先做一次“来源对账”,而不是直接改标题。把导入后的页面标题、原始文件里的标题行、文件名、导入日志中的记录四者放进同一张核对表,逐项比对。只要其中三项能互相印证,就能确定这个标题属于哪个文件;只剩一项对不上时,才把它当作待修项,而不是立刻覆盖。
错位通常有三种可区分的原因,处理动作完全不同:
判断方法很直接:先看标题文本是否能在原始文件里找到。能找到,就是顺序或归属问题;找不到,先怀疑缺失或默认值。这个判断决定你下一步是调整排序规则,还是回到源文件补字段。
不要只凭标题本身认文件,标题往往是最容易重复的字段。建议同时记录三项:
假设有一批十个页面,其中两个文件名只差一个后缀,标题又都含同一主题词。此时仅比对标题无法区分,但把“路径 + 正文首句”并列后,对应关系立刻唯一。这里的关键动作是:先固定稳定标识,再比对标题。顺序反过来,就会在相似标题之间反复摇摆。
当多个角色对“哪个标题属于哪个文件”理解不一致时,争论本身没有产出。更有效的做法是把分歧写成可勾选的项目:
每一项只填“一致 / 不一致 / 无法判断”。当“无法判断”出现时,说明缺的是证据而不是结论,应先补证据。全部一致后再动标题;只要稳定标识这一项不一致,就先解决标识问题,因为后续所有比对都建立在它之上。
核对完成后,通常只改一处,然后观察它带来的变化。举例来说,如果确认是排序规则导致的顺序错位,就只调整导入时的排序字段,不再逐个改标题。改完后重新核对同一张表:若顺序恢复一致而标题文本未变,说明原因判断成立,下一步可以把这套核对流程固化到导入环节;若顺序仍错,则问题在标识复用或数据源本身,需要回到源文件处理。
要注意,改动前后的比较会受搜索需求变化、数据采集时间差等因素影响,不能把某次对齐后的表现直接归因于这次修改。核对对应关系解决的是“哪个标题属于哪个文件”,它本身不等于效果提升。
第一,用标题当唯一键。标题重复、含相同主题词时,比对必然失败,应改用稳定标识加正文指纹。第二,先批量覆盖再核对。一旦覆盖,原始对应关系就丢失了,之后无法判断错位是导入造成的还是修改造成的。正确顺序始终是:留证据、建对应、再修改、后复核。