先给结论:当爱站关键词挖掘这类工具支持的输入对象从单一文本变成带结构或带附加字段的格式时,不要直接把旧规范放大使用。正确做法是先确认新格式里哪些字段是工具真正读取的,再把旧规范拆成“必填标识”和“可追溯备注”两层,用小样本验证后再决定是否批量套用。
假设你原先维护一份纯文本种子词表,每行一个词,交给爱站关键词挖掘做批量查询。现在上游同事改成提供CSV,列名是“分组、主词、限定词、备注”,其中备注列偶尔为空,限定词列有时填“地区”有时填“场景”。如果直接把CSV整份贴进输入框,工具可能把列名当成词,或者把“分组”和“主词”拼成一个不存在的组合词。个别样本看起来正常,是因为那一行恰好只有主词有值;规模化后,空备注和混合限定词就会让结果出现大量无关词。这就是“个别样本成立但规模化后出现例外”的典型边界。
输入规范通常分三层:词本身、词与词的关系、词之外的说明。格式变化可能只动第三层,也可能同时改前两层。判断依据可以看三点:
只有第一点成立时,改分隔符或引号规则即可;第二点成立时,必须把附加列移出查询区;第三点成立时,要先做空值过滤。把这三层混在一起改,往往会把原本能用的样本也改坏。
一个可操作的改法是:为每行保留一个“必填标识”,即工具真正要查询的最小词形;其余分组、来源、限定条件全部放进“可追溯备注”,不进入查询区。例如把“分组=华东,主词=空气净化器,限定词=除甲醛,备注=空”改成查询词“空气净化器 除甲醛”,同时在外部表里记录它属于华东组。这样做的结果是:查询结果仍能按外部表回填分组,而工具端不会因为备注为空而报错或产生空词。下一步再决定是否把“限定词”也纳入查询,取决于你要的是宽词还是窄词。
先取十到二十行覆盖三种情况:备注为空、限定词有两种取值、主词含分隔符。跑完后不要只看返回词数量。请求量、抓取量或某个统计归零,不能单独证明输入规范正确,它也可能是查询词本身过窄、工具对该格式不读取、或上游数据被过滤。更可靠的证据是:返回词是否仍能对应回原始分组,以及空备注行是否产生了空词或列名词。如果返回结果无法回填分组,说明备注层没有和查询层建立稳定映射,应先补映射再扩大样本。
可以照搬的条件是:新格式只增加不参与查询的说明列,且分隔符不出现在词内。此时旧规范只需加一层空值过滤。必须分叉的条件是:附加列会改变词形,或同一列在不同行承担不同角色。例如“限定词”列有时是地区、有时是场景,这两种词形在查询意图上并不等价,混在同一规范里会让结果不可比。此时应按角色拆成两套输入规范,分别验证后再合并报表。假设你只按一套规范跑完全量,后续发现地区词和场景词被同等对待,那么修正成本会从改输入规范变成重跑并重新对齐分组。
把验证通过的规范写成一份最小说明:哪些列进入查询、哪些列只做备注、空值如何处理、分隔符冲突如何转义。然后拿这份说明去核对爱站关键词挖掘当前实际支持的输入格式,因为具体字段和读取规则可能随版本调整,需要以工具内实际说明为准。确认后再批量执行,并把“无法回填分组”的行单独留出,作为下一轮调整输入规范的依据,而不是直接丢弃。