分词工具能发现文本中的切分歧义、未登录词、专名边界和粒度不一致,但它不能证明哪种切分绝对正确,也不能证明搜索召回率、用户意图或业务效果。它给出的是候选切分与词频、词性等统计信号,判断仍需结合语料、词典和下游任务验收。
要判断一个工具能帮到什么程度,先看它输出什么。常见输出包括:
这些输出都属于可观察的语言现象。例如左右邻字熵高,说明某片段左右搭配丰富,可能成词;熵低,说明它常固定出现在特定上下文里,可能是词的一部分。但熵高不等于一定是词,还需要看它在你的语料中是否承担独立语义。
第一,不能证明唯一正确切分。中文分词没有绝对标准,“武汉市长江大桥”按地名粒度可切“武汉市/长江大桥”,按专名粒度可切“武汉/市长/江大桥”,后者会产生歧义,但工具未必报错。
第二,不能证明搜索召回效果。分词只是索引和查询处理的一环,召回还取决于同义词、停用词、字段权重和查询改写。切分正确不代表能召回目标文档。
第三,不能证明用户意图。把“苹果手机维修”切成“苹果/手机/维修”只说明词边界,不说明用户要买手机、修手机还是查报价。
第四,不能证明新词一定被识别。未登录词、网络新词、品牌缩写常被切碎,工具不报错不等于识别正确,需要人工抽样核对。
假设你发现某关键词搜不到目标页面,怀疑是分词问题。可以这样执行:
验收信号:同一段文本在两次运行中切分一致;目标词在自定义词典加入后不再被切碎;召回测试中目标文档出现在候选集前若干位。若加入词典后仍无变化,说明问题可能出在索引阶段或查询改写,而不是分词本身。
上述方法适用于你手头有可复现的文本样本、能控制词典和切分粒度、并且下游有明确验收指标的场景。若你只是想知道“这个词该怎么切”,工具输出只能作为参考,最终要由你的语料和业务规则决定。
判断结果时记住:工具报出的切分是候选,不是结论。当多个切分都合理时,选哪个取决于你的检索粒度、词典覆盖和人工评估标准。没有这些前提,任何“分词正确率”都只是特定语料上的统计,不能直接搬到你的项目。
下一步,取你最近一次搜索无结果或结果偏差的查询,按上面的四步跑一遍,重点记录目标词是否被切碎、加入词典后召回是否变化。这个记录比单看工具输出更能定位原因。