中文分词是自然语言处理流程中的首要环节,其任务是将没有空格分隔的连续汉字序列,切分为具有独立语义的词语单元。由于汉语文本的词边界并不显式存在,分词结果的准确性会直接影响后续的词性标注、情感分析、关键词抽取和机器翻译等任务的效果。在实际业务中,不同场景对分词速度和精度的要求差异巨大,因此选择适合的切分策略往往比一味追求复杂模型更为关键。
基于词典的方法是中文分词中历史最悠久、工程实现最简单的方案。其核心是依赖一份覆盖常用词汇的词库,利用字符串查找算法将待处理文本与词库中的词条进行匹配和切割。根据扫描方向与匹配优先级的不同,主要衍生出以下几种变体。
正向最大匹配从句子开头开始扫描,每次以词库中最长词条的长度作为窗口,优先尝试匹配更长的词。例如,面对“研究生命起源”这一片段,它会优先尝试匹配较长的词组,从而得到“研究/生命/起源”,而非“研究生/命/起源”这种错误切分。逆向最大匹配则从句尾反向扫描,在处理某些以单字词结尾的歧义片段时往往表现更优。双向匹配同时执行正向和逆向扫描,然后比较两组结果中的词数或单字词残留量,选择更优的输出作为最终结果。
需要注意:这类方法的效果高度依赖词表的完备性和时效性。若处理的是社交媒体评论或新兴行业文本,建议建立定期更新词库的机制,否则专有名词和网络流行语很容易被切碎,导致准确率和召回率下降。
统计方法不再依赖词典的完整性,而是从大规模语料中学习汉字之间的共现概率和条件分布关系。其中,隐马尔可夫模型(HMM)与条件随机场(CRF)是两条极具代表性的技术路线。
HMM将分词问题转化为对每个字符赋予位置标签的过程,常用标签为B(词首)、M(词中)、E(词尾)和S(独立单字词),随后利用维特比算法求解概率最高的标签序列。CRF则突破了HMM对观测状态独立性的假设,能够灵活融合前后文字的多维特征,在捕捉复杂词边界时表现出更强的建模精度,因此它能在传统方法中持续保持领先地位。
统计模型的一个显著优势在于具备识别未登录词的能力。假如语料中“生成式人工智能”频繁紧邻出现,模型有可能在学习过程中将其逐渐聚合为一个完整词语。但代价同样明显:必须准备足量且与目标领域同分布的标注语料进行训练,且训练调试周期和离线推理耗时均明显高于词典法。
算力的普及使深度学习架构逐渐成为工业界与学术界的主流选择,代表方案包括双向长短时记忆网络(BiLSTM)和以Transformer为骨干的预训练语言模型。
BiLSTM通过双向隐层状态将上下文信息融合进每个字符的向量表示,在处理长程依赖关系时显著优于CRF。以BERT为代表的预训练模型更进一步,其通过大规模无监督文本的掩码任务预训练,已具备深厚的通用语义知识。应用于分词时,只需在模型顶层接入一个轻量分类层进行微调,即可在公开评测集上取得领先成绩。
一个常被提及的例子是句子“南京市长江大桥”。深度学习模型能够依托上下文理解“南京市”与“长江大桥”的修饰和指代关系,给出正确切分结果,而不会陷入“南京/市长/江大桥”这类局部语境歧义,这正是传统词典和统计方法在语义判断上的明显短板。
值得警惕:深度模型的参数规模动辄成百上千万,GPU显存消耗大,线上推理耗时也很难压到毫秒级。若需求是超低延迟的大规模实时处理,需结合知识蒸馏或模型剪枝等工程手段来压缩成本。
词典法、统计法和深度法在多个维度上存在明显差异,理解这些差异有助于根据业务场景做出合理选型。
首先,词典法响应速度最快,内存占用低,适合词典足够全且文本领域固定的场景,例如政府公文、法律文书的批量处理。但它在语义歧义处理上存在天然劣势,且对新词敏感。
其次,统计法在平衡精度和速度上表现较好,尤其适用于拥有一定规模领域语料的场景,如医疗、金融等专业领域的文本处理。它比词典法更能应对未登录词,但训练成本不可忽略。
最后,深度法在语义理解能力上最强,特别适合内容复杂、语境多变的通用文本,例如搜索引擎、智能客服和新闻聚合平台。但它的部署和运维成本最高,不适合资源受限或对响应速度要求极端的场景。
选型时可以参考以下原则:如果词表能做到高频更新且文本领域集中,优先选词典法;如果手头有领域标注语料且追求中等精度,可选择CRF等统计模型;如果预算充足且追求最佳效果,直接采用预训练模型进行微调。
分词质量会直接影响词性标注、命名实体识别、关键词抽取和机器翻译等任务的输入质量。例如,关键词抽取若基于错误分词,可能把“深度/学习”拆成“深/度学/习”,导致后续任务性能明显下降。总体上,分词错误会在下游任务中被逐步放大,因此值得认真对待。
未登录词是分词系统的主要挑战之一。对于词典法,可以定期补充新词表和行业词表;对于统计法,选择特征设计合理的CRF模型能提升识别能力;对于深度模型,预训练模型对未登录词已有一定的泛化处理能力,必要时可引入外部词典作为辅助特征对模型进行增强。
并非所有场景都适合使用预训练模型。对于高并发、低延迟的实时业务,模型推理耗时和显存开销可能成为瓶颈。此时可以借助知识蒸馏、模型量化和剪枝等方式压缩模型体积,或将深度模型用于离线批量处理,在线场景则采用词典法或统计法作为降级方案。
中文分词方案的选择本质上是在精度、速度和资源消耗之间做权衡。词典法适合快速落地的固定领域,统计法适合有标注语料的专业场景,深度法则是追求最优语义效果的综合手段。建议在正式上线前用业务真实语料对候选方案进行小规模评测,以词准确率、未登录词召回率和单条耗时三个指标作为主要判断依据,再决定最终采用的方案。