跳转到内容

中文分词

中文不同于英文有天然的空格作为单词边界,因此在进行 NLP(自然语言处理)任务(如词嵌入、意图识别、搜索引擎倒排索引)之前,必须将连续的汉字序列切分为有意义的词汇,此即 中文分词 (Word Segmentation)


业界最经典、生态最繁荣的中文分词组件。支持精确模式、全模式和搜索引擎模式,并允许挂载自定义业务词典。

  • 安装pip install jieba
  • 特点:基于前缀词典实现高效的词图扫描,利用 Viterbi 算法解码隐藏状态。

由北京大学推出的多领域开源中文分词工具。

  • 特点:与 jieba 的通用模型不同,pkuseg 提供针对新闻、网络、医药、旅游等 不同垂直领域 的优化模型,特定领域的切分准确度更高。
  • 特点:可能不是最快的,但号称是基于深度学习(BiLSTM 模型)的最准的开源中文分词库。除了分词,还自带词性标注 (POS) 和实体识别 (NER) 能力。

清华大学自然语言处理与社会人文计算实验室推出的一套中文词法分析工具包。

  • 特点:速度极快,同时包含了分词和词性标注两项核心能力。