跳转到内容

词频-逆文档频率

TF-IDF 是一种用于信息检索与数据挖掘的常用加权技术,旨在评估一个词对于一个文件集或一个语料库中的其中一份文件的重要性。


  • 逻辑:统计词汇在当前文档中出现的频率。
  • 作用:高频词通常代表文档的核心主题。
  • 策略:为了过滤“的”、“是”、“了”等无意义停用词,TF 会在统计后结合停用词表进行初步清洗。

2.2. IDF (Inverse Document Frequency) —— 逆文档频率

Section titled “2.2. IDF (Inverse Document Frequency) —— 逆文档频率”
  • 逻辑:计算该词在整个语料库中出现的文档比例的倒数并取对数。
  • 作用:反映词汇的“差异化能力”。如果一个词在所有文档中都出现(如“系统”),那么它的 IDF 权重会很低;反之,只在少数文档出现的专业词(如“量化”)则权重极高。

$$\text{TF-IDF} = \text{TF} \times \text{IDF}$$ 某个词在特定文档中的 TF-IDF 值越大,代表其作为该文档“关键词”的身份越显著。


特性表现
优点计算速度快,算法直观,对长文档关键词提取效果好。
缺点纯词频统计,忽略了词汇的位置信息、同义词关系及深层语义结构。