更新于
2026年7月21日
TF-IDF#
术语解释#
TF-IDF(Term Frequency-Inverse Document Frequency,词频-逆文档频率) 是一种在自然语言处理中广泛使用的文本向量化方法,它通过计算词语在特定文档中的频率以及在整个语料库中的稀疏程度来衡量词语的重要性。
TF-IDF 是词频(TF)与逆文档频率(IDF)的乘积,其中词频指某个词在当前样本中出现的次数,而逆文档频率则反映的说词语的通用程度。将 TF 和 IDF 相乘得到每个词的权重值。对于数据集中的每个词都计算该值并组成矩阵,即得到文本的向量化表示。
详细计算原理与计算示例,可以参见 「6.3 TF-IDF词袋模型:带权文本特征表示方法」 内容。
出现动机#
-
弥补词袋模型的缺陷:在基础的词袋模型(只考虑词是否出现或仅看词频)中,无法有效区分词语的重要性。
-
修正高频词的误导:通常在一个样本中词频越高,其重要性应越高;但如果一个词在“整个数据集”中出现的频率都很高(如一些代词或虚词),那么它对于区分样本的贡献反而很小。
-
自动化衡量词语权重:TF-IDF 旨在通过逆文档频率来修正词频,使得在特定文档中频繁出现但在语料库中罕见的词获得更高的权重
优点缺点#
-
优点:
- 反映词语真实重要性:能够更准确地对原始文本进行特征表示,特别是能通过权重反映出哪些词是该文档的“核心关键词”。
-
缺点:
-
数据稀疏性问题:由于词表可能包含数万个词,每个样本向量中会存在大量的 0,导致特征矩阵极其稀疏。
-
忽略语义信息:作为一种词袋模型的变体,它依然无法捕捉词与词之间的位置关系、先后顺序或深层语义联系(无法解决一词多义问题)。
-
相关术语#
-
考虑权重的词袋模型
-
词袋模型
-
词向量
阅读
--