← 返回知識庫刷題首頁
P1 · 應會

NLP中級

詞頻–逆文件頻率 (Term Frequency–Inverse Document Frequency, TF-IDF)

是什麼

TF-IDF 以詞頻(TF,詞在該文件出現多寡)乘上逆文件頻率(IDF,含該詞的文件越少越高)衡量詞對某文件的重要性:在本文件常見、在整個語料罕見的詞得分最高。

解決什麼問題

用於關鍵詞提取、文件檢索與文本分類的特徵表示,壓低「的」「是」這類到處都出現的詞的權重。

考場 Trigger

  • 詞在本文常見但語料中罕見
  • 長文件詞頻被放大
  • 計算詞的重要性權重

容易搞混

詞向量訓練方法情感分析與關鍵詞提取Embedding 與向量表示

中級深度

能說出 IDF 的作用,並知道 TF 未正規化時長文件詞頻會膨脹,需除以總詞數或取對數修正。

Official Evidence

官方題目正在怎麼考

1 官方題1 考綱節點