P1 · 應會
NLP
詞頻–逆文件頻率 (Term Frequency–Inverse Document Frequency, TF-IDF)
是什麼
TF-IDF 以詞頻(TF,詞在該文件出現多寡)乘上逆文件頻率(IDF,含該詞的文件越少越高)衡量詞對某文件的重要性:在本文件常見、在整個語料罕見的詞得分最高。
解決什麼問題
用於關鍵詞提取、文件檢索與文本分類的特徵表示,壓低「的」「是」這類到處都出現的詞的權重。
考場 Trigger
- 詞在本文常見但語料中罕見
- 長文件詞頻被放大
- 計算詞的重要性權重
容易搞混
詞向量訓練方法情感分析與關鍵詞提取Embedding 與向量表示
中級深度
能說出 IDF 的作用,並知道 TF 未正規化時長文件詞頻會膨脹,需除以總詞數或取對數修正。