普考-圖書資訊管理圖書資訊學概要112 年第 15 題單選題
對於資訊檢索系統而言,下列何者統計值具有文件鑑別力?
ADocument Frequency(DF)正確答案
BTerm Frequency(TF)
CTotal Frequency(F)
DAverage Precision(AP)
A正確答案
TF-IDF 中的 IDF 來自 DF(文件頻率),DF 越低代表該詞越能鑑別文件。
為什麼答案是 A
DF(文件頻率)指某詞出現在多少篇文件中。DF 越小代表詞越稀有、越能鑑別文件,這也是 IDF(反文件頻率)的基礎,屬於資訊檢索核心鑑別指標。
載入中…
完整詳解
Pro · 無限重點 TF-IDF 中的 IDF 來自 DF(文件頻率),DF 越低代表該詞越能鑑別文件。
鑑別力 = 能區分文件 = 稀有詞 = 看 DF(少數文件才出現)。TF 只算單篇次數,無鑑別力。
逐選項分析
A✓ 正確
DF(文件頻率)指某詞出現在多少篇文件中。DF 越小代表詞越稀有、越能鑑別文件,這也是 IDF(反文件頻率)的基礎,屬於資訊檢索核心鑑別指標。
B✕ 陷阱
TF 是某詞在「單一文件」中出現次數,只反映詞在該文件中的重要性,無法區分該詞是否為普遍常見詞,故無鑑別力。需搭配 IDF 才有意義。
C✕
Total Frequency 是該詞在整個語料庫的總出現次數,常見詞(如 the)總數會很高,反而最無鑑別力,不能用來區分文件。
D✕
Average Precision 是評估「檢索系統效能」的指標,衡量排序結果品質,不是用來判斷「單一詞彙」對文件的鑑別力,層級不同。
IR 常見統計值比較
| 統計值 | 計算範圍 | 用途 | 有無鑑別力 |
|---|
| DF | 跨文件:出現此詞的文件數 | 計算 IDF | ✅ 有(越低越好) |
| TF | 單一文件內出現次數 | 詞在該文件重要性 | ❌ 無 |
| F (Total) | 整個語料庫總次數 | 詞頻統計 | ❌ 無 |
| AP | 檢索排序結果 | 評估系統效能 | ❌ 無(不同層級) |
最常被混淆的是 TF 與 DF。TF 代表「一篇文件內」的重要性,DF 代表「跨文件」的稀有度。鑑別力談的是「能否區分文件」,所以一定要看跨文件的 DF(IDF),不是單篇的 TF。考生只記 TF-IDF 卻忘記拆開理解就會中招。