系統評估
搜尋模型效能 — BM25、向量與混合搜尋的 MRR、nDCG 與召回率
最佳 MRR@10 — Vector
0.575
+7.5% vs BM25
最佳 nDCG@10 — Hybrid
0.792
最佳排名品質
精確率@K — 所有方法
1.000
Single-category dataset
指標雷達圖(K=10)
Recall/F1 以對數縮放顯示(×5000)以利視覺比較 · Recall/F1 log-scaled (×5000) for visual comparison
nDCG 趨勢(@5 · @10 · @20)
MRR 趨勢(@5 · @10 · @20)
Precision@K
各方法完整指標
指標詳解 — 每個 IR 評估指標的意義與重要性
召回率(Recall@K)
hits in top-K / |相關集合|衡量系統找回所有相關結果的能力。分子為 Top-K 命中相關結果數,分母為全部相關商品數。
💡 本資料集所有商品同屬一類別(8.3 萬件),召回率趨近 0 是預期結果,並非系統缺陷。
精確率(Precision@K)
Top-K 相關結果數 / K衡量檢索結果中相關結果的比例。高精確率代表「少而精」的結果集。
💡 本資料集 Precision=1.0 — 所有商品同屬一類別,任何結果皆算相關。說明相關集定義對指標解讀的重要影響。
平均倒數排名(MRR@K)
avg(1 / 首個相關結果排名)衡量第一個相關結果的位置。MRR=1.0 表示最相關結果每次排第一;0.5 表示平均排第二。
💡 Vector MRR@10=0.575,首個相關結果平均排名約第 1.7 位,優於 BM25 的 0.500(平均第 2 位)。
歸一化折損累積增益(nDCG@K)
DCG@K / IDCG@K衡量排序品質,越靠前的相關結果貢獻越高(對數折損)。nDCG=1.0 為完美排序。
💡 Hybrid nDCG@10=0.792 — 非常優秀的排序,距理想排序損失不到 21%。
平均精確率均值(MAP@K)
mean(AP@K 跨查詢均值)各查詢平均精確率(AP)的均值,考慮每個位置的精確率,衡量整體排序一致性。
💡 MAP=1.0(與 Precision=1.0 同理)。在多類別資料集中,MAP 能更好地區分各搜尋方法。
F1@K(調和平均)
2 × P × R / (P + R)精確率與召回率的調和平均數,同等看待兩個指標,尋求平衡點。
💡 F1 ≈ 2×Recall(因 Precision=1.0)≈ 0.0002@K=10。召回率是此設定下的瓶頸指標。