🏠 居家廚房 · 8.3 萬商品
檢查中

系統評估

搜尋模型效能 — BM25、向量與混合搜尋的 MRR、nDCG 與召回率

最佳 MRR@10Vector
0.575
+7.5% vs BM25
最佳 nDCG@10Hybrid
0.792
最佳排名品質
精確率@K所有方法
1.000
Single-category dataset
指標雷達圖(K=10)

Recall/F1 以對數縮放顯示(×5000)以利視覺比較 · Recall/F1 log-scaled (×5000) for visual comparison

nDCG 趨勢(@5 · @10 · @20)
MRR 趨勢(@5 · @10 · @20)
Precision@K
各方法完整指標

指標詳解 — 每個 IR 評估指標的意義與重要性

召回率(Recall@K)
hits in top-K / |相關集合|

衡量系統找回所有相關結果的能力。分子為 Top-K 命中相關結果數,分母為全部相關商品數。

💡 本資料集所有商品同屬一類別(8.3 萬件),召回率趨近 0 是預期結果,並非系統缺陷。
精確率(Precision@K)
Top-K 相關結果數 / K

衡量檢索結果中相關結果的比例。高精確率代表「少而精」的結果集。

💡 本資料集 Precision=1.0 — 所有商品同屬一類別,任何結果皆算相關。說明相關集定義對指標解讀的重要影響。
平均倒數排名(MRR@K)
avg(1 / 首個相關結果排名)

衡量第一個相關結果的位置。MRR=1.0 表示最相關結果每次排第一;0.5 表示平均排第二。

💡 Vector MRR@10=0.575,首個相關結果平均排名約第 1.7 位,優於 BM25 的 0.500(平均第 2 位)。
歸一化折損累積增益(nDCG@K)
DCG@K / IDCG@K

衡量排序品質,越靠前的相關結果貢獻越高(對數折損)。nDCG=1.0 為完美排序。

💡 Hybrid nDCG@10=0.792 — 非常優秀的排序,距理想排序損失不到 21%。
平均精確率均值(MAP@K)
mean(AP@K 跨查詢均值)

各查詢平均精確率(AP)的均值,考慮每個位置的精確率,衡量整體排序一致性。

💡 MAP=1.0(與 Precision=1.0 同理)。在多類別資料集中,MAP 能更好地區分各搜尋方法。
F1@K(調和平均)
2 × P × R / (P + R)

精確率與召回率的調和平均數,同等看待兩個指標,尋求平衡點。

💡 F1 ≈ 2×Recall(因 Precision=1.0)≈ 0.0002@K=10。召回率是此設定下的瓶頸指標。

All 83,000+ products belong to the same Home & Kitchen category. Retrieving k=5/10/20 out of 83K means recall will be nearly zero even for perfect ranking — this is expected for single-category dense retrieval.

MRR and nDCG are more meaningful: Hybrid MRR@10 = 0.575 means the first relevant result is typically ranked 1st or 2nd. Precision = 1.0 because every retrieved item belongs to the same category.