Ranking Metrics
8/3/26About 1 min
Ranking Metrics
排序评估关心的不只是每个样本预测是否正确,还关心有限展示位中的顺序质量。
常用指标
Precision@K 与 Recall@K
Precision 偏向展示质量,Recall 偏向覆盖。隐式反馈中“未点击”不一定是不相关,因此两者会受到曝光日志缺失影响。
NDCG@K
DCG 让靠前位置和高等级相关性贡献更大:
NDCG 用理想排序归一化,适合点击、点赞、转化等分级标签,但需要谨慎定义 ,避免高频行为完全支配结果。
MRR 与 MAP
MRR 只强调第一个相关结果的位置,适合“找到一个答案”类任务;MAP 综合多个相关结果的精度,更适合信息检索式列表。推荐场景通常还需结合 coverage、novelty、diversity 与 calibration。
评估协议
- 按时间切分,保证训练数据早于验证和测试;
- 明确候选集来自全库、固定负样本还是线上召回结果;
- 同时报告宏平均、用户加权平均及关键人群切片;
- 评估多个 ,与真实页面展示深度一致;
- 用置信区间或重采样表达不确定性;
- 对离线提升执行线上实验,验证其业务含义。
候选采样不同会让指标不可直接比较,因此模型报告必须记录数据窗口、负样本策略、候选集合与过滤规则。
