Recommendation Metrics
8/3/26About 2 min
Recommendation Metrics
推荐指标必须覆盖三件事:模型能否正确预测、列表能否满足当前需求、系统能否产生长期用户与生态价值。只优化 CTR 容易诱发标题党、重复内容或短期反馈回路。
指标层次
| 层次 | 代表指标 | 回答的问题 |
|---|---|---|
| Prediction | log loss、AUC、calibration | 概率预测是否准确? |
| Retrieval | Recall@K、Hit Rate、coverage | 相关物品是否进入候选集? |
| Ranking | NDCG@K、MRR、MAP | 相关结果是否排在前面? |
| Experience | CTR、有效观看、负反馈、多样性 | 当前列表体验如何? |
| Long-term | DAU、留存、LT7/LT30、生命周期价值 | 用户是否愿意持续回来? |
| Ecosystem | 创作者覆盖、供给健康、公平、收入 | 平台是否可持续? |
| System | 延迟、超时、成本、特征新鲜度 | 系统是否稳定高效? |
长期价值与代理指标
DAU 和留存常被视为北极星结果,时长、点击和互动则是更快反馈的代理指标。例如,某用户从 开始的七日内有四天活跃,可记为 LT7=4。代理指标必须验证与长期目标的因果关系:时长上升可能代表内容更好,也可能来自难以退出的交互设计。
UGC 平台还需观察发布量、优质供给和创作者留存;商业化系统需联合考察广告主价值、成本、ROI/ROAS、GMV 与用户体验。
离线与在线的分工
离线评估适合快速筛选和定位退化,但历史日志带有旧策略的曝光偏差。在线 A/B 实验用于估计真实产品影响,同时必须设置:
- primary metric:实验最终要改善的指标;
- guardrails:崩溃、延迟、负反馈、安全与生态约束;
- segments:新老用户、活跃度、地区和设备切片;
- duration:覆盖周内周期、学习效应和延迟转化;
- decision rule:显著性、效应量、功效和停止条件。
详见 A/B Testing。
常见诊断关系
- Recall@K 上升但线上无收益:新增候选未被下游使用,或只是重复候选;
- AUC 上升但 NDCG 不变:整体判别改善,却没有改善列表头部;
- CTR 上升但留存下降:局部代理目标与长期体验冲突;
- 整体均值上涨但关键人群下跌:流量结构掩盖了异质性;
- 业务指标上涨但成本激增:需要把收益与延迟、算力一起比较。
