协同过滤不需要理解物品是什么,却能发现买帐篷的人常买防潮垫。本文讲清基于内容与协同过滤两条思路、召回排序重排的多阶段架构、冷启动与反馈指标的陷阱,以及“被猜中”的代价。

核心要点

  • 协同过滤利用人与人的相似性,能发现跨类别关联
  • 现代推荐系统是召回、排序、重排的多阶段流水线
  • 点击与停留时长不等同满意度,短期指标会让系统跑偏

猜你喜欢的两条思路

推荐系统主要有两类思路。基于内容的推荐看物品属性:你看过科幻片,就再推科幻片。协同过滤(collaborative filtering)则看人与人的关系:和你口味相似的人喜欢了什么,就推给你,完全不需要理解物品本身是什么。

协同过滤的经典形式是把用户和物品都表示成向量,用向量内积预测评分。它有个迷人之处——能发现跨类别的关联,比如买了帐篷的人常常也会买防潮垫,这种规律无需人工归纳。

从矩阵分解到深度学习

用户与物品的评分矩阵极其稀疏,绝大多数格子是空的。矩阵分解把大矩阵拆成两个低维小矩阵的乘积,用隐含因子填补空缺,曾是推荐系统的主力方法。后来各类融合特征的深度模型被广泛采用。

现代推荐系统通常是多阶段的:召回层从千万级物品中快速筛出几百个候选,排序层用复杂模型精细打分,重排层再考虑多样性、新鲜度与业务规则。每一层的目标与速度要求都不同。

冷启动与数据

新用户、新物品没有历史行为,这就是冷启动问题。常见对策是先用人口属性、内容特征或热门榜单兜底,再快速收集少量反馈进行探索。深度学习时代,预训练的通用表征也让新物品的冷启动变得容易一些。

推荐系统还高度依赖反馈数据的质量。点击、停留时长、购买、划走都是信号,但它们并不等同于满意度:吸引眼球的标题能换来点击,却带来失望。过度依赖短期指标,会让系统逐渐偏离用户真正的兴趣。

“猜中”的代价

被猜中未必全是好事。只推相似内容会形成信息茧房,使用户视野收窄;一味追逐停留时长可能放大低质内容。因此业界越来越重视多样性、可解释性与用户控制权,例如提供不感兴趣按钮与兴趣标签管理。关于这些影响的讨论仍在持续。

常见问题

关掉个性化推荐是不是就不会被“算计”了?

关闭个性化通常会退回到热门榜单或地域推荐等较粗的方式,收集到的行为数据也会减少。但要完全不被影响并不现实,因为排序本身就是一种选择。更实际的做法是主动使用反馈工具,并定期清理兴趣标签。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。