B站推荐算法二面面经:生成式召回落地与稀疏信号建模
- 轮次
- 二面
- 时间
- 2026-09
- 来源
- 牛客网
《面试题目》
- 针对 RQ-Kmeans 聚类召回方案,你在项目中做了哪些针对性优化改进?
- 你的生成式召回实验,基线对比选用了哪些传统召回方式?核心收益的底层逻辑是什么?
- 线上多通路召回体系中,你的生成式召回策略如何与传统召回通路做融合、兜底与权重配比?
- 若线上业务需要拓展至多目标、多场景,同时兼顾点击、GMV、预算等多个优化目标,你的召回框架需要如何迭代适配?
- 日常是否使用 B 站?对比你做过的电商推荐场景,B 站内容推荐的核心差异体现在哪里?
- 若业务目标是将 70% 流量倾斜扶持中小 UP 主,从算法层面可以设计哪些落地方案?
- 一键三连是 B 站高价值但极度稀疏的用户行为信号,该在推荐链路哪个环节引入、如何建模使用?
- 高弹幕互动视频普遍具备哪些内容特征?如何将弹幕数据建模为推荐可用特征?
- 除主观体验外,有哪些量化指标可以衡量推荐系统的内容同质化、信息茧房与多样性问题?
- B 站长内容具备长效消费周期,而推荐算法普遍优化短期即时指标,如何将平台长期生态健康度融入模型优化框架?
《参考解析》
RQ-Kmeans 这类量化召回,改进点在哪:残差量化把向量逐级逼近,第一级抓主体方向、后面几级补残差,最后每个 item 得到一串码字组合。值得优化的地方:一是码本设计与层数的消融——层数越多逼近越细,但末级码本实际承载的信息量很小,收益递减而检索成本上升,需要用召回率而不是重构误差来选;二是聚类目标与业务口径的错位——K-means 最小化的是平方误差,它不区分「热度高的 item 分错」和「长尾 item 分错」,可以按样本权重(有效曝光/点击)重加权,或对热门 item 做拆簇;三是簇内失衡——大簇检索慢、小簇几乎不被检索到,需要设簇容量上限与最小规模;四是与下游的一致性——量化码用于倒排检索时,候选数量取决于簇大小,取多少个簇是由延迟预算反推的,这部分最好在方案里就说明白。
实验怎么设计,收益从哪来:做生成式召回实验,标题、摘要、评估口径要提前定:离线看 Recall@K、命中率、覆盖率与新颖度,线上看人均消费、时长、次日留存以及系统指标(延迟、QPS 成本)。基线要覆盖 ItemCF 类的协同召回、双塔向量召回、以及线上原有多路聚类召回——只跟弱基线比会被直接追问。收益逻辑可以说三点:序列建模保留了顺序与长程依赖,不像双塔把用户压成单向量那样有损;生成式解码不局限于向量近邻,能跳出局部、缓解热门偏置;再叠加约束解码(只生成合法 ID)可以在同样的候选预算下提高有效候选比例。同时要承认它的短板——推理延迟、对训练分布的依赖、冷启动 item 覆盖差——并说明它在系统中是增量通路。
融合与兜底:别让量纲决定权重:多通路召回合并时最容易被追问「分数怎么加」。生成式的序列似然、双塔的内积、i2i 的相似度量纲完全不同,直接加权等于让数值范围大的通路垄断候选。常见做法是各通路先归一化(或做分位数映射、排名融合 RRF),再按来源配额合并;权重靠线上小流量实验调,并且定期看每条通路的候选贡献率与后链路转化,零贡献的通路及时下线。兜底要分层:生成式超时/空结果退回向量召回,向量召回异常退回热门与地域先验,保证任何情况下都有候选、P99 不炸。另外要解释清楚「融合在哪一层做」——在召回融合层做还是交给粗排统一点,对延迟和一致性的影响不同。
多目标多场景的迭代路径:从单目标扩到多目标,一般不会一上来就上复杂模型,而是先做结构:把场景 id、目标权重作为特征注入(目标条件化),让一个模型覆盖多场景,避免每个场景单独一套带来的冷启动与维护成本;用户表示从单向量扩到多兴趣/多向量,按场景或目标取不同的兴趣簇;再往上才是分目标召回加统一融合。要预判两个追问:场景间样本极不平衡怎么处理(重加权、分场景归一化、大场景预训练 + 小场景微调),以及目标之间互相冲突怎么平衡(融合权重、帕累托式多目标优化、把某些目标降级成约束)。这题的重点是给出「先条件化、再多向量、最后分路」的渐进路线,而不是背一个大模型名字。
B 站与电商推荐的本质差异:电商是强意图、短决策、结果导向——用户带着购买目的来,转化路径短且可归因到 GMV,item 有明确的价格、库存、类目与生命周期,时效性强。内容社区相反:消费是低意图、长决策、过程导向——用户来消磨时间,价值体现在停留、完播、互动而非单次转化,内容没有库存但有时效衰减曲线(老视频可能长期被消费),创作者与用户之间还有一层「人」的关注关系。由此带来几个工程差异:内容推荐更依赖多模态(封面、标题、音频、弹幕)与序列兴趣,电商更依赖用户画像与商品属性;内容侧的评价指标更多元(完播、互动、负反馈都算),电商则收敛到转化与 ROI;内容推荐还要额外考虑创作者生态与内容重复度,而电商更多考虑库存与预算约束。第 5 题其实也在测「你到底用不用这个产品」——准备时至少能讲出自己使用 B 站时观察到的几个具体现象。
一键三连与弹幕:稀疏信号怎么变成特征:三连动作稀疏但意图极强,直接当召回信号会样本不足,更实际的做法是:拆成点赞、投币、收藏三个目标做多任务学习,共享底层表示再各自出预测头,用动作间的相关性互相补充;训练时按创作者和类目分层归一化,避免模型只学到「头部 UP 主三连多」这种先验;在链路上它更适合进精排/重排作为强正反馈与长期兴趣刻画,也可以作为相似用户扩展的种子。弹幕是内容侧特征:高弹幕视频的共性是情绪密度高、有可复读的梗与名场面、互动节奏集中;可用弹幕密度的时间分布(峰值位置与个数)、情感倾向、高频词/梗词表、以及弹幕文本的 embedding 作为特征,服务内容召回、冷启动与高光片段定位。使用前必须清洗——刷屏、复读、攻击性内容会把「争吵」误判为「优质互动」,这一步要在回答里主动提到。
同质化与长期生态怎么量化:可量化指标分四组。内容分布侧:曝光与消费的熵/基尼系数、类目与创作者覆盖数、非头部内容曝光占比、新内容冷启曝光量。用户侧:单用户短期消费的类目熵、跨类目跳转比例、推荐结果内部相似度、重复曝光率。反馈侧:负反馈率、快速划走率、屏蔽与取关。系统侧:群体间曝光公平性与「搜索/关注」占比变化。把生态目标融进优化框架,关键是要承认短期点击与长期生态存在结构性冲突,靠调权重往往压不住,更稳的机制是把生态指标做成约束(长尾曝光不低于某比例)、或用长期价值建模把「本次曝光对用户未来留存的影响」纳入回报,并在评估时把观察窗口拉长到 7 日甚至更久,否则次日指标一涨就以为方向对了。第 9、10 题连在一起问,本质是考你能不能把「生态健康」拆成可监控、可优化的量。