面灵AI→

B站推荐算法二面:生成式召回与多通路融合 10 问

轮次
二面
时间
2026-09
来源
牛客网

《面试题目》

  1. 针对 RQ-Kmeans 聚类召回方案,你在项目中做了哪些针对性优化改进?
  2. 你的生成式召回实验,基线对比选用了哪些传统召回方式?核心收益的底层逻辑是什么?
  3. 线上多通路召回体系中,你的生成式召回策略如何与传统召回通路做融合、兜底与权重配比?
  4. 若线上业务需要拓展至多目标、多场景,同时兼顾点击、GMV、预算等多个优化目标,你的召回框架需要如何迭代适配?
  5. 日常是否使用 B 站?对比你做过的电商推荐场景,B 站内容推荐的核心差异体现在哪里?
  6. 若业务目标是将 70% 流量倾斜扶持中小 UP 主,从算法层面可以设计哪些落地方案?
  7. 一键三连是 B 站高价值但极度稀疏的用户行为信号,该在推荐链路哪个环节引入、如何建模使用?
  8. 高弹幕互动视频普遍具备哪些内容特征?如何将弹幕数据建模为推荐可用特征?
  9. 除主观体验外,有哪些量化指标可以衡量推荐系统的内容同质化、信息茧房与多样性问题?
  10. B 站长内容具备长效消费周期,而推荐算法普遍优化短期即时指标,如何将平台长期生态健康度融入模型优化框架?

《参考解析》

聚类召回的优化空间:RQ-Kmeans(残差量化 + K-means)这类方案的思路是先粗聚类再对残差继续聚类,多级码本逼近原始向量。可优化点集中在四处:① 码本与层数的取舍——层数多则逼近更准但码字组合爆炸、后级学到的东西越少,层数少则量化误差大、召回口径变粗,通常按向量分布与召回预算做消融;② 容量/均衡约束——纯 K-means 会被热门 item 主导,加入曝光或样本量约束、或对长尾做重加权,能让码本覆盖更均匀;③ 训练目标与业务目标对齐——聚类是在 embedding 空间做无监督逼近,而线上关心的是召回命中率,可以对样本按有效反馈重加权、或把聚类目标换成带监督信号的学习式量化;④ 工程侧——码本大小与检索结构(倒排/IVF)决定延迟与内存,长尾簇的样本太少会导致该码字事实上失效,需要设最小簇规模并做回收。

生成式召回为什么能赢、基线怎么选:做生成式召回实验,基线至少要覆盖三类:i2i/协同过滤类(ItemCF、swing)、向量检索类(双塔 + ANN)、以及原有的多层聚类或多兴趣召回。只跟最弱的基线比说明不了问题。收益的底层逻辑通常来自两点:一是它直接对「用户下一个可能交互的 item 序列」建模,天然利用了序列中的顺序与长程依赖,而双塔把用户压成单一向量、信息有损;二是解码出的候选可以突破向量空间的局部性,缓解热门主导。但代价也真实存在——推理延迟高、需要约束解码保证合法性、对新 item 依赖训练分布,因此它在系统里的定位一般是「增量通路」而不是替代品,面试时把这条讲清楚比只说收益更可信。

多通路融合、兜底与权重配比:工程上通常分两层:召回层各通路各自出候选并打上来源标记,融合层做去重、按来源配额或加权分数合并。要注意几个坑:不同通路的分数不可比(生成式的似然、双塔的内积、i2i 的相似度不在一个量纲),直接相加等于让量纲大的通路垄断,稳妥做法是各自归一化或只做序的融合(RRF 之类的排名融合),权重通过线上小流量实验调。兜底要分层设计:生成式通路超时或返回空就退回向量通路,向量通路异常再退热门/地域等先验,保证 P99 与「任何情况下都有候选」。此外要监控每条通路的候选贡献率与后链路转化,长期零贡献的通路就该下线,否则召回层会越堆越臃肿、延迟持续上涨。

多目标多场景下的召回框架:召回从「单目标 top-k」走向多目标时,常见三条路:① 多向量/多兴趣表示,把用户拆成若干兴趣簇,不同场景或目标取不同簇;② 目标条件化,把场景 id、目标权重作为特征喂进模型,用一个模型覆盖多场景(避免每个场景单独维护一套,冷启动场景没数据);③ 分目标召回 + 统一融合,每一路服务一个目标,再在融合层按业务权重调。工程上还要处理场景间的数据不平衡(大场景主导训练、小场景被淹没,需要重加权或分场景归一化)与目标冲突(点击与 GMV、时长与预算往往互相拉扯,靠融合权重或帕累托式多目标优化来平衡)。面试官追问这里,本质是看你能不能把「业务目标」翻译成「召回层的候选供给结构」。

扶持中小 UP 主的算法落点:这题考的是把业务诉求翻译成可执行链路。可从四层给方案:① 召回层——为中小 UP 主单独建一路召回(按类目/内容质量/新鲜度),保证其内容能进入候选池,同时做创作者维度的上限控制,避免同一作者刷屏;② 排序层——在样本或损失上做重加权,给长尾内容更高的探索收益,或用不确定性建模(Thompson sampling、UCB)给低曝光内容机会;③ 重排层——把创作者多样性作为硬约束(滑动窗口打散、MMR/DPP),并对新内容设保底曝光位;④ 目标层——把「中小 UP 主曝光占比」当一个显式指标参与优化,而不是只靠人工配额。风险与代价要一起说:强推低质长尾会伤短期消费指标与用户体验,所以必须配质量门槛(完播、负反馈率)和灰度实验,用「探索配额」而不是「无差别倾斜」。70% 这个数字本身也要质疑:是曝光占比还是消费占比、周期多长、用什么指标验收,问清楚再答。

稀疏高价值信号(一键三连)与弹幕特征:一键三连同时包含点赞、投币、收藏三个动作,稀疏但置信度极高。建模上有几种做法:把三连拆成多个目标做多任务学习(共享底层、各自输出头),利用动作间的相关性互相增强;用「三连率」而非绝对量做目标、按创作者与类目分层归一化,避免只在头部 UP 主上有效;在链路上它更适合放在精排与重排环节作为强正反馈(召回阶段太稀疏、做不了稠密训练信号),也可以用来做用户兴趣的长期刻画与相似用户扩展。弹幕则是内容侧特征:高弹幕视频往往有强情绪点、名场面、互动梗,弹幕的密度分布(峰值位置)、情感倾向、梗词与高频词、时间戳密集区都是可用特征,可用文本模型或词表把弹幕压成向量参与内容召回与冷启动,也能反哺「高光片段」定位。要注意弹幕噪声大(刷屏、复读、攻击性内容),需要先做清洗与过滤,否则会把「争吵热闹」误当成「优质互动」。

同质化、信息茧房与长期生态怎么度量:主观感受之外,可量化的指标至少有四类。① 内容侧分布:曝光与消费的基尼系数/熵、类目与 UP 主维度的覆盖数、长尾(非头部)内容的曝光占比、新内容的冷启动曝光量。② 用户侧多样性:单个用户短期内消费内容的类目熵、跨类目跳转比例、推荐结果内部的相似度(embedding 平均距离)、以及重复曝光率。③ 反馈侧:负反馈率(不感兴趣、减少此类推荐)、快速划走率、屏蔽/取关行为,这些是茧房最直接的信号。④ 系统侧:跨群体的曝光公平性、以及「用户主动搜索/关注」与「算法推荐」的占比变化。长期生态融入优化的思路是把长期价值显式建进目标:用多目标或约束式优化把生态指标作为约束(例如长尾曝光不低于某比例)而不是只做加权的辅助项;用强化学习或长期价值建模(把「这次曝光对用户未来留存/活跃的影响」作为回报);再配合 A/B 上观察更长的窗口(7 日乃至 30 日留存与消费深度),避免被次日的短期点击指标骗过去。这题的加分点在于承认「短期指标与长期生态存在结构性冲突」,并给出「用约束而非调权」这类具体机制,而不是喊「兼顾长期价值」。