面灵AI→

腾讯混元大模型算法岗一面真题

轮次
一面
时间
2026-09
来源
牛客网

《面试题目》

  1. Agent-RL 的奖励该如何设计?Outcome Reward、Process Reward、规则奖励分别适合什么场景?
  2. 长链路 Agent 任务仅有最终奖励时,信用分配为什么困难,有哪些常见解决方案?
  3. 讲讲 GRPO 主流的衍生改进算法以及各自核心思路。
  4. 什么场景适合使用 Multi-Agent?对比 Single-Agent,多智能体带来的收益和额外成本是什么?
  5. PRM 怎么参与 Agent 训练的信用分配?只是每一步打奖励,还是会转成 Advantage 参与训练更新?
  6. Agent 评测除任务成功率之外还有哪些关键指标?LLM-as-a-Judge 和 Golden Set 的优缺点是什么?
  7. 混元整体架构是什么样的,它的 Attention 与传统 Multi-Head Attention 有什么不同?
  8. DPO 训练时 chosen 和 rejected 样本概率同时下降是什么原因,可以怎么处理?
  9. 对比 TF-IDF 与 BM25,BM25 做了哪些核心优化?
  10. Agent 多阶段任务各阶段 token 差异大,阶段内 token 归一化算 loss 为什么能够缓解长度偏差?

《参考解析》

奖励与优化

1. Agent-RL 奖励设计:先分清「能用规则判」还是「只能估」:设计奖励的第一步不是选算法,而是判断信号的可验证程度。终态能自动判定(代码跑不跑得过单测、检索答案是否命中、任务是否真的闭环)就用 Outcome Reward,成本最低且几乎无法被模型钻空子,唯一缺点是稀疏。步骤很多、终态难以稳定判定(网页多步操作、长链路工具调用)才需要 Process Reward 提供逐步信号,代价是标注与 PRM 训练成本,且评分器会被针对性刷分。规则奖励覆盖的是另一类东西:输出格式、工具参数 schema、结果可解析性、是否重复调用——它近乎零成本、可在线判,但只能当护栏和轻量塑形,当成主奖励会诱导模型只做表面合规。工程上的常见配比是 outcome 为主、规则做门禁与塑形、PRM 补中间密度,并让 PRM 的权重随训练退火。

2. 信用分配的四条技术路线:只有最终奖励时,归因难来自四点:步数长、过程非马尔可夫、轨迹长度不统一、终态本身带噪声。对应有四条路线。其一是把终态拆成可验证的中间检查点,让奖励变密而不是靠猜。其二是学一个逐步价值(PRM 或 critic),用 A_t = γV(s_{t+1}) − V(s_t) 把信用摊到每一步。其三是统计方法降方差:return-to-go 加折扣、GAE 的 λ 折中、对关键步做 k 条 rollout 求均值、用同 prompt 的组内均值做基线(GRPO)、用留一均值(RLOO)。其四是搜索式回溯,用 MCTS/ToT 从终态反推节点价值,再拿这些价值去蒸馏策略。实践中还要处理长度不一致带来的尺度问题——奖励归一化、advantage 白化、按阶段分组统计,缺一个都会让训练偏向长轨迹。

3. PRM 到底是奖励项还是价值函数:两种做法都成立,区别在于要不要乘折扣。当作奖励项时,通常用分数差分 ΔPRM = PRM(s_t) − PRM(s_{t−1}) 叠加终局奖励,再一起算 advantage;因为它是势函数的差分,属于 potential-based shaping,理论上不改变最优解,只是把梯度铺匀、加快收敛。当作价值函数时,直接把 PRM(s_t) 视作 V(s_t),优势就变成 γV(s_{t+1}) − V(s_t),相当于用 PRM 顶替了 critic,省掉一套价值网络,还可以只在关键决策点(工具调用前后、分支选择处)打分以压低成本。除训练外,PRM 还常用于推理侧与数据侧:best-of-N 重排、轨迹筛选、拒绝采样构造 SFT 数据、定位坏步做局部重采样。要防的是评分器被刷与分布外失准,所以常见做法是权重退火归零、并用 held-out 轨迹持续校准 PRM。

4. GRPO 之后改了什么:GRPO 的出发点是省掉 critic——同一 prompt 采一组回答,用组内归一化后的回报当 advantage,配 KL 约束直接更新策略。后续改进围绕它的几个薄弱点展开。裁剪与采样:DAPO 用 clip-higher 放宽上界避免熵塌缩,动态采样丢掉全对和全错的组(它们没有梯度信息),把 loss 改成 token 级,并给超长回答加惩罚。归一化:Dr.GRPO 指出除以序列长度和除以标准差都会引入长度偏好,去掉后训练更稳。重要性比粒度:GSPO 把 token 级 ratio 改为序列级,缓解 MoE 模型中路由变化引起的数值不稳与训练崩溃,是 Qwen 系列常用的方案。此外 RLOO、REINFORCE++ 用留一均值做基线,属于更轻的同族方法;也有工作把 verifier 或 PRM 的分数作为额外 advantage 项叠加进来。

5. DPO 里 chosen 和 rejected 一起掉概率怎么解释:这是 DPO 目标的固有性质——它只优化相对差,不约束绝对似然。隐含奖励是 β 乘上两条序列 log 概率比之差,只要 rejected 下降得更快,目标就在改善,哪怕 chosen 的绝对概率也在跌。触发条件通常是:训练数据偏离当前策略分布太远、学习率过大或训得太久、β 偏小、chosen 本身有噪声或质量不佳、序列太长把 logprob 累加误差放大、以及样本对的区分度过低。处理手段可以分三层:目标层加 SFT/NLL 正则(DPO+NLL、RPO)或改用 IPO/CPO/SimPO 这类有界、去参考模型的目标;数据层清洗噪声对、剔除过于相似的 pair、混入 on-policy 采样;优化层降学习率、调大 β、早停。监控上盯 chosen 的平均 logprob 与输出熵,持续下滑即刻停训。

系统与评测

6. Multi-Agent 什么时候值得拆:值得拆的信号是:子任务之间弱耦合且角色异质(一个检索、一个写、一个验)、各自需要完全不同的上下文材料、需要并行采样提高多样性、需要不同的工具权限边界(执行 vs 审核)、或者单个上下文窗口确实装不下。拆开后的收益是分工精度、并行吞吐,以及能按角色配不同规格模型来控制成本。代价是 token 与延迟随 agent 数放大、错误沿通信链路传播放大、共享记忆的一致性难保证、信用分配更碎、评测与调试复杂度陡增。务实的判断标准是:先用单 agent 加良好的上下文管理跑出基线,只有当某个子任务真的需要独立上下文或独立权限、且这些子任务的正确性可以被分别验证时,拆分才划算。

7. Agent 评测不只看成功率:只看 success rate 会掩盖很多问题,至少还应该看:部分完成度与子目标达成率、步骤效率(步数、工具调用数、token 与折算成本)、端到端延迟、工具调用的合法率与参数幻觉率、出错后的自我恢复率、对 prompt 和环境扰动的鲁棒性、多次重复的一致性(pass^k,跑十次都成才算稳)、安全与越权比例、以及与基线模型的对战胜率。判分方式上,LLM-as-a-Judge 的长处是便宜、可扩展、能评开放式产出,短处是位置偏好、长度偏好、自我偏好这些系统偏差和不可复现的评分,需要用交换顺序、多次采样取均值、定期人工抽检来校准。Golden Set 的长处是标签确定、跨版本可比、便于做回归和防污染,短处是构建维护昂贵、覆盖有限、模型容易在其上过拟合。合理分工是 golden set 守回归底线,judge 看整体趋势。

模型与检索

8. 阶段内 token 归一化为什么能纠长度偏差:当各阶段 token 数相差一个数量级时,loss 的归一口径直接决定了模型偏好。按整条轨迹归一化,长阶段里每个 token 的权重被摊薄到 1/L,短阶段几乎不产生梯度,优化会被长阶段主导;直接对整条序列求和则更糟,长阶段梯度绝对值更大,等于在奖励「输出更长」。改成阶段内部按 token 平均、再把各阶段 loss 等权平均之后,每个阶段对梯度的贡献与自身长度解耦:短阶段(往往承载关键决策,比如选工具、下结论)能拿到足够监督,长阶段也无法靠 token 多而垄断更新。这与 DAPO 采用 token-level loss、Dr.GRPO 移除长度归一化与标准差归一化的结论一致——归一化方式本身就是一个隐式长度奖励。

9. 混元的架构特点与 Attention 差异:混元旗舰是 Decoder-only 的稀疏 MoE,总参数量数百 B 而单 token 只激活几十 B,router 只激活少数专家(另有共享专家兜底),用相同激活算力换取更大容量。Attention 层面它与传统 MHA 的差别有三点:其一,采用 GQA,多个 query 头共享一组 KV 头,KV cache 的规模由 KV 头数决定而非 attention 头数,长上下文显存与带宽大幅下降;其二,引入跨层注意力(CLA),相邻两层复用同一份 KV,等于把 KV cache 再砍一半,从而支撑 256K 级别的上下文;其三,新一代走 Mamba-Transformer 混合架构,大部分层用状态空间模型做序列混合(复杂度线性、推理状态恒定),只保留少量 Transformer 层负责精确检索。总结起来就是三句话:省 KV、撑长上下文、稀疏地花算力。

10. BM25 对 TF-IDF 做了哪三处修正:TF-IDF 的两个硬伤是词频线性累加和完全不看文档长度,导致长文档与堆砌关键词的文档天然占优。BM25 从概率检索模型出发做了三处修正:词频饱和,tf 项变成 tf·(k1+1)/(tf + k1·(1 − b + b·dl/avgdl)),出现次数越多边际收益越小;文档长度归一化,用 b(常取 0.75)调节长度惩罚强度,长文档不再仅因为词多而得分高;IDF 采用 Robertson-Sparck-Jones 形式加平滑,保证罕见词权重合理且不出现负值。经典 BM25 还带查询词频项 k3,工程上会扩展为 BM25F 做多字段加权,或与学习型稀疏检索(SPLADE 等)融合做召回。本质区别是:TF-IDF 在数词,BM25 在估相关性。