奖励模型 面试题
共 2 篇真实面经 · 涵盖 拼多多 / 腾讯 等 2 家公司
拼多多大模型算法秋招一面:过程奖励模型与 GRPO
拼多多大模型算法秋招一面面经,题目集中在 Agent 与强化学习链路:过程奖励模型如何避免只学轨迹长度、GRPO 省掉价值模型后的采样代价、DPO 两个概率同时下降的原因,以及千万级知识库的召回与冲突证据取舍。
腾讯混元大模型算法岗一面真题
腾讯混元大模型算法岗一面的同题记录:从 Agent-RL 的奖励分层与长链路信用分配讲起,串起 GRPO 各支改进、PRM 如何进 advantage、多智能体值不值得拆、Agent 评测指标怎么选,再落到混元 MoE 与跨层注意力、DPO 双降归因、BM25 的词频饱和与长度归一化、以及阶段内 token 归一化对长度偏好的影响。