面灵AI→

拼多多大模型算法秋招一面:过程奖励模型与 GRPO

拼多多 大模型算法 一面

拼多多大模型算法秋招一面面经,题目集中在 Agent 与强化学习链路:过程奖励模型如何避免只学轨迹长度、GRPO 省掉价值模型后的采样代价、DPO 两个概率同时下降的原因,以及千万级知识库的召回与冲突证据取舍。

2026-09

腾讯混元大模型算法岗一面真题

腾讯 大模型算法 一面

腾讯混元大模型算法岗一面的同题记录:从 Agent-RL 的奖励分层与长链路信用分配讲起,串起 GRPO 各支改进、PRM 如何进 advantage、多智能体值不值得拆、Agent 评测指标怎么选,再落到混元 MoE 与跨层注意力、DPO 双降归因、BM25 的词频饱和与长度归一化、以及阶段内 token 归一化对长度偏好的影响。

2026-09