面灵AI→

大厂推荐算法面经 10 问(同题重复投稿):后训练 RL 复习清单

某互联网公司 推荐算法

同一份「大厂推荐算法面经 10 问」由两个账号先后发布,内容与另一篇完全一致。十道题集中在 LLM 后训练的 RL 侧:PPO / GRPO / DPO 的定位与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 与验证集背离的排查,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 的轻重。

2026-10

百度大模型算法岗一面二面面经(GSPO 与多智能体)

百度 大模型算法 一面+二面

百度大模型算法岗一二面面经。一面考强化学习对齐选型(GSPO 相对 PPO、GRPO 的优势)、多智能体协作与记忆、Qwen 多模态与 MRoPE、RAG 全流程,手撕最长公共子序列;二面考 ReAct、SFT 与 RLHF 数据、自注意力与 QKV。

2026-09

百度大模型算法岗一二面面经(对齐、Agent 与多模态)

百度 大模型算法 一面+二面

百度大模型算法岗一面二面面经合集。一面围绕对齐算法选型(GSPO 与 PPO、GRPO 对比)、视觉语言模型、多智能体拆分与记忆、Qwen 多模态与 MRoPE、RAG;二面深入 ReAct、SFT 与 RLHF 数据、奖励模型、检索选型与 QKV。

2026-09