GSPO 面试题
共 3 篇真实面经 · 涵盖 某互联网公司 / 百度 等 2 家公司
大厂推荐算法面经 10 问(同题重复投稿):后训练 RL 复习清单
同一份「大厂推荐算法面经 10 问」由两个账号先后发布,内容与另一篇完全一致。十道题集中在 LLM 后训练的 RL 侧:PPO / GRPO / DPO 的定位与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 与验证集背离的排查,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 的轻重。
百度大模型算法岗一面二面面经(GSPO 与多智能体)
百度大模型算法岗一二面面经。一面考强化学习对齐选型(GSPO 相对 PPO、GRPO 的优势)、多智能体协作与记忆、Qwen 多模态与 MRoPE、RAG 全流程,手撕最长公共子序列;二面考 ReAct、SFT 与 RLHF 数据、自注意力与 QKV。
百度大模型算法岗一二面面经(对齐、Agent 与多模态)
百度大模型算法岗一面二面面经合集。一面围绕对齐算法选型(GSPO 与 PPO、GRPO 对比)、视觉语言模型、多智能体拆分与记忆、Qwen 多模态与 MRoPE、RAG;二面深入 ReAct、SFT 与 RLHF 数据、奖励模型、检索选型与 QKV。