大厂推荐算法面经 10 问(同题重复投稿):后训练 RL 复习清单
某互联网公司 推荐算法
同一份「大厂推荐算法面经 10 问」由两个账号先后发布,内容与另一篇完全一致。十道题集中在 LLM 后训练的 RL 侧:PPO / GRPO / DPO 的定位与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 与验证集背离的排查,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 的轻重。