面灵AI→

百度后训练大模型算法岗一二三面面经

百度 后训练大模型算法工程师 一面二面三面

百度后训练大模型算法岗一面到三面面经。一面考困惑度等概率类评估指标的物理意义、Mid-Train 中间训练阶段的定位与配置差异、冷启动到 RL 的过渡设计、Tag-level 与 DAPO 的差异,并手撕重要性采样;二面集中在多模态与 MOE,追问 ViT 与 LLM 的损失函数、视觉-文本对齐策略、路由设计以及未命中目标专家的惩罚约束;三面围绕项目复盘与训练范式的理解。

2026-10

百度后训练大模型算法岗一二三面面经

百度 后训练大模型算法工程师 一面二面三面

百度后训练大模型算法岗一面到三面面经。一面考困惑度等概率类评估指标的物理意义、Mid-Train 中间训练阶段的定位与配置差异、冷启动到 RL 的过渡设计、Tag-level 与 DAPO 的差异,并手撕重要性采样;二面集中在多模态与 MOE,追问 ViT 与 LLM 的损失函数、视觉-文本对齐策略、路由设计以及未命中目标专家的惩罚约束;三面围绕项目复盘与训练范式的理解。

2026-10

大厂推荐算法面经 10 问(同题重复投稿):后训练 RL 复习清单

某互联网公司 推荐算法

同一份「大厂推荐算法面经 10 问」由两个账号先后发布,内容与另一篇完全一致。十道题集中在 LLM 后训练的 RL 侧:PPO / GRPO / DPO 的定位与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 与验证集背离的排查,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 的轻重。

2026-10

大厂推荐算法面经 10 问:后训练 RL 的算法对比与工程细节

某互联网公司 推荐算法

一份大厂推荐算法方向的面经,十道题全部落在 LLM 后训练的强化学习侧:DPO 的损失函数、PPO 与 GRPO、DPO 的异同与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 上升而验证集下降的排查方向,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 阶段的轻重判断。

2026-10

腾讯 CSIG 后训练实习一二面面经:从位置编码到 PPO 与 GRPO

腾讯 大模型算法(后训练) 一面+二面

腾讯 CSIG 后训练岗日常实习一、二面共 18 道题:一面考位置编码演进(绝对位置编码到 RoPE 及后续优化)、视频 VLM 的帧采样与时序建模、多模态输入编码差异、长文档与超大分辨率适配、推理超参、SFT 与 RL 的特性与业务场景、数据飞轮、稀疏 Attention 和量化;二面考 RL 熵值与 KL 监控、KV Cache 原理与显存优化、vLLM 与 SGLang 加速机制对比、PPO 与 GRPO 的细节差异、VLM 训练阶段与业务指标归因。

2026-10

腾讯 CSIG 业务后训练日常实习一二面:大模型与 RL 高频深挖

腾讯 大模型算法(后训练) 一面+二面

腾讯 CSIG 业务后训练日常实习一面二面记录:一面围绕位置编码演进、视频 VLM 的帧采样与时序建模、Qwen2-VL 与 Qwen3.5-VL 编码差异、超大分辨率与长文档适配、推理超参、SFT 与 RL 的适用场景、数据 Pipeline、稀疏 Attention 与模型量化;二面深挖 RL 训练监控指标、KV Cache 与显存优化、vLLM 与 SGLang 的加速机制差异、PPO 与 GRPO 算法细节、RL 三核心以及 VLM 全流程训练与指标归因。

2026-10