面灵AI→

腾讯 CSIG 后训练实习一二面面经:从位置编码到 PPO 与 GRPO

腾讯 大模型算法(后训练) 一面+二面

腾讯 CSIG 后训练岗日常实习一、二面共 18 道题:一面考位置编码演进(绝对位置编码到 RoPE 及后续优化)、视频 VLM 的帧采样与时序建模、多模态输入编码差异、长文档与超大分辨率适配、推理超参、SFT 与 RL 的特性与业务场景、数据飞轮、稀疏 Attention 和量化;二面考 RL 熵值与 KL 监控、KV Cache 原理与显存优化、vLLM 与 SGLang 加速机制对比、PPO 与 GRPO 的细节差异、VLM 训练阶段与业务指标归因。

2026-10

腾讯 CSIG 业务后训练日常实习一二面:大模型与 RL 高频深挖

腾讯 大模型算法(后训练) 一面+二面

腾讯 CSIG 业务后训练日常实习一面二面记录:一面围绕位置编码演进、视频 VLM 的帧采样与时序建模、Qwen2-VL 与 Qwen3.5-VL 编码差异、超大分辨率与长文档适配、推理超参、SFT 与 RL 的适用场景、数据 Pipeline、稀疏 Attention 与模型量化;二面深挖 RL 训练监控指标、KV Cache 与显存优化、vLLM 与 SGLang 的加速机制差异、PPO 与 GRPO 算法细节、RL 三核心以及 VLM 全流程训练与指标归因。

2026-10