PPO 面试题
共 9 篇真实面经 · 涵盖 某互联网公司 / 腾讯 / 蚂蚁集团 / 华为 / 快手 等 6 家公司
大厂推荐算法面经 10 问:后训练 RL 的算法对比与工程细节
一份大厂推荐算法方向的面经,十道题全部落在 LLM 后训练的强化学习侧:DPO 的损失函数、PPO 与 GRPO、DPO 的异同与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 上升而验证集下降的排查方向,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 阶段的轻重判断。
腾讯 CSIG 后训练实习一二面面经:从位置编码到 PPO 与 GRPO
腾讯 CSIG 后训练岗日常实习一、二面共 18 道题:一面考位置编码演进(绝对位置编码到 RoPE 及后续优化)、视频 VLM 的帧采样与时序建模、多模态输入编码差异、长文档与超大分辨率适配、推理超参、SFT 与 RL 的特性与业务场景、数据飞轮、稀疏 Attention 和量化;二面考 RL 熵值与 KL 监控、KV Cache 原理与显存优化、vLLM 与 SGLang 加速机制对比、PPO 与 GRPO 的细节差异、VLM 训练阶段与业务指标归因。
腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO
腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。
腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO
腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。
蚂蚁集团大模型算法面经合集:并发基础与训练推理
蚂蚁集团大模型算法岗六场面试合集:一面以线程池、锁与 JVM、索引与 B+ 树、Redis 与秒杀链路打底,二面追问线索评分 ROI、Prompt 强制 JSON 输出与幻觉兜底、800ms 链路拆解;后几面深入 MLA 与 KV Cache 优化、蒸馏数据清洗与 w8a16 量化,以及 PPO/GRPO 的损失、KL 估计与 rollout 资源关系。
蚂蚁集团大模型算法岗面经
蚂蚁集团大模型算法岗多轮面经汇总,重点考察 PPO/GRPO 的四个模型与损失函数、KL 估计方式、rollout 与 batchsize 的资源关系、拒绝采样、Agent 记忆系统设计与 vLLM 推理加速,另有 RAG 混合检索与术语消歧、LoRA 微调层选择、高并发低延迟部署等落地问题。
华为大模型算法岗面经:LoRA、PPO 与 Transformer
华为大模型算法岗面经,覆盖数据清洗与数据集构建、LoRA 微调原理、前向反向传播与参数更新、PPO 与 GRPO 与 DPO 的区别、多模态与智驾模型、ViT 与 VLA 原理,以及和为 k 的最长子数组算法题。
快手大模型应用开发二面:Agentic RL 与 RAG 全链路
快手大模型应用开发二面:中段集中考 Agentic RL 的信用分配、PPO 的 Clip 与 KL 约束、GRPO 为何省掉 critic;其余覆盖 Agent 架构、RAG 切分与混合检索、幻觉归因、记忆冲突与 SSE 断点续传。
小红书广告交易算法实习面试:KKT 条件与博弈论连环拷打
小红书广告交易算法日常实习面试,全程围绕数学与强化学习展开:安全强化学习、为什么选 SAC 而不是别的算法、拉格朗日对偶与对偶形式、KKT 与 Slater 条件、Stackelberg 博弈和 Nash 博弈的区别,八股问 PPO/DPO/GRPO,手撕是网格路径计数。