面灵AI→

滴滴 Agent 岗面经:智能客服与行程规划 Agent 设计

滴滴 Agent 开发

滴滴 Agent 岗面经,全程围绕真实项目与技术选型追问依据:智能问数的数据误差归因、幻觉优化、知识库增强与微调的适用边界、基座与微调数据选择、评估体系、verl 中的 agent loop、GRPO 与 on-policy/off-policy 取舍,以及出行场景智能客服的对话状态管理、工具编排、兜底与服务质量评估,行程规划 Agent 的长流程上下文、断点恢复、多 Agent 并发改文件的冲突处理,手撕买卖股票 II 与编辑距离。

2026-10

大厂推荐算法面经 10 问(同题重复投稿):后训练 RL 复习清单

某互联网公司 推荐算法

同一份「大厂推荐算法面经 10 问」由两个账号先后发布,内容与另一篇完全一致。十道题集中在 LLM 后训练的 RL 侧:PPO / GRPO / DPO 的定位与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 与验证集背离的排查,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 的轻重。

2026-10

大厂推荐算法面经 10 问:后训练 RL 的算法对比与工程细节

某互联网公司 推荐算法

一份大厂推荐算法方向的面经,十道题全部落在 LLM 后训练的强化学习侧:DPO 的损失函数、PPO 与 GRPO、DPO 的异同与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 上升而验证集下降的排查方向,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 阶段的轻重判断。

2026-10

腾讯 CSIG 后训练实习一二面面经:从位置编码到 PPO 与 GRPO

腾讯 大模型算法(后训练) 一面+二面

腾讯 CSIG 后训练岗日常实习一、二面共 18 道题:一面考位置编码演进(绝对位置编码到 RoPE 及后续优化)、视频 VLM 的帧采样与时序建模、多模态输入编码差异、长文档与超大分辨率适配、推理超参、SFT 与 RL 的特性与业务场景、数据飞轮、稀疏 Attention 和量化;二面考 RL 熵值与 KL 监控、KV Cache 原理与显存优化、vLLM 与 SGLang 加速机制对比、PPO 与 GRPO 的细节差异、VLM 训练阶段与业务指标归因。

2026-10

腾讯大模型算法岗一二面面经

腾讯 大模型算法工程师 一面二面

腾讯大模型算法岗一二面记录:一面考注意力实现、ReAct、多轮工具调用的 RL 损失与 GRPO、GSPO,并手撕多头注意力;二面考多工具 Agent 训练、rollout 奖励与 LLM Judge 评估。

2026-10

腾讯大模型算法岗一二面面经

腾讯 大模型算法工程师 一面二面

腾讯大模型算法岗一面二面面经:一面考多头注意力实现、ReAct、多轮工具调用的 RL 损失与 GRPO、GSPO;二面考多工具 Agent 的 SFT、rollout 奖励与端到端时延归因。

2026-10

腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO

腾讯 大模型算法

腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。

2026-10

腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO

腾讯 大模型算法

腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。

2026-10

蚂蚁集团大模型算法岗面经 01:多模态与 Agent 合集

蚂蚁集团 大模型算法

蚂蚁集团大模型算法岗面经合集(八场):多模态监督粒度、反向 KL、GRPO 与 DAPO、奖励黑客与视觉 token 压缩,另含二级缓存、MQ 幂等、RAG 检索评测、Prefill/Decode 分离与 GQA、KV cache。

2026-09

蚂蚁集团大模型算法面经合集:并发基础与训练推理

蚂蚁集团 大模型算法 多轮面试合集

蚂蚁集团大模型算法岗六场面试合集:一面以线程池、锁与 JVM、索引与 B+ 树、Redis 与秒杀链路打底,二面追问线索评分 ROI、Prompt 强制 JSON 输出与幻觉兜底、800ms 链路拆解;后几面深入 MLA 与 KV Cache 优化、蒸馏数据清洗与 w8a16 量化,以及 PPO/GRPO 的损失、KL 估计与 rollout 资源关系。

2026-09

百度 算法岗面经 两轮 智驾决策与大模型

百度 算法工程师(智驾方向)

百度算法岗两轮面经。第一轮围绕智驾决策模型深挖,问单 Head 设计、Loss 与 Reward 设计、决策与预测任务的监督方式、开环与闭环训练、离散决策如何生成轨迹和风险映射;第二轮从大模型实习切入,追问 SFT 与 GRPO 的改动。

2026-09

百度大模型算法岗面经合集:GRPO 训练与算子优化

百度 大模型算法 多轮面试合集

百度大模型算法岗两场面试:一面围绕算子优化方案与效果验证,追问 GEMM 矩阵尺寸、GPU 架构与 Tensor Core 精度;二面聚焦 PPO、GRPO 与 DPO 的区别、持续学习分类,以及 8 卡 A100 的 GRPO 加速优化。

2026-09

字节AI Agent开发一面:三层编排、上下文隔离与GRPO

字节跳动 Agent开发 一面

字节抖音电商AI Agent开发一面面经,围绕一个风控归因Agent项目逐层追问:为什么非要拆成三级编排、主Agent与子Agent之间上下文怎么传递和保真、上下文超长怎么压、RAG召回率从哪些角度提升、父子文档索引解决什么、多Agent上下文与状态如何互不串,另有手撕多层嵌套JSON深度合并且键冲突时类型不同的处理,以及GRPO与PPO在奖励归因上的差异。

2026-09

滴滴算法秋招凉经:GRPO 监控指标与 Agentic RL 数据链路

滴滴 大模型算法

滴滴算法秋招凉经,12 问全部围绕 RL 后训练:GRPO 除 reward 外要盯的六类指标、可训练轨迹必须保留的可见状态、SFT 数据筛选与成功轨迹的幸存者偏差、何时从 SFT 切到 RL,以及异步 rollout 的 off-policy 与 KL 约束。

2026-09

滴滴算法面经合集:RL 八股与 Agent 项目深挖

滴滴 大模型算法工程师 一面

滴滴算法岗面经合集。以强化学习八股为主:PPO/GRPO/DPO/DAPO 区别、组内优势、熵坍塌、动态采样、clip 与 reward hacking,另含 SFT 与 RL 取舍、Agent 项目深挖与 Transformer 手撕。

2026-09

京东 大模型算法岗面经合集 02:多模态位置编码、Agent 与 SFT/RL 追问

京东 大模型算法 多轮面试合集

京东大模型算法岗 9 场面试记录:VLM 项目追问 M-RoPE 视频位置编码与 SAM2,RoPE、ALiBi 与 SwiGLU 八股,Agent 与 SFT/GRPO 链路,RAG 与库存一致性,以及一场偏前端的 Vue 响应式面试。

2026-09

京东 大模型算法岗面经合集 01:PPO/DPO/GRPO 八股、音视频链路与端侧 AI 追问

京东 大模型算法 多轮面试合集

京东大模型算法岗 6 场面试记录:强化学习与微调原理(PPO 与 GRPO 的 KL 约束、DPO 的数据构造)、音视频链路深挖(AAC 与 Opus、WebRTC、3A 算法)、LoRA 参数、RAG 切片与召回优化,末尾手撕 LRU。

2026-09

快手可灵策略梯度岗一面:强化学习算法与论文深挖

快手 强化学习算法 一面

快手可灵(视频生成团队)策略梯度岗一面记录,先对两篇论文和实习经历做深挖,再问主流强化学习算法的区别、GAE 与 Diffusion Model、RLVF,以及 GRPO 具体存在什么问题,手撕是切分披萨数,可用 DP 或 DFS 加记忆化搜索。

2026-09

快手大模型应用开发二面:Agentic RL 与 RAG 全链路

快手 大模型应用开发 二面

快手大模型应用开发二面:中段集中考 Agentic RL 的信用分配、PPO 的 Clip 与 KL 约束、GRPO 为何省掉 critic;其余覆盖 Agent 架构、RAG 切分与混合检索、幻觉归因、记忆冲突与 SSE 断点续传。

2026-09

拼多多大模型算法秋招一面:过程奖励模型与 GRPO

拼多多 大模型算法 一面

拼多多大模型算法秋招一面面经,题目集中在 Agent 与强化学习链路:过程奖励模型如何避免只学轨迹长度、GRPO 省掉价值模型后的采样代价、DPO 两个概率同时下降的原因,以及千万级知识库的召回与冲突证据取舍。

2026-09

腾讯混元大模型算法岗一面面经

腾讯 大模型算法 一面

腾讯混元大模型算法岗一面真题,围绕 Agent 强化学习展开:奖励设计与长链路信用分配、GRPO 的衍生改进、Multi-Agent 的收益与代价、PRM 如何接入训练、Agent 评测体系,并延伸到混元自身的 MoE 与 Attention 设计、DPO 概率双降、BM25 检索以及分阶段 token 归一化。

2026-09