面灵AI→

百度后训练大模型算法岗一二三面面经

百度 后训练大模型算法工程师 一面二面三面

百度后训练大模型算法岗一面到三面面经。一面考困惑度等概率类评估指标的物理意义、Mid-Train 中间训练阶段的定位与配置差异、冷启动到 RL 的过渡设计、Tag-level 与 DAPO 的差异,并手撕重要性采样;二面集中在多模态与 MOE,追问 ViT 与 LLM 的损失函数、视觉-文本对齐策略、路由设计以及未命中目标专家的惩罚约束;三面围绕项目复盘与训练范式的理解。

2026-10

百度后训练大模型算法岗一二三面面经

百度 后训练大模型算法工程师 一面二面三面

百度后训练大模型算法岗一面到三面面经。一面考困惑度等概率类评估指标的物理意义、Mid-Train 中间训练阶段的定位与配置差异、冷启动到 RL 的过渡设计、Tag-level 与 DAPO 的差异,并手撕重要性采样;二面集中在多模态与 MOE,追问 ViT 与 LLM 的损失函数、视觉-文本对齐策略、路由设计以及未命中目标专家的惩罚约束;三面围绕项目复盘与训练范式的理解。

2026-10

字节大模型算法秋招一面

字节跳动 大模型算法工程师 一面

字节跳动大模型算法秋招一面面经:十道题覆盖基座模型选型与备选评估、数据方案与公开数据集、DAPO 与 GRPO 的差异、强化学习选型考量、上下文压缩与有效长度、长程 Agent 优化方向、FlashAttention 分块原理与 PagedAttention 的 KV Cache 管理,末尾手撕 Self-Attention。

2026-10

字节大模型算法岗秋招一面

字节跳动 大模型算法工程师 一面

字节跳动大模型算法岗秋招一面面经:从基座模型选型理由与备选评估、数据方案与公开数据集取舍,问到 DAPO 对比 GRPO 的改进、强化学习算法选型考量、上下文压缩与有效长度,下半程是 FlashAttention 分块原理、vLLM 的 PagedAttention,最后手撕 Self-Attention。

2026-10

滴滴 Agent 岗面经:智能客服与行程规划 Agent 设计

滴滴 Agent 开发

滴滴 Agent 岗面经,全程围绕真实项目与技术选型追问依据:智能问数的数据误差归因、幻觉优化、知识库增强与微调的适用边界、基座与微调数据选择、评估体系、verl 中的 agent loop、GRPO 与 on-policy/off-policy 取舍,以及出行场景智能客服的对话状态管理、工具编排、兜底与服务质量评估,行程规划 Agent 的长流程上下文、断点恢复、多 Agent 并发改文件的冲突处理,手撕买卖股票 II 与编辑距离。

2026-10

滴滴国际化信贷AI二面:风控自动化、实验结果题与实习项目追问

滴滴 国际化信贷AI算法 二面

滴滴国际化信贷 AI 岗二面面经:围绕风控 AI 的理解、用 AI 做提效(数据处理、特征提取、训练实验自动化)的设计题、现场给乱序实验结果选最优,以及实习项目里的合成数据形态、训练参与部分与强化学习 reward 设计逐层追问。

2026-10

大厂推荐算法面经 10 问(同题重复投稿):后训练 RL 复习清单

某互联网公司 推荐算法

同一份「大厂推荐算法面经 10 问」由两个账号先后发布,内容与另一篇完全一致。十道题集中在 LLM 后训练的 RL 侧:PPO / GRPO / DPO 的定位与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 与验证集背离的排查,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 的轻重。

2026-10

大厂推荐算法面经 10 问:后训练 RL 的算法对比与工程细节

某互联网公司 推荐算法

一份大厂推荐算法方向的面经,十道题全部落在 LLM 后训练的强化学习侧:DPO 的损失函数、PPO 与 GRPO、DPO 的异同与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 上升而验证集下降的排查方向,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 阶段的轻重判断。

2026-10

腾讯大模型算法岗一二面面经

腾讯 大模型算法工程师 一面二面

腾讯大模型算法岗一二面记录:一面考注意力实现、ReAct、多轮工具调用的 RL 损失与 GRPO、GSPO,并手撕多头注意力;二面考多工具 Agent 训练、rollout 奖励与 LLM Judge 评估。

2026-10

腾讯大模型算法岗一二面面经

腾讯 大模型算法工程师 一面二面

腾讯大模型算法岗一面二面面经:一面考多头注意力实现、ReAct、多轮工具调用的 RL 损失与 GRPO、GSPO;二面考多工具 Agent 的 SFT、rollout 奖励与端到端时延归因。

2026-10

腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO

腾讯 大模型算法

腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。

2026-10

腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO

腾讯 大模型算法

腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。

2026-10

蚂蚁集团大模型算法岗面经 01:多模态与 Agent 合集

蚂蚁集团 大模型算法

蚂蚁集团大模型算法岗面经合集(八场):多模态监督粒度、反向 KL、GRPO 与 DAPO、奖励黑客与视觉 token 压缩,另含二级缓存、MQ 幂等、RAG 检索评测、Prefill/Decode 分离与 GQA、KV cache。

2026-09

百度 算法岗面经 两轮 智驾决策与大模型

百度 算法工程师(智驾方向)

百度算法岗两轮面经。第一轮围绕智驾决策模型深挖,问单 Head 设计、Loss 与 Reward 设计、决策与预测任务的监督方式、开环与闭环训练、离散决策如何生成轨迹和风险映射;第二轮从大模型实习切入,追问 SFT 与 GRPO 的改动。

2026-09

百度大模型算法岗一面二面面经(GSPO 与多智能体)

百度 大模型算法 一面+二面

百度大模型算法岗一二面面经。一面考强化学习对齐选型(GSPO 相对 PPO、GRPO 的优势)、多智能体协作与记忆、Qwen 多模态与 MRoPE、RAG 全流程,手撕最长公共子序列;二面考 ReAct、SFT 与 RLHF 数据、自注意力与 QKV。

2026-09

百度大模型算法岗面经合集:GRPO 训练与算子优化

百度 大模型算法 多轮面试合集

百度大模型算法岗两场面试:一面围绕算子优化方案与效果验证,追问 GEMM 矩阵尺寸、GPU 架构与 Tensor Core 精度;二面聚焦 PPO、GRPO 与 DPO 的区别、持续学习分类,以及 8 卡 A100 的 GRPO 加速优化。

2026-09

滴滴算法秋招凉经:GRPO 监控指标与 Agentic RL 数据链路

滴滴 大模型算法

滴滴算法秋招凉经,12 问全部围绕 RL 后训练:GRPO 除 reward 外要盯的六类指标、可训练轨迹必须保留的可见状态、SFT 数据筛选与成功轨迹的幸存者偏差、何时从 SFT 切到 RL,以及异步 rollout 的 off-policy 与 KL 约束。

2026-09

滴滴算法面经合集:RL 八股与 Agent 项目深挖

滴滴 大模型算法工程师 一面

滴滴算法岗面经合集。以强化学习八股为主:PPO/GRPO/DPO/DAPO 区别、组内优势、熵坍塌、动态采样、clip 与 reward hacking,另含 SFT 与 RL 取舍、Agent 项目深挖与 Transformer 手撕。

2026-09

合合信息多模态大模型算法研究员一面 + 作业帮大模型算法一面二面

合合信息 算法 多轮面试合集

合合信息多模态大模型算法研究员一面与作业帮大模型算法一面、二面合集,问题覆盖如何判断 SFT 模型可以转 RL、DPO 奖励函数与 DPO/GRPO 对比、RL 训练中输出变长的原因、DPO 数据筛选稳定性与 OCR 模型架构,手撕三数之和、搜索旋转排序数组。

2026-09

快手可灵策略梯度岗一面:强化学习算法与论文深挖

快手 强化学习算法 一面

快手可灵(视频生成团队)策略梯度岗一面记录,先对两篇论文和实习经历做深挖,再问主流强化学习算法的区别、GAE 与 Diffusion Model、RLVF,以及 GRPO 具体存在什么问题,手撕是切分披萨数,可用 DP 或 DFS 加记忆化搜索。

2026-09

联想AI岗笔试考点复盘(选择题、编程与AI coding)

联想 人工智能岗 笔试

联想 AI 岗笔试题型复盘:20 道单选加一道编程加一道 AI coding,选择题覆盖算法补代码、RNN、HMM、强化学习、LoRA、SQL、激活函数与排序,编程题仅过 18% 用例。

2026-09

理想汽车智能体算法一面:Agent Loop 与奖励设计

理想汽车 智能体算法-软件 一面

理想汽车智能体算法一面面经,围绕 Agent 工程落地展开:Agent Loop 需要哪些结构化状态、什么任务该用 Agent 而非固定工作流、奖励设计失衡怎么排查、失败轨迹如何拆成训练样本,以及 LoRA 与全参微调的取舍。

2026-09

美团 自动驾驶算法工程师一面:VOC 大模型实习与强化学习项目拷打

美团 自动驾驶算法工程师 一面

美团正式批自动驾驶算法工程师一面,2026 年 9 月 21 日,约 55 分钟。前半程深挖实习的 VOC 用户之声与大模型分类打标,后半程围绕强化学习项目的奖励设计、MHA 与评价指标追问,最后是最大下降幅度手撕题与 AI Coding 经验。

2026-09

拼多多大模型算法秋招一面:过程奖励模型与 GRPO

拼多多 大模型算法 一面

拼多多大模型算法秋招一面面经,题目集中在 Agent 与强化学习链路:过程奖励模型如何避免只学轨迹长度、GRPO 省掉价值模型后的采样代价、DPO 两个概率同时下降的原因,以及千万级知识库的召回与冲突证据取舍。

2026-09

腾讯混元大模型算法岗一面真题

腾讯 大模型算法 一面

腾讯混元大模型算法岗一面的同题记录:从 Agent-RL 的奖励分层与长链路信用分配讲起,串起 GRPO 各支改进、PRM 如何进 advantage、多智能体值不值得拆、Agent 评测指标怎么选,再落到混元 MoE 与跨层注意力、DPO 双降归因、BM25 的词频饱和与长度归一化、以及阶段内 token 归一化对长度偏好的影响。

2026-09

腾讯混元大模型算法岗一面面经

腾讯 大模型算法 一面

腾讯混元大模型算法岗一面真题,围绕 Agent 强化学习展开:奖励设计与长链路信用分配、GRPO 的衍生改进、Multi-Agent 的收益与代价、PRM 如何接入训练、Agent 评测体系,并延伸到混元自身的 MoE 与 Attention 设计、DPO 概率双降、BM25 检索以及分阶段 token 归一化。

2026-09

小红书广告交易算法实习面试:KKT 条件与博弈论连环拷打

小红书 广告交易算法(日常实习)

小红书广告交易算法日常实习面试,全程围绕数学与强化学习展开:安全强化学习、为什么选 SAC 而不是别的算法、拉格朗日对偶与对偶形式、KKT 与 Slater 条件、Stackelberg 博弈和 Nash 博弈的区别,八股问 PPO/DPO/GRPO,手撕是网格路径计数。

2026-09

小红书多模态算法秋招二面面经(约 40 题 + 手撕)

小红书 多模态算法 二面

小红书多模态算法秋招二面记录,约 40 题加一道手撕。考察视觉编码器与 LLM 连接方式、多模态幻觉、InfoNCE 温度,以及 SFT 调优、PPO/DPO/GRPO 选型、OOM 优化、端侧推理与蒸馏;手撕为矩阵原地旋转 90 度。

2026-09