面灵AI→

大厂推荐算法面经 10 问:后训练 RL 的算法对比与工程细节

某互联网公司 推荐算法

一份大厂推荐算法方向的面经,十道题全部落在 LLM 后训练的强化学习侧:DPO 的损失函数、PPO 与 GRPO、DPO 的异同与 on-policy 归属,DAPO 与 GSPO 对 GRPO 的改进,process reward 与 outcome reward 的取舍,reward 上升而验证集下降的排查方向,VeRL 的同步异步与训推不一致,以及 SFT 与 RL 阶段的轻重判断。

2026-10

字节多模态大模型一面二面三面:从 Lora 微调到手撕算法

字节跳动 多模态大模型 一面

字节多模态大模型岗三面连轴面经:一面围绕论文与 RAG 项目、质量过滤模型、LoRA 原理、Transformer 自注意力与 BERT/GPT 差异、RLHF 与 DPO,手撕最长公共子序列;二面拷打多模态训练与 Prompt 验证、数据清洗、CLIP、幻觉与复读机、前馈网络升维降维、LLaMA 版本差异;三面偏开放,聊对大模型结构演进与训练难点的理解。

2026-09

华为大模型算法岗面经:LoRA、PPO 与 Transformer

华为 大模型算法

华为大模型算法岗面经,覆盖数据清洗与数据集构建、LoRA 微调原理、前向反向传播与参数更新、PPO 与 GRPO 与 DPO 的区别、多模态与智驾模型、ViT 与 VLA 原理,以及和为 k 的最长子数组算法题。

2026-09

合合信息多模态大模型算法研究员一面 + 作业帮大模型算法一面二面

合合信息 算法 多轮面试合集

合合信息多模态大模型算法研究员一面与作业帮大模型算法一面、二面合集,问题覆盖如何判断 SFT 模型可以转 RL、DPO 奖励函数与 DPO/GRPO 对比、RL 训练中输出变长的原因、DPO 数据筛选稳定性与 OCR 模型架构,手撕三数之和、搜索旋转排序数组。

2026-09

京东 大模型算法岗面经合集 01:PPO/DPO/GRPO 八股、音视频链路与端侧 AI 追问

京东 大模型算法 多轮面试合集

京东大模型算法岗 6 场面试记录:强化学习与微调原理(PPO 与 GRPO 的 KL 约束、DPO 的数据构造)、音视频链路深挖(AAC 与 Opus、WebRTC、3A 算法)、LoRA 参数、RAG 切片与召回优化,末尾手撕 LRU。

2026-09

腾讯混元大模型算法岗一面面经

腾讯 大模型算法 一面

腾讯混元大模型算法岗一面真题,围绕 Agent 强化学习展开:奖励设计与长链路信用分配、GRPO 的衍生改进、Multi-Agent 的收益与代价、PRM 如何接入训练、Agent 评测体系,并延伸到混元自身的 MoE 与 Attention 设计、DPO 概率双降、BM25 检索以及分阶段 token 归一化。

2026-09

小红书 大模型算法岗面经合集(三):Transformer 细节、DPO 与推理优化

小红书 大模型算法 多轮面试合集

小红书大模型算法岗九场面经合集(三),2025 年 12 月至 2026 年 1 月。覆盖 Transformer 结构与 GQA,微调 7B 显存估算、FlashAttention、DPO 与 RAG 微调,以及 PPO、GRPO 差异。

2026-09