大模型算法 面试题
共 18 篇真实面经 · 涵盖 快手 / 腾讯 / 蚂蚁集团 / 百度 / 字节跳动 等 12 家公司
快手广告大模型算法 HR 面面经
快手广告大模型算法岗 HR 面面经,问题集中在求职动机与稳定性:base 地选择、是否还在实习与转正预期、求职目标以及偏研究还是偏业务应用的取向、对已投递几家公司的比较、手上其他流程的进度、论文产出情况,最后是候选人反问后续流程。
腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO
腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。
腾讯 WXG 大模型算法暑期实习面经:强化学习、LoRA 与手撕 PPO
腾讯 WXG 大模型算法暑期实习面经:从论文与强化学习算法(GRPO、PPO、reward model)与马尔可夫决策过程切入,追问 bf16/fp16/fp32 的精度与计算、LoRA 微调细节与量化,随后是大段手撕——实现 PPO、推导 MDP 的 γ 阈值、估算 SFT 参数量与显卡利用率、判断相交链表,以及如何让全连接层输出子空间基底接近标准正交基。
蚂蚁集团大模型算法岗面经 01:多模态与 Agent 合集
蚂蚁集团大模型算法岗面经合集(八场):多模态监督粒度、反向 KL、GRPO 与 DAPO、奖励黑客与视觉 token 压缩,另含二级缓存、MQ 幂等、RAG 检索评测、Prefill/Decode 分离与 GQA、KV cache。
蚂蚁集团大模型算法面经合集:并发基础与训练推理
蚂蚁集团大模型算法岗六场面试合集:一面以线程池、锁与 JVM、索引与 B+ 树、Redis 与秒杀链路打底,二面追问线索评分 ROI、Prompt 强制 JSON 输出与幻觉兜底、800ms 链路拆解;后几面深入 MLA 与 KV Cache 优化、蒸馏数据清洗与 w8a16 量化,以及 PPO/GRPO 的损失、KL 估计与 rollout 资源关系。
百度大模型算法岗面经合集:GRPO 训练与算子优化
百度大模型算法岗两场面试:一面围绕算子优化方案与效果验证,追问 GEMM 矩阵尺寸、GPU 架构与 Tensor Core 精度;二面聚焦 PPO、GRPO 与 DPO 的区别、持续学习分类,以及 8 卡 A100 的 GRPO 加速优化。
字节 AI Agent 开发一面 30 题全记录
字节 AI Agent 开发一面 30 题记录,分项目深挖、Agent 与 RAG 核心、八股、手撕、工程场景五组。重点在长期记忆的存储设计、上下文压缩的取舍、多 Agent 防死循环、父子切块与混合检索重排,以及工具成功率统计的手撕题。
滴滴算法秋招凉经:GRPO 监控指标与 Agentic RL 数据链路
滴滴算法秋招凉经,12 问全部围绕 RL 后训练:GRPO 除 reward 外要盯的六类指标、可训练轨迹必须保留的可见状态、SFT 数据筛选与成功轨迹的幸存者偏差、何时从 SFT 切到 RL,以及异步 rollout 的 off-policy 与 KL 约束。
滴滴算法面经合集:RL 八股与 Agent 项目深挖
滴滴算法岗面经合集。以强化学习八股为主:PPO/GRPO/DPO/DAPO 区别、组内优势、熵坍塌、动态采样、clip 与 reward hacking,另含 SFT 与 RL 取舍、Agent 项目深挖与 Transformer 手撕。
华为大模型算法岗面经:LoRA、PPO 与 Transformer
华为大模型算法岗面经,覆盖数据清洗与数据集构建、LoRA 微调原理、前向反向传播与参数更新、PPO 与 GRPO 与 DPO 的区别、多模态与智驾模型、ViT 与 VLA 原理,以及和为 k 的最长子数组算法题。
货拉拉大模型二面:上下文压缩与记忆沉淀
货拉拉大模型方向二面面经。从实习难点切入,追问 LLM 沉淀结果的评估与冲突重合处理、firstcoder 与其它 coding agent 的差异、上下文为什么要压缩、上下文与记忆的区别、记忆如何沉淀,以及测评方案。
理想汽车智能体算法一面:Agent Loop 与奖励设计
理想汽车智能体算法一面面经,围绕 Agent 工程落地展开:Agent Loop 需要哪些结构化状态、什么任务该用 Agent 而非固定工作流、奖励设计失衡怎么排查、失败轨迹如何拆成训练样本,以及 LoRA 与全参微调的取舍。
蔚来 大模型算法 秋招面经:代码智能体仓库级改造与上下文工程
2026 秋招蔚来大模型算法岗面经,问题全部围绕代码智能体的工程落地:仓库级上下文如何构建、纯向量检索为何漏文件、符号图与影响分析怎么用、怎么保证生成的补丁真的可交付、项目级指令文件的边界,以及权限隔离与提示注入防护。
拼多多9.19线下面经:大模型算法一面到主管面
拼多多 9.19 线下大模型算法面经,一天走完一面到主管面。技术面围绕实习与论文,八股考 LoRA 的 alpha/rank、VLM 减少 vision token、Qwen-VL 位置编码与 adapter 选型,手撕含 O(n) 递增三元组、搜索旋转数组与黄金分堆。
拼多多大模型算法HR面 从意向度问到自媒体账号
拼多多大模型算法 HR 面记录:从自我介绍、岗位方向意向度、其他流程进展与 base 地,一路问到父母职业、对公司的印象、是否认识在职员工,以及有没有注册网店和自媒体账号(有的话入职前需要注销)。
拼多多大模型算法秋招一面:过程奖励模型与 GRPO
拼多多大模型算法秋招一面面经,题目集中在 Agent 与强化学习链路:过程奖励模型如何避免只学轨迹长度、GRPO 省掉价值模型后的采样代价、DPO 两个概率同时下降的原因,以及千万级知识库的召回与冲突证据取舍。
拼多多大模型算法秋招二面:LoRA 微调与注意力原理
拼多多大模型算法秋招二面,从 LoRA 的低秩假设与 rank 和 alpha 配比切入,覆盖 QLoRA 的量化与训练不稳定、注意力缩放与长上下文优化路线、RoPE 外推与 YaRN,以及显存估算、梯度累积和混合精度溢出排查。
小红书大模型算法面经:笔试到 HR 面全流程
小红书大模型算法岗全流程面经,覆盖机考三题(加权热度排序、图文匹配、时间衰减排序)、一面多模态与训练细节、二面推荐系统与 AB 实验、HR 面反问,以及手撕链表两两交换节点。