面灵AI→

腾讯 CSIG 业务后训练日常实习一二面:大模型与 RL 高频深挖

腾讯 大模型算法(后训练) 一面+二面

腾讯 CSIG 业务后训练日常实习一面二面记录:一面围绕位置编码演进、视频 VLM 的帧采样与时序建模、Qwen2-VL 与 Qwen3.5-VL 编码差异、超大分辨率与长文档适配、推理超参、SFT 与 RL 的适用场景、数据 Pipeline、稀疏 Attention 与模型量化;二面深挖 RL 训练监控指标、KV Cache 与显存优化、vLLM 与 SGLang 的加速机制差异、PPO 与 GRPO 算法细节、RL 三核心以及 VLM 全流程训练与指标归因。

2026-10

蚂蚁集团大模型算法岗面经

蚂蚁集团 大模型算法

蚂蚁集团大模型算法岗多轮面经汇总,重点考察 PPO/GRPO 的四个模型与损失函数、KL 估计方式、rollout 与 batchsize 的资源关系、拒绝采样、Agent 记忆系统设计与 vLLM 推理加速,另有 RAG 混合检索与术语消歧、LoRA 微调层选择、高并发低延迟部署等落地问题。

2026-09

百度大模型算法岗一二面面经(对齐、Agent 与多模态)

百度 大模型算法 一面+二面

百度大模型算法岗一面二面面经合集。一面围绕对齐算法选型(GSPO 与 PPO、GRPO 对比)、视觉语言模型、多智能体拆分与记忆、Qwen 多模态与 MRoPE、RAG;二面深入 ReAct、SFT 与 RLHF 数据、奖励模型、检索选型与 QKV。

2026-09

字节多模态大模型一面二面三面:从 Lora 微调到手撕算法

字节跳动 多模态大模型 一面

字节多模态大模型岗三面连轴面经:一面围绕论文与 RAG 项目、质量过滤模型、LoRA 原理、Transformer 自注意力与 BERT/GPT 差异、RLHF 与 DPO,手撕最长公共子序列;二面拷打多模态训练与 Prompt 验证、数据清洗、CLIP、幻觉与复读机、前馈网络升维降维、LLaMA 版本差异;三面偏开放,聊对大模型结构演进与训练难点的理解。

2026-09

京东 大模型算法岗面经合集 01:PPO/DPO/GRPO 八股、音视频链路与端侧 AI 追问

京东 大模型算法 多轮面试合集

京东大模型算法岗 6 场面试记录:强化学习与微调原理(PPO 与 GRPO 的 KL 约束、DPO 的数据构造)、音视频链路深挖(AAC 与 Opus、WebRTC、3A 算法)、LoRA 参数、RAG 切片与召回优化,末尾手撕 LRU。

2026-09

美团 9.19 笔试 十道 AI 选择题与因子数量题

美团 大模型算法 笔试

美团 9.19 笔试复盘:10 道单选几乎都与 AI 相关,覆盖多 Agent 共享事实、Transformer-XL、ZeRO-3 显存、KMP 与二分比较次数、RLHF 与 PPO、子网掩码和 ViT;编程题为两数相乘后因子数量最大值。

2026-09