分布式训练 面试题
共 8 篇真实面经 · 涵盖 字节跳动 / 元戎启行 / 滴滴 / Kimi / 腾讯 等 6 家公司
字节 AI Infra 三面:CUDA Graph 与 TP 并行的卡死排查
字节 AI Infra 三面面经,主线是分布式训练与算子开发:CUDA Graph 与 TP 并行同时启用导致卡死的定位过程、Triton/CuTe 这类 DSL 的价值、MoE 训练里 Router Replay 与 EP 并行、滑动窗口 Attention 的确定性反向优化,以及国产 GPU 上的算子 Benchmark 方法。
元戎启行 OC 了,讲讲我的来时路(AI Infra 方向求职复盘)
一位中下 9 本候选人的元戎启行 AI Infra 方向求职复盘:7 月中旬投递、8 月初一二面、9 月初 HR 面、9 月底 OC。核心方法不是一上来刷题,而是先把目标行业和目标岗位弄明白——通过看 JD、看员工分享、用面试本身检验认知,再针对岗位考察重点准备项目梳理。
滴滴 AI Infra 算法岗一二面面经
滴滴 AI Infra 算法岗一二面:一面考 Attention 优化、KV Cache 显存计算与 ZeRO 分片;二面深挖流水线调度、分布式 Decode 与 PyTorch 编译栈。
滴滴 AI Infra 算法岗一二面面经
滴滴 AI Infra 算法岗一二面面经:一面考 Attention 架构优化、KV Cache 管理、MLA 与线性注意力、GQA 显存估算与 DeepSpeed ZeRO,二面追问调度细节并手撕 CUDA 算子。
Kimi AI Infra 算法一面
Kimi AI Infra 算法一面面经,10 问全在分布式训练与 GPU 底层:DeepEP 两种模式取舍、Ulysses 与 Ring Attention 对比、DCP 分片注意力、Online Softmax 与 Blackwell 架构演进。
Kimi AI Infra 算法一面
Kimi AI Infra 算法一面面经,10 问全在分布式训练与 GPU 底层:DeepEP 两种模式取舍、Ulysses 与 Ring Attention 对比、DCP 分片注意力、Online Softmax 与 Blackwell 架构演进。
腾讯混元 AI Infra 一面
腾讯混元 AI Infra 一面面经,围绕大模型训练的四种并行展开:TP 的切分维度与通信、集合通信量怎么算与何时判定通信瓶颈、DP 与 TP 的取舍及训练与推理的差异、PP 的 Stage 划分与 Bubble,以及 CP 在长上下文场景下的跨卡 Attention。
快手 AI Infra 算法岗二面面经:分布式训练与推理、高并发系统设计
快手 AI Infra 算法岗二面面经:从分布式训练解决的问题、流水线并行的实现逻辑与短板,问到分布式推理的痛点、离线推理的吞吐优化手段、时延与吞吐的关系,并追问组 batch 重构会不会引入训练或推理的随机性;后半段转向 Java/MySQL 基础与 12306 高并发架构设计,手撕链表两数相加。