算子优化 面试题
共 5 篇真实面经 · 涵盖 字节跳动 / 某互联网大厂 / 百度 / 快手 / 足下科技 等 5 家公司
字节 AI Infra 三面:CUDA Graph 与 TP 并行的卡死排查
字节 AI Infra 三面面经,主线是分布式训练与算子开发:CUDA Graph 与 TP 并行同时启用导致卡死的定位过程、Triton/CuTe 这类 DSL 的价值、MoE 训练里 Router Replay 与 EP 并行、滑动窗口 Attention 的确定性反向优化,以及国产 GPU 上的算子 Benchmark 方法。
AI Infra 求职劝退贴:面试官建议与个人复盘
AI Infra 方向求职劝退贴:作者面试某大厂日常实习后,记录面试官给出的五条建议(岗位极度内卷、算子被 AI 冲击、国产芯片迁移难等),并复盘纯 infra 岗全挂的原因、可行的替代方向与选路自查清单。
百度大模型算法岗面经合集:GRPO 训练与算子优化
百度大模型算法岗两场面试:一面围绕算子优化方案与效果验证,追问 GEMM 矩阵尺寸、GPU 架构与 Tensor Core 精度;二面聚焦 PPO、GRPO 与 DPO 的区别、持续学习分类,以及 8 卡 A100 的 GRPO 加速优化。
快手 AI Infra 一面面经:Attention 算子优化、prefill 与 decode 调度及量化
快手 AI Infra 一面面经:围绕 Attention 重构与模型部署追问,考察 Triton 算子、profile 与 Roofline 分析、prefill 与 decode 调度、线性注意力,以及 AWQ 与 W8A16。
足下科技高性能计算一面凉经
足下科技高性能计算一面凉经,处女面。面试以场景题为主、几乎没问项目,作者个人项目基于Ampere架构自评偏玩具。面试官提示该岗位不需要做算子、更偏高层优化,作者复盘认为算子优化复用性强且难超越现有实现。