面灵AI→

字节 AI Infra 三面:CUDA Graph 与 TP 并行的卡死排查

字节跳动 AI Infra 三面

字节 AI Infra 三面面经,主线是分布式训练与算子开发:CUDA Graph 与 TP 并行同时启用导致卡死的定位过程、Triton/CuTe 这类 DSL 的价值、MoE 训练里 Router Replay 与 EP 并行、滑动窗口 Attention 的确定性反向优化,以及国产 GPU 上的算子 Benchmark 方法。

2026-10

Kimi AI Infra 算法一面

Kimi AI Infra 算法工程师 一面

Kimi AI Infra 算法一面面经,10 问全在分布式训练与 GPU 底层:DeepEP 两种模式取舍、Ulysses 与 Ring Attention 对比、DCP 分片注意力、Online Softmax 与 Blackwell 架构演进。

2026-10

Kimi AI Infra 算法一面

Kimi AI Infra 算法工程师 一面

Kimi AI Infra 算法一面面经,10 问全在分布式训练与 GPU 底层:DeepEP 两种模式取舍、Ulysses 与 Ring Attention 对比、DCP 分片注意力、Online Softmax 与 Blackwell 架构演进。

2026-10

快手 AI Infra 一面面经:Attention 算子优化、prefill 与 decode 调度及量化

快手 AI Infra 一面

快手 AI Infra 一面面经:围绕 Attention 重构与模型部署追问,考察 Triton 算子、profile 与 Roofline 分析、prefill 与 decode 调度、线性注意力,以及 AWQ 与 W8A16。

2026-09

快手 AI Infra 一面面经(同场重复投稿):Attention 算子优化、prefill 与 decode 调度及量化

快手 AI Infra 一面

快手 AI Infra 一面面经(同场重复投稿,题目与另一篇相同):围绕 Attention 重构、Triton 算子、profile 与 Roofline、prefill 与 decode 调度、线性注意力、AWQ 与 W8A16 追问。

2026-09