元戎启行 OC 了,讲讲我的来时路(AI Infra 方向求职复盘)
- 结果
- OC
- 时间
- 2026-10
- 来源
- 牛客网
《核心观点》
- 求职第一步不是刷题,而是确定目标。作者锁定智驾行业的理由是:公司在这个方向有技术护城河、岗位在公司核心链条上、有技术纵深可积累、公司舍得投研发资源;明确说不想为了进大厂去做边缘业务或没有技术积累的工作。
- 面试不只是拿 offer 的手段,也是快速获取信息的方式。看再多 JD 和员工分享,理解都是未被验证的;跟面试官聊 45 分钟获得的信息,可能比网上看一周更有价值。
- 作者最终锁定 AI Infra 方向,逻辑是:AI 的发展正从大模型竞争转向应用规模化落地,对基础设施的需求很大;AI Infra 门槛高(要懂软件又要懂硬件)、竞争者少,机会反而更多。
- AI Infra 是个综合领域,至少分四块:AI 编译器与算子优化、分布式训练框架、推理引擎与部署优化、分布式调度与平台工程。不同方向能力要求不同——元戎的 AI Infra 岗偏分布式训练和车端芯片部署,重点考察训练加速与推理部署。
- 看面经的价值在于「反向定位短板」:可以直接了解岗位考察重点、公司看重什么、自己差在哪,从而有针对性地准备项目而不是临时背八股。
- 作者的判断是这类岗位不光考你知不知道,还重点考你做没做过、能不能讲清楚,所以项目梳理是关键。
《参考解析》
这份复盘的可用之处在于「先定方向、再定准备」这个顺序。 很多人的秋招是从刷题开始的,题目刷完才发现投的岗位和自己准备的方向不匹配。作者的做法是反过来的:先通过 JD、员工分享、面经把目标岗位的考察重点摸出来,再倒推要补什么。这个顺序对技术方向差异大的岗位尤其重要——同样叫「后端」,做基础架构和做业务系统的考察点几乎不重叠。
AI Infra 四条线各自在考什么,值得展开记一下。AI 编译器与算子优化考图优化、算子融合、算子实现(CUDA/Triton)、性能分析工具(nsight、profiler);核心能力是能读懂计算图并判断瓶颈在哪。分布式训练框架考数据并行/张量并行/流水线并行的适用场景与通信开销、集合通信原语(AllReduce、AllGather)、显存优化技术(ZeRO、重计算、混合精度、offload),以及通信与计算的 overlap;这条线对并行计算和网络(NVLink、RDMA)的理解要求高。推理引擎与部署优化考量化和精度校准、KV cache 与批调度(continuous batching、PagedAttention)、投机解码、算子融合与图捕获,以及服务侧的吞吐/延迟权衡(TTFT、TPOT)。分布式调度与平台工程考集群调度(K8s、GPU 拓扑感知、gang scheduling)、多租户与配额、故障容错与断点续训、可观测性。元戎偏训练加速和车端芯片部署,所以准备的落点应该在「训练侧的并行与通信优化」和「推理侧在受限算力上的部署优化(量化、算子适配、内存带宽)」这两块。
「用面试检验认知」这个做法可以复制。 具体操作上是:把面试当成一次有反馈的调研——结束后立刻记录面试官反复追问的点、自己答不上来的点、以及对方介绍的团队在做什么;几场下来就能看出这个岗位真正在意什么能力,而不是靠猜。作者也提到前期没有一上来疯狂刷题,因为目的是先拿到 offer、先进入这个方向。这个取舍不一定适合所有人(算法岗的笔试和手撕代码仍需硬功夫),但**「先把岗位摸清再决定时间怎么分配」这个原则是通用的**。
心态部分值得原样保留一句:不要因为暂时没有结果,就否定前面做过的准备;慢一点没关系,只要还在往前走。作者的准备节奏是每天做一点——补一点知识、看一点面经、参加一场面试,回头看才发现是这些琐碎的准备把人推到了终点。这在秋招后半程(身边人陆续 OC 的时候)是很有用的心理锚点。