AI Infra 学习路线 v2.0(2026 版)
本文迁移自 知识星球原文,保留原始发布日期;作者统一署名 determine。
在 AIInfraGuide 四大模块骨架之上,融合一线 AI Infra 工程师能力模型(OpenAI / Anthropic / NVIDIA / 字节大模型团队视角),补齐 系统编程、网络、编译器、云原生平台、生产服务、Agent Infra、成本工程 七个缺口。
0. 路线定位
AI Infra 的本质
不是 CUDA + GPU,而是 AI + HPC + 分布式系统 + 云基础设施 的交叉领域:

目标画像

---
1. 能力模型总览
达到顶级 AI Infra 工程师需要的能力清单与重要性:

2. 五阶段学习计划(总周期 24 个月)
阶段顺序经过重排:先推理后训练。原因:推理岗位需求大、上手快、能快速建立正反馈;训练 Infra 岗位少且集中在头部公司。
---
Phase 0:GPU 软件工程师(0–3 个月)

Phase 1:Kernel 工程师(3–6 个月)

---
Phase 2:LLM Infra 工程师(6–12 个月)

---
Phase 3:Senior Infra——分布式训练(12–18 个月)

---
Phase 4:顶级 Infra 工程师(18–24 个月)

---
3. 知识模块地图(八大模块)
在原四大模块基础上增补为八大模块,与原路线的对照关系:

各模块与阶段映射

---
4. 源码阅读路线(按序精读,不要乱读)

阅读方法:每个项目先跑通最小 demo → 用 gdb/日志单步追一条数据流 → 画时序图 → 写笔记回答验收问题。
---
5. 岗位方向路径对照

求职策略与 AIInfraGuide 面试宝典一致:推理方向岗位最多,训练方向只在大厂。但若目标顶级团队(OpenAI/Anthropic/NVIDIA),训练 + 平台 + 成本工程是差异化竞争力。
---
6. 全路线检查清单(Checklist)


---
7. 资源清单
书籍

课程

论文(按阶段)
- 算子:FlashAttention 1/2/3、FP8 Formats
- 训练:ZeRO 系列、Megatron-LM、Ring Attention、Ulysses、Chinchilla
- 推理:PagedAttention、Splitwise、SmoothQuant、AWQ、Speculative Decoding、Medusa
- 平台:Ray、Volcano、Singularity(NVIDIA 推理服务)
跟踪渠道
arXiv(cs.DC/cs.LG)、SemiAnalysis、NVIDIA 官方博客、Meta/Google/字节/Anthropic Infra 博客。
---
8. v1.0 → v2.0 变化总结

上一篇:电装(DENSO)一面面经 + 二面备考总纲+入职前学习准备与安排
评论与交流
评论管理 ↗