如果你学习推理基础设施,你将永远不会失业。
阶段 1:系统基础C/C++ 或 Rust 基础、Python 性能、Linux、内存层次结构、CPU 与 GPU 执行。
阶段 2:GPU 架构基础CUDA 核心、张量核心、VRAM、内存带宽、SM 占用率、nvidia-smi 分析。
阶段 3:Transformer 推理剖析预填充与解码阶段、KV 缓存增长、注意力内存计算、算术强度。
阶段 4:服务引擎vLLM、SGLang、TGI:连续批处理、PagedAttention、调度、吞吐量与延迟。
阶段 5:KV 缓存优化前缀缓存、分块预填充、KV 量化、缓存卸载、多轮重用。
阶段 6:量化和压缩FP8、INT8、AWQ、GPTQ、稀疏性;衡量质量下降与速度提升的对比。
阶段 7:推测解码与并行性草稿-目标模型、Medusa 头、张量与管道并行权衡。
阶段 8:内核级优化Triton 内核、FlashAttention、CUDA 图、操作融合、Nsight 分析。
阶段 9:分布式推理多节点服务、NVLink 和 InfiniBand、解耦预填充/解码、MoE 专家并行。
阶段 10:自动扩展与经济学基于队列的 KEDA 扩展、冷启动、现货 GPU、每令牌成本、MFU 利用率。
阶段 11:网关、路由与可靠性AI 网关、回退链、速率限制、TTFT 和 ITL SLO、观测性、混沌测试。
阶段 12:作品集与基准自托管集群、发布的延迟/吞吐量/成本基准、内核优化文章。
大多数人停留在看教程的阶段。
建设者们会吃到ai红利。
(收藏它)