跳到主要内容

AI 推理工程

Inference Engineering 大系列 6 卷 18 篇长文——KV Cache、Paged Attention、Guided Decoding、Distributed Training、Post-Training 等 LLM 推理工程化的第一性原理长文,适合 LLM 平台 / SRE / 后端工程师。

Inference Engineering 大系列

副标题:从 KV Cache 到 Post-Training——LLM 推理工程化的第一性原理。 风格:翻译 + 中文工程视角 + 结构化对照表 + 工程师笔记。 来源:2026-09-09 剪藏的 11 篇高质量英文长文(总字数 ~235K),拆解为 6 个子系列。


系列总览

系列主题节点文章数状态
系列-01 · Roadmap9 节点 Inference Engineering 学习路线路线图3 篇 + 1 总览✅
系列-02 · KV CacheKV Cache 第一性原理(显存/延迟/并发)节点 1-23 篇✅
系列-03 · Paged Attention显存浪费 60-80% → <4% 的工程革命节点 3-43 篇✅
系列-04 · Guided Decoding结构化输出:2×2 选型(XGrammar × vLLM/SGLang)节点 5/83 篇✅
系列-05 · Distributed Training单卡 16Ψ bytes → DP → ZeRO → Ray Train节点 73 篇✅
系列-06 · Post-Training从 base 到 instruct:SFT + RLHF/RLVR/PRM新增独立3 篇✅

📑 导航索引(按子系列分卷)

母索引(必读)

系列-01 · Inference Engineering 学习路线图(3 篇)

系列-02 · KV Cache 第一性原理(3 篇)

系列-03 · Paged Attention(3 篇)

系列-04 · Guided Decoding(3 篇)

系列-05 · Distributed Training(3 篇)

系列-06 · Post-Training(3 篇)


🎯 适合谁读

  • LLM 平台 / SRE / 后端工程师:理解 LLM 推理的资源账本(显存、计算、通信)、服务化框架(vLLM/SGLang)、训练范式
  • AI Infra 工程师:从 KV cache 切到 Paged Attention、从 DP 切到 ZeRO/FSDP、从 SFT 切到 RL——工程化 LLM 全栈必备
  • 产品经理 / 技术 Leader:理解“为什么 AI 推理这么贵“、“如何选型框架”、“训练 vs 后训练的钱和效果权衡”

📊 系列画像

  • 总字数:~85K 中文字符 + ~235K 英文字符原文附录
  • 总文件数:20 篇 markdown(6 卷 × 3 篇 + 2 篇总览) + 17 张 SVG 配图
  • 来源素材:@itsmenikhitha / Hamza El-Shafie / SqueezeBits / Suman Debnath / Han Fang + Karthik / @akshay_pachaar
  • 风格定位:工程师视角的“翻译 + 中文工程语境补充“,避免学术综述的抽象,也不只调用 API

📚 关联系列

All Posts

本系列全部文章(19 篇)