从云原生走向 AI 原生:一套面向未来的架构方法论 → 阅读《AI 原生基础设施》

工作负载实践

草稿

前三部分给出了机制(数据平面)、秩序(控制面)与评估框架(决策轴)。本部分让它们经受真实负载的检验:负载不同,所有权衡的答案都不同。各章按“由系统观到物理、由单卡到多节点”排列:

  • 工作负载系统观是序章:训练是同步问题、推理是尾延迟问题、多节点推理继承训练的互连约束,但 SLO 换成了请求路径;三个视角框定后面各章要解的方程;
  • LLM 推理的物理层先算清两笔账:解码受带宽屋顶线约束、KV cache 是容量货币。它是后面各章的物理地基,也解释了为什么推理与训练需要完全不同的调度语义;
  • vLLM 环境准备最小示例是动手序章:在 macOS 上原生编译或用 Docker 镜像备好环境,再用 Python API、Batch 推理两步跑通“能运行、能并发”的最小闭环,Apple Silicon 的 CPU 限制反而让每一步的物理约束清晰可见;
  • vLLM 推理加速回答“为什么快”:从 KV Cache 与显存瓶颈出发,拆解分层架构、FlashAttention、PagedAttention、动态批处理,并对比 vLLM 与 Transformers、SGLang、TensorRT-LLM 的架构差异;
  • vLLM在物理层之上引入治理视角:并发、批处理与显存水位线如何同时决定吞吐与尾延迟,平台如何定义可评审的推理配额与验收指标;
  • vLLM serve补上服务化一环:用 vLLM 库 + Uvicorn 绕过 macOS 上 CLI 的兼容性问题,从启动日志逐段读出一次请求的生命周期,看清自动批处理与动态调度发生在哪里;
  • vLLM 生产化部署从单实例走到生产栈:多副本、会话感知路由与全链路可观测,用官方参考实现 production-stack 一次立起三件套;
  • vLLM 生产调优补齐工程参数面:并行策略(TP/PP)、调度参数与量化取舍,附 Kubernetes 部署模板、压测方法与常见故障排查表;
  • vLLM 源码结构切到代码视角:梳理 vLLM 仓库的分层目录与核心模块,并附内部机制(调度、KV Cache、PagedAttention 等)的深入路线图;
  • GPU 推理自动伸缩让副本数随负载呼吸:并发与队列指标怎么选、缩容到零的四层冷启动账怎么算,附零成本的 KEDA 实验;
  • PyTorch转到训练侧:训练要的是稳定吞吐而非瞬时峰值,调度语义(gang、抢占、checkpoint)与“有效产出”才是正确的验收对象;
  • 多节点训练实验环境解决“去哪里练”:用一台双卡实例模拟双节点、个位数美元开云上真双节点、免费微实例走通 Slurm,把 rank 映射与跨节点通信这两类单机盲区真实暴露出来;
  • Ray/KubeRay 与拓扑约束把场景推到多卡多节点:单卡经验失效,拓扑约束必须从“偏好”升级为“可验收的硬约束”,正好呼应互连与集合通信的物理结论。

读完本部分,可观测与验收不再是事后补救,而是顺理成章的下一步:把每类负载的物理特性转成可运营指标。

章节目录

工作负载系统观

草稿

训练是同步问题,任何一个环节都能成为主导;推理是尾延迟问题,高利用率与违约的 SLO 可以并存;把平台拆成模型、服务、加速器、数据、控制五个平面之后,Kubernetes 才开始像 AI 应用平台。

LLM 推理的物理层

草稿

在讨论推理平台的资源治理之前,先算清物理账:预填充与解码为何受不同的屋顶线约束、KV cache 的容量公式与并发上限、连续批处理与分页 KV 的设计思想、分块预填充对尾延迟的意义,以及推理服务与共享/配额层的配合公式。

vLLM 环境准备

草稿

在 macOS Silicon 上原生编译安装 vLLM(含兼容性修复与故障排查),并构建 CPU Docker 镜像,为推理实验准备一致环境。

vLLM 最小示例

草稿

用 Transformers 与 Flask 跑通最小推理并包一层 HTTP 服务,再通过三条并发请求体验 Batch 推理的原理、优势与限制。

vLLM 推理加速

草稿

深入剖析 vLLM 推理加速的工程原理:分层架构、KV Cache、PagedAttention、FlashAttention 与动态批处理,并对比主流推理引擎的架构差异。

vLLM

草稿

从并发、KV cache 与显存形态解释推理为何放大共享问题,并给出可治理的部署与验收思路。

vLLM serve

草稿

介绍如何用 vLLM serve 启动生产级推理服务,自动 Batch 合并与动态调度,兼容 OpenAI API,适配 macOS 环境。

vLLM 生产化部署

草稿

从单个 vLLM 实例到生产推理栈:用官方参考实现 production-stack 在 Kubernetes 上部署多副本引擎与请求路由器,理解会话感知路由如何放大 KV 缓存复用,用 Grafana 面板验收 TTFT 与缓存命中率,并为自动伸缩与 PD 分离打好基础。

vLLM 生产调优

草稿

vLLM 生产环境的部署与性能调优:并行策略(TP/PP)、调度参数、量化与 Speculative Decoding,附 Kubernetes 部署模板、常见故障排查表及与 RAG 框架的集成。

vLLM 源码结构

草稿

系统梳理 vLLM 项目的目录结构与核心源码分布,帮助开发者快速定位关键模块,并附内部机制深入主题的撰写路线图。

GPU 推理自动伸缩

草稿

推理负载有潮汐,副本数不能写死:比较 Knative KPA、HPA 与 KEDA 三种伸缩机制的指标语义,理解为什么 GPU 推理要用队列深度而不是 CPU 利用率,算清缩容到零的四层冷启动账,并用一个零成本的 KEDA 实验跑通 0 到 1 到 0 的完整周期。

PyTorch

草稿

训练更依赖稳定吞吐与通信拓扑,讨论抢占、弹性与 checkpoint 如何影响调度器与数据平面策略。

多节点训练实验环境

草稿

没有集群也能练真功夫:用一台双卡实例模拟双节点 DDP、在云上开真实双节点、本地用 Gloo 验证控制流、以及用云上工具链搭 Slurm 集群。四条成本从 0 到几美元的路线,帮你练会单机永远学不到的 rank 映射与跨节点通信。

Ray 与拓扑

草稿

多卡/多节点场景下,GPU 调度从资源数量升级为拓扑与通信主导,需关注资源表达与可用性验收。

创建于 2026/01/10 更新于 2026/08/30 2078 字 阅读约 5 分钟