上手篇:从零到第一块可调度的 GPU
草稿
本部分是全书的高速入口,目标是回答一个问题:如何零成本起步,最终让一块 GPU 从“云控制台里的一个选项”变成“Kubernetes 里一行可调度的资源请求”。
每一章都是一块垫脚石,踩在一个真实痛点上:
- 准备 GPU 运行环境 讲清驱动与 CUDA 的版本规则:GPU 环境里一半的故障来自“驱动、工具链、镜像各说各话”,这一章给你统一的判断框架,实验在 Colab 免费 T4 上完成。
- 从免费开始 划定免费与付费的边界:Colab 能学到哪里、假 GPU 怎么零成本学调度、什么时候才值得租云上的卡,以及付费后的选型与止损纪律。
- 用 Docker 运行 GPU 工作负载 跨过第一道真正的工程门槛:GPU 容器不是普通容器加一个参数,理解设备注入机制后,你才能读懂后面所有 Kubernetes 方案在做什么。从本章起需要一块可自由安装软件的 GPU。
- 单机 Kubernetes 与 GPU Operator 把前面收束成平台形态:
nvidia.com/gpu: 1出现在节点可分配资源里,GPU 从“机器的部件”变成“集群的资源”。
每章末尾的动手实验遵循统一格式(目标 → 前置条件与成本 → 步骤 → 验证清单 → 原理速览 → 清理)。成本结构是阶梯式的:前两章的实验在 Google Colab 上零成本完成;后两章需要本地 GPU 或按小时租用的实例(没有卡也可以先读后练,或用GPU 实验室的假 GPU 关卡零成本练调度)。付费实验的预算控制在几美元以内。
先动手,再补课
上手篇刻意压低了原理密度,只保留“动手必需”的最小解释。如果你在某个步骤停下来问“为什么是这样”,答案几乎都在认识机器与问题(硬件与设备模型)和GPU 软件栈与容器化(注入机制)两部分;而“怎么分卡、怎么治集群”的系统答案,在数据平面与控制面。
章节目录
草稿
理解 GPU 软件栈的分层与版本规则,学会用最少的命令验证一台 GPU 机器的健康状态,并掌握“容器时代宿主机只需要驱动”这一关键事实,为 GPU 容器与 Kubernetes 接入扫清环境障碍。
草稿
用 Google Colab 的免费 GPU 完成性能基线实验,认清免费路径的能力边界(能学 CUDA 与单卡,不能学 Docker 与 Kubernetes),用假 GPU 零成本学习调度,并在真正需要付费时掌握选型、计费与止损纪律。
草稿
理解 GPU 容器与普通容器的本质差别,安装配置 NVIDIA Container Toolkit,掌握 --gpus 语义与基础镜像选择,跑通第一个 GPU 容器并建立单卡性能的量级直觉。
草稿
在单机 Kubernetes 上部署 GPU Operator,把上一章的 GPU 容器升级为可调度的 Pod:理解 device plugin 的上报链路,跑通第一个请求 nvidia.com/gpu 的 Pod,并诚实界定你此刻拥有与尚未拥有的平台能力。