一、简单说是啥
H100 是 NVIDIA 2022 年 3 月发布的数据中心 GPU,属于 Hopper 架构(继承自 Volta → Ampere → Hopper 这条数据中心线)。它不是给你打游戏用的——GeForce RTX 那种是消费级,H100 是插在服务器机架里、用来训练和推理大模型的专用加速卡。
从 2022 到现在,它是 OpenAI、Meta、Stability AI 这些公司训练大模型的底层算力基座,也可以说是"这一波 AI 浪潮的物理载体"。
一块 H100 SXM 版本官方定价约 3 万美元,但在 2023–2024 供不应求的时候,实际交易价格能被炒到 4 万甚至更高。
二、基本参数
| 参数 | H100 SXM5 | 说明 |
|---|---|---|
| 架构 | Hopper (GH100) | TSMC 4N 工艺,800 亿晶体管 |
| 显存 | 80 GB HBM3 | 极高带宽内存 |
| 显存带宽 | 3.35 TB/s | 决定推理速度的关键指标 |
| FP64 | 34 TFLOPS | 双精度,科学计算用 |
| FP32 | 67 TFLOPS | 单精度 |
| TF32 Tensor Core | 989 TFLOPS | AI 训练常用 |
| BF16 / FP16 Tensor Core | 1,979 TFLOPS | AI 训练主力精度 |
| FP8 Tensor Core | 3,958 TFLOPS | 本代新增,Transformer 神器 |
| NVLink 带宽 | 900 GB/s | 多卡互联,比 PCIe 快近一个数量级 |
| 功耗(TDP) | 700 W | 需要液冷或强力风冷 |
| 主机接口 | PCIe Gen5 x16 |
注意:官方 datasheet 数字都是"启用稀疏(sparsity)后的值",实际生产工作负载大多用的是密集(dense)值,是这个数字的一半。看性能数字时留个心眼。
三、"好在哪":几个关键设计
这是回答的重点。H100 并不是"比 A100 快 2 倍"这么简单——它是专门为 Transformer 架构调过的芯片,而 Transformer 恰好就是所有大语言模型的骨架。这个"押注"在 2022 年发布时并不是稳赢的,回头看非常准。
1. Transformer Engine + FP8:核心杀手锏
Transformer Engine 在训练中会逐层动态切换 FP8 和 FP16 精度——计算密集的层用 FP8 拉吞吐,对精度敏感的层用 FP16 保住模型质量。这个"自动混合精度"以前需要工程师手工调,现在硬件+编译器帮你搞定。
FP8(8 位浮点)比 FP16 少一半的显存占用和数据搬运量,理论上算力翻倍。这一项就带来了对 A100 大约 3–4 倍的 GPT-3 训练加速,以及在超大模型推理上最高约 30 倍的吞吐提升。
对比:A100 那一代还没有 FP8,只有 FP16/BF16。同样跑 Transformer,A100 就是要多搬一倍数据、多花一倍显存。
2. HBM3 显存 + 3.35 TB/s 带宽
大模型推理的瓶颈不是算力,而是显存带宽——每生成一个 token,都要把整个模型权重从显存搬到计算单元一遍。H100 的显存带宽是 A100 的 1.6 倍(3.35 vs 2.0 TB/s),这直接翻译成推理延迟的降低。
80 GB 显存也是一个门槛:一个 70B 参数的模型用 FP16 存需要 ~140 GB,需要 2 张 H100;用 FP8 存刚好塞进 1 张。这个"塞得下"和"塞不下"的界限,直接决定了部署成本。
3. NVLink 4 + NVLink Switch:让多卡像一张卡
单卡再强,训练 GPT-4 这种规模的模型也远远不够。H100 SXM 通过 NVLink 4.0 让 GPU 之间以 900 GB/s 通信,延迟极低——这个数字比 PCIe Gen5 的 128 GB/s 高了 7 倍。
配合 NVLink Switch System,一整个 DGX H100(8 卡)里的任何两张卡都能全速直连,256 卡的 DGX SuperPOD 里的 GPU 也几乎可以看作一个巨大的共享显存池。这是训练超大模型能"横向扩展"的物理前提。
4. MIG(Multi-Instance GPU):一卡当七卡用
MIG 可以把一块 H100 划成最多 7 个完全隔离的 GPU 实例,每个实例有独立的 CUDA 核心、Tensor 核心、L2 缓存和 HBM 内存,硬件级别隔离。
这对推理服务和多租户场景特别有用:一张卡卖给 7 个客户,QoS 独立、不会互相影响。云厂商用得很多。
5. Confidential Computing(机密计算)
H100 是首款支持**基于 GPU 的可信执行环境(TEE)**的数据中心 GPU。模型权重、输入数据在 GPU 内运算时对宿主机、云厂商乃至虚拟化层都是不可见的。对金融、医疗、政府这种合规敏感场景是刚需——你们做合规业务应该能理解这个价值。
6. 生态才是真正的护城河
抛开硬件本身:CUDA、cuDNN、TensorRT、NCCL、Triton、Megatron-LM、DeepSpeed……几乎所有主流 AI 训练和推理框架都是围绕 NVIDIA GPU 深度优化的,而 H100 又是过去三年里被优化得最彻底的一代。AMD 的 MI300X 显存更大(192 GB),理论算力也不差,但 ROCm 软件栈的成熟度和生态仍在追赶。
四、几种形态
一张 H100 不是"一个东西",有几个变体:
- H100 SXM5:完整版,700W,NVLink 全速,用在 NVIDIA DGX / HGX 服务器里。训练大模型基本都是这个。
- H100 PCIe:标准 PCIe 卡形态,350W,无 NVLink(只有 PCIe),性能约为 SXM 的 60–70%。塞进普通服务器用的。
- H100 NVL:两张 H100 用 NVLink 4 桥接的双卡方案,共 188 GB HBM3,主要面向大模型推理场景,比如 GPT-3、LLaMA-2 这类。
五、2026 年这个时间点,H100 还香吗
这是很多人会关心的问题。NVIDIA 在 H100 之后又出了:
- H200(2024):同一个 GH100 计算 die,只是把显存换成了 141 GB HBM3e、4.8 TB/s——算力完全一样,"多了间大房子"
- B200(Blackwell,2024/2025):双 die 封装、10 TB/s die-to-die 互连、192 GB HBM3e、8 TB/s 带宽,原生支持 FP4 精度(推理再翻倍)
- B300(Blackwell Ultra,2025 年底):288 GB 显存,为长上下文推理优化
现状(截至 2026 中):
- 训练:Blackwell 相对 Hopper 大约有 2.2–2.5 倍的每卡性能提升;推理:B200 在大规模服务场景下"每 token 成本"能比 H100 降低约 7 倍
- H100 依然是四款里最广泛可用、软件栈最成熟的一款;但 NVIDIA 官方已表示 H100 被 H200 取代,现有库存还在卖,新订单会引导到 H200
- 业内常见的一种做法是"混合部署":Blackwell 用于生产环境的推理(吞吐红利明显),Hopper(H100/H200)用来做训练和批处理,因为它更便宜、更容易拿到货
H100 的历史地位不是"最快的 GPU"(那个头衔早就被 B200 拿走了),而是"押中了 Transformer 这个赌注、并在 LLM 元年成为事实上的算力标准"的那款芯片。它把 FP8、Transformer Engine、HBM3、NVLink 这几个当时看还有点激进的选择组合到了一起,恰好赶上 ChatGPT 引爆的算力需求——从 2022 到 2024 年,谁能拿到 H100,谁就能训练前沿模型。今天它仍然是训练的性价比之选和生态最完备的那款 GPU。
如果你是想搞清楚"为什么最近几年 NVIDIA 股价那么疯",答案基本就是这块芯片,加上后面的 H200/B200/B300。
除非注明,否则均为李锋镝的博客原创文章,转载必须以链接形式标明本文链接

文章评论
装机能上嘛,配个电脑200w,哈哈