李锋镝的博客

  • 首页
  • 时间轴
  • 说说
  • 每日心情
  • Now
  • 系列文章
  • 论坛
  • 左邻右舍
    • 左邻右舍
    • 博友圈
  • 留言
    • 留言
    • 走心评论
  • 关于
    • 关于我
    • 网站地图
    • 网站统计
    • 另一个网站
    • 我的导航站
    • 赞助
  • 🚇开往
Destiny
自是人生长恨水长东
  1. 首页
  2. AI
  3. 正文

英伟达 H100 是啥,到底好在哪?

2026年8月26日 约 1,846 字7 分钟 12 0 1

一、简单说是啥

H100 是 NVIDIA 2022 年 3 月发布的数据中心 GPU,属于 Hopper 架构(继承自 Volta → Ampere → Hopper 这条数据中心线)。它不是给你打游戏用的——GeForce RTX 那种是消费级,H100 是插在服务器机架里、用来训练和推理大模型的专用加速卡。

从 2022 到现在,它是 OpenAI、Meta、Stability AI 这些公司训练大模型的底层算力基座,也可以说是"这一波 AI 浪潮的物理载体"。

一块 H100 SXM 版本官方定价约 3 万美元,但在 2023–2024 供不应求的时候,实际交易价格能被炒到 4 万甚至更高。

二、基本参数

参数H100 SXM5说明
架构Hopper (GH100)TSMC 4N 工艺,800 亿晶体管
显存80 GB HBM3极高带宽内存
显存带宽3.35 TB/s决定推理速度的关键指标
FP6434 TFLOPS双精度,科学计算用
FP3267 TFLOPS单精度
TF32 Tensor Core989 TFLOPSAI 训练常用
BF16 / FP16 Tensor Core1,979 TFLOPSAI 训练主力精度
FP8 Tensor Core3,958 TFLOPS本代新增,Transformer 神器
NVLink 带宽900 GB/s多卡互联,比 PCIe 快近一个数量级
功耗(TDP)700 W需要液冷或强力风冷
主机接口PCIe Gen5 x16

注意:官方 datasheet 数字都是"启用稀疏(sparsity)后的值",实际生产工作负载大多用的是密集(dense)值,是这个数字的一半。看性能数字时留个心眼。

三、"好在哪":几个关键设计

这是回答的重点。H100 并不是"比 A100 快 2 倍"这么简单——它是专门为 Transformer 架构调过的芯片,而 Transformer 恰好就是所有大语言模型的骨架。这个"押注"在 2022 年发布时并不是稳赢的,回头看非常准。

1. Transformer Engine + FP8:核心杀手锏

Transformer Engine 在训练中会逐层动态切换 FP8 和 FP16 精度——计算密集的层用 FP8 拉吞吐,对精度敏感的层用 FP16 保住模型质量。这个"自动混合精度"以前需要工程师手工调,现在硬件+编译器帮你搞定。

FP8(8 位浮点)比 FP16 少一半的显存占用和数据搬运量,理论上算力翻倍。这一项就带来了对 A100 大约 3–4 倍的 GPT-3 训练加速,以及在超大模型推理上最高约 30 倍的吞吐提升。

对比:A100 那一代还没有 FP8,只有 FP16/BF16。同样跑 Transformer,A100 就是要多搬一倍数据、多花一倍显存。

2. HBM3 显存 + 3.35 TB/s 带宽

大模型推理的瓶颈不是算力,而是显存带宽——每生成一个 token,都要把整个模型权重从显存搬到计算单元一遍。H100 的显存带宽是 A100 的 1.6 倍(3.35 vs 2.0 TB/s),这直接翻译成推理延迟的降低。

80 GB 显存也是一个门槛:一个 70B 参数的模型用 FP16 存需要 ~140 GB,需要 2 张 H100;用 FP8 存刚好塞进 1 张。这个"塞得下"和"塞不下"的界限,直接决定了部署成本。

3. NVLink 4 + NVLink Switch:让多卡像一张卡

单卡再强,训练 GPT-4 这种规模的模型也远远不够。H100 SXM 通过 NVLink 4.0 让 GPU 之间以 900 GB/s 通信,延迟极低——这个数字比 PCIe Gen5 的 128 GB/s 高了 7 倍。

配合 NVLink Switch System,一整个 DGX H100(8 卡)里的任何两张卡都能全速直连,256 卡的 DGX SuperPOD 里的 GPU 也几乎可以看作一个巨大的共享显存池。这是训练超大模型能"横向扩展"的物理前提。

4. MIG(Multi-Instance GPU):一卡当七卡用

MIG 可以把一块 H100 划成最多 7 个完全隔离的 GPU 实例,每个实例有独立的 CUDA 核心、Tensor 核心、L2 缓存和 HBM 内存,硬件级别隔离。

这对推理服务和多租户场景特别有用:一张卡卖给 7 个客户,QoS 独立、不会互相影响。云厂商用得很多。

5. Confidential Computing(机密计算)

H100 是首款支持**基于 GPU 的可信执行环境(TEE)**的数据中心 GPU。模型权重、输入数据在 GPU 内运算时对宿主机、云厂商乃至虚拟化层都是不可见的。对金融、医疗、政府这种合规敏感场景是刚需——你们做合规业务应该能理解这个价值。

6. 生态才是真正的护城河

抛开硬件本身:CUDA、cuDNN、TensorRT、NCCL、Triton、Megatron-LM、DeepSpeed……几乎所有主流 AI 训练和推理框架都是围绕 NVIDIA GPU 深度优化的,而 H100 又是过去三年里被优化得最彻底的一代。AMD 的 MI300X 显存更大(192 GB),理论算力也不差,但 ROCm 软件栈的成熟度和生态仍在追赶。

四、几种形态

一张 H100 不是"一个东西",有几个变体:

  • H100 SXM5:完整版,700W,NVLink 全速,用在 NVIDIA DGX / HGX 服务器里。训练大模型基本都是这个。
  • H100 PCIe:标准 PCIe 卡形态,350W,无 NVLink(只有 PCIe),性能约为 SXM 的 60–70%。塞进普通服务器用的。
  • H100 NVL:两张 H100 用 NVLink 4 桥接的双卡方案,共 188 GB HBM3,主要面向大模型推理场景,比如 GPT-3、LLaMA-2 这类。

五、2026 年这个时间点,H100 还香吗

这是很多人会关心的问题。NVIDIA 在 H100 之后又出了:

  • H200(2024):同一个 GH100 计算 die,只是把显存换成了 141 GB HBM3e、4.8 TB/s——算力完全一样,"多了间大房子"
  • B200(Blackwell,2024/2025):双 die 封装、10 TB/s die-to-die 互连、192 GB HBM3e、8 TB/s 带宽,原生支持 FP4 精度(推理再翻倍)
  • B300(Blackwell Ultra,2025 年底):288 GB 显存,为长上下文推理优化

现状(截至 2026 中):

  • 训练:Blackwell 相对 Hopper 大约有 2.2–2.5 倍的每卡性能提升;推理:B200 在大规模服务场景下"每 token 成本"能比 H100 降低约 7 倍
  • H100 依然是四款里最广泛可用、软件栈最成熟的一款;但 NVIDIA 官方已表示 H100 被 H200 取代,现有库存还在卖,新订单会引导到 H200
  • 业内常见的一种做法是"混合部署":Blackwell 用于生产环境的推理(吞吐红利明显),Hopper(H100/H200)用来做训练和批处理,因为它更便宜、更容易拿到货

H100 的历史地位不是"最快的 GPU"(那个头衔早就被 B200 拿走了),而是"押中了 Transformer 这个赌注、并在 LLM 元年成为事实上的算力标准"的那款芯片。它把 FP8、Transformer Engine、HBM3、NVLink 这几个当时看还有点激进的选择组合到了一起,恰好赶上 ChatGPT 引爆的算力需求——从 2022 到 2024 年,谁能拿到 H100,谁就能训练前沿模型。今天它仍然是训练的性价比之选和生态最完备的那款 GPU。

如果你是想搞清楚"为什么最近几年 NVIDIA 股价那么疯",答案基本就是这块芯片,加上后面的 H200/B200/B300。

除非注明,否则均为李锋镝的博客原创文章,转载必须以链接形式标明本文链接

本文链接:https://www.lifengdi.com/ren-gong-zhi-neng/4934

本作品采用 知识共享署名-非商业性使用-相同方式共享 4.0 国际许可协议 进行许可
标签: GPU NVIDIA
最后更新:2026年8月26日

李锋镝

既然选择了远方,便只顾风雨兼程。

打赏 点赞
< 上一篇
1234567891112131415161718192021222324252627282930313233343536373839404142434446474849505152535455575859606162636465666769727476777879808182858687909293949596979899
取消回复

文章评论

  • HaryLv 2友

    装机能上嘛,配个电脑200w,哈哈

    AndroidChrome 151.0.0.0 中国-安徽-合肥
    2026年8月26日
    00 回复
  • 愁云淡淡雨潇潇。暮暮复朝朝。别来应是,眉峰翠减,腕玉香销。
    小轩独坐相思处,情绪好无聊。一丛萱草,几竿修竹,数叶芭蕉。

    听点儿音乐吧 朋友~
    文章目录
    最新 热点 随机
    最新 热点 随机
    英伟达 H100 是啥,到底好在哪? Kafka Log Compaction(日志压缩)详解 WordPress缓存插件WP Fastest Cache、WP Rocket 、FlyingPress对比 每日早报 · 2026年8月20日 · 早上好 Kratos+ v1.1.18版本更新说明 每日早报 · 2026年8月19日
    给主题增加了Now、每日心情、年度回顾、岁月同一天、随机漫步等功能Kratos+ v1.1.16版本更新说明AI时代,个人技术博客的出路在哪里?增加了两套复古皮肤-牛皮纸、千禧网页写了一个订阅每日新闻的WP插件Kratos+ v1.1.18版本更新说明
    RabbitMQ Exchange 我要狠狠的反驳“公司禁止使用 Lombok ”的观点! Java之五种遍历Map集合的方式 MQ消费端遇到瓶颈该怎么办? Java 灵魂拷问 13 个为什么,你都会哪些? 英伟达 H100 是啥,到底好在哪?
    最近评论
    Hary 发布于 45 分钟前(08月26日) 装机能上嘛,配个电脑200w,哈哈
    林羽凡 发布于 4 小时前(08月26日) 太不可思议了,WP Rocket居然快有500万的装机量了。
    李锋镝 发布于 1 天前(08月25日) 基本上大家都是这样,闲着没事就捣鼓捣鼓
    不凡 发布于 1 天前(08月25日) 嗐,闲时玩玩,没那么“极” :8:
    李锋镝 发布于 1 天前(08月25日) 哈哈哈~说明你也是极客
    标签聚合
    MySQL 分布式 Redis K8s 数据库 多线程 IDEA 日常 Claude SQL JAVA AI编程 WordPress ElasticSearch AI Spring MQ JVM SpringBoot 架构
    友情链接
    • sssr7844的博客
    • Honesty
    • 蜗牛工作室
    • 若梦博客
    • 林羽凡
    • 瓦匠个人小站
    • 临窗旋墨
    • 老张博客
    • 知向前端
    • 志文工作室
    • 搬砖日记
    • 彬红茶日记
    • Serendipity
    • 韩小韩博客
    • 懋和道人
    • 哥斯拉
    • 皮皮社
    • 九仞之行
    • 韩情脉脉
    • Mr.Sun的博客

    COPYRIGHT © 2026 lifengdi.com. ALL RIGHTS RESERVED.

    正在博友圈履约中

    域名年龄

    Theme Kratos-plus By Dylan Li

    津ICP备2024022503号-3

    京公网安备11011502039375号