发布于 约 5137 字 预计阅读 15 分钟
显卡AI性能汇总
目录
显卡AI性能汇总
本文中的FP32默认使用稠密向量算力。若列名含稀疏,则为厂商宣传的结构化稀疏峰值;否则默认为稠密算力。不同厂商对 AI TOPS/TFLOPS 的标注口径不同,本文更侧重代际与数据格式支持关系。本文中的算力数值均取厂商/白皮书中的峰值算力。
Nvidia
*表示CUDA Core和Tensor Core都支持该数据格式,-表示都不支持,+表示CUDA Core支持但Tensor Core不支持,=表示CUDA Core不支持但Tensor Core支持,?表示支持情况未知。
表中的“支持”指存在硬件/指令路径,不代表主流 AI 框架一定实际使用该路径;低比特量化格式可能只是存储低比特,计算时仍会反量化到 FP16/BF16。
Pascal(GP102/GP104/GP106/GP107)
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|
| GTX 1050 | 2 | 112.1 | 1.862 | 75 | + | - | - | - | + | - |
| GTX 1050 Ti | 4 | 112.1 | 2.138 | 75 | + | - | - | - | + | - |
| GTX 1060 | 6 | 192.2 | 4.375 | 120 | + | - | - | - | + | - |
| GTX 1070 | 8 | 256.3 | 6.463 | 150 | + | - | - | - | + | - |
| GTX 1070 Ti | 8 | 256.3 | 8.186 | 180 | + | - | - | - | + | - |
| GTX 1080 | 8 | 320.3 | 8.873 | 180 | + | - | - | - | + | - |
| GTX 1080 Ti | 11 | 484 | 11.34 | 250 | + | - | - | - | + | - |
| TITAN X | 12 | 480 | 10.97 | 250 | + | - | - | - | + | - |
| TITAN Xp | 12 | 548 | 12.15 | 250 | + | - | - | - | + | - |
Pascal架构不含Tensor Core。 GTX 10系支持FP16指令,但消费级 GP102/GP104 的 FP16 吞吐率较低,与 GP100 (Tesla P100)不同,不应视为高性能 FP16 AI算力。
Turing(TU116/TU117)
GTX 16系没有多少相关资料,按 RTX 20系架构去掉
Tensor Core来看。
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|
| GTX 1650 | 4 | 128 | 2.984 | 75 | + | - | - | - | + | - |
| GTX 1650 Super | 4 | 192 | 4.416 | 100 | + | - | - | - | + | - |
| GTX 1660 | 6 | 192.1 | 5.027 | 120 | + | - | - | - | + | - |
| GTX 1660 Super | 6 | 336 | 5.027 | 125 | + | - | - | - | + | - |
| GTX 1660 Ti | 6 | 288 | 5.437 | 120 | + | - | - | - | + | - |
Turing(TU102/TU104/TU106)
RTX 20系的数据格式兼容性由Nvidia发布的Turing架构白皮书中得出
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | Tensor Core(FP16 TFLOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| RTX 2060 | 12 | 336 | 7.181 | 57.4 | 185 | * | - | - | - | * | = |
| RTX 2060 Super | 8 | 448 | 7.181 | 57.4 | 175 | * | - | - | - | * | = |
| RTX 2070 | 8 | 448 | 7.465 | 59.7 | 175 | * | - | - | - | * | = |
| RTX 2070 Super | 8 | 448 | 9.062 | 72.5 | 215 | * | - | - | - | * | = |
| RTX 2080 | 8 | 448 | 10.07 | 80.5 | 215 | * | - | - | - | * | = |
| RTX 2080 Super | 8 | 496.1 | 11.15 | 89.2 | 250 | * | - | - | - | * | = |
| RTX 2080 Ti | 11 | 616 | 13.45 | 107.6 | 250 | * | - | - | - | * | = |
| TITAN RTX | 24 | 672 | 16.31 | 130.5 | 280 | * | - | - | - | * | = |
Ampere
RTX 30系的数据格式兼容性由Nvidia发布的Ampere架构白皮书中得出
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | Tensor Core(FP16 TFLOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| RTX 3050 | 8 | 224 | 9.098 | 72.8 | 130 | * | * | - | - | * | = |
| RTX 3060 | 12 | 360 | 12.74 | 101 | 170 | * | * | - | - | * | = |
| RTX 3060 Ti | 8 | 448 | 16.20 | 129 | 200 | * | * | - | - | * | = |
| RTX 3070 | 8 | 448 | 20.31 | 163 | 220 | * | * | - | - | * | = |
| RTX 3070 Ti | 8 | 608.3 | 21.75 | 174 | 290 | * | * | - | - | * | = |
| RTX 3080 | 12 | 912.4 | 30.64 | 245 | 350 | * | * | - | - | * | = |
| RTX 3080 Ti | 12 | 912.4 | 34.10 | 273 | 350 | * | * | - | - | * | = |
| RTX 3090 | 24 | 936.2 | 35.58 | 285 | 350 | * | * | - | - | * | = |
| RTX 3090 Ti | 24 | 1008 | 40.00 | 320 | 450 | * | * | - | - | * | = |
Ada Lovelace
RTX 40系的数据格式兼容性由Nvidia发布的Ada架构白皮书中得出
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | Tensor Core(FP8 TFLOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| RTX 4060 | 8 | 272 | 15.11 | 242 | 115 | * | * | = | - | * | = |
| RTX 4060 Ti | 16 | 288 | 22.06 | 353 | 165 | * | * | = | - | * | = |
| RTX 4070 | 12 | 504 | 29.15 | 466 | 200 | * | * | = | - | * | = |
| RTX 4070 Super | 12 | 504 | 35.48 | 568 | 220 | * | * | = | - | * | = |
| RTX 4070 Ti | 12 | 504 | 40.09 | 642 | 285 | * | * | = | - | * | = |
| RTX 4070 Ti Super | 16 | 672 | 44.10 | 706 | 285 | * | * | = | - | * | = |
| RTX 4080 | 16 | 716.8 | 48.74 | 780 | 320 | * | * | = | - | * | = |
| RTX 4080 Super | 16 | 736 | 52.22 | 836 | 320 | * | * | = | - | * | = |
| RTX 4090D | 24 | 1008 | 73.54 | 1177 | 425 | * | * | = | - | * | = |
| RTX 4090 | 24 | 1008 | 82.58 | 1321 | 450 | * | * | = | - | * | = |
Blackwell
RTX 50系的数据格式兼容性由Nvidia发布的Blackwell架构白皮书中得出。
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | Tensor Core(稀疏FP4 AI TOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| RTX 5050 | 8 | 320 | 13.17 | 421 | 130 | * | * | = | = | * | = |
| RTX 5060 | 8 | 448 | 19.20 | 614 | 145 | * | * | = | = | * | = |
| RTX 5060 Ti | 16 | 448 | 23.70 | 759 | 180 | * | * | = | = | * | = |
| RTX 5070 | 12 | 672 | 30.87 | 988 | 250 | * | * | = | = | * | = |
| RTX 5070 Ti | 16 | 896 | 43.94 | 1406 | 300 | * | * | = | = | * | = |
| RTX 5080 | 16 | 960 | 56.28 | 1801 | 360 | * | * | = | = | * | = |
| RTX 5090D v2 | 24 | 1344 | 104.75 | 2375 | 575 | * | * | = | = | * | = |
| RTX 5090D | 32 | 1792 | 104.75 | 2375 | 575 | * | * | = | = | * | = |
| RTX 5090 | 32 | 1792 | 104.75 | 3352 | 575 | * | * | = | = | * | = |
Blackwell支持稀疏化的FP4矩阵。
AMD
*表示VALU和Matrix Core都支持该数据格式,-表示都不支持,+表示VALU支持但Matrix Core不支持,=表示VALU不支持但Matrix Core支持,?表示支持情况未知。
表中的“支持”指存在硬件/指令路径,不代表主流 AI 框架一定实际使用该路径;低比特量化格式可能只是存储低比特,计算时仍会反量化到 FP16/BF16。
RDNA 1.0
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|
| RX 5300 | 3 | 168 | 4.632 | 100 | + | - | - | - | + | - |
| RX 5500 | 4 | 224 | 5.196 | 110 | + | - | - | - | + | - |
| RX 5500 XT | 8 | 224 | 5.196 | 130 | + | - | - | - | + | - |
| RX 5600 | 6 | 288 | 6.390 | 150 | + | - | - | - | + | - |
| RX 5600 XT | 6 | 336 | 8.064 | 160 | + | - | - | - | + | - |
| RX 5700 | 8 | 448 | 7.949 | 180 | + | - | - | - | + | - |
| RX 5700 XT | 8 | 448 | 9.754 | 225 | + | - | - | - | + | - |
RDNA 1.0架构不含Matrix Core。
RDNA 2.0
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|
| RX 6400 | 4 | 128 | 3.565 | 53 | + | - | - | - | + | + |
| RX 6500 XT | 8 | 144 | 5.765 | 107 | + | - | - | - | + | + |
| RX 6600 | 8 | 224 | 8.928 | 132 | + | - | - | - | + | + |
| RX 6600 XT | 8 | 256 | 10.60 | 160 | + | - | - | - | + | + |
| RX 6650 XT | 8 | 280.3 | 10.79 | 180 | + | - | - | - | + | + |
| RX 6700 | 10 | 320 | 11.29 | 175 | + | - | - | - | + | + |
| RX 6700 XT | 12 | 384 | 13.22 | 230 | + | - | - | - | + | + |
| RX 6750 GRE | 12 | 384 | 13.22 | 230 | + | - | - | - | + | + |
| RX 6750 XT | 12 | 432 | 13.31 | 250 | + | - | - | - | + | + |
| RX 6800 | 16 | 512 | 16.17 | 250 | + | - | - | - | + | + |
| RX 6800 XT | 16 | 512 | 20.74 | 300 | + | - | - | - | + | + |
| RX 6900 XT | 16 | 512 | 23.04 | 300 | + | - | - | - | + | + |
| RX 6950 XT | 16 | 576 | 23.65 | 335 | + | - | - | - | + | + |
RDNA 2.0架构不含Matrix Core。
RDNA 3.0
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | Matrix Core(INT8 TOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| RX 7400 | 8 | 172.8 | 7.885 | ? | 55 | * | = | - | - | * | = |
| RX 7600 | 8 | 288 | 21.75 | 43.5 | 165 | * | = | - | - | * | = |
| RX 7650 GRE | 8 | 288 | 22.08 | ? | 170 | * | = | - | - | * | = |
| RX 7600 XT | 16 | 288 | 22.61 | 45.1 | 190 | * | = | - | - | * | = |
| RX 7700 | 16 | 624 | 25.18 | 50.4 | 263 | * | = | - | - | * | = |
| RX 7700 XT | 12 | 432 | 35.17 | 70.3 | 245 | * | = | - | - | * | = |
| RX 7800 XT | 16 | 624 | 37.32 | 74.6 | 263 | * | = | - | - | * | = |
| RX 7900 GRE | 16 | 576 | 45.98 | 92 | 260 | * | = | - | - | * | = |
| RX 7900 XT | 20 | 800 | 51.48 | 103 | 315 | * | = | - | - | * | = |
| RX 7900 XTX | 24 | 960 | 61.42 | 123 | 355 | * | = | - | - | * | = |
RDNA 4.0
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | Matrix Core(稀疏INT4 TOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| RX 9060 | 8 | 288 | 21.43 | 686 | 132 | * | * | = | - | * | * |
| RX 9060 XT | 16 | 322.3 | 25.64 | 821 | 160 | * | * | = | - | * | * |
| RX 9070 GRE | 12 | 432 | 34.28 | 1097 | 220 | * | * | = | - | * | * |
| RX 9070 | 16 | 644.6 | 36.13 | 1165 | 220 | * | * | = | - | * | * |
| RX 9070 XT | 16 | 644.6 | 48.66 | 1557 | 304 | * | * | = | - | * | * |
RDNA 4.0的Matrix Core支持结构稀疏化的INT4矩阵。
RDNA 4.0的 INT4 记为*是按VALU 可处理低比特整数/打包逻辑 + Matrix Core 支持 INT4 矩阵的工程口径;若严格要求普通 VALU 具备原生 INT4 矩阵/点积吞吐,也可记为=。
Intel
*表示XVE和XMX都支持该数据格式,-表示都不支持,+表示XVE支持但XMX不支持,=表示XVE不支持但XMX支持,?表示支持情况未知。 表中的“支持”指存在硬件/指令路径,不代表主流 AI 框架一定实际使用该路径;低比特量化格式可能只是存储低比特,计算时仍会反量化到 FP16/BF16。
Xe-HPG
Xe-HPG 中,
+侧对应 XVE/Vector Engine 普通 SIMD/DP4A 路径,=侧对应 XMX/DPAS 矩阵路径。根据 Intel Xe-HPG 白皮书,XVE 支持 FP16 MAD 与 INT8 DP4A;XMX 支持 FP16、BF16、INT8、INT4、INT2的 DPAS multiply,并支持 16/32 位累加,由Intel的Xe-HPG白皮书得出。
游戏卡
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | XMX(INT8 TOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Arc A310 | 4 | 124 | 3.072 | 52 | 75 | * | = | - | - | * | = |
| Arc A380 | 6 | 186 | 4.403 | 66 | 75 | * | = | - | - | * | = |
| Arc A580 | 8 | 512 | 12.29 | 197 | 225 | * | = | - | - | * | = |
| Arc A750 | 8 | 512 | 17.20 | 229 | 225 | * | = | - | - | * | = |
| Arc A770 | 16 | 560 | 19.66 | 262 | 225 | * | = | - | - | * | = |
专业卡
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | XMX(INT8 TOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Arc Pro A40 | 6 | 192 | 3.482 | 69 | 50 | * | = | - | - | * | = |
| Arc Pro A50 | 6 | 192 | 4.813 | 69 | 75 | * | = | - | - | * | = |
| Arc Pro A60 | 12 | 384 | 8.192 | 151 | 130 | * | = | - | - | * | = |
Xe2-HPG
Xe2-HPG 尚未找到公开的白皮书,数据兼容性格式根据oneAPI SDK、DPC++文档、SYCL文档与硬件信息进行推断。
游戏卡
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | XMX(INT8 TOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Arc B570 | 10 | 380 | 11.52 | 203 | 150 | * | = | - | - | * | = |
| Arc B580 | 12 | 456 | 13.67 | 233 | 190 | * | = | - | - | * | = |
专业卡
| 型号 | 显存容量(GB) | 显存带宽(GB/s) | FP32(TFLOPS) | XMX(INT8 TOPS) | 功耗(W) | FP16 | BF16 | FP8 | FP4 | INT8 | INT4 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Arc Pro B50 | 16 | 224 | 10.65 | 170 | 70 | * | = | - | - | * | = |
| Arc Pro B60 | 24 | 456 | 12.29 | 197 | 200 | * | = | - | - | * | = |
| Arc Pro B65 | 32 | 608 | 12.29 | 197 | 200 | * | = | - | - | * | = |
| Arc Pro B70 | 32 | 608 | 22.94 | 367 | 230 | * | = | - | - | * | = |