显卡AI性能汇总

GPU显卡硬件 #GPU#算力#AI
目录

显卡AI性能汇总

本文中的FP32默认使用稠密向量算力。若列名含稀疏,则为厂商宣传的结构化稀疏峰值;否则默认为稠密算力。不同厂商对 AI TOPS/TFLOPS 的标注口径不同,本文更侧重代际与数据格式支持关系。本文中的算力数值均取厂商/白皮书中的峰值算力。

Nvidia

*表示CUDA CoreTensor Core都支持该数据格式,-表示都不支持,+表示CUDA Core支持但Tensor Core不支持,=表示CUDA Core不支持但Tensor Core支持,?表示支持情况未知。

表中的“支持”指存在硬件/指令路径,不代表主流 AI 框架一定实际使用该路径;低比特量化格式可能只是存储低比特,计算时仍会反量化到 FP16/BF16。

Pascal(GP102/GP104/GP106/GP107)

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)功耗(W)FP16BF16FP8FP4INT8INT4
GTX 10502112.11.86275+---+-
GTX 1050 Ti4112.12.13875+---+-
GTX 10606192.24.375120+---+-
GTX 10708256.36.463150+---+-
GTX 1070 Ti8256.38.186180+---+-
GTX 10808320.38.873180+---+-
GTX 1080 Ti1148411.34250+---+-
TITAN X1248010.97250+---+-
TITAN Xp1254812.15250+---+-

Pascal 架构不含 Tensor Core。 GTX 10系支持FP16指令,但消费级 GP102/GP104 的 FP16 吞吐率较低,与 GP100 (Tesla P100)不同,不应视为高性能 FP16 AI算力。

Turing(TU116/TU117)

GTX 16系没有多少相关资料,按 RTX 20系架构去掉Tensor Core来看。

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)功耗(W)FP16BF16FP8FP4INT8INT4
GTX 165041282.98475+---+-
GTX 1650 Super41924.416100+---+-
GTX 16606192.15.027120+---+-
GTX 1660 Super63365.027125+---+-
GTX 1660 Ti62885.437120+---+-

Turing(TU102/TU104/TU106)

RTX 20系的数据格式兼容性由Nvidia发布的Turing架构白皮书中得出

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)Tensor Core(FP16 TFLOPS)功耗(W)FP16BF16FP8FP4INT8INT4
RTX 2060123367.18157.4185*---*=
RTX 2060 Super84487.18157.4175*---*=
RTX 207084487.46559.7175*---*=
RTX 2070 Super84489.06272.5215*---*=
RTX 2080844810.0780.5215*---*=
RTX 2080 Super8496.111.1589.2250*---*=
RTX 2080 Ti1161613.45107.6250*---*=
TITAN RTX2467216.31130.5280*---*=

Ampere

RTX 30系的数据格式兼容性由Nvidia发布的Ampere架构白皮书中得出

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)Tensor Core(FP16 TFLOPS)功耗(W)FP16BF16FP8FP4INT8INT4
RTX 305082249.09872.8130**--*=
RTX 30601236012.74101170**--*=
RTX 3060 Ti844816.20129200**--*=
RTX 3070844820.31163220**--*=
RTX 3070 Ti8608.321.75174290**--*=
RTX 308012912.430.64245350**--*=
RTX 3080 Ti12912.434.10273350**--*=
RTX 309024936.235.58285350**--*=
RTX 3090 Ti24100840.00320450**--*=

Ada Lovelace

RTX 40系的数据格式兼容性由Nvidia发布的Ada架构白皮书中得出

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)Tensor Core(FP8 TFLOPS)功耗(W)FP16BF16FP8FP4INT8INT4
RTX 4060827215.11242115**=-*=
RTX 4060 Ti1628822.06353165**=-*=
RTX 40701250429.15466200**=-*=
RTX 4070 Super1250435.48568220**=-*=
RTX 4070 Ti1250440.09642285**=-*=
RTX 4070 Ti Super1667244.10706285**=-*=
RTX 408016716.848.74780320**=-*=
RTX 4080 Super1673652.22836320**=-*=
RTX 4090D24100873.541177425**=-*=
RTX 409024100882.581321450**=-*=

Blackwell

RTX 50系的数据格式兼容性由Nvidia发布的Blackwell架构白皮书中得出。

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)Tensor Core(稀疏FP4 AI TOPS)功耗(W)FP16BF16FP8FP4INT8INT4
RTX 5050832013.17421130**==*=
RTX 5060844819.20614145**==*=
RTX 5060 Ti1644823.70759180**==*=
RTX 50701267230.87988250**==*=
RTX 5070 Ti1689643.941406300**==*=
RTX 50801696056.281801360**==*=
RTX 5090D v2241344104.752375575**==*=
RTX 5090D321792104.752375575**==*=
RTX 5090321792104.753352575**==*=

Blackwell支持稀疏化的FP4矩阵。

AMD

*表示VALUMatrix Core都支持该数据格式,-表示都不支持,+表示VALU支持但Matrix Core不支持,=表示VALU不支持但Matrix Core支持,?表示支持情况未知。

表中的“支持”指存在硬件/指令路径,不代表主流 AI 框架一定实际使用该路径;低比特量化格式可能只是存储低比特,计算时仍会反量化到 FP16/BF16。

RDNA 1.0

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)功耗(W)FP16BF16FP8FP4INT8INT4
RX 530031684.632100+---+-
RX 550042245.196110+---+-
RX 5500 XT82245.196130+---+-
RX 560062886.390150+---+-
RX 5600 XT63368.064160+---+-
RX 570084487.949180+---+-
RX 5700 XT84489.754225+---+-

RDNA 1.0 架构不含 Matrix Core

RDNA 2.0

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)功耗(W)FP16BF16FP8FP4INT8INT4
RX 640041283.56553+---++
RX 6500 XT81445.765107+---++
RX 660082248.928132+---++
RX 6600 XT825610.60160+---++
RX 6650 XT8280.310.79180+---++
RX 67001032011.29175+---++
RX 6700 XT1238413.22230+---++
RX 6750 GRE1238413.22230+---++
RX 6750 XT1243213.31250+---++
RX 68001651216.17250+---++
RX 6800 XT1651220.74300+---++
RX 6900 XT1651223.04300+---++
RX 6950 XT1657623.65335+---++

RDNA 2.0 架构不含 Matrix Core

RDNA 3.0

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)Matrix Core(INT8 TOPS)功耗(W)FP16BF16FP8FP4INT8INT4
RX 74008172.87.885?55*=--*=
RX 7600828821.7543.5165*=--*=
RX 7650 GRE828822.08?170*=--*=
RX 7600 XT1628822.6145.1190*=--*=
RX 77001662425.1850.4263*=--*=
RX 7700 XT1243235.1770.3245*=--*=
RX 7800 XT1662437.3274.6263*=--*=
RX 7900 GRE1657645.9892260*=--*=
RX 7900 XT2080051.48103315*=--*=
RX 7900 XTX2496061.42123355*=--*=

RDNA 4.0

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)Matrix Core(稀疏INT4 TOPS)功耗(W)FP16BF16FP8FP4INT8INT4
RX 9060828821.43686132**=-**
RX 9060 XT16322.325.64821160**=-**
RX 9070 GRE1243234.281097220**=-**
RX 907016644.636.131165220**=-**
RX 9070 XT16644.648.661557304**=-**

RDNA 4.0Matrix Core支持结构稀疏化的INT4矩阵。

RDNA 4.0 的 INT4 记为 * 是按VALU 可处理低比特整数/打包逻辑 + Matrix Core 支持 INT4 矩阵的工程口径;若严格要求普通 VALU 具备原生 INT4 矩阵/点积吞吐,也可记为=

Intel

*表示XVEXMX都支持该数据格式,-表示都不支持,+表示XVE支持但XMX不支持,=表示XVE不支持但XMX支持,?表示支持情况未知。 表中的“支持”指存在硬件/指令路径,不代表主流 AI 框架一定实际使用该路径;低比特量化格式可能只是存储低比特,计算时仍会反量化到 FP16/BF16。

Xe-HPG

Xe-HPG 中, +侧对应 XVE/Vector Engine 普通 SIMD/DP4A 路径, =侧对应 XMX/DPAS 矩阵路径。根据 Intel Xe-HPG 白皮书,XVE 支持 FP16 MAD 与 INT8 DP4A;XMX 支持 FP16、BF16、INT8、INT4、INT2的 DPAS multiply,并支持 16/32 位累加,由Intel的Xe-HPG白皮书得出。

游戏卡

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)XMX(INT8 TOPS)功耗(W)FP16BF16FP8FP4INT8INT4
Arc A31041243.0725275*=--*=
Arc A38061864.4036675*=--*=
Arc A580851212.29197225*=--*=
Arc A750851217.20229225*=--*=
Arc A7701656019.66262225*=--*=

专业卡

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)XMX(INT8 TOPS)功耗(W)FP16BF16FP8FP4INT8INT4
Arc Pro A4061923.4826950*=--*=
Arc Pro A5061924.8136975*=--*=
Arc Pro A60123848.192151130*=--*=

Xe2-HPG

Xe2-HPG 尚未找到公开的白皮书,数据兼容性格式根据oneAPI SDK、DPC++文档、SYCL文档与硬件信息进行推断。

游戏卡

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)XMX(INT8 TOPS)功耗(W)FP16BF16FP8FP4INT8INT4
Arc B5701038011.52203150*=--*=
Arc B5801245613.67233190*=--*=

专业卡

型号显存容量(GB)显存带宽(GB/s)FP32(TFLOPS)XMX(INT8 TOPS)功耗(W)FP16BF16FP8FP4INT8INT4
Arc Pro B501622410.6517070*=--*=
Arc Pro B602445612.29197200*=--*=
Arc Pro B653260812.29197200*=--*=
Arc Pro B703260822.94367230*=--*=
目录