GPU架构与精度支持查询

选择GPU厂商和架构,查看不同显卡型号支持的计算精度

NVIDIA

NVIDIA是GPU领域的领导者,提供从消费级到数据中心的全系列GPU产品,支持最新的光线追踪和AI加速技术。

GeForce RTX H100 A100

AMD

AMD提供高性能的Radeon系列显卡和CDNA架构的数据中心加速器,在游戏和计算领域都有竞争力的产品。

Radeon RX Instinct MI300

国产GPU

国产GPU厂商包括华为、寒武纪、天数智芯等,提供从端侧到云端的AI加速卡,支持多种精度计算。

昇腾 寒武纪 天数智芯 海光

精度类型说明

浮点精度

  • FP32 (单精度):32位浮点精度,常用于传统GPU计算和科学计算
  • FP16 (半精度):16位浮点精度,在AI训练和推理中广泛使用,可提高性能并减少内存使用
  • BF16 (脑半精度):16位浮点精度的一种变体,由Intel和Google推出,在保持精度的同时提供更好的数值稳定性
  • TF32 (Tensor Float 32):NVIDIA推出的特殊精度格式,结合了FP32的范围和FP16的精度,专为AI计算优化
  • FP8 (8位浮点):8位浮点精度,用于高效AI推理,可显著提高性能并降低功耗
  • FP6 (6位浮点):6位浮点精度,Blackwell架构新支持的超高效率精度格式
  • FP4 (4位浮点):4位浮点精度,用于极致的AI推理性能,是当前最高效的精度格式之一

整数精度

  • INT8 (8位整数):8位整数精度,广泛用于AI推理,提供良好的性能和精度平衡
  • INT4 (4位整数):4位整数精度,用于极高吞吐量的AI推理场景,精度要求相对较低

性能说明

  • 稠密计算:传统的计算模式,处理所有输入数据
  • 稀疏计算:利用数据稀疏性进行优化的计算模式,可以显著提高性能
  • TC (Tensor Core):NVIDIA GPU上的专用AI加速核心,可大幅提升矩阵运算性能