苹果在为下一代 Apple GPU 架构提前做准备。
看了 Apple 的 Metal 4.1 规范文档,引入了 FP4/MXFP4 以及 int4/int2 支持,本质上和当年苹果预热 NAX/Tensor Core 是同一个套路,先在规范和编译器层面把数据类型与接口铺好,为下一代 GPU 架构在硬件物理层原生支持 FP4 TensorOps 提前做准备。
当年苹果在 Metal 规范中提前引入 simdgroup_matrix,支持 FP16、Int8 的矩阵乘加,后面的 Metal 4.0 引入 cooperative_tensor 支持 FP8,相当于把 API 从传统的 SIMD 矩阵升级为了全新的 Tensor 张量管线,由于当时的 GPU Shader Core 没有独立矩阵单元,只能靠常规的 ALU 软模拟运算,到了 A19 和 M5 这一代全新 GPU 架构(Apple10 家族 GPU) 正式引入 Neural Accelerator(神经加速单元),才在硬件层面实现了原生的 FP8 矩阵加速。这种软件先行的模式,可以让新芯片一发布就直接享有成熟的软件生态、编译器支持,所以 A19、M5 系列芯片在发布的时候,端侧 AI 算力和推理吞吐直接就能得到巨大的提升。
现在苹果在 Metal 4.1 提前预埋 FP4、MXFP4 和 tensor_blockwise 规范,也是同样在为下一代 GPU 架构做准备,提前完成对物理原生 FP4 矩阵计算单元(TensorOps)的软件铺路。
参考:
Metal 设计规范:http://t.cn/AX0y3C7i
Metal 功能集汇总表:http://t.cn/A6WNDqbJ
发布于 广东
