最近这几个国产Flash模型,无一例外都是超大规模但是超低激活参数的模型,对于内存容量的需求远大于内存带宽的需求,其实最适合的就是像苹果M系,Strix Halo或者GB10这种Super UMA。
但比较尴尬的点是规模又有点太大了,就算想要跑NVFP4量化版本,内存占用还是会超过128G。
对于DGX Spark来说,可以通过双机互联曲线救国,但对于RTX Spark就很尴尬了,虽然芯片一样,但跑Win的N1X并不具备DGX Spark的多机互联能力,而内存上限目前只支持到128G,就算是NVFP4也塞不下,感觉需要验证更大容量的版本了[无聊][无聊]
发布于 广东
