Strata夯爆了。
Strata的原理简单说就是把MOE模型拆拆用,真正常用专家的放进显存,不常用的专家放在内存,最不常用的放在ssd,这样就可以在显存捉襟见肘的情况下,仍然能够跑125B级别的较大的模型,可以说是为5090以降的一众游戏卡量身定做的。
看官方文档应当最低支持到8G显存,64G内存,甚至AMD显卡也支持。
我在我平常玩游戏的9800x3d + RTX 5090 + 192G DDR5 内存的组装机上配置好,安装了 Qwen 3.8 next 125B UD-IQ4_XS模型,挂在deepseek harness上,跑一个任务,如图二,149 Token/秒,256k上下文。
我用我另一台玩游戏的9800x3d+RTX 5080+96G DDR 5内存的机器上跑同一个任务,如图一,79 tokens/秒,256k上下文。
从用本地AI,确保私密,数据不出本机的角度来说,简直是效率与安全的完美匹配了。
要知道,在macstudio 512G版本的机器,跑deepseek v4.1,是大概40 Tokens/秒。
两台DGX Spark串联起来,跑Qwen 3.8 next 125b,一直是26 Tokens/秒,怎么也快不起来了。
然而,利用Strata,不说5090这样的大杀器了,就是用真正意义上的普通游戏卡,中国内地可以京东合法买到的,只有16G GDDR7显存的5080显卡就能在同样256k厂上下文上跑出70多tokens,实在是过于堪用了。
而且,不工作的时候,还可以DLSS 5 玩游戏……
真不敢想象到明年的时候能进化成什么样。
发布于 北京
