蚁工厂
26-08-22 09:58 微博认证:科技博主

加州大学伯克利分校和麻省理工学院的研究人员开源了一款新的推理引擎:FreeToken(这个名字真好),用它可以实现:
Qwen3.6 35B → 8GB RTX 4060 笔记本 39 tok/s
DeepSeek-V4-Flash 284B → RTX 5090 台式机 22-25 tok/s
GLM-5.2 753B → RTX PRO 6000 工作站 15 tok/s

项目地址:github.com/FlashML-org/FreeToken
直接用官方检查点非量化版。当然还需要内存支持,比如DeepSeek-V4-Flash 284B 这个除了32G的显卡还需要192GB的内存~且内存速度越快越好。

发布于 山东