爱范儿
26-07-15 15:11 微博认证:爱范儿官方微博

【腾讯混元开源 Hy3 量化版本,单张 96GB 显卡即可部署】

腾讯混元团队把 295B 参数的 Hy3 模型量化为 1bit 和 4bit GGUF 版本,并配套发布 llama.cpp 部署方案。1bit 版本的权重从接近 600GB 压缩到 85.5GB,单张 96GB 显存的推理显卡即可运行;4bit 版本为 169.9GB,适合两张推理显卡部署。

团队还为 llama.cpp 加入 Hy3 的 MTP 投机解码支持,开启后 1bit 版本解码速度提升约 50%,4bit 版本提升接近 60%。

官方评测显示,4bit 版本在 Agent、多语言代码、工具调用和长文理解任务上的表现接近 BF16 原始模型,1bit 版本在长文理解、Agent 和代码任务上也保持了较小的性能损失。