我测试了 Qwen3.8 Flash Next 的 11 种标准 GGUF 量化方法,从 Q4 到 Q1。
在这些单轮、非代理式评估中,我测试的每种标准 GGUF 都保留了 BF16 准确率的 >95%。甚至 IQ1 模型的表现也出人意料地好。
令牌效率的下降则更加明显。在相同工作负载下,量化模型生成的输出令牌数量比 BF16 多出 14% 到 157%。
因此,对于这些非代理式评估,准确率本身显示出相对较少的下降,而令牌效率则给我们提供了更强的信号,表明量化正在影响模型。
剩下的问题是,这如何转化为长代理式轨迹。我现在正在运行这些评估(但不是针对所有模型),并将于下周发布结果。
详情:http://t.cn/AXWOaVFe…
(一如既往,不要将这些结果解读为排名)
http://t.cn/AXWOaVFD
发布于 北京
