Transformer-周
26-08-27 12:07 微博认证:AI博主

拿4卡80g测试了一下qwen3.8 flash, N-gram外置再cpu上,全是BF-16,Radom的16K prefill 只有8K tokens/s,decoding页就能打到22,并发聚合能上100(batch8)。说实话如果一个125B的模型,正常吞吐比这高(别和我算那 N-gram层),我觉得还是过pcie的延迟影响了速度 ​

发布于 日本