AIGCLINK
26-09-20 10:37 微博认证:AI博主

开源推理引擎Inco Splash,称在M5 Max MacBook Pro上跑 Qwen3.8-27B,达到144 tok/s

解码速度最高是Ollama的3倍、oMLX的2倍,在4并发子 Agent/短prompt聚合吞吐场景最高接近4倍

目前支持Qwen3.8-27B/Qwen3.6-35B-A3B、Apple芯片

如果27B/35B-A3B这类4-bit模型在Mac上足够快,很多编程任务不一定非要调云端大API,一部分负载会从云端API 回流到本地

github:http://t.cn/AXOlaxzc

#AI推理引擎##IncoSplash# http://t.cn/AXOYKi3s

发布于 美国