开源推理引擎Inco Splash,称在M5 Max MacBook Pro上跑 Qwen3.8-27B,达到144 tok/s
解码速度最高是Ollama的3倍、oMLX的2倍,在4并发子 Agent/短prompt聚合吞吐场景最高接近4倍
目前支持Qwen3.8-27B/Qwen3.6-35B-A3B、Apple芯片
如果27B/35B-A3B这类4-bit模型在Mac上足够快,很多编程任务不一定非要调云端大API,一部分负载会从云端API 回流到本地
github:http://t.cn/AXOlaxzc
#AI推理引擎##IncoSplash# http://t.cn/AXOYKi3s
发布于 美国
