【本地AI的“奥本海默时刻”:Qwen 3.8 Flash Next 正在终结云端垄断】想在消费级电脑上跑千亿模型的朋友可以看看开源项目Strata。只要有一张12G显存显卡加32G内存,就能在Windows或Linux上一键跑起1250亿参数的Qwen3.8-Flash-Next。它通过显存、内存与CPU协同分担计算负载,配合推测解码技术,实测生成速度可达每秒50到90多token。本地自带Web操作界面并支持图片输入,同时兼容OpenAI与Anthropic的API接口,能直接对接各类编程Agent与外部应用,所有数据均在本地离线处理。项目地址:github.com /Niko1221/Strata
发布于 上海
