卧槽,这思路绝!
在 8GB 内存的 Mac 上也能跑 260 亿参数的 AI 大模型(Gemma 4 26B)
正常来说这么大的模型需要 14GB+ 内存才能加载,这哥们用了一个巧妙的思路——按需从 SSD 流式加载:
核心原理:
Gemma 4 26B 是个 MoE(混合专家)模型,每次生成一个 token 只需要 16 个专家中的 8 个。所以它不需要把整个模型塞进内存,而是:
1. 常驻内存的只有共享层 + KV cache,大概 2GB
2. 每生成一个 token,根据路由器判断需要哪些专家,临时从 SSD 读取
3. 读过的专家放进一个 16 槽的小缓存(LRU/LFU),热数据会复用
相当于"用到啥才加载啥",用 2GB 内存预算干原来 14GB 的活。
性能
- M2 MacBook Air 8GB:5-6 tok/s
- M5 Pro 24GB:31-35 tok/s
- 要求 macOS 26 + Metal 4 + Swift 6.2
技术特点
- 纯 Swift + Metal 手写,不是 MLX 或 llama.cpp 的壳
- 自己写了 Metal kernel 做 GEMV、attention、MoE 等
- 提供三种使用方式:Mac GUI 应用、CLI、本地 OpenAI 兼容 server(端口 8080)
- 模型权重从 Hugging Face 流式下载并重新打包成 .gturbo 格式
作者
Andrey Mikhaylov,一个 iOS/Metal 工程师。项目名字 Fieldfare(田鸫)是他最喜欢的鸟,献给他爱观鸟的老婆。纯个人研究项目,跟 Google 没关系。
github:http://t.cn/AXCLcz3g
#gemma4##本地部署ai大模型教程#
