谷歌突然转头,向消费级硬件市场投下一枚神器——Gemma 4 12B。这个完全抛弃传统编码器、原生支持文本图像音频直接输入的模型,能在16GB轻薄本上全离线运行,堪称「多模态六边形战士」。
著名评测机构 atomic.chat 将其拉到单张 RTX 4090 上,与 Gemma 4 26B-A4B 进行「纯手写单文件 HTML5 Canvas 复杂物理动效」极限对决。结果让人惊掉下巴:Gemma 4 12B 以80 tok/s的速度全线通关所有物理测试场景,仅占用9GB显存——用不到前代模型一半的体量,几乎打出了同等质量的战绩。
核心秘密在于谷歌 DeepMind 引入的颠覆性「无编码器统一架构」。过去所有多模态大模型本质上是「缝合怪」,需要视觉和音频两个编码器分别翻译再融合,慢、占内存、训练难;而 Gemma 4 12B 直接吃原数据,仅用35M超轻量嵌入模块替代原本27层视觉Transformer,音频则切成40毫秒片段线性投影,与文本Token共享同一套权重。
这种大一统带来三重红利:端到端延迟大幅降低、LoRA 微调只需一次前向传递同时更新所有模态、在纯文本和 Agent 任务上远超只专注视觉-语言的开源模型。主导研究的 DeepMind 科学家 Michael Tschannen 骄傲表示:「尽管抛弃了编码器,12B 依然稳稳坐在了 Gemma 4 家族的帕累托前沿上。」
DeepMind CEO Demis Hassabis 宣布 Gemma 4 全系列下载量正式突破1.5亿次,整个开源社区的狂欢被推向高潮。这1.5亿次涵盖自动化构建、全球服务器部署及超7万个衍生微调版本,证明 Gemma 4 已成为像 Linux 一样的新基建;Apache 2.0 协议则彻底扫清商业化障碍,可随意修改打包售卖,无需向谷歌交一分钱版权费。
在过去两年的大模型混战中,所有巨头都在卷参数、卷云端算力。然而闭源实验室运送的是纯粹智力,开源权重运送的是杠杆——Gemma 4 12B 的发布,就像普罗米修斯将火种带到人间,它不再是锁在云端按次计费的奢侈品,而是你笔记本里那个永不断网、永保隐私、永不疲倦的数字搭档。当AI从云端降落到每个人的书桌上,一场属于超级个体和Agent开发的超级大爆炸,才刚刚开始。
