昨晚Google开源了大语言模型Gemma,主打轻量高性能和支持端侧。很多朋友问和我们开源的端侧MiniCPM相比怎么样,团队同学做了简单评测:👇🏻
1. MiniCPM-2B中文能力超越 Gemma-7B。
2. MiniCPM-2B各英文任务上整体领先Gemma-2B(均分 MiniCPM-2B 56.6 vs Gemma-2B 46.4),相比Gemma-7B也能在HumanEval、GSM8K、ARC-c/e取得领先,详见下表。
3. Google通过TPUv5e芯片硬件加速,MiniCPM则通过「模型沙盒」实验从学习效率提速。学习token量仅为Gemma-2B的1/2、Gemma-7B的1/6,也可见Gemma还没有充分挖掘出模型参数的能力上限。
4. MiniCPM在超参方案、训练策略、数据方案等方面进行了创新,例如WSD学习率优化器,参见
- 技术报告 http://t.cn/A6Yz9zI1
- 仓库 http://t.cn/A6jd59t7
- 模型 http://t.cn/A6YNIxPM
5. Google重返大模型开源社区并重点支持端侧应用,与我们“让大模型飞入千家万户”的愿景不谋而合。
2024是大模型落地应用的关键年,接下来会看到更多从硬件、架构、算法等方面极限挖掘大模型效率的探索。众人拾柴火焰高,相信在大家共同的开源努力下,我们可以更快奔向AGI的目标。
发布于 北京
