[CL]《T5Gemma 2: Seeing, Reading, and Understanding Longer》B Zhang, P Suganthan, G Liu, I Philippov... [Google DeepMind] (2025)
曾经被认为在大型语言模型时代逐渐边缘化的 Encoder-Decoder 架构,正在 Google 手中焕发第二次生命。T5Gemma 2 的发布不仅是一次模型迭代,更是一场关于架构效率、多模态融合与长文本理解的深度实验。
以下是关于 T5Gemma 2 的核心洞察与技术要点:
架构的轮回与进化
在 Decoder-only 架构统治市场的今天,Google 团队通过 T5Gemma 2 证明了 Encoder-Decoder 依然具备不可替代的优势。该系列涵盖了 270M、1B 和 4B 三种规模,其核心逻辑是将预训练好的 Gemma 3(Decoder-only)通过 UL2 目标函数进行适配,转化为 Encoder-Decoder 结构。这种转换并非简单的搬运,而是一种知识的重组。
极简主义的效率革命
为了在轻量化模型中榨取最高性能,T5Gemma 2 引入了两项关键创新:
1、Tied Embedding(共享词嵌入):在编码器和解码器之间完全共享词向量,在几乎不损失精度的情况下减少了约 10% 的参数冗余。
2、Merged Attention(合并注意力机制):将解码器的自注意力和交叉注意力统一为一个模块。这不仅缩小了编解码器之间的结构差异,更让参数初始化变得异常顺滑。
这种设计哲学告诉我们:冗余是性能的敌人,而统一是效率的阶梯。
跨越维度的感知力
即便基础的 Gemma 3 模型在小参数量下是纯文本的,T5Gemma 2 却能通过适配过程展现出惊人的多模态能力。它重用了 SigLIP 视觉编码器,将图像转化为 256 个嵌入 token 喂给编码器。实验显示,270M 和 1B 规模的模型在视觉理解任务上表现出了极强的韧性。这印证了一个深刻的见解:强大的语言底座本身就蕴含着理解世界的逻辑,缺少的只是一个感知窗口。
长文本的天然优势
长文本处理一直是 Decoder-only 模型的痛点,而 T5Gemma 2 在这方面展现了降维打击的实力。尽管预训练序列长度仅为 16K,但它在 128K 的长文本测试中依然稳健。Encoder-Decoder 架构中,编码器专门负责输入理解,而交叉注意力机制则像一个精准的检索器,能够从海量背景中提取关键信息。这证明了架构本身的拓扑结构往往比单纯增加参数更能解决特定痛点。
从预训练到后训练的全面超越
T5Gemma 2 在预训练阶段就与 Gemma 3 旗鼓相当,而在经过轻量级的指令微调后,其性能在多项指标上实现了反超。这揭示了一个重要的趋势:Encoder-Decoder 架构在下游任务的迁移和微调中具有更高的天花板。
深度思考与金句
架构的选择从来不是非黑即白,而是关于感知与生成之间的平衡。T5Gemma 2 的成功告诉我们,Encoder 负责看世界,Decoder 负责说世界,这种分工明确的结构在处理复杂多模态信息时具有天然的优雅感。
如果说 Decoder-only 是在进行一场关于概率的豪赌,那么 Encoder-Decoder 则是在理解的基础上进行精准的表达。
原文链接:arxiv.org/abs/2512.14856
