《A History of Large Language Models》
大型语言模型(LLM)的发展史,浓缩精华
1️⃣ 起点:分布式表示
1980年代,Hinton等人提出神经网络通过“分布式表示”学习词向量,解决了统计语言模型维度灾难问题。2003年,Bengio等首创用神经网络联合训练词嵌入和语言模型,开创了基于词向量的概率语言建模。
2️⃣ 自回归框架
Bengio模型及后续LLM均采用自回归(next-word prediction)训练,最大化文本序列的似然。简单而强大,能生成连贯语言。
3️⃣ 神经网络训练的转折点:2012年AlexNet
计算能力和大数据的爆发,使得神经网络训练规模大幅提升,NLP领域开始规模化训练神经语言模型。
4️⃣ 词向量的突破:word2vec
Mikolov等人提出高效的浅层log-linear模型(CBOW和skip-gram),大幅简化训练,捕捉词语的语义和句法规律,实现“king - man + woman ≈ queen”的线性关系。
5️⃣ 长距离依赖与序列到序列模型
RNN/LSTM架构引入,可处理变长输入输出,支持机器翻译等任务。但固定长度上下文瓶颈限制了长文本建模能力。
6️⃣ 注意力机制的诞生与演进
2014年,Bahdanau等引入可微的“软”注意力机制,动态关注输入序列的不同部分,解决长距离依赖衰减问题。随后Luong等优化了注意力形式,推动了NMT性能提升。
7️⃣ Transformer革命(2017年)
Vaswani等提出完全基于注意力的Transformer架构,摒弃RNN和卷积,实现训练的高度并行化,大幅提高效率和性能,成为现代LLM的基石。
8️⃣ 预训练与微调
OpenAI提出生成式预训练(Generative Pre-Training)+判别式微调模式。大规模无监督预训练奠定基础,再用监督学习或强化学习(RLHF)进行任务适配与价值对齐。
9️⃣ 强化学习与模型对齐
通过RLHF让模型更好地遵循人类意图,减少偏见和不良行为,提升安全性与实用性。
🔟 规模与简单法则
LLM的核心力量是“简单方法+极致规模”。规模扩展带来质变:100B参数模型能链式推理,甚至在数学竞赛中夺冠。正如“苦涩教训”所言,简单且可扩展的方法终将胜出。
---
🌟 总结
从分布式表示到word2vec,从RNN到注意力机制,再到Transformer,LLM的崛起是持续积累与简化的结果。它们不是魔法,而是海量计算与简单原则的奇迹。未来,LLM将越来越懂人类语言,也将深刻影响社会各领域。
📚 想深入了解?原文详细梳理了这段历程:
gregorygundersen.com/blog/2025/10/01/large-language-models/
---
💡 延伸思考
LLM的成功告诉我们,深奥的智能不一定来自复杂的规则,而是大规模数据与并行计算的力量。与此同时,人类专业知识依然不可替代,未来AI与专家的结合将创造更大价值。保持谦逊,拥抱变化,迎接智能新时代!
