AI并不会像人一样真正理解语言、拥有思想。它本质是一台超级概率预测机器,靠海量文本数据、神经网络训练,学会人类文字的搭配规律,完成类似“高级文字接龙”的工作。完整过程分为4个阶段;此外,用户实际提问时还有一个推理阶段,模型会逐词生成回答。
1. 准备海量清洗后的文本素材
工程师收集互联网公开网页、书籍、新闻、文章、对话等万亿规模文本,做过滤、去重、脱敏,剔除违法、错误、隐私内容,形成训练语料库。
AI不会背诵全部原文,只是从文本里学习:哪些词经常挨在一起、句子怎么组织、不同场景一般会说什么话。
2. 预训练:打下语言基础(最耗算力)
刚初始化完成的模型,内部全是随机数字,输出完全乱码。基于Transformer架构,做自监督预训练,训练任务就是:给定上文,预测下一个词元(Token)。
- 文字会先拆成Token(词片段)转为数字,模型只能处理数字信号。
- 反复做预测练习,不断调整模型内部数十亿、上千亿参数,优化预测准确度。
- 训练结束后,模型懂语法、常识、句式,能续写通顺文字,但还听不懂人的指令,经常自顾自续写,不会好好回答提问。
3. 监督微调SFT:学会听懂指令、会聊天
工作人员人工标注大量样本:「用户提问 → 理想回答」的配对对话数据。
把这些对话喂给模型继续训练,教会模型:看到用户提问,不是自由续写,而是输出对应回答,学会对话格式,知道区分用户说的话和AI输出内容,具备基础问答能力。
4. 人类反馈对齐RLHF/DPO:说话得体、符合人的喜好
同样问题让模型生成多版回答,人工对回答打分排序,区分哪个回答更准确、礼貌、安全。
- 训练奖励模型,自动评判回答质量好坏;
- 用强化学习迭代主模型,引导模型更多生成高分回答,减少生硬、错误、不安全输出;
经过对齐之后,AI说话才变得自然、有礼貌,懂得拒绝不合理请求。
推理阶段:用户实际提问时逐词生成回答
你输入问题之后:
- 用户文字拆成Token数字序列送入模型;
- 模型计算所有候选词的出现概率,挑选合适的词输出;
- 把刚生成的词,追加到上下文,再预测下一个词;
- 循环不断,一字一字输出完整回复,直到触发结束标记停止生成。
重点:整个过程没有“思考”,全部是数学概率运算,AI只是模仿人类文本里出现过的语言模式,并不真正明白自己在说什么。