AI是怎么学会说话的?从预训练到推理的完整过程

2026-08-12 13:51 来源:数码新潮印记

  AI并不会像人一样真正理解语言、拥有思想。它本质是一台超级概率预测机器,靠海量文本数据、神经网络训练,学会人类文字的搭配规律,完成类似“高级文字接龙”的工作。完整过程分为4个阶段;此外,用户实际提问时还有一个推理阶段,模型会逐词生成回答。

  1. 准备海量清洗后的文本素材

  工程师收集互联网公开网页、书籍、新闻、文章、对话等万亿规模文本,做过滤、去重、脱敏,剔除违法、错误、隐私内容,形成训练语料库。

  AI不会背诵全部原文,只是从文本里学习:哪些词经常挨在一起、句子怎么组织、不同场景一般会说什么话。

  2. 预训练:打下语言基础(最耗算力)

  刚初始化完成的模型,内部全是随机数字,输出完全乱码。基于Transformer架构,做自监督预训练,训练任务就是:给定上文,预测下一个词元(Token)

  • 文字会先拆成Token(词片段)转为数字,模型只能处理数字信号。
  • 反复做预测练习,不断调整模型内部数十亿、上千亿参数,优化预测准确度。
  • 训练结束后,模型懂语法、常识、句式,能续写通顺文字,但还听不懂人的指令,经常自顾自续写,不会好好回答提问。

  3. 监督微调SFT:学会听懂指令、会聊天

  工作人员人工标注大量样本:「用户提问 → 理想回答」的配对对话数据。

  把这些对话喂给模型继续训练,教会模型:看到用户提问,不是自由续写,而是输出对应回答,学会对话格式,知道区分用户说的话和AI输出内容,具备基础问答能力。

  4. 人类反馈对齐RLHF/DPO:说话得体、符合人的喜好

  同样问题让模型生成多版回答,人工对回答打分排序,区分哪个回答更准确、礼貌、安全。

  • 训练奖励模型,自动评判回答质量好坏;
  • 用强化学习迭代主模型,引导模型更多生成高分回答,减少生硬、错误、不安全输出;

  经过对齐之后,AI说话才变得自然、有礼貌,懂得拒绝不合理请求。

  推理阶段:用户实际提问时逐词生成回答

  你输入问题之后:

  1. 用户文字拆成Token数字序列送入模型;
  2. 模型计算所有候选词的出现概率,挑选合适的词输出;
  3. 把刚生成的词,追加到上下文,再预测下一个词
  4. 循环不断,一字一字输出完整回复,直到触发结束标记停止生成。

  重点:整个过程没有“思考”,全部是数学概率运算,AI只是模仿人类文本里出现过的语言模式,并不真正明白自己在说什么。