今日AI小科普:“分词器”。
我们知道,大语言模型(LLM)本质上就是一个复杂的“计算器”,输入一堆数字,经过计算后,输出一堆数字。
因此,要让大语言模型读懂人类的文字,第一步就是把它变成模型能理解的数字。这个负责“翻译”的组件,就是分词器(Tokenizer)。
现代大模型普遍采用了一种“子词分词法”,它的核心思想是将常见的高频词汇整体保留,把低频的生僻词拆解成常见的词根或音节。这就好比我们遇到不认识的复杂汉字,会习惯性地把它拆解成熟知的偏旁部首。
那分词器拆完原始文本之后,该怎么翻译成模型能理解的数字呢?答案就是分词器专用的“字典”——词表。
开发者会先收集海量的文本数据,把它们全部喂给分词器。分词器利用统计算法,在庞大的语料库中寻找字母或汉字的相邻规律。经过反复的合并和筛选,分词器最终编撰出了一本专属的“字典”。
你可以把它想象成一张只有两列的超大Excel表格。表格的第一列存放着文字片段,第二列存放着唯一对应的整数序号。比如英文单词“apple”、“hello”,对应的数字就可能是“114”、“514”,这样一个数字序号,就是一个Token ID。
于是,当你发消息给模型时,消息首先会发给分词器,分词器就会按照词表来对你的文本进行拆分、翻译,再把对应的数字发给模型。
等模型计算完,输出的也是数字,同理,这串数字也会先发给分词器,分词器再依照词表来对结果进行反向翻译,这样你收到的就是能看懂的文本了。
(图片就是从模型视角看你们之间的对话。)
#how i ai##ai##大模型#
发布于 北京
