人工智能与龙共弈
26-03-24 19:59

涨知识的 AI 黑话:从 Token 词元 到 AI Agent 读懂未来

中国政府网援引国家数据局权威数据,我国日均 Token 词元 调用量已突破140万亿,词元二字的正式落地。

Token 这个在人工智能领域流通多年的英文词,终于有了经官方认可的中文名称。

词元,是AI理解人类语言的最小单位,其切分粒度介于字与词之间,能够更精准地覆盖大模型处理文本时的语义切片,这个名字简洁、贴切,也体现了语言学与计算机科学之间的融合。

Token 获得中文定名,只是AI领域浩瀚词汇体系中的一个缩影,整个人工智能产业在过去数十年间,积累了大量专业英文术语,它们构成了这个领域的基础语言,也深刻影响着从业者的思维方式,了解这些术语,是进入AI世界的必要门槛。

那么问题来了,在 AI 领域还有哪些单词是需要我们了解的呢?

最为核心的概念之一,是LLM,即Large Language Model,大型语言模型。

这是当前 AI 产业最炙手可热的技术方向,GPT、Claude、DeepSeek 等产品都属于这一范畴。

Transformer 是一种革命性的神经网络架构

核心机制叫做 Attention Mechanism,注意力机制

模型在处理文本时,能够动态地判断哪些词与哪些词之间的关联更为重要,从而大幅提升了语言理解的质量。

NLP 是 Natural Language Processing 自然语言处理,是 AI 与人类语言打交道的整个学科分支。

在 NLP 的范畴之下,有一系列更具体的任务,例如情感分析(Sentiment Analysis)、命名实体识别(Named Entity Recognition)、机器翻译(Machine Translation)等。

这些任务在搜索引擎、智能客服、内容审核等场景中被广泛应用,早已渗透进日常生活的每个角落。

Prompt,提示词,是人与大模型交互的基本方式。

用户输入的每一段文字,都是一个 Prompt,围绕如何写出更有效的提示词,甚至形成了一门叫做 Prompt Engineering 提示词工程 的新兴技术方向。

RAG 是 Retrieval-Augmented Generation,检索增强生成

模型在生成回答时,可以先从外部知识库中检索相关信息,从而提升回答的准确性与时效性,有效缓解了大模型幻觉 Hallucination 的问题。

Hallucination 幻觉是模型以极为自信的语气输出实际上错误或虚构的内容,是当前大模型技术面临的重要挑战之一。

训练一个大模型,需要经历若干关键阶段

预训练 Pre-training 是第一步,模型在海量文本数据上学习语言的基本规律。

微调 Fine-tuning 让模型在特定任务或特定风格的数据上进一步学习,以适应具体的应用场景。

RLHF是 Reinforcement Learning from Human Feedback 基于人类反馈的强化学习,成为提升模型对话质量的重要手段,通过人类标注员对模型输出进行评分,再以强化学习的方式引导模型朝着更符合人类期望的方向优化。

Benchmark 基准测试是在模型的评估与部署环节衡量模型能力的标准化工具

Inference 推理 则是指模型接收输入、生成输出的实际运行过程,与训练阶段相对应。

模型的规模通常以参数量 Parameters 来衡量,参数量越大,模型的表达能力往往越强,但对算力和内存的要求也随之攀升,为了降低部署成本,量化 Quantization 技术应运而生,它通过降低参数的数值精度,在尽量保留模型能力的前提下,大幅压缩模型的体积。

Agent 智能体 是一种能够自主规划、调用工具、执行多步骤任务的AI系统,可以理解为具备一定自主行动能力的 AI 程序。

多个智能体协同配合,形成 Multi-Agent System 多智能体系统,在复杂任务的自动化处理中展现出巨大潜力。

Function Calling 是函数调用,是大模型与外部工具、API进行交互的技术桥梁。

Embedding 是嵌入,是将文字、图片等信息转化为高维数值向量的技术,使得计算机能够以数学方式理解语义的相似性。

Vector Database,向量数据库,则是专门用于存储和检索这类向量数据的基础设施,是 RAG 系统的重要组成部分。

从 Token 到 Transformer,从 NLP 到 Agent ,这些英文词汇构成了AI时代的通用语言。

词元的正式命名,是一个信号,标志着中文世界正在以更加主动的姿态,参与到人工智能的概念体系建构之中。

140万亿这个数字背后,是无数次人与机器之间的语言交互,是一个正在加速演进的智能时代的真实写照。

语言的命名,

往往是理解的开始。。。
#人工智能[超话]##token##词元#

发布于 广东