鸿泽思维
26-06-09 20:06 微博认证:头像本人

有些同学问,我听了那么多transformer的课,怎么还是一头雾水呢?那多正常,给你讲的人也没整明白。网络上很人一直对着transformer的架构图讲,怎么说呢,你就当听相声就行。

这个图是2017年谷歌论文《attention all you need》的上古老图,都包浆了。论文创造性地提出了transformer核心实现机制QKV向量计算的算法,这是毫无疑问的。但这个论文非常短小,是学术风格的,面向机器学习的翻译场景,与当下的AI只能说是爷爷辈的关系了。

你是在学AI的发展史,听听是可以的,如果你想学现在大模型的实现,入门ai,看还不如不看。它的意义在于搞明白当代大模型的实现机制以后,回去看论文向老祖致敬,除此之外,没了。

现在的AI,也就是LLM大模型的框架是openai在2019年发布的gpt2体系,已经对2017年的transformer进行了魔改和工程化落地。机制没怎么变,但流程和实现变化了。比如说图中的encode编码器已经被delete,decode统一了transformer的业务实现。

也就是说,在实际的大模型算法开发过程中,并不是图中这样的两块并行,而是一条线撸到底的线性过程。

拿这张图翻来覆去讲的,主打一个反正你也听不懂,纯属娱乐。

发布于 北京