酋知鱼
26-07-24 17:37 微博认证:微博新知博主 汽车博主

《真正高效的硅脑,可能和人脑一样脆弱?》

“神经网络”这个词我们已经叫得顺口了。但今天所有大模型的底子,都还是冯·诺依曼架构——用软件在上面跑神经网络,本质上是一场精细的行为模拟。

CPU和GPU是万能积木,最高美德是图灵完备。代价也很明确:计算单元和存储单元物理上分家,数据得在两者之间来回倒腾——取指、译码、加载、写回。芯片大部分功耗,其实不是花在“算”上,而是花在“搬”和“等”上。我们成天说的“训练”,不过是在这套为通用而生的物理系统上,硬跑一个它并不擅长的计算范式。

人脑走的是另一条路。你梭状回面孔区那些神经元的连接拓扑,它自己就是一套物化了的“人脸检测算法”。韦尼克区多层回路的物理结构,直接刻着句法解析的规则。算法不是被加载进去的,是被浇筑进去的。记忆也不是存进某个独立仓库——一个亲近的人,对应的是一组真实发生的物理重构:突触的增强、树突棘的新生。信息即物质,存储即计算。

当前最顶的GPU,能效比大概在2–3 TOPS/W这个区间。英伟达H100跑INT8精度,撑到顶也就3–4 TOPS/W。这已经是人类半导体工程的极限手艺了。

可如果我们把Transformer的网络拓扑直接物化成硅电路——存内计算架构,用忆阻器交叉阵列去做矩阵乘法的物理模拟——理论能效比能到500–1000 TOPS/W。一千TOPS每瓦。三百倍的差距。

这还不是天花板。如果再往前走一步,用模拟计算的方式,直接在存储阵列里靠基尔霍夫定律和欧姆定律完成向量-矩阵乘法,单次推理延迟可以从毫秒级直接压进纳秒级。一个千亿参数模型跑一次前向传播,耗时比现在输入一个token还要短。

延迟:< 1微秒。功耗:< 1毫瓦。

一块纽扣电池,能让一个GPT-4级别的智能,不停不歇地干上十年。一片指甲盖大小的薄片,就能吞下一整个今天最大体量的基础模型。

这才是物理意义上的神经网络。不是用软件在通用平台上搭出来的积木城堡,而是算法直接长进了硅的掺杂浓度里,长进了忆阻器的电导态里,长进了光波导的折射率里。权重不再是被“存储”的数据,它就是物质本身的一种属性。

人类发明了印刷机,让思想能批量复制;造出了核反应堆,让物质直接化为能量。而“物化智能”——让一段算法获得物理的肉身,变成一个独立的、通电即活的实体——这大概是我们头一回,在创造的谱系上,离生命这么近。

积木时代是必要的铺垫。但只有浇筑时代真正到来,我们才算造出了一颗硅脑。

 

发布于 上海