伊妹耳
26-08-26 22:47 微博认证:科技博主

每次看到MoE,我脑子里都会自动出现一个画面:
公司来了个小活儿,老板说:“大家一起上!”
然后100多个人全部搬着椅子进会议室……
这显然太浪费了。
真正聪明的做法应该是:财务的事找财务,程序的事找程序,设计的事找设计,其他人该干嘛干嘛。
MoE差不多就是这个思路。
Qwen3.8-Flash主模型125B,但每个Token只激活6B。简单说就是“家底很厚,但干活的时候没必要全员出动”。
这也是为什么我觉得现在AI越来越像在从“堆硬件”进入“拼效率”。
参数当然重要,但怎么把这么大的模型跑得更快、更省,这里面其实全是技术活。
#阿里发布Qwen3.8Flash#

发布于 上海