🔧芯模协同进化,Qwen探索RSI
语言模型持续向更复杂的 Agent 任务推进,但能力落地仍依赖芯片与推理栈两类关键工程,长期由人类分段设计和优化。我们希望让模型深入其中,依据真实工具反馈参与设计、验证和优化。为此,Qwen3.8-Max 分别完成两项生产级实验:一是从 NoC 模块规格出发,完成 RTL 设计、验证与物理实现;二是将 Qwen3.8-Flash-Next 部署到平头哥真武 M890,持续优化端到端推理性能。
我们将这条路径概括为“芯模协同进化”:让模型深入硬件工程的内部,读取真实工具反馈,将问题转化为可验证目标,保留有效改动、回退失败方案,形成反馈驱动的自主迭代闭环。
💾芯片设计自迭代
模型拿到的全部输入,只有一份芯片模块的设计需求。Qwen3.8-Max 在专业芯片设计工具中连续自主工作超过 60 小时,从编写电路代码,到搭建测试环境验证正确性,再到规划数十万个元件在芯片上如何摆放和连线,走完了芯片设计的完整流程。
最终成果与初始版本相比,使用的元件数量减少 29%,芯片面积缩小 42%,功耗降低 59.5%。测试环节发现的问题会被回传给设计环节修正,每一次失败都变成一次可追溯的改进。
⚡推理适配:56 小时从零打通新硬件
把一个模型部署到一块从未适配过的芯片上,通常需要工程师花费较长周期。在这项实验中,Qwen3.8-Max 用 56 小时在平头哥真武 M890 上完成了 Qwen3.8-Flash-Next 的从零适配与性能优化,期间派出四十多个并行子任务,分别探索不同方向的优化可能。
最终在计算精度完全一致的前提下,长文本场景的首字延迟下降 47%、每字延迟下降 60%,日常对话场景的吞吐量提升 96%。提速主要来自模型自己编写的八个高性能计算模块,以及一套整体调度优化方案。
🔬从两个工程闭环走向芯模协同进化
两项实验面向不同的硬件,不构成一条已经打通的联合生产线,但展示了同一件事:模型不再只输出一次性结果,而是能从真实反馈中持续改进自己的工作方法。任务目标、验收标准、安全边界和发布决策仍由人设定,模型在这些边界内拆解任务、执行实验、推动收敛。
让模型深入硬件工程的真实流程,从“使用工具”走向“参与建设”,是我们探索芯模协同进化的起点。目前仍有大量未触及的优化空间,更复杂的模块、更多型号的芯片、更多类型的工作负载,都还在路上等待持续探索。
#千问大模型##Qwen##AI#
