新智元
26-09-15 15:34 微博认证:新智元官方微博

OpenAI披露AI员工产出相当于人类3.1倍,首席科学家称研究重心转向递归自我改进;Anthropic达里奥随后撰文称RSI已在行业内发生。RSI的逻辑是:这一代AI参与研发让下一代AI变强,更强的AI再承担更多研发工作。

云知声U2-Flash把自迭代放进了后训练流程——模型发现薄弱环节、生成针对性数据、训练验证,循环推进,目标是打造能接住复杂日常工作的主力模型。

实测中,U2-Flash独立排查出vLLM一个并发Bug:禁用词参数与提示词共用同一分词器对象,引发偶发500错误,模型定位根因并修复,200次请求50并发全部通过。它还独立完成了图文并茂的新疆旅游PPT、买房租房十年账的可视化分析页面,以及从2D平面描述到3D办公室场景的完整建模。

U2-Flash采用稀疏MoE架构,总参数约266B,单次仅激活约10B,激活比例不到4%。SWE-Bench Pro拿到61.6分,DeepSWE较前代翻倍至64.6分,TerminalBench 3.0达24.3分、是前代9倍;办公场景WorkBuddy-Bench Office拿81分,超过DeepSeek-V4-Pro、GLM-5.2;知识数学方面GPQA Diamond 92.4分,HMMT 97.1分。

模型引入"隐式思考"机制,在隐藏状态空间中先探索多条解法路径,并提供none到max四档推理强度可选。首字响应3秒内,输出峰值300 tokens/s,Agent任务完成时间比前代缩短35%,同等任务成本约为对手四分之一。

后训练层面,团队用强弱模型对比找出决定成败的关键步骤,据此生成训练数据,并配合难度校准机制让题目始终贴着模型能力边界。训练采用异步Agent RL(GRPO),单位时间有效轨迹产出提升约60%;多教师在线策略蒸馏MOPD将数学、代码、Agent、指令跟随四个专项能力融合进同一模型,训练步数减少约55%。团队搭建的Agent还能自主监控、定位并恢复训练故障,恢复时长压缩至人工的三分之一。

U2-Flash已在云知声内部试用近一个月,覆盖HR、研发、文档等场景,支持512K上下文、128K最大输出及国产化适配。