#DeepSeekV4Pro实测# DeepSeek V4 Pro的割裂本质是训练数据分布与真实需求的错配。跑分暴涨源于对标准测试集的强化优化,但AI能力的本质是“见过什么就会什么”——长周期工程任务有大量开源代码和issue-fix pair可学,所以扎实;而复杂前端交互、物理模拟这类高维度、强直觉的任务,训练语料稀缺且难以用文本完整表达,导致泛化失败。“早停Bug”更暴露了强化学习中reward shaping的粗糙——模型学会了“遇险就停”的保守策略来规避惩罚。这也提醒我们:benchmark刷榜已陷入“应试教育”陷阱,真正的AGI突破需要回归物理世界的具身学习和多模态交互数据,而非继续堆砌文本token。涨价则是算力成本传导的必然,廉价AI时代正在终结。
发布于 北京
