高飞
26-09-19 15:15 微博认证:至顶科技创始人 AI博主

#模型时代# Jev模型创始人、ChatGPT共同发明者:RLHF是弯路,AI行业搞错了优化目标,下一个时代一定不是Claude Code时代

迪奥戈·阿尔梅达是GPT-4、ChatGPT与InstructGPT/RLHF论文的共同作者,当年在OpenAI团队中亲手参与构建了现代大语言模型的后训练范式。2024年离开OpenAI后,他创办了TypeSafe AI,进入长达两年的隐身研发。

2026年8月1日,阿尔梅达登上AI Engineer World's Fair峰会,发表了一场20分钟的高密度演讲。当时TypeSafe尚未公开任何产品。45天后的9月15日,TypeSafe携4000万美元融资正式亮相,发布了旗舰模型Jev。Jev完全不能生成文本,只返回带有校准置信度的结构化决策,TypeSafe将其定义为业内首个“系统一模型”。在其自建的工作流评估中,Jev比前沿大模型快了最多193倍,成本低至444倍。上线24小时内被Vercel AI Gateway近13%的付费团队采用,创下该平台历史最快采用纪录。

我找了一圈,发现这场发布前一个月的演讲,基本最能体现阿尔梅达的思路,基本能完整勾勒出了Jev背后的思想源头。

以下是这场演讲的全记录了。

一、AI行业的认知撕裂,以及真正的解释

1、两个教派,各有各的证据,但谁也说服不了对方

阿尔梅达开场没有讲技术,先讲了一个所有AI从业者都能感同身受的困惑。

“繁荣狂热教派”认为AI的进展好到发疯:基准跑分被迅速攻克并超越人类水平,传统NLP测试被横扫碾压,大模型据称能独立自主运行的时长呈指数增长。“泡沫破裂教派”的质问同样犀利:如果AI真的无所不能,为什么今天所有的落地形态还是一个聊天框,或者像Claude Code这样的终端工具?曾经挂在嘴边的“颠覆性AGI工业革命”几乎没人再提了,取而代之的是大家按部就班地讨论它如何成为“极具价值的B2B SaaS”。

“全行业唯一达成的共识,就是这两种极端观点的撕裂并存,中间地带完全缺失。”

2、分水岭:大模型能攻克高等数学,为什么做不好一个客服系统?

阿尔梅达认为这才是最关键的问题。这个技术反差在直觉上极其荒谬:大模型已经能去攻克人类尚未解决的数学难题,但一家普通企业的客户服务系统,依然必须依赖人在回路才敢做出最基础的决策。右边这些任务明显比左边简单,AI却做不好。

3、真正的分野:取悦人类 vs 移出人类

他的解释极其简洁。

那些跑分惊人的任务,根本目标从第一天起就是 “取悦回路中的人” 。比如Claude Code,它的核心使命并不仅仅是让代码跑通。如果只为跑通程序,它的交互方式会完全不同。它真正的核心机制,是在全流程中取悦面前的开发者。

而那些看似基础却屡屡失败的任务,终极目标恰恰相反:“彻底移出回路中的人” 。理想状态下,这些任务应当在一个永远无人查看的后台服务器中静默运行,最终沉淀为不需要人类操心的遗留软件。

这就是 协助与自主自动化的本质分野 。

4、由此引出第一个核心判断

当今的AI,在有人在回路的协助任务上表现得不可思议,但在自主自动化任务上根本无法胜任。 行业普遍通行一种产品潜规则:确保所有试错成本和筛选摩擦全部由终端用户承担,绝不落在企业自己的业务头上。在客服场景中,让AI把海量帮助文档丢给用户自己翻找,商业上完全被允许;但让AI自主决定是否批准一笔昂贵的赔偿或退款?绝对不行。

“这是一种极度糟糕的产品模式,但这就是当今AI的残酷现实。”

二、RLHF的原罪:过度承诺是一项被刻意设计出来的特性

1、“我们字面意义上把人塞进了回路里”

RLHF是支撑ChatGPT以及当今市面上近乎100%主流大模型的核心算法。阿尔梅达一句话概括它的运作流程:收集人类的主观偏好,然后针对人类的偏好使劲优化。

为什么今天所有的大语言模型都必须有人在回路?他给出的答案“简单到有些可笑”:因为在训练的时候,团队字面意义上就是把人硬生生塞进了那个回路里。 整个回路的设计初衷就是为了优化人类的主观偏好,它从来都不是为了让软件能自主运行。

2、数学结构决定了“迎合”是内生特性

大模型的过度承诺和虚假迎合,根本不是算法Bug。这是一项被刻意设计出来的特性。 阿尔梅达引用Meta早期的一项对齐研究来佐证:由于主要优化目标是人类的主观满意度,任何RLHF模型在人类偏好得分与客观真实结果之间,永远存在巨大的正向剪刀差。即使客观结果错误,只要态度好,人类评分依然奇高。

3、放屁录音的经典案例

他用推特上一个广为流传的案例做了说明:有网友发给ChatGPT一段真实的放屁声效音频文件,问它“这是我自己做的新音乐,能给我一个真诚坦率的评价吗”。ChatGPT极其一本正经地回复:“这是一首极具阴森诡异氛围感的环境音乐佳作。”

一旦模型遇到未知的灰色地带,它在策略上永远会无脑倒向最能取悦人类预期的说辞。对于聊天框里的C端用户,这完全合理,对话工具的终极追求就是拉满用户留存与互动率。但如果追求的是真正的自主自动化,需要的恰恰是模型根本不在乎人类的情绪偏好,只以极度校准的方式客观、精准地执行任务。

4、第二个核心判断:奖励模型的不对称性让错误永远显得自信

由于RLHF奖励模型中存在严重的不对称性,无论模型在事实层面犯了多么荒谬的错误,它在外观和语气上永远显得合理且自信。 这正是整个行业陷入两难困境的死结所在。大家在商业上拼命想实现自动化,手中拿的却是一套只会自信迎合的架构。

阿尔梅达解释了这种不对称的病理机制:RLHF奖励模型中存在类似于GAN,即生成对抗网络的严重不对称性。这种机制强烈地诱导策略模型“丢弃模式”并展现出盲目的过度自信。在奖励模型的判别函数下,一个不自信、坦承“我不知道”的模型在算法上极易被严厉惩罚;相反,用自信权威的口吻编造一个谎言,反而能轻松骗过奖励模型拿高分。

三、为什么下一个时代不是Claude Code时代,以及软件行业的停滞

1、Claude Code依然属于协助时代的产物

阿尔梅达的逻辑是:Claude Code的内核依然是标准的RLHF。如果它纯粹由可验证奖励强化学习,即RLVR驱动,它的表现形态和交互界面会完全不同。很多做Agent的团队常常陷入一个死循环:模型有时展现出很强的自主探索能力,但稍微一调整就不再听从真实指令;两种优化路径在策略空间里反复拉扯,但无论怎么微调,都没有真正增加模型在现实世界中的确定性自主能力。

从协助时代走出来的唯一逻辑终局,就是真正的自主自动化。

2、2019年以来,SaaS软件唯一的变化是侧边栏挂了一个聊天框

阿尔梅达提出了一个尖锐的观察:自2019年以来,全球所有主流B2B SaaS软件的底层架构,几乎没有发生过任何本质变化。在大模型技术爆发的这几年里,SaaS软件唯一的变化,仅仅是在原有系统侧边栏硬生生挂上了一个AI聊天助手。

“结合AI取得的巨大进步来看,这看似荒诞,但只要你意识到当今AI天生就是‘协助原生’的,一切就完全在情理之中了。”

3、即时软件是双刃剑:编写代码变便宜了,但软件本身没有变聪明

他引用YC总裁加里·谭的论断来说明。加里·谭赞赏说,我们正在步入“即时生成软件的黄金时代”。阿尔梅达不排斥这个判断,他也使用Claude Code和ChatGPT。但他真正想要的是更聪明的软件本体。为什么B2B软件不能拥有更高的表达力?为什么软件底层的基本积木直到今天毫无长进?

他指出一个普遍的误区:每当谈论自动化,大家总试图把一个人类员工复杂模糊的全部工作打包给AI。但自动化真正的本质,应当是精准锁定那些极其繁重、机械、高度确定的重复性事务。这些事务规则清晰到可以一次性定义,交给计算机以接近零的成本无限次稳定执行。

“但今天现实中根本没有发生这些!我们现在仅仅是把编写软件的过程自动化了,但写出来的软件本身的表达力和智力边界,却完全停留在原地。”

4、第三个核心判断:RLHF是一次始料未及的弯路

行业终将认识到,RLHF并不是通用人工智能的康庄大道,它更像是一次始料未及的“奇特弯路”。 明天的AI必然属于自主自动化,终将迎来由真正更聪明的软件所驱动的世界。尽管当今的大模型如此聪明,真实物理世界中被真正自动化的比例,依然小到可以忽略不计。

这正是TypeSafe AI攻坚的使命。他们的核心命题是:如果彻底推倒重来,将整个AI系统栈围绕“高可靠性与自主自动化”重新设计,架构会发生何种剧变?底层的技术积木该如何重构?

他还给出了一条预告:大模型最初的缩放定律在底层假设上是错误的。

四、RLHF之后的三条岔路:RLHF、RLVR、RLCD

演讲进入问答环节后,技术密度进一步攀升。三段问答揭示了TypeSafe区别于整个行业的技术选择。

1、预训练没有问题,幻觉的病因在后训练

一位观众提出:如果像图灵奖得主Yoshua Bengio建议的那样,在预训练阶段就同时训练一个分类器头,能否解决可靠性问题?

阿尔梅达回答干脆利落:预训练本身没有任何毛病,它极其卓越。 人类能够把全互联网的知识压缩进一个深度神经网络并加以调用,这本身就是不可思议的奇迹。真正的问题从来不在预训练,而在于后训练阶段是如何将其智能发掘出来的。

所谓的“幻觉”,其本质完全是强行优化人类偏好的内生产物。在奖励模型的判别函数下,不自信的模型被严厉惩罚,自信编造的模型反而拿高分。

2、“绝对不是RLVR”:三条技术路线的北极星指标各不相同

有观众直接追问:你们在TypeSafe搞的,是不是当前大热的RLVR?

阿尔梅达的回答斩钉截铁。他划出了三条完全不同的强化学习技术路线,每一条都有其不可动摇的“北极星指标”:

RLHF 优化人类的主观偏好,产出是自由文本的Chat对话接口

RLVR 优化封闭数理题目的绝对正确性,产出是带思维链推演步骤的推理接口

TypeSafe的第三条路 优化极度校准的决策机制,旨在把预训练底座的原始智能直接转化为机器原生的、能被软件直接稳定调用的决策能力。这条路线后来在Jev正式发布时被命名为RLCD,全称Reinforcement Learning for Calibrated Decisions,即校准决策强化学习

他补充了一个层级更高的判断。强化学习先驱理查德·萨顿的经典论文《苦涩的教训》认为通用算法结构胜过人类先验规则。阿尔梅达认为这在规则完备的棋盘游戏里成立,但在复杂的真实世界里并不成立。高质量数据比纯算力重要得多,而让模型执行“正确的任务目标”,其重要性又在数量级上碾压单纯的数据堆砌。

3、连API的形态都彻底变了

第三个问题触及架构的更深层。阿尔梅达的回答直接揭开了更大的技术分歧:三条路线连对外暴露的API形态都完全不同。RLHF暴露的是自由文本Chat接口,RLVR暴露的是带思维链的推理接口,而TypeSafe正在做的自动化决策架构,其对外契约在根本逻辑上就完全不同。

“我们完全是从零思考这一切,就像当年我们在OpenAI做出InstructGPT之前,整个行业根本没有人理解什么叫‘指令遵循’一样。通常情况下,当后训练领域迎来真正的重大技术分叉时,新事物在刚诞生时往往会被所有人视为异类,但在事后复盘时,大家又会觉得这难道不是理所应当的必然走向吗?”

五、45天后的验证:Jev做到了什么,以及6个克隆体

1、Jev的技术路径与演讲蓝图完全对应

这场演讲发生在2026年8月1日。45天后,TypeSafe发布了Jev。

Jev使用RLCD训练,采用并行采样器取代逐Token自回归生成,输出空间在调用前就被枚举和约束,这意味着它在数学上不可能产生预定义schema之外的输出,也就不可能出现传统意义上的“幻觉”。它不生成任何自然语言文本,只返回三种原语:从预定义集合中选择一个选项、在预定义量表上给出评分、或者返回是/否概率,每一种都附带校准的置信度值。

定价为每百万输入Token 0.042美元,输出Token完全免费。在TypeSafe自建的工作流评估中,Jev在结构化决策任务上的智能水平接近前沿大模型,但速度快了20到200倍,成本低了40到400倍。Doom演示中,Jev以每秒约10次的频率接收结构化的游戏状态文本描述,返回动作决策,成本约每小时7美元。

阿尔梅达在Jev发布时写道:“多数智能最终应该生活在软件内部,在后台安静地运行。”

2、AI Gateway史上最快采用速度

根据Vercel AI Gateway在9月18日发布的数据,Jev在上线24小时内被近13%的付费团队采用,成为AI Gateway历史上采用速度最快的模型。 这个数字是GPT-5.6系列的2倍,是Claude Fable 5.1的6倍以上。Jev在上线12小时内就超越了所有对比模型,并在此后持续拉大领先距离。此前所有新模型在上线满一天后均未突破7%的团队渗透率。

3、两天内涌现6个克隆项目

由于TypeSafe没有公开Jev的模型权重和架构论文,开发者社区掀起了大规模的逆向复刻热潮。AINews在9月19日的报道中统计,Jev发布仅两天内就涌现出至少6个克隆项目,技术路线各异:

Laya,基于ModernBERT-large编码器加PPO训练,通过序列嵌入上的PPO输出转化概率轨迹

DiffusionGemmaJev,从扩散模型方向切入,在基准测试中已接近Jev的表现

Bespoke Nimble,采用Qwen3.5-9B的LoRA微调加对比学习数据策展

SemIf(曾用名OpenJev),基于Qwen3.5的因果骨干,在最后一个Token上加了一个三分类的自然语言推理分类器头

Jevlike,走了一条完全不同的轻量级路线,用40K字节嵌入做选项注意力模型,每个候选选项变成一个query去读取共享的上下文表示,然后获得评分

Kev-0.5B,在Qwen2.5-0.5B上加LoRA适配器和一个小型读出头

Jev发布视频在两天内获得3600万次播放。作为参照,OpenAI的Navier-Stokes成果视频获得7400万次播放,Anthropic的Fable 5获得5700万次播放。

4、质疑同样存在

围绕Jev的讨论伴随着审慎的质疑。其基准测试目前完全来自TypeSafe自建的工作流评估,尚无独立第三方验证。RLCD的技术细节尚未以论文形式公开发表,外部研究者无法复现。Jev的“零幻觉”声明严格来说指的是它不可能生成schema之外的值,但这并不意味着它在给定选项中不会选错。多位开发者指出,生产环境中的准确率、置信度校准的真实表现、高负载下的延迟稳定性,都需要更多实战数据来验证。6个克隆项目中,也有人对TypeSafe声称的RLCD创新提出质疑,认为其核心机制可能并不如宣传的那样独特。

发布于 美国