indigo
26-09-18 07:48 微博认证:Hallidai 联合创始人 Brilliant Phoenix 合伙人 科技博主

这两天 TypeSafe 最新发布的 Jev 模型特别火,因为它不生成文字 👀 Jev 是一个“函数调用式”的前沿模型,输入是非结构化的状态(文本或程序状态),输出是带概率的类型化决策。它不生成自然语言,这是它有意舍弃的能力。名字来自卡尼曼的"系统一"直觉判断,与 LLM 擅长的"系统二"推理相对 http://t.cn/AXOKToqZ

在舍弃了传统 LLM 的很多东西后换来了三个亮点:端到端的延迟 70–500 毫秒;输入每百万 token 0.042 美元,输出免费;单次决策最多 255 个选项,且不会编造选项之外的答案。

一位叫 Archer Hume 的工程师通过一万次 API,把这个黑盒摸了一遍,结论基本印证了官方的说法:

1. 概率是直接读出的,而非逐 token 生成:API 的 output_tokens 只反映序列化响应长度,200 多个选项的问题和二选一返回速度几乎一样,token 数也不随概率值变化。作者推测最终隐向量经一个线性层加 softmax 得到分布;

2. 主干是因果 Transformer 解码器:Jev 在 MMLU-Pro 上有 84.6% 的准确率,说明有前沿级预训练,而 TypeSafe 也公开说过是在预训练语言模型上做 RLCD 后训练;

3. TypeSafe 的 RLCD(校准决策强化学习)用真实结果训练模型,使概率"诚实"。在 1,200 道 MMLU 题上,期望校准误差仅 0.0313;

4. 作者推测 Jev 是稀疏 MoE,活跃参数约 100 亿,依据是 3 万 token 约 160 毫秒的处理速度,以及这种仅 prefill 的设计恰好避开了 MoE 逐 token 解码的服务成本;

Jev 无需自回归解码即可并行分类,推理开销大幅降低;用结果而非语言建模目标训练出的概率可以直接用于业务阈值(例如 p(紧急) > 0.1 就升级处理);显式的数值分布让下游系统能把误报与漏报的代价写进业务逻辑,而不是藏在模型行为里。

它解决了一个真实问题:普通大模型的"置信度"只是文本 token,并不代表决策可靠。但 Jev 无法做任何需要自由文本输出的任务(写作、聊天、copilot);没有清晰决策结构的场景;数学证明、代码生成这类重推理任务;以及本身对延迟不敏感、用 LLM 就够的场景。

Jev 最有价值的地方不是替代 LLM,而是让 agent 系统里那些高频、低价值、但必须可靠的决策点(该不该升级、走哪个分支、这条数据属于哪类)变得又快又便宜又可量化🤔

发布于 加拿大