Matthew Berman 最近采访了 OpenAI Codex 负责人 Tibo,整期大概 44 分钟,主要聊 Codex、Agent、下一代模型,以及 OpenAI 接下来的产品方向。
Tibo 这次访谈里透露的信息比我预想的多很多。
ChatGPT 和 Codex 最终会合并成同一个 personal AGI。Ultra Fast 这种速度可能 1~2 年后就会接近默认,未来的 Agent 也会越来越依赖 cloud,一台 laptop 的资源已经开始成为限制。
更有意思的是,现在这些需要手动维护 skills、memory、sub-agent 的复杂工作流,在 Tibo 看来都还很早期。
他描述的目标是让 Agent 长期理解你、你的目标、每天在做什么,甚至理解你的团队,然后主动帮你工作。
我把整期 44 分钟里比较重要的内容整理了一下:
0:45 Tibo 在 Google DeepMind 学到了什么
ChatGPT 发布大约一年前,Google 内部已经有 LM Chat。
当时的模型已经能生成连贯、甚至有帮助的内容,DeepMind 也产生了把 LM Chat 做成公开产品的想法。
Tibo 对那段经历的评价很直接,DeepMind 是一个非常有创造力的地方,但整个组织并没有很好地围绕 shipping product 运作。
到了 OpenAI,研究和产品团队会非常紧密地一起工作,从想法阶段就开始 co-design,而且整个组织有非常强的 shipping 倾向。
他现在很在意保留这种文化。
OpenAI 很 bottom-up,一个人有想法之后可以快速找人一起做,然后很快上线,对新产品想法的 stop energy 很少。
同时他也提到另一个问题。速度太快很容易让产品变成一堆互相没有关系的 feature,所以 OpenAI 现在也很强调 simplicity、performance、efficiency,以及最终产品整体的统一。
4:22 OpenAI 怎么保持这种高速文化
Tibo 给创业公司的建议其实很简单:要有 conviction,要尽早拥有真实用户,然后根据反馈快速迭代。
对于 OpenAI 这种已经很大的公司,还有一件更难的事情,就是愿意主动打乱自己已经建立起来的东西。
当新的研究、新能力出现之后,他们会重新判断资源应该放在哪里,有时候甚至会从当前主要业务里重新分配资源。
他说 AI 的未来不会等你把现在的业务慢慢经营舒服了。
而且模型能力也不是 benchmark 跑完就完全知道了。OpenAI 自己训练出新模型以后,内部还需要大量使用,才会突然发现它原来可以这样用,然后产品方向跟着发生变化。
他举了 voice 的例子。
现在新的 ChatGPT voice 足够自然,也能使用工具,他自己已经开始大量直接和 ChatGPT 说话。早上拿起手机,把今天要做的事情直接说出来,ChatGPT 有他的工具权限,然后自己开始工作。
这种模型能力的变化,会直接反过来改变产品设计。
7:23 Astra / 下一代模型和 Agent harness
这段我感觉非常值得看。
Tibo 说,现在高级 Codex 用户已经习惯了很多奇怪的复杂度。
你要维护 skill files,memory 偶尔会忘东西,使用 sub-agent 以后又要考虑 sub-agent 怎么工作,最后会构成一个越来越复杂的小网络。
OpenAI 想做的目标非常明确:
Agent 深度理解你,理解你的目标,理解你的日常工作,理解你的团队,并且可以主动行动。
你不需要天天管理这些底层结构。
另外一个问题是 laptop 本身开始成为限制。
电脑本来就是按照人类的工作速度设计的。我们能同时处理多少窗口、打字有多快、一次开多少应用,这些限制对模型没有意义。
未来的模型可能可以同时处理 100 个 application,探索方案、写 tests、compile、验证不同 hypothesis 全部并行。
所以 Tibo 明确认为,下一代模型需要的资源会超过一台 laptop,cloud agent 会越来越重要。
11:18 开发者工作流会怎么变
这里有个观点我很喜欢,OpenAI 现在非常在意人的 attention。
目前很多人用 coding agent 的方式是一次开 10 个甚至 15 个 agent,然后不断 context switch,过半小时再回来检查结果。
Ultra Fast + voice 之后,工作流会发生很大变化。
Agent 的速度可以接近甚至超过你思考和表达的速度,你可以保持在同一个 flow 里,边说想法,边看 prototype,边让它生成 report,然后继续修改。
Tibo 把 Agent 方向分成两类。
一类是 personal AGI。
它非常了解你,和你一起工作,主动提出重要信息,而且覆盖 coding、research、advice 等各种任务。
另一类是 full automation。
比如自动看 production logs,发现性能问题以后自己优化;发现 regression 后自己 patch;安全 scanner 找到 vulnerability 后自动修复,把漏洞暴露窗口压到接近 0。
人在里面可能只需要批准 high-risk action。
14:27 ChatGPT 和 Codex 为什么一定要合并
这一段基本把 OpenAI 的产品终点讲明白了。
Tibo 说,他们一开始收到很多反馈:为什么一定要把 ChatGPT 和 Codex 合并?
他的回答是 future models want us to be merged。
因为未来底层就是同一种技术,同一个 harness,同一个高度 multimodal、voice-first、非常高效的 Agent。
它天然就能 coding,也天然能做其他事情。
OpenAI 最终想做的是一个 personal AGI,然后 interface 根据每个人自己适应。
程序员、设计师、PM、普通用户这些身份只是人类为了理解复杂现实创造出来的分类。每个人实际需要的能力都不同。
主持人问,那最后会不会真的只剩一个 interface?
Tibo 直接说,是的。
你和你妈妈未来用的是同一个东西。
连接的工具不同、做的事情不同、看到的界面和得到的能力也不同,但底层就是同一个 personal AGI。
他还提到了更 ambient 的交互。未来你在办公室白板上写东西,AI 可以看到;你直接对它说话,它理解你正在指什么。Vision、voice、人的语气、动作这些信息都会逐渐进入交互。
20:25 OpenAI vs Anthropic
Codex 已经到 2000 万用户了。
主持人专门问了一次 Anthropic,因为前一段时间 Anthropic 在 coding agent 上存在感非常强。
Tibo 的态度倒是挺 OpenAI 的,他说自己很少看竞争对手。
他现在关注的是模型能力、模型效率,以及怎么把这些能力交给尽可能多的人。
他认为 OpenAI 很重要的一点是 community 和 broad access。
Codex 合并进 ChatGPT 也是这个思路,把 coding agent 能力迅速分发给 PM、designer、sales、marketing 等大量原本不会专门去使用 coding product 的人。
他也明确提到,这次合并是 Codex 最近增长的重要推动力之一。
23:37 为什么 Tibo 老是给大家 reset limit
这段真的很好玩。
最开始 reset 单纯是补偿。
OpenAI 在快速迭代 Codex 的时候偶尔会把东西搞坏,或者配置出了问题,体验没有达到他们想要的水平。
Tibo 就觉得,用户这么依赖这个产品,结果我们弄坏了半小时,那就把 usage reset 掉,补回来。
然后这件事慢慢变成了社区传统。
更离谱的是,这个决定基本没有什么 marketing 或 finance 审批。
Tibo 原话大概就是:I can press the button whenever I want, whenever it feels right.
觉得该 reset,他就按。
现在甚至真的做了一个实体 reset button。
有时候产品也没坏,他们只是想庆祝某个节点,或者希望所有人都去试一下新东西,也会直接送 usage。
后面还聊到了为什么 OpenAI 有能力这么送 compute。
他们很早以前就开始大量规划计算资源,当时甚至有人质疑为什么要投这么多,现在这笔投入显然派上用场了。
同时新的 frontier model 也开始直接参与优化自己的 inference infrastructure。
比如 Soul 帮助优化 Luna 的 serving stack,Luna 价格下降了 80%。
除了成本,普通 inference 的速度相比三个月前也已经提高大约 60%,这个数字还没算 Ultra Fast。
30:25 递归自我改进已经开始出现了
主持人问,这算不算 recursive self-improvement 的早期形态?
Tibo 觉得算。
大家聊 recursive self-improvement 时通常想到的是 model 训练下一代 model。
OpenAI 现在已经大量用模型去优化支撑模型自己的 infrastructure。
包括 inference stack、CUDA kernels、serving、产品形态、cloud agents。
模型变强以后,可以帮助 OpenAI 更快改善运行模型的系统;系统变好之后,又能让模型发挥出更多能力,然后继续把这些能力投入系统本身。
Tibo 把整个东西看成 one big system。
32:00 OpenAI 为什么暂停 frontier RL
这部分 Tibo 没有透露具体安全事件的细节。
他的描述是,随着模型能力继续增加,alignment 和 safety 的重要性也在快速增加,OpenAI 因此大幅增加了这一块的投入。
那次 pause 给了团队时间去理解并 harden 整个 system,在达到一套比较明确的 safety principles 之后,再恢复训练。
主持人追问有没有一个明确的 unpause 条件。
Tibo 说 safety team 最后确实形成了一组比较清晰的 principles。
这件事在他的描述里已经属于 OpenAI 正常研究流程的一部分,需要暂停的时候,他们内部可以很快做出这种决定。
34:13 Ultra Fast 会不会变成默认速度
Ultra Fast 现在 OpenAI 内部最典型的用途其实是 incident response。
遇到 outage 时,incident commander 和 response team 会拿到 Ultra Fast,因为这种情况下每一秒都重要。
一些赶 DevDay、验证关键新 idea 的团队也会申请。
不过 14x token speed 不代表所有工作都真的快 14 倍。
大量生成代码这种 generation-heavy 的任务可以非常接近完整加速。
如果 Agent trajectory 里面有很多 tool calls,瓶颈就跑到 network、CPU 和其他 overhead 上了,实际可能只有 3x 到 4x。
OpenAI 内部也没有给所有员工无限 Ultra Fast。
因为内部自己就有能力把 production GPU 全吃光,所以他们会限制员工用量,大部分 Ultra Fast capacity 会留给外部 customers。
至于这种速度以后是不是永远属于 premium feature,Tibo 的判断很激进。
他觉得大概 1 到 2 年,这种速度可能就会接近 default。
原因也不只有 inference hardware。
模型本身的 token efficiency 也在快速提高。Soul 已经比 Terra 高效很多,他也直接说下一代模型会继续比 Soul 更高效。
当然,最上面永远还会有一个更贵、更快、愿意堆更多 hardware 的 tier。
43:20 为什么普通人也应该至少试一下 AI
Tibo 最后讲得其实挺朴素。
现在的模型能力正在快速变便宜。
Luna 这种今天已经非常小、非常便宜的模型,放到六个月前可能还处在 frontier。
他觉得这种变化会持续下去,今天昂贵的 intelligence,半年以后可能已经便宜很多,最后会变成非常普遍的资源。
至于完全没用过 AI、甚至有点害怕 AI 的人,他建议先看看身边的人到底怎么用。
写作、personal advice、health、finance,这些现在已经是很多 ChatGPT 用户每天真的在使用的东西。
他自己也会用 health,至少在去见医生以前,可以先把问题弄明白一点,让自己和医生交流时掌握更多信息。
有时候第一次理解 AI 的价值,可能真的就只是找到一个和自己生活有关的问题,然后试一次。
发布于 湖南
