我对AI办公的理解,分为三层。第一层,Office三件套;文档、表格、PPT,加上生成和编辑,通用 Agent 的基座。
有了三件套,再带上技能和记忆,Agent能进公司干活了。但进了公司,光会做文档不够,得碰得到业务系统,这就到了第二层,连接层。
MCP、CLI,把 CRM、ERP系统串起来,Agent 才能在系统之间来回搬信息,处理企业级的活儿。
这一层各家都在积极做,本质一个Chat自带手脚进了不同组织,你可以管这叫数据穿墙。
真正分层的,是连接的质量。举个例子:
我每天下午4点港股收盘,都会去跑收盘数据,绝大部分AI办公跑不出来。为啥呢?
接口是接了,数据不到位,有延迟,要么调动不了;这是产品体验链接层的第一个分水岭。
再往上一层,第三层,垂类交付。
金融客户、做研报的人,表面上要一份 PPT、文章,实际上,背后要调动的工具和 Agent 完全不一样。
我每次查瑞银、摩根大通报告,有的 AI 办公他做了云端search,能直接搜到外媒原文,有的连云端搜索都没有,这是检索能力的差异。
更细的,即便都接了 CLI,拿到数据也不一样。
这么说吧,比如国内:
通达信把三十年金融数据封装成接口,卖给各家 Agent,但 L2 十档行情因为合规限制还不能远程调,这就是数据授权的生意,愿不愿意给你用。
这一层没有统一答案,金融一套,教育一套,法律又一套,每个赛道差异的核心还是数据,跟通用上下文关系不大。
还有一层跟基础模型有关。
做研报这种大交付,一个模型要读财报、研究报告,非常吃上下文;目前256K上下文撑不住,我觉得 1M 很重要,这只是我的体感。
基模关键有两点:
一,Agent 调度,接下一个任务后,能不能快速并行地分给子 Agent 处理;二,推理,能不能严格遵守指令、不跑偏地把活干了,还不浪费 Token。
我目前用基模,比较多的是Qwen3.8 -max、Kimi k3、智谱GM 5.3;这几个哪个性价比最高?个人认为千问,其次是智谱;调动我用Deepseek V4 flash。
所以,AI 办公最后拼什么:垂类、数据、基模;以及ToB能够拿下多少客户?
Agent 编排、产品外皮都能做,复杂的是谁能把基模做好,快速进入企业把活干明白。
对了,还有一个是智能体;实际上,智能体是交付层与连接层中间可以做成loop循环的东西。
还有一点,AI办公ToB订阅付费可能不是一种最佳方式;大企业一旦布局,就要24小时轮流用偷啃,到时候,偷啃消耗像水电煤,离不开还瘾大。
发布于 北京
