OpenAI联合博通发布的全球首颗自研AI推理芯片Jalapeño(墨西哥辣椒)已正式亮相,这颗从设计到流片仅花9个月的芯片专攻推理场景而非训练,背后是成本、效率与战略的精密考量。
一、定位差异:推理与训练是两种不同“体力活”
训练重算力密度:训练大模型需海量数据并行计算,依赖英伟达GPU的CUDA生态与万卡级集群协同,短期内难以撼动。
推理重成本与延迟:推理是面向用户的日常调用,每天数亿次对话持续烧钱,芯片需在低延迟与高吞吐间平衡。
Jalapeño专为LLM推理优化:它是一款ASIC专用集成电路,从零围绕Transformer架构的注意力机制、内存搬运做深度匹配,砍掉图形渲染等通用能力。
二、商业逻辑:推理才是“无底洞”成本中心
推理成本压倒训练:OpenAI 2025年推理支出高达75亿美元,占340亿美元总运营费用的22%;2025年上半年仅推理就烧掉50.2亿美元,全年翻倍。
降本空间巨大:博通CEO陈福阳透露,Jalapeño推理成本比典型AI GPU降低约50%,这对每赚1美元就要花1.35美元的OpenAI至关重要。
芯片不对外销售:仅内部使用,直接服务于ChatGPT、Codex、API及未来智能体产品。
三、战略考量:自研芯片是“全栈飞轮”的支点
摆脱“算力佃农”地位:OpenAI总裁布罗克曼坦言公司“永远无法足够快地获取算力”,自研芯片是对供应链掌控的核心。
AI设计AI芯片:9个月流片的关键在于OpenAI用自家大模型参与RTL生成、验证与布局,压缩了设计-验证循环。
多代路线图:博通确认已制定多代芯片路线图,下一代预计2028年推出,此后每年迭代一次。
四、行业格局:自研芯片成头部AI公司“标配”
巨头集体下场:谷歌TPU迭代至第八代,亚马逊Trainium获2250亿美元收入承诺,微软Maia 200已部署,Meta发布四款MTIA芯片。
训练市场短期不变:英伟达CUDA生态与NVLink互联体系仍是训练领域的统治标准,但推理市场的蛋糕正被定制ASIC逐步切走。
未来或呈“异构混合”:训练用英伟达,推理用自研芯片,行业分工正从“两层”变为“全栈一体化”。