【扛住海量衝擊!“牛來”Ai全由超10萬張中國國產芯片卡承載】過去一周,一個名叫“牛來”的中國神秘大模型在海外開發者社區突然爆火。8月26日晚,中國智譜正式宣布,這個匿名模型Ox-Alpha(中文社區稱為“牛來”)就是其最新開源的GLM-5.3-Flash。
而真正讓行業震動的是另一個消息:支撐這款模型全部流量的,是超過10萬張中國國產芯片卡。
GLM-5.3-Flash是智譜GLM-5系列的首個原生多模態模型,總參數320B,激活參數僅18B。正式發佈前,智譜選擇以匿名身份在OpenRouter和OpenCode兩大海外平台免費開放測試。
結果出人意料。“牛來”迅速登頂雙平台,5天累計Token調用量高達62萬億,刷新了兩個平台的歷史紀錄。
模型火了,但一個更大的疑問隨之而來:如此大規模的海量流量,算力從哪來?
據報道,測試期間每日高達100萬億Token的流量,全部由超過10萬張中國國產芯片集群承載。這是中國國產算力芯片首次大規模集體“出海”,直接服務全球真實負載。
據科技行業媒體了解,這批芯片的供應商或來自華為、摩爾線程與海光。
智譜官方對此未予置評,技術文檔中也沒有明確具體芯片型號。但可以確定的是,這些芯片通過自研高帶寬互聯網絡連接,形成了一個大規模國產算力集群。
中國國產芯片能跑大模型,這本身不算新聞。但要在全球海量真實流量下跑出與英偉達GPU旗鼓相當的成本效率,是另一回事。
據了解,單張中國國產芯片當前的主要瓶頸在於內存容量和帶寬,而GLM-5.3-Flash又原生支持最長100萬Token的上下文,對顯存和通信提出了極高要求。
據報道,智譜創新性的優化了多項技術。
智譜在SGLang基礎上構建了專用推理引擎,採用W8A8量化、INT8/FP8/BF16混合緩存量化等多項技術。
在集群層面,智譜採用了Encode-Prefill-Decode(EPD)分離式架構,將多模態編碼、Prompt預填充和逐Token解碼拆分為三個可以獨立調度和擴縮容的工作池。
與同一批硬件上的初始基線相比,端到端服務性能提升了3倍。
智譜在官方技術文檔中表示,“硬件效率和單Token成本已達到與主流英偉達GPU相當的水平”。
據報道,半導體研究機構SemiAnalysis隨即在X平台發文評論:“所有流量均由中國國產芯片承載,硬件效率和單token成本已可與英偉達GPU相媲美。繼Jalapeño(OpenAI自研推理芯片)昨日(8月25日)宣布之後,CUDA護城河再度受到考驗。”
“牛來”的爆發,不只是智譜的一次產品成功,更是中國國產算力的一次集體證明。
