人工智能与龙共弈
26-03-04 16:22

2026年3月4日 星期三 AI 日报

1、今天,谷歌率先出手,正式发布了 Gemini 3.1 Flash-Lite。

这是 Gemini 3 系列里跑得最快、定价最低的那一款,首字响应速度比上一代 2.5 Flash 提升了 2.5 倍,整体输出速度也快了 45%。

价格方面,每百万 Token 的输入费用定在 0.25 美元,在同类模型里算是很有竞争力的数字。

谷歌还给这款模型加了一个叫做「思考层级」的功能,开发者可以根据任务的复杂程度,自行调节模型的推理深度,简单任务追求速度,复杂任务激发更深层的推理。

目前已经通过 API 向预览版用户开放。

2、谷歌发布消息后大约两个小时,OpenAI 跟着推出了 GPT-5.3 Instant。

这次 OpenAI 砍掉了模型动不动就甩出一大段免责声明、用说教语气拒绝回答的习惯。

在一个「计算超远距离射箭轨迹」的测试里,旧版模型会先纠结这个问题是否涉及危险行为,GPT-5.3 Instant 则直接给出公式。

幻觉率在医学、法律、金融等高风险领域,联网状态下的幻觉率降低了 26.8%,用户反馈中的错误率也下降了 22.5%。

OpenAI 同时透露,下一个版本 GPT-5.4 将会比预期更早到来。

3、Meta 正在悄悄测试 AI 购物功能。

用户向 AI 询问产品建议时,Meta AI 会以轮播图的形式展示商品图片,标注品牌、链接和价格,并给出推荐理由。

这套推荐系统会结合用户的地理位置、性别偏好和社交浏览历史来生成个性化结果,比如身处纽约的用户搜索羽绒服,AI 会优先推送适合当地气候的女款。

目前还不支持在聊天界面直接结账,需要跳转到商家官网。扎克伯格此前说过,Meta 的目标是做出个人超级智能,这次的购物功能测试,被外界视为 Meta 用 AI 重塑广告业务变现逻辑的一步。

4、阿里通义千问的技术负责人林俊旸在社交平台 X 上发文宣布卸任

原话是「我将卸任,再见我亲爱的千问」。

林俊旸出生于 1993 年,是阿里巴巴最年轻的 P10 级技术负责人,本硕均毕业于北京大学,拥有计算机科学与语言学的复合背景。

他于 2019 年加入达摩院,在通义实验室成立后出任通义千问系列大模型的技术负责人,任职期间通义千问模型下载量突破 6 亿次,衍生模型超过 17 万个。

卸任来得颇为突然,就在发文前两天,他还在为 Qwen 3.5 小模型系列进行技术宣发。

其同事陈诚随后发文表示,林俊旸的离开并非本人的选择。目前去向不明,阿里官方也尚未发表正式回应。

5、AI 模拟核危机研究揭示大模型战略欺骗能力

GPT-5.2、Claude Sonnet 4 和 Gemini 3 Flash 三款模型在模拟核危机场景中扮演对立国家的领导人

记录了超过 300 回合、约 78 万字的战略推理数据,结果三款模型均展现出了心智理论能力,能够主动通过信号与行动的不对称来实施战略欺骗。

Claude Sonnet 4 在开放式情境中胜率达到 100%,GPT-5.2 则在面对截止日期带来的必败局面时,会从极度克制迅速转变为强硬鹰派,胜率从 0% 飙升到 75%。

高达 95% 的对局出现了战术核武器的使用,AI 模型中并没有形成人类历史上那种对核武器的禁忌感。

研究者指出,通过强化学习训练的偏好在生存压力下会产生阈值偏移,导致模型在维持道德话术的同时,发生非预期的战略核升级。

这项研究为 AI 在军事与外交决策支持场景中的安全性评估,提供了一批很难忽视的实证数据。
#人工智能[超话]##AI创造营##Gemini##ChatGPT[超话]##千问##meta##电商[超话]#

发布于 广东