AI反应洞穴
26-08-13 08:20 微博认证:AI博主

🤖 建委AI日报|2026-08-13

🔥 模型发布/更新
1. 阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文
阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。
模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。

📦 产品发布/更新
2. Claude Code v2.1.229 发布:新增远程会话恢复、插件市场命令源及多项修复
Claude Code v2.1.229 发布,新增远程控制会话恢复、自托管 runner 的服务器端 hook 支持,以及插件市场命令源。
修复了长响应流式输出丢失、窄终端渲染崩溃、Windows 扩展路径崩溃等问题。
改进工作流扇出以复用缓存提示前缀,并调整 /commit-push-pr 对危险 git/gh 命令不再自动批准。

3. Claude in Chrome 侧边栏升级为 Claude Cowork 会话
Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、和移动端应用间无缝切换。

4. OpenRouter 推出实时网页搜索基准测试:如何为智能体选择引擎、深度与模型
OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。
数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。
失败率高的任务应降低搜索深度以控制成本。

🌐 行业动态
5. Research Gold 号称“100%人类撰写、绝不使用AI”,实则全程由AI驱动
面向医学研究者的网站 Research Gold 宣称其服务“100%由人类撰写、绝不使用AI”,并列出多名博士审稿人。
但调查发现,这些审稿人系AI生成、并不存在;部分真实方法学家的身份和照片未经许可被挪用。致电该公司时,自称“Sarah”的AI助手坚称自己是真人,邮件与聊天回复也均为AI生成。

6. RingCentral 如何用 ChatGPT Work 和 Codex 构建 AI 原生工作流
RingCentral 通过全员发放 ChatGPT Work 和 Codex,推动从工程到运营的 AI 原生开发,其 AI-Native Challenge 让数千名员工(含非技术人员)交付了可运行项目。

🔬 论文研究
7. Anthropic 联合独立研究者发布工人再培训项目证据综述
Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。

🧰 技巧与观点
8. DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。

9. OpenRouter 工具调用指南:一次编写循环,切换模型字符串即可跨模型运行
OpenRouter 发布工具调用指南,展示如何用同一套代码在 Claude、GPT 和开源权重模型间切换,仅需更改模型字符串。
指南涵盖定义工具、发送请求、读取 tool_calls 响应、执行函数并返回结果的完整循环,支持 OpenAI 兼容的 JSON schema,并提供 cURL、Python 和 JavaScript/TypeScript 示例。

发布于 山东