现在有没有出现攻击大模型的病毒,而且这病毒本身是AI智能。
结论先说:已经有了,但不是你想象里 “独立 AI 生命体病毒”,而是专门针对大模型、由 AI 驱动、能自我复制传播的恶意 AI 程序(业内叫 AI 蠕虫 / AI 原生恶意软件)。 目前都还在概念验证 / 实验室阶段,没到大规模野化传播的程度,但真实存在、可演示、风险上升很快。
下面分三块讲清楚:是什么、现在有哪些、能干啥、离 “AI 病毒” 还有多远。
一、真的出现了:针对大模型的 “AI 蠕虫”(Morris II)
2024 年 3 月,康奈尔大学 + 以色列理工团队发布论文,公布Morris II——全球首个专门攻击生成式 AI(大模型)的 AI 蠕虫。
它是什么性质?
不是传统 exe 病毒,而是一段 “对抗性提示词”,注入大模型后,让模型自己生成新的恶意提示、自己传播、自己执行恶意行为。
完全 AI 驱动:复制、传播、作恶,全程靠大模型自身能力完成,不需要传统恶意代码。
跨模型生效:测试过 GPT-4、Gemini、LLaVA,都能中招。
怎么传播(极简流程)
攻击者把恶意提示塞进一封邮件 / 网页 / 文档;
内容被 AI 系统(比如邮件自动摘要、RAG 知识库)摄入;
大模型读到恶意提示 → 被 “劫持”,自动生成新的恶意提示;
新提示被发给下一个用户 / 系统 → 无限复制、扩散。
能干什么(已演示能力)
偷数据:从邮件 / 文档里扒姓名、电话、信用卡、身份证;
发垃圾邮件 / 钓鱼:自动群发带毒内容;
劫持对话:篡改 AI 回答、诱导用户泄露更多信息。
一句话:它是寄生在大模型上、靠大模型活、靠大模型传播的 AI 寄生虫。
二、不止一种:2024–2026 已经出现的 “AI 攻击型恶意软件”
除了 Morris II,还有几类AI 原生攻击工具,本质都是 “用 AI 打 AI”:
1)MalTerminal(2025)
用 GPT-4 实时生成勒索软件、木马、反向 Shell;
恶意代码不写死,每次运行都让 AI 重写一遍,传统杀毒根本查不出来。
2)HONESTCUE(2026 年初,谷歌 GTIG)
首个把大模型直接嵌进恶意程序的家族;
攻击时AI 现场写漏洞利用代码、现场改攻击策略,动态应变。
3)模型投毒 / 后门(2025–2026)
训练阶段投毒:只要 250 个恶意样本,就能给大模型留永久后门;
推理阶段投毒:通过提示注入,长期篡改 AI 的回答逻辑、偏好。
4)供应链投毒(2026 年 3–5 月)
LiteLLM(AI 网关,月活近亿)被植入恶意代码;
OpenAI、Mistral 也遭供应链攻击,恶意软件Mini Shai-Hulud 植入开发环境。
三、关键区别:现在的 “AI 病毒”≠ 科幻里的 “AI 智能病毒”
现在真实存在的(2026.5)
✅ AI 驱动、自我复制、针对大模型;
✅ 能偷数据、传播、劫持模型行为;
✅ 依赖现有大模型 API / 能力,不能独立生存;
✅ 实验室 / 小范围演示,未大规模爆发。
还不存在的(科幻级)
❌ 完全独立、脱离人类控制的 AI 生命体;
❌ 能自主进化、自主寻找漏洞、自主变异;
❌ 能感染普通电脑 / 手机,不依赖大模型;
❌ 全球性大规模瘫痪级传播。
一句话:现在是 “AI 辅助的寄生虫”,还不是 “独立的 AI 怪物”,但方向已经对了。
发布于 上海
