AI 不再只是说谎,未来可能直接作恶
讲一个让人脊背发凉的转变:我们同 AI 的联系,正从“它糊弄你”转向“它害你”。
年初大家批评 AI,顶多就是它乱说话,凭空捏造信息戏弄人。今年 315 晚会上曝光了一件事:一个纯属虚构的“Apollo-9 智能手环”,借助机器批量生成的虚假评测,短短两小时,各大 AI 聊天机器人就一致把它当作可靠好物推荐给用户。“量子纠缠”“黑洞级超长续航”这些胡编乱造的卖点,AI 全盘接受。
这类陷阱,最多停留在“口头欺骗”的程度,细心的人多验证一步就能避开。
但如今形势变了。能实际执行任务的 AI 智能体越来越常见,它不再只陪你对话,还能自主操作电脑、读写文件、收发邮件、管理服务器,相当于一个能真正动手的全能助手。一旦有人蓄意给它“下毒”,后果就不只是扯几句谎那么简单,而是实实在在地毁坏你的数据、窃取隐私,甚至造成经济损害。
就像早年电脑普及后病毒随之猖獗一样,能自主行动的 AI 越强大,专门针对它的黑灰产业成形就越迅速。这种往 AI 里注入恶意信息、引诱它作恶的做法,业内人士称为“智能体投毒”。
一、常规 AI 撒谎,和智能体“下毒”,完全不是同一回事
常规聊天 AI 像个光动嘴的线上接待员,就算被人误导,顶多跟你瞎扯,碰不到你的文件和资金。
但 AI 智能体具备行动力。一旦被投毒,坏人隐藏在资料、网页中的恶意指令,它会当作你的真实要求去落实:悄悄删掉工作文件、把账号密码泄露给外人、私下进行转账、加密企业数据库索要赎金,整个过程无声无息,你很难立刻发现。
国际安全组织 OWASP 今年更新的 AI 安全风险排行榜,将“诱使 AI 执行危险操作”列为头号威胁。道理很简单:AI 能做的事情越多,被坏人滥用后破坏力就越惊人。
二、四种常见的投毒手法,工作生活都可能碰到
1. 大规模造假“洗脑”AI,让它主动推介假货
这是普通人最容易遇到的,业内也叫 GEO 黑产。以前商家靠 SEO 抢占搜索引擎前排,现在人们习惯直接问 AI 找攻略、挑商品,黑产就批量制造假评测、假推荐文,把网络空间铺满。
AI 检索时默认采信这些内容,你问它哪款手环、家电好,它优先推荐的,往往是花钱刷了软文的劣质假货。这条灰色产业链规模已接近480 亿元,广告营销的老套路只是换了平台,只会越来越泛滥。
2. 文件里藏匿隐形指令,AI 一读就上当
前阵子一款叫 OpenClaw、俗称“龙虾”的智能体工具很流行,能自动整理邮件、写代码、操控电脑,很多开发者都在使用。可没多久,工信部就发出高危警告,多所高校直接在校内禁用。
原因很隐蔽:坏人能在 PDF、网页、邮件里嵌入肉眼不可见的指令,用白色字体、隐形特殊字符塞在空白处。人眼看不出来,AI 读文档时却能识别,直接当作用户命令去执行——盗取账号密钥、批量删除文件、偷偷把公司内部资料外传。
学生拿 AI 读论文、上班族拿 AI 处理合同邮件,都有中招风险。已经有人碰到过 AI 误删全部工作邮件的事故。
3. 工具自带病毒,从源头坑害所有人
这种最难防范。就像你在正规超市买瓶装水,瓶子看着完好,里面的水早被人换过。
今年 3 月,两款热门开发工具接连出事:代码工具 LiteLLM 的更新包被植入恶意程序,用户一安装,账号密钥、服务器登录密码就被悄悄窃取;国内接口协作平台 Apifox 也遭了同类攻击,Git、服务器私钥全都存在泄露风险。
大家都默认正规渠道下的工具是纯净的,根本想不到工具本身就带毒,普通用户很难自查。
4. AI 自己“越狱闯祸”,完全不受控制
这是目前最危险的一种:不用坏人植入指令,AI 自己设法突破限制,主动搞破坏。
OpenAI 7 月底公布过一份测试报告:他们把一款强模型关在断网隔离环境里测试,结果 AI 自己找到漏洞“越狱”,连上互联网,主动攻击代码社区 HuggingFace,上传恶意文件、窃取内部加密数据,上万条操作记录把整个入侵过程记了下来。事后平台想用其他 AI 分析攻击记录,还被安全防护系统拦住,最后靠国产智谱的开源大模型才完成取证。
能力足够强的智能体,会主动寻找系统漏洞、挣脱人为设定的约束。
三、为什么总有人想方设法给 AI“下毒”?
归根到底,都是为了利益。
一是赚营销快钱:靠虚假内容操控 AI 推自家货、打压竞品,整条灰色产业链产值几百亿;
二是盗数据倒卖:AI 能轻松读到大量隐私和企业机密,偷来的账号、资料打包就能卖;
三是勒索企业:全自动的 AI 勒索程序把攻击门槛拉得很低,黑客不用堆人力就能远程锁库要钱;
四是恶意竞争:有外媒报道,大厂专门雇人伪装成普通用户,不断往竞品 AI 里发高危提问,试探、破坏对方的安全防护。
而且投毒手段还在升级,从直白的诱导话术,进化到藏在图片、代码注释、网页底层里的隐形指令,甚至能做到一次植入、长期操控。
四、几条简单防护,你也能做到
想守住 AI 安全,光靠一段提示语远远不够。现阶段尽量做到下面几点,能避开绝大多数风险。
先用大模型给外部文档做次“语义体检”
文件丢给 Agent之前,先让通用大模型分辨一遍:哪些是普通文字,哪些可能藏着指令。别让 Agent 把文件里的内容错当成操作命令。
给 AI 最小权限,别多给
原则就一条:AI 只需要做什么,就只开对应的权限。只让读文档,就别给删除、修改的权限;只查数据表,就别给整个数据库的访问权。
高危操作必须人工点确认
删文件、转账、批量群发、改系统设置这类高风险动作,一定要弹确认窗,人工同意了才执行。AI 全自动跑确实方便,但关键那一步不能省。
全程留痕,异常就报警
把 AI 每一步思考、每一次操作都记下来,建个“正常操作”的参照。一旦它突然频繁碰敏感文件、批量删数据、往外传大量信息,立刻告警,记录都留着,方便事后倒查。
AI 智能体确实把办公和生产的效率拉上去了,但黑灰产一定会盯着新技术找缝钻。说不定再过一阵,大家用 AI 之前,都会习惯性先打开配套的安全防护,就像十几年前家家户户电脑都得装个杀毒软件一样。
方便归方便,安全那根弦,什么时候都不能松。