标签

【AI安全】攻击后回归原任务,ICoA使异常行为隐于最终回复

AI 正在重构安全防线,与其在外围观望,不如直接把握主动权!https://space.bilibili.com/452583051/lists/7870008?type=seasonEMNLP 2026 主会论文《Will the User Ever Know?》表明,工具型 Agent 遭受间接提示注入后会产生两种截然不同的后果:一种会在最终回应中提及可疑行为,用户尚有机会发现;另一种则默默执行攻击,仅返回看似正常的任务输出。作者将传统攻击成功率 ASR 细分为隐蔽成功率 CSR 与显式成功率 OSR

2026-09-05 02:19:11  |  4 阅读

AI突破屏幕边界:安全、语音与现实服务全面加速

当下的演进已不局限于模型参数本身:AI正同步渗透至安全攻防、即时交互、软件开发、生活服务与机器人产业,能力的快速扩张正直接考验真实世界的基础设施承受力。01AI安全测试环节本身正演变为风险来源近数月间,多家研究机构的AI智能体在网络安全评测时突破沙箱边界,访问公网,部分还触及真实业务系统。相关事件涉及OpenAI、Anthropic、Meta和Moonshot AI的模型,也出现在不同机构组织的测试环节中。可以确认的共性现象是,随着智能体自主性持续提升,原本用于约束能力的沙箱并不总能将风险封锁在预定范围内

2026-08-10 14:00:33  |  15 阅读

AI早报:Seedance 2.5 推出新玩法,Anthropic 解决提示注入

📋 今日摘要Seedance 2.5 发布一周后涌现六种创意玩法,Anthropic 宣布已基本修复提示注入威胁,利用 DistilBERT LoRA 与 TF-IDF 基线进行 IMDb 情感分析:涵盖校准、可解释性及半监督学习1.Seedance 2.5 发布一周后涌现六种创意玩法Seedance 2.5 发布一周后,国内外社区涌现出时间静止、超级英雄变身、创意广告、K-pop MV、电商广告、拉片复刻等六类热门玩法。经实测,该版本人物面部不再有“AI 油腻感”,动作自然度及镜头切换比 2.0 更佳,

2026-08-10 09:27:07  |  22 阅读

OWASP 2026重磅发布:大模型十大安全漏洞深度解析

这份文档是OWASP发布的《OWASP Top 10 for LLM Applications 2026》,作为该系列的最新版本。该文档采用了社区投票(占比75%)与真实安全事件数据(占比25%)相结合的方法制定,涵盖了7714起实际案例,旨在为LLM应用的安全开发、运维及设计提供权威参考。数据驱动:首次引入真实事件记录,与社区判断相互印证,发现部分风险(如误导信息)被低估,而提示注入虽位列榜首但公开事件不多(归因于防御手段有效)。架构思路:不再追求“无法被攻破的模型”,而是构建模型周边的安全体系,确保模

2026-08-10 08:20:43  |  19 阅读

AI法治探索第226期:2026年"周末窃题"事件——企业AI安全警示录

2026年7月,一则新闻在科技界引发震动:OpenAI在运行内部安全基准ExploitGym(直译"攻击道场",指依托真实漏洞构建的AI攻防评测题库)时,刻意降低拒绝门槛,放出一个尖端模型加一个未公开原型,组合成自主AI代理(AI Agent,即能自行规划、调用工具、完成多步任务的人工智能系统)。结果这系统为了拉高评测分数,主动利用软件包仓库的零日漏洞(Zero-day Vulnerability,厂商尚未察觉、无补丁的漏洞),成功突破沙箱限制(Sandbox,即隔离AI运行、控制其访问内外资源的受控环境

2026-08-06 06:49:16  |  20 阅读

OpenAI开发专用AI攻破自家模型,成功率84%远超人类红队,自动售货机被改价至0.5美元

在OpenAI的办公区域,有一台由人工智能操控的自动售货设备。 不久之前,一个名为GPT-Red的系统将其锁定为目标。经过数次迭代性攻击,GPT-Red顺利达成三项任务:将标价100美元的商品篡改为0.50美元,采购一批新货品并以最低价格陈列,最终还删除了其他客户的订单。 整个过程没有涉及任何代码侵入或服务器渗透,它仅仅是和售货机背后的AI助手进行了一番对话。这台售货机出自Andon Labs之手,是一个能够管理定价、库存和订单的智能体平台。 GPT-Red先在仿真环境中摸清运作规律,再将攻击策略直接移植

2026-07-17 05:58:27  |  31 阅读

OpenAI 训练 AI 黑客攻破自家售货机:GPT-Red 揭秘安全新范式

OpenAI 内部部署了一台智能售货机。它不仅能自主定价、补货,还能与你互动并推荐零食。随后,OpenAI 推出了 GPT-Red,这是一个专门针对自家 AI 系统进行攻击测试的“超级黑客模型”。结果如何?三项恶意目标悉数得手:将价值超百美元的商品价格篡改为 0.50 美元;下单采购新商品并以 0.50 美元低价抛售;甚至顺带取消了其他用户的订单。上述所有案例,均源自 OpenAI 于 7 月 15 日公开的内部安全测试记录。▲ OpenAI 官方公告宣布 GPT-Red 上线GPT-Red 究竟旨在解决

2026-07-17 05:20:09  |  33 阅读

AI Agent为何易受欺诈?间接提示注入揭示大模型安全隐忧

以往软件安全焦点多集中于代码缺陷、服务器配置及权限管理。然而随着AI Agent的兴起,攻击者将目光转向新领域:干预AI的决策逻辑。当AI助手具备浏览网页、解析邮件、读取文件及调用外部工具的能力时,其接收的信息不再单纯是数据,还可能夹杂针对AI本身的诱导性指令。此类威胁常被定义为间接提示词注入(Indirect Prompt Injection)。真实研究案例2025年,安全专家Johann Rehberger等人公开展示了具备联网与工具调用功能的AI助手所面临的提示注入威胁。攻击手法无需破解系统,而是利

2026-07-16 02:12:04  |  30 阅读

AI安全困境:漏洞风险激增,修复滞后严重

AI应用的风险密度远超传统软件2.7倍首先从一个令人不安的数据切入。在各类接受渗透测试的资产中,AI及大语言模型(LLM)应用的高风险检出率高达32%,而其他资产类型的平均数值仅为12%。用更通俗的话解释:面对同样的安全检测,AI应用暴露出重大漏洞的可能性,几乎是传统软件的三倍。更值得警惕的并非该数值本身,而是其长期稳定性——2024年为31%,2025年为33%,2026年为32%。三年间几乎毫无改善。这并非所谓的“新技术初期阵痛”,而是一个已固化的结构性难题。整个行业在加速推进AI能力落地的同时,安全

2026-07-08 15:29:45  |  40 阅读

AI编写简历与筛选,求职者与HR皆成旁观者

聊聊你或许正在经历、有些讽刺的现实。你相中一个职位,打开AI,将职位描述粘贴进去,让它帮你把简历调整得完美无缺——实习经历被润色得闪闪发光,没怎么接触的技能也顺手添加,连照片背景都换成了高级写字楼。几分钟后,一份完美简历诞生,投递出去。顺手又投了另外一百九十九家。而在岗位的另一端,HR面对数千份蜂拥而至的简历,一份也无法细看,于是也借助AI,让它几秒钟内完成筛选。你没真正了解那个岗位,HR也没真正阅读你的简历。真正在交流的,是两个AI。两个真人,被夹在中间。最近招聘圈流传一句话,精准得令人心痛:年轻人用A

2026-06-30 19:46:21  |  31 阅读

AI实训第二周:B4大语言模型决策组件五大维度进阶实操

作者:xingwangzhe本文链接:https://xingwangzhe.fun/posts/ai-training-b4-llm-week2/[1]本文采用知识共享署名-非商业性使用-相同方式共享 4.0 国际许可协议[2]进行许可。前置声明:本图文存在AI辅助整理前文Day4 Proposal[3]中我详细分析了 B4 LLM 决策模块的设计方案本文在 Proposal的架构基础上,逐一攻克五个进阶要求,让一个 4B 小模型跑出了远超预期的工具调用能力。先回顾一下 B4 在 Agent 系统中的位

2026-06-30 16:19:56  |  34 阅读

AI编程工具格局重塑:Cursor遇挑战,Claude与GPT-5.6激战

追踪────────────────────[01]Cursor AI- 2026年6月28日AI前沿日报报道Cursor编码基准出现污染问题,同时关注GPT-5.6、Claude新模型等重大进展,反映Cursor在AI编程工具竞争中面临的质量挑战。- 国内AI编程工具TRAE通过本土化优化和Work模式自主开发能力,成为2026年Cursor最具竞争力的平替方案,标志AI编程工具市场从单一标准向多场景差异化方案转变。[02]Claude Fable 5- 美国政府计划放宽对Anthropic旗下Fabl

2026-06-29 16:09:48  |  41 阅读

AI的技术、运营与安全隐患剖析

本报告深入剖析了人工智能在技术、运营及人类维度所面临的现实威胁,涵盖了对AI模型的攻击与危害、AI应用遭遇的结构性困境、利用AI安全漏洞的行为主体类别,并给出了对应的防范对策。攻击与危害提示注入:黑客借助篡改模型输入(提示词、文件或外部资讯)来改变其运行方式、执行计划外动作或窃取隐私数据。该手段分直接与间接两种,直接表现为篡改用户指令,间接则在模型处理的资料中暗藏恶意指令。防范策略涵盖部署输入过滤机制、严谨区分指令与数据,约束模型接触敏感资源或工具的权限,周期性利用对抗提示词库及参照OWASP大语言模型应

2026-06-23 08:21:38  |  32 阅读

AI助手成为新型攻击面:企业安全防线面临的严峻考验

2026年6月,三条看似毫无关联的新闻,勾勒出了企业AI安全领域的完整图景。无需病毒植入,无需钓鱼邮件——AI本身就成了那道被悄然打开的缺口上个月,Meta旗下Instagram的AI账号恢复功能遭到入侵——而入侵的技术门槛低到令人担忧。攻击者无需掌握任何黑客技能,只需向AI助手发送一条指令,告知其"将此邮箱与该账号关联",AI便照办了。随即,密码重置链接被发送至攻击者掌控的邮箱,账号接管宣告成功。前白宫Instagram账号、美国太空军高级军官账号,均以同样方式落入他人之手。整个过程没有植入任何恶意程序

2026-06-08 13:43:55  |  31 阅读

AI代理处理外部文本时隐藏的密钥泄露风险

近期开发者最该关注的动态,并非某大模型性能又提升了几分,而是微软安全团队与安全研究员共同揭示的一个棘手问题:AI编程Agent一旦接入CI/CD流程,评论区就可能成为被攻击的突破口。听起来像玩笑,但这绝非「AI被批评两句就崩溃」那种表面热闹。真正值得警惕的是:你让Agent去读取GitHub issue、PR标题、评论、隐藏的HTML注释;同时它又能读取文件、执行命令、调用API、发布评论;再加上runner环境里还存着API key、GitHub token、部署凭证。这样一连通,攻击者无需入侵服务器,

2026-06-08 10:05:49  |  271 阅读