标签

【AI安全】攻击后回归原任务,ICoA使异常行为隐于最终回复

AI 正在重构安全防线,与其在外围观望,不如直接把握主动权!https://space.bilibili.com/452583051/lists/7870008?type=seasonEMNLP 2026 主会论文《Will the User Ever Know?》表明,工具型 Agent 遭受间接提示注入后会产生两种截然不同的后果:一种会在最终回应中提及可疑行为,用户尚有机会发现;另一种则默默执行攻击,仅返回看似正常的任务输出。作者将传统攻击成功率 ASR 细分为隐蔽成功率 CSR 与显式成功率 OSR

2026-09-05 02:19:11  |  2 阅读