标签

AI互攻:OpenAI用红队测试打磨GPT-5.6

让AI攻击AI,看似机智,但漏洞一旦暴露,也可能被恶意利用。OpenAI推出了GPT-Red,专为对抗自家模型设计的AI系统。它负责挖掘GPT-5.6的缺陷、构造对抗样本、诱导模型异常行为,所获数据用于优化下一代模型。这一机制称为"红队测试"。01 红队测试为何关键大模型的安全性不仅取决于其训练内容,更取决于面对恶意输入时的反应。GPT-Red可批量生成绕过安全过滤的提示变体,帮助OpenAI在发布前系统性发现并修补攻击路径。这是AI安全领域广受认可的核心方法。图1:AI红队测试流程 ·

2026-07-18 08:21:56  |  13 阅读

评论 | 6月AI伦理新规落地,是护航者还是绊脚石?

今年发布的《人工智能科技伦理审查与服务办法(试行)》,开启了人工智能科技伦理审查与服务的先导试点,以实践探索推动规则落实。该先导计划的执行期为2026年6月1日至11月30日,试点阶段各城市将根据自身情况制定相应的实施细则与操作方案。这份试行办法由多家机构共同编制,中国科协也是核心发起方之一。纵观发展轨迹,国内AI伦理体系逐步完善:2017年《新一代人工智能发展规划》初次把伦理要求列入国家战略;2022年《关于加强科技伦理治理的意见》构建了科技伦理治理的基础制度架构;直到此次专门办法的实施,AI伦理实现了

2026-06-30 10:02:34  |  18 阅读

AI资讯:白宫限制Anthropic出口,NSA高端模型访问受阻

【美国“防务一号”网站6月24日报道】因白宫基于国家安全考量对Anthropic公司施加出口禁令,美国国家安全局(NSA)的部分分析人员已被告知将无法再使用Mythos 5模型。受该事件波及,军民部门官员原本正在评估的借助高级模型侦测系统软件漏洞的计划或面临阻碍。不过,据内部消息人士指出,依据早前达成的协议,NSA或许依然能够使用该技术的旧版本。本次管控起因于白宫本月对Anthropic实施的出口管制行动,迫使该公司减少了涵盖Mythos 5与Fable 5等尖端模型的推出。早前有报道提到NSA局长对My

2026-06-25 07:13:20  |  18 阅读

AI论文精选:可重复性、机器人优化与健康评估新进展

1. 利用GitHub问题提升可重复性审计:ReproRepo通过标准化流程实现规模化验证 原文标题: ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues 发布时间: 2026-06-16 论文链接:http://arxiv.org/abs/2606.18237v1 复现研究结果的论文与代码发布是科学进步的核心环节。现有工作已构建基准测试来评估大语言模型代理在可重复性审计中的作用,但存在数据标注和人工评估成本过高、

2026-06-18 07:32:00  |  14 阅读

中美携手筑牢AI安全防线:合作势在必行

中美携手筑牢AI安全防线:合作势在必行Christina Knight哈佛大学智能设计和工商管理硕士候选人。曾领导Scale AI的安全和政策研究实验室,并担任美国人工智能标准和创新中心的高级政策顾问Scott Singer卡内基国际和平基金会技术和国际事务项目研究员Foreign AffairsApril 7, 2026导读随着人工智能深度融入中美经济与战略博弈,该技术也带来了无国界的极端风险。任何个人或组织都可能利用AI模型或组合模型设计危险病原体,攻击电网或医院网络,或制造侵蚀信任的深度伪造内容。因

2026-06-06 21:23:22  |  36 阅读

美国AI监管新规解读:模型发布前审阅机制详解

近期美国AI监管的动态备受瞩目,不少业内人士听闻“严管模型”便感到焦虑。首先澄清一点:此次核心举措名为“发布前审阅”,实质上是一套标准化的上线前流程,并结合了工程化的红队测试。其目的并非评判生成内容的对错,而是忧虑尖端模型若被滥用,会将生物安全及网络防御等高风险隐患放大至无法承受的地步。决策层真正畏惧的,绝非模型产出几句荒谬文字,而是现实防线被突破。2023年10月,拜登签署《关于安全、可靠和可信的人工智能的行政命令》,方针十分明确:针对高算力的AI系统,安全不能仅靠企业自律,必须具备可报告性与可核验性。

2026-05-06 05:44:03  |  15 阅读

AI安全快讯|2026年4月21日热点扫描

📌 核心要点概览🤖 人工智能产业动态OpenAI悄然升级GPT Pro,提速4倍并逼近GPT-5.5发布节点;阿里Qwen3.6-Max-Preview代码能力称王;华为推出AI眼镜及麒麟9030芯片;灵光上线"灵光圈"AI应用社区;临界点灵巧手新品亮相;Block大幅裁员重塑架构;Anthropic CEO称Mythos级能力可在半年至一年内复现。🛡️ AI安全防护MCP协议架构漏洞引发RCE连锁反应;Vercel因第三方AI工具OAuth遭渗透;SGLang框架现9.8分严重RCE漏洞;国安部预警AI

2026-04-21 21:41:27  |  18 阅读

2026 AI监管升级:三级分级加数字水印,违规最高罚千万

4月7日,工信部等十部门联合发布了《人工智能科技伦理审查与服务办法 (试行)》,宣告 AI 合规迈入“三级分级监管 + 全流程审查”的新阶段;同时生效的《人工智能生成合成内容标识办法》要求:AI 生成内容需具备显式标记与隐式水印,若违规将面临最高1000万元的罚款,且可能遭受采购金额1-10倍的连带追责。此次变革的核心在于,AI 合规已从“事后补救”彻底转变为“事前审查 + 全程监管”。企业必须将“算法安全红队测试 + 内容数字水印溯源 + 伦理审查全程留痕”纳入 AI 部署的“必备项”,否则将面临巨额罚

2026-04-20 12:00:36  |  7 阅读

AI智能体开发实施路径

AI 智能体(AI Agents)的构建方式,已由早期“单一对话窗口”逐步演进为多智能体系统(Multi-Agent Systems, MAS)以及智能体工作流(Agentic Workflows)。与传统软件研发模式相比,AI 智能体更关键的部分在于推理、规划与执行能力。下面梳理的是 2026 年通行的 AI 智能体开发完整流程:在这一阶段,你要做的不是简单罗列功能,而是像在“搭建团队”。角色设定:为每个智能体明确角色(Role)、目标(Goal)与背景(Backstory)。比如,一个“英语口语智能体

2026-04-10 08:29:59  |  25 阅读