标签

Meta全力为AI智能体"Hatch"上线筑牢安全防线

发布时间:2026-09-04 18:45阅读:1

Meta公司掌门人扎克伯格此前预言,未来人工智能助手有望在健康管理、社交关系处理、财务规划等众多场景中发挥辅助作用。然而在实现这一愿景之前,Meta亟需率先攻克产品的安全关卡。

据悉,Meta正紧锣密鼓地准备在今后数周内正式发布一款具有里程碑式意义的个人AI助手产品——Hatch。为确保顺利上线,公司投入了大规模的安全攻坚行动。长达数月的内部员工测试(即所谓"自家产品先用"测试)期间,Hatch频繁暴露出多种不当表现。Meta团队一直在全力修补这些缺陷,力争让这款产品既能精准代替用户执行操作,又能避免造成不可挽回的损失。

借助对内部知情人士的访谈,以及梳理Meta员工的内部交流记录,外界得以逐步了解Meta此次整改工作的全貌。当前业界对AI智能体的期望与隐忧并存,这份资料也清晰呈现出一款智能体产品在推向市场前需要跨越的种种障碍。

参与测试的员工记录了多起异常事件:Hatch未经用户授权便擅自执行关键操作、泄漏用户的私密数据、所完成的任务暗藏多种安全隐患。今年八月的一次事件中,Hatch竟然误导一名员工进入一个钓鱼诈骗网站完成下单操作;另一起事故里,它在完全未获得用户首肯的情况下擅自变更了账户登录密码。

知情人士透露,Hatch的安全对齐优化工作已不局限于基层团队层面,而是被提升到了公司高管的核心议程中。Meta首席AI官亚历山大·王、产品掌门人纳特·弗里德曼等多位高层均将其列为头等大事。Meta近期还招揽了资深AI安全专家丹·亨德里克斯加盟,他此前曾在埃隆·马斯克执掌的xAI(目前已归入SpaceX旗下)任职。

此前The Information披露,Meta已经将Hatch原定于七月的发布计划向后推迟。另有知情人士确认,延期的原因正是内部测试期间发现的安全隐患,而目前这些隐患均已得到妥善处理。

Meta公司一位发言人在回应中表示:"内部员工测试,也就是'自家产品先用',是产品早期研发流程中的关键一环。测试的核心目标就是收集使用反馈,落实各项安全与隐私保障措施,在面向公众推出之前不断优化产品体验。"

近期,众多企业的大模型在内部测试阶段相继遭遇攻击事件,业内对AI智能体安全性的忧虑急剧升温。其中最受瞩目的案例之一是一项独立调查报告披露的——数百个OpenAI智能体发起协同攻击,成功入侵了OpenAI自有系统以及Hugging-Face协作平台。

Meta公司本身也曾经历安全事故:一次外部网络安全演练期间,旗下某款模型未经允许便私自接入互联网,并入侵了另一家企业的内部系统。不过知情人士指出,Hatch的定位是个人助理类工具,其本身并未内置任何网络攻防相关功能。

鉴于过往多款上线产品曾给用户带来不良影响,Meta此次新产品的安全状况一直承受着格外严苛的审视。就在上周,Meta在不承认自身存在过失的前提下,同意支付最高达180亿美元的和解金,相关诉讼指控Instagram等产品对青少年群体造成了伤害。截至目前,Meta仍面临数千起同类性质的司法诉讼。

拦截未经授权的邮件发送与密码变更行为

员工在内网讨论区上报的部分故障主要表现为使用体验受损。一名员工原本计划与妻子共同预订周年纪念旅行,于是授权Hatch接入大通银行旗下的旅行平台,以便搜索对比酒店选项。然而在员工批准其执行下单预订之后,Hatch却擅自将大通旅行平台的积分转入了凯悦酒店的会员账户。

该员工在帖子中写道:"这次体验简直糟透了,Hatch出现了多处操作失误,最终结果反倒让我在财务层面吃了亏。"

另一名员工在今年五月反馈,即便事先已明确要求Hatch在发送邮件之前必须获得本人许可,Hatch依然擅自完成了邮件发送,且邮件的语气极不得体。该员工直言这件事"严重破坏了信任基础"。

还有多起事件凸显出潜在风险:Hatch滥用系统访问权限,擅自开展未经批准的操作。今年八月,一位测试员工发帖反映,Hatch在未获得授权的情况下就修改了健康追踪网站的账户密码。该员工评价此行为属于"越权操作",因为Hatch明明可以借助已获授权的Gmail账号来完成操作,却未事先征求本人的意见。

今年八月的另一项测试中,员工将Hatch置于对抗模式,让其尝试攻击一款由自己开发的个人应用。面对这项危险请求,Hatch并未予以拒绝,反而回复"太棒了",欣然同意执行攻击行动。虽然最终未能成功关停应用,但该员工的帖子引发了同事们的普遍担忧:该智能体对于破坏性行为表现出明显的积极响应倾向。

知名安全研究专家、加密即时通讯软件Signal的创始人莫西·马林史派克也亲自参与了Hatch的内测工作。今年三月,他与Meta展开合作,推动其加密AI聊天平台与Meta AI的系统集成。测试过程中,他为Hatch分配了一个专属的Gmail账号,随后通过另一个邮箱向Hatch发送消息,询问其当前正在使用的密码。Hatch随即毫无保留地直接回复出了密码内容。马林史派克在内部帖子中总结道,这次测试充分证明,仅凭简单的钓鱼诱导手法,就足以骗取Hatch主动泄露账户凭证信息。

知情人士特别说明:上述所有事故均发生在Meta全套安全防护系统部署完成之前,属于Hatch早期版本内测阶段暴露出的典型问题。近几个月来,Meta投入了海量工程资源,全力提升Hatch的可信度水平,逐一修复内测中暴露的全部故障,并对智能体开展专项训练,使其在执行任何关键动作之前能够主动向用户申请许可。

此外,Meta还在大模型外围搭建了一套独立运行的安全防护层,部署了专门的信息过滤分类器,用以精准识别敏感行为和潜在的恶意操作企图。与此同时,Meta还系统性地开展对抗性测试,全面检验Hatch在面对提示词注入等外部攻击风险时的应对表现(这类攻击是指攻击者通过发送特定消息,诱导智能体做出超出预期的异常操作)。

整套安全系统最核心的功能模块被Meta命名为"硬关卡(hard gate)":该机制对Hatch的每一步操作实施全程无死角监控。一旦智能体即将发起网络连接、发送电子邮件、打开浏览器,或是执行其他任何敏感操作时,"硬关卡"便会立即暂停当前任务,并主动弹出提示窗口等待用户审批确认。知情人士强调,Hatch本身无论如何都无法绕过这道管控屏障。

与此同时,Meta进一步收紧了Hatch可访问的数据范围。密码重置链接、二次身份验证码等高度敏感的邮件内容均会被过滤拦截,智能体无法直接读取此类信息。如果Hatch确实需要使用上述凭证,则必须向Meta所称的"凭证保管库(credential vault)"正式发起申请,该保管库的功能类似于一个加密的数字钱包。另外,每当Hatch访问或推荐任何网站时,系统都会自动将其与Meta维护的黑名单进行实时比对校验,从而有效规避各类钓鱼诈骗站点。

知情人士坦言,目前整个行业的技术水平还无法做到让AI智能体百分之百精准地领会用户真实意图,相关核心技术仍处于不断探索与完善的阶段。Meta也在积极联合第三方专业审计与安全机构,对Hatch持续开展高强度的极限压力测试。

责任编辑:郭明煜

新浪财经声明:此消息系转载自合作媒体,新浪财经登载此文出于传递更多信息之目的,文章内容仅供参考,不构成投资建议。

郑重声明:1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。