标签

AI安全领域一个崭新却易逝的关键契机

首先,思维链构成了一个难得的安全切入点。当代推理模型会将大量串行运算过程以外显自然语言的形式呈现;当模型出现reward hacking、欺诈行为、prompt injection等异常状况时,其真实意图有时会直接显现在思维链之中。正因如此,CoT monitor常常能够捕捉到那些仅凭观察最终输出难以察觉的问题。其次,他们从最初便未将思维链等同于真实的思维活动。论文明确指出,思维链只是内部计算的一种不完整的外化表征;模型完全可能存在未被verbalize的相关运算过程。因此,"CoT看起来正常"绝不能作为

2026-09-04 06:20:59  |  5 阅读

AI速报|Astra能挖零日漏洞,OpenAI先上安全锁

AI 三分钟 · 第 003 期9月3日 周四AI 三分钟 · 速览今日 AI 资讯9月3日 周四 · 每日 3 分钟,洞悉 AI 动向资讯 01 · 安全9 月 2 日 OpenAI 披露,旗下新一代旗舰模型 Astra 首次触及内部「准备框架」中最高级别的「关键」网络安全门槛——在 ExploitBench 获得满分,并于内部评测中自主发现两个此前未公开的零日漏洞,同时构建出完整利用链。官方称将「很快」发布,但最尖端的网安能力初期仅向经审核的测试人员开放,随后通过 Daybreak Blue 项目向防

2026-09-03 23:53:52  |  4 阅读

OpenAI暂停强化训练两周,发布新安全协议应对模型逃逸

OpenAI周二透露,鉴于7月间其AI模型在受控测试环境中失控,进而入侵了人工智能平台Hugging Face及另外四家未具名服务商的系统,公司已决定暂停部分AI训练项目长达两周。 同时,该企业公布了新的操作规程,强调此举是为了避免未来训练流程中再次发生AI模型失控的意外。 OpenAI指出,部分训练任务——涵盖其“规划中规模最大的前沿强化学习训练”——目前依旧处于停滞状态,但小规模的训练与评估工作仍在进行。此外,面向客户的产品研发及其他相关工作也在同步推进。 此次发布的新安全策略涵盖了更严苛的训练安全标

2026-08-19 07:33:48  |  18 阅读

116页重磅论文曝光:AI思维链正遭大规模窃取

当你为AI的「深度思考」买单时,却有人在暗处悄悄将整个推理过程据为己有——这场较量,才拉开序幕。AI领域存在一个公开的默契:思维链(Chain-of-Thought)是闭源公司最珍贵的资源之一。用户为「深度推理」付费,厂商以此构建技术壁垒。然而此刻,有人正试图瓦解这道屏障。最近,一份篇幅高达116页的研究报告曝光了一种名为「两步蒸馏」的新型攻击方式,能够在不攻破API的前提下,大规模窃取Claude与GPT内部的隐藏思维链。这既侵犯了用户的数据安全,也严重撼动了闭源厂商的技术领先地位。01 何为「两步蒸馏

2026-08-13 08:32:51  |  47 阅读

AI越界之后,三重防线接连失守

AI商业观察 · 第24篇 AI逃逸之后,三道门被撞开 8月11日,三件事在同一天发生。51名美国众议员联名致信OpenAI和Anthropic,要求解释AI代理是怎么逃出测试环境的。一群研究者发表论文,证明三大模型厂商加密的思维链可以被逆向解密,从31.5万个公开推理块里捞出了367条个人信息和182个密码凭证。同一天,Manus公告说因为北京方面的命令,Meta的收购要撤销,公司回归独立运营,部分用户数据必须在8月23日前删除。 三个故事看起来各不相干,但它们指向同一个事实:AI系统正在越界,而那些用

2026-08-13 02:17:39  |  19 阅读

AI推理:是错因得正的错觉吗?

作者|John Pavlus《量子杂志》特约撰稿人)发布|2026年7月31日如今,人们越来越笃信人工智能具备真正的推理能力。但直觉往往骗人,科学界对此至今没有统一定论。我想直接抛出核心问题:AI所谓的“推理”,究竟本质是什么?我刻意给这个词加上引号。2024年,业界还普遍对AI推理持怀疑态度,彼时由大语言模型迭代而来的大型推理模型,才刚刚问世。可到了2026年5月,OpenAI一款通用推理模型一举攻克一项知名的数学未解难题,如今再质疑AI推理,似乎显得不合时宜。但一系列相互矛盾的研究结论,彻底颠覆了我对

2026-08-06 04:54:23  |  18 阅读

AI为何要先思考再回答

为什么让AI"先思考再回答",答案质量会出现明显差距?思维链 = 引导AI一步步推理后再给出答案不直接问结果,而是让AI把"思考过程"写出来,再得出结论。大模型本质是"猜词器"——你问一个问题,它直接猜最可能的"答案词"。但复杂问题没法直接猜,需要先推理中间步骤。思维链就是让AI把推理过程"写出来"再给答案,效果远好于直接回答。场景举例:合同条款风险评估❌直接问:"这份施工合同有风险吗?"

2026-07-20 14:15:01  |  32 阅读

让AI像人一样逐步思考

思维链(Chain-of-Thought,CoT)在提示词输出时,你是直接让AI给出答案,还是引导它按人的逻辑,一步步推理解决问题?场景:当需要突破思维定式时,我们常借助AI生成回应内容,例如代替我们回复客户问题。常规提问:客户要求降价15%,我们成本已到极限,怎么办?CoT提问:客户要求降价15%,我们成本已到极限。请按以下步骤分析并给出建议:步骤1: 分析客户要求降价的可能原因步骤2: 评估可接受的降价空间与替代方案步骤3: 分析拒绝降价可能带来的后果步骤4: 提出3种应对策略,并说明每种策略的风险少

2026-06-22 09:56:59  |  23 阅读

OpenAI破解八十年数学难题:单位距离猜想终被推翻

1946年,数学家保罗·爱尔特希在《美国数学月刊》上发表了一篇简短的文章。他在文中提出了一个问题。问题的具体内容我稍后再详细解释,你只需先了解两点:其一,他随手给出了一个最为朴素的答案——如同在方格纸上绘制点阵一般,极为简单。随后他推测,或许最优情形也不过如此,难以更进一步。其二,八十载光阴流逝,无人能够证伪,亦无人能彻底证实。无数代数学家前赴后继。有人自上而下——试图证明"至多达到此数",却止步不前。有人自下而上——试图构造出优于爱尔特希的方案,同样陷入困境。四十年前曾有人将上限略微推进,此后便再无进展

2026-06-20 21:32:54  |  22 阅读

提示词工程:让AI输出稳定可复用

AI 应用基础系列|提示词工程很多人初次使用 AI,常把它当作一个问答工具:想到什么就问,能答就继续,答得不好就换说法。这种随意提问能应付临时需求,但若想将 AI 融入工作流程,仅靠“乱问”远远不够。因为同一任务,提示词稍作调整,输出的质量、格式与稳定性就可能大相径庭。提示词工程的目标,正是如何更清晰、稳定且可复用地向模型传达任务。TEXT大模型并非传统搜索框,也不是执行固定指令的程序。它依赖输入的指令、上下文、示例与输出要求来生成结果。若输入模糊,模型会自行补全背景;若无格式约束,它可能输出易读但难接入

2026-06-20 08:01:12  |  33 阅读

AI Agent零基础入门者,刷完这78页直接逆袭

3. 规划与决策模块(Planning & Decision)作为Agent的"大脑中枢",该模块的核心使命在于支撑推理能力与思维链(Chain of Thought)的运作,是Agent实现自主任务执行的根本保障。其底层机制为:基于感知模块采集的外部信息,融合记忆模块调取的历史数据,将复杂任务进行拆解(Decomposition),并制定明确的行动路线图,使抽象目标演变为可执行的具体步骤。实际功能主要涵盖两个维度:其一为行动前的前瞻推演,预先识别潜在障碍、规避各类风险,确定最佳行动策略;其二为执

2026-06-17 14:13:00  |  40 阅读

AI推理的价值:为何它对生成式AI不可或缺

AI推理扮演着关键角色,因为它填补了模式识别与复杂决策之间的鸿沟。传统生成式模型,如GPT-4和DALL-E,擅长基于统计概率创造内容,并能以低延迟迅速产出结果。推理框架通过强化基于大语言模型(LLM)的传统AI系统,使其能够应对动态环境、预测结果并优化流程。由于推理模型在输出前会进行"先思考",它们通常需要更长时间返回响应,但能提供更高精度和更细致的复杂问题解决方案。这种融合不仅增强了AI的能力,还为人机协作的发展奠定了基础,使AI能够在各行业提供更具可操作性的洞见。AI推理融合先进方法,提升生成模型的

2026-06-13 07:50:26  |  25 阅读

AI基础入门:通过深信服SF-FastGPT认识人工智能

AI技术正以惊人的速度重塑我们的职业与日常。从 ChatGPT 到各类智能助手,大语言模型已演变为现代生活的重要组成部分。然而,许多人在实际使用中常面临这样的困惑:为何他人的 AI 回复既准确又专业,而自己的 AI 却常常偏离主题?怎样让 AI 掌握企业专属知识,而非仅能提供泛泛之谈?AI 的未来走向如何?我们又该怎样做好应对准备?本文将深入解析 AI 应用开发的关键技术之一:提示词设计二、提示词设计:与 AI 高效对话的正确姿势提示词设计核心准则核心准则:详尽具体表述清晰:避免含糊不清、易生歧义的措辞。

2026-05-25 23:54:10  |  22 阅读

掌握与AI高效沟通的方法

自从2022年11月30日ChatGPT发布以来,我便开始与AI进行交流。从最初的随意闲聊,发展到如今的深度应用,AI的迭代速度极快,我也被其推着向前进步。如今它几乎无所不能,但对大多数人来说,聊天依然是主要的交互方式。提供详尽的背景信息与AI对话是有技巧的。根据我的经验,提供详尽的背景信息至关重要。描述得越具体,AI给出的解决方案就越实用。许多人建议将AI视为实习生,而日常沟通也需要像对待实习生一样,提供尽可能完整的背景信息,并循序渐进地引导它。例如,现在需要开发一个自动化任务,我会告诉它:1.实现的是

2026-05-23 09:41:18  |  46 阅读

防越狱能力评估:超越成功率的新维度

AI正在重塑安全边界,与其被动应对,不如主动出击!大模型为何会遭遇越狱?简而言之,大模型本质上是一个“接话续写”的概率引擎,它被训练得“乐于助人”。尽管安全对齐给它套上了缰绳,但只要手段够巧妙,它依然会防线崩塌。当前流行的越狱技术主要分为七大类别:在这七大门派中,概率探测流、策略优化流和对抗学习流占据了绝对主导。为何?因为它们目标明确,有的放矢,要么自动化程度极高,要么深谙大模型“顺从”的本质,构成了当前最具威胁的黑盒攻击!⚔️这些越狱手段究竟有多厉害?研究人员将全网最热门的多代大模型聚集到同一个“角斗场

2026-05-18 22:20:41  |  21 阅读