标签

AI代码自验证的可信工程实践

作者:Ido Pesok|Cognition AI(Devin 开发团队)当AI智能体能够独立完成编码、调试、重构甚至完整项目开发后,一个致命问题随之出现:如何让AI可信地验收自己产出的代码?如果智能体既当“开发者”又当“验收官”,很容易陷入自我验证偏差——写出的bug自己看不见,逻辑漏洞自己合理化,最终导致代码不可靠、工程不可信,也无法在真实生产环境规模化使用。在Devin的工程实践中,我们构建了一套不依赖特定产品、可直接复用到任何AI Agent开发体系的代码验收机制。这套方法的核心目标只有一个:让A

2026-06-08 07:35:18  |  9 阅读

自主AI智能体的零信任防护体系

在当前的企业安全格局中,一个令安全管理者忧心忡忡的现实摆在眼前:前沿AI模型正将从发现漏洞到利用漏洞的时间窗口,从过去的数月压缩至仅仅数小时。这不仅仅是攻击速度的飞跃,更是攻防对抗维度的彻底重构。随着“自主AI智能体”(Autonomous AI Agents)深度融入企业核心业务,我们在获得前所未有的效率提升的同时,也面临着传统安全边界无法覆盖的新难题。这些智能体不再是执行固定指令的被动脚本,而是具备理解目标、自主调用工具并执行多步复杂操作能力的实体。缺少一套严密的零信任架构,这些高度自主的智能体将成为

2026-06-08 00:49:26  |  20 阅读

Anthropic 最新文章:AI 正在从工具升级为制造者——它已深度参与下一代 AI 开发

Anthropic 这篇最新发布的文章指出一个重要趋势:AI 正在逐步渗透到 AI 自身的研发链条中。传统模式下,AI 的开发完全依赖人类:工程师负责编码、团队搭建环境、研究人员设计实验、最终由人评估成果。但今天,在 Anthropic 的实际工作中,Claude 已经能够独立承担大量工程与研究任务,显著提升了 AI 的迭代效率。过去,人们对 AI 的认知停留在"人类创造工具"这一层面。开发者编写程序,研究人员设计实验方案,产品团队确定研发方向,最终训练出更强大的模型。AI 不过是人类劳动的结晶,是被制造

2026-06-07 23:19:21  |  27 阅读

AI短剧赛道降温:真实失败率与算力成本的全景透视

AI 短剧的投入产出比远不止算力费用这么简单。过去半年,市场上流传着诸多"单部爆款获利十多万"的传说,但真正实践的人心里都清楚,分账收益降低、算力排队等待、审核多次驳回,这些隐藏成本叠加起来,往往会把一部作品的利润蚕食殆尽。副业创作者最担心的不是前期投入大,而是生成失败率居高不下——无法预知要尝试多少次才能产出成品,也不确定平台是否会因内容问题直接切断流量。如今 Douju AI 把这套"先试错再量产"的成本核算搬到了发布会现场。本次发布会上,影视 AI 创作平台 Douj

2026-06-07 22:57:59  |  39 阅读

翼虎周评 | 美股崩盘引发 AI 业绩大考,布局四大核心赛道

点击上方关注我们1一周回顾01本周全球主要市场走势各异,美股分化明显,港股冲高后回落,A 股则呈现震荡偏弱态势。资金在高位成长股与低位防御股间快速切换,AI 产业链的波动成为跨市场联动的核心线索。美股方面,三大指数表现不一,道指受金融、医疗等蓝筹股带动再创新高,纳指与标普 500 在高位震荡。AI 板块因业绩预期差异巨大,博通指引不及预期拖累芯片股,英伟达等龙头仍显韧性。市场交易降息逻辑,资金从高位科技流向价值蓝筹,中概股随大盘承压调整。港股呈现脉冲式走势,恒指与恒科指周初大幅反弹,腾讯等互联网巨头领涨,

2026-06-07 20:21:16  |  24 阅读

AI制药行业需要什么样的规则体系

行业洞察报告· 2026 年过去十年间,人工智能已从药物研发流程的边缘角色,转变为核心驱动力。蛋白结构预测、生成式分子设计、抗体与环肽的全新设计、临床试验的患者分层与终点预测——这些曾依赖经验和反复实验验证的环节,现在越来越多地由算法模型预先提供假设。作为深耕AI驱动药物研发领域的企业,我们在抗体、GPCR靶点、环肽、PROTAC、药物-染料偶联物等多个研发管线的实践让我们确信:技术价值是真实存在的,但行业尚未为这种价值建立完整的规范体系。一个缺乏规则约束的高速发展行业,迟早会因一两次代价惨重的失败而被迫

2026-06-07 19:02:07  |  25 阅读

2026年美国AI立法新动向:伟大美国AI法案深度解读

AI领域规范化管理法案统一了人工智能行业的专业术语,明确了前沿模型、前沿开发者、大型前沿开发者及灾难性风险等核心概念的定义。其中,前沿模型特指依托超大规模计算资源训练的基础模型;大型前沿开发者则被界定为上一财年总收入超过5亿美元的人工智能企业。同时,法案对"灾难性风险"进行了界定,涵盖AI辅助研发生物、化学、核武器等大规模毁灭性武器,以及导致50人以上人员伤亡或10亿美元以上财产损失的重大事故。此外,文件还对模型权重、重大修改、独立验证机构等专业概念作出解释,确保法规执行的一致性。法案修订了《2020年国

2026-06-07 12:58:44  |  24 阅读

AirPods Pro两只耳机型号不一样?原来是这个原因

用户疑惑:AirPods Pro左右耳型号不一样,这是怎么回事?解答:属于正常现象AirPods Pro左耳和右耳型号不同,并不能证明买到了仿品。每只耳机底部都刻有以A字母开头的独立编号,充电盒则另有专属序列号——这是出厂时预设的硬件标识机制。属于常规情况,无需担心。若想自行验证,佩戴耳机连接iPhone,进入设置-蓝牙,点击AirPods名称旁的圆形图标,型号信息一目了然,再将耳机翻过来查看底部编号,对照官网支持页面提供的号段范围:一代对应A2084、A2083;二代Lightning接口版本对应A29

2026-06-07 11:24:22  |  21 阅读

AI科研评估瓶颈:6月论文53.6%聚焦验证难题

2026 年 5 月,OpenAI 的模型反证了一个离散几何核心猜想。这件事在数学圈是大事——AI 第一次做出真正意义的数学发现,不是刷 benchmark 分数,是反证一个开放猜想。同一周,DeepMind 发了Co-Scientist(multi-agent AI research partner)和AlphaEvolve(Gemini 驱动的算法设计 agent)。Google 发Empirical Research Assistance(AI 协助科研工作流)。Anthropic 完成 65 亿美

2026-06-07 09:19:09  |  37 阅读

PRAXIS:重塑生物研究的 AI 实验科学家

AI 科学家案例学习负面案例代码验证长期记忆可审计工作流生物信息学大模型智能体▲ 图 1:Schema envelopes enable routable and auditable cross-agent biomedical workflows近两年来,以 Coscientist、ChemCrow 为代表的大模型科学家智能体,在化学合成路径规划及自动化实验调度等场景下,展现出了令人瞩目的能力。然而,一旦将这些智能体迁移至生物学与生物信息学领域,诸多挑战便随之而来。首要难题是基因与蛋白名称的幻觉现象。生

2026-06-07 00:34:57  |  34 阅读

Anthropic开源DCRH框架:企业AI代码安全的风险量化与合规闭环

大家好,我是Amber,一个专注于AI技术领域的安全研究者。在数据安全实践中,我始终坚守一个基本原则:安全就是保护资产边界、评估风险敞口、控制不确定性。过去我们主要关注数据分类、脱敏、加密、权限管理和访问日志。但AI编程的兴起正在改变企业的安全边界——代码已成为企业关键资产,也是AI安全最容易忽视的环节。许多企业的安全策略仍停留在传统开发模式:防范代码泄露、阻止内部网络越权、预防人为错误。但面对AI生成的代码,这些传统方法显得力不从心。最近Anthropic开源的Defending Code Refere

2026-06-06 23:04:31  |  44 阅读

AI论文评分系统的效果验证研究

摘要。由机构研发的 AI 论文评估工具,现已融入众多考生日常练习流程。用户在完成 essay 或 PT 后可上传作答内容,系统将自动提供结构化反馈,涵盖问题识别、规则准确性、分析深度、写作结构、遗漏点提示、修改意见及预测得分。该系统预计于 2025 年 11 月启用;上线后,用户最关注的并非 AI 是否能生成优美的评语,而是其评分是否贴近真实考试中阅卷人的打分。幸运的是 California 会对未通过者返还 essay/PT 答卷并公开各题得分,因此可以将 AI 盲评结果与官方成绩逐题对照验证。New

2026-06-06 16:20:17  |  29 阅读

AI加速原型产出却未提速项目,产品经理掉进了新陷阱

这段时间我发现了一个值得深思的问题,在此做个梳理。过去几个月,AI彻底改变了我的工作模式。以往,从需求梳理到原型产出,通常要经历需求分析、流程规划、线框绘制、高保真设计等多个环节。一个复杂页面,从构思到落地可能耗费数小时甚至数天。而现在,只需输入一段提示词,大模型短短几分钟就能生成完整的高保真原型,甚至直接输出可运行的HTML代码。表面看效率确实大幅提升,但很快又暴露出新的困扰:原型出得越来越快,项目进度却没有同步加快。根本原因在于,工作重心从「绘制原型」转移到了「调整原型」。AI生成的高保真页面通常既精

2026-06-06 02:22:37  |  37 阅读

AI+Power 2026香港行|仿真团队拓展数智合作新版图

AI+Power 2026香港行仿真团队拓展数智合作新版图我们——智启仿真技术团队,受AI+Power 2026主办方定向邀请,作为专业观众代表团成员赴香港参会。为何受邀?因为我们长期运用AI+高精度仿真技术,为新能源、商用车船等系统提供虚拟验证服务,而本届大会聚焦"AI驱动能源转型"主题——与我们的业务方向高度契合,这正是我们来深度参观、精准对接的原因。本次以参观学习、寻求合作为目标,深入探讨AI与仿真解决方案融合的前沿方向。AI+Power 2026聚焦"人工智能驱动能源转型",与我们从事的仿真服务天

2026-06-05 17:33:49  |  20 阅读

为何AI率先颠覆程序员与设计师,而非医生律师?

近两年来,关于人工智能的探讨几乎随处可见。有人断言程序员将被替代。有人声称设计师已面临失业。亦有人推测律师、医生及教师等职业终将难逃此劫。然而审视现实,一个显著现象浮现:AI最初产生深远影响的领域,并非医疗、法律或金融,而是代码、图像与视频。程序员正借助AI编写程序。设计师开始利用AI创作视觉方案。视频创作者正运用AI完成脚本撰写、配音、剪辑乃至视频生成。与此同时,那些看似门槛更高、薪资更丰厚的行业,虽也在应用AI,却未发生同等剧烈的变革。缘由何在?关键或许不在职业本身,而在于行业是否具备被AI重构的基础

2026-06-05 08:36:46  |  21 阅读