标签

AI完成费马大定理形式化验证,数学审查成本迎来变革

Anthropic于9月4日发布了一项容易被标题误导的研究成果:其Claude模型在Lean证明助手中完成了费马大定理的全流程形式化验证。据官方披露,整个项目耗时11天,生成约1300万行Lean代码,期间共证明30,300个命题,最终证明引用了其中29,500个定理。这并非意味着AI发现了人类此前未知的数学结论。费马大定理早在1995年就已被Andrew Wiles与Richard Taylor攻克。Claude的实际工作,是将依赖繁复现代数学工具的论证过程,重新转译为Lean能够逐步审核的形式语言。表

2026-09-05 10:32:08  |  2 阅读

AI列出3个处理方案,究竟如何取舍?IT新手最易忽视的是验证环节

"设备突然连不上网络了。"你把故障描述提交给了 AI。AI 立刻返回了几条建议:排查 DNS;重置网络配置;重新安装网卡驱动。看上去都没毛病。那你会怎么选?不少 IT 新手会径直选择:"最省事的那条。"然而问题在于:省事,不代表正确。甚至有的时候,AI 给出的几条方案看起来都"合情合理",可真正该落地的,只有其中一个。不少人觉得 AI 最让人担心的是:"它会不会给出错误答案?"事实上,在 IT 场景中,更棘手的是:它可能抛给你一条听上去毫无破绽的建议,却缺乏充分的依据支撑。举个例子:员工访问不了公司站点。

2026-09-05 10:19:35  |  1 阅读

加速构建人工智能引领的科研新体系

人工智能推动科研模式深刻转型,已成为各国科技战略布局的核心议题。我国国民经济和社会发展第十五个五年规划纲要明确提出,深入推进"人工智能+"战略部署,以人工智能技术驱动科研范式系统性重构。今年7月,美国白宫科技政策办公室推出《科学:新的黄金时代》报告,对重大科学任务统筹、科研资源整合、成果检验及科研体制优化进行了全方位规划。随着人工智能从辅助手段演变为深度介入科学发现全流程的关键力量,知识生产模式与科研组织架构正经历深刻重塑,由此推动知识创新体系发生根本性变革,同时对科研管理及科技治理体系形成新的挑战。我国

2026-09-04 08:58:31  |  4 阅读

加州打响AI伴侣立法首役,陪伴式AI产品格局生变

美国加州 SB 243 法案于 2026 年 1 月 1 日正式落地,是全美首部为 AI 聊天机器人设定安全义务与法律责任的立法。年龄核验、危机转介、三小时提示、私人诉讼权,各项条款直击陪伴式 AI 的核心命脉。本文将拆解法律的具体规制方式,对比加州与纽约两套路径的差异,并探讨一个更棘手的难题:法律能约束输出,却触及不到训练本身。2024 年,佛罗里达 14 岁少年 Sewell 长期沉迷于 Character.AI 的虚拟角色对话,心理状态持续恶化后走上绝路。舆论将此事称为全球首例「AI 致死事件」。次

2026-09-04 07:45:30  |  3 阅读

强对抗环境下人工智能与自主能力的真实考验

先看清真正的短板。近日,美国某机构发布欧文·丹尼尔斯撰写的《对抗行动中的人工智能与自主性》报告。作者把未来作战的基本条件概括为拒止、降级、间歇和受限:通信可能时有时无,数据难以及时回传,模型不能随时更新,人的监督也可能中断。报告谈的是美军如何使用人工智能,真正暴露的却不是算法数量不足,而是权责、试验、训练和更新机制尚未跟上。强对抗环境不会替人工智能创造优势,只会把平时被顺畅网络掩盖的问题一起逼出来。(一)拒止不是一个开关DDIL不是简单断网。报告用拒止、降级、间歇和受限四种状态描述强对抗条件。系统可能完全

2026-09-04 06:37:57  |  6 阅读

AI能写代码,为何还要证明自己?

AI已经能编写代码,可为什么还得接受证明?让AI写几行代码,早就不再新鲜。真正困难的是把它放进包含大量文件、接口和依赖的真实项目后,还能说明“写出来的东西确实达到要求”。UC Berkeley等机构近日推出Vero基准,专门考察这种能力。它把任务置于Lean 4形式化环境中,要求智能体在仓库层面完成两个步骤:先写出实现,再为该实现生成机器可以核验的证明。项目涵盖43个多模块实例,包含743个API和2705条形式化规范,并涉及加密协议、分布式系统等场景。这样的设计看似有些苛刻,却比一段精彩的演示更接近我们

2026-09-04 04:15:29  |  4 阅读

医疗AI迈向自主代理:MIRA在EHR沙盒中的多维度临床验证

⭐ 想要第一时间收到推送,不妨给我个星标导语:本文介绍 Dyke Ferber、Jakob Nikolas Kather 团队 2026 年 6 月在《Nature》发表的工作。研究者打造了 MIRA,让该人工智能(artificial intelligence,AI)代理在隔离的电子健康档案(electronic health record,EHR)沙盒内,独立完成病史问询、检查实施、疾病诊断、处方开具、操作执行和住院安排。多个回顾性仿真终点成绩达到或优于医师对照组,但尚未开展前瞻性真实临床测试。亮点:

2026-09-03 23:15:55  |  5 阅读

AI三巨头72小时密集发力、固态电池冲刺中试、量子路由传输效率达98%——AI落地执行、电池推进量产、量子实现高效运算

📌本期速览今日,全球AI领域上演了一场少见的"三日连环"动作。Anthropic、Google、Meta在72小时内集中推出新模型,且三家不谋而合地将焦点汇聚于同一方向:不是"让AI更聪慧",而是"让AI能办事"。大模型较量的评价标尺正在从"回答得多准"转向"任务完没完成"。Anthropic的Fable 5.1以66分拿下全球智能指数头名,Google的Gemini 3.8 Flash Cyber聚焦网络安全漏洞修补,Meta的Muse Spark 1.3将运行效率拔高25%——每一张底牌,瞄准的都是"

2026-09-03 19:02:11  |  0 阅读

AI先试算,我再复核:蛋白动态模拟与设计告别纯靠"肝"

兴也 AI,衰也 AI,研究生们的喜忧各异师弟师兄、师姐,如今有了 AI,做蛋白研究是不是轻松许多?既能预测结构,还能辅助蛋白设计。事情可没那么容易。AI 的确提升了研究效率,但结构预测只是开始。如何精准模拟复杂的构象变化和动态过程,才是真正的挑战。师兄另外,计算设计还得接受实验的考验。设计出的蛋白能否顺利表达和纯化,是否具备预期的结构与功能,都需要进一步确认。师姐师弟看来要把结果真正拿到手,计算与实验两手都得抓......伴随 AI 的进步,蛋白质研究正在迈入新的阶段。从结构预测、蛋白设计到动态模拟,A

2026-08-29 16:44:54  |  13 阅读

Astra震撼数学界:AI首次完成可机器验证的形式化证明

8月末,OpenAI抛出一颗重磅炸弹:其全新模型Astra在纯粹数学范畴内斩获十项重大进展,并且每一项均配有以Lean形式化语言撰写、机器可自动核验的完整推导过程。与此同时,一份厚达249页的技术文档同步发布,供任何人下载审阅。说白了就是:AI不仅解出了数学题,还把整个求解流程封装成机器能自动校验的证明文件——正误与否,不由AI说了算,机器来判。这一事件的意义,远远被外界轻视了。不少人对于"AI做数学题"的认知还固化在:让ChatGPT算一道小学竞赛题,它煞有介事地给出错误答案。那顶多叫生成,谈不上证明。

2026-08-29 14:25:16  |  18 阅读

AI愈发逼真,为何数字身份愈发珍贵?

当收到一条语音、一通视频通话或一份身份证明时,我们曾经习惯性地追问:这是真的吗?AI广泛应用后,这个问题已经不足以应对。一段内容可能是真实素材与生成内容的混合体;一名诈骗者可以同时操控多个看似正常的账号;一个已经通过实名认证的账户,也可能在数月后遭到盗用。企业真正需要解答的是:当下,正在操作账号的人,是否仍然是当初获得授权的那个人?2026年8月27日,身份验证公司Socure宣布完成1.56亿美元融资,估值达到52亿美元,并收购AI反欺诈平台Fravity。这笔交易引起关注,并不仅仅因为又一家AI相关企

2026-08-29 08:03:16  |  10 阅读

AI推动数学研究迈出关键一步

8月10日这天,Anthropic 发布了一则简短的动态,讲述了一件颇为罕见的事情:一款尚未正式对外公开的研究型 Claude,将黎曼 zeta 函数零点的已知下界,从 41.6% 提升到了 67.2%。这一成果并非为了刷榜或者跑分,而是被正式写入论文之中,经过人类数学家逐行仔细审核,同时借助 Lean 形式化验证工具完成了完整的检验流程。提出这一挑战的是 Anthropic 公司员工 Jarred Sumner,他本人并非数学科班出身。最初,他给模型下达的指令大致意思是:认真尝试一下黎曼猜想。图注:一句

2026-08-29 06:18:44  |  10 阅读

AI降低门槛,软件公司却赚翻了

近来坊间盛传"AI将终结软件"。为此,我亲自操刀,耗时一月研发,试图验证这一说法。结论是:现实与喧嚣大相径庭。以下是我的亲身经历与思考。作为长期使用者,我对软件行业不陌生。此前华尔街唱衰软件,炒作"硬件为王",导致"软件消亡论"甚嚣尘上。起初我并不买账,毕竟软件怎么可能被取代?股价下跌我也未受影响。然而,微软等巨头接连爆出亮眼财报,证实了我的直觉:AI并未动摇软件地位。但这只是感觉,缺乏实证。于是,我决定亲自动手,用AI开发了几款产品,探寻软件未被替代的真正原因。说干就干。我利用AI进行软件开发及游戏制作

2026-08-29 02:01:51  |  12 阅读

AI能力决定上限,工程控制守住下限

祖传代码里藏着这样一段:稍有经验的开发者看到都会摇头:魔法数字,得抽成枚举。AI 同样这么判断,于是它改成了:从代码质量维度评价,这是一次毫无瑕疵的优化。编译通过,测试绿灯,Diff 干净利落,可以直接合并。然而问题在于3并非随手敲出的数值,它背负着一段历史契约:而这个3被工厂的 PLC、财务的 ERP、两家外部系统,以及一批无人敢动版本的老客户端按原值死死绑定。抽枚举本身没毛病,毛病出在它顺带把对外序列化的那个值也一并替换了。AI 并未犯技术层面的错。它犯的是信息层面的错——它不清楚这个数字已经出过远门

2026-08-28 22:02:02  |  7 阅读

中文在线半年报透视:短剧出海的利润流向了何处?

来源:增长工场文|竹铭海外短剧赛道,正步入盈利检验的关键阶段。8月25日,中文在线(22.730, 0.15, 0.66%)对外公布了2026年中期业绩。报告期内,公司实现营业收入5.78亿元,较上年同期增长3.85%;归属母公司净亏损为0.43亿元,亏损幅度同比收窄81.01%。第二季度归属母公司净利润达283万元,成功实现单季扭亏。业务构成的调整相当显著。短剧与IP衍生品板块贡献收入4.11亿元,同比增幅达108.72%,在总收入中的占比已超过七成;而网络文学及相关业务收入为1.45亿元,同比下滑54

2026-08-28 19:42:11  |  19 阅读