AI Agent迈入可验证流程新阶段
【AI云算工场 AI 早报】2026年7月6日🔥头条:AI Agent开始进入科学判断力竞争当前AI领域最值得关注的焦点,并非模型对话能力又提升了多少,而是Agent能否在真实且充满不确定性的任务中做出正确决策。OpenAI发布GeneBench-Pro,采用更贴近真实科研的计算生物学任务来评估AI Agent:数据是否支撑结论、噪声是否在可接受范围、下一步实验应如何优化,这些能力远比"会调用工具"更关键。与此同时,OpenAI预览GPT-5.6 Sol,长上下文处理、复杂工具链调度与科学推理能力持续突破
瑞士打造'全透明'大模型:主权AI从概念走向可落地工程
6月21日,名为Apertus的项目跻身Hacker News首页,收获192个赞。其官网宣言简明扼要:"全开放基础模型,服务于主权AI。"该项目由瑞士AI倡议(Swiss AI Initiative)主导,EPFL、ETH Zurich及瑞士国家超算中心(CSCS)共同推进。"全开放"并非空泛口号。Apertus承诺披露训练数据集、训练代码、模型权重、技术路线及对齐策略——全程可复现。同时内置PII清除功能,宣称符合欧盟AI法案规范,并配备输出过滤系统以响应GDPR删除诉
PRAXIS:重塑生物研究的 AI 实验科学家
AI 科学家案例学习负面案例代码验证长期记忆可审计工作流生物信息学大模型智能体▲ 图 1:Schema envelopes enable routable and auditable cross-agent biomedical workflows近两年来,以 Coscientist、ChemCrow 为代表的大模型科学家智能体,在化学合成路径规划及自动化实验调度等场景下,展现出了令人瞩目的能力。然而,一旦将这些智能体迁移至生物学与生物信息学领域,诸多挑战便随之而来。首要难题是基因与蛋白名称的幻觉现象。生