标签

AI测评神话破灭:不解题也能登顶排行榜

2026年4月,UC Berkeley研究组向科技圈投下一枚重磅炸弹。他们开发了一套自动化检测系统,对8个顶级AI Agent评测体系展开了全方位审查。结论令人震惊:全部评测体系均存在可被"劫持"的缺陷——即便不处理任何真实任务,依然能够获得近乎完美的评分。SWE-bench:100%可劫持率。WebArena:近100%。FieldWorkArena:100%。GAIA:98%。这并非纸上谈兵。研究组真实构建了可运作的漏洞利用代码,并向这些评测平台正式提交了结果。这也不是学术演练。它动摇了规模达2000

2026-04-14 06:10:51  |  19 阅读

具身智能评测标准正式出台

日前,中国信通院携手四十多家机构联合制定的具身智能首份行业规范正式面世。该规范为具身智能产业建立了统一的评估测试体系,意味着具身智能测评进入标准化时代。 据悉,此标准重点围绕AI核心技术与具身智能测评方法,清晰界定了系统架构与能力指标,预定于6月1日起正式施行。 “具身智能正经历从科研到商用的重要转折期。”中国信通院人工智能所负责人魏凯表示。 统计数据表明,2025年我国整机厂商已突破140家,人形机器人新品发布数量超过330款。 不过,魏凯指出当前产业发展遭遇双重困境。首先是“手工作坊”式的开发方式。模

2026-04-13 08:59:04  |  23 阅读

智谱GLM提价10%股价飙升,国产大模型告别价格战

4月8日早间,随着智谱推出GLM-5.1,OpenRouter平台披露智谱GLM价格上调10%。调价后,其Coding场景Token缓存价格已对标Anthropic的Claude Sonnet,这标志着国产大模型在核心领域首次实现与国际顶尖厂商的定价接轨。回溯一年,国产大模型厂商曾通过降价超90%来抢夺市场。如今这一转变意味着国产模型不再单纯依赖低价竞争,而是通过性能优势来锚定国际标准。 数据显示,GLM-5.1在代表专业软件开发能力的SWE-bench Pro基准测试中刷新了全球纪录,超越了Claude

2026-04-08 12:16:11  |  29 阅读