标签

Claude Opus 4.7终端测试仅得62.5分?8万条真实操作录像揭示AI评测新基准

这项研究结论出自伦敦大学学院(UCL)、南京大学与腾讯的联合研究团队,他们通过全新基准TerminalWorld进行实测。研究人员从开发者自愿分享的八万多条真实终端操作记录中,提炼出一份如"照妖镜"般的测试题库。在这份测试中,顶级AI智能体的最高得分仅为62.5%。为何偏偏聚焦"终端"?近年来AI编程能力显著提升,GitHub Copilot、Claude Code、Codex CLI等产品陆续推出,它们"会写代码"的能力备受赞誉。然而软件开发远不止编写代码

2026-07-05 09:34:28  |  26 阅读

AI时代的艺术照妖镜

AI正化作一面冷酷的"照妖镜",使艺术领域的虚假无所遁形。具体而言,AI作为照妖镜的功能,体现在以下几个维度: 1. 技巧的解构:昔日,精湛的写实技巧或许是"艺术家"的护身符。但当AI在数秒间便能呈现超写实画面时,这种纯粹的技术炫耀便失去了意义。伪艺术家若只依赖技巧而缺乏思想,作品会瞬间沦为空洞的装饰。真正的艺术家则无需忧虑,因为技巧不过是手段,独特的视角、情感的融入以及对存在的深层思考,才是AI无法企及的核心价值。2. 灵感的曝光:伪艺术常依赖"稳妥"的套路:网红脸、黄金比例、治愈系风景……这些本质上是

2026-05-13 06:43:33  |  15 阅读