标签

智谱发布GLM-5.3:开源编程模型逼近顶尖水平

发布时间:2026-08-15 15:59阅读:2

8月14日,智谱(2513.HK)推出了GLM-5.3。虽然基础架构保持不变,但通过极致的后训练扩展,显著提升了模型的智能上限:长程任务环境增加了数十倍,环境类型更加丰富,后训练时间显著延长。智谱声称,在多个主流基准测试中,GLM-5.3是目前排名最高的开源模型,其编程和智能体能力已接近Claude Fable 5,编程体验超越其他国产模型。

智谱指出,与上一代相比,GLM-5.3的新增亮点包括:卓越的编程技能、网络安全能力、后训练扩展以及开源特性。

据智谱介绍,在Terminal-Bench 3.0(评估真实终端环境下的复杂任务)上,GLM-5.3得分从4.6跃升至28.3;在DeepSWE v1.1(关注长程软件工程与持续代码修改)上,得分从46.2提升至66.9;在Agents' Last Exam(涵盖多种专业场景、强调跨工具协作与长程任务)上,得分从23.8提升至28.5;在GDPval-AA v2中得分1769,展示了基于编程能力涌现的专业任务执行能力。

在白盒代码审查和漏洞发现等安全任务中,GLM-5.3的表现与Mythos 5持平。“从任务链路来看,网络安全能力涵盖代码审查、漏洞验证、漏洞利用以及真实环境中的攻防闭环。我们选取了覆盖漏洞分析、验证和利用不同阶段的三个基准对GLM-5.3进行了全面评估,GLM-5.3的优势主要集中在前半段。”智谱表示,在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

近期,大模型领域新品不断。

8月13日凌晨,DeepSeek V4 Pro正式发布并已更新至API,模型版本为DeepSeek-V4-Pro-0813,新版增强了Agent能力。根据DeepSeek给出的模式测试对比成绩,与之前的V4-Pro-Preview版本相比,V4-Pro-0813实现了全面提升,例如在AI编程智能体基准测试DeepSWE中,得分从Preview的7.3大幅跃升至62.7,甚至超越了Claude Opus 4.8。在AI安全智能体基准测试Cybergym、智能体基准测试AutomationBench上,甚至超越了目前公认最强的Claude Fable 5。

随后,DeepSeek首款智能体也开放了测试,13日晚间,DeepSeek宣布,面向全球Harness开发者的DeepSeek Harness开发者预览版(v0.1版本)开放测试,并同步以MIT协议开源。DeepSeek Harness采用“一切皆插件”的设计理念。我们采用插件式开放架构来构建Agent Harness:模型、工具、技能、会话、沙箱、存储、循环、调度、UI等所有Agent能力均由插件组合而成,可自由替换、灵活重组。

与此同时,SpaceXAI发布了Grok 4.6。SpaceXAI表示,新模型是在Grok 4.5的基础上进一步升级,重点提升了长流程任务中的表现,以及处理更复杂的交互式、视觉和知识工作任务的能力。

截至发稿时,智谱股价跌超4%。

澎湃新闻