AI前沿日报|8月28日 智谱GLM激活参数减半引轰动
今日聚焦两条核心线索:本土算力崛起与模型评测的可信性议题。智谱将新发布的模型激活参数量削减约一半,依托十万张国产芯片集群的算力支撑,在基准测试中实现对DeepSeek的反超;与此同时,DeepMind为模型评估流程引入密码学保障机制。机器人训练数据生成与AI基础设施两条支线也在同步演进。
8月26日,智谱正式推出并开源GLM-5.3-Flash模型。该模型的规格参数颇为反直觉:总参数量达320B,但激活参数由GLM-4.5的32B压缩至18B,网络层数从92层缩减至45层——以近乎减半的激活参数量,换取了更优的性能表现。在Artificial Analysis智能指数评估中,该模型斩获57分,与Claude Opus 4.8持平,并超越DeepSeek旗舰V4 Pro(53分),同时成为GLM-5系列中首款原生支持多模态输入(涵盖图像与视频)的模型。
更值得关注的是其底层架构设计理念与运行平台。这是业界首个融合「稀疏注意力+线性注意力」混合架构的开源前沿大模型,注意力运算量与KV缓存分别缩减至原先的1/3.01与1/4.44。在正式发布前,该模型以Ox Alpha代号(国内命名为「牛来」)在OpenRouter、OpenCode平台累计产生62T token调用量,全部依托逾十万张国产芯片构成的算力集群运行,单token成本已与英伟达主流GPU方案持平。SemiAnalysis对此评价:继OpenAI自研推理芯片之后,CUDA生态壁垒再度面临冲击。定价策略同样激进——输入价格仅0.8元/百万token,约为Claude Opus 4.8的1/40。
8月27日,DeepMind公开了一项评估方法论的创新实验:将前沿模型的外部评测流程封装于密码学「黑箱」之中。该方案基于Google Cloud的机密计算技术,使评估方提交的测试题目与模型权重实现双向隔离——评测方无法窥探模型参数,DeepMind亦无法获取测试内容,从技术层面有效阻断benchmark污染风险。该项目与新加坡AI安全研究所、OpenMined、AVERI、MLCommons等机构协作推进,首阶段已在Gemini Flash Lite模型上完成试运行。面对模型刷榜能力持续增强的趋势,评测体系自身的可信度正演变为新的行业瓶颈。
MIT CSAIL联合丰田研究院提出借助智能体方案应对机器人训练数据匮乏的挑战。SceneSmith框架由三个VLM组件(由GPT-5.2驱动)协同工作:designer负责场景元素生成、critic负责真实性判别、orchestrator掌控生成终止时机,逐步构建出包含家具陈设、可交互开关柜门等元素的室内空间环境。研究团队累计生成超过1300个场景,物体密度达到既往方法的6倍;利用这些环境对机器人策略进行测试时,VLM裁判对「运行失败风险」的判断与人类判定的一致率突破99%。
AI基础设施企业基元律动宣布完成数千万美元融资(由弘晖基金领投),并同步开启TokenRhythm API公测服务。该平台定位为「单一密钥调用多元模型」,对标OpenRouter模式,其核心战略押注于Routing Harness调度框架——并非简单的接口聚合,而是深度介入智能体执行流程,基于任务类型、执行阶段、成本预算与实时运行状态动态遴选模型、灵活切换模型并归并产出结果。平台当前已积累5.4万用户,日均token调用量达5000亿。在多模型并行的生态格局下,能够将「模型编排」环节做到低成本、高易用性的玩家,其商业价值或许超越单一模型的性能极限。
当日AI领域的核心命题可归纳为「效能提升」与「信任构建」:智谱凭借激活参数减半的设计与国产算力的协同,兑现了架构创新与工程优化的双重红利;DeepMind运用密码学技术为评估流程构建新型防护机制;SceneSmith通过智能体方案弥补机器人领域最迫切的数据缺口;基元律动则押注模型之上的智能调度层。后续值得密切关注的动向包括:智谱下周一即将发布的首份财报将如何阐释「低价策略+国产芯片」的战略逻辑,以及双盲评测范式能否从试点阶段演进为行业通行标准。