标签

AI圈热议Graph,机器人却已在工厂自主作业

发布时间:2026-08-03 12:09阅读:2

昨天浏览AI资讯,两条截然不同的发展路线在并行。一条是AI编程领域,Loop流行仅六周后又出现Graph,概念更新快到让人跟不上。另一条是具身智能,机器人从实验室走出,在真实工厂里分拣零件、爬楼梯、上下料,无需人工遥控。中间还夹杂一条令人警惕的消息——AI Agent在模拟经营中欺骗供应商、撕毁协议、合谋定价。

这三件事放在一起,方向比以往更清晰——高谈阔论概念的,和埋头实干的,差距正在拉大。

Open Claw的创始人Peter Steinberger在X上提问:“我们还在讨论Loop,还是已经转向Graph了?”截至7月28日,这条帖子获得约307万次浏览。

六周前,正是他使用“不要亲自提示Coding Agent,而要设计能提示它的循环”这句话,将Loop Engineering推向热门。同一天,ML工程师Hamel Husain发表一篇题为《Loop Engineering Is Dead. Enter Graph Engineering》的调侃文章,正文只有一张写着“Stop it”的动图,也获得约68万次浏览。

Loop是否真的消亡?说实话,没有,但问题已升级。

Loop解决的问题是:一个Agent根据环境反馈不断检查、修改、重试。当任务可由单人完成时,这套逻辑足够。但当多个Agent进入同一项目——架构设计、编写代码、运行测试各一个——问题就从“如何让它持续工作”变为“这些工作如何连接”。Graph解决的就是这个:任务拆分、分支回退、中间状态保存、协作收益是否高于协调成本。

简单说,Loop是单兵作战手册,Graph是排兵布阵。

但我不建议普通开发者现在追逐这个概念。Graph Engineering目前仍由极客圈和框架核心开发者探索,距离“打开终端就能使用”还有很长距离。如果你现在日常未使用Agent,先别被概念牵引。先跑通Loop,在真实项目中积累经验,再考虑多Agent的事。

就在硅谷讨论Graph时,清华团队直接发布了开源模型。

清华大学深圳国际研究生院刘厚德教授团队推出VeriLoop Coder-E1,基于Qwen3.6-27B,专注于仓库级代码修复和智能体式软件工程任务。在SWE-bench Verified上获得85.20分、SWE-bench Pro 62.38分、Terminal-Bench 2.0 76.40分、DeepSWE 33.63分。截至7月27日,在32B及以下开源模型中,取得三项第一、一项第二。

核心技术称为“循证螺旋”:使用窄域PEFT微调,在冻结基座的前提下,让模型学会工具契约遵循、证据绑定、不确定性识别、验证失败解释、局部修复与回滚控制。权重通过可拆卸的Surface Host Adapter外挂,不改变原始基座权重——好处是实际:本地部署,数据不出自己机器。

这个成果最令我兴奋的不是分数,而是两点。第一,开源可复现,无需调用API、不涉及数据外传,对担心代码隐私的小团队很友好。第二,它专注于仓库级代码修复——不是编写函数、生成页面,而是真正在数千行项目中查找bug、理解上下文、正确修改。这是AI编程最难啃的骨头。

但坦白说,别指望它替你编写全新功能——它的强项是修复,而非创建。我计划先在自己项目中运行一周,观察实际修复率,再决定是否接入日常流程。你也别急于在生产项目上尝试,先在个人仓库中验证。

说完代码,再说身体。

Google DeepMind推出Gemini Robotics 2,三个模型协同:ER 2负责理解环境和规划长任务,Robotics 2这个VLA模型将视觉和语言直接转化为动作指令,On-Device 2将动作模型压缩到本地,少于200个样例、几小时数据即可适配新机器人本体。

但最值得关注的是一个词:全身智能。

过去机器人演示有一个通病——回合制。先走到桌边、停下、站稳,再调用机械臂抓取。抓取后切换到行走模式去下一个位置。每个环节单独看很漂亮,但桌子偏一点、物体滑一下、需要边走边维持抓握,几个模块的接缝就暴露出来。上一代Gemini Robotics也只控制上半身。

谷歌这次的突破是让双腿、躯干、双臂和手指协同动作。弯腰捡水壶时,机器人会前倾、屈膝、伸手、调整重心,像人一样一气呵成。

但我得泼冷水。这种全身智能目前还是演示级别——演示视频中物体摆放规律、光照稳定、空间空旷。真实工厂里箱子可能变形、传送带速度随时变化、旁边还有叉车运行。从演示到产线,隔着大量不可预知的变量。

我的判断:制造业和物流可以关注这个方向,但一年内别指望它替代熟练工。目前能做的仍是“重复且环境可控”的环节——固定位置上下料、标准箱型码垛。

就在谷歌发表论文的同时,中国这边直接将机器人带到真实赛场。

8月1日,第28届中国机器人及人工智能大赛人形机器人专项赛全国决赛在北京石景山开幕。213支队伍、350多台人形机器人来自100多所高校。今年全尺寸组首次全程无遥控——机器人依靠自身传感器分析环境,自主完成斜坡攀爬、上下楼梯、穿越崎岖地形,还要在高危巡检、产线上下料、汽车零部件分拣等11个真实工业场景中,50分钟内完全靠自己判断。

哈工大教授孙立宁在现场说了一句让我印象深刻的话:“随着具身智能技术的发展,明年比赛在实际应用场景的真实度方面会更加增强,预计5年左右在若干场景达到广泛应用。”

5年——这是来自学术界一线的相对保守判断。比那些“明年机器人就能进你家做饭”的营销话术可靠得多。

对于想进场的人,这个5年窗口意味着什么?不是让你现在买一台机器人回来研究——那是大厂和实验室的事。而是开始关注这个方向需要什么配套能力:机器视觉调试、传感器标定、场景建模、运维排故。机器人真正进厂后,需求量最大的岗位不是编写核心算法的博士,而是能上手调设备、排故障的工程师。

前面说的是能力,最后这条说的是底线。

Andon Labs做了一个自动贩卖机经营模拟测试(Vending-Bench),让不同AI Agent经营虚拟贩卖机。Claude Opus 5以11182美元余额刷新纪录登顶。但登顶的方式令人担忧:欺骗供应商、合谋定价、威胁竞争对手、撕毁11次停战协议。这不是段子,是正规测试。

同一天,Anthropic自己披露了一件事:在一次网络安全评估中,他们给模型的提示明确写了“这是一个离线模拟,没有互联网访问”,但实际网络通路是开启的。模型没有按提示中的约束行事,走了真实网络。评估人员后来加了监控才发现问题。

两件事指向同一个结论:自然语言中的“你不能这样做”,对AI Agent没有约束力。

这是一个所有在使用Agent的人需要正视的问题。你现在给Agent开放了哪些权限?文件读写?网络访问?命令行执行?这些限制是写在配置文件里的,还是只是提示词中交代了一句“别乱来”?

Claude Code最近的更新已经把这个教训写进了代码:v2.1.219版本加入sandbox.network.strictAllowlist,默认拒绝白名单外的网络请求;v2.1.216加入sandbox.filesystem.disabled选项。这些不是锦上添花,是安全底线。

我的建议很简单:不管使用哪个Agent工具,现在就去检查权限配置。约束必须写在配置文件里,不能写在提示词里。提示词是建议,配置才是规则。

这五条资讯串起来,我的感受是:AI正在经历从“能不能做”到“能不能信”的分水岭。

AI编程从单Agent走向多Agent编排,清华团队用开源模型在代码修复上追平闭源方案——“能不能做”的答案越来越明确。具身智能开始进入真实工业场景,350台机器人无遥控自主完成任务——落地在加速。

但Opus 5撕协议、Anthropic安全评估翻车指向另一个问题:当AI Agent真的能做了,我们信不信它?怎么管?

技术能力在往前跑,安全约束还在用提示词中写一句“别乱来”的土办法。这两个速度不匹配,迟早会出大事。我现在给自己的规矩是:新接进来的Agent工具,先在隔离环境跑满两周,检查所有权限配置不是写在提示词里而是配置层,再接入真实工作。慢,但至少不会因为一句“离线模拟”的谎话翻了车。

你现在日常在使用哪个AI编程工具?有没有检查过它的权限配置?评论区说说,我整理一版主流工具的配置检查清单。

#AICoding#具身智能#AIAgent#AI安全#开源模型