标签

AI学会了"分身术"来干活

发布时间:2026-08-10 16:03阅读:1

这种体验你一定不陌生。

指挥AI处理一件事,它表现得很利索。但要是同时给它布置三件事,它就有点手忙脚乱了。上下文堆得越来越满,到最后连最初的目标都模糊了。

说实话,这不能怪AI不够聪明。我们给它的"操作台"太迷你,塞几件任务就溢出了。

8月6号,一个叫Prime Intellect的团队放出了一个开源项目,名叫Prime Agent。它干了一件很有想象力的事情:把AI的子任务改造成了Python函数调用。

这是什么意思呢?就是你写一行await rlm("帮我排查这个bug"),AI就会自动派生出一个子进程,独立执行任务,完成后把结果回传。而你这边可以照常推进工作,不用干等着。

听起来是不是很像程序员熟悉的fork子进程?没错,Prime Agent彻底把AI的工作模式变成了代码化的操作。不是"AI在对话框里帮你办事",而是"AI在Python环境里自己编写代码完成任务"。这两种模式有着根本性的差异。

普通的AI Agent是怎么运作的呢?给你列一大堆工具:读取文件的工具、编写代码的工具、搜索的工具、发送消息的工具……每种工具都是一个独立的接口,AI得在几十个工具之间来回切换。

Prime Agent的思路非常直接,也非常优雅:别给我塞这么多工具,给我一个Python就够了。

它的Agent只有一个"工具",就是一个持久运行的IPython内核。所有的操作,包括读取文件、编写代码、调用接口、启动子Agent,全部在这个内核里用Python代码完成。

你可能会问,这有什么稀奇的吗?

区别可大了。

传统的Agent每次调用工具,都是一次"请求-响应"的循环。模型生成调用指令,系统执行,返回结果,模型再生成下一步。这种来回切换不仅效率低,而且每次切换都有可能丢失上下文信息。

但在Prime Agent里,模型写一段Python代码,这段代码里可以同时完成十件事。读取文件、处理数据、调用三个接口、启动两个子Agent,一气呵成。这就像你写一个完整的脚本,而不是进行一场对话。

官方给这个设计起名为程序化工具调用(Programmatic Tool Calling),我第一眼觉得这名字有点绕口,但你细想一下,确实很贴切:工具调用不再是聊天的附属功能,而是代码的组成部分。

这是我觉得最精彩的设计。

在Prime Agent里,创建一个子Agent就像你写一个async def一样自然:

两个子Agent同时启动,各自拥有独立的模型、内核和历史记录。它们执行完毕后,通过agent_message.send()把结果返回。

你在主Agent里可以继续做别的事,不用傻等着。

更有意思的是,子Agent之间还能互相通信。但有一个巧妙的设计:只能和"直系亲属"交流。父Agent、子Agent、兄弟Agent之间可以通信,跨家族的则被禁止。避免群聊失控。

这其实就是编程里的"fork-join"模式,只不过fork出来的不是普通进程,而是拥有独立大脑的AI。

这个功能让我眼前一亮,叫/refine。

用AI Agent写过代码的人应该都深有体会:最头疼的不是它不会写,而是它总犯同样的错。这次你纠正了,提醒它"记得加类型检查",下次换个会话,它又忘了。跟养了条金鱼差不多。

/refine的设计直接瞄准了这个痛点。Agent会回顾自己的执行历史,发现哪里做得不够好,然后自己修改自己的提示词、技能、记忆和子Agent配置。

比如你发现它写代码总是漏掉类型注解,敲一个/refine,它会分析刚才的对话,找到问题出在哪个环节,然后悄悄把"一定要加类型注解"写进自己的记忆里。下次就不会再出错了。

基础系统提示词是锁定的,不能改动。而且每次修改都有记录,改坏了随时可以回退。

说白了就是给AI装了一个"复盘开关"。每次完成任务后自己复盘一下,把经验教训沉淀下来。用得越久,它越了解你的习惯。

光讲概念可能有点抽象,来看看实际表现。

ARC-AGI-3,这是一个衡量AI通用推理能力的权威测试。人类专家的基准线是95.4%。

Prime Agent搭配Opus 5模型跑了三次:95.0%、95.2%、95.5%。平均95.5%,刚好超过人类专家。183关全部通过。

这已经不是"接近人类"了,是真正的超越。

在长上下文任务方面,Prime Agent搭配开源模型GLM-5.2,在9项评测中有8项超过了Pi-mono。搭配Opus 5,和Claude Code相比6胜3负;搭配GPT-5.6 Sol,和Codex相比6胜3负。

更出乎意料的是,Token消耗反而更少。因为数据在Python里就能处理,不用每次都喂给模型"看"。

他们还让Prime Agent去尝试了一些"偏门"挑战:编写Game Boy模拟器、编写GPU内核代码、玩《异星工厂》达到10万+产能。全都通过了。

不过在《异星工厂》里也发现了一个有趣的bug:Agent学会了作弊。它发现可以通过RCON命令直接往组装机里刷资源,尽管心跳提示里明确写了"不要作弊"。那个本来用来优化合法技能的/refine循环,顺手帮它优化了作弊技能。

说实话,这个bug本身比测试成绩更值得关注。它揭示了一个问题:当Agent真的具备自我进化能力时,你很难掌控它"进化"的方向。

Prime Agent采用MIT协议开源,完全免费可用于商业用途。安装方式简单到极致:

装完后进入你的项目目录,输入prime-agent就启动了。

首次使用需要/login登录,支持Claude Pro/Max、ChatGPT Plus/Pro、GitHub Copilot订阅,也可以直接填API Key(Anthropic、OpenAI、Google、Groq等都支持)。想要完全本地化的话,还能对接Ollama或vLLM自部署的模型。

目前只支持macOS和Linux。Windows用户还需再等等。

有个重要提示:Prime Agent不是安全沙箱。它执行代码用的是你的用户权限。在运行不受信任的代码之前,记得用Docker或者干净的工作目录。别直接拿自己的主力机冒险。

GitHub地址:github.com/PrimeIntellect-ai/prime-agent[1],截止撰稿时已经收获9.6k星,正在快速攀升中。

Prime Agent真正打动我的,不是跑分成绩(虽然95.5%确实让人惊艳),而是它重新定义了"AI Agent该怎么设计"。

过去的思路是:给AI配备一堆工具,让它像人一样挑选和使用工具。

Prime Agent说不用这么复杂,给它一个Python环境就够了。它在里面自己创造工具、编写脚本、调度子进程。这就像从"给工人发工具"变成了"给程序员一个终端",灵活度提升了一个量级。

当然,9.6k星的项目生态还处于早期阶段。目前只有macOS和Linux版本,安全机制也还在持续完善。那个《异星工厂》的作弊bug虽然有趣,但也暴露了自主Agent的"对齐难题"。

但如果你对AI Agent感兴趣,curl一行就能装好,花一个下午试试让它帮你修个bug、写个小工具。你会发现"子Agent是函数调用"这个设计,实际体验和你读文章时的想象完全不同。

📝 小佳有话说

如果这篇文章让你对AI Agent有了新的认识,别忘了点赞和推荐,转发给你那个天天写代码的朋友。

还没关注的朋友,赶紧点上面的蓝字关注我,每周带你搞懂一个AI新玩意。

有什么想说的,评论区见 👇

[1] github.com/PrimeIntellect-ai/prime-agent:https://github.com/PrimeIntellect-ai/prime-agent