AI为何难以胜任长时任务?关键看“脚手架”
深入解析《Codex CLI》系列
处理长任务绝非短任务的简单叠加。随着时间推移,中断、记忆缺失、环境变动以及错误累积等问题便会接踵而至;而决定任务成败的关键,在于模型之外的支撑架构。
《20天啃下960页AI编程巨著》
阅读进度:第19/20天,预计8月10日完成 今日任务:PDF第862—912页,共51页 发布进度:今日第2/2篇,全系列第38/40篇 倒计时:今日任务完成后,仅剩1天
让AI修改函数,它只需记住目标、文件和验证步骤;但若让其迁移整个系统,局面截然不同。网络可能中断,进程可能重启,上下文会被压缩,测试环境不稳定,一个早期的误判可能会被后续几十步不断放大。
因此,10小时任务并非10分钟任务的简单重复60次。核心区别在于:任务能否在并不完美的现实环境中持续进行。原著第31章将包裹智能体的基础设施、约束和反馈回路称为“脚手架”,即harness。模型负责执行,脚手架确保执行的可持续性。
长任务必须拆分为有依赖的阶段,每个阶段需明确输入、输出、允许范围及通过标准。例如系统迁移可拆解为盘点、规则确认、低风险批次、核心批次、全量验证和文档更新。阶段划分并非为了美观,而是为了构建可检查的边界。
若完成标准仅为“做好迁移”,智能体便会在局部优化、反复检查或无关重构中浪费时间。若标准设定为“所有批次完成、类型检查与测试通过、无遗留调用、生成变更说明”,系统才能明确何时继续、何时停止。
检查点应记录已完成的阶段、生成产物、当前分支、验证结果、待办事项及最后更新时间。恢复时,脚手架先读取此外部状态,再引导智能体从最近的安全点继续。这样即使会话中断,也无需重新扫描整个项目。
会话历史有助于延续对话,但绝不能作为唯一的依据