标签

AI Agent 技术书源码公开

发布时间:2026-08-11 15:40阅读:3

前几天在视频平台有人推荐《深入理解 AI Agent:设计原理与工程实践》这本书,我顺手去 GitHub 上看了看,记录一下该书的具体情况。

作者为 Pine AI 首席科学家李博杰,全书正文、图表及 95 个配套实验均已在 GitHub 上开源(bojieli/ai-agent-book)。作者近期仍在持续维护——最新提交于今日(8 月 11 日),修复了第 4 章 Sidecar 的拼写问题;此前还同步了第 4、10 章的翻译,并新增了第 8 章的消融模块。

本书核心内容

书中将 Agent 归纳为以下公式:

Agent = LLM + 上下文 + 工具

即大脑、眼睛与手脚。大脑(LLM)负责决策,眼睛(上下文)决定视野,手脚(工具)决定行动力。

全书共十章,根据作者前言的划分,可归纳为四个部分:

构建 Agent(第二至五章):上下文工程、记忆与知识库、工具、Coding Agent

评估与进化(第六至八章):评估系统、模型后训练、持续进化

交互与协作(第九至十章):多模态实时交互、多 Agent 协作

第一章搭建统一框架,将 Agent 从实现层、直觉层至学术层串联起来。

作者推荐的阅读路径:Agent 开发者按顺序阅读第一至八章;若时间紧张,可优先阅读第一、二章,因第二章 KV Cache 底层原理较为技术化,初学者可暂缓阅读。

本书的诞生过程

前言中作者透露,本书采用了其所谓的“口述式协作”(whisper coding)方式编写,他口述时使用的正是 Pine 自己的语音 Agent:

每次撰写讲稿前,我会先向它口述大致提纲,让其进行调研(survey),再由其整理初稿;课后结合 AI Agent 实战营学员的反馈,与其反复讨论、打磨,通过多次迭代,最终将这些讲稿扩展、整理成了现书。

后记中提及的两个待解决问题

其一为 Agent 如何流式、实时地与环境交互。目前的 Agent 多为回合制,而真实环境输入是持续变化的。作者提出了两条路径:架构上实现快慢分离,以及加快推理速度。

其二为 Agent 如何像人类一样从成败中持续积累经验。目前的模型在每次任务结束后,过程中获得的经验大多会随上下文一同丢弃。

仓库地址:https://github.com/bojieli/ai-agent-book