你大概已经写过「能调几个函数的聊天机器人」,也大概已经在生产里踩过这些坑:工具幻觉、上下文越写越长、任务做到一半假成功、评测全靠人眼。模型每升一代,Demo 会更好看,但长流程、高风险场景里,真正卡住的往往不是「会不会写 prompt」,而是模型之外那一层工程稳不稳。

本系列是我读李博杰《深入理解 AI Agent:设计原理与工程实践》(v1.2,开源讲稿整理)时的工程学习笔记。结构跟书走,表述与代码按自己的理解重写,不是原文缩译。目标只有一个:把「感觉驱动」的 Agent 搭建,收成可讨论、可评测、可迭代的原则驱动工程。

核心公式:先记住这一句

书里把最小可运行形态写成:

Agent = LLM + 上下文 + 工具

直觉映射:

角色实现层负责什么
大脑LLM理解、规划、决策、决定是否调用工具
眼睛上下文模型「此刻能看见」的一切:系统提示、对话、工具定义、检索片段、状态元信息
手脚工具读文件、搜网页、调 API、跑代码、操作 GUI……

熟悉强化学习的人可以再叠一层形式化语言:策略(Policy) 对应 LLM,观察空间(Observation) 对应上下文,动作空间(Action) 对应工具。三套说法描述同一对象,只是抽象层不同。

Demo 视角下,三件齐就能转起来。生产视角还要再套一圈外壳——书里把它收成 Harness(套件 / 线束:把模型「绑」进可靠执行环境的所有支撑代码):

Agent = Model + Harness
Harness ≈ 上下文 + 工具 + 约束 + 验证 + 纠正
  • 约束:能做什么、不能做什么(权限、金额上限、禁止路径)
  • 验证:做完的结果对不对(检查交付件、断言、二次审核)
  • 纠正:错了怎么恢复(重试、重规划、回滚、人工接管)

这三层不是新模块清单,而是围绕「上下文 + 工具」织出来的安全网。最小公式让系统能跑;扩展公式让系统能在钱、权限、长流程里站住。

全书地图:三部分怎么串

部分章节你要带走的主线
基础第 1 章公式、ReAct 循环、Harness、工作流 vs 自主
三大支柱第 2–7 章上下文 / 工具 / 模型(评估 + 后训练)
进阶第 8–10 章自我进化、多模态实时、多 Agent

更细一点:

  1. 上下文(2–3 章):API 消息结构、KV Cache 友好设计、Skills、状态栏、压缩;再延伸到用户记忆与 RAG / Agentic RAG。
  2. 工具(4–5 章):工具粒度与 MCP、异步事件;Coding Agent 为什么几乎成了通用 Agent 的内核。
  3. 模型(6–7 章):没有评估就没有进步;SFT / RL 与工具调用能力如何进参数。
  4. 演化与协作(8–10 章):经验如何外化、语音与 Computer Use、多 Agent 何时划算。

读的时候建议带着一个业务问题:你的 Agent 是「几轮聊天就够」还是「数小时多利益相关方还不能数错」?上限要求越高,Harness 的必要性越明显。

和站内旧系列怎么配合

站内已有 Agent 模式手册(约 23 篇),偏通识:ReAct、Plan-and-Execute、记忆、框架对比、生产化清单等。本系列不重复同一路径,差异在:

旧系列 ai-agent本系列 ai-agent-indepth
粒度模式百科 + 可跑 Demo按「公式 + Harness」纵向加深
重心会用循环与工具上下文工程、评估科学、后训练、自我进化
口吻从零到生产可用读完一本开源讲义后的工程笔记

两套可以交叉读:例如旧文讲清 ReAct 骨架后,这里用 Harness 视角看「为什么光有循环还不够」;旧文的评测篇,可与本系列第 6 章对照。

阅读约定

  • 每篇用场景或反直觉问题开场,不先写「本文将介绍……」。
  • 术语首次出现会就地解释;需要时给最小可运行代码。
  • 文中若提 Claude Code、Manus、OpenClaw、Pine 等产品,是为了说明架构选择,不是产品评测榜。
  • 书中实验与数据请以原书与其仓库为准;这里重写的是原则与取舍

下一篇从第 1 章切入:把公式拆开,看 ReAct 真正在循环什么,以及 Harness 五个功能原则如何把 Demo 往生产推。

版权声明: 如无特别声明,本文版权归 sshipanoo 所有,转载请注明本文链接。

(采用 CC BY-NC-SA 4.0 许可协议进行授权)

本文标题:00. 导读:从感觉驱动到原则驱动的 Agent 工程

本文链接:https://www.sshipanoo.com/blog/ai/ai-agent-indepth/00-导读/

本文最后一次更新为 天前,文章中的某些内容可能已过时!