Way to Agentic / 前言
书籍目录版
Curriculum · Book Style

学习路线与大纲

以能力模型为纲,按章节推进 Agentic Engineering 能力建设。 每一章包含:具备能力、加分项、框架、开源、最佳实践、技术源头与验收标准。 右下角「开启批注」后,可在正文任意位置点击写评论;登录后保存到你的 Gitee 用户目录。

建议周期 12–16 周 主线 Must → Should → Plus 原则 先闭环,再加深 批注 可落盘保存
前言

如何使用这份大纲

不要六条线并行。完成一章的「最小可运行实验 + 笔记 + 指标」后再进入下一章。

框架学习以「理解设计与边界」为目标,避免只会调 API。 详细能力定义与公司 JD 标注,见 能力模型页

阅读顺序

  • 先读第 0 章总览,建立全局地图
  • 严格按第 1–6 章顺序推进
  • 第 7 章按目标岗位选修
  • 第 8 章用总项目收束

每章固定结构

  • 具备能力 / 加分项
  • 需掌握框架 / 优秀开源
  • 最佳实践 / 技术源头
  • 阶段验收清单
第 0 章

总路线图

P0–P6 与能力模型映射、优先级与验收标准一览。

章节 能力映射 优先级 验收标准
第 1 章 · P0 Python、Prompt、LLM 调用 Must 可独立写服务并稳定调用模型
第 2 章 · P1 Loop / Tool / Memory / Multi-Agent Must 最小 Runtime,支持工具与状态恢复
第 3 章 · P2 RAG / 向量库 / GraphRAG Must 有评测集,能解释召回与幻觉治理
第 4 章 · P3 LangGraph + MCP + Harness Must Should 扩展图编排,接入 MCP Server
第 5 章 · P4 Eval / Trace / Prompt 工程化 Must 评测→归因→回归闭环
第 6 章 · P5 稳定性 / 流式 / 容器 Must Should 限流熔断、Trace、延迟成本报表
第 7 章 · P6 沙箱 / 微调 / 推理 / RL Plus 按岗位选修并做出 Demo
第 1 章 Must 1–2 周

工程与模型地基(P0)

目标:具备把模型接到服务里的基本功,为后续 Agent 闭环打底。

1.1 具备能力

  • 熟练使用 Python 编写可维护服务代码
  • 掌握 LLM API:流式、超时、重试、降级
  • 会写 Structured Output / 结构化 Prompt
  • 理解 Token、上下文窗口、成本与延迟
  • 能用 Git + 容器运行最小服务

1.2 加分项

  • 同时熟悉 Java 或 Go 服务端基础
  • Prompt 模板管理与版本化
  • 形成稳定的 AI Coding 工作流(Cursor / Claude Code)

1.3 需掌握框架 / 工具

  • FastAPI(或等价 Web 框架)
  • OpenAI 兼容 API SDK
  • Pydantic
  • Docker 基础

1.5 最佳实践

  • 模型调用统一封装:超时 / 重试 / 熔断 / 日志
  • Prompt 与代码分离,带版本与回归样例
  • 先测正确性,再谈“更聪明”
  • AI Coding 可用,关键路径必须人审

1.6 最新技术源头

  • OpenAI / Anthropic / Google 官方 Blog & Cookbook
  • DeepSeek / Qwen / GLM 发布说明
  • Hugging Face Blog
  • Towards AI / The Batch(动态概览)

1.7 阶段验收

  • 可流式输出的 LLM Chat API(含重试与日志)
  • ≥10 条 Prompt 回归样例
  • 能口述成本、首 Token 延迟、失败率如何观测
第 2 章 Must 3–4 周

Agent 核心能力(P1)

能力模型主战场:Tool、Memory、Workflow、Multi-Agent、推理范式。

2.1 具备能力

  • 白板画出 Agent Loop:Plan → Act → Observe → Update
  • 任务规划:串行 / 并行 / 派生
  • 工具体系:注册、校验、并行、超时、重试、降级、追踪
  • 上下文工程:短长期记忆、Token 预算、裁剪压缩、状态隔离
  • 实现 ReAct 或 Plan-and-Execute 至少一种
  • Multi-Agent:主从分工、协作与冲突处理
  • 异常恢复:状态机、checkpoint、失败可续跑

2.2 加分项

  • Human-in-the-loop(打断、确认、恢复)
  • Agent-as-Tool / 动态子 Agent
  • Skills / Hooks / Plugin 化扩展
  • 拆解 Coding Agent(Claude Code / Codex)机制

2.3 需掌握框架

  • LangGraph(主攻)
  • LangChain(生态与工具抽象)
  • 了解 AutoGen / CrewAI / OpenAI Agents SDK
  • 自研最小 Runtime(强烈建议)

2.5 最佳实践

  • 先状态机,后更强模型
  • 工具权限最小化,危险操作需审批
  • 每步落盘:输入、参数、输出、耗时、Token
  • 限制最大步数 / 最大费用
  • Memory(会话态)与 RAG(知识态)边界清晰

2.6 最新技术源头

  • LangChain / LangGraph Blog & Changelog
  • Anthropic Engineering(Tool Use 等)
  • OpenAI Agents / Responses API 更新
  • 论文:ReAct、Reflexion、Plan-and-Solve

2.7 阶段验收

  • 自研或深度定制最小 Agent Runtime
  • 至少一个 Multi-Agent 场景
  • 能对比 ReAct vs Plan-and-Execute 边界
第 3 章 Must 2 周

知识检索与 RAG(P2)

把“会检索”做成可评测、可回归的工程能力。

3.1 具备能力

  • 解析、切分、元数据设计
  • Embedding、索引、混合检索、Rerank
  • 检索结果组织与回填上下文
  • 幻觉治理:拒答、引用、置信度
  • 离线评测:召回、正确性、引用率

3.2 加分项

  • GraphRAG / 知识图谱 / Ontology
  • 语义缓存、查询改写、多路召回融合
  • 代码知识库 / 代码检索

3.3 需掌握框架

  • LlamaIndex 或 LangChain Retriever(深挖其一)
  • 向量库:Milvus / pgvector / Qdrant(至少一个)
  • 了解 Elasticsearch 混合检索

3.5 最佳实践

  • 切分策略绑定文档结构,避免一刀切
  • 检索与生成分开评测
  • 答案尽量带来源引用
  • 维护「坏查询」集合并持续回归

3.6 最新技术源头

  • LlamaIndex / LangChain RAG 文档与更新
  • Microsoft GraphRAG 论文与仓库
  • Milvus / Qdrant / Weaviate 官方 Blog
  • RAGAS 与检索评测相关工作

3.7 阶段验收

  • 垂直领域知识库 + 混合检索 Demo
  • ≥50 条问答评测集与报表
  • 能讲清 3 个幻觉 bad case 根因与修复
第 4 章 Must Should 2 周

框架深挖与协议(P3)

从“会用框架”升级到“能选型、能扩展、能接协议”。

4.1 具备能力

  • 深入理解至少 1 个编排框架(状态、边、checkpoint)
  • 在生产约束下扩展框架,而非只跑通示例
  • 理解 MCP:发现、调用、权限与安全边界
  • 理解 Harness:可控运行 + 评测 + 护栏
  • 了解 A2A / 多 Agent 通信协议角色

4.2 加分项

  • 阅读关键源码路径 / 二次开发
  • 自建 MCP Server 对接内部系统
  • 对比 Dify/Coze 与代码框架边界
  • Eino(Go)等定向语言生态

4.3 需掌握框架

  • LangGraph(必深)
  • MCP SDK / 规范
  • 了解 Spring AI、Dify、Coze

4.5 最佳实践

  • 选型先写清:状态复杂度、HITL、可观测需求
  • 协议层与业务工具层解耦
  • MCP 最小权限 + 副作用审计
  • 从“示例能跑”升级到“可配置、可回放、可评测”

4.6 最新技术源头

  • MCP 官方规范
  • Anthropic / OpenAI Agents 工程文章
  • LangGraph Release Notes
  • A2A 规范与生态讨论、GitHub Trending

4.7 阶段验收

  • LangGraph 长任务工作流(含 checkpoint)
  • 至少一个 MCP Server 接入或自建
  • 一页框架选型说明(为何用 / 不用)
第 5 章 Must 2 周

评测、观测与迭代闭环(P4)

没有评测集,就不谈优化。把效果迭代做成数据闭环。

5.1 具备能力

  • 离线评测集、过程评测、端到端评测
  • Bad Case 归因与回归
  • 指标:成功率、质量、延迟、成本、人工介入率
  • 全链路 Trace:模型 / 检索 / 工具 / 编排节点
  • Prompt 模板管理、路由、灰度与效果分析

5.2 加分项

  • LLM-as-a-Judge
  • 执行轨迹聚类与自动归因
  • OpenTelemetry 接入 AI 链路
  • 评测平台化

5.3 需掌握框架 / 工具

  • LangSmith 或 Langfuse(先跑通一个)
  • DeepEval / Promptfoo / RAGAS
  • OpenTelemetry(本章了解,第 6 章加深)

5.5 最佳实践

  • 没有评测集,不谈“优化了 Prompt”
  • 线上指标与离线集对齐
  • 每次改动必跑回归,保留 diff
  • 成本与延迟纳入质量定义

5.6 最新技术源头

  • LangSmith / Langfuse Blog
  • OpenAI Evals 与各 Eval 框架 Release
  • LLM-as-Judge / Agent Eval 论文
  • 各厂 Agent 可观测实践分享

5.7 阶段验收

  • 评测集 + 一键回归脚本
  • Trace 可回放一次完整失败任务
  • 成功率 / 延迟 / 成本看板(截图或文档)
第 6 章 Must Should 2 周

工程上线与稳定性(P5)

让 Agent 在真实流量下可运行、可降级、可排障。

6.1 具备能力

  • 超时、重试、幂等、熔断、限流、降级
  • SSE / WebSocket 流式工程细节
  • 缓存、MQ、异步调度在 Agent 中的用法
  • Docker 部署;理解 K8s 基本概念
  • 线上排障:慢调用、工具失败、模型抖动

6.2 加分项

  • 全链路压测与分段瓶颈分析
  • 多模型路由与自动降级
  • Java/Go 高性能服务经验

6.3 需掌握框架 / 组件

  • Redis / MQ(Kafka 或等价)
  • Docker Compose;K8s 基础清单
  • 网关层限流与超时配置

6.5 最佳实践

  • 默认超时优于无限等待
  • 工具调用必须幂等或可补偿
  • 流式接口处理断连与续传语义
  • 容量规划关注工具耗时,不只看模型 QPS

6.6 最新技术源头

  • 云厂商 AI Infra / Serverless 推理博客
  • vLLM / SGLang / TensorRT-LLM Release
  • CNCF / K8s AI 工作负载实践
  • SRE / 稳定性工程案例

6.7 阶段验收

  • Agent 服务可容器化一键启动
  • 具备限流 / 熔断 / 降级与基础监控
  • 压测记录:QPS、TP99、成功率、工具耗时
第 7 章 Plus 2–4 周

定向加分轨道(P6)

不要全学。按目标岗位选择 1 条主轨道 + 1 条辅轨道

轨道 A · 运行时 / 沙箱

  • 具备能力:隔离执行、权限、弹性调度、护栏
  • 框架:Docker、K8s、gVisor/Firecracker(了解)
  • 源头:云原生安全与大厂隔离实践

轨道 B · 微调 / 对齐

  • 具备能力:数据构建、SFT、LoRA/QLoRA、评估
  • 开源:HF TRL、LLaMA-Factory、PEFT
  • 源头:HF Blog、RLHF/DPO 论文

轨道 C · 推理加速与成本

  • 具备能力:批处理、量化、路由、缓存、首 Token 优化
  • 开源:vLLM、SGLang、llama.cpp
  • 源头:推理引擎 Release 与基准报告

轨道 D · 决策 / RL 交叉

  • 具备能力:约束决策、规划搜索、RL 概念
  • 加分:Offline RL、规则引擎混合架构
  • 源头:RL 经典文献 + 工业调度案例
第 8 章

总项目 Capstone

用一个端到端项目串起第 2–6 章。可选:研发效能 Agent、垂直问答 Agent、业务流程 Agent、审核风控 Agent。

必须证明的能力

  • Runtime + Tool + Memory
  • RAG 或业务工具接入
  • Eval 集与回归
  • 可观测与基础稳定性

加分交付

  • MCP 化工具
  • Multi-Agent / HITL
  • 成本与延迟优化报告
  • 5 分钟演示脚本

交付物清单

  • 可运行仓库 + README + 架构图
  • 指标面板(成功率 / 延迟 / 成本)
  • 10 个 Bad Case 复盘
附录 A

信息源中枢

工程实践向

  • 框架 Changelog / Release Notes(每周)
  • Langfuse / LangSmith / vLLM 官方博客
  • 大厂技术博客:落地与稳定性案例
  • 本仓库后续 frontend/frontier/

产业信号向

  • 目标公司技术博客与开源组织
  • JD 样本持续抽样,反哺能力模型
  • Agent / RAG / LLMSys 相关会议与工作坊
附录 B

每周执行节奏

投入重心产出
周一读 1 篇官方更新 / 论文 / Release半页笔记:影响哪条能力
周二–周四主章节动手(框架或项目)可运行提交 + 指标
周五评测与 Bad Case回归报告
周六体系化复盘 / 更新架构图更新进度勾选
周日信息源扫尾 + 下周计划3 条待验证假设
建议在仓库中维护个人进度:每完成一章勾选验收清单,并反链到 frontend/projects/ 自研目录。