Curriculum · Book Style
学习路线与大纲
以能力模型为纲,按章节推进 Agentic Engineering 能力建设。 每一章包含:具备能力、加分项、框架、开源、最佳实践、技术源头与验收标准。 右下角「开启批注」后,可在正文任意位置点击写评论;登录后保存到你的 Gitee 用户目录。
前言
如何使用这份大纲
不要六条线并行。完成一章的「最小可运行实验 + 笔记 + 指标」后再进入下一章。
框架学习以「理解设计与边界」为目标,避免只会调 API。
详细能力定义与公司 JD 标注,见
能力模型页。
阅读顺序
- 先读第 0 章总览,建立全局地图
- 严格按第 1–6 章顺序推进
- 第 7 章按目标岗位选修
- 第 8 章用总项目收束
每章固定结构
- 具备能力 / 加分项
- 需掌握框架 / 优秀开源
- 最佳实践 / 技术源头
- 阶段验收清单
第 0 章
总路线图
P0–P6 与能力模型映射、优先级与验收标准一览。
| 章节 | 能力映射 | 优先级 | 验收标准 |
|---|---|---|---|
| 第 1 章 · P0 | Python、Prompt、LLM 调用 | Must | 可独立写服务并稳定调用模型 |
| 第 2 章 · P1 | Loop / Tool / Memory / Multi-Agent | Must | 最小 Runtime,支持工具与状态恢复 |
| 第 3 章 · P2 | RAG / 向量库 / GraphRAG | Must | 有评测集,能解释召回与幻觉治理 |
| 第 4 章 · P3 | LangGraph + MCP + Harness | Must Should | 扩展图编排,接入 MCP Server |
| 第 5 章 · P4 | Eval / Trace / Prompt 工程化 | Must | 评测→归因→回归闭环 |
| 第 6 章 · P5 | 稳定性 / 流式 / 容器 | Must Should | 限流熔断、Trace、延迟成本报表 |
| 第 7 章 · P6 | 沙箱 / 微调 / 推理 / RL | Plus | 按岗位选修并做出 Demo |
第 1 章
Must
1–2 周
工程与模型地基(P0)
目标:具备把模型接到服务里的基本功,为后续 Agent 闭环打底。
1.1 具备能力
- 熟练使用 Python 编写可维护服务代码
- 掌握 LLM API:流式、超时、重试、降级
- 会写 Structured Output / 结构化 Prompt
- 理解 Token、上下文窗口、成本与延迟
- 能用 Git + 容器运行最小服务
1.2 加分项
- 同时熟悉 Java 或 Go 服务端基础
- Prompt 模板管理与版本化
- 形成稳定的 AI Coding 工作流(Cursor / Claude Code)
1.3 需掌握框架 / 工具
- FastAPI(或等价 Web 框架)
- OpenAI 兼容 API SDK
- Pydantic
- Docker 基础
1.5 最佳实践
- 模型调用统一封装:超时 / 重试 / 熔断 / 日志
- Prompt 与代码分离,带版本与回归样例
- 先测正确性,再谈“更聪明”
- AI Coding 可用,关键路径必须人审
1.6 最新技术源头
- OpenAI / Anthropic / Google 官方 Blog & Cookbook
- DeepSeek / Qwen / GLM 发布说明
- Hugging Face Blog
- Towards AI / The Batch(动态概览)
1.7 阶段验收
- 可流式输出的 LLM Chat API(含重试与日志)
- ≥10 条 Prompt 回归样例
- 能口述成本、首 Token 延迟、失败率如何观测
第 2 章
Must
3–4 周
Agent 核心能力(P1)
能力模型主战场:Tool、Memory、Workflow、Multi-Agent、推理范式。
2.1 具备能力
- 白板画出 Agent Loop:Plan → Act → Observe → Update
- 任务规划:串行 / 并行 / 派生
- 工具体系:注册、校验、并行、超时、重试、降级、追踪
- 上下文工程:短长期记忆、Token 预算、裁剪压缩、状态隔离
- 实现 ReAct 或 Plan-and-Execute 至少一种
- Multi-Agent:主从分工、协作与冲突处理
- 异常恢复:状态机、checkpoint、失败可续跑
2.2 加分项
- Human-in-the-loop(打断、确认、恢复)
- Agent-as-Tool / 动态子 Agent
- Skills / Hooks / Plugin 化扩展
- 拆解 Coding Agent(Claude Code / Codex)机制
2.3 需掌握框架
- LangGraph(主攻)
- LangChain(生态与工具抽象)
- 了解 AutoGen / CrewAI / OpenAI Agents SDK
- 自研最小 Runtime(强烈建议)
2.5 最佳实践
- 先状态机,后更强模型
- 工具权限最小化,危险操作需审批
- 每步落盘:输入、参数、输出、耗时、Token
- 限制最大步数 / 最大费用
- Memory(会话态)与 RAG(知识态)边界清晰
2.6 最新技术源头
- LangChain / LangGraph Blog & Changelog
- Anthropic Engineering(Tool Use 等)
- OpenAI Agents / Responses API 更新
- 论文:ReAct、Reflexion、Plan-and-Solve
2.7 阶段验收
- 自研或深度定制最小 Agent Runtime
- 至少一个 Multi-Agent 场景
- 能对比 ReAct vs Plan-and-Execute 边界
第 3 章
Must
2 周
知识检索与 RAG(P2)
把“会检索”做成可评测、可回归的工程能力。
3.1 具备能力
- 解析、切分、元数据设计
- Embedding、索引、混合检索、Rerank
- 检索结果组织与回填上下文
- 幻觉治理:拒答、引用、置信度
- 离线评测:召回、正确性、引用率
3.2 加分项
- GraphRAG / 知识图谱 / Ontology
- 语义缓存、查询改写、多路召回融合
- 代码知识库 / 代码检索
3.3 需掌握框架
- LlamaIndex 或 LangChain Retriever(深挖其一)
- 向量库:Milvus / pgvector / Qdrant(至少一个)
- 了解 Elasticsearch 混合检索
3.5 最佳实践
- 切分策略绑定文档结构,避免一刀切
- 检索与生成分开评测
- 答案尽量带来源引用
- 维护「坏查询」集合并持续回归
3.6 最新技术源头
- LlamaIndex / LangChain RAG 文档与更新
- Microsoft GraphRAG 论文与仓库
- Milvus / Qdrant / Weaviate 官方 Blog
- RAGAS 与检索评测相关工作
3.7 阶段验收
- 垂直领域知识库 + 混合检索 Demo
- ≥50 条问答评测集与报表
- 能讲清 3 个幻觉 bad case 根因与修复
第 4 章
Must
Should
2 周
框架深挖与协议(P3)
从“会用框架”升级到“能选型、能扩展、能接协议”。
4.1 具备能力
- 深入理解至少 1 个编排框架(状态、边、checkpoint)
- 在生产约束下扩展框架,而非只跑通示例
- 理解 MCP:发现、调用、权限与安全边界
- 理解 Harness:可控运行 + 评测 + 护栏
- 了解 A2A / 多 Agent 通信协议角色
4.2 加分项
- 阅读关键源码路径 / 二次开发
- 自建 MCP Server 对接内部系统
- 对比 Dify/Coze 与代码框架边界
- Eino(Go)等定向语言生态
4.3 需掌握框架
- LangGraph(必深)
- MCP SDK / 规范
- 了解 Spring AI、Dify、Coze
4.5 最佳实践
- 选型先写清:状态复杂度、HITL、可观测需求
- 协议层与业务工具层解耦
- MCP 最小权限 + 副作用审计
- 从“示例能跑”升级到“可配置、可回放、可评测”
4.6 最新技术源头
- MCP 官方规范
- Anthropic / OpenAI Agents 工程文章
- LangGraph Release Notes
- A2A 规范与生态讨论、GitHub Trending
4.7 阶段验收
- LangGraph 长任务工作流(含 checkpoint)
- 至少一个 MCP Server 接入或自建
- 一页框架选型说明(为何用 / 不用)
第 5 章
Must
2 周
评测、观测与迭代闭环(P4)
没有评测集,就不谈优化。把效果迭代做成数据闭环。
5.1 具备能力
- 离线评测集、过程评测、端到端评测
- Bad Case 归因与回归
- 指标:成功率、质量、延迟、成本、人工介入率
- 全链路 Trace:模型 / 检索 / 工具 / 编排节点
- Prompt 模板管理、路由、灰度与效果分析
5.2 加分项
- LLM-as-a-Judge
- 执行轨迹聚类与自动归因
- OpenTelemetry 接入 AI 链路
- 评测平台化
5.3 需掌握框架 / 工具
- LangSmith 或 Langfuse(先跑通一个)
- DeepEval / Promptfoo / RAGAS
- OpenTelemetry(本章了解,第 6 章加深)
5.5 最佳实践
- 没有评测集,不谈“优化了 Prompt”
- 线上指标与离线集对齐
- 每次改动必跑回归,保留 diff
- 成本与延迟纳入质量定义
5.6 最新技术源头
- LangSmith / Langfuse Blog
- OpenAI Evals 与各 Eval 框架 Release
- LLM-as-Judge / Agent Eval 论文
- 各厂 Agent 可观测实践分享
5.7 阶段验收
- 评测集 + 一键回归脚本
- Trace 可回放一次完整失败任务
- 成功率 / 延迟 / 成本看板(截图或文档)
第 6 章
Must
Should
2 周
工程上线与稳定性(P5)
让 Agent 在真实流量下可运行、可降级、可排障。
6.1 具备能力
- 超时、重试、幂等、熔断、限流、降级
- SSE / WebSocket 流式工程细节
- 缓存、MQ、异步调度在 Agent 中的用法
- Docker 部署;理解 K8s 基本概念
- 线上排障:慢调用、工具失败、模型抖动
6.2 加分项
- 全链路压测与分段瓶颈分析
- 多模型路由与自动降级
- Java/Go 高性能服务经验
6.3 需掌握框架 / 组件
- Redis / MQ(Kafka 或等价)
- Docker Compose;K8s 基础清单
- 网关层限流与超时配置
6.5 最佳实践
- 默认超时优于无限等待
- 工具调用必须幂等或可补偿
- 流式接口处理断连与续传语义
- 容量规划关注工具耗时,不只看模型 QPS
6.6 最新技术源头
- 云厂商 AI Infra / Serverless 推理博客
- vLLM / SGLang / TensorRT-LLM Release
- CNCF / K8s AI 工作负载实践
- SRE / 稳定性工程案例
6.7 阶段验收
- Agent 服务可容器化一键启动
- 具备限流 / 熔断 / 降级与基础监控
- 压测记录:QPS、TP99、成功率、工具耗时
第 7 章
Plus
2–4 周
定向加分轨道(P6)
不要全学。按目标岗位选择 1 条主轨道 + 1 条辅轨道。
轨道 A · 运行时 / 沙箱
- 具备能力:隔离执行、权限、弹性调度、护栏
- 框架:Docker、K8s、gVisor/Firecracker(了解)
- 源头:云原生安全与大厂隔离实践
轨道 B · 微调 / 对齐
- 具备能力:数据构建、SFT、LoRA/QLoRA、评估
- 开源:HF TRL、LLaMA-Factory、PEFT
- 源头:HF Blog、RLHF/DPO 论文
轨道 C · 推理加速与成本
- 具备能力:批处理、量化、路由、缓存、首 Token 优化
- 开源:vLLM、SGLang、llama.cpp
- 源头:推理引擎 Release 与基准报告
轨道 D · 决策 / RL 交叉
- 具备能力:约束决策、规划搜索、RL 概念
- 加分:Offline RL、规则引擎混合架构
- 源头:RL 经典文献 + 工业调度案例
第 8 章
总项目 Capstone
用一个端到端项目串起第 2–6 章。可选:研发效能 Agent、垂直问答 Agent、业务流程 Agent、审核风控 Agent。
必须证明的能力
- Runtime + Tool + Memory
- RAG 或业务工具接入
- Eval 集与回归
- 可观测与基础稳定性
加分交付
- MCP 化工具
- Multi-Agent / HITL
- 成本与延迟优化报告
- 5 分钟演示脚本
交付物清单
- 可运行仓库 + README + 架构图
- 指标面板(成功率 / 延迟 / 成本)
- 10 个 Bad Case 复盘
附录 A
信息源中枢
工程实践向
- 框架 Changelog / Release Notes(每周)
- Langfuse / LangSmith / vLLM 官方博客
- 大厂技术博客:落地与稳定性案例
- 本仓库后续
frontend/frontier/
产业信号向
- 目标公司技术博客与开源组织
- JD 样本持续抽样,反哺能力模型
- Agent / RAG / LLMSys 相关会议与工作坊
附录 B
每周执行节奏
| 日 | 投入重心 | 产出 |
|---|---|---|
| 周一 | 读 1 篇官方更新 / 论文 / Release | 半页笔记:影响哪条能力 |
| 周二–周四 | 主章节动手(框架或项目) | 可运行提交 + 指标 |
| 周五 | 评测与 Bad Case | 回归报告 |
| 周六 | 体系化复盘 / 更新架构图 | 更新进度勾选 |
| 周日 | 信息源扫尾 + 下周计划 | 3 条待验证假设 |
建议在仓库中维护个人进度:每完成一章勾选验收清单,并反链到
frontend/projects/ 自研目录。