学习如何设计生产级 AI 智能体系统
智能体 AI 的"系统设计入门"——涵盖架构、模式、权衡与真实的生产工程实践
万事皆有取舍。在智能体 AI 中,取舍在于:自主性 vs 可控性、成本 vs 质量、延迟 vs 准确率,以及简洁性 vs 能力。
本 README 是入门指南——概览 + 面试准备。想要带代码、决策树和真实模式的生产级深度内容,请查看
/resources/文件夹:
| 类别 | 概览 | 包含内容 |
|---|---|---|
| 智能体 | 模式、多智能体、框架、SDK | ReAct · Plan-and-Execute · Reflexion · 模式决策树 · Supervisor · 何时采用多智能体 · LangChain · LangGraph · CrewAI · AutoGen · LangFlow · 框架对比 · Claude SDK · OpenAI SDK |
| 记忆 | 短期、长期、情景、程序性 | 上下文窗口 · Token 预算 · 压缩 · Mem0 · Zep · LangMem · 记忆方案对比 · 检查点 · 自改进智能体 |
| 工具 | 设计原则、可靠性、分类 | 单一职责 · 幂等性 · 错误契约 · 熔断器 · 代码执行 · 浏览器工具 |
| RAG | 流水线、分块、检索、重排 | 分块 · 混合检索 · 重排 · 查询改写 · 故障模式 |
| 上下文工程 | 窗口管理、缓存、注入、版本控制 | 提示词缓存 · 动态注入 · 版本控制 |
| 安全 | 护栏、注入防御、沙箱、治理 | 直接注入 · 间接注入 · 防御架构 · NeMo Guardrails · E2B 沙箱 · 欧盟 AI 法案 |
| 可观测性 | 追踪、平台、指标、告警 | 智能体追踪 · Langfuse · LangSmith · OpenTelemetry · 平台对比 · 度量什么 |
| 评估 | RAGAS、LLM-as-Judge、轨迹评估、CI 门禁 | RAGAS · LLM-as-Judge · 轨迹评估 · CI 评估门禁 · 红队测试 |
| 成本工程 | Token 预算、路由、缓存、真实数据 | Token 预算 · 模型路由 · 语义缓存 · 真实数据 |
| 故障模式 | MAST 分类、缓解手册 | MAST 分类 · 缓解手册 |
| 可扩展性 | 水平扩展、多租户、异步 | 水平扩展 · 多租户 · 异步编排 |
| 安全性 | 零信任、凭证、隔离 | 零信任智能体 · 凭证管理 |
| 部署 | 容器、K8s、模型服务、CI/CD | 容器化 · 模型服务 · 健康检查 · CI/CD |
| 协议 | MCP、A2A | MCP · A2A · MCP vs A2A |
| 高层设计 | 参考架构、面试模板 | 参考架构 · 面试模板 |
| 低层设计 | 状态机、API、数据模型 | 状态机设计 · API 契约 · 数据模型 |
| 人工介入 | 审批关卡、升级、置信度 | 审批关卡 · 升级策略 · 置信度阈值 |
为什么要学习智能体 AI 系统设计?
2026 年智能体 AI 职位发布同比增长 280%,达到约 9 万个美国职位(Stanford AI Index 2026)。预计到 2026 年底,40% 的企业应用将集成任务专用的 AI 智能体(Gartner)。美国智能体 AI 工程师的薪资带为底薪 $185K–$320K。
然而超过 40% 的多智能体 AI 项目失败了(MAST 分类,NeurIPS 2025)。差距不在于做 demo——而在于构建能在规模下可靠运行的系统。
这与传统系统设计有什么不同?
| 传统系统设计 | 智能体 AI 系统设计 |
|---|---|
| 确定性请求-响应 | 非确定性推理循环 |
| 固定的 API 契约 | LLM 动态选择工具 |
| 无状态微服务 | 带记忆的有状态智能体会话 |
| 水平扩展 | Token 预算 + 成本管理 |
| 错误码 | 幻觉检测 + 护栏 |
| 负载均衡器 | 智能体编排器 |
| 缓存(Redis) | 语义缓存 + 提示词缓存 |
| 健康检查 | 智能体行为监控 + 评估 |
适合谁?
- 转向 AI 工程的后端/软件工程师
- 准备系统设计面试的 AI 工程师
- 构建生产级智能体系统的工程师
- 为组织评估智能体架构的架构师
根据你有多少时间,决定如何使用这份资源:
| 时间安排 | 重点内容 | 章节 |
|---|---|---|
| 1 周(面试准备) | 模式 + 取舍 + 2 个案例研究 | 从这里开始、智能体模式、记忆、面试方法,任意 2 个解答 |
| 2 周(扎实基础) | 以上 + 生产问题 | 增加工具架构、RAG、成本工程、故障模式、可观测性 |
| 1 个月(全面掌握) | 全部 + 所有案例研究 | 所有章节 + 全部 10 个解答 + 附录 |
| 持续参考 | 按需用于架构决策 | 收藏特定章节,在设计评审时查阅 |
Anthropic、Cohere、Mistral 和 FAANG 智能体岗位的面试遵循 4 步框架(45-60 分钟):
不要直接跳到架构。在这里花 5-10 分钟。
- 智能体应该做什么?(功能需求)
- 它不能做什么?(范围边界)
- 用户是谁?(终端用户、内部工具、API 调用方)
- 延迟预期是多少?(秒级?分钟级?异步?)
- 准确率要求多高?(可以错 5%?还是 0.1%?)
- 哪些动作需要人工审批?(金融、生产、面向客户)
- 规模多大?(日用户数、每秒请求数、每月 Token 数)
- 成本预算是多少?(单请求、单用户、每月)
- 有哪些合规约束?(PII、HIPAA、SOC2、GDPR)
估算用量(信封背面估算):
用户数:10,000 日活
每用户每天交互数:5
每天智能体运行数:50,000
每秒智能体运行数:~0.6
每次运行 Token 数(平均):4,000(输入)+ 1,000(输出)= 5,000
每天 Token 数:2.5 亿
按 $3/M 输入 + $15/M 输出计算每天成本:
输入:2 亿 × $3/M = $600
输出:5,000 万 × $15/M = $750
总计:约 $1,350/天 → 约 $40K/月
画出典型的智能体架构:
用户 → API 网关 → 编排智能体
├── 规划器
├── 工具执行器 → [工具:搜索、代码、API、数据库]
├── 记忆管理器 → [短期 | 长期 | 情景]
├── LLM 路由器 → [主 LLM | 快速 LLM | 专用模型]
├── 护栏引擎
└── 响应组装器 → 用户
↕
可观测性(Langfuse/LangSmith/OTel)
解释每个组件存在的理由,以及去掉它会发生什么。
这里需要深入。对每个核心组件:
- 智能体模式选择——ReAct?Plan-and-Execute?为什么?
- 工具设计——哪些工具?什么 schema?幂等性?
- 记忆架构——哪些类型?用什么存储?淘汰策略?
- LLM 路由——哪个步骤用哪个模型?成本影响?
- 安全——护栏放在哪里?拦截什么?
必要时展示伪代码或 API 契约。
- 识别瓶颈——规模放大 10 倍时哪里会崩?
- 成本优化——模型路由、缓存、Token 预算
- 故障模式——什么会出问题?如何发现?
- 可观测性——追踪什么、度量什么、告警什么?
- 人工介入——哪里需要人参与闭环?
来自 Cohere 面试的专业建议: 他们还有展示环节——你展示一个过去的项目,面试官会就设计选择、失败的方案和替代方案交叉质询。准备一个 15 分钟的演讲,讲你最拿得出手的项目。
| 问题 | 难度 |
|---|---|
| 设计一个 AI 客服智能体 | 中等 |
| 设计一个 AI 编程智能体 | 困难 |
| 设计一个自主研究助手 | 中等 |
| 设计一个 AI SDR/销售智能体 | 中等 |
| 设计一个 DevOps 故障处理智能体 | 困难 |
| 设计一个 AI 个人助理 | 中等 |
| 设计一个浏览器自动化智能体 | 困难 |
| 设计一个多智能体企业工作流系统 | 非常困难 |
| 设计一个 AI 数据分析师 | 中等 |
| 设计一个 AI 知识管理平台 | 困难 |
下面每个主题都是简要概览。点击深入链接查看带代码、决策树和真实模式的生产级内容。
核心问题: 用哪种智能体模式?→ 模式决策树
单智能体 vs 多智能体: 默认用单智能体。只有当你测出了单智能体的性能上限、任务能分解为不同领域,并且你有协调基础设施时,才上多智能体。真实案例:$8/次查询的多智能体 → $0.40/次查询的单智能体,准确率差异 <1%。
| 因素 | 单智能体 | 多智能体 |
|---|---|---|
| 复杂度 | 低——一个循环、一个状态 | 高——协调、交接、状态同步 |
| 成本 | 更低——LLM 调用更少 | 更高——N 个智能体 × 每次 M 次调用 |
| 延迟 | 可预测 | 不稳定——取决于协调 |
| 调试 | 简单直接 | 困难——故障跨智能体级联 |
| 适用场景 | 任务能塞进一个上下文窗口 + 工具集 | 任务跨越不同专业领域 |
| 深入阅读:概览 · 何时采用多智能体 |
智能体模式一览:
| 模式 | Token 成本 | 适用场景 | 深入阅读 |
|---|---|---|---|
| ReAct | 中等 | 探索性、动态任务 | → ReAct |
| Plan-and-Execute | 低(节省 70%) | 可预测的多步任务 | → P&E |
| Reflexion | 2-3 倍开销 | 有明确通过/失败标准的任务 | → Reflexion |
| ReWOO | 最低 | 独立的并行查询 | → ReWOO |
框架一览:
| 框架 | 适用场景 | 深入阅读 |
|---|---|---|
| LangGraph | 有状态工作流,企业默认选择 | → LangGraph |
| CrewAI | 基于角色的多智能体原型 | → CrewAI |
| AutoGen | 基于对话的多智能体 | → AutoGen |
| LlamaIndex | 以数据为中心的 RAG + 智能体 | → LlamaIndex |
| Pydantic AI | 类型安全、依赖注入 | → Pydantic AI |
| DSPy | 编程化的提示词优化 | → DSPy |
完整对比:→ 框架对比
核心问题: 用哪种记忆类型 + 存储?→ 记忆概览
| 记忆类型 | 存储内容 | 深入阅读 |
|---|---|---|
| 短期 | 当前上下文窗口 | 上下文窗口 · Token 预算 · 压缩 |
| 长期 | 跨会话的事实、偏好 | Mem0 · Zep · LangMem · 对比 |
| 情景 | 历史交互、执行记录 | 检查点 · 执行轨迹 |
| 程序性 | 学到的策略、自改进提示词 | 自改进智能体 |
快速基准: LongMemEval 上 Mem0 49% vs Zep 63.8% vs Hindsight 91.4%。
核心问题: 如何为智能体设计可靠的工具?→ 工具概览
四个不可妥协项:单一职责 · 幂等性 · 错误契约 · Schema 设计
核心问题: 如何构建生产级 RAG 流水线?→ RAG 概览
流水线:查询 → 分块 → 混合检索 → 重排 → 生成 → 引用
核心问题: 如何管理进入上下文窗口的内容?→ 上下文工程概览
关键技术:提示词缓存(Anthropic 节省 90%,OpenAI 节省 50%)· 动态注入 · 版本控制
MCP 连接智能体与工具。A2A 连接智能体与其他智能体。两者互补。
深入阅读:MCP · A2A · MCP vs A2A
核心问题: 如何防止智能体做出有害行为?→ 安全概览
4 层分类:内容 → 评估 → 沙箱 → 动作
深入阅读:直接注入 · 间接注入 · 防御架构 · NeMo Guardrails · E2B 沙箱 · 欧盟 AI 法案
核心问题: 如何了解我的智能体在生产环境中做了什么?→ 可观测性概览
平台:Langfuse · LangSmith · OpenTelemetry · 对比
核心问题: 我怎么知道智能体是否正常工作?→ 评估概览
深入阅读:RAGAS · LLM-as-Judge · 轨迹评估 · CI 评估门禁 · 红队测试
核心问题: 如何在规模下控制智能体成本?→ 成本概览
核心洞察:Token 成本占智能体总成本的 70-90%。团队往往低估 5-10 倍。
深入阅读:Token 预算 · 模型路由 · 语义缓存 · 真实数据
核心问题: 智能体的哪些动作需要人工批准?→ HITL 概览
核心问题: 生产级智能体系统会出什么问题?→ 故障模式概览
关键数据:7 个框架、1,642 条轨迹中,故障率 41-86.7%(MAST,NeurIPS 2025)。
深入阅读:MAST 分类(14 种模式) · 缓解手册
| 主题 | 核心问题 | 深入阅读 |
|---|---|---|
| 可扩展性 | 如何横向扩展智能体? | 概览 · 水平扩展 · 多租户 · 异步编排 |
| 安全性 | 如何保障智能体系统的安全? | 概览 · 零信任智能体 · 凭证管理 |
| 部署 | 如何把智能体部署到生产环境? | 概览 · 容器化 · 模型服务 · 健康检查 · CI/CD |
| 主题 | 包含内容 | 深入阅读 |
|---|---|---|
| 高层设计 | 参考架构、服务拆分、面试模板 | 概览 · 参考架构 · 面试模板 |
| 低层设计 | 状态机、API 契约、数据模型、流式传输 | 概览 · 状态机设计 · API 契约 · 数据模型 |
| 内容 | 约 Token 数 |
|---|---|
| 1 个英文单词 | ~1.3 tokens |
| 1 页文本 | ~500 tokens |
| 1 个代码文件(200 行) | ~800 tokens |
| 系统提示词(典型智能体) | 2,000-4,000 tokens |
| RAG 上下文(5 个分块) | 2,500-5,000 tokens |
| 完整对话(10 轮) | 5,000-15,000 tokens |
| 操作 | 延迟 |
|---|---|
| LLM 推理(首 Token,Claude Sonnet) | 500-800ms |
| LLM 推理(首 Token,Haiku) | 200-400ms |
| 向量检索(Qdrant,100 万向量) | 5-20ms |
| 重排(Cohere,50 篇文档) | 80-120ms |
| Redis 读取 | < 1ms |
| Postgres 查询 | 1-10ms |
| 外部 API 调用 | 100-500ms |
| 完整智能体回合(工具调用 + 推理) | 2-8 秒 |
| 多智能体协调(3 个智能体) | 5-20 秒 |
架构与模式:
- 什么情况下你不会用智能体?
- 对比 LangGraph vs CrewAI vs AutoGen——分别在什么场景下选哪个?
- 如何防止智能体陷入无限循环?
- 工作流和智能体的区别是什么?
- 设计一个主 LLM 服务商宕机时的兜底策略。
记忆与上下文: 6. 为一个跨会话记住用户偏好的客服智能体设计记忆架构。 7. 长运行智能体中如何处理上下文窗口溢出? 8. 什么情况下用 Mem0、Zep,或直接用 pgvector?
安全与可靠性: 9. 一个处理用户提交文档的智能体,如何防范提示词注入? 10. 多智能体系统中会出现哪些单智能体不会出现的问题? 11. 详细讲讲你会如何为生产环境中执行代码的智能体构建护栏。 12. 智能体在测试中表现正常,但生产中静默失败。如何诊断?
成本与扩展: 13. 智能体每天运行 5 万个会话时如何控制成本? 14. 如何针对具体问题在 RAG、微调、提示词工程之间做选择? 15. 估算一个服务 1 万日活用户的客服智能体的月成本。
评估: 16. 如何评估智能体是否正常工作? 17. 离线评估和在线评估的区别是什么? 18. 如何构建一个能拦截劣质提示词变更的 CI 评估门禁?
| 公司 | 系统 | 作用 | 来源 |
|---|---|---|---|
| Telefónica | 语音 AI 智能体 | 客服单次交互 €0.35,对比人工基准 €3.50 | 10 个智能体 AI 示例 |
| Siemens + PepsiCo | Digital Twin Composer | AI 智能体以物理级精度模拟供应链变化 | CES 2026 |
| PwC | 结构化编排 | 通过结构化多智能体编排实现 7 倍准确率提升 | MAST 分析 |
| Cursor | AI 编程智能体 | 自主多文件智能体(Cursor 3),约 50 名员工实现 $2B ARR | Cursor |
| Anthropic | Claude Code | 驱动 Claude Code 的 Agent SDK——子智能体、MCP、权限管理 | Agent SDK |
| 公司 | 博客 | 关注点 |
|---|---|---|
| Anthropic | anthropic.com/research | 智能体模式、安全、对齐 |
| LangChain | blog.langchain.dev | LangGraph、LangSmith、生产智能体 |
| Cohere | cohere.com/blog | 企业 RAG、智能体工作流 |
| OpenAI | openai.com/research | 模型能力、智能体、评估 |
| Latent.Space | latent.space | 信号最强的 AI 工程 newsletter |
| 论文 | 链接 | 重要性 | 阅读时长 |
|---|---|---|---|
| Anthropic:Building Effective Agents | anthropic.com | 5 种生产模式。从这里开始。 | 30 分钟 |
| ReAct:Synergizing Reasoning and Acting | arXiv | 工具使用的奠基论文 | 45 分钟 |
| MAST:Why Do Multi-Agent LLM Systems Fail? | arXiv | 1,642 条轨迹中的 14 种故障模式 | 45 分钟 |
| Plan-then-Execute:Resilient LLM Agents | arXiv | P-t-E 架构指南 | 1 小时 |
| Mem0:Production-Ready Long-Term Memory | arXiv | Token 削减 80% 的基准 | 1 小时 |
| EDDOps:Eval-Driven Development | arXiv | 持续评估的形式化框架 | 1 小时 |
| Securing AI Agents Against Prompt Injection | arXiv | 防御架构 | 45 分钟 |
| Agentic Design Patterns | arXiv | GoF 格式的智能体模式 | 1 小时 |
| Production-Grade Agentic AI Workflows | arXiv | 9 条生产最佳实践 | 1 小时 |
- Anthropic — Building Effective Agents、Claude Agent SDK
- LangChain — LangGraph、LangSmith、LangChain
- donnemartin/system-design-primer — 本资源借鉴的其结构和格式
- MAST 作者 — Mert Cemri、Melissa Z. Pan、Shuyi Yang 等
- Mem0 — 记忆基准与研究
- 本文档中链接的所有来源
基于 MIT License 授权
最后更新:2026 年 5 月