← Back
lukeTheNeuromancer

lukeTheNeuromancer/agentic-ai-system-design-primer-zh

Agentic AI 系统设计笔记

View on GitHub ↗
Stars
40
Forks
6
Watchers
40
Open issues
0
Contributors
1
Language
—
License
MIT License
Default branch
main
Created Sep 25, 2026Updated Sep 25, 2026

Star growth

Today—
This week—
This month—

Star history will appear here once this repo has been tracked for a couple of days.

README

Agentic AI 系统设计入门

学习如何设计生产级 AI 智能体系统

智能体 AI 的"系统设计入门"——涵盖架构、模式、权衡与真实的生产工程实践

万事皆有取舍。在智能体 AI 中,取舍在于:自主性 vs 可控性、成本 vs 质量、延迟 vs 准确率,以及简洁性 vs 能力。


深入生产指南

本 README 是入门指南——概览 + 面试准备。想要带代码、决策树和真实模式的生产级深度内容,请查看 /resources/ 文件夹:

类别 概览 包含内容
智能体 模式、多智能体、框架、SDK ReAct · Plan-and-Execute · Reflexion · 模式决策树 · Supervisor · 何时采用多智能体 · LangChain · LangGraph · CrewAI · AutoGen · LangFlow · 框架对比 · Claude SDK · OpenAI SDK
记忆 短期、长期、情景、程序性 上下文窗口 · Token 预算 · 压缩 · Mem0 · Zep · LangMem · 记忆方案对比 · 检查点 · 自改进智能体
工具 设计原则、可靠性、分类 单一职责 · 幂等性 · 错误契约 · 熔断器 · 代码执行 · 浏览器工具
RAG 流水线、分块、检索、重排 分块 · 混合检索 · 重排 · 查询改写 · 故障模式
上下文工程 窗口管理、缓存、注入、版本控制 提示词缓存 · 动态注入 · 版本控制
安全 护栏、注入防御、沙箱、治理 直接注入 · 间接注入 · 防御架构 · NeMo Guardrails · E2B 沙箱 · 欧盟 AI 法案
可观测性 追踪、平台、指标、告警 智能体追踪 · Langfuse · LangSmith · OpenTelemetry · 平台对比 · 度量什么
评估 RAGAS、LLM-as-Judge、轨迹评估、CI 门禁 RAGAS · LLM-as-Judge · 轨迹评估 · CI 评估门禁 · 红队测试
成本工程 Token 预算、路由、缓存、真实数据 Token 预算 · 模型路由 · 语义缓存 · 真实数据
故障模式 MAST 分类、缓解手册 MAST 分类 · 缓解手册
可扩展性 水平扩展、多租户、异步 水平扩展 · 多租户 · 异步编排
安全性 零信任、凭证、隔离 零信任智能体 · 凭证管理
部署 容器、K8s、模型服务、CI/CD 容器化 · 模型服务 · 健康检查 · CI/CD
协议 MCP、A2A MCP · A2A · MCP vs A2A
高层设计 参考架构、面试模板 参考架构 · 面试模板
低层设计 状态机、API、数据模型 状态机设计 · API 契约 · 数据模型
人工介入 审批关卡、升级、置信度 审批关卡 · 升级策略 · 置信度阈值

动机

为什么要学习智能体 AI 系统设计?

2026 年智能体 AI 职位发布同比增长 280%,达到约 9 万个美国职位(Stanford AI Index 2026)。预计到 2026 年底,40% 的企业应用将集成任务专用的 AI 智能体(Gartner)。美国智能体 AI 工程师的薪资带为底薪 $185K–$320K。

然而超过 40% 的多智能体 AI 项目失败了(MAST 分类,NeurIPS 2025)。差距不在于做 demo——而在于构建能在规模下可靠运行的系统。

这与传统系统设计有什么不同?

传统系统设计 智能体 AI 系统设计
确定性请求-响应 非确定性推理循环
固定的 API 契约 LLM 动态选择工具
无状态微服务 带记忆的有状态智能体会话
水平扩展 Token 预算 + 成本管理
错误码 幻觉检测 + 护栏
负载均衡器 智能体编排器
缓存(Redis) 语义缓存 + 提示词缓存
健康检查 智能体行为监控 + 评估

适合谁?

  • 转向 AI 工程的后端/软件工程师
  • 准备系统设计面试的 AI 工程师
  • 构建生产级智能体系统的工程师
  • 为组织评估智能体架构的架构师

学习指南

根据你有多少时间,决定如何使用这份资源:

时间安排 重点内容 章节
1 周(面试准备) 模式 + 取舍 + 2 个案例研究 从这里开始、智能体模式、记忆、面试方法,任意 2 个解答
2 周(扎实基础) 以上 + 生产问题 增加工具架构、RAG、成本工程、故障模式、可观测性
1 个月(全面掌握) 全部 + 所有案例研究 所有章节 + 全部 10 个解答 + 附录
持续参考 按需用于架构决策 收藏特定章节,在设计评审时查阅

如何应对智能体系统设计面试

Anthropic、Cohere、Mistral 和 FAANG 智能体岗位的面试遵循 4 步框架(45-60 分钟):

第 1 步:澄清需求与约束

不要直接跳到架构。在这里花 5-10 分钟。

  • 智能体应该做什么?(功能需求)
  • 它不能做什么?(范围边界)
  • 用户是谁?(终端用户、内部工具、API 调用方)
  • 延迟预期是多少?(秒级?分钟级?异步?)
  • 准确率要求多高?(可以错 5%?还是 0.1%?)
  • 哪些动作需要人工审批?(金融、生产、面向客户)
  • 规模多大?(日用户数、每秒请求数、每月 Token 数)
  • 成本预算是多少?(单请求、单用户、每月)
  • 有哪些合规约束?(PII、HIPAA、SOC2、GDPR)

估算用量(信封背面估算):

用户数:10,000 日活
每用户每天交互数:5
每天智能体运行数:50,000
每秒智能体运行数:~0.6
每次运行 Token 数(平均):4,000(输入)+ 1,000(输出)= 5,000
每天 Token 数:2.5 亿
按 $3/M 输入 + $15/M 输出计算每天成本:
  输入:2 亿 × $3/M = $600
  输出:5,000 万 × $15/M = $750
  总计:约 $1,350/天 → 约 $40K/月

第 2 步:绘制高层设计

画出典型的智能体架构:

用户 → API 网关 → 编排智能体
                         ├── 规划器
                         ├── 工具执行器 → [工具:搜索、代码、API、数据库]
                         ├── 记忆管理器 → [短期 | 长期 | 情景]
                         ├── LLM 路由器 → [主 LLM | 快速 LLM | 专用模型]
                         ├── 护栏引擎
                         └── 响应组装器 → 用户
                              ↕
                    可观测性(Langfuse/LangSmith/OTel)

解释每个组件存在的理由,以及去掉它会发生什么。

第 3 步:设计核心智能体组件

这里需要深入。对每个核心组件:

  • 智能体模式选择——ReAct?Plan-and-Execute?为什么?
  • 工具设计——哪些工具?什么 schema?幂等性?
  • 记忆架构——哪些类型?用什么存储?淘汰策略?
  • LLM 路由——哪个步骤用哪个模型?成本影响?
  • 安全——护栏放在哪里?拦截什么?

必要时展示伪代码或 API 契约。

第 4 步:扩展并加固设计

  • 识别瓶颈——规模放大 10 倍时哪里会崩?
  • 成本优化——模型路由、缓存、Token 预算
  • 故障模式——什么会出问题?如何发现?
  • 可观测性——追踪什么、度量什么、告警什么?
  • 人工介入——哪里需要人参与闭环?

来自 Cohere 面试的专业建议: 他们还有展示环节——你展示一个过去的项目,面试官会就设计选择、失败的方案和替代方案交叉质询。准备一个 15 分钟的演讲,讲你最拿得出手的项目。


智能体系统设计面试题(含解答)

问题 难度
设计一个 AI 客服智能体 中等
设计一个 AI 编程智能体 困难
设计一个自主研究助手 中等
设计一个 AI SDR/销售智能体 中等
设计一个 DevOps 故障处理智能体 困难
设计一个 AI 个人助理 中等
设计一个浏览器自动化智能体 困难
设计一个多智能体企业工作流系统 非常困难
设计一个 AI 数据分析师 中等
设计一个 AI 知识管理平台 困难

智能体 AI 主题——速查

下面每个主题都是简要概览。点击深入链接查看带代码、决策树和真实模式的生产级内容。

智能体——模式、多智能体、框架、SDK

核心问题: 用哪种智能体模式?→ 模式决策树

单智能体 vs 多智能体: 默认用单智能体。只有当你测出了单智能体的性能上限、任务能分解为不同领域,并且你有协调基础设施时,才上多智能体。真实案例:$8/次查询的多智能体 → $0.40/次查询的单智能体,准确率差异 <1%。

因素 单智能体 多智能体
复杂度 低——一个循环、一个状态 高——协调、交接、状态同步
成本 更低——LLM 调用更少 更高——N 个智能体 × 每次 M 次调用
延迟 可预测 不稳定——取决于协调
调试 简单直接 困难——故障跨智能体级联
适用场景 任务能塞进一个上下文窗口 + 工具集 任务跨越不同专业领域
深入阅读:概览 · 何时采用多智能体

智能体模式一览:

模式 Token 成本 适用场景 深入阅读
ReAct 中等 探索性、动态任务 → ReAct
Plan-and-Execute 低(节省 70%) 可预测的多步任务 → P&E
Reflexion 2-3 倍开销 有明确通过/失败标准的任务 → Reflexion
ReWOO 最低 独立的并行查询 → ReWOO

框架一览:

框架 适用场景 深入阅读
LangGraph 有状态工作流,企业默认选择 → LangGraph
CrewAI 基于角色的多智能体原型 → CrewAI
AutoGen 基于对话的多智能体 → AutoGen
LlamaIndex 以数据为中心的 RAG + 智能体 → LlamaIndex
Pydantic AI 类型安全、依赖注入 → Pydantic AI
DSPy 编程化的提示词优化 → DSPy

完整对比:→ 框架对比


记忆

核心问题: 用哪种记忆类型 + 存储?→ 记忆概览

记忆类型 存储内容 深入阅读
短期 当前上下文窗口 上下文窗口 · Token 预算 · 压缩
长期 跨会话的事实、偏好 Mem0 · Zep · LangMem · 对比
情景 历史交互、执行记录 检查点 · 执行轨迹
程序性 学到的策略、自改进提示词 自改进智能体

快速基准: LongMemEval 上 Mem0 49% vs Zep 63.8% vs Hindsight 91.4%。


工具

核心问题: 如何为智能体设计可靠的工具?→ 工具概览

四个不可妥协项:单一职责 · 幂等性 · 错误契约 · Schema 设计

可靠性:熔断器 · 重试策略

分类:代码执行 · 浏览器工具 · API 集成


RAG(检索增强生成)

核心问题: 如何构建生产级 RAG 流水线?→ RAG 概览

流水线:查询 → 分块 → 混合检索 → 重排 → 生成 → 引用

另见:查询改写 · RAG 故障模式


上下文工程

核心问题: 如何管理进入上下文窗口的内容?→ 上下文工程概览

关键技术:提示词缓存(Anthropic 节省 90%,OpenAI 节省 50%)· 动态注入 · 版本控制


协议

MCP 连接智能体与工具。A2A 连接智能体与其他智能体。两者互补。

深入阅读:MCP · A2A · MCP vs A2A


安全与护栏

核心问题: 如何防止智能体做出有害行为?→ 安全概览

4 层分类:内容 → 评估 → 沙箱 → 动作

深入阅读:直接注入 · 间接注入 · 防御架构 · NeMo Guardrails · E2B 沙箱 · 欧盟 AI 法案


可观测性与监控

核心问题: 如何了解我的智能体在生产环境中做了什么?→ 可观测性概览

平台:Langfuse · LangSmith · OpenTelemetry · 对比

监控内容:指标 · 告警设计 · 智能体追踪


评估

核心问题: 我怎么知道智能体是否正常工作?→ 评估概览

深入阅读:RAGAS · LLM-as-Judge · 轨迹评估 · CI 评估门禁 · 红队测试


成本工程

核心问题: 如何在规模下控制智能体成本?→ 成本概览

核心洞察:Token 成本占智能体总成本的 70-90%。团队往往低估 5-10 倍。

深入阅读:Token 预算 · 模型路由 · 语义缓存 · 真实数据


人工介入(HITL)

核心问题: 智能体的哪些动作需要人工批准?→ HITL 概览

深入阅读:审批关卡 · 升级策略 · 置信度阈值


故障模式

核心问题: 生产级智能体系统会出什么问题?→ 故障模式概览

关键数据:7 个框架、1,642 条轨迹中,故障率 41-86.7%(MAST,NeurIPS 2025)。

深入阅读:MAST 分类(14 种模式) · 缓解手册


可扩展性 · 安全性 · 部署

主题 核心问题 深入阅读
可扩展性 如何横向扩展智能体? 概览 · 水平扩展 · 多租户 · 异步编排
安全性 如何保障智能体系统的安全? 概览 · 零信任智能体 · 凭证管理
部署 如何把智能体部署到生产环境? 概览 · 容器化 · 模型服务 · 健康检查 · CI/CD

高层设计 · 低层设计

主题 包含内容 深入阅读
高层设计 参考架构、服务拆分、面试模板 概览 · 参考架构 · 面试模板
低层设计 状态机、API 契约、数据模型、流式传输 概览 · 状态机设计 · API 契约 · 数据模型

附录

Token 参考数字

内容 约 Token 数
1 个英文单词 ~1.3 tokens
1 页文本 ~500 tokens
1 个代码文件(200 行) ~800 tokens
系统提示词(典型智能体) 2,000-4,000 tokens
RAG 上下文(5 个分块) 2,500-5,000 tokens
完整对话(10 轮) 5,000-15,000 tokens

AI 系统延迟数字

操作 延迟
LLM 推理(首 Token,Claude Sonnet) 500-800ms
LLM 推理(首 Token,Haiku) 200-400ms
向量检索(Qdrant,100 万向量) 5-20ms
重排(Cohere,50 篇文档) 80-120ms
Redis 读取 < 1ms
Postgres 查询 1-10ms
外部 API 调用 100-500ms
完整智能体回合(工具调用 + 推理) 2-8 秒
多智能体协调(3 个智能体) 5-20 秒

更多面试题

架构与模式:

  1. 什么情况下你不会用智能体?
  2. 对比 LangGraph vs CrewAI vs AutoGen——分别在什么场景下选哪个?
  3. 如何防止智能体陷入无限循环?
  4. 工作流和智能体的区别是什么?
  5. 设计一个主 LLM 服务商宕机时的兜底策略。

记忆与上下文: 6. 为一个跨会话记住用户偏好的客服智能体设计记忆架构。 7. 长运行智能体中如何处理上下文窗口溢出? 8. 什么情况下用 Mem0、Zep,或直接用 pgvector?

安全与可靠性: 9. 一个处理用户提交文档的智能体,如何防范提示词注入? 10. 多智能体系统中会出现哪些单智能体不会出现的问题? 11. 详细讲讲你会如何为生产环境中执行代码的智能体构建护栏。 12. 智能体在测试中表现正常,但生产中静默失败。如何诊断?

成本与扩展: 13. 智能体每天运行 5 万个会话时如何控制成本? 14. 如何针对具体问题在 RAG、微调、提示词工程之间做选择? 15. 估算一个服务 1 万日活用户的客服智能体的月成本。

评估: 16. 如何评估智能体是否正常工作? 17. 离线评估和在线评估的区别是什么? 18. 如何构建一个能拦截劣质提示词变更的 CI 评估门禁?

真实世界的智能体架构

公司 系统 作用 来源
Telefónica 语音 AI 智能体 客服单次交互 €0.35,对比人工基准 €3.50 10 个智能体 AI 示例
Siemens + PepsiCo Digital Twin Composer AI 智能体以物理级精度模拟供应链变化 CES 2026
PwC 结构化编排 通过结构化多智能体编排实现 7 倍准确率提升 MAST 分析
Cursor AI 编程智能体 自主多文件智能体(Cursor 3),约 50 名员工实现 $2B ARR Cursor
Anthropic Claude Code 驱动 Claude Code 的 Agent SDK——子智能体、MCP、权限管理 Agent SDK

公司 AI 工程博客

公司 博客 关注点
Anthropic anthropic.com/research 智能体模式、安全、对齐
LangChain blog.langchain.dev LangGraph、LangSmith、生产智能体
Cohere cohere.com/blog 企业 RAG、智能体工作流
OpenAI openai.com/research 模型能力、智能体、评估
Latent.Space latent.space 信号最强的 AI 工程 newsletter

值得读的论文

论文 链接 重要性 阅读时长
Anthropic:Building Effective Agents anthropic.com 5 种生产模式。从这里开始。 30 分钟
ReAct:Synergizing Reasoning and Acting arXiv 工具使用的奠基论文 45 分钟
MAST:Why Do Multi-Agent LLM Systems Fail? arXiv 1,642 条轨迹中的 14 种故障模式 45 分钟
Plan-then-Execute:Resilient LLM Agents arXiv P-t-E 架构指南 1 小时
Mem0:Production-Ready Long-Term Memory arXiv Token 削减 80% 的基准 1 小时
EDDOps:Eval-Driven Development arXiv 持续评估的形式化框架 1 小时
Securing AI Agents Against Prompt Injection arXiv 防御架构 45 分钟
Agentic Design Patterns arXiv GoF 格式的智能体模式 1 小时
Production-Grade Agentic AI Workflows arXiv 9 条生产最佳实践 1 小时

致谢

  • Anthropic — Building Effective Agents、Claude Agent SDK
  • LangChain — LangGraph、LangSmith、LangChain
  • donnemartin/system-design-primer — 本资源借鉴的其结构和格式
  • MAST 作者 — Mert Cemri、Melissa Z. Pan、Shuyi Yang 等
  • Mem0 — 记忆基准与研究
  • 本文档中链接的所有来源

许可证

基于 MIT License 授权

最后更新:2026 年 5 月


参考:HimClix/agentic-ai-system-design-primer