主题
Agent 核心理论
Agent 是一套围绕目标、环境、工具、状态和反馈组织起来的执行系统。本章面向 Agent 工程师面试:你要能讲清模式,也要能讲清失败时怎么定位。
本章内容
- 什么是 AI Agent?与传统 ChatBot 应用有何区别? — 目标驱动、状态、工具、循环和工程成本的核心区别
- AI Agent 的核心组件有哪些? — 感知、决策、执行、记忆如何组成任务推进闭环
- 什么是 Agent 的上下文窗口? — 长任务里的信息预算、位置偏置、成本延迟和上下文治理
- 工具调用基础:什么是 Tool Calling — 概念边界、四步基本流程、决策与执行分离
- 工具返回超大结果怎么处理? — 摘要优先、分页游标、落盘句柄、三层治理方案
- 什么是 Agent Loop(智能体循环)? — 目标、状态、动作、观察、状态更新和停止条件的面试回答
- ReAct 推理范式是什么?它如何让 Agent 更可靠地完成任务? — 显式推理、环境接地、闭环纠错、轨迹可审计四个可靠性机制
- ReAct 模式 — 推理与行动交替的原始论文与实现
- 先规划后执行 Plan-and-Execute — Planner / Executor 分工与 ReWOO 变体
- 什么是 Reflexion?它和 ReAct 有什么区别? — 步内纠错 vs 跨尝试学习,反思闭环的四环节与记忆治理
- Agent 系统中如何设计优雅的终止条件? — 完成条件、止损出口、循环检测、预算控制和人工接管
- MCP 协议是什么?它解决了什么问题? — 工具生态标准化、N×M 集成成本和 Agent 外部能力接入
- MCP 协议的架构包含哪些核心组件? — Host、Client、Server、Tools、Resources、Prompts 的职责边界
- 什么是 A2A 协议?它和 MCP 协议有什么区别? — Agent 间协作协议和工具接入协议的分层区别
- A2A 协议中的 Agent Card 是什么? — 多 Agent 发现、能力声明、认证和协作入口
- 上下文超出窗口时有哪些压缩策略? — 滑动窗口、摘要压缩、结构化抽取、检索式记忆和隔离上下文
- MCP 和 A2A 如何协同工作? — 同时使用工具接入和 Agent 协作协议的多 Agent 架构
- 生产环境如何保证 Agent 系统安全? — Prompt 注入、越权工具、数据泄露、沙箱、审批和审计
- 多 Agent 协作有哪些常见编排模式? — 路由、Orchestrator-Worker、黑板、辩论和流水线模式
- Function Calling 和 MCP 有什么区别? — 模型工具调用意图和工具进程协议的边界、优缺点
- AI Agent 的记忆机制有哪些类型? — 短期记忆、工作记忆、长期记忆、情景记忆和语义记忆
- 如何让 AI Agent 具备长期记忆能力? — 存储 schema、向量检索、图谱、写入治理和召回评估
- 如何设计 AI Agent 的工具权限控制? — 读写分离、最小权限、动态授权、审批和审计
- 子 Agent 模式有什么优势和挑战? — 独立上下文、任务隔离、父子边界和结果汇总
- 从零设计 Agent 框架要优先实现哪些模块? — 模型适配、工具系统、状态管理、运行循环和可观测性
- 如何设计生产级 Agent 系统架构? — Runtime、工具面、记忆面、安全面、评估面和运维面
- 如何评估 AI Agent 的效果? — 单步、过程、结果、线上质量和业务指标评估
- MCP 的工作流程是什么? — 初始化、能力发现、工具转译、调用路由和结果回灌
- MCP 协议安全性设计包含哪些层面? — Server 信任、权限边界、传输鉴权、工具审计和注入防护
- 如何将已有应用转换成 MCP 服务? — API 封装、Tool/Resource/Prompt 建模、鉴权、测试和部署
- 什么是 Manus? — 通用 Agent 产品形态、异步任务、工具执行和工程边界
- Computer Use 是什么? — 截图感知、动作空间、反馈循环、GUI 自动化和安全限制
- ReAct 是什么? — Reasoning、Acting、Observation 交替推进的工具使用范式
- 大模型应用如何实现长短期记忆? — 会话上下文、摘要、外部存储、检索召回和记忆治理
- 什么是大模型 Agent?它与传统 AI 系统有什么不同? — 目标驱动、工具使用、运行时决策和反馈闭环
- LLM Agent 的基本架构有哪些组成部分? — 模型、规划、工具、记忆、上下文、执行和观测
- LLM Agent 常见功能有哪些? — 工具调用、检索、规划、执行、协作、记忆和自我修正
- 如何让 LLM Agent 具备长期记忆能力? — 记忆抽取、存储、召回、冲突处理、隐私和评估
- LLM Agent 如何进行动态 API 调用? — API 发现、Schema 生成、工具选择、权限校验和结果回灌
- LLM Agent 如何进行动态 API 调用?深挖版 — 动态工具发现、OpenAPI/MCP、Schema、鉴权、错误恢复和治理
- LLM Agent 在多模态任务中如何执行推理? — 图像、语音、视频、文档和工具反馈的跨模态推理链路
- 主流 LLM Agent 框架有哪些? — LangChain/LangGraph、AutoGen、CrewAI、ADK、OpenAI Agents SDK 等选型
- AutoGPT 如何实现自主决策? — 目标驱动、任务拆解、工具循环、记忆和停止条件
- A2A 的核心架构及主要组件有哪些? — Agent Card、Client、Server、Task、Message、Artifact 和能力发现
- A2A 协议有哪五大设计原则? — 互操作、能力发现、任务协作、模态无关和企业安全
- A2A 协议的工作原理是怎样的? — Agent 发现、任务创建、消息交换、状态推进和结果交付
- A2A 协议的工作流程是怎样的? — 发现 Agent、创建 Task、发送 Message、流式更新和 Artifact 返回
- A2A 与 MCP 协议的关系是怎样的? — Agent 间协作和工具接入协议如何分层协同
- 什么是 Google ADK? — Google Agent Development Kit 的架构、工具、部署和适用场景
- Spring AI 如何实现 Tool Calling? — Java/Spring 生态下的工具声明、ChatClient 调用和安全边界
- 什么是 OpenManus?它的实现原理是什么? — 开源 Manus 思路、Planner/Executor、工具循环和沙箱治理
- Agent 死循环问题如何解决? — 重复动作检测、无进展判断、预算、停止条件和 trace 回归
- 自我反思 Reflexion — 失败反馈如何写回下一轮尝试
- Agent 运行循环 — 从用户输入到任务完成的状态机
- 规划算法 — ToT、MCTS、任务图在 Agent 中的用法
- 记忆架构 — MemGPT、Mem0、LangMem 的工程取舍
- Agent Skills — 把稳定经验做成可加载能力包
- 自我纠错机制 — 检测、回滚、重试和拒绝
学习路径
- 从 Agent 定义 开始,明确 Agent、工作流、聊天机器人的边界。
- 掌握 ReAct,它是很多工具调用 Agent 的最小可用模式。
- 学习 运行循环,理解一个完整任务如何被推进、暂停、失败和恢复。
- 进阶学习 规划、反思、记忆、Skills、纠错。面试里真正拉开差距的,通常是你能不能说清这些模块什么时候该加、什么时候该删。