什么是 Agent
简单来说,Agent 是由 AI 模型 驱动,并能够调用工具、执行任务、根据结果继续决策的智能系统。
可以将它粗略理解为:
Agent = AI 模型 + Tools + Skills + Memory + Workflow
其中:
- AI 模型:负责理解用户的目标、分析当前信息并作出决策。
- Tools:让模型能够与外部世界交互,例如搜索网页、读取文件、执行代码、调用 API。
- Skills:针对某类任务预设的工作方法和规则,例如代码审查、生成图片或操作浏览器。
- Memory:保存用户偏好、项目背景和历史信息,使 Agent 可以在后续任务中保持上下文。
- Workflow:将「理解需求 → 制定步骤 → 调用工具 → 检查结果 → 继续执行」串联起来的执行过程。
普通聊天模型通常只能根据已有信息生成文本;Agent 则可以为了完成目标主动采取行动。例如,当你要求它修复一个 Bug 时,它可以阅读代码、搜索调用位置、修改文件、运行测试,并依据测试结果继续调整。
MCP(Model Context Protocol)不是 Agent 本身,而是一种让 Agent 以统一方式连接外部工具和数据源的协议。它可以把数据库、浏览器、GitHub、文件系统等能力提供给模型使用。
因此,Agent 并不等于 MCP,也不等于某一个大模型。更准确地说,Agent 是以模型为决策核心,结合工具、技能、记忆和执行流程而形成的可行动系统。
什么是 MCP
MCP(Model Context Protocol,模型上下文协议)是一套开放协议,用于让 AI 应用以统一方式连接外部工具和数据源。
在没有 MCP 时,接入不同服务通常需要为每个服务单独编写接口和鉴权逻辑;有了 MCP 后,服务只要实现 MCP Server,支持 MCP 的 AI 客户端就能按照统一规范发现并调用其能力。
MCP 通常包含三类能力:
- Tools:可由模型调用的操作,例如查询数据库、创建 Issue、发送请求。
- Resources:可供模型读取的上下文,例如文件、文档、数据库记录。
- Prompts:服务端提供的可复用提示词模板。
可以把 MCP 理解为 AI 与外部服务之间的「通用插座」。它负责连接和通信,但不负责替模型作出决策。
什么是 Skills
Skills 是为某一类任务准备的能力包,通常包含任务说明、执行步骤、约束条件,以及需要调用的工具。
例如,「代码审查」Skill 会告诉 Agent 应重点检查哪些问题、如何读取代码和运行测试;「浏览器自动化」Skill 则会提供操作网页所需的工具和流程。
Skills 的价值在于把重复的经验固化下来,让 Agent 不必每次都从零规划任务。它更像一份可执行的操作手册,而不是一个新的模型或协议。
什么是 Memory
Memory 是 Agent 在当前或未来任务中保留信息的机制,使它不必在每次对话中重新了解用户和项目。
常见的记忆类型包括:
- 会话记忆:保存当前对话中的上下文,通常会在会话结束后失效。
- 长期记忆:保存用户偏好、项目背景和长期有效的约定,可在后续会话中继续使用。
- 外部记忆:将文档、数据库或知识库作为可检索的信息来源,需要时再读取。
Memory 的作用是提供上下文,而不是替代真实数据。涉及当前代码、线上状态或最新文档时,Agent 仍应重新查询并验证。
什么是 Workflow
Workflow 是完成一类任务时的固定执行流程,它将模型思考、工具调用和结果检查组织成明确的步骤。
一个简单的代码修复 Workflow 可以是:
理解问题 → 阅读相关代码 → 定位根因 → 修改文件 → 运行测试 → 检查结果
Workflow 可以由人预先定义,也可以由 Agent 根据目标动态规划。前者更稳定、可控,适合重复且步骤明确的任务;后者更灵活,适合探索性问题,但需要设置权限、验证和人工确认等边界。
Agent 工作过程
Agent 的一次任务通常会经历以下过程:
接收目标 → 获取上下文 → 制定计划 → 调用工具 → 检查结果 → 输出结果或继续执行
以「整理一篇文章」为例,Agent 会先理解用户希望修改什么,再读取文章内容和相关资料;当需要事实依据时,它会查询资料或调用工具;完成修改后,它还应检查结果是否符合要求。
工具调用不是 Agent 的固定步骤。对于简单的解释或改写任务,模型可能只需直接生成文本;只有在需要外部信息或执行操作时,才需要调用对应工具。
Agent 的安全边界
Agent 可以调用工具不代表它应当拥有所有权限。根据影响范围,可以将操作分为三类:
- 只读操作:例如读取文件、搜索资料、查询数据,通常风险较低。
- 写入操作:例如修改文件、创建记录、发送请求,应检查目标和内容是否正确。
- 高风险操作:例如删除数据、执行不可逆命令、发布公开内容或操作生产环境,应要求明确授权和人工确认。
工具返回的内容同样不能完全信任。网页、文档或外部服务的响应可能包含错误信息,甚至试图诱导 Agent 执行无关操作。因此,Agent 在执行高风险动作前,需要验证结果是否与原始目标一致,并遵守既定的权限范围。
一个最小示例
下面以「检查文章中的链接是否有效」为例,展示一个简单的 Agent 流程:
目标:检查文章中的链接,并汇总失效链接
1. 读取文章内容
2. 提取其中的链接
3. 逐个检查链接是否能够访问
4. 汇总可访问与失效的链接
5. 将检查结果返回给用户在这个过程中,模型负责理解「检查链接」这一目标并决定下一步;读取文章和访问链接属于工具能力;检查步骤构成 Workflow;如果系统记住文章所在位置或用户偏好,则使用了 Memory。若要自动修改文章,则还需要额外的写入权限和人工确认。
TIP
AI 模型负责思考,MCP 负责连接外部能力,Skills 提供任务方法,Memory 提供上下文,Workflow 规定任务如何推进。它们共同构成了一个能够实际完成工作的 Agent。