文章摘要
加载中...|
此内容根据文章生成,并经过人工审核,仅用于文章内容的解释与总结

什么是 Agent

简单来说,Agent 是由 AI 模型 驱动,并能够调用工具、执行任务、根据结果继续决策的智能系统。

可以将它粗略理解为:

Agent = AI 模型 + Tools + Skills + Memory + Workflow

其中:

  • AI 模型:负责理解用户的目标、分析当前信息并作出决策。
  • Tools:让模型能够与外部世界交互,例如搜索网页、读取文件、执行代码、调用 API。
  • Skills:针对某类任务预设的工作方法和规则,例如代码审查、生成图片或操作浏览器。
  • Memory:保存用户偏好、项目背景和历史信息,使 Agent 可以在后续任务中保持上下文。
  • Workflow:将「理解需求 → 制定步骤 → 调用工具 → 检查结果 → 继续执行」串联起来的执行过程。

普通聊天模型通常只能根据已有信息生成文本;Agent 则可以为了完成目标主动采取行动。例如,当你要求它修复一个 Bug 时,它可以阅读代码、搜索调用位置、修改文件、运行测试,并依据测试结果继续调整。

MCP(Model Context Protocol)不是 Agent 本身,而是一种让 Agent 以统一方式连接外部工具和数据源的协议。它可以把数据库、浏览器、GitHub、文件系统等能力提供给模型使用。

因此,Agent 并不等于 MCP,也不等于某一个大模型。更准确地说,Agent 是以模型为决策核心,结合工具、技能、记忆和执行流程而形成的可行动系统。

什么是 MCP

MCP(Model Context Protocol,模型上下文协议)是一套开放协议,用于让 AI 应用以统一方式连接外部工具和数据源。

在没有 MCP 时,接入不同服务通常需要为每个服务单独编写接口和鉴权逻辑;有了 MCP 后,服务只要实现 MCP Server,支持 MCP 的 AI 客户端就能按照统一规范发现并调用其能力。

MCP 通常包含三类能力:

  • Tools:可由模型调用的操作,例如查询数据库、创建 Issue、发送请求。
  • Resources:可供模型读取的上下文,例如文件、文档、数据库记录。
  • Prompts:服务端提供的可复用提示词模板。

可以把 MCP 理解为 AI 与外部服务之间的「通用插座」。它负责连接和通信,但不负责替模型作出决策。

什么是 Skills

Skills 是为某一类任务准备的能力包,通常包含任务说明、执行步骤、约束条件,以及需要调用的工具。

例如,「代码审查」Skill 会告诉 Agent 应重点检查哪些问题、如何读取代码和运行测试;「浏览器自动化」Skill 则会提供操作网页所需的工具和流程。

Skills 的价值在于把重复的经验固化下来,让 Agent 不必每次都从零规划任务。它更像一份可执行的操作手册,而不是一个新的模型或协议。

什么是 Memory

Memory 是 Agent 在当前或未来任务中保留信息的机制,使它不必在每次对话中重新了解用户和项目。

常见的记忆类型包括:

  • 会话记忆:保存当前对话中的上下文,通常会在会话结束后失效。
  • 长期记忆:保存用户偏好、项目背景和长期有效的约定,可在后续会话中继续使用。
  • 外部记忆:将文档、数据库或知识库作为可检索的信息来源,需要时再读取。

Memory 的作用是提供上下文,而不是替代真实数据。涉及当前代码、线上状态或最新文档时,Agent 仍应重新查询并验证。

什么是 Workflow

Workflow 是完成一类任务时的固定执行流程,它将模型思考、工具调用和结果检查组织成明确的步骤。

一个简单的代码修复 Workflow 可以是:

理解问题 → 阅读相关代码 → 定位根因 → 修改文件 → 运行测试 → 检查结果

Workflow 可以由人预先定义,也可以由 Agent 根据目标动态规划。前者更稳定、可控,适合重复且步骤明确的任务;后者更灵活,适合探索性问题,但需要设置权限、验证和人工确认等边界。

Agent 工作过程

Agent 的一次任务通常会经历以下过程:

接收目标 → 获取上下文 → 制定计划 → 调用工具 → 检查结果 → 输出结果或继续执行

以「整理一篇文章」为例,Agent 会先理解用户希望修改什么,再读取文章内容和相关资料;当需要事实依据时,它会查询资料或调用工具;完成修改后,它还应检查结果是否符合要求。

工具调用不是 Agent 的固定步骤。对于简单的解释或改写任务,模型可能只需直接生成文本;只有在需要外部信息或执行操作时,才需要调用对应工具。

Agent 的安全边界

Agent 可以调用工具不代表它应当拥有所有权限。根据影响范围,可以将操作分为三类:

  • 只读操作:例如读取文件、搜索资料、查询数据,通常风险较低。
  • 写入操作:例如修改文件、创建记录、发送请求,应检查目标和内容是否正确。
  • 高风险操作:例如删除数据、执行不可逆命令、发布公开内容或操作生产环境,应要求明确授权和人工确认。

工具返回的内容同样不能完全信任。网页、文档或外部服务的响应可能包含错误信息,甚至试图诱导 Agent 执行无关操作。因此,Agent 在执行高风险动作前,需要验证结果是否与原始目标一致,并遵守既定的权限范围。

一个最小示例

下面以「检查文章中的链接是否有效」为例,展示一个简单的 Agent 流程:

text
目标:检查文章中的链接,并汇总失效链接

1. 读取文章内容
2. 提取其中的链接
3. 逐个检查链接是否能够访问
4. 汇总可访问与失效的链接
5. 将检查结果返回给用户

在这个过程中,模型负责理解「检查链接」这一目标并决定下一步;读取文章和访问链接属于工具能力;检查步骤构成 Workflow;如果系统记住文章所在位置或用户偏好,则使用了 Memory。若要自动修改文章,则还需要额外的写入权限和人工确认。

TIP

AI 模型负责思考,MCP 负责连接外部能力,Skills 提供任务方法,Memory 提供上下文,Workflow 规定任务如何推进。它们共同构成了一个能够实际完成工作的 Agent。

评论 隐私政策