什么是Agent?
Agent的核心定义是:将大语言模型与工具结合,创建一个能够推理任务、决定使用哪个工具,并迭代式地寻找解决方案,一直到最后完成用户指定任务的系统软件。
可以这样理解:
- 大语言模型 是系统的“大脑”,负责理解和推理,规划下一步行动。
- 工具 是系统的“手”和“感官”,能让Agent执行具体的操作(如计算、搜索网络、查询数据库等)。
- Agent 是一个协调“大脑”和“手”的自动化工作流。它根据模型对任务的理解,智能地选择并调用一个或多个工具,根据工具的返回结果(观察)再次进行推理,循环往复,直到任务完成或达到停止条件。

Agent和传统调用大模型的区别
2025年是“Agent元年”!从“思考”到“行动”的范式跃迁,2026年是Agent爆发年!
| 特性 | AIGC (如 ChatGPT) | AI Agent (如 Manus, OpenClaw) |
|---|---|---|
| 核心能力 | 内容生成 | 任务规划与自主执行 |
| 交互模式 | 被动响应,依赖提示词 | 主动规划,自主决策 |
| 输出结果 | 建议、方案、内容(需人工后续处理) | 可交付的最终成果(如已发送的邮件、整理好的报表) |
| 与外界交互 | 有限,主要通过文本 | 强大,可通过工具调用操作现实世界系统 |
Agent的运行原理
Agent的工作遵循经典的 ReAct(Reasoning + Acting, 推理+行动) 模式,
工作流程说明:
用户输入:任务开始时,用户向Agent提出问题。
模型推理:大语言模型分析当前任务和状态,决定下一步做什么。它可能决定“我无法直接回答,需要调用一个工具来获取信息”,并生成一个“工具调用动作”。
工具调用:Agent执行模型指定的工具,例如进行一次网络搜索或数据库查询,并将执行结果(观察)返回。
迭代:这个观察结果会和之前的对话历史一起,再次输入给模型。模型基于新的信息进行下一轮推理,可能继续调用其他工具,或认为已经掌握了足够信息,可以生成最终答案。
最终输出:当模型认为任务已达成或达到迭代限制时,它会生成一个最终的、面向用户的答案。

概念 说明 关键点 Agent 模型 + 工具的工作流协调器 遵循ReAct循环,智能调度工具完成任务。 模型 大脑,负责推理 可静态配置,也可动态选择。 工具 手脚,负责执行相关动作 可静态定义,也可基于权限/状态动态过滤或注册。 系统提示 角色设定与行为指南 可静态设置,也可根据上下文动态生成。 状态+上下文 短期记忆 包含消息历史,可扩展以存储自定义信息。 中间件 功能扩展插件 在执行的各个阶段插入自定义逻辑,实现高级控制。 结构化输出 控制输出格式 确保Agent的最终回答符合预定义的结构。 Skills 技能包,另外的手脚 可通过渐进式加载来,让Agent动态加载需要用的Skill
WorkFlow和Agent区别
React 的 Agent 是一种典型的智能体,而 Workflows 是一个更广泛的概念,代表多种预设的、结构化的 LLM 编排模式,之前的 React Agent 只是 WorkFlow 的其中一种简单模式。但 Workflows 还包括其他**非 React Agent **的模式,包含多样化的图形结构,例如串联、并行处理、路由等。这些模式也用 LLM 来做意图决策,但其流程是预设的、结构化的。它是一种更广泛的“编排模式”或“架构模式”的统称。


简单来说:
- 当您需要一个能自己“思考”并决定如何使用工具来完成复杂、开放式任务的助手时,您应该构建一个 Agent。
- 当您需要将一系列明确的、结构化的 LLM 调用步骤自动化时(例如先翻译、再总结、最后润色),您应该设计一个 Workflow。Agent可以作为这个Workflow 中的一个组件,但并非必须。
AI工具/框架分类

其核心定位和类别可归纳如下表所示:
| 类别 | 概念 | 核心定位与描述 | 目标用户 | 典型用例 |
|---|---|---|---|---|
| AI大模型工具平台 (低代码/可视化应用构建) | Dify | 一个开源的LLM应用开发平台,提供可视化的方式搭建工作流、RAG引擎,旨在让开发者快速搭建Agent或者RAG和部署AI应用。 | 应用开发者、产品经理、企业团队 | 快速搭建客服机器人、知识库问答、AI智能体等。 |
| Coze | 字节跳动推出的AI Bot开发平台,同样强调低代码和插件生态,用户可通过组装插件、工作流快速搭建并发布AI智能体。 | 个人创作者、产品运营、开发者 | 创建并发布到多种渠道(如飞书、微信)的聊天机器人、自动化助手。 | |
| n8n | 一个强大的开源工作流自动化工具。有强大的节点生态(含AI节点)和逻辑编排能力,常被用于搭建复杂的、多步骤的自动化AI Agent。 | 业务人员、开发者、自动化工程师 | 构建集成了AI判断、API调用、数据处理的复杂业务流程自动化。 | |
| 通用的Agent软件(可执行的智能体应用) | OpenClaw | 一个开源的多模态AI智能体软件应用,旨在理解和操作图形用户界面(GUI),可模拟人类在电脑上完成各种任务。 | 研究者、对桌面自动化有需求的业务人员 | 自动完成网页操作、软件使用、信息收集等跨应用任务。 |
| Claude Code | 它是一个可以被调用的、具有代码执行能力的AI“功能”,可被视为一个原子性的、功能强大的Agent软件。 | 所有Claude用户 | 执行数据分析、图表绘制、文件处理、数学计算等需要代码执行的任务。 | |
| Agent的开发框架 (用于编程构建Agent) | LangChain | 最流行的AI应用开发框架之一。提供模块化组件(Models, Tools, Memory等)和“链”的抽象,用于编排基于LLM的应用程序和基础Agent。 | AI应用开发者 | 构建复杂的、多步骤的问答系统、文档分析工具、自定义Agent。 |
| LangGraph | 构建在LangChain之上的框架,用于创建有状态的、多智能体工作流。其核心是通过“图”来定义Agent或工具之间的循环和条件流转,适合构建复杂、长期运行的Agent系统。 | 需要构建复杂协作Agent的开发者 | 构建模拟游戏、多角色协作系统、包含复杂决策循环的自治Agent。 | |
| DeepAgents | LangChain生态中一个专注于构建“深度”或“长周期”任务Agent的框架。它提供了虚拟文件系统、任务规划、子Agent委托、高效的上下文管理等高级能力,专门为处理需要长时间运行、多步骤交互的复杂任务而设计。 | 需要构建处理复杂、长期任务Agent的开发者 | 执行代码库分析重构、自动化研究、需要多轮规划和文件交互的复杂项目。 | |
| Spring AI | Spring生态系统的AI集成框架。它为Java/Kotlin开发者提供了一套统一的API,来调用各种大模型并提供RAG、函数调用等基础组件,方便在Spring应用中集成AI能力。 | Java/Spring生态的开发者 | 在现有的Spring Boot企业应用中快速集成大模型聊天、摘要、分类等功能。 |
平台 vs. 框架 vs. 软件
- 平台 (Platform):如 Dify, Coze。提供开箱即用的环境,通常有Web界面,通过可视化拖拽和配置来搭建应用Agent。它们负责底层的基础设施(如模型调度、部署),用户更关注业务逻辑组装。核心是“搭建”。
- 框架 (Framework):如 LangChain, LangGraph, Spring AI, DeepAgents。是一套代码库和规范,为开发者提供构建模块和最佳实践。开发者需要编写代码来使用它们,拥有更高的灵活性和控制力。核心是“开发”。
- 软件/应用 (Software):如 OpenCode, OpenClaw。是一个可独立运行的程序,拥有自己的运行时和用户界面,用于完成特定类型的任务(自动化、GUI操作)。用户通过配置和使用它来直接产生价值。核心是:用
OpenClaw 介绍

OpenClaw(曾用名 Clawdbot,中文昵称“小龙虾”)是一款 运行在本地设备上的开源通用型的AI智能体(Agent)。它由奥地利独立开发者 Peter Steinberger(PSPDFKit创始人)于2025年底创建,在2026年初迅速爆红,GitHub星标数在短时间内突破27万,成为全球最受关注的开源项目之一。
模块化与Skills系统架构:
- OpenClaw的能力通过 Skills(技能) 进行扩展。每个Skill都是一个包含自然语言指令的文件夹,相当于一份“标准作业程序(SOP)”,教会AI处理特定任务。
- 采用 “渐进式信息披露” 策略:启动时只加载Skill的元数据描述,当任务匹配时,才动态加载详细指令,极大优化了Token使用效率。
- 拥有庞大的社区技能市场 ClawHub,提供超过500个现成技能,覆盖办公、开发、数据分析等场景。

争议与风险:
- 极高的安全风险:这是最受关注的问题。它需要极高的系统权限,一旦被恶意利用或遭受“提示注入攻击”,可能导致敏感数据泄露、系统被完全控制。国家网络与信息安全信息通报中心已发布专项风险预警。
- 供应链投毒:社区技能市场(ClawHub)中,约10.8%的Skill技能包被检测出包含恶意代码,用户安装技能时极易“中招”。
- 行为不可控:AI在执行复杂指令时可能发生“权限失控”,无视用户后续指令,进行危险操作(如删除文件)。
- 使用成本与门槛:复杂任务消耗的Token量巨大,账单可能失控;同时其部署和维护仍有技术门槛,对普通用户并不友好。
OpenClaw的影响

OpenClaw的崛起标志着AI从 “对话与内容生成” 时代,正式迈入 “自主执行与行动” 的Agent时代。它不再是一个玩具,而是一个切实的 生产力工具原型。它的模块化与Skills系统架构证明:这是一套新的Agent软件开发中可行的方案!
“Agent + Skills” 架构是一种高度模块化、可扩展的设计范式,用于构建复杂且专业的AI智能体系统。其核心思想是将智能体的基础推理与执行能力(Agent)与其专业技能和工作流(Skills)解耦。
这种架构的具体构成及其为开发AI Agent系统软件带来的显著优势。该架构通常包含两个核心层级:
- 智能体核心层
- 这是系统的“通用大脑”,由框架(如LangChain,DeepAgents)提供。它负责基础的任务理解、规划、决策、工具调用和上下文管理。
- 一个强大的智能体核心应具备规划能力、环境交互能力(虚拟文件系统工具
ls,read_file,write_file等)、任务分解能力(子Agent)以及关键的长上下文管理能力(通过内容卸载与摘要化来维持长期记忆)。这是支撑复杂任务的基础。
- 技能模块层
- 这是系统的“专业化技能包”。每个Skill是一个独立的模块,包含完成特定领域任务所需的所有知识、指令和资源。
- 一个技能是一个目录,其核心是一个
SKILL.md文件。该文件包含元数据(名称、描述)和详细的、循序渐进的指令,并可引用其他脚本、模板等资源。
采用“Agent + Skills”的模块化架构,能为系统设计和开发带来多方面的重要优势:
极致的可扩展性与灵活性:
新能力的添加不再需要修改智能体核心代码。开发者或领域专家可以像“开发插件”一样,独立地创建和封装新的Skill(只需遵循
SKILL.md规范)。系统能力可以通过累积Skills的方式无限扩展。卓越的Token与上下文管理效率:
这是“渐进式披露”机制带来的最直接好处。智能体启动时无需将大量、可能无关的专业指令全部载入系统提示词,极大节省了初始上下文窗口。只有在确需时,才支付读取特定技能详细内容的Token成本。这直接支撑了更复杂、集成更多专业知识的智能体成为可能。
清晰的关注点分离与专业分工:
智能体核心开发者专注于提升基础能力:优化规划算法、增强工具使用稳定性、改进上下文管理策略等(如优化内容卸载策略 )。技能开发者则专注于领域知识:将最佳实践编写成精准、可重复执行的指令,无需关心底层智能体如何调度与记忆。
提升系统的可维护性与可靠性:
技能模块化使得调试和更新变得更容易。如果某个领域任务执行出错,可以独立检查和修复对应的Skill指令,而不会影响智能体核心或其他技能。技能的版本管理也变得可行。
实现动态的能力组合:
对于复杂任务,智能体核心可以规划并串联调用多个Skills来协同完成。这种动态组合能力使得智能体能够应对远超单个技能范围的复杂、跨领域工作流。