Agent和OpenClaw的相关概念

什么是Agent?

Agent的核心定义是:将大语言模型与工具结合,创建一个能够推理任务、决定使用哪个工具,并迭代式地寻找解决方案,一直到最后完成用户指定任务的系统软件。

可以这样理解:

  • 大语言模型 是系统的“大脑”,负责理解和推理,规划下一步行动。
  • 工具 是系统的“手”和“感官”,能让Agent执行具体的操作(如计算、搜索网络、查询数据库等)。
  • Agent 是一个协调“大脑”和“手”的自动化工作流。它根据模型对任务的理解,智能地选择并调用一个或多个工具,根据工具的返回结果(观察)再次进行推理,循环往复,直到任务完成或达到停止条件。

image-20260620111308150

Agent和传统调用大模型的区别

2025年是“Agent元年”!从“思考”到“行动”的范式跃迁,2026年是Agent爆发年!

特性 AIGC (如 ChatGPT) AI Agent (如 Manus, OpenClaw)
核心能力 内容生成 任务规划与自主执行
交互模式 被动响应,依赖提示词 主动规划,自主决策
输出结果 建议、方案、内容(需人工后续处理) 可交付的最终成果(如已发送的邮件、整理好的报表)
与外界交互 有限,主要通过文本 强大,可通过工具调用操作现实世界系统

Agent的运行原理

Agent的工作遵循经典的 ReAct(Reasoning + Acting, 推理+行动) 模式,

工作流程说明:

  1. 用户输入:任务开始时,用户向Agent提出问题。

  2. 模型推理:大语言模型分析当前任务和状态,决定下一步做什么。它可能决定“我无法直接回答,需要调用一个工具来获取信息”,并生成一个“工具调用动作”。

  3. 工具调用:Agent执行模型指定的工具,例如进行一次网络搜索或数据库查询,并将执行结果(观察)返回。

  4. 迭代:这个观察结果会和之前的对话历史一起,再次输入给模型。模型基于新的信息进行下一轮推理,可能继续调用其他工具,或认为已经掌握了足够信息,可以生成最终答案。

  5. 最终输出:当模型认为任务已达成或达到迭代限制时,它会生成一个最终的、面向用户的答案。

    image-20260620111507712

    概念 说明 关键点
    Agent 模型 + 工具的工作流协调器 遵循ReAct循环,智能调度工具完成任务。
    模型 大脑,负责推理 可静态配置,也可动态选择。
    工具 手脚,负责执行相关动作 可静态定义,也可基于权限/状态动态过滤或注册。
    系统提示 角色设定与行为指南 可静态设置,也可根据上下文动态生成。
    状态+上下文 短期记忆 包含消息历史,可扩展以存储自定义信息。
    中间件 功能扩展插件 在执行的各个阶段插入自定义逻辑,实现高级控制。
    结构化输出 控制输出格式 确保Agent的最终回答符合预定义的结构。
    Skills 技能包,另外的手脚 可通过渐进式加载来,让Agent动态加载需要用的Skill

WorkFlow和Agent区别

React 的 Agent 是一种典型的智能体,而 Workflows 是一个更广泛的概念,代表多种预设的、结构化的 LLM 编排模式,之前的 React Agent 只是 WorkFlow 的其中一种简单模式。但 Workflows 还包括其他**非 React Agent **的模式,包含多样化的图形结构,例如串联、并行处理、路由等。这些模式也用 LLM 来做意图决策,但其流程是预设的、结构化的。它是一种更广泛的“编排模式”或“架构模式”的统称。

image-20260620111715964

image-20260620111735264

简单来说:

  • 当您需要一个能自己“思考”并决定如何使用工具来完成复杂、开放式任务的助手时,您应该构建一个 Agent
  • 当您需要将一系列明确的、结构化的 LLM 调用步骤自动化时(例如先翻译、再总结、最后润色),您应该设计一个 Workflow。Agent可以作为这个Workflow 中的一个组件,但并非必须。

AI工具/框架分类

image-20260620111847780

其核心定位和类别可归纳如下表所示:

类别 概念 核心定位与描述 目标用户 典型用例
AI大模型工具平台 (低代码/可视化应用构建) Dify 一个开源的LLM应用开发平台,提供可视化的方式搭建工作流、RAG引擎,旨在让开发者快速搭建Agent或者RAG和部署AI应用。 应用开发者、产品经理、企业团队 快速搭建客服机器人、知识库问答、AI智能体等。
Coze 字节跳动推出的AI Bot开发平台,同样强调低代码和插件生态,用户可通过组装插件、工作流快速搭建并发布AI智能体。 个人创作者、产品运营、开发者 创建并发布到多种渠道(如飞书、微信)的聊天机器人、自动化助手。
n8n 一个强大的开源工作流自动化工具。有强大的节点生态(含AI节点)和逻辑编排能力,常被用于搭建复杂的、多步骤的自动化AI Agent。 业务人员、开发者、自动化工程师 构建集成了AI判断、API调用、数据处理的复杂业务流程自动化。
通用的Agent软件(可执行的智能体应用) OpenClaw 一个开源的多模态AI智能体软件应用,旨在理解和操作图形用户界面(GUI),可模拟人类在电脑上完成各种任务。 研究者、对桌面自动化有需求的业务人员 自动完成网页操作、软件使用、信息收集等跨应用任务。
Claude Code 它是一个可以被调用的、具有代码执行能力的AI“功能”,可被视为一个原子性的、功能强大的Agent软件。 所有Claude用户 执行数据分析、图表绘制、文件处理、数学计算等需要代码执行的任务。
Agent的开发框架 (用于编程构建Agent) LangChain 最流行的AI应用开发框架之一。提供模块化组件(Models, Tools, Memory等)和“链”的抽象,用于编排基于LLM的应用程序和基础Agent。 AI应用开发者 构建复杂的、多步骤的问答系统、文档分析工具、自定义Agent。
LangGraph 构建在LangChain之上的框架,用于创建有状态的、多智能体工作流。其核心是通过“图”来定义Agent或工具之间的循环和条件流转,适合构建复杂、长期运行的Agent系统。 需要构建复杂协作Agent的开发者 构建模拟游戏、多角色协作系统、包含复杂决策循环的自治Agent。
DeepAgents LangChain生态中一个专注于构建“深度”或“长周期”任务Agent的框架。它提供了虚拟文件系统、任务规划、子Agent委托、高效的上下文管理等高级能力,专门为处理需要长时间运行、多步骤交互的复杂任务而设计。 需要构建处理复杂、长期任务Agent的开发者 执行代码库分析重构、自动化研究、需要多轮规划和文件交互的复杂项目。
Spring AI Spring生态系统的AI集成框架。它为Java/Kotlin开发者提供了一套统一的API,来调用各种大模型并提供RAG、函数调用等基础组件,方便在Spring应用中集成AI能力。 Java/Spring生态的开发者 在现有的Spring Boot企业应用中快速集成大模型聊天、摘要、分类等功能。

平台 vs. 框架 vs. 软件

  • 平台 (Platform):如 Dify, Coze。提供开箱即用的环境,通常有Web界面,通过可视化拖拽和配置来搭建应用Agent。它们负责底层的基础设施(如模型调度、部署),用户更关注业务逻辑组装。核心是“搭建”
  • 框架 (Framework):如 LangChain, LangGraph, Spring AI, DeepAgents。是一套代码库和规范,为开发者提供构建模块和最佳实践。开发者需要编写代码来使用它们,拥有更高的灵活性和控制力。核心是“开发”
  • 软件/应用 (Software):如 OpenCode, OpenClaw。是一个可独立运行的程序,拥有自己的运行时和用户界面,用于完成特定类型的任务(自动化、GUI操作)。用户通过配置和使用它来直接产生价值。核心是:用

OpenClaw 介绍

image-20260620112409458

OpenClaw(曾用名 Clawdbot,中文昵称“小龙虾”)是一款 运行在本地设备上的开源通用型的AI智能体(Agent)。它由奥地利独立开发者 Peter Steinberger(PSPDFKit创始人)于2025年底创建,在2026年初迅速爆红,GitHub星标数在短时间内突破27万,成为全球最受关注的开源项目之一。

模块化与Skills系统架构:

  • OpenClaw的能力通过 Skills(技能) 进行扩展。每个Skill都是一个包含自然语言指令的文件夹,相当于一份“标准作业程序(SOP)”,教会AI处理特定任务。
  • 采用 “渐进式信息披露” 策略:启动时只加载Skill的元数据描述,当任务匹配时,才动态加载详细指令,极大优化了Token使用效率。
  • 拥有庞大的社区技能市场 ClawHub,提供超过500个现成技能,覆盖办公、开发、数据分析等场景。

image-20260620112612597

争议与风险:

  • 极高的安全风险:这是最受关注的问题。它需要极高的系统权限,一旦被恶意利用或遭受“提示注入攻击”,可能导致敏感数据泄露、系统被完全控制。国家网络与信息安全信息通报中心已发布专项风险预警。
  • 供应链投毒:社区技能市场(ClawHub)中,约10.8%的Skill技能包被检测出包含恶意代码,用户安装技能时极易“中招”。
  • 行为不可控:AI在执行复杂指令时可能发生“权限失控”,无视用户后续指令,进行危险操作(如删除文件)。
  • 使用成本与门槛:复杂任务消耗的Token量巨大,账单可能失控;同时其部署和维护仍有技术门槛,对普通用户并不友好。

OpenClaw的影响

image-20260620112703281

OpenClaw的崛起标志着AI从 “对话与内容生成” 时代,正式迈入 “自主执行与行动” 的Agent时代。它不再是一个玩具,而是一个切实的 生产力工具原型。它的模块化与Skills系统架构证明这是一套新的Agent软件开发中可行的方案!

“Agent + Skills” 架构是一种高度模块化、可扩展的设计范式,用于构建复杂且专业的AI智能体系统。其核心思想是将智能体的基础推理与执行能力(Agent)与其专业技能和工作流(Skills)解耦。

这种架构的具体构成及其为开发AI Agent系统软件带来的显著优势。该架构通常包含两个核心层级:

  1. 智能体核心层
    • 这是系统的“通用大脑”,由框架(如LangChain,DeepAgents)提供。它负责基础的任务理解、规划、决策、工具调用和上下文管理。
    • 一个强大的智能体核心应具备规划能力环境交互能力(虚拟文件系统工具lsread_filewrite_file等)、任务分解能力(子Agent)以及关键的长上下文管理能力(通过内容卸载与摘要化来维持长期记忆)。这是支撑复杂任务的基础。
  2. 技能模块层
    • 这是系统的“专业化技能包”。每个Skill是一个独立的模块,包含完成特定领域任务所需的所有知识、指令和资源。
    • 一个技能是一个目录,其核心是一个 SKILL.md文件。该文件包含元数据(名称、描述)和详细的、循序渐进的指令,并可引用其他脚本、模板等资源。

采用“Agent + Skills”的模块化架构,能为系统设计和开发带来多方面的重要优势:

  1. 极致的可扩展性与灵活性:

    新能力的添加不再需要修改智能体核心代码。开发者或领域专家可以像“开发插件”一样,独立地创建和封装新的Skill(只需遵循SKILL.md规范)。系统能力可以通过累积Skills的方式无限扩展。

  2. 卓越的Token与上下文管理效率:

    这是“渐进式披露”机制带来的最直接好处。智能体启动时无需将大量、可能无关的专业指令全部载入系统提示词,极大节省了初始上下文窗口。只有在确需时,才支付读取特定技能详细内容的Token成本。这直接支撑了更复杂、集成更多专业知识的智能体成为可能。

  3. 清晰的关注点分离与专业分工:

    智能体核心开发者专注于提升基础能力:优化规划算法、增强工具使用稳定性、改进上下文管理策略等(如优化内容卸载策略 )。技能开发者则专注于领域知识:将最佳实践编写成精准、可重复执行的指令,无需关心底层智能体如何调度与记忆。

  4. 提升系统的可维护性与可靠性:

    技能模块化使得调试和更新变得更容易。如果某个领域任务执行出错,可以独立检查和修复对应的Skill指令,而不会影响智能体核心或其他技能。技能的版本管理也变得可行。

  5. 实现动态的能力组合:

    对于复杂任务,智能体核心可以规划并串联调用多个Skills来协同完成。这种动态组合能力使得智能体能够应对远超单个技能范围的复杂、跨领域工作流。

--- 本文结束 The End ---