Agents

什么是AI Agent?

Agent,翻译成中文叫做智能体,是当前最火的一个词了。举几个大家容易理解的例子。 1、在去年荣耀的发布会上,CEO赵明对手机上的AI助理说了一句“帮我点2000杯奶茶”的指令,便成功通过手机下单2000杯奶茶,送给了现场观众。 2…

TL;DR

Agent,翻译成中文叫做智能体,是当前最火的一个词了。举几个大家容易理解的例子。 1、在去年荣耀的发布会上,CEO赵明对手机上的AI助理说了一句“帮我点2000杯奶茶”的指令,便成功通过手机下单2000杯奶茶,送给了现场观众。 2…

Agent,翻译成中文叫做智能体,是当前最火的一个词了。举几个大家容易理解的例子。 1、在去年荣耀的发布会上,CEO赵明对手机上的AI助理说了一句“帮我点2000杯奶茶”的指令,便成功通过手机下单2000杯奶茶,送给了现场观众。 2、去年,Manus横空出世,用户可以通过指令描述告诉他帮忙生成一份调查报告,他就能打开浏览器,搜索相关信息,并生成一份报告。 3、我们使用cursor做编码,告知他帮忙实现某个功能,他就能检查文件,找到合适的位置,做代码修改,然后运行验证是否有问题,如果有问题,帮忙解决。 4、最近豆包手机助手很火,可以通过对话让他帮忙操作你的手机。 还有很多很多,这些都是智能体。所以,所谓的AI Agent,其实就是一个可以自主完成工作的AI助手。 其实,现在很多LLM的对话工具,如ChatGPT、千问等,也在从对话助手向Agent转型。 如果一定要给他下个定义的话:Agent是以大语言模型为核心计算引擎,能够自主理解、规划决策、执行负责任务的智能体。 Agent 的四大核心能力:目标驱动(Planning)、工具使用(Tools)、记忆保持(Memory)、自主决策(Action)。 Agent = LLM + Memory + Tools + Planning + Action 如下面是n8n中AI Agent的定义方式,可以看到他针对AI Agent做了很好的抽象。 LLM:大语言模型,是Agent的大脑,需要用大模型来理解用户的需求,分析该做什么,决定要调用什么工具等等。 Memory:记忆,因为AI助理一般需要多个步骤来执行的,所以记忆是必要的。记忆除了我们前面介绍过的短期记忆以外,在agent的实际落地中,还需要长期记忆,这个我们在agent这个部分会重点讲解。 Tools:工具,agent需要能使用工具,这里的工具可以是我们在介绍spring ai的时候提到的function,也可以是MCP,甚至是另一个agent。 Planning:规划能力,这个是agent中非常重要的能力,需要理解需求后做规划,这样才能更好的解决问题,这部分需要通过提示词工程来提升模型的理解和规划能力。 Action:任务执行,这一步也很重要,一般来说就是调用工具做执行。如果agent没有执行能力,那么就一点意义都没有了。 基于系统的控制方式,我们将Agent分为两类:Workflow Agent / 编排型智能体、Autonomous Agent / 自主型智能体。 | | Workflow Agent(编排型) | Autonomous Agent(自主型) | | --- | --- | --- | | 控制方式 | 预定义流程编排(显式流程) | LLM动态决策(隐式推理) | | 路径确定性 | 高(可预测) | 低(可能发散) | | 开发难度 | 中(需设计流程) | 高(需处理不确定性) | | 可靠性 | 高(适合生产) | 中(可能“跑偏”) | | 灵活性 | 有限(受限于流程) | 极高(可应对未知) | | 典型框架 | LangGraph、Dify、N8N、Spring AI Alibaba | AutoGen | | 是否需要人类干预 | 少(流程稳定) | 可能需要(防止失控) |

版本提示

模型、框架与接口会持续变化。涉及版本号、参数与生产配置时,请在实践前对照对应官方文档。

LLMentor系统化学习大模型应用工程

内容来自个人课程知识库备份,并经过结构化整理。技术版本持续演进,生产使用前请结合官方文档验证。