DEV Community

Sanya
Sanya

Posted on

自主智能体:LLM 如何从「聊天」走向「行动」

自主智能体:LLM 如何从「聊天」走向「行动」

本文深入探讨基于大语言模型(LLM)的自主智能体技术体系:从 ReAct、CoT、ToT 等推理框架,到 Voyager、Generative Agents 等代表性系统,剖析核心原理、能力边界与未来挑战。


一、从「对话」到「行动」:什么是自主智能体?

2022 年之前,LLM 的主流用法是「问答」:用户提问,模型生成答案。这是一种单轮、被动的交互模式。

2023 年之后,以 ReAct、Generative Agents、Voyager 为代表的研究证明:LLM 可以不只生成文字,还可以感知环境、制定计划、执行动作、评估结果,形成完整的感知-推理-行动(Perception→Reasoning→Action)闭环

这就是自主智能体(Autonomous Agent)的核心定义:

自主智能体 = LLM(大脑)+ 工具调用(手脚)+ 记忆系统(经验)+ 规划模块(决策)

一个最简单的 Agent 架构:

用户指令 → 规划模块(Planning)→ 行动模块(Action)
                      ↑                      ↓
              记忆系统(Memory)  ←  环境反馈(Observation)
Enter fullscreen mode Exit fullscreen mode

二、核心推理框架:LLM 如何「思考」?

2.1 Chain of Thought(CoT)— 显式推理链

论文Wei et al., 2022, arXiv:2201.11903

核心思想:在给出最终答案之前,先让模型「说出推理过程」。这相当于把 LLM 从「直觉系统」变成「显式推理系统」。

# 没有 CoT
用户:「小明有5个苹果丢了2个又买了3个现在有几个?」
模型:「11。」  # 直接给答案,容易错

# 有 CoT
用户:「小明有5个苹果丢了2个又买了3个现在有几个?」
模型:「首先5-2=3然后3+3=6所以是6个。」  # 显式步骤
Enter fullscreen mode Exit fullscreen mode

实验证明:CoT 在数学、逻辑、常识推理任务上显著提升性能,且这种能力会在模型规模超过某个阈值(约 100B 参数)后「涌现」。

2.2 ReAct — 推理与行动协同

论文Yao et al., 2022, arXiv:2210.03629

CoT 的局限:它只生成推理文本,不与环境交互。当环境反馈超出模型预期时,CoT 无法自我修正。

ReAct(Synergizing Reasoning and Acting)将「推理」与「行动」交替进行:

Thought:我需要查一下北京的天气
Action:调用天气 API (city=北京)
Observation:北京今天晴,26°C
Thought:温度较高,我应该提醒用户多喝水
Action:输出文字回复
Enter fullscreen mode Exit fullscreen mode

这种 Thought → Action → Observation → Thought... 的循环,使 Agent 具备了动态修正的能力。实验证明,ReAct 在 HotpotQA(知识问答)和 FEVER(事实核查)任务上,超越了纯推理或纯行动方法。

2.3 Tree of Thoughts(ToT)— 探索式规划

论文Yao et al., 2023, arXiv:2305.10601

CoT 是「一条路走到黑」,ToT 则允许 Agent 同时探索多条推理路径,并评估哪条路最有可能通向正确答案。

          起点
          /  |  \
        路径A  路径B  路径C  ← 三条思考路径并行探索
        / \    / \    / \
     ...  ...  ...  ...   ← 各自延伸
        \   /
      评估与选择
Enter fullscreen mode Exit fullscreen mode

这本质上是将 LLM 的「生成」能力转化为「有意识的搜索」,类似于 AlphaGo 的蒙特卡洛树搜索(MCTS)。实验表明,ToT 在创意写作、24 点游戏等需要探索的任务上,显著优于 CoT。


三、代表性系统:从沙盒到真实世界

3.1 Generative Agents — 社会行为的模拟

论文Park et al., 2023, arXiv:2304.03442

斯坦福大学 HAI 实验室的工作,发表在 UIST 2023。研究者构建了一个名为「Smallville」的虚拟小镇,部署了 25 个基于 LLM 的生成式智能体(Generative Agents)

每个 Agent 有:

  • 身份:姓名、职业、性格
  • 记忆流(Memory Stream):以时间顺序存储所有观察和反思
  • 反思(Reflection):定期将记忆凝练成高层次的洞察
  • 计划(Plan):根据当前情境生成当天行动计划

实验证明:这些 Agent 能自发产生「周五晚上办派对」这样的社会行为——没有人告诉它们该这么做,是 Agent 之间基于彼此记忆的交互自然涌现的结果。

意义:这说明当 Agent 具备记忆和反思能力时,集体行为可以从个体规则的交互中涌现——这是复杂系统研究中的经典主题,也是让 AI 模拟人类社会行为的第一步。

3.2 Voyager — 开放世界的持续学习

Voyager 是第一个基于 LLM 的、能在 Minecraft 中持续学习和探索的智能体系统。其核心创新是三层架构:

┌─────────────────────────────────────────┐
│  技能库(Skill Library)                │
│  成功解决问题的代码模式,永久存储复用    │
├─────────────────────────────────────────┤
│  持续学习循环(Curriculum Learning)     │
│  自动生成「刚好超出能力范围」的新任务  │
├─────────────────────────────────────────┤
│  提示生成器(Prompt Generator)         │
│  根据当前状态生成引导性文字提示         │
└─────────────────────────────────────────┘
Enter fullscreen mode Exit fullscreen mode

Voyager 在 Minecraft 中解锁了 248 种不同技能,表现远超基于强化学习的基准系统(如 DreamerV3)。关键在于:它不仅完成一次性任务,还在过程中积累可复用的技能库——这正是人类学习的方式。

3.3 CAMEL — 多智能体协作

论文Li et al., 2023, arXiv:2303.17760

CAMEL(Communicative Agents for "Mind" Exploration of Large Language Model Society)探索了多智能体协作的可能性。

架构:两个 Agent——助手(Assistant)用户(User)——通过自然语言对话协作完成复杂任务。例如,让它们自主谈判出一个双方都认可的商业计划,而不需要人类在中间调解。

CAMEL 的一个重要发现是:即使没有明确的指令,Agent 也能通过对话涌现出复杂的协作策略——这为多 Agent 系统研究打开了新的大门。


四、工具调用:Agent 的「手脚」

一个 Agent 如果只能「说话」,能力就极其有限。真正让 Agent 有用的是工具调用(Tool Use)能力。

主流框架:

工具类型 代表案例
搜索引擎 Web 搜索、Wikipedia 查询
代码执行 Python、bash
API 调用 天气、地图、日历、邮件
文件操作 读写本地文件、数据库查询
机械操作 机器人控制、自动驾驶

Toolformer(Schick et al., 2023)证明:LLM 可以自主学会调用工具,而不需要人类显式教导。这相当于让模型自己发现「可以用计算器来算数学题」,而不只是用语言模型硬算。


五、能力边界与核心挑战

尽管进展惊人,自主智能体仍面临严峻挑战:

5.1 幻觉与错误累积

Agent 执行多步任务时,第一步的轻微错误会像滚雪球一样,在后续步骤中被放大为严重偏离。ReAct 和 ToT 提供了部分缓解,但无法根除。

5.2 长期规划失效

当前 Agent 在短序列任务(5-10 步)上表现尚可,但当任务需要上百步时,Agent 容易陷入「重复探索」或「遗忘子目标」的困境。

5.3 记忆系统的局限性

现有 Agent 的记忆多为简单的文本检索,缺乏对记忆重要性的评估能力。Generative Agents 的反思机制是朝正确方向的一步,但计算成本高、效果不稳定。

5.4 安全与对齐

一个能自主行动的 Agent,如果目标设定不当,后果远比一个「只会聊天」的模型严重得多。这就是为什么安全对齐(Safety Alignment)研究与 Agent 研究必须并行推进。


六、未来方向

方向 现状 潜力
多模态 Agent 视觉-语言-动作融合 极高
长期记忆架构 向量数据库 + 知识图谱
自主目标生成 Voyager 路线探索
多 Agent 协作 CAMEL 等初步探索 极高
安全性与对齐 仍为开放问题 关键

参考文献

  1. Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903. DOI

  2. Yao, S., et al. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629. DOI

  3. Yao, S., et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601. DOI

  4. Park, J.S., et al. (2023). Generative Agents: Interactive Simulacra of Human Behavior. arXiv:2304.03442. DOI

  5. Li, G., et al. (2023). CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society. arXiv:2303.17760. DOI

  6. Liu, S., et al. (2024). Odyssey: Empowering Minecraft Agents with Open-World Skills. arXiv:2407.15325. DOI

  7. Schick, J., et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools. arXiv:2302.04761. DOI

Top comments (0)