大模型怎么从「会聊天」变成「会做事」?2023 年复旦这篇 86 页综述,给 LLM Agent 立了第一套共同语言
- 关联论文:2309.07864
你用过 Cursor、Devin、AutoGPT 这类「会自己跑流程」的 AI 工具吗?它们有一个共同的祖先——LLM Agent(基于大语言模型的智能体)。但 2023 年初这个概念还是一团乱麻:ReAct、Toolformer、Reflexion、MemGPT……各种工作各说各话,没有统一框架。
2023 年 9 月复旦大学 NLP 实验室把这片混乱「画了一张地图」——一篇 86 页的综述,把 LLM Agent 的所有碎片工作串成一根主线:把「Agent」拆成大脑、感知、行动三层,然后从单 Agent 一直聊到多 Agent、再聊到「几百个 Agent 住在一起会涌现什么社会行为」。
为什么这件事值得大众关注
LLM Agent 不是一个学术概念,它就是你现在用的所有 AI 工具的底层结构:
- 🧑💻 你用的写代码 AI(Cursor/Copilot/Devin):本质上是「大脑=LLM + 感知=你的代码 + 行动=写文件/跑命令」的 Agent
- 🛒 你用的客服 AI:从「读你的问题」到「查订单」到「回复」全是一个 Agent 循环
- 🎮 AI 玩游戏、控制机器人:都是 LLM 在做实时决策
- 🏢 企业里的 AI 流程自动化:RAG + 工具调用 + 多步执行,本质都是 Agent
这篇综述给出的「大脑-感知-行动」框架,至今仍是工业界设计 AI Agent 系统的默认词汇表。你读懂了这张图,就读懂了过去三年所有「会自己干活」AI 工具的设计逻辑。
一句话核心机制
LLM Agent = 一个会调用工具的 LLM。具体来说:
- 大脑(Brain):LLM 本身 + 记忆机制(短期对话 + 长期笔记)
- 感知(Perception):读懂文本、图像、声音、传感器数据
- 行动(Action):调用 API、生成文本、操作软件、跟其他 Agent 通信
整篇综述做的事,就是把这三层的所有已知玩法画成一张树状图。
一个影响至今的细节:单 Agent vs 多 Agent 的「该不该」
很多人以为「Agent 越多越强」,综述直接打破这个迷思:多 Agent 系统通信成本、错误传播、对齐难度常常让协作比单 Agent 更糟。生产系统的默认建议是先做单 Agent,做不出来再考虑多 Agent——这与 2024–2026 年 LangChain、AutoGen、CrewAI 的实战经验完全一致。
2026 年视角
这篇综述发表于 2023 年 9 月,缺少了 2024 年后的关键进展:Anthropic 的 Computer Use、OpenAI 的 Deep Research、Agent Protocol、MCP(Model Context Protocol)等。但它给的「大脑-感知-行动」框架至今没有被推翻——你今天看到的任何 AI Agent 产品,基本都能套进这个三脚架。
⚠️ 落地硬约束
- 综述本身不提供可直接复制的代码,需要自己从 ReAct、AutoGPT、LangChain 等开源项目补充
- 多 Agent、Agent 社会仍是研究阶段,生产部署建议从单 Agent 起步
- 工具调用的可靠性(超时、重试、降级)没有任何标准答案,每个项目都要自己设计
- 记忆管理(短期/长期/结构化/向量库)没有银弹,需要按业务场景组合
- 综述配套仓库
github.com/WooooDyy/LLM-Agent-Paper-List是论文清单,不是可直接 import 的代码库,别混淆
给「想自己搭一个 Agent」的人:三件必做
- 先把"大脑-感知-行动"三层画出来:每一层用什么实现、可观测性指标怎么定
- 加可观测性:每一步的 prompt、决策、工具调用、结果必须落日志——Agent 失败时唯一的救命稻草
- 安全前置:强 Agent = 强风险。输出过滤、权限边界、人工确认环一个不能少
一句话总结
如果你只能读一篇 LLM Agent 综述,就读这篇——它给了你未来三年读任何 Agent 论文都不会迷路的「主坐标」。
三个标题变体
- 数字钩子版:86 页 + 200+ 引用、复旦这篇综述是 LLM Agent 领域的「新华字典」
- 拟人化版:让大模型从「聊天机器人」进化成「会干活的员工」,靠的就是这篇综述画的三层框架
- 类比版:LLM Agent 的「大脑-感知-行动」,就像公司里的「CEO-眼睛-手脚」
小红书风格卡片文案(可直接发布)
🤖 你以为 ChatGPT 只会聊天?那你 out 了
2023 年起,AI 圈最热的方向不是「更大的模型」,而是「会自己干活的 AI」——LLM Agent。
Cursor 帮你写代码、Devin 帮你修 bug、AI 客服帮你查订单、机器人帮你搬货——它们的底层都是同一个东西:大模型 + 记忆 + 工具调用。
🧠 但 2023 年初这个领域是一团乱麻——各种工作各说各话,没统一框架。
📚 于是复旦 NLP 实验室 2023 年 9 月写了一篇 86 页综述,给整个领域立了第一套共同语言。
🔑 核心三件套(大脑-感知-行动):
1️⃣ 大脑:LLM 本身 + 短期对话记忆 + 长期笔记 2️⃣ 感知:读懂文字、图片、声音、传感器数据 3️⃣ 行动:调 API、写文字、操作软件、跟其他 AI 通信
📌 一个反常识结论:
多 Agent 不一定更好! 通信成本 + 错误传播 + 对齐难度,常常让「三个臭皮匠」反而干不过「一个诸葛亮」。生产系统建议:先做单 Agent,做不出来再考虑多 Agent。
🎯 2026 年的位置: 这篇综述是所有 Agent 论文的「主坐标」——你今天看到的任何 AI Agent 产品(Computer Use、Deep Research、AutoGen、CrewAI),基本都能套进这个三脚架。
⚠️ 想自己做一个 Agent?看这 4 个硬约束: 1. 综述不给代码,要自己从 ReAct/AutoGPT/LangChain 拼 2. 工具调用的超时、重试、降级没有标准答案 3. 记忆管理没有银弹,要按场景组合短期/长期/向量/结构化 4. 多 Agent 仍是研究阶段,生产请从单 Agent 起步
💡 一句话总结: 读懂这篇综述 = 拿到未来三年读 Agent 论文的「新华字典」。
👇 互动话题:你用过哪些「会自己干活」的 AI 工具?评论区聊聊 👇