2022–2023
01 · 工具使用
这一阶段要解决什么?
语言模型如何识别何时应调用外部工具?
阶段结论
Toolformer 等工作把 API 调用变成模型可学习的行为。
Agent 智能体 · 已策展
Tool Use → ReAct → 记忆与反思 → Runtime → Harness
不只看 Agent 会做什么,而是追问它如何被约束、观测、评测并在长任务中可靠运行。
2022–2023
语言模型如何识别何时应调用外部工具?
Toolformer 等工作把 API 调用变成模型可学习的行为。
2022–2023
如何让模型根据环境反馈修正后续行动?
Agent 行为循环的典型范式。
ReAct 将思考、行动与观察组织成可迭代轨迹。
2023–2025
Agent 如何跨轮次保留经验,并从失败中修正策略?
记忆、反思和规划模块扩展了 Agent 的任务时间跨度。
2025–至今
如何把会调工具的模型变成可恢复、可观测、可评测的执行系统?
递归 Agent Harness 的库内前沿论文。
Harness 工程的实证研究。
把论文概念转换为系统检查清单。
Harness 将上下文组装、工具协议、沙箱、状态、检查点与评测纳入同一工程层。