2026-07-28 · R2 · arXiv 2607.22157
arXiv: https://arxiv.org/abs/2607.22157
video-kb script: /shared/video-kb/scripts/tom/2026-07-28_R2_frozen-weights-agent-external-memory-deployment-feedback-continual-learning-short-video-script.md
1. 标题与观众
- 标题:LoJ · 冻结权重 Agent 的外部记忆
- 目标观众:AI Agent 工程师 / Agent 平台架构师 / 企业 AI 落地顾问
- 一句话核心观点:不微调权重,用 1-bit 反馈 + 规则蒸馏 + 外部 memory,让冻结权重 Agent 每次失败都变教学机会
3. 45-90 秒口播稿
冻结权重 LLM Agent 跑了几万次 episode,几乎从不学习。上次解出的硬任务,下次复发照样从零开始。企业想落地,三条路都堵死:微调成本高,客户数据有合规风险,学错一次污染权重就不可逆。
这篇 Learning on the Job 给出另一条路:不微调模型权重,把每条 episode 的成功或失败 1-bit 结果,加上事后修正,蒸馏成可检索的自然语言规则,存到外部 memory。下次 episode 开始前,用 memory_search 检索,把这些规则注入提示。
在 τ-bench 银行域,只给 1-bit verdict,单次成功率就拉到 baseline 的 1.6 倍;叠加修正后,到 2.6 倍。最关键的是,baseline 永远解不出的 84 个任务里,有 22 个被翻成了可解。
更难得的是跨模型 transfer:Mistral Large 这类开源模型,读 Claude Sonnet 5 建出来的 store,也能跑赢自己的 no-memory baseline。harness、protocol 和 data 已经公开。
今晚就能做的第一件事:把客服 Agent 当周的失败 case 喂给 Rule Distiller,跑一轮 baseline 1-bit verdict,看 single-trial success 是否真的回升。
4. 镜头分镜
- 镜头 1 · 8s · 标题卡 · 屏幕文字:冻结权重 Agent 不学 · 画面元素:LoJ 标志 + episode 计数器 · 运动方式:计数跳变后归零
- 镜头 2 · 8s · 判断卡 · 屏幕文字:三条路都被堵 · 画面元素:三扇紧闭的门图标 · 运动方式:门逐一关闭
- 镜头 3 · 8s · 流程卡 · 屏幕文字:verdict → 规则 · 画面元素:蒸馏器方框 + 检索漏斗 · 运动方式:数据流入并写入外部 store
- 镜头 4 · 8s · 证据卡 · 屏幕文字:1.6× / 2.6× · 画面元素:三栏数字 + 银行域图标 · 运动方式:数字由小变大并锁定
- 镜头 5 · 8s · 风险卡 · 屏幕文字:跨域未定 · 画面元素:双行警示提示 · 运动方式:警示色边框轻微呼吸
- 镜头 6 · 8s · 行动卡 · 屏幕文字:失败入 Distiller · 画面元素:三步清单 · 运动方式:勾选依次亮起
- 镜头 7 · 8s · 落版卡 · 屏幕文字:每次失败都变教学 · 画面元素:免责小字 + 议题限定语 · 运动方式:缓慢淡出