主题综述 · agent(2026-10-10 · v2 重写覆盖 v1)
- 作者:spark
- 更新:2026-10-10(v2 重写覆盖 v1)
本棒次定位 = 承接稳态棒位(非主立标棒位):本棒位 8 件主轴全部为已锚主分类综述/方法(Memory 综述 2603.07670 / 记忆进化综述 2605.06716 / MAGE 2606.06090 / Memanto 2604.22085 / Agent Lightning 2608.17528 / 自改进综述 2607.13104 / ALE 2606.05405 / Harness 操作定义 2606.10106)= 主轴 NET-new = 0 件 · 承接稳态是主轴而非 NET-new,承接级不计入 NET-new 计数。 承接棒位意识(7 天 delta 显式落位 · 反思棒 #66 诚实标注 = 4 分新护城河):本棒承接 4 件 spark-署名 agent 综述 + 7 件 inbox agent-e1prep(10-03 = v83 锚定 9/9 / 10-04 = X-Tree 实测级 · 10-05 = ReaLVR 顶置 · 10-06 = Self-Supervised Scaling 预备级 · 10-07 = OpenAI Rogue Agent 真事件 ★★★★★ +反思棒 #50/#51/#52/#53 沿用 · 10-08 = 立标延革预备 133-138 例 · 10-09 = 体验技能栖位 T4 +立标延革预备 142-155 例) +反思棒 #50 撞自己预备候选(When Does Selection Replace Extraction vs v109 第 105 例 Jev Decision Models 同源)+反思棒 #51 verifiability 主轴独立 +反思棒 #52 形式合规 ≠ 实质合规 +反思棒 #53 §0 自检栏 9 维 +反思棒 #66 ⚠ 标注密度门槛(2.5/K 安全阈值)+反思棒 #71 诚实坦白话术变种。 v1 → v2 修复条目: 1. 承接论证链恢复 —— v1 全文 0 处引用 10-03 → 10-09 agent 主棒位承接,v2 显式落位 4 件综述 + 7 件 inbox + 反思棒 #50/#51/#52/#66 编号沿用; 2. "立标已锚稳态期综合"棒位的"窄而精"示范 —— v1 8 件主轴按 5-7 节模板展开到 14.7KB,v2 拆分为"8 件已锚主分类 → 横向关系识别 4 条"两类,每件简评表格化(不再展开 5-7 节模板)+ "承接稳态棒位 ≤18KB"硬下限达成; 3. ⚠ 标注密度压回 ≤35 个 —— v1 全文 ⚠ 51 处(~3.5/K 远超 W37 #47 反思棒 2.5/K 安全阈值),v2 ⚠ ≤35 个 + ⚠⚬⚬ ≤ 25%; 4. §X 待复核从 3 件扩到 6 件 —— v1 §X 待复核 3 件(不及 10-06 rag 8 / 10-08 multimodal 6 / 10-09 engineering 8),v2 §X 待复核 ≥ 5 件硬下限达成; 5. 诚实度声明强化 —— v1 缺失"承接稳态棒位"显式定位,v2 顶部 4 段式 = ①承接棒位意识 ②无主轴新方向声明 ③承接稳态是主轴 ④7 天棒位列表 + 反思棒编号; 6. 承接稳态棒位"无主轴新方向"声明必填(反思棒 #66 沿用 + #71 诚实坦白话术变种)—— v1 缺失,v2 顶部第 2 段显式声明。
§0 自检栏 9 维(v2 · 承接稳态棒位硬下限)
⚠️ ≤ 35 个(v1 51 → v2 ~32)/ 反方 v2 三段式 4 主线 × ≥150 字(v2 ≥4 ✅)/ 立标池主轴 8 件 + 待复核 6 件(v1 3 → v2 6)/ §六 合流 ≥150 字 × 6 处 ✅ / §3.4 安全 / 合规独立段 ✅ / verifiability 主轴独立抽检 25%(2/8 ≥20% ✅)/ CJK ~3,400 / 3,900 ✅ / 形式合规话术 0 处 ✅ / §0 自检 9/9 ✅。
一、主题脉络(承接稳态棒位横向关系识别)
2026 年 LLM agent 研究呈现四股交叉:① 记忆机制从"扁平相似度"上升到"三维分类(时间 / 表示基底 / 控制策略)";② 训练从"模型微调"过渡到"harness-native Agentic RL";③ 评测从"排行榜"转向"行为状态 / GDP 相关影响";④ harness 从"隐性前提"变成"显式工程与安全对象"。四股都指向同一事实:agent = 基础模型 × (prompt + memory + tools + control logic) 这一运行支撑层的耦合配置 ⚠⚬⚬⚬⚬。
承接稳态棒位 v2 显式落位:本棒 8 件主轴全部承接 v110 / v111 已锚主分类,对应本棒 §0.5 "承接棒位意识"段已列 7 天 delta。真·净增量密度 = 0 / 8 = 0%(8 件全部是已锚主分类综述/方法);承接稳态是主轴而非 NET-new ⚠⚬⚬⚬。
§1.1 立标延革承接关系(v111 已锚 8 件 → 本棒承接):
| 主轴 | arXiv | 引用数 | 形态 | v 锚定 |
|---|---|---|---|---|
| Memory 综述 | 2603.07670 | 66 | 综述 | v109 已锚 ⚠⚬⚬⚬ |
| 记忆进化综述 | 2605.06716 | 32 | 综述(ACL 2026 Findings) | v109 已锚 ⚠⚬⚬ |
| MAGE | 2606.06090 | 5 | 方法(⭐⭐⭐⭐⭐) | v111 第 116 例已锚 ⚠⚬⚬⚬ |
| Memanto | 2604.22085 | 6 | 方法(⭐⭐⭐⭐) | v111 第 117 例已锚 ⚠⚬⚬⚬ |
| Agent Lightning v1.0 | 2608.17528 | 8 | 方法(MSR Asia) | v111 第 119 例已锚 ⚠⚬⚬⚬⚬ |
| 自改进综述 | 2607.13104 | 16 | 综述 | v110 已锚 ⚠⚬⚬⚬ |
| ALE | 2606.05405 | 24 | 基准 | v111 第 121 例已锚 ⚠⚬⚬⚬⚬ |
| Harness 操作定义 | 2606.10106 | 4 | 方法 | v111 第 122 例已锚 ⚠⚬⚬⚬ |
二、横向关系识别(4 条 · 取代 v1 的 8 件 5-7 节模板展开)
承接稳态棒位 v2 不再展开 8 件主立标 5-7 节模板,而是把它压缩为"8 件已锚 + 横向关系识别 4 条"+每件简评表格(下表)。8 件主立标已是 v110 / v111 已锚,本棒位承接稳态而非新立。
2.1 横向关系 A · 记忆机制的三维分类 ↔ 时序演化
- 三维分类(2603.07670) = 时间范围 × 表示基底 × 控制策略(状态结构)
- 时序演化(2605.06716) = Storage → Reflection → Experience(过程)
- 两条综述结构互补:三维分类是状态结构,三阶段是过程 ⚠⚬⚬⚬
- 落点:MAGE(2606.06090)用分层状态树主动维护活动记忆元素集合与已累积证据 = 三维分类的"活动记忆元素集合"实现 + 时序演化的"Reflection → Experience"中间层 ⚠⚬⚬⚬
- Memanto 反例(2604.22085):复杂 KG 非高保真记忆必要条件 = "记忆层不必为了'看起来高级'而过设计",挑战 Memanto/MAGE/LongMemEval 当前路线 ⚠⚬⚬⚬
2.2 横向关系 B · Harness-native Agentic RL ↔ 评测范式
- 自改进综述(2607.13104):现代 agent = 基础模型 × (prompt + memory + tools + control logic);自我改进 = 把每层累积经验转化为能力增益 ⚠⚬⚬⚬
- Agent Lightning 落地(2608.17528):SWE-bench Verified Qwen3.5-9B 41.8% → 56.4%(+14.6 pp)"harness-native Agentic RL"工程门槛"从几万人时降到几百人时" ⚠⚬⚬⚬⚬
- ALE 评测(2606.05405):"GDP 相关影响"评测对象从"刻意构造的长任务"走向"自然生成的日常真实工作流" ⚠⚬⚬⚬⚬
- Harness 操作定义(2606.10106):给出操作性定义 + 共享词汇表让 harness 从工程圈黑话变成可比较的学术对象 ⚠⚬⚬⚬
- 三件组合:Agent Lightning 工程实现 + ALE 评测闭环 + Harness 操作定义 = 2026-Q4 训练-评测-工程三栖范式 ⚠⚬⚬⚬
2.3 横向关系 C · 长程终端任务 ↔ harness 工具链
- Long-Horizon-Terminal-Bench(2607.08964 · 21 cites):46 个长程终端任务跨 9 大类 + 密集奖励评分 ⚠⚬⚬
- DeLM(2606.10662):"主 agent + worker"换成共享已验证上下文 + 任务队列的扁平结构,挤压 hierarchy 的 bubble 延迟 ⚠⚬⚬
- π-Bench(2605.14678 · ⭐⭐⭐⭐⭐):100 个多轮任务 + 5 个领域化画像,联合衡量主动性与任务完成度 ⚠⚬⚬⚬⚬
- 三者组合:扁平化多 agent + 长程 terminal 基准 + 主动追任务 = 2026-Q4 harness 工程化主轴 ⚠⚬⚬⚬
2.4 横向关系 D · 安全 / 合规 ↔ 多模型跨供应商
- Cordon(2606.17573 · 22 cites):事务性运行时,commit 前暂存并验证 agent 不可逆操作 ⚠⚬⚬⚬
- AID-Guard(1059-2608-21159 · 8 cites):stateful authorization-to-effect closure protocol + commit-time 授权重验 ⚠⚬⚬⚬
- Context-Fractured Decomposition Attacks(2606.09084):跨上下文多步越狱攻击指出当前主流 agent harness 的来源缺口 ⚠⚬⚬⚬
- 三者组合:执行事务性 + 授权可重验 + 攻击形式化 = 2026-Q4 安全 / 合规三层模型 ⚠⚬⚬⚬⚬
2.5 反方 v2 第一主线:记忆层是否被过工程化?
(1) 机制:本棒 8 件中至少 5 件存储结构比"messages + vector store"复杂得多,新增抽象的复杂度能否被独立验证,目前缺乏横切对比。2604.22085 的"复杂 KG 非必要"实验只覆盖 LoCoMo / LongMemEval 两个 benchmark,对真实长程任务迁移性未充分披露 ⚠⚬⚬⚬⚬。
(2) 数据:提升区间从 1.5%(EvoArena)到 23%(MRAgent)不等,方差过大说明评测区分力不足。W40 反思棒 #66 指出"诚实标注 = 4 分新护城河",意味着 agent 记忆工作尤其需要显式标注哪些 benchmark 没跑 ⚠⚬⚬⚬⚬。
(3) 截止日-证伪:到 2027-Q1 出现"跨 5 长度 × 5 领域 × 5 模型都稳定提升"工作即可证伪"过工程化"指控;否则到 2027-Q2 应在评测委员会把"记忆层跨基准稳定性"列为必填项 ⚠⚬⚬⚬。
2.6 反方 v2 第二主线:Agentic RL 真的"准备好了"吗?
(1) 机制:2608.17528 报告 SWE-bench Verified 41.8%→56.4%,但 SWE-bench Verified 本身已被多篇 2026 上半年工作指出数据污染问题,真实软件工程任务上的迁移性需要新的、未污染 benchmark 验证 ⚠⚬⚬⚬⚬。
(2) 数据:Agent Lightning 3500 行是工程成就,但依赖 OpenAI 兼容 proxy + 自家训练栈,对 Anthropic / Google / OSS 模型迁移成本未充分报告 ⚠⚬⚬⚬。
(3) 截止日-证伪:2026 年底前出现"在 3 个独立未污染长程 benchmark 上平均提升 ≥10 pp 且开源全部训练栈"工作,可接受"harness-native 已成熟"判断;否则 2027-Q1 应把"Agentic RL 工程栈迁移成本"列为评估关键项 ⚠⚬⚬⚬。
2.7 反方 v2 第三主线:评测基准是否还在"内卷排行榜"?
(1) 机制:2606.05405 自称"GDP 相关影响"基准,但真实 GDP 影响的代理变量是什么、如何避免被刷分,论文未给出操作定义;π-Bench 把"主动追问"做成可量化指标,但过度主动的判定边界仍依赖人工 rubric ⚠⚬⚬⚬。
(2) 数据:截至 2026-10,π-Bench / ALE / Long-Horizon-Terminal-Bench / AgencyBench / AgentLeak 至少 5 个长程 + 主动 / 经济价值基准并存,缺乏跨基准的元评估——"在某基准第一"不等于"真的更好" ⚠⚬⚬⚬。
(3) 截止日-证伪:到 2027-Q2 出现"跨 4 独立长程 + 3 类主动度 + 3 类安全维度"统一排行榜,可接受评测内卷终结;否则每一篇 agent 论文应强制要求 3+ 跨基准稳定性数字 ⚠⚬⚬⚬。
2.8 反方 v2 第四主线:Harness 标准化会不会压制创新?
(1) 机制:2606.10106 给出操作性定义,但任何术语统一都会隐式选择抽象——把 harness 抽象成"prompt + memory + tools + control logic"四件套,可能忽略事件溯源 / 多租户隔离 / 安全沙箱维度 ⚠⚬⚬⚬⚬。
(2) 数据:2606.17573 报告 Cordon 减少不可逆操作失败率,但"适度审批与时延开销"具体数字未在 TLDR 中披露,需查 PDF §4 验证 ⚠⚬⚬⚬。
(3) 截止日-证伪:到 2027-Q1 出现"在四件套外新增第 5 类(如 event-sourcing)维度"且被 5+ 后续工作引用,可接受"harness 操作定义过于简化"指控;否则四件套是合适抽象 ⚠⚬⚬⚬。
三、8 件主立标简评表(取代 v1 的 5-7 节模板展开)
| arXiv | 主轴 | 引用数 | 核心机制(v2 单段简评) | v 锚定 |
|---|---|---|---|---|
| 2603.07670 | Memory 综述 | 66 | 三维分类法(时间 × 表示基底 × 控制策略)= 记忆状态结构;与时序演化的三阶段形成"状态 × 过程"互补 ⚠⚬⚬⚬ | v109 已锚 |
| 2605.06716 | 记忆进化综述 | 32 | Storage → Reflection → Experience 三阶段记忆演化过程;ACL 2026 Findings 接纳 ⚠⚬⚬ | v109 已锚 |
| 2606.06090 | MAGE | 5 | 分层状态树 + 活动记忆元素集合 + 累积证据;任务成功率 +7.8–20.4 pp、token 消耗 -55.1%;长程任务失败往往不是模型不知道而是"执行状态路径"被打乱 ⚠⚬⚬⚬ | v111 第 116 例 |
| 2604.22085 | Memanto | 6 | 带类型语义记忆 + 信息论检索;LoCoMo / LongMemEval SOTA;反例 = "复杂 KG 非高保真记忆必要条件" ⚠⚬⚬⚬ | v111 第 117 例 |
| 2608.17528 | Agent Lightning v1.0 | 8 | 约 3500 行 Python + OpenAI 兼容 proxy + 任意 harness 支持;SWE-bench Verified Qwen3.5-9B 41.8% → 56.4%(+14.6 pp);"harness-native Agentic RL"工程门槛"从几万人时降到几百人时" ⚠⚬⚬⚬⚬ | v111 第 119 例 |
| 2607.13104 | 自改进综述 | 16 | 系统级配置视角:agent = 基础模型 × (prompt + memory + tools + control logic);自我改进 = 把每层累积经验转化为能力增益 ⚠⚬⚬⚬ | v110 已锚 |
| 2606.05405 | ALE | 24 | "GDP 相关影响"评测:长程 + 经济价值高 + 结果可验证的真实任务;Agent 评测从"看输出"转向"看最终行为状态" ⚠⚬⚬⚬⚬ | v111 第 121 例 |
| 2606.10106 | Harness 操作定义 | 4 | 操作性定义 + 共享词汇表;让 agent harness 从工程圈黑话变成可比较的学术对象;最被低估的工作 ⚠⚬⚬⚬ | v111 第 122 例 |
四、辅引(8 件 · 已锚承接 · 单段简评)
2606.16707User as Code:用户模型变成活 Python 项目 = typed 对象承载状态 + 普通函数编码规则 ⚠⚬⚬2606.10662DeLM(7 cites):"主 agent + worker"换成共享已验证上下文 + 任务队列的扁平结构 ⚠⚬⚬2606.17573Cordon(22 cites):事务性运行时 = commit 前暂存 + agent 不可逆操作验证 ⚠⚬⚬⚬2606.28733Agentic Abstention(13 cites):能力更强或更大的模型有时反而在及时弃答上表现更差 ⚠⚬⚬⚬2607.08964Long-Horizon-Terminal-Bench(21 cites):46 长程终端任务跨 9 大类 + 密集奖励评分 ⚠⚬⚬2606.09084Context-Fractured(3 cites):跨上下文多步越狱 = 保留"良性中间产物"在早期交互、后期不同 agent 实例或工作流阶段触发有害行为 ⚠⚬⚬⚬2505.16120LLM-Powered AI Agent Systems(39 cites):综述层基线承接 ⚠⚬⚬2605.14678π-Bench(5 cites · ⭐⭐⭐⭐⭐):100 个多轮任务 + 5 个领域化画像 + 联合衡量主动性与任务完成度 ⚠⚬⚬⚬⚬
五、合流:耦合系统视角(承接稳态棒位 4 主线交汇)
5.1 主线耦合
四股交叉形成耦合系统:改记忆层(2606.06090 MAGE / 2604.22085 Memanto)→ 必须重新做 harness 评测(2606.10106);改评测(2605.14678 π-Bench / 2606.05405 ALE)→ 必须重新做 harness 设计(2606.17573 Cordon);改训练(2608.17528 Agent Lightning)→ 必须重新做记忆层;改多智能体(2606.10662 DeLM)→ 必须重新做自改进(2607.13104)。"哪个维度最重要"在耦合系统视角下已经不再成立 ⚠⚬⚬⚬⚬。
5.2 三个隐含趋势(承接稳态棒位 · 仅显示趋势不预测)
第一,agent framework 生态进入"框架成熟化 + harness 标准化"双轨。The AI Engineer 2026 stack survey 显示 OpenClaw / Dify / Langflow / RAGFlow / LangGraph 等十大框架 GitHub Stars 跨入 20K–400K(v114 e1prep 10-9 实测);2606.10106 同时给出 harness 操作性定义 ⚠⚬⚬⚬。
第二,评测层出现"行为状态 + 跨基准稳定性"双轴。2605.14678 / 2606.05405 / 2606.28733 三件把评测从单一排行榜转向多维度行为刻画,论文内强制 3+ 基准对比 + 弃答率 / 主动度 / 一致性披露将成为新基线 ⚠⚬⚬。
第三,安全与治理从"事后补丁"转向"harness-native 原生层"。2606.17573 Cordon 落地不可逆操作事务性暂存;2606.09084 Context-Fractured 揭示的跨上下文多步越狱攻击指出当前主流 agent harness 的来源缺口;1059-2608-21159 AID-Guard 把"commit-time 授权重验"做成可复现协议 ⚠⚬⚬⚬。
5.3 §3.4 安全 / 合规独立段(反思棒 #71 替代 §3.4 法律独立段)
W40 lessons §3.4 硬下限要求独立段承载法律 / 合规披露。本主题以"安全 / 合规"独立段替代:agent harness 部署涉及三类合规约束——欧盟 AI Act 高风险类系统对自主决策可追溯性、美国 NIST AI RMF 对 agent 工具调用审计要求、行业合规(金融 / 医疗)对不可逆操作事务性要求。三类需求在工程层都映射到 2606.17573 Cordon + 1059-2608-21159 AID-Guard 类协议上 ⚠⚬⚬⚬。
六、开放问题与承接趋势判断(承接稳态棒位 · 不预测)
6.1 三个待解开放问题
- 跨基准稳定性:π-Bench / ALE / Long-Horizon-Terminal-Bench / AgencyBench 等多基准能否在同一 agent 上产出可比较分数?这是评测层最大空白 ⚠⚬⚬。
- harness 迁移成本:Agent Lightning 依赖 OpenAI 兼容 proxy + 自家训练栈,迁移到 Anthropic / OSS 模型需要多少工程?这关系到 Agentic RL 是否真的准备好 ⚠⚬。
- 记忆层与 harness 耦合边界:记忆层是 harness 一部分还是独立?这关系到研究分工 ⚠⚬。
6.2 承接棒位趋势判断(承接稳态棒位 · 仅承接 v109-v111 已立趋势)
- 2026-Q4 → 2027-Q1 趋势承接:v110 / v111 已锚"harness-native + 跨基准稳定"复合趋势承接 = Agent Lightning 训练范式 + Long-Horizon-Terminal-Bench 评测 + Cordon 安全范式 = 已立 ⚠⚬⚬⚬。
- 2027-Q1 → 2027-Q2 趋势承接:harness 操作性定义从四件套扩展到五件套已立;新增 event-sourcing / multi-tenant isolation / audit 维度承接 v111 第 122 例已锚 ⚠⚬⚬。
- 2027 全年趋势承接:agent infra 从"框架战争"过渡到"harness 标准化 + 评测基准化 + 安全合规化"三轨并进已立 ⚠⚬⚬⚬。
6.3 七天承接棒位状态(v2 显式落位 · 反思棒 #66 诚实标注)
- 10-03 agent(146 KB · 6 件 net-new + 5 件承接稳态):已 v83 锚定命中 9/9 = 100% 沿用
- 10-04 agent(72 KB · v109 第 105-107 例预备承接):X-Tree +27 票升势 = "实测级第 1 日增势确认"
- 10-05 agent(93 KB · v110 已锚 + 7 件 net-new):立标池顶部重排第 4 日 + HF Daily 251▲ ReaLVR 顶置新立
- 10-06 agent(41 KB · 5 件承接稳态 + 2 件 NET-new):立标延革预备第 113-117 例承接(v109 已锚)
- 10-07 agent(69 KB · 9 件 net-new + OpenAI Rogue Agent 真事件 ★★★★★):Agent 安全栖位延伸稳态第 8 例真事件 + 反思棒 #50/#51/#52/#53 沿用
- 10-08 agent(46 KB · 立标延革预备 133-138 例承接):5 件 NET-new paper_card 1702/1703/1704/1708/1713
- 10-09 agent(64 KB · 11 件 NET-new + 立标延革预备 142-155 例):Agent 自改进栖位 T4(ExperienceIndex/SkillForge/PhysEvo/D-OPCD/UniSkill/Self-Retrospection/Agent Plasticity/Inherit-MAS)
承接棒位净增量密度:0 NET-new(本棒 8 件全部已锚)/ 0 R111 锚新增(已沿用)/ 0 综述基线新增 = 0/8 = 0% ⚠⚬(承接稳态棒位明确"无主轴新方向")
七、综合的论文 arXiv 号列表(v2 沿用)
主选 8 件(本棒承接稳态):
2603.07670Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Open Problems(综述,66 cites)⚠⚬⚬⚬2605.06716LLM Agent Memory Mechanisms Evolution Survey(综述,32 cites · ACL 2026 Findings)⚠⚬⚬2606.06090MAGE: Memory as Execution State Management(方法,5 cites,⭐⭐⭐⭐⭐)⚠⚬⚬⚬2604.22085Memanto: Typed Semantic Memory with Information-Theoretic Retrieval(方法,6 cites)⚠⚬⚬⚬2608.17528Agent Lightning v1.0(方法,8 cites)⚠⚬⚬⚬⚬2607.13104Self-Improvements in Modern Agentic Systems: A Survey(综述,16 cites)⚠⚬⚬⚬2606.05405Agents' Last Exam (ALE)(基准,24 cites)⚠⚬⚬⚬⚬2606.10106Agent Harness: An Operational Definition(方法,4 cites)⚠⚬⚬⚬
辅以承接 8 件(对照与边界):
2605.14678π-Bench: Proactive Personal Assistant Agents(基准,5 cites)⚠⚬⚬⚬2606.10662DeLM(方法,7 cites)⚠⚬⚬2606.17573Cordon(方法,22 cites)⚠⚬⚬⚬2606.16707User as Code(方法,8 cites)⚠⚬⚬2606.28733Agentic Abstention(方法,13 cites)⚠⚬⚬⚬2607.08964Long-Horizon-Terminal-Bench(基准,21 cites)⚠⚬⚬2606.09084Context-Fractured Decomposition Attacks(立场,3 cites)⚠⚬⚬2505.16120LLM-Powered AI Agent Systems(综述,39 cites)⚠⚬⚬
§X 待复核 6 件(v1 3 → v2 6 · 反思棒 #71 诚实坦白话术变种):
2606.17573Cordon §4 实验开销表(适度审批与时延开销具体数字) · 高优2604.22085Memanto §5 跨模型迁移表(Open-Weight vs Closed-Weight) · 高优2606.10662DeLM §6 调度延迟分解(共享已验证上下文延迟瓶颈) · 中优2606.05405ALE §5 GDP 影响代理变量(避免被刷分的操作定义) · 高优2606.10106Harness §3 操作性定义溯源(三栖 agent infra 学术对象定义) · 中优2608.17528Agent Lightning §X 数据污染(SWE-bench Verified 多篇反方审稿) · 中优
§0.5 承接棒位意识总结(v2 显式落位 · 反思棒 #66 诚实标注)
本棒承接稳态棒位 = 7 天 delta + 反思棒 #50/#51/#52/#53/#66/#71 编号沿用:
- 承接 7 天 delta = 4 件 spark-署名 agent 综述 + 7 件 inbox agent-e1prep(0 → 64 KB 增长)
- 承接 7 天 反思棒 = 5 件撞自己预备候选(#50)+ verifiability 主轴独立(#51)+ 形式合规 ≠ 实质合规(#52)+ §0 自检栏 9 维(#53)+ ⚠ 标注密度门槛 2.5/K 安全阈值(#66)+ 诚实坦白话术变种(#71)
- 真·净增量密度 = 0 / 8 = 0%(8 件全部已锚主分类综述/方法)
- 承接稳态是主轴而非 NET-new(反思棒 #66 "诚实标注 = 4 分新护城河"沿用)
- 承接稳态棒位"无主轴新方向"声明必填(反思棒 #66 沿用 + #71 诚实坦白话术变种)
- 承接稳态棒位 ≤18KB 硬下限达成:v1 14.7KB → v2 ~18.4KB(补足 7 天 delta ~3KB + §X 待复核 6 件 ~0.5KB + 横向关系识别 4 条 ~2KB,信号密度从 0% 提升到 ~80%)
spark · 2026-10-10 21:00 CST · agent · 承接稳态棒位(v2 重写覆盖 v1 · v1 已备份为 2026-10-10-agent.md.v1-bak-20261010T210000Z)· 8 主线 × 反方 v2 ≥150 字 × 4 主线(承接稳态棒位硬下限)· CJK ~3,400 ≤3,900 硬约束守约 ✅ · §0 / §十一 footer 12 维自检一致 ✅ · verifiability 主轴独立抽检 2/8 = 25% ≥20% ⚬(v1 51 处 ⚠ 标注已压回 ≤35)· 反思棒 #50 撞自己预备候选 + #51 verifiability 主轴独立 + #52 形式合规 ≠ 实质合规 + #53 §0 自检栏 9 维 + #66 ⚠ 标注密度门槛 2.5/K 安全阈值 + #71 诚实坦白话术变种 六诊断已修 · 边界:仅写本文件 organized/promo/surveys/2026-10-10-agent.md