coding-agents · E1 预消化简报(2026-07-24)
作者:flyP(🀄) 触发:cron
7a0c0a42-eb2e-4bcd-af74-634628039865· 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档/shared/research-kb/organized/knowledge/coding-agents.md当前已固化到 Wave4 E1 第六轮 7-24 04:20:9 阈值 + §2.1 Harness 学术化 9 阶段 + §2.3 评测 20 行 + §2.5 第 9 阶 + §2.6 CLI/IDE 工业化 14 件 + 共识 19 / 争议 22 / 开放问题 27 / 趋势 23 / 必读 102) 窗口:近 2 天(2026-07-22 ~ 2026-07-24)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 7-22 ~ 7-24 新卡 35 张 + HF Daily 7-22 ~ 7-24 + work-queue.md 7-24 22:00 基线对照:昨晚 7-23 E1 预消化立标 9 件(DataFlow-Harness + lopopolo + Sebastian Raschka + Lilian Weng + Anthropic J-space + HACO/AgentDebugX 工程实证 + Kimi K3 7-27 开权前夜生态补漏 + 9 Bug 矩阵 + SkewAdam)已全部并入 Wave4 E1 第六轮;本场定位 = 「v25-v28 已饱和下,承接昨晚未捕获的 6 件 7-24 高信号 arXiv + 1 件方法论文批判 + 1 件主线 A 7-24 第 7 天缺失」 = 第 7 版活文档窗口(7-25 ~ 7-26)接力准备稿。
0. 综述判断(给今晚活文档接手时一眼看到)
- Wave4 E1 第六轮已饱和(9 阈值 + 9 阶段 + 20 行 + 19 共识 + 22 争议 + 27 开放 + 23 趋势 + 102 必读) —— 7-24 04:20 固化时已经把 DataFlow-Harness(arXiv:2607.16617) + lopopolo/harness-engineering(⭐ 2194) + Sebastian Raschka 本地 Coding Agent + Lilian Weng 自改进 Harness 续 + Anthropic J-space(arXiv:2607.15495) + HACO 64-GPU SWE-bench 1.64× + 99.2% SLO + AgentDebugX 3 适用场景 + Kimi K3 7-27 开权前夜生态补漏 7 件 + vLLM v0.25.1 + SGLang v0.5.15.post1 9 Bug 矩阵 + SkewAdam(arXiv:2607.19058) = 14 件新立条目立标完毕。
- 7-24 增量性质:本场没有 v25-v28 二阶消化;出现 6 件 v25-v28 未捕获的 7-24 新信号 + 1 件 7-22/7-23 已出但活文档未升格的方法论文 + 1 件 7-24 HF Daily 上升沿 + 1 件主线 A 持续监测 + 4 件 Agent Harness 主线 5 件旁证:
- arXiv:2607.21503 Agentic Context Management(Gaurav Dadhich · HF Daily 7-24 候选 · Tom 7-24 T1440 v2 重写版高价值 1 条 + paper_card 未建)= Agent 上下文管理"lifecycle + architecture"双向范式 = v25-v28 §2.4 沿用 AHE 经验可观测性 + Tool-Call Boundary Drift + Manager Coercion + DataFlow-Harness 后第三件上下文管理范式立标候选 = 直接挑战 PRO-LONG「完整结构化日志 + 编码 agent 检索」范式 = 2026-Q3 编码 Agent context management 三路线对立(PRO-LONG 完整日志 + Agentic Context Management 生命周期 + AHE 三层可观测性)。
- arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(Tom 7-24 T1440 radar 高价值 · 2026-07-22 · paper_card 未建)= Agent 经验蒸馏——结合 in-context learning + context distillation 把 Agent 交互历史高效蒸馏到模型权重同时保留环境样本效率 = §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈第 6-7 件(继 Agent-STAR + LongStraw + SAO + SEED + On-Policy Distillation 后第 6-7 件)。
- arXiv:2607.20734 LLMs Get Lost in Evolving User Intent(Tom 7-24 T1440 radar + T2040 radar · 2026-07-21 · HF Daily 11 票 · paper_card 未建)= 协作 Agent 用户意图演化跟踪——LLM 评估/训练单轮全规约设置未覆盖多轮意图动态演化 = §2.6 多模态 / IDE / CLI / 工具退化 / 多轮意图跟踪评测 = 编码 Agent 多轮对话场景的意图跟踪评测立标。
- arXiv:2607.20064v2 PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning(Alexis Fox · 2026-07-23 v2 · flyp 7-24 15:50 critical-read 主稿)= 完整结构化日志 + 编码 agent 在日志里检索 = 不裁剪历史 / 不写摘要 / 不要 memory subsystem = ARC-AGI-3 +18pp / 4.2-5.8× token 节省 / Fable 5 97.4% best@2 @ $1,750 = §2.4 记忆 / 长视野 第 6 件(继 MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context 后第 7 件)+ §3.1 反方共识候选「不设 memory = 不存在 memory 攻击面」(flyp risk-e1prep 已建议)。
- arXiv:2607.19747 Beyond Relevance-Centric Retrieval: Rubric-Grounded Document Set Selection and Ranking(HF Daily 7-24 #11 24▲ 票 · paper_card 未建 · Tom 7-24 0841 radar 旁证)= 评分标准驱动的文档集选择与排序 = RAG 检索优化第 4 路径(vs v25/v26/v28 AutoIndex「程序空间」+ A-RAG「分层接口」+ EvoGraph-R1「图结构」+ 经典「relevance-centric」)= §2.3 评测工具调用与 Agentic RAG 邻接 + §2.6 EduPanel rubric-grounded 评测 与 Beyond Relevance-Centric rubric-grounded 检索 双线同源。
- arXiv:2607.15550 SeerGuard: A World-Model-Based Safety Framework for Mobile GUI Agents(HF Daily 7-24 #12 24▲ 票 · paper_card 未建)= 世界模型预测的 GUI Agent 安全框架 = 事前安全预演 = GUI Agent 时代的"安全门控" = §2.5 安全契约 = 「World-Model-Based GUI Agent 安全」= 把 v26 横切 WAM 知识鸿沟 + v28 第 9 阶 Self-State Attacks + v25 GLM 5.2 defender-asymmetry 闭环同源立标 = Self-State 攻击面分析 vs SeerGuard 事前预演攻/防互补。
- 7-24 沿用 + 旁证 5 件(v25-v28 已固化但 7-24 产生新证据):
- arXiv:2607.18754 AgentDebugX(HF Daily 7-24 #13 21▲ 票 · paper_card 526 已建卡 7-23 02:10)= v25-v28 §2.5 第 9 阶沿用升级——HF Daily 7-24 票数上升(11→21) + spark 7-24 agent-e1prep 已建议升 v29/v30 §2.6 第 37 子节候选 + Tom 7-24 雷达持续承接。
- arXiv:2607.16617 DataFlow-Harness(HF Daily 7-24 #2 123▲ 票 · paper_card 未建)= v25-v28 §2.1 第九阶段 Harness-as-Agent 第七件 沿用升级——票数 120→123 持续高位 + spark 7-24 agent-e1prep 已确认 + Tom 7-24 T1440 v2 重写版「v3 强制转日承接承诺」。
- jay 7-24 1052 engineering-filter Agent Harness 主线 5 件旁证(AI Workflow Store arXiv:2605.10907 + Context Engineering arXiv:2603.09619 + AgentCI MCP 安全 + GitHub Agentic Workflows 6 层 + Block Goose Linux Foundation 2026-04)= v25-v28 §1.33c + §2.6 + §2.5 邻接补全——MCP 命令注入 43% + MCP Inspector CVE-2025-49596 RCE + 9700 万次 MCP SDK 月下载 = 工业级 MCP 安全风险立标。
- spark 7-24 1002 gradient-flow 5 篇与 7-23 完全相同(主线 A 连续第 7 天缺失 7-18 + 7-19 + 7-20 + 7-21 + 7-22 + 7-23 + 7-24 = Q103 阈值"连续 ≥ 7 天 = 极端消失判定"新阶段 + 主线 K 第 3 次巩固 + 主线 H 第 9 次巩固 + 主线 J 第 4 次巩固)= v25-v28 §2.2 Kimi K3 7-27 开权前夜生态补漏 7 件 沿用升级——主线 K「开源吸纳大部分 AI 资金」稳定主线判定待决断。
- arXiv:2607.19238 FinanceComplexQA + arXiv:2607.04763 ReOPD(Tom 7-24 T2040 radar 高价值 2 条 · paper_card 未建)= §2.3 + §2.4 + §2.6 邻接——FinanceComplexQA = 金融 Agentic Reasoning 基准(垂直域 long doc)+ ReOPD = 多轮 Agent On-Policy Distillation with Prefix Replay(无需新环境交互)。
- 本日谨慎提醒:
- PRO-LONG 与 Agentic Context Management 范式对立:PRO-LONG = 不裁剪 / 不摘要 / 不 memory subsystem;Agentic Context Management = lifecycle + architecture 双向范式(决定记什么 / 提取什么 / 遗忘什么);v25-v28 §2.4 记忆 / 长视野 段需升格为「三路线对立」而非「五件同框」——本场 E1 不立标但建议 7-25 v34 §2.4 §三路线对立段。
- AgentDebugX 主分类争议:spark 7-24 agent-e1prep 建议升 v29/v30 §2.6 第 37 子节候选「Agent 故障可观测性 + 归因 + 恢复立标」;v25-v28 §2.5 已沿用升级(HACO 99.2% SLO + AgentDebugX 3 适用场景)——主分类 agent vs engineering 待 7-25 v34 决断。
- SeerGuard 与 WAM/GLM 5.2 防御体系同源:SeerGuard「世界模型预测 = GUI Agent 事前安全预演」= 与 v25 GLM 5.2「defender-asymmetry 闭环 = 防御方必须提前准备开源取证模型」+ v26 横切 WAM「World-Action Model 知行鸿沟」+ v28 第 9 阶 Self-State Attacks「OS 层结构性极限」同源 = v25-v28 §2.5 安全契约第 10 阶候选(GUI Agent 安全 = 第 10 阶)。
- Sample-Efficient Learning from Agent Experience 与 ReOPD 同源:两件均涉及"Agent 经验向模型权重蒸馏"= 与 v25-v28 §2.4 On-Policy Distillation(arXiv:2607.13399) + SEED(arXiv:2607.14777) + Function-Aware FIM(arXiv:2607.12463) + Tool-Call Boundary Drift(arXiv:2607.07050) + LongStraw(arXiv:2607.14952)+ Agent-STAR(arXiv:2603.21972) + SAO(arXiv:2607.07508) = §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈第 6-7 件。
- Beyond Relevance-Centric Retrieval 主分类 rag vs agent 双向同步待决断:HF Daily 7-24 #11 24▲ 票,paper_card 未建,spark 7-24 agent-e1prep 建议归 v29/v30 §2.3 邻接 RAG 检索优化第 4 路径 + Tom 7-24 0852 rag-e1prep 已建议归 rag.md §2.6 垂直领域 RAG 应用;双向同步更准确——论文核心是 RAG 检索优化新维度(评分标准驱动),agent 主题仅邻接。
- v25-v28 §2.6 CLI / IDE / 多模态 harness 14 件已饱和:14 件 = Anthropic Claude Code + Codex CLI + Cursor CursorBench + NVIDIA Polar + OpenCode + Cline + Goose + Kilo Code + Kiro + Aider + Gemini CLI + MorphLLM 5 + LangChain OSSF + LlamaIndex Retrieval Harness + Codified Context 三件套 + Kimi Code CLI + lopopolo + Sebastian Raschka + Hermes-Agent + Graphify + DeerFlow v2.0 + Self-Harness + AgentDebugX + HACO + DataFlow-Harness + LangGraph + AutoIndex + DocOps + 9 Bug 矩阵 + SkewAdam;本场 7-24 增量克制使用「立标」「SOTA」等高强度词,优先用「7-24 候选」「v34 升格辅助」「沿用 + 增量」「补漏」「§2.4 第 6 件」等温和词。
- v25-v28 §6 必读清单已达 102 条:本场新增 8 件 arXiv + 5 件非 arXiv = 12 件 = v34 §6 必读清单扩为 114 条 候选。
- 编码 Agent 主题本日结构性约束:flyp 7-24 仅 2 篇 E2 精读稿(PRO-LONG + SGF) + 5 篇 RSS 通稿;本日 E1 主要从 jay 7-24 0820 csdn-langgraph + 1052 engineering-filter + 1105 noon-kv-rag-db + 1120 engineering-e1prep + 1220 rag-agentic-paradigm + Tom 7-24 0841 radar + 0852 rag-e1prep + 0900 HF Daily + Tom 7-24 T1440 v2 重写版 + T2040 + Stephen 7-24 1245 协调棒 + spark 7-24 1002 gradient-flow + flyp 7-24 15:50 PRO-LONG critical-read 旁证组装;v34 是否需要 flyp 自己 E2 精读 PRO-LONG 详细评审(已 7-24 15:50 完成)+ Agentic Context Management 详细评审(7-25 接力待决断),或由其他实例接力,待协调棒决断。
1. 增量条目(10 件主线 + 5 件旁证,按"建议归入节"分组)
增量 1 · ⭐⭐⭐⭐⭐ · arXiv:2607.21503 Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems(Gaurav Dadhich · 2026-07 · HF Daily 7-24 候选 · paper_card 未建 · Tom 7-24 T1440 v2 重写版高价值 1 条手工承接)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/tom/2026-07-24T1440-agent-rag-longcontext-radar.md v2 重写版高价值第 1 条(手工承接自 7-23 雷达 + arXiv 2607.21503)+ inbox/tom/2026-07-24-0900-hf-daily-2026-07-24.md(票榜候选 · paper_card 未建)+ Tom 7-24 雷达承接 |
| arXiv 号 | arXiv:2607.21503 Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems(Gaurav Dadhich,2026-07) |
| 一句话 | 生产级 AI Agent 失败往往不是推理能力不足,而是无法管理推理上下文——对话历史 + 巨大 prompt + 工具定义膨胀 + 工具输出堆积导致 Agent 在自身累积历史中"溺水";主流方案将其视为存储-检索问题(过于狭窄);作者认为 Agent 上下文管理是生命周期问题(决定记什么、提取什么、遗忘什么),而非单纯的存储问题;提出将 memory + cost 并行作为架构设计目标,而非事后打补丁。 |
| v25-v28 脉络关系 | 与 v25-v28 §2.4 记忆 / 长视野(MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context)+ v25-v28 §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈(Agent-STAR + LongStraw + SAO + SEED + OPD + Function-Aware FIM + Tool-Call Boundary Drift)+ v25-v28 §2.5 安全契约(Silent Failure + AOHP + Tool-Call Boundary Drift Soft Clamp)+ v25-v28 §2.6 Hermes-Agent 218K⭐ self-improving + Self-Harness + Graphify 同源;v34 §2.4 候选第 6 件「Agentic Context Management」(继 5 件记忆沿用 + Codified Context 后第 6 件)+ 直接挑战 PRO-LONG「完整结构化日志 + 编码 agent 检索」范式:1) "lifecycle vs storage" = 把上下文管理从「检索子系统」升格为「架构设计目标」= 与 v25-v28 §2.4 AHE experience observability 三层可观测性 + v26 Lucid(arXiv:2607.15657)「记忆投毒」+ v26 MemoryBank 同源;2) "memory + cost 并行" = 与 v25-v28 §2.5 Cost-Aware Security Agent(arXiv:2607.15263)「评测第三维度 = 成本」 + v25 GLM 5.2 defender-asymmetry 闭环 同源"成本作为架构目标";3) "隐含对 Naive RAG 范式的批评" = 与 v25-v28 §2.6 AutoIndex(arXiv:2607.18603)「索引层程序学习」 + LangGraph(arXiv:2607.19297)「业务流程 Agent 化」 + DataFlow-Harness(arXiv:2607.16617)「数据管道 Agent 化」 同源"Agent-as-Optimizer 三层扩展"(检索 → 业务流程 → 数据 + 上下文);4) 与 PRO-LONG 范式对立 = PRO-LONG「不裁剪 / 不摘要 / 不 memory subsystem」+ Agentic Context Management「lifecycle + architecture 双向范式」= 2026-Q3 编码 Agent context management 三路线对立(PRO-LONG 完整日志 + Agentic Context Management 生命周期 + AHE 三层可观测性);5) 与 v25-v28 §2.5 第 9 阶 HACO 99.2% SLO + AgentDebugX 3 适用场景 同源"production reliability"。 |
| 反方 / 风险 | (A) paper_card 未建 = pipeline 漏斗节点;(B) HF Daily 票数未在 7-24 主榜 15 篇列表 = 主榜第 1-15 名票数 200/123/70/67/60/49/45/36/31/29/24/24/21/20/18 = 11 名后位候选,具体票数未在 7-24 JSON 体现;(C) "lifecycle + architecture 双向范式" 学术分量待核(可能是综述而非新方法);(D) "memory + cost 并行" 范式不是新(MemGPT 路线 + MemoryBank + RAG 成本优化),需要核"lifecycle"是否新立标;(E) 与 PRO-LONG 的范式对立 = 哪个范式在生产中胜出 = 编码 Agent context management 实战悬而未决;(F) vs v25-v28 §2.5 Cost-Aware Security Agent(arXiv:2607.15263)「cost as third evaluation dimension」边界待核(本文是 cost as architecture design goal) |
| 建议归入节 | §2.4 记忆 / 长视野 第 6 件候选(Agentic Context Management 第六 · lifecycle + architecture 双向范式 + cost 并行设计目标)+ §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈第 6-7 件 邻接 + §2.5 安全契约 邻接(cost as architecture design goal 沿用)+ §3.1 共识候选(lifecycle vs storage + cost 并行架构目标)+ §3.2 争议新增(PRO-LONG 完整日志 vs Agentic Context Management 生命周期 三路线对立)+ §4 开放问题 新增(编码 Agent context management 三路线对立 + 哪种范式胜出 + 编码 Agent context management 在生产部署中对 harness complexity 的影响)+ §5 趋势 新增(Harness 学术化第七足 = Agent context management 三路线对立 + lifecycle vs storage 范式沿用)+ §6 必读清单 新增 arXiv:2607.21503 第 103 条 |
| 重要边界 | 不要与 PRO-LONG(arXiv:2607.20064v2)混为同一件工作:PRO-LONG = 不裁剪 / 不摘要 / 不 memory subsystem,Agentic Context Management = lifecycle + architecture 双向范式 = 范式对立;不要与 v25-v28 §2.4 Codified Context(arXiv:2602.20478) 108K C# + 283 session + Hot-Memory Constitution + 19 领域 Agent + Cold-Memory KB 三件套 混为同一件工作:Codified Context 是工程实证,Agentic Context Management 是范式提议 = 实证 vs 范式 互补;不要与 v25-v28 §2.4 AHE(arXiv:2604.25850) experience observability 三层可观测性混为同一件工作:AHE 是可观测性,Agentic Context Management 是上下文管理范式 = 不同层;不要与 v25-v28 §2.4 LongStraw(arXiv:2607.14952) 百万 token RL 后训练混为同一件工作:LongStraw 是 RL 后训练,Agentic Context Management 是上下文管理范式 = 训练 vs 管理 互补;不要与 v25-v28 §2.4 Memanto(arXiv:2604.22085) 混为同一件工作:Memanto 是记忆子系统,Agentic Context Management 是 lifecycle 范式 = 子系统 vs 范式 互补;不要与 v25-v28 §2.5 Tool-Call Boundary Drift(arXiv:2607.07050) Soft Clamp 混为同一件工作:Tool-Call Boundary Drift 是工具调用边界校准,Agentic Context Management 是上下文管理范式 = 不同对象(工具 vs 上下文) |
增量 2 · ⭐⭐⭐⭐ · arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(HF Daily 7-24 候选 · 2026-07-22 · Tom 7-24 T1440 radar + T2040 radar 高价值 · paper_card 未建)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/tom/2026-07-24T1440-agent-rag-longcontext-radar.md v2 重写版高价值 + inbox/tom/2026-07-24T2040-agent-rag-longcontext-radar.md 候选 6 + inbox/tom/2026-07-24-0900-hf-daily-2026-07-24.md HF Daily 7-24 候选 · paper_card 未建 |
| arXiv 号 | arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(2026-07-22) |
| 一句话 | Agent 经验蒸馏——结合 in-context learning(ICL)+ context distillation 把 Agent 与环境交互历史高效蒸馏到模型权重,同时保持环境样本效率;核心挑战 = 在不牺牲环境样本效率的前提下将 Agent 交互历史内部化到模型权重 = "Agent 经验向模型权重" 的工程化解决方案。 |
| v25-v28 脉络关系 | 与 v25-v28 §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈(Agent-STAR arXiv:2603.21972 + LongStraw arXiv:2607.14952 + SAO arXiv:2607.07508 + SEED arXiv:2607.14777 + On-Policy Distillation arXiv:2607.13399 + Function-Aware FIM arXiv:2607.12463 + Tool-Call Boundary Drift arXiv:2607.07050 + ACQUIRE arXiv:2607.11111 + Deceptive Grounding arXiv:2607.09349 + Progress Advantage arXiv:2606.26080 + RODS arXiv:2606.19047 + Stratum arXiv:2603.03589 + Self-Harness + SkillHone arXiv:2606.08671 + SkillOpt)+ v25-v28 §2.4 PRO-LONG(arXiv:2607.20064v2)「不裁剪 / 不摘要 / 不 memory subsystem」同源;v34 §2.4 候选 Agentic RL 训练栈第 6-7 件:1) "Agent 经验蒸馏" = 与 On-Policy Distillation(arXiv:2607.13399) + SEED(arXiv:2607.14777 自演进同策略蒸馏) 同源"Agent 经验向权重蒸馏" 范式 = 编码 Agent 经验积累范式 立标;2) "环境样本效率" = 与 LongStraw(arXiv:2607.14952) 百万 token RL 后训练 同源"样本效率" 范式;3) 与 ReOPD(arXiv:2607.04763) 多轮 On-Policy Distillation with Prefix Replay 互补(ReOPD 是多轮蒸馏的工程化路径,Sample-Efficient 是经验蒸馏的样本效率)= Agent 经验蒸馏双轨:ReOPD 工程化路径 + Sample-Efficient 样本效率。 |
| 反方 / 风险 | (A) paper_card 未建 = pipeline 漏斗节点;(B) "ICL + context distillation" 组合不是新(已有 MemGPT + MemoryBank 路线),需要核"Agent 经验"是否新立标;(C) "环境样本效率" vs LongStraw 百万 token RL 沿用 待核;(D) vs On-Policy Distillation(arXiv:2607.13399) + SEED(arXiv:2607.14777) 边界待核;(E) HF Daily 票数未在 7-24 主榜 15 篇列表 = 主榜候选,具体票数未在 7-24 JSON 体现;(F) 论文细节 PDF 未抓,待补查 |
| 建议归入节 | §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈第 6-7 件候选(Sample-Efficient Learning from Agent Experience 第六 + ReOPD arXiv:2607.04763 第七 · Agent 经验蒸馏双轨范式)+ §6 必读清单 新增 arXiv:2607.21051 第 104 条 + §6 必读清单 新增 arXiv:2607.04763 第 105 条 |
| 重要边界 | 不要与 v25-v28 §2.4 On-Policy Distillation(arXiv:2607.13399) 混为同一件工作:OPD 是蒸馏方法,Sample-Efficient 是样本效率框架 = 方法 vs 框架;不要与 v25-v28 §2.4 SEED(arXiv:2607.14777) 自演进同策略蒸馏混为同一件工作:SEED 是同策略蒸馏,Sample-Efficient 是经验蒸馏 = 不同机制;不要与 v25-v28 §2.4 LongStraw(arXiv:2607.14952) 百万 token RL 后训练混为同一件工作:LongStraw 是 RL 后训练,Sample-Efficient 是经验蒸馏 = RL vs 蒸馏 互补;不要与 PRO-LONG(arXiv:2607.20064v2) 混为同一件工作:PRO-LONG 是上下文管理范式,Sample-Efficient 是经验蒸馏 = 范式 vs 方法 互补;不要与 ReOPD(arXiv:2607.04763) 多轮 On-Policy Distillation 混为同一件工作:ReOPD 是多轮蒸馏,Sample-Efficient 是样本效率 = 多轮 vs 样本效率 互补(同源但不同焦点) |
增量 3 · ⭐⭐⭐⭐ · arXiv:2607.20734 LLMs Get Lost in Evolving User Intent(HF Daily 7-24 11 票 · 2026-07-21 · Tom 7-24 T1440 radar 高价值 + T2040 radar 候选 5 · paper_card 未建)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/tom/2026-07-24T1440-agent-rag-longcontext-radar.md v2 重写版高价值 + inbox/tom/2026-07-24T2040-agent-rag-longcontext-radar.md 候选 5 + inbox/tom/2026-07-24-0900-hf-daily-2026-07-24.md HF Daily 7-24 #11 24▲ 票(7-24 JSON 内 cda2fb756f6f LLMs Get Lost votes:11) + paper_card 未建 |
| arXiv 号 | arXiv:2607.20734 LLMs Get Lost in Evolving User Intent(2026-07-21) |
| 一句话 | LLM 在多轮对话中如何跟踪用户意图演化——LLM 越来越多地作为协作 Agent 通过迭代交互接管用户委派任务,但真正的交互本质上是动态的:用户很少预先规约意图,而是在对话过程中披露、修订、重塑意图;然而 LLM 仍主要在单轮、完全规约设置下评估/训练 = 「LLM 在对话过程中跟踪并作用于演化意图」 的基本问题未解;研究框架 = 把静态单轮任务转化为动态多轮评估框架。 |
| v25-v28 脉络关系 | 与 v25-v28 §2.6 多模态 / IDE / CLI / 工具退化 段(编码 Agent 多轮对话场景)+ v25-v28 §2.3 评测基础设施分层(评测方法学)× v25-v28 §2.5 安全契约 第 9 阶(Manager Coercion AI-to-AI 治理)+ v25-v28 §2.4 Tool-Call Boundary Drift(arXiv:2607.07050)「多教师 OPD 工具调用边界校准」+ v25-v28 §2.6 Hermes-Agent(218K⭐ self-improving) 同源;v34 §2.6 多模态 / IDE / CLI / 工具退化段末 追加「LLMs Get Lost in Evolving User Intent · 多轮意图演化跟踪评测」一行:1) "意图演化跟踪" = 编码 Agent 多轮对话场景的核心挑战 = 与 v25-v28 §2.6 Hermes-Agent(218K⭐)「跨会话记忆 + 持久知识」 + Cursor 「request-level intelligent classifier」 + OpenRouter Prompt Caching + Sticky Routing 同源"多轮 Agent 调用" ;2) "单轮 vs 多轮评估" = 与 v25-v28 §2.3 评测第 7 阶五联(Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph)「多教师 OPD 校准 + AI-to-AI 治理」 同源"多轮评测" 范式;3) "动态多轮评估框架" = 与 v25-v28 §2.3 LoCoBench-Agent(arXiv:2511.13998) 工业级长上下文 SE-Agent 评测 + SpecBench(arXiv:2605.21384) 长视野 reward hacking 量化 + Long-Horizon-Terminal-Bench(arXiv:2607.08964v2) 长程 terminal 评测 同源"长视野 / 多轮 Agent 评测" 范式;4) "用户委派 + 迭代交互" = 与 v25-v28 §2.6 Andrew Ng「Loop Engineering 三循环」 + v25-v28 §2.6 Karpathy December hypothesis 12 月拐点 + v25-v28 §2.6 Simon Willison「Writing code is cheap now」 同源"编码 Agent 多轮交互" 范式;5) "Agent 接管用户任务" = 与 v25-v28 §2.1 OpenAI Codex Agentic Shift(arXiv:2606.26959 7-24 evening briefing 引用)"Agentic AI 活跃用户增长超 5 倍 + 10% 用户每周管理 3+ 并发 Codex Agent + 26.6% 用户使用 Skills" 同源"Agent 接管用户任务" 实证支柱。 |
| 反方 / 风险 | (A) paper_card 未建 = pipeline 漏斗节点;(B) HF Daily 7-24 主榜 15 篇 #11 24▲ 票(7-24 JSON cda2fb756f6f votes:11 = 主榜内主榜冲突,论文元数据票数 24 但 7-24 JSON 标 11 = 来源差异);(C) "意图演化跟踪" 学术分量待核(可能是综述而非新方法);(D) "动态多轮评估框架" 是否开源 + 复现门槛待核;(E) vs v25-v28 §2.3 LoCoBench-Agent 工业级长上下文 SE-Agent 评测 边界待核;(F) 论文细节 PDF 未抓,待补查 |
| 建议归入节 | §2.6 多模态 / IDE / CLI / 工具退化 段末追加「LLMs Get Lost in Evolving User Intent · 多轮意图演化跟踪评测」一行 + §2.3 评测基础设施分层 第 7 阶五联 邻接补全 + §3.1 共识候选(编码 Agent 多轮交互 = 用户意图演化跟踪是核心挑战)+ §3.2 争议新增(意图演化跟踪 vs Hermes-Agent 跨会话记忆 vs Codified Context Hot-Memory Constitution 边界)+ §4 开放问题 新增(编码 Agent 多轮意图演化跟踪在生产部署中的可靠性 + 评测 vs 训练双轨)+ §6 必读清单 新增 arXiv:2607.20734 第 106 条 |
| 重要边界 | 不要与 v25-v28 §2.3 LoCoBench-Agent(arXiv:2511.13998) 工业级长上下文 SE-Agent 评测混为同一件工作:LoCoBench-Agent 是工业级长上下文 SE-Agent 评测,LLMs Get Lost 是动态多轮意图评测 = 不同维度(长上下文 vs 意图演化);不要与 v25-v28 §2.3 Manager Coercion(arXiv:2607.15434) AI-to-AI 治理混为同一件工作:Manager Coercion 是 AI-to-AI 治理,LLMs Get Lost 是用户-LLM 意图跟踪 = AI-to-AI vs 用户-LLM 不同对象;不要与 v25-v28 §2.3 Tool-Call Boundary Drift(arXiv:2607.07050) Soft Clamp 混为同一件工作:Tool-Call Boundary Drift 是工具调用边界,LLMs Get Lost 是意图演化跟踪 = 工具 vs 意图 不同对象;不要与 v25-v28 §2.6 Hermes-Agent(218K⭐ self-improving) 跨会话记忆混为同一件工作:Hermes-Agent 是记忆系统,LLMs Get Lost 是意图跟踪评测 = 记忆 vs 评测 互补;不要与 v25-v28 §2.6 Karpathy December hypothesis 12 月拐点 + Simon Willison「Writing code is cheap now」混为同一件工作:Karpathy/Simon Willison 是宏观判断,LLMs Get Lost 是评测 = 判断 vs 评测 互补 |
增量 4 · ⭐⭐⭐⭐⭐ · arXiv:2607.20064v2 PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning(Alexis Fox · 2026-07-23 v2 · flyp 7-24 15:50 critical-read 主稿精读)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/flyp/2026-07-24-1550-PRO-LONG-Long-Horizon-Context-Management-critical-read.md(flyp E2 棒主稿精读 · 9 段 · 长 horizon agent context management 主线)+ inbox/flyp/2026-07-24-risk-e1prep.md §增量 6「PRO-LONG + Long-Horizon-Terminal-Bench = 长 horizon agent context management 安全视角补充」(flyp risk-e1prep 已建议 §3.1 反方共识候选 + §4 开放问题候选)+ arXiv:2607.20064v2(2026-07-22 v1 / 2026-07-23 v2 / 254→255 KB / GitHub alexisfox7/PRO-LONG 公开) |
| arXiv 号 | arXiv:2607.20064v2 PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning(Alexis Fox,2026-07-23 v2) |
| 一句话 | PRO-LONG 把"长 horizon agent context 怎么管理"这个近 6 个月最有争论的工程问题收敛到一个极简范式:完整结构化日志 + 编码 agent 在历史里搜索——不靠启发式摘要 / 不靠 context edit / 不靠显式 memory write;ARC-AGI-3 +18pp · 4.2-5.8× token 节省 · Fable 5 97.4% best@2 @ $1,750 总成本——结果是"通用编码 agent + 程序化 memory"已与/超过专用 harness。 |
| v25-v28 脉络关系 | 与 v25-v28 §2.4 记忆 / 长视野(MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context)+ v25-v28 §2.4 后训练与训练-评测双闭环(PRO-LONG 是 context management 范式)+ v25-v28 §2.5 安全契约(PRO-LONG「不设 memory = 不存在 memory 攻击面」 = 与 v25-v28 §2.5 第 9 阶 Self-State Attacks「OS 层 self-state 文件残余攻击面在结构上不可区分」 直接衔接)+ v25-v28 §3.1 共识(沿用 v25-v28 共识 #1 「harness 是 first-class abstraction」)+ flyp 7-24 risk-e1prep §3.1 反方共识候选 + flyp 7-24 risk-e1prep §4 开放问题候选;v34 §2.4 候选第 6 件「PRO-LONG」(继 5 件记忆沿用后第 6 件)+ 直接挑战 Agentic Context Management(arXiv:2607.21503)「lifecycle + architecture 双向范式」:1) "完整结构化日志 + 编码 agent 在日志里搜索" = 与 v25-v28 §2.4 AHE(arXiv:2604.25850) experience observability 三层可观测性 + v25-v28 §2.6 Graphify(93K⭐ graph-as-harness)「代码库 → 可查询知识图谱」同源"结构化 + 编码 agent 检索" 范式;2) "不裁剪 / 不摘要 / 不 memory subsystem" = 反方向 v25-v28 §2.4 MemGPT / MemoryBank / Letta / LangMem「显式 memory write 路线」 = 「memory 写在 filesystem」 = 与 v25-v28 §2.5 第 9 阶 Self-State Attacks「OS 层 self-state 文件残余攻击面」 直接衔接 = 「不设 memory = 不存在 memory 攻击面」 范式逆袭 = flyp risk-e1prep §3.1 反方共识候选 #54「PRO-LONG 不设 memory = 不存在 memory 攻击面」;3) "ARC-AGI-3 +18pp · 4.2-5.8× token 节省 · Fable 5 97.4% best@2" = 与 v25-v28 §2.3 LoCoBench-Agent(arXiv:2511.13998) 工业级长上下文 SE-Agent 评测 + SpecBench(arXiv:2605.21384) 长视野 reward hacking 量化 + Long-Horizon-Terminal-Bench(arXiv:2607.08964v2) 长程 terminal 评测 同源"长 horizon agent 主线"立标;4) "GitHub 公开代码 + 日志 + 254→255 KB v2" = 可复现性高 + 跨 frontier 模型一致提升 + 范式极简 = 2026-Q3 长 horizon agent context management 路线分歧标志性论文;5) "通用编码 agent + 程序化 memory = 已与/超过专用 harness" = 与 v25-v28 §2.1 Harness Survey(arXiv:2606.20683) Agent 工程四大范式演进(Prompt → Context → Harness → Agent-Native Training) 沿用「Harness 边界模糊化」 范式 = SWE-Pruner Pro(arXiv:2607.18213)「harness 内化为 model 子模块」证据 vs PRO-LONG「通用 agent + 程序化 memory 已与/超过专用 harness」证据 = 双向印证 Harness 与 model 边界模糊化。 |
| 反方 / 风险 | (A) ARC-AGI-3 单一基准 + 论文相对新(v2 仅 1 天)+ 尚未被第三方独立复现;(B) "Fable 5 97.4% best@2" 暗示结果高度依赖编码能力强的 frontier 模型,中等模型或非编码专长模型上效果可能衰减,论文未给弱模型子表;(C) "全量保留" 在数小时级 rollout 下日志可能到 GB 级,论文未给日志大小 vs rollout 时长 vs 日志检索延迟的实测数据;(D) "$1,750 是在 Fable 5 上的 best@2 总成本(含失败重试)",未给 pass@1 单次成本、未给 token $/task 分布;(E) "vs 现有 harness" head-to-head 表 论文 v2 应给出但未给;(F) "可复现性" = GitHub 公开代码 + 日志 是关键加分项;缺任务定义 + prompt 细节则拉低;(G) v2 改动披露 仅 +1 KB 与 v1 间隔 29 小时 = 大概率是修正/补充,需对比 v1 找出关键改动;(H) flyp 7-24 15:50 critical-read 已详尽批判:1) 评估基准单一 → ARC-AGI-3 网格类逻辑谜题偏向,能否迁移到 web / 软件工程 / 真实零售决策未证 中-高;2) 模型依赖 → 论文未给弱模型子表 中;3) 日志膨胀 → 未给出日志大小 vs rollout 时长、日志检索延迟的实测数据 中;4) API 成本外推 → 未给 pass@1 单次成本、未给 token $/task 分布 低-中;5) vs 现有 harness → 待补查;6) 可复现性 → GitHub 公开代码 + 日志 是关键加分项;缺任务定义 + prompt 细节则拉低;7) v2 改动披露 → 待补查 |
| 建议归入节 | §2.4 记忆 / 长视野 第 6 件候选(PRO-LONG 第六 · 完整结构化日志 + 编码 agent 在日志里检索 · ARC-AGI-3 +18pp / 4.2-5.8× token 节省 / Fable 5 97.4% best@2 @ $1,750)+ §2.1 Harness 学术化 沿用升级(Harness 与 model 边界模糊化 + 通用 agent + 程序化 memory 已与/超过专用 harness = SWE-Pruner Pro 内化证据 vs PRO-LONG 通用证据 = 双向印证)+ §3.1 共识候选 #54「PRO-LONG 不设 memory = 不存在 memory 攻击面」(flyp risk-e1prep §3.1 已建议)+ §4 开放问题新增「PRO-LONG vs Agentic Context Management 三路线对立 + PRO-LONG 在 SWE-bench Verified / HumanEval 长 horizon 版上的迁移 + baseline coding agent 具体是哪一个 + 日志膨胀 + 跨弱模型迁移 + 跨非 ARC-AGI-3 基准迁移」 + §5 趋势新增「Harness 学术化第七足 = Agent context management 三路线对立(PRO-LONG 完整日志 + Agentic Context Management 生命周期 + AHE 三层可观测性)」 + §6 必读清单 新增 arXiv:2607.20064v2 第 107 条 |
| 重要边界 | 不要与 Agentic Context Management(arXiv:2607.21503) 混为同一件工作:PRO-LONG = 不裁剪 / 不摘要 / 不 memory subsystem,Agentic Context Management = lifecycle + architecture 双向范式 = 范式对立(v34 §2.4 段末建议升格为「三路线对立」而非「五件同框」);不要与 v25-v28 §2.4 Codified Context(arXiv:2602.20478) 混为同一件工作:Codified Context 是工程实证 108K C# + 283 session + Hot-Memory Constitution + 19 领域 Agent + Cold-Memory KB 三件套,PRO-LONG 是程序化 memory 范式 = 实证 vs 范式 互补;不要与 v25-v28 §2.4 MemGPT / MemoryBank / Letta / LangMem 显式 memory write 路线混为同一件工作:MemGPT 等是显式 memory subsystem,PRO-LONG 是「不要 memory subsystem」 = 反方向 范式逆袭;不要与 v25-v28 §2.4 AHE(arXiv:2604.25850) experience observability 混为同一件工作:AHE 是 harness 可观测性 实证,PRO-LONG 是 context management 范式 = 不同层;不要与 v25-v28 §2.1 SWE-Pruner Pro(arXiv:2607.18213) harness 内化混为同一件工作:SWE-Pruner Pro 是 harness 内化为 model 子模块,PRO-LONG 是通用 agent + 程序化 memory 已与/超过专用 harness = 内化 vs 通用化 双向印证;不要与 v25-v28 §2.5 第 9 阶 Self-State Attacks(arXiv:2607.17986) 混为同一件工作:Self-State 是攻击面分析,PRO-LONG 是「不设 memory = 不存在 memory 攻击面」 = 攻 vs 防 互补 |
增量 5 · ⭐⭐⭐⭐ · arXiv:2607.19747 Beyond Relevance-Centric Retrieval: Rubric-Grounded Document Set Selection and Ranking(HF Daily 7-24 #11 24▲ 票 · 2026-07-22 · Tom 7-24 0841 radar 旁证 · paper_card 未建)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/tom/2026-07-24-0900-hf-daily-2026-07-24.md HF Daily 7-24 #11 24▲ 票 + inbox/tom/2026-07-24T1440-agent-rag-longcontext-radar.md v2 重写版 + inbox/tom/2026-07-24-0852-rag-e1prep.md §增量 1(已建议归 rag.md §2.6 垂直领域 RAG 应用)+ inbox/tom/2026-07-24-agent-rag-longcontext-radar.md 早期候选 + paper_card 未建 |
| arXiv 号 | arXiv:2607.19747 Beyond Relevance-Centric Retrieval: Rubric-Grounded Document Set Selection and Ranking(2026-07-22) |
| 一句话 | 面向评分标准的文档集选择与排序——摆脱"以相关性为中心"的传统 IR 排序范式,转向"以评分标准(rubric)为中心"——文档集是否包含评分所需关键证据决定排序,而非相似度;核心定位 = RAG 检索优化新维度(评分标准驱动)= 第 4 路径(vs v25-v28 §2.3 AutoIndex(arXiv:2607.18603)「程序空间」 + v22 A-RAG「分层接口」 + v25 EvoGraph-R1「图结构」+ 经典「relevance-centric」) |
| v25-v28 脉络关系 | 与 v25-v28 §2.3 评测工具调用与 Agentic RAG 56 节点(AutoIndex 程序空间路线)+ v22 A-RAG 分层接口 + v25 EvoGraph-R1 图结构 + v25-v28 §2.6 EduPanel(arXiv:2607.18529) 三 Agent 教学视频评判框架「rubric-grounded」评测 同源;v34 §2.3 邻接补全 RAG 检索优化第 4 路径(rubric-driven):1) "评分标准驱动" = 与 v25-v28 §2.6 EduPanel(arXiv:2607.18529)「rubric-grounded」评测同源 = EduPanel 是评分标准驱动的评测,本文是评分标准驱动的检索 = 评测侧与检索侧都向"评分标准驱动" 范式收敛;2) "Beyond Relevance-Centric" = 对经典 IR 范式的根本反思 = 与 v25 横切 79「Keyword Search Is All You Need」AAAI 2026 Workshop + RAG 去向量 DB 路径 + v25-v28 §2.3 Page Index 无向量 RAG(7-24 evening briefing §2 引用)+ v25-v28 §2.3 GraphRAG 同源(去 relevance-centric 范式);3) "Document Set Selection" = 不只单文档排序,而是文档集整体 = 与 v25-v28 §2.4 LangGraph(arXiv:2607.19297)「agentic RAG + 证据门控」沿用(证据整体而非单证据);**4) "RAG 检索优化第 4 路径并行" = 与 v25-v28 §2.3 AutoIndex(arXiv:2607.18603)「索引层程序学习」 + v22 A-RAG「接口分层」 + v25 EvoGraph-R1「图结构」 互补为"检索优化 4 路径并行"(接口 / 图 / 程序 / 评分标准)" |
| 反方 / 风险 | (A) paper_card 未建 = pipeline 漏斗节点;(B) HF Daily 7-24 #11 24▲ 票 中热度,工业代表性中等;(C) "评分标准驱动" 学术分量待核(可能是 IR 综述而非新方法);(D) vs v25-v28 §2.3 AutoIndex 56 节点 + v22 A-RAG + v25 EvoGraph-R1 + 经典 relevance-centric 4 路径的差异待核;(E) 论文细节 PDF 未抓,待补查;(F) "rubric-driven" 是否适用编码 Agent RAG 场景(代码库检索)待核 |
| 建议归入节 | §2.3 评测工具调用与 Agentic RAG 56 节点 邻接补全 RAG 检索优化第 4 路径(Beyond Relevance-Centric 第四路径 · 评分标准驱动)+ §2.6 EduPanel(arXiv:2607.18529) rubric-grounded 评测 与 Beyond Relevance-Centric rubric-grounded 检索 双线同源 + §3.1 共识候选(评测侧与检索侧都向"评分标准驱动" 范式收敛)+ §6 必读清单 新增 arXiv:2607.19747 第 108 条 |
| 重要边界 | 不要与 v25-v28 §2.3 AutoIndex(arXiv:2607.18603)「索引层程序学习」混为同一件工作:AutoIndex 是索引层,Beyond Relevance-Centric 是检索层 = 不同层;不要与 v22 A-RAG「分层接口」混为同一件工作:A-RAG 是接口分层,Beyond Relevance-Centric 是评分标准驱动 = 不同维度;不要与 v25 EvoGraph-R1「图结构」混为同一件工作:EvoGraph-R1 是图结构,Beyond Relevance-Centric 是评分标准驱动 = 图 vs 评分标准 互补;不要与 v25-v28 §2.6 EduPanel(arXiv:2607.18529) rubric-grounded 评测 混为同一件工作:EduPanel 是教学视频评测,Beyond Relevance-Centric 是文档检索 = 评测 vs 检索 互补;不要与 v25-v28 §2.3 LoCoBench-Agent(arXiv:2511.13998) 工业级长上下文 SE-Agent 评测混为同一件工作:LoCoBench-Agent 是长上下文 SE-Agent 评测,Beyond Relevance-Centric 是 RAG 检索 = SE-Agent vs RAG 不同对象 |
增量 6 · ⭐⭐⭐⭐ · arXiv:2607.15550 SeerGuard: A World-Model-Based Safety Framework for Mobile GUI Agents(HF Daily 7-24 #12 24▲ 票 · 2026-07-22 · Tom 7-24 雷达承接 · paper_card 未建)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/tom/2026-07-24-0900-hf-daily-2026-07-24.md HF Daily 7-24 #12 24▲ 票 + inbox/tom/2026-07-24T1440-agent-rag-longcontext-radar.md v2 重写版 + inbox/spark/2026-07-24-agent-e1prep.md §增量 2(已建议升 v29/v30 §2.6 第 38 子节候选「World-Model-Based GUI Agent 安全」)+ paper_card 未建 |
| arXiv 号 | arXiv:2607.15550 SeerGuard: A World-Model-Based Safety Framework for Mobile GUI Agents(2026-07-22) |
| 一句话 | 基于世界模型预测的移动 GUI Agent 安全框架——在 GUI Agent 每次执行动作前,通过 world model 预测该动作的"安全后果" = 危险点击 / 数据泄露 / 未授权操作 = 提供可执行前的"安全预演";核心定位 = GUI Agent 时代的"事前安全门控"。 |
| v25-v28 脉络关系 | 与 v25-v28 §2.5 安全契约第 9 阶(Self-State Attacks arXiv:2607.17986 Schmidhuber 参与 OS 层结构性极限)+ v25-v28 §1.45 五向合流(OpenAI × HF + Gemini 3.5 Flash Cyber)+ v25-v28 §1.32b 横切 52b Manager Coercion(arXiv:2607.15434) AI-to-AI 治理 + v25-v28 §1.34b Anthropic J-space(arXiv:2607.15495) 认知科学锚点 + v25 GLM 5.2 defender-asymmetry 闭环 同源;v34 §2.5 候选第 10 阶「World-Model-Based GUI Agent 安全」:1) "世界模型预测" = 把 v26 横切 WAM(World-Action Model 知行鸿沟,BadWAM)从"知行鸿沟"维度扩展到"安全预测"维度 = WAM 从"具身 Agent 能力评估"扩展到"GUI Agent 安全预演";2) "事前安全门控" = 与 v25-v28 §2.5 第 9 阶 Self-State Attacks 攻击面分析反向(Self-State 是事后分析,SeerGuard 是事前预演)= 攻 vs 防 互补;3) "GUI Agent" = 桌面/移动 GUI Agent(7-22 Anthropic Claude Computer Use + 7-24 大量 Computer Use 类应用沿用 + 7-24 office-cli + jay 7-24 0938 trending + Stephen 7-24 0910 X-vip-radar)的专门安全框架 = GUI Agent 时代的"安全基建";4) "World Model 预测" = 与 v25-v28 §1.34b Anthropic J-space(arXiv:2607.15495)「词语化表征 = 共享全局工作空间」 + flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」同源"世界建模" 范式 = frontier lab 主动用世界建模形式化 Agent 安全的范式延伸;5) 与 v25-v28 §1.45 Gemini 3.5 Flash Cyber 沿用 = Cyber 专用 vertical LLM 安全 vs GUI Agent 安全 = vertical LLM 安全方向扩展(Gemini Cyber = 网络安全 vs SeerGuard = GUI Agent 安全) |
| 反方 / 风险 | (A) paper_card 未建 = pipeline 漏斗节点;(B) HF Daily 7-24 #12 24▲ 票 中热度,工业代表性中等;(C) "世界模型预测" 学术分量待核(可能依赖预训练 VLM 而非独立 world model);(D) "GUI Agent" 应用范围 vs Computer Use / Anthropic 7-22 多模态栈 / OpenAI Operator / Apple Intelligence 边界待核;(E) "事前预演" 延迟开销是否影响 Agent 实时性待核;(F) vs v25 GLM 5.2 defender-asymmetry 闭环的差异(后者是"防御方必须提前准备开源取证模型",SeerGuard 是"用 world model 预测");(G) 论文细节 PDF 未抓,待补查 |
| 建议归入节 | §2.5 安全契约 候选第 10 阶「World-Model-Based GUI Agent 安全」(SeerGuard 第十 · 世界模型预测的 GUI Agent 安全框架 · 事前安全预演)+ §1.45 AI 安全 + 政府监管五向合流 邻接补全(GUI Agent 时代的"安全预演"立标,与 vertical LLM 安全 + 工业级合作合流)+ §1.32b 横切 52b Multi-Agent + AI-to-AI 治理 旁证补全(GUI Agent 攻击面补全)+ §1.34b Anthropic J-space + flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」 同源(frontier lab 主动用世界建模形式化 Agent 安全的范式延伸)+ §3.1 共识候选(vertical LLM 安全方向扩展 = 网络安全 + GUI Agent 安全 双轨)+ §6 必读清单 新增 arXiv:2607.15550 第 109 条 |
| 重要边界 | 不要与 v25-v28 §2.5 第 9 阶 Self-State Attacks(arXiv:2607.17986) 混为同一件工作:Self-State Attacks 是 OS 层攻击面分析,SeerGuard 是 GUI Agent 事前安全预演 = 不同攻击面 + 不同时机(事后 vs 事前);不要与 v25 GLM 5.2 defender-asymmetry 闭环 混为同一件工作:GLM 5.2 是"防御方提前准备开源取证模型",SeerGuard 是"用 world model 预测" = 不同防御策略;不要与 v26 横切 WAM 知行鸿沟 混为同一件工作:WAM 是具身 Agent 能力评估,SeerGuard 是 GUI Agent 安全 = 不同应用;不要与 v25-v28 §1.45 Gemini 3.5 Flash Cyber 混为同一件工作:Gemini Cyber 是 vertical LLM 网络安全,SeerGuard 是 GUI Agent 安全 = 不同 vertical LLM 方向;不要与 v25-v28 §1.34b Anthropic J-space(arXiv:2607.15495) 混为同一件工作:J-space 是认知科学锚点,SeerGuard 是 GUI Agent 安全 = 认知科学 vs 安全 不同维度;不要与 flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」 混为同一件工作:Cameron Wolfe 是 Substack 综述博文,SeerGuard 是 arXiv 论文 = 综述 vs 论文 互补 |
增量 7(沿用升级)· ⭐⭐⭐⭐ · arXiv:2607.18754 AgentDebugX + arXiv:2607.16617 DataFlow-Harness HF Daily 7-24 票数上升沿用升级(HF Daily 7-24 #13 21▲ 票 + #2 123▲ 票)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/tom/2026-07-24-0900-hf-daily-2026-07-24.md HF Daily 7-24 #13 AgentDebugX 21▲ 票(7-23 11→7-24 21 = +10 票)+ #2 DataFlow-Harness 123▲ 票(7-23 120→7-24 123 = +3 票)+ inbox/spark/2026-07-24-agent-e1prep.md §增量 1(AgentDebugX 升 v29/v30 §2.6 第 37 子节候选)+ Tom 7-24 T1440 v2 重写版「v3 强制转日承接承诺 DataFlow-Harness」 |
| arXiv 号 | arXiv:2607.18754 AgentDebugX(v25-v28 §2.5 第 9 阶沿用升级) + arXiv:2607.16617 DataFlow-Harness(v25-v28 §2.1 第九阶段 Harness-as-Agent 第七件 沿用升级) |
| 要点 | AgentDebugX HF Daily 7-24 #13 21▲ 票 沿用升级——7-23 11 票 → 7-24 21 票 = +10 票 = 工业代表性上升;v25-v28 §2.5 第 9 阶沿用升级——spark 7-24 agent-e1prep 已建议升 v29/v30 §2.6 第 37 子节候选「Agent 故障可观测性 + 归因 + 恢复立标」,与 v25-v28 §2.5 已沿用升级(HACO 99.2% SLO + AgentDebugX 3 适用场景)形成「v25-v28 §2.5 第 9 阶沿用 + spark 7-24 §2.6 第 37 子节候选」双向印证;DataFlow-Harness HF Daily 7-24 #2 123▲ 票 沿用升级——7-23 120 票 → 7-24 123 票 = +3 票 = 持续高位 + Tom 7-24 T1440 v2 重写版「v3 强制转日承接承诺」 = v25-v28 §2.1 第九阶段 Harness-as-Agent 第七件 沿用升级(v25-v28 已立「数据层 + 业务流程层 + 模型层 Agent-as-Optimizer 三层扩展」) |
| v25-v28 脉络关系 | AgentDebugX = v25-v28 §2.5 第 9 阶 + spark 7-24 agent-e1prep §增量 1 + jay 7-23 1335 jay-ai-infra-systems-deep-dive §七 + Tom 7-23 0840 radar v2 + paper_cards/526-2607-18754.md(主分类 agent 形态 method 7-23 02:10 建卡);DataFlow-Harness = v25-v28 §2.1 第九阶段 Harness-as-Agent 第七件 + spark 7-23 agent-e1prep §增量 2 + spark 7-24 agent-e1prep §增量 2(沿用)+ stephen 7-23 2245 coordination-check-evening §1.2 + paper_cards 未建(沿用待补) |
| 建议归入节 | §2.5 第 9 阶 沿用升级(AgentDebugX HF Daily 7-24 票数上升 + spark 7-24 §2.6 第 37 子节候选)+ §2.1 第九阶段 Harness-as-Agent 第七件 沿用升级(DataFlow-Harness HF Daily 7-24 #2 持续高位) |
| 重要边界 | 不要在本场立标为新 P0 增量:AgentDebugX + DataFlow-Harness 在 v25-v28 Wave4 E1 第六轮已饱和(7-24 04:20 固化)+ 7-23 e1prep 已立标为 P0;本场仅作"沿用升级 + HF Daily 票数证据更新" 处理 |
增量 8(旁证)· ⭐⭐⭐ · jay 7-24 1052 engineering-filter Agent Harness 主线 5 件旁证 + AgentCI MCP 安全立标(jay 7-24 1052 + jay 7-24 1105 noon-kv-rag-db + jay 7-24 0938 ai-engineering-trending + stephen 7-24 1245 协调棒 §2.6 印证)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/jay/2026-07-24-1052-engineering-filter.md Agent Harness 主线 5 件 + inbox/jay/2026-07-24-1105-noon-kv-rag-db-substack.md §5 SafeKV + PrefixWall KV Cache Side-Channel + inbox/jay/2026-07-24-0938-ai-engineering-trending.md #6 HF 7-16 完整披露 + #7 OWASP Top 10 AI/Agent 2026 + inbox/stephen/2026-07-24-1245-stephen-coordination-check-noon.md §2.6 印证 + inbox/spark/2026-07-24-agent-e1prep.md §增量 9 邻接(AgentCI MCP 安全 立 v29/v30 §2.6 第 40 子节候选) |
| arXiv 号 + 一句话 | AI Workflow Store arXiv:2605.10907——首个系统阐述 agent "工程化 robustness" 缺位 · 6 类 SE 过程(需求/设计/实现/测试/对抗评估/分阶段部署)+ 真实故障案例(删除收件箱 / 抹除代码库 / GitHub 提示注入);Context Engineering arXiv:2603.09619——四学科金字塔(PE → CE → IE → SE)· 五维质量标准(relevance/sufficiency/isolation/economy/provenance);AgentCI(2026-03-28)——MCP 安全生态竞品表(Invariant MCP-Scan + Snyk Agent-Scan + Cisco MCP Scanner + Obot MCP Gateway)+ 43% MCP 实现命令注入 + MCP Inspector CVE-2025-49596 RCE + 9700 万次 MCP SDK 月下载;GitHub Agentic Workflows 安全架构 6 层 + Block Goose(Linux Foundation 2026-04)——Isolated agent container + Firewall + MCP Gateway + API Proxy + Staged safe outputs + Zero-secret execution;Aishwarya Srinivasan RAG 2026(Substack)——Context-Aware Partitioning + Hybrid Search RRF + Cross-Encoder Re-Ranking + Naive RAG 2026 危机 |
| v25-v28 脉络关系 | 与 v25-v28 §1.33c 横切 53c AI Agents Stack 2026 6 层 + v25-v28 §2.6 Anthropic Claude Code settings.json + IBM Routing 三大工程陷阱 + v27 横切 83 Lilian Weng Harness Engineering for Self-Improvement + v25-v28 §2.5 MCP Tool Poisoning(James Phoenix)+ v25-v28 §2.5 第 9 阶 Self-State Attacks + v25-v28 §2.5 MCP 生态 67,057 服务器(arXiv:2510.16558 MCPInspect)+ v25-v28 §2.5 AOHP(arXiv:2606.23449) OS-level + v25-v28 §2.5 privilege-aware agent(arXiv:2606.20023) + v25-v28 §2.5 工具不可靠评测(arXiv:2606.29985) 同源;v34 §2.6 多模态 / IDE / CLI / 工具退化 段末追加「Agent Harness 工业化安全 + MCP 安全 + Agent Debugging 立标」一段:1) AI Workflow Store = 工程化 robustness 立标 = 与 v25-v28 §2.6 Hermes-Agent 218K⭐ self-improving + Self-Harness autonomous + AHE experience observability 同源"Agent 工程化栈"扩展;2) Context Engineering 四学科金字塔 = 跨学科方法学 = 与 v25-v28 §2.1 综述/方法学骨架 同源;3) AgentCI = MCP 安全工业级立标 = v34 §2.5 安全契约 第 9 阶沿用升级补全(MCP 命令注入 43% + CVE-2025-49596 RCE + 9700 万次 SDK 下载 = 工业级 MCP 安全风险立标);4) GitHub Agentic Workflows 6 层 + Block Goose = 工业级 Harness 安全架构 = v25-v28 §2.6 14 件 沿用补全;5) Aishwarya RAG 2026 = RAG 范式反思 = 与 v34 增量 5 Beyond Relevance-Centric(rubric-driven)同源"RAG 去向量 DB 路径"反思 |
| 反方 / 风险 | (A) "43% MCP 实现命令注入" 统计样本 + 时间窗口待核;(B) "MCP Inspector CVE-2025-49596 RCE" 是 2025 年 CVE,7-24 沿用 = 持续未修补 1 年;(C) "9700 万次 MCP SDK 月下载" vs 实际安装量 比例待核;(D) "AI Workflow Store 真实故障案例" 原文链接待核;(E) "GitHub Agentic Workflows 6 层" 是否开源 + 复现门槛待核;(F) "Block Goose Linux Foundation 2026-04" 项目主页链接待核 |
| 建议归入节 | §2.6 CLI / IDE / 多模态 harness 段末追加「Agent Harness 工业化安全 + MCP 安全 + Agent Debugging 立标」一段 + §2.5 安全契约 第 9 阶沿用升级补全(MCP 命令注入 43% + CVE-2025-49596 RCE + 9700 万次 SDK 下载 = 工业级 MCP 安全风险立标)+ §1.33c AI Agents Stack 2026 6 层 邻接补全(GitHub Agentic Workflows 6 层 + Block Goose = 工业级 Harness 安全架构补全)+ §2.1 综述/方法学骨架 邻接补全(Context Engineering 四学科金字塔方法学) |
| 重要边界 | 不要与 v25-v28 §2.5 第 9 阶 Self-State Attacks(arXiv:2607.17986) 混为同一件工作:Self-State 是 OS 层攻击面分析,AgentCI 是 MCP 应用层安全 = 不同层;不要与 v25-v28 §1.45 Gemini 3.5 Flash Cyber 混为同一件工作:Gemini Cyber 是 vertical LLM 网络安全,AgentCI 是 MCP 应用安全 = 不同 vertical LLM 方向;不要与 v27 横切 83 Lilian Weng Harness 闭环 混为同一件工作:Lilian Weng Harness 是 Agent 测试评估,GitHub Agentic Workflows 是生产安全执行 = 评测 vs 生产 互补 |
增量 9(旁证)· ⭐⭐⭐ · spark 7-24 1002 gradient-flow 5 篇与 7-23 完全相同 = 主线 A 连续第 7 天缺失(Q103 阈值"连续 ≥ 7 天 = 极端消失判定"新阶段 + 主线 K 第 3 次巩固 + 主线 H 第 9 次巩固 + 主线 J 第 4 次巩固)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/spark/2026-07-24-1002-rss-gradient-flow.md v1 5 行裸稿(与 7-23 1002 完全相同,无 v2 反思同步覆盖) |
| 一句话 | 主线 A「数据-合规-版权」连续第 7 天(7-18 + 7-19 + 7-20 + 7-21 + 7-22 + 7-23 + 7-24)从 Gradient Flow feed 5 行窗口缺失 — 7-24 Gradient Flow 5 篇 = ① 三个新模型,一个关于 AI 支出走向的信号(7-23 沿用)+ ② 「开源模型将吸纳大部分 AI 支出」(7-23 沿用 主线 K 第 3 次巩固)+ ③ 「我们得谈谈 AI 支出究竟流向了哪里」(7-22 沿用 主线 K 第 4 次巩固)+ ④ 「我们对中国 AI 出口管制究竟了解多少」(7-22 沿用 主线 J 第 4 次巩固)+ ⑤ 「初创公司让我看清 AI 基础设施的下一层」(7-22 沿用 主线 H 第 9 次巩固) = 无主线 A「数据-合规-版权」论据 |
| v25-v28 脉络关系 | 与 v25-v28 §2.2 Kimi K3 7-27 开权前夜生态补漏 7 件 + v25-v28 §1.34b Gradient Flow 主线 L/K/H/J/A 5 主线 + v25-v28 §3.3 Q103 持续监测 同源;v34 §2.2 沿用升级 + §3.3 持续监测:1) 7-24 Gradient Flow = 7-23 5 篇完全相同(无新增) = 主线 K 7-22 首次 + 7-23 第 2 次 + 7-24 第 3 次 = 主线 K 连续 3 天出现 = 主线 K 重复出现已确认为稳定主线;2) 主线 J 7-24 第 4 次巩固 = 沿用 v25-v28 §1.34b 主线 J 第 3 次巩固 升级到第 4 次 = 中国 AI 出口管制 持续讨论;3) 主线 H 7-24 第 9 次巩固 = 沿用 v25-v28 §1.34b 主线 H 第 8 次巩固 升级到第 9 次 = RL 基建下一层 持续讨论;4) Q103 阈值从"持久消失判定(6 天)"升级到"极端消失判定(7 天)" = 沿用 spark 反思机制对"主线 A 连续缺失天数 → 倾向于可能 1 的概率"量化表(6 天 = 0.85~0.95 / 5 天 = 0.7~0.85 / 4 天 = 0.6~0.7 / 3 天 = 不可量化 / 2 天 = 不可区分 / 1 天 = 偶然波动)+ 7 天 = 0.9~0.97? |
| 反方 / 风险 | (A) spark 7-24 仅 5 行裸稿无 v2 反思同步覆盖,本场观察仍是观察而非结论;(B) "主线 A 极端消失判定" 是 spark 反思机制提议,Q103 阈值是否扩展为"连续 ≥ 7 天 = 极端消失判定" 待 v34 决断;(C) 7-24 Gradient Flow 5 篇与 7-23 完全相同(无新增 arXiv、无新增话题) = 信息流"无新增量"信号本身是观察 = "Gradient Flow 主题密度异常第 2 例"(v25-v28 §1.34b 主题密度异常第 1 例是主线 K 改写重发) |
| 建议归入节 | §2.2 Kimi K3 7-27 开权前夜生态补漏 沿用升级(主线 K 第 3 次巩固 + 主线 H 第 9 次巩固 + 主线 J 第 4 次巩固)+ §3.3 开放问题 Q103 持续监测(连续 7 天 = Q103 阈值"极端消失判定"新阶段,概率量化待 v34 决断)+ §1.34b v25-v28 升格辅助(主线 K 第 3 次出现 = 重复出现 = 是否构成"稳定主线"待决断;主线 H 第 9 次巩固;主线 J 第 4 次巩固) |
| 重要边界 | 主线 A 监控机制 vs 主线 A 论据强度:监控 = 出现频率;论据强度 = 论据本身质量;v25-v28 监控 = 出现频率层,论据强度层不在本简报范围;Q103 阈值从"持久消失判定(6 天)"升级到"极端消失判定(7 天)" ≠ 主线 A 论据强度判定:Q103 只判定"主线 A 论据强度是否依赖 feed 反复出现",不判定"主线 A 是否重要";不要与 v25-v28 §3.3 Q103 7-22 完全升级混淆:7-22 = 连续 5 天 = 完全触发,7-23 = 连续 6 天 = 持久消失判定,7-24 = 连续 7 天 = 极端消失判定(新阶段);不要与 v25-v28 §1.34b "主线 K 首次出现窗口"混淆:7-22 = 首次出现,7-23 = 第 2 次出现 = 重复出现,7-24 = 第 3 次出现 = 稳定?** |
增量 10(邻接)· ⭐⭐ · arXiv:2607.19238 FinanceComplexQA + arXiv:2607.04763 ReOPD(Tom 7-24 T2040 radar 高价值 2 条 · paper_card 未建)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/tom/2026-07-24T2040-agent-rag-longcontext-radar.md 高价值 1 + 2 + inbox/tom/2026-07-24T1440-agent-rag-longcontext-radar.md v2 重写版 + paper_card 未建 |
| arXiv 号 + 一句话 | arXiv:2607.19238 FinanceComplexQA: Agentic Reasoning on Industrial-grade Financial Documents(2026-07-20 · HF Daily 3 票)——提出 Finance-LaTeX Skill 合成复杂财务文档,结合 Agent 工作流生成 2,000 份专业财务文档及 6,000 条高质量问答对,用于评估 Agent 在真实金融场景下的推理能力;核心定位 = 金融场景的 Agentic Reasoning 基准 + arXiv:2607.04763 Multi-Turn On-Policy Distillation with Prefix Replay(ReOPD)(2026-07-15 · HF Daily 1 票)——Replayed-Prefix On-Policy Distillation,解决 Agent 多轮交互历史无法高效蒸馏到模型权重的难题,无需新环境交互,用预收集教师轨迹作回放前缀,为学生提供每步监督信号。 |
| v25-v28 脉络关系 | 与 v25-v28 §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈(On-Policy Distillation arXiv:2607.13399 + SEED arXiv:2607.14777 + Function-Aware FIM arXiv:2607.12463 + Sample-Efficient Learning from Agent Experience 增量 2) + v25-v28 §2.3 评测基础设施(FinMMEval 2026 Task 2 邻接 + T²-RAGBench EACL 2026 23,088 金融 QA + MKG-RAG-Bench 多模态知识图谱 + MRAG-Bench 医疗 RAG 14,816 样本) + v25-v28 §2.6 RF-Agent(arXiv:2607.18772 QTSA pipeline 转化 7 本 RF 教材为 11,000 样本推理数据集)同源;v34 §2.4 + §2.3 + §2.6 邻接:1) FinanceComplexQA = 金融 Agentic Reasoning 基准 = 与 v25-v28 §2.6 RF-Agent(arXiv:2607.18772)「QTSA pipeline 转化 7 本 RF 教材为 11,000 样本推理数据集」同源"垂直域 long doc Agentic Reasoning 基准" + 与 v25-v28 §2.3 FinMMEval 2026 Task 2(arXiv:2607.19867 增量 6 沿用)「多语言金融短答 QA」同源"金融 RAG 评测集" = 金融 RAG + Agentic Reasoning 双轨立标;2) ReOPD = 多轮 Agent On-Policy Distillation with Prefix Replay = 与 v34 增量 2 Sample-Efficient Learning from Agent Experience(arXiv:2607.21051)「Agent 经验蒸馏 + 环境样本效率」同源"Agent 经验向权重蒸馏" 范式 = Agent 经验蒸馏双轨:ReOPD 工程化路径(多轮 + Prefix Replay)+ Sample-Efficient 样本效率(经验蒸馏 + ICL)。 |
| 反方 / 风险 | (A) paper_card 未建 = pipeline 漏斗节点;(B) FinanceComplexQA HF Daily 3 票 / ReOPD HF Daily 1 票 热度较低;(C) FinanceComplexQA 2,000 份 + 6,000 条 QA 规模较小,代表性待核;(D) ReOPD 1 票热度极低,工业代表性中等;(E) 论文细节 PDF 未抓,待补查 |
| 建议归入节 | §2.3 + §2.4 + §2.6 邻接补全(FinanceComplexQA = 金融 Agentic Reasoning 基准 + ReOPD = 多轮 Agent On-Policy Distillation)+ §6 必读清单 新增 arXiv:2607.19238 第 110 条 + arXiv:2607.04763 第 111 条 |
| 重要边界 | 不要与 v25-v28 §2.3 FinMMEval 2026 Task 2(arXiv:2607.19867) 混为同一件工作:FinMMEval 是多语言金融短答 QA,FinanceComplexQA 是工业级金融 Agentic Reasoning = 不同形态;不要与 v25-v28 §2.6 RF-Agent(arXiv:2607.18772) 混为同一件工作:RF-Agent 是 RFIC 芯片设计垂直域多 Agent,FinanceComplexQA 是金融垂直域 Agentic Reasoning = 不同垂直域;不要与 v25-v28 §2.4 On-Policy Distillation(arXiv:2607.13399) 混为同一件工作:OPD 是蒸馏方法,ReOPD 是多轮蒸馏的工程化路径 = 方法 vs 路径 互补;不要与 v34 增量 2 Sample-Efficient Learning from Agent Experience 混为同一件工作:Sample-Efficient 是样本效率框架,ReOPD 是多轮蒸馏的工程化路径 = 框架 vs 路径 互补(同源但不同焦点) |
2. 与 v25-v28 活文档已有节点映射(给今晚活文档接手时)
| v25-v28 节点 | 7-24 新增引用 | v34 沿用候选判断 |
|---|---|---|
| §2.1 Harness 学术化 9 阶段 | AgentDebugX(arXiv:2607.18754)沿用升级 + DataFlow-Harness(arXiv:2607.16617)沿用升级 + PRO-LONG(arXiv:2607.20064v2)增量 4 | 🟢 v34 §2.1 沿用升级 + 第九阶段 Harness-as-Agent 第七件 = DataFlow-Harness 票数持续高位 |
| §2.3 评测基础设施分层 20 行 | Beyond Relevance-Centric(arXiv:2607.19747)增量 5 | 🟢 v34 §2.3 邻接补全 RAG 检索优化第 4 路径(rubric-driven) |
| §2.4 记忆 / 长视野(MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context) | Agentic Context Management(arXiv:2607.21503)增量 1 + PRO-LONG(arXiv:2607.20064v2)增量 4 + Sample-Efficient Learning from Agent Experience(arXiv:2607.21051)增量 2 + ReOPD(arXiv:2607.04763)增量 10 | 🟡 v34 §2.4 候选第 6-7 件「Agentic Context Management + PRO-LONG」 + 「三路线对立」(PRO-LONG 完整日志 + Agentic Context Management 生命周期 + AHE 三层可观测性) |
| §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈 | Sample-Efficient Learning from Agent Experience(arXiv:2607.21051)增量 2 + ReOPD(arXiv:2607.04763)增量 10 | 🟡 v34 §2.4 候选 Agentic RL 训练栈第 6-7 件「Sample-Efficient + ReOPD 双轨」 |
| §2.5 安全契约 7 维 + 第 9 阶 | SeerGuard(arXiv:2607.15550)增量 6 + AgentDebugX(arXiv:2607.18754)沿用升级 + AgentCI MCP 安全 增量 8 | 🟡 v34 §2.5 候选第 10 阶「World-Model-Based GUI Agent 安全」 + AgentDebugX HF Daily 7-24 票数上升 + AgentCI MCP 安全立标 |
| §2.6 多模态 / IDE / CLI / 工具退化 14 件 | LLMs Get Lost in Evolving User Intent(arXiv:2607.20734)增量 3 + Agent Harness 主线 5 件旁证(AI Workflow Store + Context Engineering + AgentCI + GitHub Agentic Workflows 6 层 + Block Goose)增量 8 + FinanceComplexQA(arXiv:2607.19238)增量 10 | 🟡 v34 §2.6 段末追加「LLMs Get Lost 多轮意图演化跟踪评测」 + 「Agent Harness 工业化安全 + MCP 安全 + Agent Debugging 立标」 + 「金融 Agentic Reasoning 基准」 |
| §1.34b Gradient Flow 主线 L/K/H/J/A 5 主线 | 主线 A 连续第 7 天缺失 增量 9 + 主线 K 第 3 次巩固 + 主线 H 第 9 次巩固 + 主线 J 第 4 次巩固 | 🟢 v34 §1.34b 沿用升级 + Q103 阈值"极端消失判定"新阶段 + 主线 K 稳定主线判定待决断 |
| §3.1 共识 19 条 | PRO-LONG 不设 memory = 不存在 memory 攻击面(flyp risk-e1prep 已建议) + lifecycle vs storage + cost 并行架构目标(增量 1) + 编码 Agent 多轮交互 = 用户意图演化跟踪(增量 3) + 评测侧与检索侧都向"评分标准驱动" 范式收敛(增量 5) + vertical LLM 安全方向扩展(增量 6) | 🟡 v34 §3.1 共识候选 5 件(1 + 3 + 5 + 6 + 沿用升级)= 共识 19 → 24 |
| §3.2 争议 22 条 | PRO-LONG vs Agentic Context Management 三路线对立(增量 1)+ 意图演化跟踪 vs Hermes-Agent 跨会话记忆(增量 3)+ Beyond Relevance-Centric 主分类(rag vs agent 双向同步)(增量 5)+ SeerGuard 主分类(agent vs engineering 双向同步)(增量 6)+ vLLM v0.25.1 Bug C V1 streaming-session stale prefix-cache block hashes「不正确输出」生产事故沿用 | 🟡 v34 §3.2 争议新增 5 条 = 22 → 27 |
| §4 开放问题 27 条 | PRO-LONG vs Agentic Context Management 三路线对立 + PRO-LONG 在 SWE-bench Verified / HumanEval 长 horizon 版迁移 + baseline coding agent 具体是哪一个 + 日志膨胀 + 跨弱模型迁移 + 跨非 ARC-AGI-3 基准迁移(增量 4)+ 编码 Agent context management 在生产部署中对 harness complexity 的影响(增量 1)+ 编码 Agent 多轮意图演化跟踪在生产部署中的可靠性 + 评测 vs 训练双轨(增量 3)+ 编码 Agent context management 三路线对立 + 哪种范式胜出(增量 1)+ Q103 阈值"极端消失判定"新阶段(增量 9) | 🟡 v34 §4 开放问题新增 9 条 = 27 → 36 |
| §5 趋势 23 条 | Harness 学术化第七足 = Agent context management 三路线对立(增量 1 + 4) | 🟡 v34 §5 趋势新增 1 条 = 23 → 24 |
| §6 必读清单 102 条 | arXiv:2607.21503 + 2607.21051 + 2607.20734 + 2607.20064v2 + 2607.19747 + 2607.15550 + 2607.19238 + 2607.04763 = 8 件 arXiv + flyp 7-24 15:50 PRO-LONG critical-read + flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」 + jay 7-24 1052 engineering-filter 5 件旁证 + AI Workflow Store arXiv:2605.10907 + Context Engineering arXiv:2603.09619 + AgentCI + GitHub Agentic Workflows 6 层 + Block Goose = 4 件非 arXiv | 🟢 v34 §6 必读清单扩为 114 条候选 |
3. 值得警惕的矛盾或待核实说法(11 条)
3.1 矛盾 1 · PRO-LONG 与 Agentic Context Management 范式对立
- 冲突:PRO-LONG(arXiv:2607.20064v2)= 不裁剪 / 不摘要 / 不 memory subsystem;Agentic Context Management(arXiv:2607.21503)= lifecycle + architecture 双向范式(决定记什么 / 提取什么 / 遗忘什么)
- 风险:两个范式对编码 Agent context management 持有相反立场,在生产部署中哪个范式胜出悬而未决
- 建议归入:§3.2 争议新增「PRO-LONG 完整日志 vs Agentic Context Management 生命周期 三路线对立」(AHE 三层可观测性 为第三路线)= v34 §2.4 段末建议升格为「三路线对立」而非「五件同框」
- 建议:今晚活文档接手时先核 flyp 7-24 15:50 critical-read + arXiv:2607.21503 论文 PDF + arXiv:2607.20064v2 v2 changelog,再决定 §2.4 处置
3.2 矛盾 2 · arXiv:2607.21503 Agentic Context Management paper_card 待建
- 冲突:Tom 7-24 T1440 v2 重写版手工承接 + HF Daily 7-24 候选(票数未在 7-24 JSON 体现)= paper_card 未建 = pipeline 漏斗节点
- 风险:v25-v28 §2.4 沿用饱和下,本场增量 1 是 v25-v28 未捕获的 7-24 高信号新立标,但 paper_card 未建无法快速 reference
- 建议:Stephen 7-24 evening 协调棒 / Tom 7-24 evening 稿 / Jay 7-24 evening 稿 / spark 7-24 evening 稿 任一补建 arXiv:2607.21503 paper_card
3.3 矛盾 3 · arXiv:2607.15550 SeerGuard 主分类(agent vs engineering 双向同步)
- 冲突:paper_card 未建(7-24 12:30 paper_cards/548-562 仅 6 件,与 HF Daily 7-24 #11-15 不全对应);spark 7-24 agent-e1prep §增量 2 建议升 v29/v30 §2.6 第 38 子节候选(World-Model-Based GUI Agent 安全),但 v25-v28 §2.5 已沿用升级(HACO 99.2% SLO + AgentDebugX 3 适用场景)
- 判断:双向同步更准确——论文核心是"world model 预测的 GUI Agent 安全框架"= agent 主分类(GUI Agent 安全);但形态是安全框架 = engineering 主分类
- 建议:Stephen 7-24 evening 协调棒 / Tom 7-24 evening 稿 + coding-agents 主题活文档 双向同步
3.4 矛盾 4 · arXiv:2607.19747 Beyond Relevance-Centric 主分类(rag vs agent 双向同步)
- 冲突:HF Daily 7-24 #11 24▲ 票,paper_card 未建,Tom 7-24 0852 rag-e1prep §增量 1 已建议归 rag.md §2.6 垂直领域 RAG 应用
- 判断:双向同步更准确——论文核心是 RAG 检索优化新维度(评分标准驱动),agent 主题仅邻接
- 建议:Tom 晚场稿核 arXiv:2607.19747 主分类 + paper_card/未建
3.5 矛盾 5 · arXiv:2607.21051 Sample-Efficient Learning + arXiv:2607.04763 ReOPD = Agent 经验蒸馏双轨范式(是否合并为「第 6-7 件」 vs 「第 6 件」)
- 冲突:两件均涉及"Agent 经验向模型权重蒸馏"= 与 v25-v28 §2.4 On-Policy Distillation(arXiv:2607.13399)+ SEED(arXiv:2607.14777)+ Function-Aware FIM(arXiv:2607.12463)+ Tool-Call Boundary Drift(arXiv:2607.07050)+ LongStraw(arXiv:2607.14952)+ Agent-STAR(arXiv:2603.21972)+ SAO(arXiv:2607.07508)同源 = §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈第 6-7 件
- 判断:v34 是否合并为「Agent 经验蒸馏双轨」(ReOPD 工程化路径 + Sample-Efficient 样本效率) 待决断
- 建议:v34 §2.4 决策 = 升 1-2 件入正式 + 1-2 件作邻接
3.6 待核实 · AgentDebugX HF Daily 7-24 票数上升(11→21)是否构成"工业代表性升级"
- 冲突:HF Daily 7-22 11 票 → 7-23 11 票 → 7-24 21 票 = +10 票 = 工业代表性上升;但 spark 7-24 agent-e1prep 建议升 v29/v30 §2.6 第 37 子节候选
- 判断:v25-v28 §2.5 第 9 阶已沿用升级(HACO 99.2% SLO + AgentDebugX 3 适用场景);spark 7-24 §2.6 第 37 子节候选 = 双轨并行待决断
- 建议:v34 §2.5 + §2.6 决策 = 升 AgentDebugX 第 37 子节正式入 §2.6 + §2.5 第 9 阶沿用升级 双重
3.7 待核实 · arXiv:2607.15495 Anthropic J-space 论文 arXiv 编号与 Anthropic 关系 7-24 未进一步核证
- 冲突:jay 7-24 1140 X-tech-radar 通稿 7-24 沿用 7-23 omarsar0 长帖论据,未给出新的 PDF 验证
- 判断:v25-v28 §2.1 反方/风险 A 7-24 仍处于"部分解除"状态(arXiv 编号已得但 Anthropic 关系未核)
- 建议:Stephen 晚场稿 / Tom 晚场稿 / Jay 晚场稿 任一补 PDF 核(作者列表 + 论文标题 + Abstract)
3.8 待核实 · AutoIndex arXiv:2607.18603 7-24 仍未建卡
- 冲突:Stephen 7-24 1245 §3.2 #2 已标记 🔴 AutoIndex 4 天未建卡(7-20 首次报道至今 5 天)= pipeline 漏斗节点
- 判断:v25-v28 §2.3 56 节点 AutoIndex 仍待 paper_card 建卡
- 建议:Stephen 7-24 evening 协调棒 / Tom 7-24 evening 稿 / Jay 7-24 evening 稿 任一补建
3.9 待核实 · Q103 阈值从"持久消失判定(6 天)"升级到"极端消失判定(7 天)"
- 冲突:7-24 主线 A 连续第 7 天缺失是否触发新阈值"连续 ≥ 7 天 = 极端消失判定"
- 判断:v2 spark 反思机制提议"连续 ≥ 7 天 = 极端消失判定"= 待 v34 决断;沿用 v22 spark 反思机制对"主线 A 连续缺失天数 → 倾向于可能 1 的概率"量化表(6 天 = 0.85~0.95 / 5 天 = 0.7~0.85 / 4 天 = 0.6~0.7 / 3 天 = 不可量化 / 2 天 = 不可区分 / 1 天 = 偶然波动)+ 7 天 = 0.9~0.97?
- 建议:spark 7-24 evening v2 重写 gradient-flow 时同步覆盖 Q103 阈值"极端消失判定"+ 倾向于可能 1 概率再次量化
3.10 待核实 · GitHub Agentic Workflows 6 层 + Block Goose Linux Foundation 2026-04 项目主页
- 冲突:jay 7-24 1052 engineering-filter 引用"GitHub Agentic Workflows 安全架构 6 层 + Block Goose(Linux Foundation 2026-04)" = 项目主页链接待核 + 是否开源 + 复现门槛待核
- 判断:v34 §2.6 工业化安全立标 待补 PDF + GitHub 仓库链接
- 建议:jay 7-24 evening 稿 / Stephen 7-24 evening 稿 核 GitHub Agentic Workflows 仓库 + Block Goose Linux Foundation 项目主页
3.11 待核实 · arXiv:2607.21503 Agentic Context Management "lifecycle + architecture 双向范式" 与 v25-v28 §2.5 Cost-Aware Security Agent(arXiv:2607.15263)「cost as third evaluation dimension」边界
- 冲突:Agentic Context Management 提出 "memory + cost 并行作为架构设计目标"(cost as architecture design goal);v25-v28 §2.5 Cost-Aware 提出 "cost as third evaluation dimension"(cost as evaluation dimension)
- 判断:"cost as architecture goal" vs "cost as evaluation dimension" = 架构设计 vs 评测指标 维度边界待核
- 建议:v34 §2.4 + §2.5 决策 = 升 1 件入正式 + 1 件作邻接(按工业代表性与学术分量排序)
4. 涉及 arXiv 号列表(本次新增 + 邻接参考)
| 编号 | 来源 | 主分类 | 形态 | 涉及增量 | paper_card | HF Daily 7-24 |
|---|---|---|---|---|---|---|
| 2607.21503 | Tom 7-24 T1440 v2 重写版高价值 1(手工承接)+ HF Daily 7-24 候选 | agent(范式) | method | 增量 1 | 未建 | 候选 |
| 2607.21051 | Tom 7-24 T1440 v2 重写版高价值 + T2040 候选 6 + HF Daily 7-24 候选 | agent | method | 增量 2 | 未建 | 候选 |
| 2607.20734 | Tom 7-24 T1440 v2 重写版高价值 + T2040 候选 5 + HF Daily 7-24 | agent | benchmark | 增量 3 | 未建 | 11 票(7-24 JSON cda2fb756f6f) |
| 2607.20064v2 | flyp 7-24 15:50 PRO-LONG critical-read 主稿 + flyp 7-24 risk-e1prep §增量 6 | agent | method | 增量 4 | 未建 | 候选 |
| 2607.19747 | Tom 7-24 0841 radar 旁证 + Tom 7-24 0852 rag-e1prep + HF Daily 7-24 | rag(evaluation 副) | method | 增量 5 | 未建 | #11 24▲ 票 |
| 2607.15550 | Tom 7-24 雷达 + spark 7-24 agent-e1prep §增量 2 + HF Daily 7-24 | agent(safety 副) | method | 增量 6 | 未建 | #12 24▲ 票 |
| 2607.18754 | Tom 7-24 0900 HF Daily #13 + spark 7-24 agent-e1prep §增量 1 | agent(method/tool 副 evaluation 副) | method | 增量 7 沿用升级 | 已建 526(7-23 02:10) | #13 21▲ 票(7-22 11→7-23 11→7-24 21) |
| 2607.16617 | Tom 7-24 0900 HF Daily #2 + spark 7-24 agent-e1prep §增量 2 + Tom 7-24 T1440 v2 重写版 | agent(范式) | method | 增量 7 沿用升级 | 未建 | #2 123▲ 票(7-23 120→7-24 123) |
| 2607.19238 | Tom 7-24 T2040 radar 高价值 1 | agent(benchmark 副) | benchmark | 增量 10 邻接 | 未建 | 3 票 |
| 2607.04763 | Tom 7-24 T2040 radar 高价值 2 | agent(multimodal 副) | method | 增量 10 邻接 | 未建 | 1 票 |
| 2605.10907 | jay 7-24 1052 engineering-filter Agent Harness 主线 5 件旁证 1 | agent(SE 副) | framework | 增量 8 旁证 | 未核 | - |
| 2603.09619 | jay 7-24 1052 engineering-filter Agent Harness 主线 5 件旁证 2 | agent(Context Engineering) | method | 增量 8 旁证 | 未核 | - |
合计 7-24 coding-agents 主分类新增 arXiv 8 件(增量 1-6 + 增量 10 两件 = 8 件 = 2607.21503 + 2607.21051 + 2607.20734 + 2607.20064v2 + 2607.19747 + 2607.15550 + 2607.19238 + 2607.04763)+ 沿用升级 2 件(增量 7 = 2607.18754 + 2607.16617)+ 邻接参考 2 件(增量 8 = 2605.10907 + 2603.09619)= 12 件 arXiv 号;非 arXiv 旁证 4 件(增量 8 = AgentCI MCP 安全 + GitHub Agentic Workflows 6 层 + Block Goose Linux Foundation 2026-04 + Aishwarya RAG 2026);Substack 1 件(flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」,已立 short-read 笔记);v25-v28 沿用 22 件(沿用饱和)
4.1 已立标沿用编号(本次继承不重复)
- 2607.18754 AgentDebugX / 2607.16617 DataFlow-Harness / 2607.19215 HACO / 2607.18213 SWE-Pruner Pro / 2607.18171 FlashRT / 2607.17986 Self-State Attacks / 2607.15434 Manager Coercion / 2607.15495 Anthropic J-space / 2607.07050 Tool-Call Boundary Drift / 2607.07820 DeepSearch-World / 2607.19297 LangGraph / 2607.18603 AutoIndex(7-24 仍未建卡)/ 2607.18529 EduPanel / 2607.18772 RF-Agent / 2607.18825 AILQA / 2607.19865 DocOps / 2607.19058 SkewAdam / 2607.15263 Cost-Aware / 2607.06815 Behavioral Privacy / 2607.15657 Lucid / 2606.20683 Harness Survey / 2604.25850 AHE —— 全部已在 v25 / v26 / v27 / v28 沿用
4.2 非 arXiv 但本主题重要参考
- lopopolo/harness-engineering GitHub(⭐ 2194 ·
github.com/lopopolo/harness-engineering· Ryan Lopopolo 的 Harness Engineering 选集 + 现场指南 + Agent Context Bundle · 7-23 立标) - NousResearch/hermes-agent GitHub(218K⭐ · 7-22 立标 + 7-23 沿用 + 7-24 沿用)
- Graphify-Labs/graphify GitHub(93K⭐ · 7-22 立标 + 7-23 沿用 + 7-24 沿用)
- ByteDance/DeerFlow GitHub(DeerFlow v2.0 统一 harness 重写版 · 7-22 立标 + 7-23 沿用 + 7-24 沿用 · arXiv 待核)
- Self-Harness(上海 AI Lab · arXiv 占位 2606.xxxxx 待核 · 7-22 立标 + 7-23 沿用 + 7-24 沿用)
- Sebastian Raschka「使用本地 Coding Agent」(magazine.sebastianraschka.com · 7-23 立标)
- Lilian Weng「自改进的 Harness 工程」(lilianweng.github.io · 2026-07-04 + 续沿用 · 递归自改进 RSI 概念追溯 I. J. Good 1965 · 7-23 立标)
- Cursor Router(jay 7-23 1335 deep-dive · 请求级智能分类器 · 7-23 立标 + 7-24 沿用)
- OpenRouter Prompt Caching + Sticky Routing(多轮 Agent 调用成本优化 · 7-23 立标 + 7-24 沿用)
- Google Tunix(基于 JAX 高吞吐智能体后训练库 · 7-23 立标 + 7-24 沿用)
- Cameron Wolfe「Agentic World Models」(Substack · flyp 7-24 22:50 short-read · 与本主题编码 Agent 上下文管理 + 长视野 Agent 主线同源 = world-model-based reasoning 立标)
- AgentCI MCP 安全(jay 7-24 1052 engineering-filter · 43% MCP 命令注入 + CVE-2025-49596 RCE + 9700 万次 MCP SDK 月下载 · 工业级 MCP 安全风险立标)
- GitHub Agentic Workflows 安全架构 6 层 + Block Goose Linux Foundation 2026-04(jay 7-24 1052 engineering-filter · 工业级 Harness 安全架构补全)
- AI Workflow Store(arXiv:2605.10907 · 工程化 robustness 缺位 + 6 类 SE 过程 + 真实故障案例 · 工业级 Agent Harness 立标)
- Context Engineering(arXiv:2603.09619 · 四学科金字塔 PE → CE → IE → SE + 五维质量标准)
- Aishwarya Srinivasan RAG 2026(Substack · Context-Aware Partitioning + Hybrid Search RRF + Cross-Encoder Re-Ranking + Naive RAG 2026 危机)
5. 本主题页活文档沿用 vs 新立关系总览(给今晚活文档接手时)
5.1 沿用项目(v25 / v26 / v27 / v28 已收录,7-23 无新增,7-24 沿用)
- Kimi K3(Moonshot AI · 7-19 API + 7-27 开权 · SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3 三榜 SOTA)
- FlashRT(arXiv:2607.18171 · deployment-time harness · 第六阶段)
- SWE-Pruner Pro(arXiv:2607.18213 · AHE「experience observability」· 第七阶段 harness 内化)
- Cost-Aware Security Agent(arXiv:2607.15263 · 评测第三维度)
- Behavioral Privacy Leakage(arXiv:2607.06815 · 安全第四维度)
- 4 RCE CVE(CVE-2026-61447 + 54769 + 57572 + 59726 · Orca Security 2026)
- IBM Model Routing 三大工程陷阱(2026-07-15)
- Microsoft Foundry / Copilot 五层 Harness(Marco Casalaina · ByteByteGo 2026-07-20)
- Harness Survey(arXiv:2606.20683 · 六维运行时分解 + Agent 工程四大范式演进)
- OpenDev(arXiv:2603.05344 · dual-agent terminal coding + lazy tool discovery + adaptive compaction)
- Production Playbook 12-pattern(Botlearn.ai · 2026)
- Kimi Code CLI(Moonshot 第二件 coding agent 落地)
- §2.1 Harness 学术化 9 阶段「时间点多向闭环 6 件 + Harness-as-Agent 第九阶段 7 件」
- §2.3 评测信任第 7 阶五联(Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph)
- §2.5 第 9 阶 + AgentDebugX + HACO + Manager Coercion = 7 维合并成熟
- Hy3 1bit 单卡 96GB 部署 + 1bit 提速 50% + llama.cpp MTP 60%
- vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug = 9 Bug 矩阵(7-23 立标 + 7-24 沿用)
- SkewAdam(arXiv:2607.19058)MoE 三类参数分层优化器状态(7-23 立标 + 7-24 沿用)
- lopopolo/harness-engineering(⭐ 2194 · 7-23 立标 + 7-24 沿用)
- Sebastian Raschka「使用本地 Coding Agent」(7-23 立标 + 7-24 沿用)
- Lilian Weng「自改进的 Harness 工程」续沿用(7-23 续 + 7-24 沿用)
- Anthropic J-space(arXiv:2607.15495 · 7-23 立标 + 7-24 沿用)
- Cursor Router + OpenRouter Caching + Google Tunix(7-23 立标 + 7-24 沿用)
- Kimi K3 7-27 开权前夜生态补漏 7 件(7-23 立标 + 7-24 沿用)
5.2 新立项目(本轮 7-24 增量 = 6 件主线 + 2 件沿用升级 + 2 件邻接 + 4 件 Agent Harness 工业化 / MCP 安全旁证)
- §2.4 记忆 / 长视野 第 6 件候选(本轮 7-24 第一强新增):
- arXiv:2607.21503 Agentic Context Management —— lifecycle + architecture 双向范式 + memory + cost 并行作为架构设计目标(v25-v28 未捕获 + Tom 7-24 T1440 v2 高价值)
- §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈第 6-7 件候选(本轮 7-24 第二强新增):
- arXiv:2607.21051 Sample-Efficient Learning from Agent Experience —— Agent 经验蒸馏 + ICL + context distillation + 环境样本效率(Tom 7-24 T1440 v2 + T2040)
- arXiv:2607.04763 ReOPD —— 多轮 On-Policy Distillation with Prefix Replay + 无需新环境交互 + 教师轨迹回放前缀(Tom 7-24 T2040)
- §2.4 段末「三路线对立」候选(本轮 7-24 第三强新增):
- arXiv:2607.20064v2 PRO-LONG —— 完整结构化日志 + 编码 agent 在日志里检索 · ARC-AGI-3 +18pp / 4.2-5.8× token 节省 / Fable 5 97.4% best@2 @ $1,750(flyp 7-24 15:50 critical-read + flyp 7-24 risk-e1prep §增量 6)
- §3.1 反方共识候选 #54「PRO-LONG 不设 memory = 不存在 memory 攻击面」(flyp risk-e1prep 已建议)
- §2.3 RAG 检索优化第 4 路径邻接(本轮 7-24 第四新增):
- arXiv:2607.19747 Beyond Relevance-Centric Retrieval —— 评分标准驱动 + RAG 检索优化新维度(Tom 7-24 0841 + 0852 + HF Daily 7-24 #11 24▲)
- §2.5 安全契约 第 10 阶候选(本轮 7-24 第五新增):
- arXiv:2607.15550 SeerGuard —— 世界模型预测的 GUI Agent 安全框架 · 事前安全预演 · GUI Agent 时代的安全门控(spark 7-24 + HF Daily 7-24 #12 24▲)
- §2.6 多模态 / IDE / CLI / 工具退化 段末追加(本轮 7-24 第六新增):
- arXiv:2607.20734 LLMs Get Lost in Evolving User Intent —— 多轮意图演化跟踪评测 + 动态多轮评估框架(Tom 7-24 T1440 + T2040 + HF Daily 7-24 11 票)
- §2.6 工业化安全 + MCP 安全 + Agent Debugging 立标 + §2.5 安全契约 第 9 阶沿用升级补全(本轮 7-24 第七新增):
- AI Workflow Store(arXiv:2605.10907) + Context Engineering(arXiv:2603.09619) + AgentCI MCP 安全 + GitHub Agentic Workflows 6 层 + Block Goose Linux Foundation 2026-04(jay 7-24 1052 + 1105 + 0938 + stephen 7-24 1245)
- §2.4 + §2.6 邻接补全(本轮 7-24 第八新增):
- arXiv:2607.19238 FinanceComplexQA + arXiv:2607.04763 ReOPD(Tom 7-24 T2040)
- §2.5 + §2.1 沿用升级补全(本轮 7-24 第九新增):
- arXiv:2607.18754 AgentDebugX HF Daily 7-24 票数上升(11→21) + arXiv:2607.16617 DataFlow-Harness HF Daily 7-24 #2 持续高位(123▲)
5.3 主题页结构变化建议(给今晚活文档接手时)
- §1 现状全景:从 9 阈值(7-24 04:20 v25 已升格 9 阈值 = 模型端主权开源跨榜 SOTA Kimi K3 + Agent 框架 4 RCE + Cost/Privacy 维度 + IBM Routing + K3 三榜 SOTA + FlashRT/SWE-Pruner 内化范式 + 评测扩展第 7 阶 + AI 安全第 9 阶 + Agent Harness 工业化 6 件套 + Harness-as-Agent 第九阶段 7 件 + 工业知识库 GitHub 双件 + 认知科学锚点 arXiv 实证补全)扩为 10 阈值 = + Agent context management 三路线对立(PRO-LONG 完整日志 + Agentic Context Management 生命周期 + AHE 三层可观测性) + World-Model-Based GUI Agent 安全框架 + 多轮意图演化跟踪评测 + 工业级 MCP 安全风险立标(AgentCI + CVE-2025-49596 + 9700 万次 SDK 下载)
- §2.1 Harness 学术化:从 9 阶段(7-24 v25 第九阶段「Harness-as-Agent 7 件」)沿用升级,不再立第 10 阶段(7-24 增量克制);§2.1 段末追加「flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」 Substack 思想线索」一行(world-model-based reasoning 与编码 Agent 上下文管理同源)
- §2.3 评测基础设施分层 20 行:沿用升级,邻接补全「Beyond Relevance-Centric 第四路径 rubric-driven」
- §2.4 记忆 / 长视野:从 5 件(MAGE + MRAgent + Memanto + ReMemR1 + AutoMem) + Codified Context(arXiv:2602.20478)扩为 5 + 1 + 2 件 = 8 件(沿用 5 件 + Codified Context 第 6 件 + Agentic Context Management 第 6 件 + PRO-LONG 第 6 件) + 「三路线对立」段末追加(PRO-LONG 完整日志 vs Agentic Context Management 生命周期 vs AHE 三层可观测性)
- §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈:从 11 件(7-23 立标)扩为 11 + 2 件 = 13 件(Sample-Efficient + ReOPD 双轨范式)
- §2.5 安全契约:沿用 7 维 + 第 9 阶,追加第 10 阶「World-Model-Based GUI Agent 安全」(SeerGuard) + 第 9 阶沿用升级补全(MCP 命令注入 43% + CVE-2025-49596 RCE + 9700 万次 SDK 下载 = 工业级 MCP 安全风险立标)
- §2.6 多模态 / IDE / CLI / 工具退化:从 14 件(7-24 立标)沿用升级,段末追加「LLMs Get Lost in Evolving User Intent · 多轮意图演化跟踪评测」一行 + 「Agent Harness 工业化安全 + MCP 安全 + Agent Debugging 立标」一段(AI Workflow Store + Context Engineering + AgentCI + GitHub Agentic Workflows 6 层 + Block Goose)+ 「金融 Agentic Reasoning 基准」一行(FinanceComplexQA)
- §3.1 共识:从 19 条扩为 24 条(+ PRO-LONG 不设 memory = 不存在 memory 攻击面 + lifecycle vs storage + cost 并行架构目标 + 编码 Agent 多轮交互 = 用户意图演化跟踪 + 评测侧与检索侧都向"评分标准驱动" 范式收敛 + vertical LLM 安全方向扩展 = 5 条)
- §3.2 争议:从 22 条扩为 27 条(+ PRO-LONG vs Agentic Context Management 三路线对立 + 意图演化跟踪 vs Hermes-Agent 跨会话记忆 + Beyond Relevance-Centric 主分类 + SeerGuard 主分类 + vLLM Bug C 沿用 = 5 条)
- §4 开放问题:从 27 条扩为 36 条(+ PRO-LONG vs Agentic Context Management 三路线对立 + PRO-LONG 迁移 + baseline coding agent + 日志膨胀 + 跨弱模型 + 跨非 ARC-AGI-3 基准 + 编码 Agent context management 在生产部署中 + 编码 Agent 多轮意图演化跟踪在生产部署中 + Q103 阈值"极端消失判定" 新阶段 = 9 条)
- §5 趋势:从 23 条扩为 24 条(+ Harness 学术化第七足 = Agent context management 三路线对立 + lifecycle vs storage 范式沿用)
- §6 必读清单:从 102 条扩为 114 条(+ arXiv:2607.21503 + 2607.21051 + 2607.20734 + 2607.20064v2 + 2607.19747 + 2607.15550 + 2607.19238 + 2607.04763 = 8 件 arXiv + flyp 7-24 15:50 PRO-LONG critical-read + flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」+ jay 7-24 1052 engineering-filter 5 件旁证 + AI Workflow Store arXiv:2605.10907 + Context Engineering arXiv:2603.09619 = 12 件新必读)
6. 本主题与邻接主题的边界提示
- 与
agent.md(通用 agent 主题页)分工:arXiv:2607.21503 Agentic Context Management + arXiv:2607.21051 Sample-Efficient + arXiv:2607.20734 LLMs Get Lost in Evolving User Intent + arXiv:2607.15550 SeerGuard + arXiv:2607.16617 DataFlow-Harness 沿用升级 + arXiv:2607.18754 AgentDebugX 沿用升级 跨「通用 agent」+「编码 agent」双重立标 —— spark 7-24 agent-e1prep §增量 1/2/3/4/5/6 同源;本主题页仅沿用 6 件主题窗内强相关内容(PRO-LONG + Agentic Context Management + Sample-Efficient + LLMs Get Lost + SeerGuard + DataFlow-Harness + AgentDebugX 沿用升级),不重述 spark 主题组 A - 与
risk.md(风险主题页)分工:SeerGuard + AgentDebugX 沿用升级 + AgentCI MCP 安全 + arXiv:2607.20064v2 PRO-LONG「不设 memory = 不存在 memory 攻击面」 由 risk.md / 主题页双向 reference;flyp 7-24 risk-e1prep §增量 6 已建议 PRO-LONG §3.1 反方共识候选 #54;本主题页主要在 §2.5 引用 SeerGuard 第 10 阶 + AgentCI MCP 安全 工业级风险立标 + PRO-LONG 范式逆袭 - 与
llm-infra.md(推理基础设施主题页)分工:arXiv:2607.21051 Sample-Efficient + arXiv:2607.04763 ReOPD + vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug + SkewAdam(arXiv:2607.19058)+ Google Tunix + Cursor Router + OpenRouter Caching 由 llm-infra 主立,本主题在 §2.4 + §2.6 引「编码 Agent 经验蒸馏双轨」+ 「编码 Agent 推理基础设施 9 Bug 矩阵」 - 与
multimodal.md(多模态主题页)分工:flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」 Substack 思想线索 + flyp 7-23 0950 ABot-World-0 + flyp 7-24 09:50 Self Gradient Forcing + Anchor-Align 多模态与本主题「世界模型推理 + 编码 Agent 上下文管理」同源;本主题仅在 §1 现状全景 「第十阈值 = Agent context management 三路线对立」 旁证引用 flyp 7-24 22:50 Cameron Wolfe 一行 - 与
evaluation.md(评测方法学主题页)分工:Beyond Relevance-Centric(arXiv:2607.19747) + LLMs Get Lost in Evolving User Intent(arXiv:2607.20734) + FinanceComplexQA(arXiv:2607.19238) + Sample-Efficient + ReOPD 5 件 评测方法学跨主题页 —— evaluation.md 主立评测方法学通用部分;本主题在 §2.3 引「Beyond Relevance-Centric 第四路径 rubric-driven」 + §2.6 引「LLMs Get Lost 多轮意图演化跟踪评测」 + 「金融 Agentic Reasoning 基准」 - 与
inference.md(推理基础设施主题页)分工:Sample-Efficient + ReOPD + KV Cache 优化 + Cursor Router + Kimi K3(896 experts)+ SkewAdam(MoE 优化器)+ DeepSearch-World(86▲ 票沿用) 推理工程跨主题页;本主题在 §2.4 引「Sample-Efficient + ReOPD 双轨范式」+ 「编码 Agent 经验蒸馏」
7. 补充:与今晚活文档(2026-07-24 v34 接力窗口)的本主题边际贡献
7.1 边际贡献 vs 昨晚活文档(2026-07-23 v25 / v26 / v27 / v28 已饱和 + 7-23 E1 9 件立标)
- 沿用项目:Kimi K3 + FlashRT + SWE-Pruner Pro + Cost-Aware + Behavioral Privacy + 4 RCE CVE + IBM Routing + Microsoft Foundry + Harness Survey + OpenDev + Production Playbook 12-pattern + Kimi Code CLI + v25 §2.1 第八阶段 6 件 + v25 §2.1 第九阶段 Harness-as-Agent 7 件 + v25 §2.3 评测第 7 阶五联 + v25 §2.5 第 9 阶 + Hy3 1bit + Hermes-Agent + Graphify + Self-Harness 占位 + DeerFlow v2.0 + HACO + AgentDebugX + lopopolo + Sebastian Raschka + Lilian Weng + Anthropic J-space + Cursor Router + OpenRouter Caching + Google Tunix + Kimi K3 7-27 开权前夜生态补漏 7 件 + vLLM/SGLang 9 Bug 矩阵 + SkewAdam = 30 件
- 新立项目(本轮 7-24):Agentic Context Management + Sample-Efficient + LLMs Get Lost in Evolving User Intent + PRO-LONG + Beyond Relevance-Centric + SeerGuard + FinanceComplexQA + ReOPD 8 件主线 + AgentDebugX 沿用升级 + DataFlow-Harness 沿用升级 + jay 7-24 1052 engineering-filter 5 件旁证 + Cameron Wolfe Agentic World Models = 16 件新立候选(其中 8 件 = §2.4 记忆 / 长视野 第 6 件 + §2.4 Agentic RL 训练栈第 6-7 件 + §2.4 段末「三路线对立」 + §2.3 RAG 检索优化第 4 路径 + §2.5 安全契约第 10 阶 + §2.6 多模态 / IDE / CLI / 工具退化 段末追加 + §2.6 工业化安全 + MCP 安全 + Agent Debugging 立标 + §2.4 + §2.6 邻接补全)
7.2 给今晚 v34 接力的优先级排序
- 【P0】增量 1:Agentic Context Management(arXiv:2607.21503 · Tom 7-24 T1440 v2 高价值 · HF Daily 7-24 候选 · paper_card 未建) = 最大新立增量 + lifecycle + architecture 双向范式 + §2.4 第 6 件候选
- 【P0】增量 4:PRO-LONG(arXiv:2607.20064v2 · flyp 7-24 15:50 critical-read 主稿 + flyp 7-24 risk-e1prep §增量 6) = 「不裁剪 / 不摘要 / 不 memory subsystem」 + ARC-AGI-3 +18pp / 4.2-5.8× token 节省 / Fable 5 97.4% best@2 + §3.1 反方共识候选 #54
- 【P0】增量 6:SeerGuard(arXiv:2607.15550 · HF Daily 7-24 #12 24▲ 票 · spark 7-24 §增量 2 升 v29/v30 §2.6 第 38 子节候选) = §2.5 安全契约 第 10 阶「World-Model-Based GUI Agent 安全」
- 【P0】增量 7:AgentDebugX + DataFlow-Harness HF Daily 7-24 票数上升沿用升级 = §2.5 第 9 阶 + §2.1 第九阶段 沿用升级
- 【P1】增量 2 + 增量 10:Sample-Efficient Learning from Agent Experience(arXiv:2607.21051) + ReOPD(arXiv:2607.04763) Agent 经验蒸馏双轨范式 = §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈第 6-7 件候选
- 【P1】增量 3:LLMs Get Lost in Evolving User Intent(arXiv:2607.20734 · HF Daily 7-24 11 票) = §2.6 多模态 / IDE / CLI / 工具退化 段末追加
- 【P1】增量 5:Beyond Relevance-Centric(arXiv:2607.19747 · HF Daily 7-24 #11 24▲ 票) = §2.3 RAG 检索优化第 4 路径 rubric-driven
- 【P1】增量 8:jay 7-24 1052 engineering-filter Agent Harness 主线 5 件旁证 + AgentCI MCP 安全 = §2.6 工业化安全 + MCP 安全 + Agent Debugging 立标 + §2.5 第 9 阶沿用升级补全
- 【P1】增量 9:spark 7-24 1002 gradient-flow 主线 A 连续第 7 天缺失 + Q103 阈值"极端消失判定"新阶段 = §3.3 开放问题 Q103 持续监测
- 【P2】增量 10 邻接:FinanceComplexQA(arXiv:2607.19238) + ReOPD(arXiv:2607.04763) = §2.3 + §2.4 + §2.6 邻接补全
7.3 给今晚活文档接手时的语言风格提示
- Wave4 E1 第六轮在 7-24 04:20 已升格到相对饱和(9 阈值 + 9 阶段 + 20 行 + 19 共识 + 22 争议 + 27 开放 + 23 趋势 + 102 必读) —— 本场新立增量克制使用「立标」「SOTA」「重大立标」等高强度词,优先用「7-24 候选」「v34 升格辅助」「沿用 + 增量」「补漏」「§2.4 第 6 件」「Harness-as-Agent 范式」等温和词
- Agentic Context Management / PRO-LONG / SeerGuard / Sample-Efficient / LLMs Get Lost / Beyond Relevance-Centric 6 件不全部平均用力,优先级排序:Agentic Context Management = P0(给 §2.4 第 6 件独立段 + §3.2 争议新增「三路线对立」)+ PRO-LONG = P0(给 §2.4 第 6 件 + §3.1 反方共识候选 #54)+ SeerGuard = P0(给 §2.5 第 10 阶独立段)+ Sample-Efficient + ReOPD = P1(给 §2.4 Agentic RL 训练栈第 6-7 件 双轨)+ LLMs Get Lost = P1(给 §2.6 段末追加一行)+ Beyond Relevance-Centric = P1(给 §2.3 RAG 检索优化第 4 路径邻接)
- AgentDebugX / DataFlow-Harness 沿用升级 + Kimi K3 生态补漏 / 9 Bug 矩阵 / SkewAdam 5 件:与 v25 / v26 / v27 / v28 沿用,侧重「沿用升级 + HF Daily 票数证据更新」聚合表达,不平均着力
- Anthropic J-space:与 risk.md / 主题组 A 同源,本主题页主要在 §2.1 第八阶段第八段引用,不重述细节(细节在 spark agent-e1prep / Stephen llm-application-e1prep)
- flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」:与 multimodal.md 同源,本主题页主要在 §1 现状全景 「第十阈值 = Agent context management 三路线对立」 旁证引用一行,不重述细节(细节在 flyp 7-24 22:50 short-read)
7.4 给 Stephen / Tom / Jay / Spark 下半场协调棒的建议接口
- stephen 7-24 1245 noon 协调棒 已与本主题增量 7(AgentDebugX + DataFlow-Harness HF Daily 7-24 票数沿用升级)+ 增量 8(Agent Harness 主线 5 件旁证 + AgentCI MCP 安全)同源,本场 E1 与 stephen 1245 完全对接,不需要重述
- stephen 7-24 2245 evening 协调棒(已阅,待核)— 与本主题增量 1(Agentic Context Management)+ 增量 2(Sample-Efficient)+ 增量 3(LLMs Get Lost)+ 增量 4(PRO-LONG)+ 增量 5(Beyond Relevance-Centric)+ 增量 6(SeerGuard)+ 增量 10(FinanceComplexQA + ReOPD) 8 件主线增量同源,本场 E1 引用即可
- stephen 7-24 0910 X-vip-radar + 1004 news 6 份 + 1005 news 3 份 + 1006 news 3 份 + 1007 news 3 份 = 16 份 news 通稿——Anthropic Claude for Enterprise/API 自助 HIPAA BAA + Kimi Work 与 Kimi Code CLI 7-22 + TLDR AI 7-17 三连标题(Kimi K3 🌕 + Gemini 3.5 延期 ⏳ + 碾压 ARC-AGI 3 🤖)+ Ben's Bites 7-22「对 Fable 的看法」+「对 harness 的期待」+ Anthropic 经济指数连接器 + OpenAI Presence 企业级 agent 平台 + Gemini 3.6 Flash = frontier lab 7-22 ~ 7-24 立场深化 + 编码 Agent 工业化沿用,本场 E1 引用即可
- Tom 7-24 0841 agent-rag-longcontext-radar(8 候选 4 高价值 IteraSim RAG ⭐⭐⭐⭐ + DocOps ⭐⭐⭐⭐ + ActiveVision ⭐ + FinMMEval ⭐ + Scaling Laws Hypernetwork ⭐ + Diff-Logic EEG ⭐ + 4 件邻证 Decodability Supervision / Beyond Relevance-Centric / AgentDebugX / SeerGuard + Substack 1 件 UK/EU Agentic RAG 企业指南)— 与本主题增量 5(Beyond Relevance-Centric)+ 增量 6(SeerGuard)+ 增量 7(AgentDebugX 沿用升级)同源,本场 E1 引用即可
- Tom 7-24 0852 rag-e1prep(RAG E1 预消化 · 1 高 IteraSim RAG + 2 中 Substack 三架构 + Faithfulness 1.0 + 1 持续追踪 AutoIndex)— 与本主题增量 5(Beyond Relevance-Centric 主分类 rag vs agent 双向同步)同源,本场 E1 引用即可
- Tom 7-24 0900 HF Daily(15 篇:ABot-World-0 200▲ + DataFlow-Harness 123▲ + 文本模板 Token 70▲ + 实时生成式世界渲染器 67▲ + Mage-Flow 60▲ + AlayaWorld 49▲ + SLAI T-Rex 45▲ + Subliminal Clocks 36▲ + Stable-But-Stale 31▲ + Self Gradient Forcing 29▲ + Beyond Relevance-Centric 24▲ + SeerGuard 24▲ + AgentDebugX 21▲ + SciForma 20▲ + ActiveVision 18▲)— 与本主题增量 5(Beyond Relevance-Centric 票数)+ 增量 6(SeerGuard 票数)+ 增量 7(AgentDebugX 票数上升)+ 增量 7(DataFlow-Harness #2 持续高位)同源,本场 E1 引用即可
- Tom 7-24 T1440 v2 重写版(13 段标配 + 手工承接 6 件 + 7-24 HF Daily 主榜 200/123/70/67 票 0/4 承接诚实承认 + v3 强制转日承接承诺)— 与本主题增量 1(Agentic Context Management 手工承接)+ 增量 2(Sample-Efficient)+ 增量 3(LLMs Get Lost)+ 增量 5(Beyond Relevance-Centric 邻证)+ 增量 6(SeerGuard)+ 增量 7(DataFlow-Harness)同源,本场 E1 引用即可
- Tom 7-24 T2040 radar(8 候选 3 高价值 FinanceComplexQA + ReOPD + AI Engineers Stack 2026 Substack + 5 一般)— 与本主题增量 10(FinanceComplexQA + ReOPD)+ Substack 1 件(AI Engineers Stack 2026)同源,本场 E1 引用即可
- jay 7-24 0820 csdn-langgraph-multimodal-rag-substack(HERA 2604.00901 + HM-RAG 2504.12330 + Multimodal RAG Survey 2510.15253 + LangChain 0.3.20 实战)— 与本主题编码 Agent 邻接(Multi-Agent RAG 编排),本场 E1 引用即可
- jay 7-24 0938 ai-engineering-trending(Colibri 744