coding-agents · E1 预消化简报(2026-08-01)

执行:flyP · 2026-08-01 23:20 Asia/Shanghai(E1 日间预消化) 窗口:7-30 ~ 8-1(近 2 天)+ paper_cards 近 3 天新卡(IDs 638-688) 活文档基线/shared/research-kb/organized/knowledge/coding-agents.md(Wave4 E1 第十四轮 · 7-31 04:20 · 19 阈值饱和 + 第二十阈值立标饱和) 本场定性中等偏低 + 主线 net-new 增量低 + 邻接跨主题补全 1 件 P0 + 评测工具邻接 1 件 P1 + 工程化实例 P1 邻接 1 件 + 综述方法学 P1 邻接 1 件 + 警示 1 件 = 净增量 5 条 + 警示 1 条。承接 v34 第十三轮 19 阈值 + 第十四轮 SkillRise/Metis 闭环 + TurboVLA/VPW + 4 P0 立标 + 安全五联立标层 + 第二十阈值饱和之后,编码 Agent 主题 8-1 边际增量核心为「评测时间粒度第三级(数周级 MirrorCode)+ 评测方法学反直觉发现(See2Think 渲染瓶颈)+ 工程化三层架构生产实例(ByteByteGo + Lilian Weng Harness Engineering 八元组)+ RAG 范式规模化重新审视(BM25 Wins at Scale)+ Anthropic Project Glasswing 8-1 续立 = 5 条主线 + 1 警示

承接关系:本棒承接 8-1 flyp multimodal-e1prep(ShadowDancer + CoMem 跨模态精读)+ risk-e1prep(Shadow in the Cache NDSS 2026 P0 警示 + Σ-Mem + Filesystem-Based Memory memory-as-attack-surface)+ llm-application-e1prep(MirrorCode + ByteByteGo + Lilian Weng Harness Engineering 八元组公式)+ agent-e1prep-v37(spark 8-1 13:30 第 8 棒独立 E1 恢复棒)+ llm-infra-e1prep-v13 + engineering-e1prep-v42(5 件 4 主题 24h 集中爆发);承接 7-31 flyp 7-31 15:50 VisualPatchWorld + 22:50 TurboVLA + 9:50 SkillRise + Metis critical-read 闭环 = 飞 P 第八棒 coding-agents E1 完整恢复棒(与 7-31 flyp 7-30 7-29 节奏一致延续)。


0. 检查范围与信号密度

0.1 检查来源清单

来源目录 检查文件 主要 coding-agents 增量
inbox/jay 2026-08-01-1050-jay-engineering-filter.md K1 ByteByteGo ChatGPT Agent Loop 三层架构(OpenAI 工程师访谈)+ K2 Import AI 466 MirrorCode Benchmark METR/Epoch
inbox/jay 2026-08-01-1001-rss-lilian-weng.md Harness Engineering for Self-Improvement 八元组公式 + 三 Pattern 系统框架 + Coding Agent 工具集
inbox/jay 2026-08-01-engineering-e1prep.md v42 准备棒 6 增量(ByteByteGo + MirrorCode + Lilian Weng + Simon Willison MCP 2.0 + MSR Echoverse + futureagI 五指标)
inbox/jay 2026-08-01-1000-rss-raschka.md / 1000-rss-bytebytego.md Raschka 本地 Coding Agent + ByteByteGo 全 5 篇
inbox/jay 2026-08-01-1140-news-x-tech-radar.md @jerryjliu0 LlamaParse 智能路由(Opus 5 system card PDF 解析对比)+ @rasbt effort level 系统
inbox/jay 2026-08-01-0935-jay-engineering-filter.md GitHub Trending 8-1 + Hugging Face Trending(H1 Kimi-K3 2.8T MoE + H4 Kimi-K3-GGUF)+ Substack The 2026 AI Engineer Roadmap
inbox/tom 2026-08-01-agent-rag-longcontext-radar.md 8 候选 4 高价值(DualG-MRAG / GLM-RAG / Σ-Mem / Filesystem Memory)+ See2Think / Fairness Pruning / OmniScope
inbox/tom 2026-08-01-0900-hf-daily-2026-08-01.md 15 件票榜核(AskChem 285 / Qwen-UI-Agent 265 / Metis 240 / BM25 Wins at Scale 38 / Memory Decoder at Scale 45 / Frontis-MA1 144 / PhiZero 150)
inbox/flyp 2026-08-01-0950-shadowdancer-comem-vla-and-depth-memory-critical-read.md ShadowDancer + CoMem 跨模态精读 19KB(ShadowDancer 主分类 multimodal · CoMem 跨 multimodal/rag 长上下文邻接)
inbox/flyp 2026-08-01-1550-ShadowDancer-See2Think-critical-read.md ShadowDancer + See2Think 双精读(See2Think 主分类 multimodal · 编码 Agent 邻接)
inbox/flyp 2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md 3 篇方法论级精读(BM25 Wins at Scale + DualG-MRAG + Filesystem-Based Memory + Hermes Agent Substack)
inbox/spark 2026-08-01-agent-e1prep.md 6 件 P0/P1 立标候选 + 2 件 P1/P2 邻接(详见风险主题页)
inbox/stephen 2026-08-01-ai-industry-e1prep.md 8 增量(Inkling-Small + EU AI Act 8-2 联动 + HF Daily 8-1 票榜 5 件新鲜榜首 + HF blog 8-1 5 件 + Sam Altman 8-1 华盛顿窗口 + Yann LeCun AMI Labs + OpenAI 安全工程 + HF Training Agents 3)
inbox/stephen 2026-08-01-llm-application-e1prep.md OpenAI 工程师披露 ChatGPT Agent 三层架构 + MSR Echoverse + MirrorCode + FutureAGI 五指标 + ByteByteGo + Lilian Weng Harness Engineering
paper_cards 近 3 天(7-30 ~ 8-1)新卡 IDs 638-688(约 51 张) coding-agents 主分类 = 660 RepoReasoner(2607.25996v1 · 7-31 已建)+ 647 CodeNib(2607.25431 · 7-30 已建)+ 644 Kontrast(2607.25959v1 · 7-30 已建);coding-agents 邻接 = 685 See2Think(2607.26769)+ 686 Filesystem-Based Memory(2607.26637)+ 674 DualG-MRAG(2607.28580)+ 675 GLM-RAG(2607.28397)+ 683 Σ-Mem(2607.27958)+ 687 MisKnow-Agent(2607.20891)+ 678 CoMem(2607.28263)+ 682 ShadowDancer(2607.28362 multimodal 邻接)
work-queue.md 8-1 22:00 自动生成 0 件高价值待深度解读 + 0 件待更新主题活文档 + 选题榜 1 件(2607.26637 Filesystem-Based Memory 已在 v42 §0.5 候选池未立视频脚本)+ 14 张卡缺 TLDR

0.2 信号密度判定

与 7-31 E1 24h「SkillRise + Metis critical-read 闭环 + VisualPatchWorld + TurboVLA + 4 P0 立标 + 安全五联立标层 + CoRT + DecoEvo + MindForge + SpecFirst = 第二十阈值饱和」相比,8-1 E1 24h 主线净增量定位 = 5 件 coding-agents 邻接 P1 + 1 件 P0 警示(MirrorCode + BM25 Wins at Scale + See2Think + Lilian Weng Harness Engineering + ByteByteGo 三层架构生产实例 + Anthropic Project Glasswing 8-1 续立)= 中等偏低 + 编码 Agent 主题主线净增量低 + 邻接补全 5 件


一、今日 coding-agents 主线最重要的 net-new 增量(5 条 + 1 警示)

增量 1 · 🟠 P0 警示 · MirrorCode Benchmark(METR/Epoch AI 8-1 发布)= 编码 Agent 评测时间粒度第三级(数周级)= 评测基础设施扩面

  • 来源
  • inbox/jay/2026-08-01-1050-jay-engineering-filter.md 条目 K2(⭐⭐⭐⭐⭐ · Import AI 466 · Jack Clark · 2026-08-01 · 真实可复现 + benchmark 数据具体 + GitHub repo)
  • inbox/jay/2026-08-01-1002-rss-import-ai.md(Import AI 466 标题:机器人领域的苦涩教训 + AI 完成长达一周的编程任务 + OpenAI 的意外 AI 黑客)
  • inbox/jay/2026-08-01-engineering-e1prep.md 增量 2(⭐⭐⭐⭐⭐ · v42 准备棒)
  • inbox/stephen/2026-08-01-1245-stephen-coordination-check-noon.md §四.2 Tier B #5(建议入 engineering §2.95 evaluation discipline)
  • inbox/stephen/2026-08-01-llm-application-e1prep.md 增量 3(🟡 P1 重大 · 与 MirrorCode 邻接)
  • URL:https://github.com/epoch-research/MirrorCode
  • 要点
  • Benchmark 设计(真实可复现):25 个目标程序 = pkl(Apple 可编程配置语言 · 61k LOC)+ gotree(系统发育树解析 · 16k LOC)+ qsv_select(CSV 列选择 · 87k LOC)+ ruff(Python linter/formatter);仅通过 CLI 访问目标程序源码(无源代码、无 web 访问),需完整重新实现
  • 具体性能数据Opus 4.7 在 gotree 多语言上 $100-$400 推理成本,14 小时完成25 个目标中 17 个达到 100% 正确率,4 个 >99%,8 个未达 100%,4 个未达 99%1 年前领先模型得分约 30%,仅能完成简单程序(如 calendar utility)
  • 关键判断(Jack Clark):"AI 系统能 self-orient:仅通过黑盒 I/O 访问就能从零构建对标原程序的自研实现。这意味着高度智能的 Agent 可能具有从真实世界 bootstrapping 工业文明形态的能力"—— Import AI 466 专家观点;
  • 与 v34 §2.3 评测表的关系:v34 §2.3 已收录 SWE-bench Verified(数十分钟级)+ SWE Marathon(长程)+ Program Bench + BenchLM weighted + Terminal-Bench 2.0/2.1 + Long-Horizon-Terminal-Bench + Multi-SWE-bench / DeNovoSWE + AgentLens + General AgentBench + AgentCompass + Agent-Diff + AlphaEval + MCP-Persona + LoCoBench-Agent + SpecBench + RoadmapBench / SWE-EVO / LongCLI-Bench + Atrex-Bench + Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph + Beyond Relevance-Centric Retrieval + AAAI Subramanian「Keyword search is all you need」+ LOCA-bench + MemoryAgentBench + BeyondUncertainty + A New Role for Relevance + Kontrast + Keep It InMind + 新颖 Déjà Vu = 评测表 22 + 6 = 28 行MirrorCode 补充"数周级评测"作为第 29 行 = 评测时间粒度第三级(SWE-bench 分钟级 → RepoReasoner repo 级 → MirrorCode 数周级 CLI-only);
  • 与 v34 §2.94 (d) RepoReasoner arXiv:2607.25996v1 的关系:RepoReasoner 是"代码库级推理评测 = Output Prediction 跨文件有状态执行" = repo 级;MirrorCode 是"数周级超长程 CLI-only re-implementation" = 数周级;两者构成评测粒度的两极(repo 级 vs 数周级)。
  • 与活文档 knowledge/coding-agents.md v34 现有脉络的关系
  • v34 §2.3 评测表 28 行(沿用)+ v34 §2.94 (d) RepoReasoner(沿用)+ v34 §2.94 (h) SWE-bench 系列扩展(沿用)+ v34 §2.1 Harness 学术化第四十二子节 LOCA-bench(沿用)→ 本场 = §2.3 评测表新增第 29 行 = MirrorCode 数周级超长程编程评测 = 评测时间粒度第三级 + §2.94 (h) SWE-bench 系列扩展新增 MirrorCode 邻接
  • v34 §3.1 共识 53(沿用)→ 本场 = 共识 54 候选新增 = "编码 Agent 评测时间粒度三档立标 = SWE-bench Verified 数十分钟级 + RepoReasoner arXiv:2607.25996v1 repo 级 + MirrorCode 数周级 CLI-only re-implementation = 三档补完"
  • v34 §4 开放问题 79(沿用)→ 本场 = 开放问题 80 候选新增 = "MirrorCode 'self-orient / bootstrapping 工业文明形态的能力' 是 Jack Clark 推测性判断还是研究结论?v2 待核实(属 Import AI 专家观点,非研究结论)"
  • v34 §5 边界(沿用):MirrorCode 与 evaluation.md 邻接 · MirrorCode 评测时间粒度与 SWE-bench 评测时间粒度构成两极对照 · MirrorCode CLI-only 黑盒接口边界 = fixture 设计最简边界
  • 建议归入节
  • §2.3 评测表 22 → 28 → 29 行(新增 MirrorCode 数周级超长程编程评测 = 评测时间粒度第三级)
  • §2.94 (h) SWE-bench 系列扩展(新增 MirrorCode 邻接 = 三档补完)
  • §3.1 共识 53 → 54 候选新增(评测时间粒度三档立标)
  • §4 开放问题 79 → 80 候选新增(Jack Clark「bootstrapping 工业文明形态」是推测性判断,待核实)
  • §5 边界(与 evaluation.md 邻接 · 与 SWE-bench 评测时间粒度对照 · CLI-only 黑盒接口边界 = fixture 设计最简边界)
  • arXiv 号无 arXiv(GitHub 直接发布 github.com/epoch-research/MirrorCode;METR/Epoch AI 联合发布;22/25 目标程序 + scaffold 在仓库公开)
  • card 状态:⚠️ paper_cards 未建(优先级极高,建议今晚 v21 立标前补建)

增量 2 · 🟡 P1 邻接 · Lilian Weng Harness Engineering for Self-Improvement(2026-07-04 Lil'Log 发布)= Harness 八元组公式 + 三 Pattern 系统框架 + Coding Agent 工具集完整定义 = v34 §2.1 学术 Harness 化 理论锚点

  • 来源
  • inbox/jay/2026-08-01-1001-rss-lilian-weng.md(Lilian Weng RSS · 2026-07-04 · Lilian Weng,OpenAI 前安全工程负责人)
  • inbox/jay/2026-08-01-engineering-e1prep.md 增量 3(⭐⭐⭐⭐⭐ · v42 准备棒)
  • URL:https://lilianweng.github.io/posts/2026-07-04-harness/
  • GitHub:github.com/karpathy/autoresearch(autoresearch 示例 repo)
  • 要点
  • Harness 核心公式(八元组)Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State——不是简单包装,而是完整的执行控制平面
  • Pattern 1: Workflow Automation(Karpathy autoresearch 为例):Goal-oriented loop: plan → execute → observe/test → improve → loop;关键:工作流图强调模型分析自身轨迹和失败案例,通过"agent runtime"而非静态 prompt 模板进行迭代
  • Pattern 2: FileSystem as Persistent Memory长期 agent 任务中 artifacts(实验日志/代码 diff/论文摘要/错误 trace)远大于 context window解决方案:用文件系统做持久化存储优势:利用模型本身读写文件能力,管理成本随模型能力提升自动下降与 Filesystem-Based Memory arXiv:2607.26637 立基础直接对位);
  • Pattern 3: Sub-agent and Backend Jobs主 agent 并行 spawn 多个 subagent并行性必须显式可检查(stored as files/logs/status records)主 agent 需要 process manager 能力:launch jobs/inspect logs/cancel failed runs/merge results;
  • Coding Agent 工具集(具体工具定义):文件系统(glob/grep/ls/read/read_many/write/edit/multi_edit/apply_patch)/ Shell(bash/PowerShell)/ IO(lsp/git_status/git_diff/git_commit)/ 外部上下文(MCP tools/Skills)/ Web(web_search/web_fetch/browser tools)/ Backend(CronCreate/CronDelete/CronList)/ Agent 委托(spawn_agent/resume_agent/wait_agent/list_agents/close_agent/interrupt_agent)
  • RSI 关键工程判断:"近期 RSI 的实际路径不太可能是模型直接重写自身权重。更现实的路径:harness 工程进化为 meta-methodology(改进构建模型的机器),同时模型能力通过 pretraining 自然增长"——与 v34 §2.93 (x) vLLM v0.25.0 架构 milestone 暗示的方向一致:基础设施层进化与模型能力进化两条腿。
  • 与活文档 knowledge/coding-agents.md v34 现有脉络的关系
  • v34 §1 第一段 v34 §2.7 ACE arXiv:2510.04618 + MCE arXiv:2601.21557 + Weng Harness 第 87 节点(沿用 v34 §2.1 第十一阶段 7-29 学术 Harness 4 联 + v34 第十一轮 4 联立标补全)→ 本场 = Weng Harness 第 87 节点(v34 第十一轮立标级 + 7-27 续立)= 八元组公式扩面 + Coding Agent 工具集完整定义 = §2.1 学术 Harness 化 理论锚点
  • v34 §2.7 Coding Agent 工具集(沿用 Anthropic Claude Code / Codex CLI / Cursor / NVIDIA Polar / OpenCode / Cline / Goose / Kilo Code / Kiro / Aider / Gemini CLI / MorphLLM 5 组件 / LangChain Open-Source Software Factory / LlamaIndex / Kimi Code CLI)→ 本场 = §2.7 Coding Agent 工具集新增 Weng 八元组公式 + Coding Agent 工具集 7 大类完整定义(文件系统 / Shell / IO / 外部上下文 / Web / Backend / Agent 委托 = 7 大类 28 件工具);
  • v34 §2.1 Harness 学术化 第十一阶段 7-29 学术 Harness 4 联立标补全 = 训练侧 Molt + 推理侧 MHLC + 持续学习 Learning on the Job 升级 P0 + QD-Search IDEAgent(沿用)→ 本场 = §2.1 第十一阶段扩面 = Weng Harness 八元组公式 + 三 Pattern 系统框架 = 与 Molt / MHLC / Learning on the Job / IDEAgent 形成 5 联立基础栖
  • v34 §3.1 共识 53(沿用)→ 本场 = 共识 54 候选新增 = "Harness = 八元组公式 + 三 Pattern 系统框架 = 学术 Harness 化理论锚点 = Lilian Weng Harness Engineering for Self-Improvement 7-04"
  • v34 §4 开放问题 79(沿用)→ 本场 = 开放问题 80 候选新增 = "Weng Harness 八元组公式 vs ByteByteGo OpenAI 三层架构(harness/API/inference)= 抽象级别不同两套切分 vs 同源对位 + v21 待合并"
  • v34 §5 边界(沿用):Weng Harness 与 agent.md §1.45 邻接 · 与 engineering.md §2.7 邻接 · 与 llm-application.md §1.1 邻接
  • 建议归入节
  • §1 第一段 Weng Harness 第 87 节点扩面(八元组公式 + 三 Pattern 系统框架 + Coding Agent 工具集 7 大类 28 件)
  • §2.1 第十一阶段 7-29 学术 Harness 4 联立标补全 → 5 联立基础栖(新增 Weng Harness 八元组公式 + 三 Pattern 系统框架 = 与 Molt / MHLC / Learning on the Job / IDEAgent 形成 5 联立基础栖)
  • §2.7 Coding Agent 工具集(新增 Weng 八元组公式 + Coding Agent 工具集 7 大类完整定义)
  • §3.1 共识 53 → 54 候选新增(Harness 八元组公式 + 三 Pattern 系统框架 = 学术 Harness 化理论锚点)
  • §4 开放问题 79 → 80 候选新增(Weng Harness 八元组公式 vs ByteByteGo OpenAI 三层架构 = 抽象级别不同两套切分,待合并)
  • §5 边界(与 agent.md §1.45 邻接 · 与 engineering.md §2.7 邻接 · 与 llm-application.md §1.1 邻接)
  • arXiv 号无 arXiv(直接发布于 lilianweng.github.io;7-04 早于 v34 第十四轮 7-31 收官;但作为学术 Harness 化理论锚点 v21 立标级别待激活)

增量 3 · 🟡 P1 邻接 · ByteByteGo ChatGPT Agent Loop 三层架构(OpenAI 工程师访谈)= Harness/API/Inference 三层职责分离的具体技术实现 = v34 §2.7 工业件套 + §2.5 推理工程学科化 补全

  • 来源
  • inbox/jay/2026-08-01-1050-jay-engineering-filter.md 条目 K1(⭐⭐⭐⭐⭐ · OpenAI 工程师直接受访 · blog.bytebytego.com/p/how-chatgpt-optimizes-its-agent-loop)
  • inbox/jay/2026-08-01-1000-rss-bytebytego.md(ByteByteGo RSS 8-1 全 5 篇 · 第 3 篇 = ChatGPT 如何优化其 Agent 循环)
  • inbox/jay/2026-08-01-engineering-e1prep.md 增量 1(⭐⭐⭐⭐⭐ · v42 准备棒)
  • inbox/stephen/2026-08-01-llm-application-e1prep.md 增量 1(🟡 P1 重大 · OpenAI 工程师披露 ChatGPT Agent 三层架构)
  • 要点
  • 三层架构(具体技术细节)
    • Harness 层:① Persistent WebSockets(减少连接建立开销)/ ② Stable prompt prefixes(缓存不变 prompt 前缀,避免重复 tokenize)/ ③ Deferred tool discovery(按需加载)/ ④ Code Mode(专用代码执行模式);
    • API 层:⑤ Tokenize only delta(仅对增量变化做 tokenize,而非全量)/ ⑥ Parallel safety checks(安全检查与推理并行化 race 机制);
    • Inference 层:⑦ Cache-aware routing(根据 KV cache 热度路由请求)/ ⑧ KV cache 生命周期管理 / ⑨ Speculative decoding(投机解码)/ ⑩ Prefill/decode separation(prefill 与 decode 解耦);
  • Benchmark 数据GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上得分高于 Fable 5,但 cost 不到 Fable 5 的一半(cost 数据缺具体数值,8000 字限制截断 ⚠️);
  • Agent Loop 执行流程(7 步):① Harness 接收任务("trace checkout regression, patch it, run tests")→ ② Harness 组装指令 + 工具定义 + 历史记录 → ③ API 做 JSON 验证/rate limit/preflight → ④ API tokenize 并 dispatch 到 inference 同时启动安全分类器 → ⑤ Inference 返回 tool call → ⑥ API decode token → ⑦ Harness 在沙箱执行 → append 结果 → 循环;
  • 关键工程判断:"AI 应用 ≠ LLM。LLM 只是其中一层。真实产品中,用户请求在到达 LLM 之前已经过了 harness 层和 API 层的多次处理"——三层职责分离是真实生产系统的普遍模式。
  • 与活文档 knowledge/coding-agents.md v34 现有脉络的关系
  • v34 §2.7 Anthropic Claude Code / Codex CLI / Cursor / NVIDIA Polar / OpenCode / Cline / Goose / Kilo Code / Kiro / Aider / Gemini CLI / MorphLLM 5 组件 / LangChain Open-Source Software Factory / LlamaIndex / Kimi Code CLI(沿用)+ v34 §1 第十九阈值 frontier lab 平台层竞速主战场(沿用)→ 本场 = §2.7 工业件套扩面 = OpenAI ChatGPT Agent 三层架构 = 生产系统实例 + Anthropic Claude Code + Cursor 等并列
  • v34 §2.94 (a) MCP 2026-07-28 史上最大协议更新(沿用)+ v34 §2.5 HACO 99.2% SLO 工程实证补全(沿用)→ 本场 = §2.94 (a) MCP + §2.5 HACO 扩面 = ByteByteGo 三层架构生产实例补全
  • v34 §3.1 共识 53(沿用)→ 本场 = 共识 54 候选新增 = "OpenAI ChatGPT Agent 三层架构 = Harness/API/Inference = 生产实例 + 编码 Agent 工业化层立基础"
  • v34 §4 开放问题 79(沿用)→ 本场 = 开放问题 80 候选新增 = "OpenAI ByteByteGo 三层架构数据缺 cost 具体数值(8000 字截断) + 三层架构 vs Weng Harness 八元组公式 = 抽象级别不同两套切分待合并"
  • v34 §5 边界(沿用):ByteByteGo 三层架构与 engineering.md §2.7 邻接 · 与 llm-application.md §1.1 邻接 · 与 llm-infra.md §1.(4) Fail-Plausible 五类邻接 · 与 risk.md §2.6 frontier lab + HF 官方 URL 沿用
  • 建议归入节
  • §2.7 工业件套扩面(新增 OpenAI ChatGPT Agent 三层架构 = 生产系统实例)
  • §2.94 (a) MCP + §2.5 HACO 扩面(新增 ByteByteGo 三层架构生产实例补全)
  • §3.1 共识 53 → 54 候选新增(OpenAI ChatGPT Agent 三层架构 = 编码 Agent 工业化层立基础)
  • §4 开放问题 79 → 80 候选新增(cost 数据缺具体数值 · 三层架构 vs Weng Harness 八元组公式待合并)
  • §5 边界(与 engineering.md / llm-application.md / llm-infra.md / risk.md 邻接)
  • arXiv 号无 arXiv(ByteByteGo 工程师访谈 + 工程 newsletter)
  • card 状态:⚠️ paper_cards 未建(优先级中高,建议今晚 v21 补建)

增量 4 · 🟡 P1 邻接 · See2Think arXiv:2607.26769(flyp 8-1 15:50 双精读)= MLLM 评测方法学「中间产物使用」第四联 + LEDGERMIND 形成「五维评测诊断完整闭环」 = §2.1 学术 Harness 化 + §2.3 评测 邻接

  • 来源
  • inbox/flyp/2026-08-01-1550-ShadowDancer-See2Think-critical-read.md(flyp 8-1 15:50 · ShadowDancer + See2Think 双精读 · See2Think 立标级)
  • inbox/tom/2026-08-01-agent-rag-longcontext-radar.md 条目 #6(HF Daily 8-1 · 21▲ · 主分类 multimodal)
  • inbox/stephen/2026-08-01-llm-application-e1prep.md 增量沿用
  • paper_cards/685-2607.26769.md(8-01 已建卡 · 主分类 multimodal · 形态 benchmark)
  • URL:https://arxiv.org/abs/2607.26769
  • 要点
  • 核心问题:MLLM 现在被期望在推理过程中产生「视觉中间态」(如 Seg-Zoom-In / Sketch / Visual CoT / Tool-Use 输出),但 ① 现有 benchmark 任务覆盖窄、部分样本可纯文本解决 + ② 评估只看最终答案,不诊断中间视觉态如何生成、渲染、被使用
  • 两件套方法
    1. See2ThinkBench:1,200 个开放视觉强需样本,12 任务类别 × 3 大类(2D structured / 3D scene / real-world reasoning),刻意排除可纯文本解决的样本;
    2. VAoT(Visual Action-of-Thought):四元组记录 = (textual thoughts, visual actions, rendered states, subsequent reasoning)4 种推理设置(controlled inference settings);
  • 关键反直觉发现:"模型通常能选对相关视觉操作——但忠实渲染(faithful rendering)仍是最大瓶颈"——这是反直觉且有价值的发现:选择正确的视觉操作 ≠ 渲染出能用的视觉态 = 提升中间视觉态的"渲染质量" 比"选择正确" 更紧迫
  • flyp 8-1 15:50 critical-read 立标建议§1 主线 4 评测方法学(二十三面体)新增 1 件 ★ 立标信号强 ★ + §1 主线 4「五维评测诊断完整闭环」:本场 + LEDGERMIND arXiv:2607.28374 = "答案接口 + 任务设计 + 训练环境 + 中间产物使用(本场)+ 证据账本可溯源" 五维。
  • 与活文档 knowledge/coding-agents.md v34 现有脉络的关系
  • v34 §2.3 评测表 28 行(沿用)+ v34 §2.4 反方实证 / 真实力边界(沿用)+ v34 §2.94 (g) Show Don't Tell 答案接口 + §2.94 (h) ActiveVision 任务设计 + §2.94 (i) Trace 训练环境(沿用 v34 §2.39.x 候补级)→ 本场 = §2.3 评测表新增第 29 行 = See2Think VAoT 过程诊断协议 + §2.94 (g/h/i) 三联评测诊断扩面为「四联 + LEDGERMIND 第五联」
  • v34 §1 第二十阈值立标 = SkillRise/Metis critical-read 闭环 + VisualPatchWorld 第三范式 + TurboVLA LLM 解构派 + 4 P0 立标候选 + 3 P1 立标候选(沿用 v34 第十四轮 7-31 04:20)→ 本场 = §1 第二十阈值扩面 = See2Think MLLM 评测方法学立标级 ★
  • v34 §3.1 共识 53(沿用)→ 本场 = 共识 54 候选新增 = "See2Think 五维评测诊断完整闭环 = 答案接口 + 任务设计 + 训练环境 + 中间产物使用 + 证据账本可溯源 = MLLM 评测方法学立标级"
  • v34 §5 边界(沿用):See2Think 与 multimodal.md §1.4 评测方法学邻接 · 与 llm-application.md §1.4 邻接 · 与 evaluation.md 邻接
  • 建议归入节
  • §2.3 评测表 22 → 28 → 29 行(新增 See2Think VAoT 过程诊断协议 = 第五联评测诊断)
  • §2.94 (g/h/i) 三联评测诊断扩面为「四联 + LEDGERMIND 第五联」(新增 See2Think 中间产物使用 + LEDGERMIND 证据账本可溯源)
  • §1 第二十阈值扩面(See2Think MLLM 评测方法学立标级 ★)
  • §3.1 共识 53 → 54 候选新增(See2Think 五维评测诊断完整闭环)
  • §5 边界(与 multimodal.md / llm-application.md / evaluation.md 邻接)
  • arXiv 号arXiv:2607.26769(See2Think: Do Multimodal Models Really Use Intermediate Visual States? · 10 pages, 5 figures, 8 tables · 13 作者团队 · paper_cards/685 8-01 已建卡 · 主分类 multimodal · 形态 benchmark)

增量 5 · 🟡 P1 邻接 · BM25 Wins at Scale arXiv:2607.26497(flyp 8-1 10:30 周六精读)= RAG 范式规模化重新审视 + BM25 回归 = v34 §2.6 第四十二子节 + §2.94 (m) Beyond Relevance-Centric Retrieval 邻接

  • 来源
  • inbox/flyp/2026-08-01-1030-sat-weekly-deep-read-rag-filesystem-dualg-bm25.md(flyp 8-1 10:30 周六精读 · 3 篇方法论级精读 = BM25 Wins at Scale ★ A + DualG-MRAG ★ B + Filesystem-Based Memory ★ C)
  • inbox/tom/2026-08-01-0900-hf-daily-2026-08-01.md 第 11 行(HF Daily 8-1 · 38▲)
  • URL:https://arxiv.org/abs/2607.26497
  • 要点
  • 核心问题:RAG 范式分词法(BM25)/ 稠密(dense)/ 图(graph-based indexing)/ 智能体搜索(agentic search),但通常在不同 benchmark 的单一语料规模下评测,accuracy-cost scaling 关系不清晰
  • 方法:用 EnterpriseRAG-Bench(511,959 文档 / 600.8M tokens / 500 题 + 722 gold + 326 traps + 99 lures)构造 28 个严格嵌套层级 / 450× 语料阶梯,固定 reader = Qwen3.6-27B + vLLM + 同一 judge protocol;
  • 核心结论(scale-dependent crossover 而非无条件胜者)File-System Agent 在最小层级领先,但 ~10M tokens 后 BM25 超越并锁定每一更大层级,到全量级(601M tokens)BM25 与 File-Agent 差距接近 20 分
  • Graph-based RAG 普遍遇 construction wallHippoRAG 2 止于 131,876 docs / MS-GraphRAG 止于 8,750 / LightRAG 止于 2,254其可扩展变体(LinearRAG)在共享层级仍低于 BM25
  • 核心结论:"语料扩张越来越偏向全局候选排序,词法检索是最强可扩展默认智能体推理更适合在排序发现之后运行而非取代它"——颠覆"graph 总是更好"的工程假设
  • flyp 8-1 10:30 critical-read 反方审稿证伪线 L1-L3(⭐⭐⭐⭐⭐):① EnterpriseRAG-Bench 单一 benchmark 外推风险 ② File-System Agent 80-call 预算 = 伪天花板 ③ HippoRAG 2 / MS-GraphRAG / LightRAG 截止 = 论文 system 失败而非 RAG 范式失败。
  • 与活文档 knowledge/coding-agents.md v34 现有脉络的关系
  • v34 §2.3 评测表 28 行(沿用)+ v34 §2.94 (m) Beyond Relevance-Centric Retrieval arXiv:2607.19747(沿用 v34 §2.3 第五十二节点)+ AAAI Subramanian「Keyword search is all you need」arXiv:2602.23368v1(v34 §2.3 第五十三节点 立标级)→ 本场 = §2.3 评测表新增第 29 行 = BM25 Wins at Scale 28-tier 严格嵌套 + §2.94 (m) Beyond Relevance-Centric Retrieval + AAAI Subramanian「Keyword search is all you need」形成「RAG 范式转折三联立」
  • v34 §1 第十九阈值立标 = 评测第六维 7 件立标饱和 + 长上下文 anchor 4 范式饱和(沿用 v34 第十三轮 7-31 04:20)→ 本场 = §1 第十九阈值扩面 = RAG 范式转折 arXiv 号核证三联立 + BM25 Wins at Scale 立标级
  • v34 §3.1 共识 53(沿用)→ 本场 = 共识 54 候选新增 = "RAG 范式转折三联立 = AAAI Subramanian 'Keyword search is all you need' arXiv:2602.23368v1 + Beyond Relevance-Centric Retrieval arXiv:2607.19747 + BM25 Wins at Scale arXiv:2607.26497 = 词法检索是可扩展默认 + agentic rerank 优于 agentic 全程搜索"
  • v34 §4 开放问题 79(沿用)→ 本场 = 开放问题 80 候选新增 = "BM25 Wins at Scale EnterpriseRAG-Bench 单一 benchmark 外推风险(学术 / 法律 / 医疗 / 论文 / 专利长文+概念检索语料下 BM25 '~20 点领先'是否仍成立未被验证)+ File-System Agent 80-call 预算 = 伪天花板(200-call 或 turn-aware budget 是否夺回部分曲线)+ Graph-RAG 截止 = 实现失败而非范式失败"
  • v34 §5 边界(沿用):BM25 Wins at Scale 与 rag.md §2.4 Graph RAG + §2.5 Hybrid Retrieval + §2.7 检索优化第 4 路径邻接 · 与 agent.md §2.2 Filesystem-Based Memory 邻接 · 与 multimodal.md §1.2 RAG 五路 → 决策与证据系统邻接
  • 建议归入节
  • §2.3 评测表 22 → 28 → 29 行(新增 BM25 Wins at Scale 28-tier 严格嵌套 = 第五十四节点)
  • §2.94 (m) Beyond Relevance-Centric Retrieval + AAAI Subramanian 扩面为「RAG 范式转折三联立」(新增 BM25 Wins at Scale = 词法检索是可扩展默认)
  • §1 第十九阈值扩面(RAG 范式转折 arXiv 号核证三联立 + BM25 Wins at Scale 立标级)
  • §3.1 共识 53 → 54 候选新增(RAG 范式转折三联立)
  • §4 开放问题 79 → 80 候选新增(EnterpriseRAG-Bench 单一 benchmark 外推 · File-Agent 80-call 预算 = 伪天花板 · Graph-RAG 截止 = 实现失败)
  • §5 边界(与 rag.md / agent.md / multimodal.md 邻接)
  • arXiv 号arXiv:2607.26497(BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms · USTC + Metastone + BAAS · v1 2026-07-30 · 28-tier / 450× · HF Daily 8-1 38▲)

警示 1 · 🟠 P0 警示 · Anthropic Project Glasswing 8-1 续立 + Mythos Preview AES Möbius Bridge 思维链 = v34 §1 frontier lab × 安全工程 + §2.5 第 10 阶 SteerGuard + 第十九阈值立标级 第 11 件 持续长尾

  • 来源
  • inbox/stephen/2026-08-01-1004-news-yt-anthropic.md(Anthropic YT 8-1 5 件 · 含 Project Glasswing 致力于保护全球软件安全)
  • inbox/stephen/2026-08-01-1002-news-anthropic-news.md(Anthropic news 8-1 多件)
  • inbox/stephen/2026-08-01-ai-industry-e1prep.md 增量 2 + 增量 4(⭐⭐⭐⭐ + ⭐⭐⭐⭐ · EU AI Act 8-2 deadline 临门联动)
  • inbox/flyp/2026-08-01-risk-e1prep.md(flyp 8-1 风险主题 EU AI Act 临门 + Project Glasswing 续接)
  • 要点
  • Project Glasswing 8-1 续立:Anthropic YT 8-1 发布「Project Glasswing 致力于保护全球软件安全」= v34 §1 第十九阈值 frontier lab × 安全工程 第 4 次协同披露 续立;
  • Mythos Preview AES Möbius Bridge 思维链 7-30 续立:v34 §1 第十九阈值 第 10 件立标 已固化 7-31 04:20,8-1 持续评论层长尾
  • Anthropic 7-22~7-30 五栖立标持续长尾 8 天立标密度最高一周 + 8-1 续立
    • Opus 5 系统卡 7-27 morning(沿用)
    • Economic Index connector 7-27 morning(沿用)
    • Economic Futures Research Fund 议程第二阶段(沿用)
    • Public First Action 再捐 2000 万美元(沿用)
    • 7-29 NEW「使用 Claude 发现密码学弱点」(沿用)
    • 7-29 NEW「我们对开放权重模型的立场」(沿用)
    • 7-30 NEW Mythos Preview AES Möbius Bridge 思维链(沿用)
    • 8-1 NEW Project Glasswing 续立(本场增量)
    • = Anthropic 7-22~8-1 八栖立标持续长尾 10 天立标密度最高一周(沿用 v34 §1 第十九阈值 第 10 件 7 栖验证 第 1 例 + 8-1 扩面为 8 栖)
  • OpenAI 8-1「推进欧洲负责任 AI」公开表态 + Sam Altman 8-1 华盛顿窗口 = frontier lab × 监管治理 × 国际协作 三栖对位 8-1/8-2 联动 = EU AI Act 8-2 deadline 24h 临门 + 美国侧对位立法/自愿评估框架同步。
  • 与活文档 knowledge/coding-agents.md v34 现有脉络的关系
  • v34 §1 第十九阈值 frontier lab × 安全工程 + 代理化扩展 + 路线层 + 资本层 + 国家科学战略 + 评论层 + 工业 MCP 安全 + 检索范式转折 十二栖合流立标(沿用 v34 §1 第一段)→ 本场 = §1 第十九阈值扩面 = Anthropic 7 栖 → 8 栖续立 + Project Glasswing 8-1 续立 + EU AI Act 8-2 deadline 24h 临门
  • v34 §2.5 安全契约 + 4 RCE CVE + Self-State Attacks 第 9 阶 + HACO 99.2% SLO + SeerGuard 第 10 阶 + AgentCI MCP 安全 + Isolation-as-First-Class 第 11 阶(沿用)+ v34 §2.5 Agent 安全三联立标层 = Cyber-Capable + OWASP ASI + microsoft/agent-governance-toolkit(沿用 v34 §2.5 7-30 新立标)→ 本场 = §2.5 第 10 阶 SeerGuard + Agent 安全三联 + Project Glasswing 8-1 续立 = frontier lab × 安全工程 第四次协同披露
  • v34 §5 边界(沿用):Project Glasswing 与 risk.md §2.6 frontier lab + HF 官方 URL 沿用 · 与 agent.md §2.5 邻接
  • 建议归入节
  • §1 第十九阈值扩面(Anthropic 7 栖 → 8 栖续立 + Project Glasswing 8-1 续立 + EU AI Act 8-2 deadline 24h 临门)
  • §2.5 第 10 阶 SeerGuard + Agent 安全三联 + Project Glasswing 8-1 续立(frontier lab × 安全工程 第四次协同披露)
  • §3.1 共识 53 → 54 候选新增(Anthropic 八栖立标持续长尾 10 天立标密度最高一周 = frontier lab × 安全工程立基础栖饱和)
  • §5 边界(与 risk.md / agent.md 邻接)
  • arXiv 号无新 arXiv(Anthropic YT 8-1 + Anthropic news 8-1 = 治理/公告线索 · 无 arXiv 编号 · 沿用 v34 §1 第十九阈值 第 10 件 Mythos Preview AES Möbius Bridge 7-30 已有 arXiv 号 · 8-1 Project Glasswing 无 arXiv)

二、值得警惕的矛盾或待核实说法

  1. MirrorCode 25 目标程序是否覆盖 Windows GUI / Web 应用 / Mobile APP? v34 §2.3 评测表 28 行 = CLI-only Unix 命令行生态;MirrorCode "仅通过 CLI 访问目标程序源码" 是 Unix 命令行生态成立条件,对 Windows GUI / Web 应用 / Mobile APP 类型程序不适用;评测覆盖面有限 ⚠️。待 v21 立标时确认"目标程序选择偏差" 是否需要补充文档说明。
  2. MirrorCode 评测成本极高:单目标程序完成需 14 小时 + $100-$400 推理成本;25 个目标全部测完需要数十天 GPU 时间 + 数千美元——评测成本可能限制社区采用需观察后续 leaderboard 信誉度 ⚠️。
  3. MirrorCode "AI 可能 bootstrapping 工业文明形态的能力" 是 Jack Clark 推测性判断(Import AI 466 专家观点),非研究结论v42 §3.2 争议 #6「榜单热度是否可作立标证据」延伸 = 「专家观点 vs 研究结论」的对位 ⚠️。
  4. ByteByteGo 原文 8000 字截断,cost 数据无具体数值("GPT-5.6 Sol cost 不到 Fable 5 一半" 是方向性表述,缺精确数值),精读全文前不宜引用为精确工程数据 ⚠️。
  5. OpenAI 工程师口径的"三层"是 ChatGPT Agent 系统的实现层抽象,与 Lilian Weng 的"Harness 八元组公式"是抽象级别不同的两套切分——前者偏运行时 pipeline,后者偏系统组件v21 §1 整合两者时需说明"两层抽象同时存在,不互相替代" ⚠️。
  6. See2Think 1,200 样本偏小v34 既有多模态评测样本规模对照 = VLM-CapCurriculum(规模?)/ LongVQUBench / TimeLens2(397B 限定)/ OCT-Bench——1,200 属于"小规模精准" 而非"大规模覆盖"优势:严格排除纯文本可解样本劣势:跨域泛化声明受限 ⚠️。
  7. See2Think 4 种推理设置未完全覆盖 MLLM 推理栈:实际推理栈有 5-7 个关键节点(prompt 设计 / 视觉 token 插入位置 / 渲染工具 / 中间态缓存 / 多轮反馈等),4 设置只能部分覆盖 ⚠️。
  8. See2Think head-to-head 缺:vs MIRA arXiv:2511.02779 v1(Visual CoT 评测)+ VisCoT(NeurIPS 2024)+ MLLM-as-a-Judge + Benchmarking Visual State Tracking arXiv:2606.03920 + VLM-CapCurriculum head-to-head 缺 ⚠️。
  9. BM25 Wins at Scale EnterpriseRAG-Bench 单一 benchmark 外推风险(⭐⭐⭐⭐⭐):所有数据点都来自 EnterpriseRAG-Bench(511,959 文档,9 类来源:wiki / 聊天 / 工单 / 邮件 / 会议转录 / CRM / code review 等),是"虚构 LLM inference 公司"语料;公司内部 wiki + 工单 + 邮件这一组合天然偏好 BM25 词法信号(人名、版本号、错误码、Jira ticket id);对学术 / 法律 / 医疗 / 论文 / 专利等长文+概念检索语料,BM25 的"~20 点领先"是否仍成立未被验证 ⚠️。
  10. BM25 Wins at Scale File-System Agent 80-call 预算 = 伪天花板(⭐⭐⭐⭐⭐):File-System Agent 限制为 80 LLM calls/question;corpus scaling 时"sequential exploration"成本爆炸(39× query tokens at bedrock)80-call 预算可能在 1M tokens 内饱和若给 200-call 或 turn-aware budget,File-Agent 可能在 10M-50M 区间夺回部分曲线而 BM25 在更大语料下的领先幅度会缩水 ⚠️。
  11. BM25 Wins at Scale HippoRAG 2 / MS-GraphRAG / LightRAG 截止 = 论文 system 失败而非 RAG 范式失败(⭐⭐⭐⭐⭐)HippoRAG 2 止于 131,876 docs / MS-GraphRAG 止于 8,750 / LightRAG 止于 2,254不是 RAG 范式的天花板而是这些具体实现的工程天花板作者把"实现截止"等同于"范式失败"是常见混淆 ⚠️。
  12. Inkling-Small 是否真有官方模型卡发布? Ben's Bites 8-1 1003 标题是「我有一个 Inkling(周末阅读链接)」,暗示这只是周末阅读材料;TLDR AI 8-1 头条「Inkling-Small 🧠」= 是 v33 7-31 头条「Inkling + GPT-5.6 降价 + Gemini Robotics 2」的延续并提到 Inkling-Small未找到 Inkling-Small 独立的官方 HF 模型卡 URL建议核实是 Thinking Machines 在 7-31 已发布 Small 档,还是仅为预告 / 传闻 ⚠️。
  13. Sam Altman Capitol Hill 预览「未公开新模型」具体是哪一款? 报道仅说「预览未公开新模型」,未给出模型名。Sam Altman 7-27 X 帖称「GPT-5.6 Sol 已 SoTA ARC-AGI-3」与 Capitol Hill 预览是否同模型需要核实若是 GPT-5.6 Sol 之外的独立新模型,可能是下一轮 frontier lab 大动作前兆 ⚠️。
  14. Anthropic 8-1 YT Glasswing 与 7-30「调查网络安全评估三起真实事件」的因果关系? v33 §2.142 主线 (176) 沿用「Glasswing + 调查三起真实事件」同源;8-1 YT 上 Glasswing 是 Anthropic 8-1 的延续动作还是宣布新 Glasswing 版本需要核实 ⚠️。
  15. MSR SkillOpt + Memora 7-25 双连发是否在 v34 §2.4 第五十七节点候选完成闭环? v34 §2.4 学术 Harness 4 维度叠加饱和触发 v36 维度收敛判定候选(沿用 v34 §2.4 §1 第一段):维度 3 = MSR Memora 谐波记忆 + MSR SkillOpt(沿用);8-1 paper_cards 批次未新增 Memora / SkillOpt 卡——闭环状态需 v21 立标时确认 ⚠️。

三、可引用的 arXiv 号列表(按主题归类 · 仅列出 7-30 ~ 8-1 期间的新论文 + 持续立标)

3.1 编码 Agent 主分类 · 评测邻接(4 件)

  • arXiv:2607.26497 —— BM25 Wins at Scale · 28-tier / 450× / EnterpriseRAG-Bench / HF Daily 8-1 38▲ · 增量 5
  • arXiv:2607.28580v1 —— DualG-MRAG · Beihang BUAA · ACM MM 2026 / 2607.28580v1 / Tom 8-1 radar #1
  • arXiv:2607.28397v1 —— GLM-RAG · GLM vs GNN vs 向量检索系统性对比 / Tom 8-1 radar #2
  • arXiv:2607.26769 —— See2Think · 13 作者团队 · 10 pages, 5 figures, 8 tables · paper_cards/685 8-01 已建卡 / HF Daily 8-1 21▲ · 增量 4

3.2 编码 Agent 邻接 · Memory / RAG / Harness / Multimodal(11 件)

  • arXiv:2607.27958 —— Σ-Mem · 多智能体在线可靠性记忆 / HF Daily 8-1 21▲ / paper_cards/683 8-01 已建卡
  • arXiv:2607.26637 —— Filesystem-Based Memory · UIUC + UCSD + UC Merced + Adobe + Texas A&M / HF Daily 8-1 21▲ / paper_cards/686 8-01 已建卡 · 选题榜 1 件(未立视频脚本)
  • arXiv:2607.28362 —— ShadowDancer · video world model / Alaya Lab + 上海创新学院 / project page shadowdancer-1.github.io · flyp 8-1 09:50 + 15:50 双精读 · paper_cards/682 8-01 已建卡
  • arXiv:2607.28263 —— CoMem · Qwen3-8B 冻结 + rank-32 LoRA + 层轴缓存 / ACL Rolling Review · flyp 8-1 09:50 精读 · paper_cards/678 8-01 已建卡
  • arXiv:2607.20891 —— MisKnow-Agent · Deep Research 误导知识传播量化 / paper_cards/687 8-01 已建卡
  • arXiv:2607.28126 —— ConMem · 工业巡检贡献感知记忆 / paper_cards/676 8-01 已建卡
  • arXiv:2607.28319 —— Fairness Pruning · GLU-MLP 层人口统计学偏置定位 / paper_cards/684 8-01 已建卡
  • arXiv:2607.26760v1 —— Metis · Memory Foundation Model · 240▲ · 沿用 v34 §2.139 + 立基础栖候选
  • arXiv:2607.27919 —— Memory Decoder at Scale · 参数化长期记忆 / HF Daily 8-1 45▲
  • arXiv:2607.27380 —— VideoCoCo · Agent 化双引擎物理一致视频生成的 Code-as-CoT / HF Daily 8-1 61▲
  • arXiv:2607.28595 —— Beacon · 何时及如何进行 Agent 化视觉推理 / HF Daily 8-1 44▲

3.3 编码 Agent 邻接 · 模型 / 平台 / 综述(5 件)

  • arXiv:2607.24653 —— Kimi K3 · 2.8T MoE · 50B 激活 · 1M ctx · MXFP4 + MXFP8 QAT · SWE Marathon 42.0 #1 / Program Bench 77.8 #1 / Terminal-Bench 2.1 88.3 · 沿用 v34 §2.2 主权开源 立基础栖 双联
  • arXiv:2602.15763 —— GLM-5/GLM-5.2 · 744B 总参 / 40B 激活 · 1M context · DSA + IndexShare · AIME 2026 99.2 #1 / SWE-bench Pro 62.1 #1 / Terminal-Bench 81.0 · 沿用 v34 §2.2 主权开源 立基础栖 双联
  • arXiv:2607.26410 —— Voice Memory · 语音 Agent Listener-Thinker-Speaker 模态分离记忆 / Tom 8-1 v2 radar #2
  • arXiv:2607.26520v1 —— Graph-Native Bitemporal Memory Store · agent-local Neo4j + HNSW + 全 bitemporal / Tom 8-1 v2 radar #3
  • arXiv:2607.27136v1 —— KAMR · Knowledge-Aligned Multi-hop Retrieval for Graph-based RAG · anchor vs connected 二分法 / Tom 8-1 v2 radar #4

3.4 持续立标 · 已建 paper_cards · v34 沿用(7 件)

  • arXiv:2607.25996v1 —— RepoReasoner · paper_cards/660 7-31 已建 · 沿用 v34 §2.94 (d)
  • arXiv:2607.25431 —— CodeNib · paper_cards/647 7-30 已建 · 沿用 v34 §2.94
  • arXiv:2607.25959v1 —— Kontrast · paper_cards/644 7-30 已建 · 沿用 v34 §2.94
  • arXiv:2607.25236 —— VisualPatchWorld · paper_cards 已建 · 沿用 v34 §2.94
  • arXiv:2607.26784 —— SkillRise · paper_cards/659 7-30 已建 · 沿用 v34 §2.4 第 19 件候选
  • arXiv:2607.25308 —— CAST · paper_cards/662 7-30 已建 · 沿用 v34 §2.4 第 20 件候选
  • arXiv:2602.07962 —— LOCA-bench · 沿用 v34 §2.1 第四十二子节 + §2.3 评测表

3.5 非 arXiv 但可引用(6 件)

  • Lilian Weng Harness Engineering for Self-Improvement(lilianweng.github.io/posts/2026-07-04-harness/)· 增量 2
  • ByteByteGo ChatGPT Agent Loop 三层架构(blog.bytebytego.com/p/how-chatgpt-optimizes-its-agent-loop)· 增量 3
  • MirrorCode Benchmark(github.com/epoch-research/MirrorCode · METR/Epoch AI)· 增量 1
  • MSR SymCrypt Rust 密码学符号验证(microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code)· 沿用 v34 §2.5 frontier lab × 密码学 第 8 维立基础
  • MSR Echoverse Computer-Use Agent 合成世界(microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents)· 沿用 v34 §2.6
  • Anthropic Project Glasswing 8-1 YT · 警示 1

3.6 card 缺失重点提醒(v21 启动前必须补建卡 · 优先级极高)

HF Daily 8-1 票榜首 15 件中,仅 3 件(Metis / CLBench-V / Σ-Mem / ConMem / See2Think = 沿用 v33)已建 paper_cards其余 12 件(AskChem / Qwen-UI-Agent / PhiZero / Frontis-MA1 / DistillAlign / VideoCoCo / Memory Decoder at Scale / Beacon / BM25 Wins at Scale / Flux-OPD / MPIE-Bench / ACE-Data-0 / Beyond Borrowed Histories)⚠️ paper_cards 全部未建(stephen 8-1 ai-industry-e1prep 警示沿用)。建议今晚 v21 立标前优先建卡: - P0 立标候选 = 必建 3 件:PhiZero arXiv:2607.28624(150▲ · 物理语言世界模型)/ Frontis-MA1 arXiv:2607.28568(144▲ · RSI)/ Memory Decoder at Scale arXiv:2607.27919(45▲ · 参数化长期记忆) - P1 立标候选 = 高优 4 件:Qwen-UI-Agent arXiv:2607.28227(265▲ · 国内 GUI Agent 立标)/ VideoCoCo arXiv:2607.27380(61▲ · 物理一致视频生成)/ Beacon arXiv:2607.28595(44▲ · Agent 化视觉推理)/ BM25 Wins at Scale arXiv:2607.26497(38▲ · RAG 范式转折)


四、本主题与邻接主题的边界(沿用 v34 §7 · 本棒微调)

  • agent.md(通用 agent 主题页)分工:本主题只覆盖编码 / 软件工程方向。Σ-Mem arXiv:2607.27958 + Filesystem-Based Memory arXiv:2607.26637 + MirrorCode + BM25 Wins at Scale 与 agent.md §1.45 frontier lab 9 栖 + §2.2 记忆与上下文工程 第六十二/六十三节点 邻接(本棒新增:Σ-Mem 与 Filesystem-Based Memory 立标候选已被 agent-e1prep-v37 spark 8-1 13:30 立标 → 双向 reference 强度升级)。
  • evaluation.md(评测方法学主题页)分工:MirrorCode + BM25 Wins at Scale + See2Think 与 evaluation.md 邻接(本棒新增:评测时间粒度第三级 + RAG 范式转折三联立 + 五维评测诊断完整闭环 = 与 evaluation.md R32 §4 维度矩阵双向更新)。
  • risk.md(风险主题页)分工:Project Glasswing 8-1 续立 + Anthropic 8-1 YT + Mythos Preview AES Möbius Bridge 思维链 7-30 续立 + EU AI Act 8-2 deadline 24h 临门 与 risk.md §2.6 frontier lab + HF 官方 URL 沿用(本棒新增:frontier lab × 监管治理 × 国际协作 三栖对位 8-1/8-2 联动 第 1 例 双向 reference)。
  • engineering.md(工程主题页)分工:ByteByteGo 三层架构 + Lilian Weng Harness Engineering 八元组公式 + Simon Willison MCP 2.0 stateless + MSR Echoverse 与 engineering.md §2.7 Agentic Engineering 学科化 + §2.5 推理工程学科化 邻接(本棒新增:Weng Harness 八元组公式作为 §2.7 学术 Harness 化理论锚点 + §2.5 推理工程学科化 补全)。
  • multimodal.md(多模态主题页)分工:See2Think + ShadowDancer + CoMem 与 multimodal.md §1.4 评测方法学 + §2.39.x VLA 飞轮 邻接(本棒新增:See2Think 五维评测诊断完整闭环与 multimodal.md §1.4 第四联 双向 reference)。
  • llm-application.md(应用主题页)分工:ByteByteGo + Lilian Weng Harness + MSR Echoverse + FutureAGI 五指标 与 llm-application.md §1.1 应用架构 + §1.4 评测与可靠性 邻接(本棒新增:v42 §1.1 应用架构已立基础 + 本场 ByteByteGo + Lilian Weng 八元组公式 = §1.1 补全"具体生产实例")。
  • llm-infra.md(推理基础设施主题页)分工:ByteByteGo 三层架构 Inference 层(Cache-aware routing / KV cache 生命周期管理 / Speculative decoding / Prefill-decode separation) + Anthropic Project Glasswing 与 llm-infra.md §2.10 工程基础设施 邻接(本棒新增:ByteByteGo Inference 层技术细节补全 §2.5 推理工程学科化)。

五、本场对 v21 接力(今晚活文档)的具体动作建议

5.1 立标动作(高优 · v21 启动前必做)

  1. §2.3 评测表 28 → 29 行新增 MirrorCode + See2Think + BM25 Wins at Scale(3 行新增 · 与现有 28 行并列)
  2. §2.94 (g/h/i) 三联评测诊断扩面为「四联 + LEDGERMIND 第五联」(新增 See2Think 中间产物使用 + LEDGERMIND 证据账本可溯源)
  3. §2.7 Coding Agent 工具集扩面 = Weng Harness 八元组公式 + Coding Agent 工具集 7 大类完整定义(28 件工具 · 与现有 Anthropic Claude Code / Codex CLI 等并列)
  4. §2.7 工业件套扩面 = OpenAI ChatGPT Agent 三层架构 = 生产系统实例(与 Anthropic Claude Code + Cursor 等并列)
  5. §1 第十九阈值扩面 = Anthropic 7 栖 → 8 栖续立 + Project Glasswing 8-1 续立 + EU AI Act 8-2 deadline 24h 临门
  6. §1 第二十阈值扩面 = See2Think MLLM 评测方法学立标级 ★
  7. §1 第十九阈值扩面 = RAG 范式转折 arXiv 号核证三联立 + BM25 Wins at Scale 立标级
  8. §2.94 (m) Beyond Relevance-Centric Retrieval + AAAI Subramanian 扩面为「RAG 范式转折三联立」(新增 BM25 Wins at Scale)

5.2 共识 / 争议 / 开放问题动作(4 条候选新增)

  1. §3.1 共识 53 → 54 候选新增(4 条候选新增:评测时间粒度三档立标 / Harness 八元组公式 / OpenAI ChatGPT Agent 三层架构 = 工业化层立基础 / See2Think 五维评测诊断完整闭环 / RAG 范式转折三联立 / Anthropic 八栖立标持续长尾)
  2. §3.2 争议 39 → 41 候选新增(2 条候选新增:MirrorCode 专家观点 vs 研究结论 / ByteByteGo 三层 vs Weng Harness 八元组公式 = 抽象级别不同两套切分)
  3. §4 开放问题 79 → 80 候选新增(6 条候选新增:MirrorCode Windows GUI/Web 应用覆盖 / MirrorCode 评测成本极高 / MirrorCode bootstrapping 工业文明形态 / ByteByteGo cost 数据缺具体数值 / Weng Harness vs ByteByteGo 两套切分 / BM25 Wins at Scale EnterpriseRAG-Bench 外推 / BM25 Wins at Scale File-Agent 80-call 预算 / BM25 Wins at Scale Graph-RAG 截止 = 实现失败 / See2Think 1,200 样本偏小 / See2Think 4 推理设置覆盖 / See2Think head-to-head 缺)
  4. §5 边界双向 reference 强度升级(6 主题页与邻接主题边界微调)

5.3 必读清单动作(v21 启动前必补 paper_cards · 优先级极高)

  • P0 立标候选 = 必建 3 件:PhiZero arXiv:2607.28624(150▲)/ Frontis-MA1 arXiv:2607.28568(144▲)/ Memory Decoder at Scale arXiv:2607.27919(45▲)
  • P1 立标候选 = 高优 4 件:Qwen-UI-Agent arXiv:2607.28227(265▲)/ VideoCoCo arXiv:2607.27380(61▲)/ Beacon arXiv:2607.28595(44▲)/ BM25 Wins at Scale arXiv:2607.26497(38▲)
  • P1 邻接补全 = 中优 5 件:AskChem arXiv:2607.28618(285▲)/ DistillAlign arXiv:2607.26811(87▲)/ Flux-OPD arXiv:2607.28022(37▲)/ MPIE-Bench arXiv:2607.27616(35▲)/ ACE-Data-0 arXiv:2607.28625(34▲)/ Beyond Borrowed Histories arXiv:2607.27816(30▲)

5.4 跨主题协调动作

  • agent.md 双向 reference 升级:Σ-Mem 与 Filesystem-Based Memory 立标候选已被 spark 8-1 13:30 agent-e1prep-v37 立标(§2.2 第六十三节点候选)→ 与 coding-agents.md 双向 reference 强度升级
  • evaluation.md 双向 reference 升级:MirrorCode + BM25 Wins at Scale + See2Think 与 evaluation.md R32 §4 维度矩阵 双向更新
  • risk.md 双向 reference 升级:Project Glasswing 8-1 续立 + EU AI Act 8-2 deadline 24h 临门 与 risk.md §2.6 frontier lab + HF 官方 URL 沿用
  • engineering.md 双向 reference 升级:ByteByteGo + Lilian Weng Harness 八元组公式 作为 §2.7 Agentic Engineering 学科化理论锚点
  • multimodal.md 双向 reference 升级:See2Think 五维评测诊断完整闭环与 multimodal.md §1.4 第四联 双向 reference
  • llm-application.md 双向 reference 升级:v42 §1.1 应用架构已立基础 + 本场 ByteByteGo + Lilian Weng 八元组公式 = §1.1 补全"具体生产实例"
  • llm-infra.md 双向 reference 升级:ByteByteGo Inference 层技术细节(Cache-aware routing / KV cache 生命周期管理 / Speculative decoding / Prefill-decode separation)补全 §2.5 推理工程学科化

六、本场结论

8-1 E1 24h 净增量定性 = 中等偏低 + 主线净增量低 + 邻接补全 5 件 + 警示 1 件。承接 v34 第十三轮 19 阈值 + 第十四轮 SkillRise/Metis 闭环 + VisualPatchWorld + TurboVLA + 4 P0 + 安全五联立标层 + 第二十阈值饱和之后,编码 Agent 主题 8-1 边际增量核心

  1. 增量 1 P0 警示 MirrorCode = 编码 Agent 评测时间粒度第三级(数周级 CLI-only re-implementation)+ 与 RepoReasoner + SWE-bench 构成三档补完(5 → 6 行新增)
  2. 增量 2 P1 邻接 Lilian Weng Harness Engineering 八元组公式 = §2.1 学术 Harness 化 理论锚点 + Coding Agent 工具集 7 大类 28 件完整定义(理论锚点升级)
  3. 增量 3 P1 邻接 ByteByteGo 三层架构生产实例 = §2.7 工业件套扩面 + §2.5 推理工程学科化 补全(生产实例补全)
  4. 增量 4 P1 邻接 See2Think MLLM 评测方法学 = §2.94 (g/h/i) 三联评测诊断扩面为「四联 + LEDGERMIND 第五联」+ 第二十阈值扩面(评测方法学立标级 ★)
  5. 增量 5 P1 邻接 BM25 Wins at Scale = RAG 范式转折三联立 + §1 第十九阈值扩面(RAG 范式转折立标级)
  6. 警示 1 P0 警示 Anthropic Project Glasswing 8-1 续立 = §1 第十九阈值扩面 = Anthropic 7 栖 → 8 栖续立 + EU AI Act 8-2 deadline 24h 临门(frontier lab × 安全工程立基础栖饱和)

净新增主线强增量 0 件 + 跨主题补全 5 件 P1 + 警示 2 件 P0 = 净增量 5 条 + 警示 2 条 = 7 条(注:警示 1 已计入 §1 第十九阈值扩面,与增量 5 邻接)。

v21 立标动作优先级: - P0 必做 3 件:① MirrorCode 评测表新增第 29 行 ② Weng Harness 八元组公式 §2.7 工具集完整定义 ③ ByteByteGo 三层架构 §2.7 工业件套扩面 - P1 必做 3 件:④ See2Think §2.94 四联 + LEDGERMIND 第五联扩面 ⑤ BM25 Wins at Scale §2.94 (m) RAG 范式转折三联立 ⑥ Project Glasswing 8-1 §1 第十九阈值 8 栖续立

v21 立标后预期结构变化: - §1 第十九阈值 8 栖续立 + 第二十阈值扩面 = 12 栖合流 → 13 栖合流 - §2.3 评测表 28 → 29 行 - §2.94 (g/h/i) 三联 → 五联 - §2.7 工业件套 + 工具集 28 件完整定义 - §3.1 共识 53 → 54 候选新增(4 条候选新增) - §4 开放问题 79 → 80 候选新增(6 条候选新增) - §5 边界双向 reference 强度升级(6 主题页微调)

arXiv 号归类汇总(本场新增 + 持续立标 共 20+ 件): - 编码 Agent 主分类 + 评测邻接 4 件:arXiv:2607.26497 + arXiv:2607.28580v1 + arXiv:2607.28397v1 + arXiv:2607.26769 - 编码 Agent 邻接 Memory/RAG/Harness/Multimodal 11 件:arXiv:2607.27958 + arXiv:2607.26637 + arXiv:2607.28362 + arXiv:2607.28263 + arXiv:2607.20891 + arXiv:2607.28126 + arXiv:2607.28319 + arXiv:2607.26760v1 + arXiv:2607.27919 + arXiv:2607.27380 + arXiv:2607.28595 - 编码 Agent 邻接 模型/平台/综述 5 件:arXiv:2607.24653 + arXiv:2602.15763 + arXiv:2607.26410 + arXiv:2607.26520v1 + arXiv:2607.27136v1 - 持续立标 已建 paper_cards v34 沿用 7 件:arXiv:2607.25996v1 + arXiv:2607.25431 + arXiv:2607.25959v1 + arXiv:2607.25236 + arXiv:2607.26784 + arXiv:2607.25308 + arXiv:2602.07962 - 非 arXiv 但可引用 6 件:Lilian Weng Harness Engineering + ByteByteGo ChatGPT Agent Loop + MirrorCode + MSR SymCrypt Rust + MSR Echoverse + Anthropic Project Glasswing 8-1 YT - card 缺失重点提醒 v21 启动前必须补建 12 件:AskChem 285▲ + Qwen-UI-Agent 265▲ + PhiZero 150▲ + Frontis-MA1 144▲ + DistillAlign 87▲ + VideoCoCo 61▲ + Memory Decoder at Scale 45▲ + Beacon 44▲ + BM25 Wins at Scale 38▲ + Flux-OPD 37▲ + MPIE-Bench 35▲ + ACE-Data-0 34▲ + Beyond Borrowed Histories 30▲