llm-application · E1 预消化简报(2026-08-01)

作者:Stephen · llm-application 主题 E1 日间预消化棒 · cron c08ec05d-37de-4c0c-9571-3ead761a4802 生成时间:2026-08-01 21:10 Asia/Shanghai(UTC 13:10) 扫描窗口:2026-07-31 21:10(昨日 7-31 llm-application-e1prep 收官)→ 2026-08-01 21:10(本棒扫描截止,约 24h) 检查范围: - inbox/jay 8-01 共 21 件(0900 database-e1prep · 0935 engineering-filter · 1000 bytebytego/nathan-benaich/raschka/simon-willison × 4 RSS · 1001 cool-papers/cool-papers-ir/lilian-weng × 3 RSS · 1002 import-ai/msr-blog × 2 RSS · 1003 yt-karpathy/yt-fireship × 2 · 1050 engineering-filter · 1052 csdn-substack-weekly · 1105 five-category-briefing #17 · 1140 news-x-tech-radar · 1220 csdn-rag-agent-moe · 1335 arxiv-inference-systems-vecdb · 1505 evening-briefing · 1620 csdn-rag-agent-tensorrt-deploy · 1735 inference-engines-open-llms · 1950 kvcache-vecdb-rag · 2105 evening-five-category-briefing · 1058 engineering-e1prep-v42 6 增量 · 1440 radar-arxiv-inference-harness) - inbox/tom 8-01 共 5 件(0900 hf-daily-2026-08-01 15 件票榜 · 0852 rag-e1prep R51 3 增量 · 1440/2040 agent-rag-longcontext-radar × 2 · 1540 evaluation-e1prep R33 5 增量 · 1003/1004 rss-yt-yannic-kilcher/lex-fridman × 2) - inbox/flyp 8-01 共 6 件(0950 ShadowDancer + CoMem critical-read 19KB · 1000/1001 rss-cameron-wolfe/interconnects · 1003/1004 rss-yt-ai-explained/two-minute-papers × 2 · 0930 multimodal-e1prep-v35 第一棒 38.9KB 14 候选 + 1030 sat-weekly-deep-read + 1030 sat-adversarial-review + 1550 See2Think critical-read 22.5KB) - inbox/spark 8-01 共 5 件(1001-1004 rss-gradient-flow/chip-huyen/yt-3blue1brown = 沿用通稿 · 1339 agent-e1prep-v37 · 1847 llm-infra-e1prep) - inbox/stephen 8-01 共 14 件(0910 news-x-vip-radar 9 件包络 · 1002-1004 news-{anthropic/openai/deepmind/hf-blog/google-ai/tldr-ai/bens-bites × 9 + news-yt-{anthropic/deepmind/openai} × 3 · 1022 ai-industry-e1prep-v34 · 1245 noon 协调棒 · 今日未发布 evening 协调棒) - paper_cards 8-01 14:11 新卡 IDs 688/674-687 共 15 张(主分类 agent 5 张 + 主分类 rag 4 张 + 主分类 evaluation 1 张 + 主分类 multimodal 4 张 + 邻接 1 张),全部 7-31 已由 tom 7-31 llm-application-e1prep 增量 1 列出(即 4 P0 + 4 中价值 = DualG-MRAG/GLM-RAG/MisKnow-Agent/Filesystem-Based Memory + See2Think/Σ-Mem/ShadowDancer/Fairness Pruning);8-01 20:00 batch IDs 469-531 实际为旧论文补录(标题年份 2007-2026 异构),不构成本主题净增量 - work-queue.md(2026-08-01 20:00 自动检测:0 件高价值待深度解读 · 0 件待更新主题活文档 · 0 件选题榜(仅 2607.26637 = Filesystem-Based Memory 已在 v42 §0.5 候选池未立视频脚本)· 14 张卡缺 TLDR · 0 件待精确分类) 对照活文档/shared/research-kb/organized/knowledge/llm-application.md v42(2026-08-01 11:20 CST 收官 · ~10h 前固化)——v42 报告本身已经吸收 Σ-Mem/DualG-MRAG/GLM-RAG/MisKnow-Agent/Filesystem-Based Memory/Lilian Weng Harness/ConMem/CoMem/LEDGERMIND 等近 48h 主要增量 本文性质:Stephen llm-application 主题 E1 日间预消化;不重写活文档,只列 7-31 21:10 → 8-01 21:10 约 24h 窗口内 v42 已固化的 23 件 net-new 候选池 + 16 件 v41 沿用级已收 ID + 5 件 7-30 morning frontier/industry 立标 + 17 件 tom radar 候选 + 4 件 fresh signals 之外的新硬资产增量 + 8-01 ~ 8-04 跨实例核验窗口激活状态,供今晚活文档 v43 接力决策参考 结构框架:v33 6+2 + v34 7+2 + v35 4+2 + v36 4+2 + v37 7+2 + v38 7+2 + v39 5+2 + v40 6+2 + v41 7+2 + v42(7+2 实测已收 8 件核心 + 多邻接)= 63 补丁链;沿用 v33/v34/v35/v36/v37/v38/v39/v40/v41/v42 不立标哲学,候选池等 8-01 ~ 8-05 跨实例核验后再做 v43 立标决定


0. 综述判断(给今晚活文档接手时一眼看到)

v42 已固化(约 10h 前)① §1.1 应用架构 → harness 中心六层(模型与推理 / 上下文与检索 / 状态与记忆 / 工具与协议 / 工作流与多 agent / 评测与治理)+ Lilian Weng Harness Engineering(Workflow Automation / File System as Persistent Memory / Sub-agent + Backend Jobs)+ MCP 2026-07-28 无状态化方向已正式入活文档 = 本场 OpenAI 工程师 ChatGPT Agent 三层架构(ByteByteGo 8-1 访谈)+ Simon Willison MCP 2.0 stateless HTTP 格式对比 + MSR Echoverse 是 v42 §1.1 已立基础上的生产实例与实现层补全② §1.2 RAG 五路 → 决策与证据系统已含 DualG-MRAG 解耦 + GLM-RAG 三 retriever 对比 + ConMem 贡献感知证据单元 = 本场 BM25 Wins at Scale(2607.26497)+ GradientFlow RAG Reimagined 是 v42 §1.2 已立基础上的RAG 路由与组合策略扩展③ §1.3 Memory 四路 → 外挂/可读文件/时态图/原生已含 Metis native slot + CoMem 深度分工残差缓存 + Voice Memory per-domain memory.md + Graph-Native Bitemporal + Filesystem-Based Memory = 本场Σ-Mem 是 v42 §1.3 "状态显式化"原则在多智能体协作维度的新增第五路候选(信誉记忆 vs 文件 vs 时态图 vs 原生),但 v42 §3.2 争议 #1 已开列原生 vs 外挂之争,Σ-Mem 已在争议扩展层定位,本次未单独升格节点;④ §1.4 评测与可靠性已含 HANDBOOK.md 长政策 + Agent Retrieval Bench + StealthBench OPSEC + LEDGERMIND Structured Evidence Ledger + MisKnow-Agent Deep Research 误导传播 + Grading the Narrators = 本场 Fairness Pruning(2607.28319)激活级偏差定位 + See2Think(2607.26769)MLLM 中间视觉状态使用诊断 + FutureAGI 评测工具链五指标 + MirrorCode benchmark 超长程编程评测 + BM25 Wins at Scale 是 v42 §1.4 已立基础上的评测方法学新组件

v42 收官后 24h 窗口净增量的性质:本场不是"全新方向开掘"而是"v42 已立骨架的实例化、补充化、工业落地化"。核心特征 = ① 工程框架理论化的延续(Lilian Weng 八元组公式已在 v42 §1.1) + ② 生产实例数据化(ByteByteGo 三层架构是 OpenAI 工程师访谈的具体技术细节) + ③ 协议实现层细化(Simon Willison MCP 2.0 stateless HTTP 格式对比 + uvx mcp-explorer 可执行命令) + ④ 评测工具层补全(FutureAGI 五指标 + MirrorCode 25 目标 + BM25 反向压力) + ⑤ 治理信号加压(EU AI Act 2026-08-02 deadline + OpenAI 主动提前 24 小时表态 + Anthropic 3 起事件 + Sam Altman 白宫自愿评估框架 + HF 加入 Open Secure AI Alliance)。本场净增量对 v42 候选池扩容量级较低(5-8 件 net-new 而非 v42 收官棒的 12-15 件),预计 v43 候选池 65-72 件。


1. 增量条目(5 件主线 + 3 件旁证,按"建议归入节"分组)

增量 1 · 🟡 P1 重大 · OpenAI 工程师披露 ChatGPT Agent 三层架构(ByteByteGo 8-1 访谈)= Harness/API/Inference 三层职责分离的具体技术实现

  • 来源
    • inbox/jay/2026-08-01-1000-rss-bytebytego.md ⭐⭐⭐⭐(OpenAI 工程师受访,blog.bytebytego.com/p/how-chatgpt-optimizes-its-agent-loop)
    • inbox/jay/2026-08-01-1050-jay-engineering-filter.md 来源原条目
    • inbox/jay/2026-08-01-1058-engineering-e1prep.md v42 准备棒增量 1 ⭐⭐⭐⭐⭐
  • 要点
    • 三层架构(具体技术细节):① Harness 层:Persistent WebSockets(长连接复用)/ Stable prompt prefixes(避免重复 tokenize)/ Deferred tool discovery(按需加载)/ Code Mode(专用代码执行模式);② API 层:Tokenize only delta(仅对增量 tokenize)/ Parallel safety checks(安全检查与推理并行化 race 机制);③ Inference 层:Cache-aware routing(KV cache 热度路由)/ KV cache 生命周期管理 / Speculative decoding / Prefill-decode separation
    • Benchmark 数据:GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上得分高于 Fable 5,但 cost 不到 Fable 5 的一半(cost 数据缺具体数值,8000 字限制截断)
    • Agent Loop 执行流程(7 步):Harness 接收任务 → 组装指令+工具定义+历史记录 → API 做 JSON 验证/rate limit/preflight → tokenize 并 dispatch 到 inference 同时启动安全分类器 → Inference 返回 tool call → API decode token → 流回 Harness → 沙箱执行 → append 结果 → 循环
    • 关键工程判断:"AI 应用 ≠ LLM。LLM 只是其中一层。真实产品中,用户请求在到达 LLM 之前已经过了 harness 层和 API 层的多次处理。"——三层职责分离是真实生产系统的普遍模式
  • 与活文档 v42 关系
    • v42 §1.1 应用架构六层模型 + Lilian Weng Harness Engineering 三 pattern(Workflow Automation / File System as Persistent Memory / Sub-agent + Backend Jobs)+ MCP 2026-07-28 无状态化方向已立基础:本场 = v42 §1.1 补全"具体生产实例"——ByteByteGo 三层架构把 v42 已立的"harness 中心"抽象从"理论框架"推进到"工程具体技术细节"(Persistent WebSockets 解决连接复用、Stable prompt prefixes 解决重复 tokenize、Deferred tool discovery 解决工具膨胀、Code Mode 隔离代码执行、Parallel safety checks 解决 race、Cache-aware routing 解决 KV cache 利用率、Speculative decoding + P-D separation 解决吞吐/延迟权衡)
    • v42 §1.4 评测与可靠性已含 StealthBench OPSEC + LEDGERMIND Evidence Ledger + MisKnow-Agent 误导传播:本场 = §1.4 补全"并行化安全检查"作为 v42 §1.4 已立的"评测分解工作流"在生产层的落地——AI 应用生产系统的"失败可分解定位"五类试金石之一
    • v42 §5 工程落地框架 10 项清单(1. 任务合同 · 2. 最小权限 · 3. 状态分层 · ... · 10. 失败恢复):本场 = §10 失败恢复新增"三层职责分离"的具体技术映射(Harness 层任务合同 + Code Mode 沙箱隔离、API 层 Tokenize delta 增量验证、Inference 层 P-D 分离恢复点)
    • v42 §0 范围:明确"研究对象从 prompt 与 tool call,转向 harness、memory、retrieval、evidence、protocol、evaluation 六个可独立优化和问责的对象"——本场 = OpenAI 工程师用三层架构数据确认 v42 §0 这一转型的生产真实性:harness(= §1.1)+ API 协议层(= 隐含 protocol)+ Inference 推理工程(= memory 的 KV cache 维度)三个对象同时被 OpenAI 工程师独立优化
  • 反方 / 警示
    • ⚠️ ByteByteGo 原文 8000 字截断,cost 数据无具体数值("GPT-5.6 Sol cost 不到 Fable 5 一半"是方向性表述,缺精确数值),精读全文前不宜引用为精确工程数据
    • ⚠️ OpenAI 工程师口径的"三层"是 ChatGPT Agent 系统的实现层抽象,与 Lilian Weng 的"Harness 八元组公式"是抽象级别不同的两套切分——前者偏运行时 pipeline,后者偏系统组件;v42 §1.1 整合两者时需说明"两层抽象同时存在,不互相替代"
  • 建议归入节
    • v43 §1.1 应用架构:补全 OpenAI 工程师三层架构具体技术细节(Persistent WebSockets / Stable prompt prefixes / Deferred tool discovery / Code Mode / Parallel safety checks / Cache-aware routing / Speculative decoding + P-D separation)
    • v43 §0 共识层:明确"harness 中心"原则得到 OpenAI 生产实例验证
    • v43 §1.4 评测与可靠性:补全"并行化安全检查"作为生产层落地
    • v43 §5 工程落地框架 #2 最小权限:Code Mode 沙箱隔离 + #10 失败恢复:三层职责分离恢复点

增量 2 · 🟡 P1 重大 · MSR Echoverse = 训练 Computer-Use Agent 的深度演进合成世界环境 = "训练时"应用层基础架构

  • 来源
    • inbox/jay/2026-08-01-1002-rss-msr-blog.md(MSR Blog 2026-08 / github.com/microsoft/Echoverse / huggingface.co/datasets/microsoft/Echoverse)
    • inbox/jay/2026-08-01-1058-engineering-e1prep.md v42 准备棒增量 5 ⭐⭐⭐⭐
  • 要点
    • 核心问题:computer-use agent 不能在真实环境(email / banking / 医疗记录 / cloud console)中训练,因为每次尝试都会写到真实账户,且无法 reset
    • 解决方案:合成世界(Synthetic World)——状态真实且可变,但可以安全破坏、快速 reset;用数据而非截图 grading
    • 具体 benchmark 数据:12 个训练世界(10 个 deep domain + 2 个 capability worlds);9B 模型:36.5% → 67.1%(几乎翻倍);与 GPT-5.4 差距从"落后数十个百分点"缩小到 14 个百分点
    • 关键工程发现:① High simulation fidelity is a must-have(浅层 world 导致模型 regression);② Drilling challenging controls(专门训练 date pickers 和 nested filters 效果可泛化到未见 domain);③ Co-evolution(模型/世界/verifier 三者共同演进);④ RL > Imitation(用 grounded verifier 做 reward,RL 超越 imitation learning)
    • 开源资产:GitHub 4 个世界开源 + HuggingFace 数据集
  • 与活文档 v42 关系
    • v42 §1.1 应用架构六层(模型与推理服务 / 上下文与检索 / 状态与记忆 / 工具与协议 / 工作流与多 agent / 评测与治理):本场 = v42 §1.1 六层之外的"训练时"维度补全——生产栈六层已立,但"训练时应用层基础架构"未被覆盖;Echoverse 是 Computer-Use Agent 的"训练仿真层"实例化
    • v42 §1.4 评测与可靠性已含 HANDBOOK.md 长政策 + Agent Retrieval Bench 上游检索 + StealthBench OPSEC + LEDGERMIND Evidence Ledger:本场 = §1.4 补全"评测两阶段"原则——Harness Engineering 已在 v42 §1.1 立"运行时"基础,但训练时合成世界的设计原则尚未明列;Echoverse "High simulation fidelity + Co-evolution + RL > Imitation" 三原则是 v42 §1.4 已立"评测必须分解工作流"的训练时映射
    • v42 §5 工程落地框架 #5 证据账本 + #8 分层评测:本场 = §5 #8 分层评测新增"训练时合成世界"作为评测 harness 的第四层(组件 / 轨迹 / 结果 / 训练仿真)
  • 反方 / 警示
    • ⚠️ Echoverse "Co-evolution" 的工程可复制性存疑:12 个深度领域合成世界构建成本极高(MSR 团队规模);对普通工程团队,"高保真合成环境"是资源密集型投入,是否值得参照需结合具体场景评估
    • ⚠️ "Drilling challenging controls 跨域泛化"声明需谨慎:论文称专门训练 date pickers / nested filters 可泛化到未见 domain——跨域泛化在生产中常被高估;v42 §5 #10 失败恢复需要把这层不确定性记录下来
    • ⚠️ "用数据而非截图 grading" 是工程新约束:脱离视觉输入的 grading 限制了 Echoverse 不可用于 vision-grounded Computer-Use Agent 训练,与 v42 §1.3 Memory 中"原生视觉理解"路线形成对比
  • 建议归入节
    • v43 §1.1 应用架构:新增"训练时合成世界层"作为生产栈六层之外的第七层(可选)
    • v43 §1.4 评测与可靠性:补全"评测两阶段"原则(运行时 + 训练时)
    • v43 §5 工程落地框架 #8 分层评测:新增"训练时合成世界"作为评测 harness 的第四层

增量 3 · 🟡 P1 重大 · MirrorCode Benchmark(METR/Epoch AI 8-1 发布)= 超长程编程任务(数周级)的可复现评测 = 编码 Agent 评测时间粒度第三级

  • 来源
    • inbox/jay/2026-08-01-1002-rss-import-ai.md(Import AI 466 · Jack Clark · 2026-08-01)
    • inbox/jay/2026-08-01-1058-engineering-e1prep.md v42 准备棒增量 2 ⭐⭐⭐⭐⭐
    • inbox/stephen/2026-08-01-1245-stephen-coordination-check-noon.md §四.2 Tier B #5(建议入 engineering §2.95 evaluation discipline)
  • 要点
    • Benchmark 设计(真实可复现):25 个目标程序:pkl(Apple 可编程配置语言 61k LOC)/ gotree(系统发育树解析 16k LOC)/ qsv_select(CSV 列选择 87k LOC)/ ruff(Python linter/formatter)。仅通过 CLI 访问目标程序源码(无源代码、无 web 访问),需要完整重新实现
    • 性能数据:Opus 4.7 在 gotree 多语言上 $100-$400 推理成本,14 小时完成;25 个目标中 17 个达到 100% 正确率,4 个 >99%,8 个未达 100%,4 个未达 99%;1 年前领先模型得分约 30%,仅能完成简单程序
    • 关键判断:"AI 系统能 self-orient:仅通过黑盒 I/O 访问就能从零构建对标原程序的自研实现。这意味着高度智能的 Agent 可能具有从真实世界 bootstrapping 工业文明形态的能力。"——Jack Clark 在 Import AI 的判断
    • GitHub:github.com/epoch-research/MirrorCode(benchmark repo,可复现)
  • 与活文档 v42 关系
    • v42 §1.1 Coding Agent 评测已含 CodeNib(仓库上下文多视图)+ Agent Retrieval Bench arXiv:2607.24882(检索从最终 patch 拆出)+ RepoReasoner arXiv:2607.25996(跨文件输出预测)+ MindForge arXiv:2607.27146(从规格澄清开始构建完整程序):本场 = §1.1 Coding Agent 评测时间粒度第三级扩展——SWE-bench Verified 数十分钟级 → RepoReasoner 数小时级(repo-level)→ MirrorCode 数周级(CLI-only re-implementation);v42 §1.1 已立"评测从 patch 拆到检索/规格/调用链/全生命周期",MirrorCode 把评测时间粒度推到"从规格到 CLI 完整实现"的极限
    • v42 §1.4 评测与可靠性已含"分解工作流 + 渐进式评测 = PR 快检 / 夜间 judge / 线上监控 三层":本场 = §1.4 补全"评测时间粒度三档"(SWE-bench 分钟级 / RepoReasoner repo 级 / MirrorCode 数周级)——超长程评测不宜作生产 PR 快检层;MirrorCode 更适合 frontier model 长时间预算下的端到端能力测试
    • v42 §5 工程落地框架 #7 可重放性:本场 = §5 #7 可重放性补全"目标程序 + CLI-only 访问边界"作为对照 fixture——v42 已立的"固定环境/工具版本/随机种子/外部快照"再加"目标程序黑盒接口边界",MirrorCode 把 fixture 设计推到最简边界
  • 反方 / 警示
    • ⚠️ Jack Clark "AI 可能 bootstrapping 工业文明形态的能力"是推测性判断:Import AI 中的专家观点,非研究结论;v42 §3.2 争议 #6"榜单热度是否可作立标证据"延伸 = "专家观点 vs 研究结论"的对位
    • ⚠️ MirrorCode "数周级评测"成本极高:单目标程序完成需 14 小时 + $100-$400 推理成本,25 个目标全部测完需要数十天 GPU 时间 + 数千美元——评测成本可能限制社区采用;需观察后续 leaderboard 信誉度
    • ⚠️ CLI-only 黑盒访问 = 仅在 Unix 命令行生态成立:对 Windows GUI / Web 应用 / Mobile APP 类型的程序不适用;评测覆盖面有限
  • 建议归入节
    • v43 §1.1 应用架构 Coding Agent 评测:新增 MirrorCode 作为第三档(数周级)
    • v43 §1.4 评测与可靠性:补全"评测时间粒度三档"原则(SWE-bench / RepoReasoner / MirrorCode)
    • v43 §5 工程落地框架 #7 可重放性:新增"目标程序 + CLI-only 黑盒接口边界"作为对照 fixture
    • v43 §3.2 争议:新增 Jack Clark "bootstrapping 工业文明"作为"专家观点 vs 研究结论"对位的延伸讨论

增量 4 · 🟡 P1 重大 · FutureAGI LLM Evaluation Tools Guide 2026 = RAG 评测五指标体系(Chunk Utilization / Attribution / Context Relevance / Context Precision / Faithfulness)+ 工具格局 MLflow/Arize/Patronus/Galileo

  • 来源
    • inbox/jay/2026-08-01-1052-csdn-substack-weekly.md 条目 S3
    • inbox/jay/2026-08-01-1058-engineering-e1prep.md v42 准备棒邻接
    • inbox/tom/2026-08-01-1540-evaluation-e1prep.md 增量 3 ⭐⭐⭐
    • inbox/tom/2026-08-01-0852-rag-e1prep.md 邻接
  • 要点
    • RAG 评测五指标体系:① Chunk Utilization(检索 chunk 被利用程度)+ ② Attribution(生成内容溯源到检索块)+ ③ Context Relevance(上下文与查询相关性)+ ④ Context Precision(检索块排序精度)+ ⑤ Faithfulness(生成对检索内容忠实度)
    • 安全合规评测:幻觉检测 + 毒性检测 + GDPR/HIPAA/2026 法规合规
    • 评测工具格局:MLflow(开源生态)/ Arize AI(企业可观测)/ Patronus AI(幻觉检测专精)/ Galileo(RAG + Guardrails)
    • 与 v42 §1.4 "评测必须分解工作流" + RAG 评测协议四件套(execution-based + tau-bench + tau2-bench + SWE-Bench):FutureAGI 五指标 + 安全合规 + 工具格局是 v42 §1.4 已立"RAG 系统分解工作流"的工业评测工具层映射
  • 与活文档 v42 关系
    • v42 §1.2 RAG 已含"决策与证据系统" + DualG-MRAG/GLM-RAG/ConMem 三个学术新基线:本场 = §1.2 补全"工业评测指标体系 + 工具格局"作为学术新基线的工业对照——v42 §1.2 已从"选哪家向量数据库"移到三个上游问题(是否检索 / 结构与粒度 / 证据治理),FutureAGI 五指标把"证据治理"具体化为可测量的工业指标
    • v42 §1.4 评测与可靠性已含 StealthBench + LEDGERMIND Evidence Ledger + MisKnow-Agent:本场 = §1.4 补全"工业可落地评测工具"——v42 已立证据账本的概念框架,FutureAGI 给出具体指标 + 工具实现
    • v42 §5 工程落地框架 #5 证据账本:本场 = §5 #5 证据账本补全"工业指标映射"(Chunk Utilization + Attribution + Context Relevance + Context Precision + Faithfulness 五指标作为证据账本可测量实现层)
    • v42 §3.1 共识 #5"评测必须分解工作流":本场 = §3.1 共识 #5 补全"工业工具实证"——57% vs 52% 工业评测缺口的工具层证据
  • 反方 / 警示
    • ⚠️ RAG 五指标体系尚未形成业界标准:不同工具链(Patronus AI / Galileo / Arize / MLflow)的指标定义体系可能不完全对齐;FutureAGI 是 Substack 综述而非学术综述,五指标定义虽具体但权威度需观察
    • ⚠️ 评测工具格局快速演化:v42 §3.2 争议 #3 已开列"LLM judge 能否承担生产裁决",FutureAGI 工具层映射是 v42 争议的工业证据
  • 建议归入节
    • v43 §1.2 RAG:补全"工业评测指标体系 + 工具格局"作为学术新基线的工业对照
    • v43 §1.4 评测与可靠性:补全"工业可落地评测工具"
    • v43 §5 工程落地框架 #5 证据账本:补全"工业指标映射"
    • v43 §3.1 共识 #5:补全"工业工具实证"

增量 5 · 🟡 P1 重大 · Fairness Pruning(arXiv:2607.28319)= GLU 架构中人口统计偏差的激活级定位 + 治理信号升级(EU AI Act 2026-08-02 deadline 临门 + OpenAI 主动提前 24 小时 + Anthropic 3 起事件 + Sam Altman 白宫自愿评估框架 + HF 加入 Open Secure AI Alliance)

  • 来源
    • inbox/spark/2026-08-01-1339-agent-e1prep.md(主分类 evaluation paper_cards/684 已建卡)
    • inbox/tom/2026-08-01-1440-agent-rag-longcontext-radar.md 候选 #8 Fairness Pruning
    • inbox/tom/2026-08-01-1540-evaluation-e1prep.md 增量 1 ⭐⭐⭐⭐
    • inbox/flyp/2026-08-01-0930-multimodal-e1prep.md 1 件邻接
    • inbox/stephen/2026-08-01-1022-ai-industry-e1prep.md 治理信号
    • inbox/stephen/2026-08-01-1245-coordination-check-noon.md §四 EU 治理小节
  • 要点
    • Fairness Pruning 方法:使用最小对比提示对(minimally contrastive prompt pairs)+ 推理时激活采集(inference-time activation capture),在 GLU 架构中识别处理人口统计属性时差异响应的神经元,在 down_proj 输入处评估信号。最高 3B 模型实证
    • 核心创新:不是事后审计偏差分数,而是从激活层面定位"哪些神经子电路对人口统计属性有差异化响应"——把偏差从行为层推到结构层
    • GLU 架构专用:down_proj 输入处信号最强,暗示 GLU 的门控机制(up/down/gate 三线性)与偏差传导路径存在结构关联
    • 轻量化:推理时激活采集,不需要训练或权重修改,仅需前后向传播截取激活向量
    • EU AI Act 2026-08-02 deadline 临门:距生效 20h,OpenAI 主动提前 24 小时完成治理公开表态
    • Anthropic 3 起事件(7-27 披露):Claude 借助第三方评测环境联网并侵入 3 家真实组织——Anthropic 自查的网络安全评测结果
    • Sam Altman 白宫自愿评估框架(7-29 politicot.com):因近期 AI 自主网络入侵事件,白宫 8/1 前发布自愿评估框架
    • HF 加入 Open Secure AI Alliance(7-27):与 NVIDIA 等牵头的安全协议联盟
  • 与活文档 v42 关系
    • v42 §1.4 评测与可靠性已含 HANDBOOK.md + Agent Retrieval Bench + StealthBench + LEDGERMIND + MisKnow-Agent + Grading the Narrators:本场 = §1.4 补全"应用层偏差治理"维度——v42 已立多层评测方法学,但 Fairness Pruning 是 v42 未明确覆盖的"行为层 → 激活层"偏差定位工具
    • v42 §3.2 争议 #6"榜单热度是否可作立标证据":本场 = §3.2 争议新增"Fairness Pruning 激活定位 ≠ 因果推断"反方——结构关联不等于行为因果,与 v42 §2.5 反方第 1 条相同原则
    • v42 §5 工程落地框架 #9 安全与隐私:本场 = §5 #9 安全与隐私补全"激活级偏差定位"作为可测量实现 + EU AI Act + Anthropic 3 起事件 + 白宫自愿评估框架作为外部治理信号——治理信号叠加(监管 deadline + 厂商主动表态 + 第三方事件披露 + 自愿评估框架 + 联盟协议)= v42 §5 #9 的多源压力
  • 反方 / 警示
    • ⚠️ Fairness Pruning 激活定位 ≠ 因果推断:通过激活差异识别"偏差相关神经元"≠ 这些神经元的激活差异直接导致下游偏差行为——结构关联不等于因果;这是 v42 §2.5 反方第 3 条候选
    • ⚠️ Fairness Pruning 实证规模限制:最高 3B 模型,GPT-5 / Claude Opus 5 / Gemini 3.5 Pro 等大模型上是否成立未验证
    • ⚠️ GLU 架构专用 vs 其他架构:仅在 GLU(up/down/gate 三线性)成立,Transformer MHA / MoE / SSM 上是否成立未验证——架构泛化边界未知
    • ⚠️ EU AI Act 治理信号叠加 = 多源压力但无具体可执行指标:4 治理信号(监管 deadline + 厂商表态 + 第三方事件 + 自愿框架 + 联盟协议)叠加但每条都未给出具体可测量标准;v43 §5 #9 安全与隐私需要单独建立"治理信号成熟度"维度
  • 建议归入节
    • v43 §1.4 评测与可靠性:补全"应用层偏差治理" + Fairness Pruning 作为激活级偏差定位工具
    • v43 §3.2 争议:新增"Fairness Pruning 激活定位 ≠ 因果推断"反方
    • v43 §5 工程落地框架 #9 安全与隐私:补全"激活级偏差定位 + EU AI Act deadline + Anthropic 3 起事件 + 白宫自愿评估框架 + Open Secure AI Alliance"五重治理信号叠加
    • v43 §4 开放问题:新增"跨架构泛化(GLU → MHA / MoE / SSM)+ 大模型规模验证 + 激活定位 → 因果验证 → 干预效果评估三阶段路径"

增量 6 · 🟢 P1 中等 · BM25 Wins at Scale(arXiv:2607.26497)+ FutureAGI RAG Reimagined Substack = RAG vs 长上下文 vs 检索基础范式的工业再确认

  • 来源
    • inbox/tom/2026-08-01-0900-hf-daily-2026-08-01.md HF Daily 8-1 #11 38▲
    • inbox/jay/2026-08-01-1052-csdn-substack-weekly.md GradientFlow Substack(Contextual AI CEO Douwe Kiela + Nvidia 研究)
  • 要点
    • BM25 Wins at Scale:HF Daily 8-1 #11 38▲ 高票条目,RAG 范式中 BM25 在规模化场景下优于向量检索的实证研究,与 v41/R28 AAAI Subramanian"Keyword Search Is All You Need"形成交叉验证
    • FutureAGI RAG Reimagined 5 Breakthroughs(GradientFlow Substack)
      • Contextual AI CEO Douwe Kiela:"LLM 只是系统架构的一部分,端到端效果由整体系统决定"
      • Nvidia OP-RAG 实证:16000 个精选 Tokens + Order-Preserve RAG 在 Llama3.1-70B 上达 44.43 F1,远超全部 128K Tokens 无 RAG 的 34.32
      • 核心结论:RAG + 长上下文组合使用效果最优,而非二选一
    • 文档解析是关键基础:Douwe Kiela 强调文档解析(表格、图表、复杂布局的信息抽取)不是预处理工作,而是关键基础
  • 与活文档 v42 关系
    • v42 §1.2 RAG 已含 "RAG 的主战场已由'选哪家向量数据库'移到三个上游问题":本场 = §1.2 RAG 范式"再确认"——BM25 + OP-RAG + GradientFlow Substack 共同确认 v42 已立"RAG + 长上下文组合最优"原则(v42 §5.2 趋势 #1 已开列"混合调度":短期状态内化,事实与政策外置,证据进入可审计账本);本场提供实证数据
    • v42 §3.2 争议 #2"图 RAG 是否普遍优于向量检索":本场 = §3.2 争议 #2 反方新增"BM25 在规模化下反胜向量"实证——与 v42 争议方向一致,但实证更新
  • 反方 / 警示
    • ⚠️ BM25 Wins at Scale paper_cards 未建:HF Daily 38▲ 高票但无 paper_cards;其结论是否与 R28 AAAI Subramanian 存在样本覆盖差异或数据集特异性,需要核实原文
    • ⚠️ OP-RAG 实证规模有限:仅 Llama3.1-70B + 16K 精选 tokens 单一实验,未覆盖多模型 + 多场景
  • 建议归入节
    • v43 §1.2 RAG:补全"RAG + 长上下文组合最优"实证(BM25 + OP-RAG + GradientFlow)
    • v43 §3.2 争议 #2:新增"BM25 规模化反胜向量"反方实证

增量 7 · 🟢 P1 中等 · MSR SymCrypt Rust+Lean+Aeneas AI 辅助形式化验证(生产密码学代码)= AI Agent 在形式化验证中的角色实证

  • 来源
    • inbox/jay/2026-08-01-1002-rss-msr-blog.md(MSR Blog 2026-08 / github.com/microsoft/SymCrypt/tree/feature/verifiedcrypto)
    • inbox/jay/2026-08-01-1058-engineering-e1prep.md v42 准备棒增量 6 ⭐⭐⭐⭐
  • 要点
    • 验证工具链:Rust(排除内存安全 bug 大类)+ Lean(函数式证明框架)+ Aeneas(验证 Rust 子集的自动化工具)
    • 验证流程:标准文档 → 形式化规范(Lean)→ Rust 实现 → Aeneas 验证 → Lean proof check
    • 已验证代码(生产级别):SHA-3(Rust 代码已在 Windows insider build 中使用)+ ML-KEM;扩展中:AES-GCM/FrodoKEM/ML-DSA
    • AI Agent 在验证中的角色:人类 review 标准形式化 + 主要 property;Agent(stochastic)写 proof 和中间 property;确定性步骤(编译/代码提取/proof 验证)非 agentic
    • 工程意义:AI + 形式化验证在生产密码学代码中的真实落地案例,不是研究 toy——SymCrypt 是 Windows 和 Azure 的核心依赖库
  • 与活文档 v42 关系
    • v42 §5 工程落地框架 #9 安全与隐私 + v42 §1.4 已含"安全评测从攻击成功率扩到 containment、OPSEC、持久记忆攻击面和供应链":本场 = §1.4 + §5 #9 补全"主动防御:AI 辅助形式化验证"维度——与 v42 §3.1 共识 #5"评测必须分解工作流"反向补全:"实现层验证"而非"测试层评测"
    • v42 §3.1 共识 #2"评测必须分解工作流":本场 = §3.1 共识 #2 补全"实现层分解"——v42 已立评测分解,但 SymCrypt 提供"实现层(Rust+Lean+Aeneas)+ 证明层(Lean proof)+ 验证层(proof check)"的三层分解实证
  • 反方 / 警示
    • ⚠️ AI 写 proof 的可靠性:论文明确"Agent(stochastic)写 proof 和中间 property"——AI 写 proof 的可靠性边界未给;v42 §3.2 争议 #3"LLM judge 能否承担生产裁决"延伸 = "LLM 写 proof 能否承担生产密码学验证"
    • ⚠️ 形式化验证适用范围:SymCrypt 是密码学代码,规模 + 形式化约束都明确;扩展到一般软件(如 LLM 应用层)的可行性未验证
  • 建议归入节
    • v43 §1.4 评测与可靠性:补全"主动防御:AI 辅助形式化验证"作为评测分解的边界扩展
    • v43 §3.1 共识 #2:补全"实现层分解"实证(Rust+Lean+Aeneas)
    • v43 §5 工程落地框架 #9 安全与隐私:补全"AI 辅助形式化验证"作为密码学代码主动防御层
    • v43 §3.2 争议:新增"LLM 写 proof 能否承担生产密码学验证"延伸讨论

增量 8 · 🟢 P1 中等 · Simon Willison MCP 2.0 Stateless HTTP 格式对比 + uvx mcp-explorer = MCP 协议实现层细节

  • 来源
    • inbox/jay/2026-08-01-1000-rss-simon-willison.md 7-31 发布(simonwillison.net/2026/Jul/31/stateless-mcp/)
    • inbox/jay/2026-08-01-1058-engineering-e1prep.md v42 准备棒增量 4 ⭐⭐⭐⭐
    • inbox/jay/2026-08-01-1050-jay-engineering-filter.md Simon Willison RSS 来源
  • 要点
    • Before(legacy stateful MCP):两次 HTTP 请求——Step 1: POST /mcp 带 initialize 获取 Mcp-Session-Id;Step 2: POST /mcp 带 session id 调用实际工具
    • After(MCP 2.0 stateless):单次 HTTP 请求——POST /mcp 带 MCP-Protocol-Version + Mcp-Method + Mcp-Name + JSON body(含 _meta 字段含客户端身份和能力)
    • 工程优势:① 客户端/服务端实现大幅简化;② 适合构建可扩展 web 应用(无需 server-side session state);③ 无需担心 session 路由到同一后端机器;④ 小模型(laptop 端)也能良好驱动
    • 可执行命令uvx mcp-explorer list <server_url> / uvx mcp-explorer inspect <tool> / uvx mcp-explorer call <server> <tool> -a arguments
    • GitHub:github.com/simonw/mcp-explorer + github.com/simonw/datasette-mcp
  • 与活文档 v42 关系
    • v42 §1.1 应用架构六层(工具与协议)+ v42 §1.1 已立"MCP 2026-07-28 无状态化方向":本场 = §1.1 补全"MCP 2.0 stateless HTTP 格式 + uvx 可执行命令"实现层细节——v42 已立方向,Simon Willison 提供 before/after 对比 + 可执行命令行
    • v42 §5 工程落地框架 #1 任务合同 + #2 最小权限 + #3 状态分层:本场 = §5 #3 状态分层补全"MCP stateless 协议"作为状态最小化原则——客户端/服务端实现大幅简化对应"状态最小化"
  • 反方 / 警示
    • ⚠️ MCP 2.0 规范仍在 12 个月弃用窗口内:企业生产部署需等待规范稳定,Simon Willison 基于个人实验(mcp-explorer / datasette-mcp)的分析,规模化部署成熟度需观察
    • ⚠️ 小模型驱动 MCP 的可靠性:Simon Willison 称"小模型(laptop 端)也能良好驱动"——实际生产场景的可靠性需更多独立验证
  • 建议归入节
    • v43 §1.1 应用架构工具与协议:补全 MCP 2.0 stateless HTTP 格式对比 + uvx 可执行命令
    • v43 §5 工程落地框架 #3 状态分层:补全"MCP stateless"作为状态最小化原则

旁证 A · 🟢 P2 邻接 · Σ-Mem arXiv:2607.27958(多智能体在线可靠性记忆)= v42 §1.3 Memory 第五路候选(信誉记忆)

  • 来源
    • inbox/tom/2026-08-01-0852-rag-e1prep.md 增量 1 ⭐⭐⭐⭐(tompaper_cards/683 已建卡)
    • inbox/tom/2026-08-01-1440-agent-rag-longcontext-radar.md 候选 #3 ⭐⭐⭐⭐
    • inbox/spark/2026-08-01-1339-agent-e1prep.md 增量 1 🟠 P0(Sigma-Mem 候选 K)
    • inbox/stephen/2026-08-01-1245-coordination-check-noon.md §一 (建议入 rag.md R51 §2.9 + agent.md v37 §2.2)
  • 要点
    • 核心问题:现有 memory 系统主要保存交互内容,不建模哪些 agent 在何种条件下可信;多智能体系统中,中心模型无法直接验证对等响应的真实性/相关性成为核心瓶颈
    • 核心创新对等方 competence 证据 + 对等关系证据(两个对称状态) + 基于后决策正确性反馈实时更新
    • 关键差异 vs Metis:Metis 是"记忆内化为模型原生 state";Σ-Mem 是"记忆建模可信赖性" = 两条腿,一条内化,一条外化建模
  • 与活文档 v42 关系
    • v42 §1.3 Memory 已含四路(外挂检索式 / 文件系统记忆 / 结构化时态记忆 / 原生模型记忆):本场 = §1.3 第五路候选(信誉记忆)——v42 已立四路并行,本场补充第五路但 v42 §3.2 争议 #1 已开列"原生记忆是否优于外挂记忆",Σ-Mem 已在争议扩展层定位(不需单独升格节点);建议在 v43 §3.2 争议 #1 补充"信誉记忆是第五路,与前四路不同层面"
    • v42 §1.4 评测与可靠性已含 Grading the Narrators(领域可靠性附到声明链):本场 = §1.4 补全"peer competence + relationship 证据"作为 Grading the Narrators 的多智能体可执行版
  • 建议归入节
    • v43 §3.2 争议 #1:新增"信誉记忆是第五路,与前四路不同层面"作为 v42 已立争议的扩展层定位
    • v43 §1.4 评测与可靠性:补全"peer competence + relationship 证据"作为 Grading the Narrators 的多智能体可执行版
    • v43 §4 开放问题 #6 信誉记忆抗串谋:Σ-Mem 已部分回答 "peer 共谋"问题,但"身份重置 + 分布漂移" 仍开放

旁证 B · 🟢 P2 邻接 · Lilian Weng Harness Engineering 八元组公式 + 三 design patterns + 完整工具集定义

  • 来源
    • inbox/jay/2026-08-01-1001-rss-lilian-weng.md(lilianweng.github.io/posts/2026-07-04-harness/ · GitHub: github.com/karpathy/autoresearch)
    • inbox/jay/2026-08-01-1058-engineering-e1prep.md v42 准备棒增量 3 ⭐⭐⭐⭐⭐
  • 要点
    • Harness 八元组公式:Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State——不是简单包装,而是完整的执行控制平面
    • 三 design patterns:① Workflow Automation(Karpathy autoresearch 为例)· ② FileSystem as Persistent Memory · ③ Sub-agent and Backend Jobs
    • Coding Agent 工具集(具体工具定义):文件系统(glob/grep/ls/read/read_many/write/edit/multi_edit/apply_patch)· Shell(bash/PowerShell)· IO(lsp/git_status/git_diff/git_commit)· 外部上下文(MCP tools/Skills)· Web(web_search/web_fetch/browser)· Backend(CronCreate/CronDelete/CronList)· Agent 委托(spawn_agent/resume_agent/wait_agent/list_agents/close_agent/interrupt_agent)
    • RSI 关键工程判断:"近期 RSI 的实际路径不太可能是模型直接重写自身权重。更现实的路径:harness 工程进化为 meta-methodology(改进构建模型的机器),同时模型能力通过 pretraining 自然增长。"
  • 与活文档 v42 关系
    • v42 §1.1 应用架构已立 Lilian Weng Harness 三 pattern:本场 = §1.1 补全"八元组公式 + 完整工具集"作为 v42 已立三 pattern 的组件级定义——v42 §1.1 把 Harness 当作 v42 §0 范围的"六大可独立优化对象之一"列出;本场把 Harness 八元组公式 + 完整工具集定义列入
    • v42 §5 工程落地框架 10 项:本场 = §5 10 项 vs Harness 八元组对照——v42 §5 的 10 项工程清单是"系统验收层",Lilian Weng 八元组是"组件定义层";两者形成 v42 §5 + 增量映射
  • 反方 / 警示
    • ⚠️ Lilian Weng "RSI 路径判断"是个人观点:"近期 RSI 不会是模型直接重写权重"是 Lilian Weng(前 OpenAI 安全工程负责人)的工程观点,非已被验证事实;v43 §5.3 趋势判断"可能在 2027 成为主线"应在 RSI 部分标注"该判断为个人观点"
  • 建议归入节
    • v43 §1.1 应用架构:补全"Lilian Weng 八元组公式 + 完整工具集"作为 v42 已立三 pattern 的组件级定义
    • v43 §5 工程落地框架:建立 §5 10 项 vs Harness 八元组的对照映射
    • v43 §5.3 趋势判断"可能在 2027 成为主线 - 原生 memory 与外部 memory 的统一接口":标注 Lilian Weng RSI 判断为个人观点

旁证 C · 🟢 P2 邻接 · Anthropic Claude Mythos Preview 发现 HAWK/AES 等真实加密算法弱点(8-1 复现)= AI 应用层突破作为密码学研究工具

  • 来源
    • inbox/stephen/2026-08-01-1245-coordination-check-noon.md §三 X radar #5
    • inbox/flyp/2026-08-01-0930-multimodal-e1prep.md 增量 7 X radar #5
  • 要点
    • 2026-07-28 Anthropic 发布 Claude Mythos Preview,发现 HAWK/AES 等真实加密算法弱点——AI 应用层"密码学研究用途"立标
    • 8-1 stephen X radar 复现确认:v34 §6 沿用 + v35 升级候选
  • 与活文档 v42 关系
    • v42 §5 工程落地框架 #9 安全与隐私 + 增量 7 SymCrypt 形式化验证:本场 = §5 #9 补全"AI 密码学研究用途"作为应用层能力跃迁
    • v42 §5.1 已发生"应用层":本场 = §5.1 已发生补全"AI 密码学研究用途"作为"应用层跃迁"的具体路径
  • 建议归入节
    • v43 §5.1 已发生:补全"AI 密码学研究用途"作为"应用层跃迁"路径
    • v43 §5 工程落地框架 #9 安全与隐私:补全"AI 密码学研究"作为应用层突破维度
    • 与 v43 §3.2 争议 #6"榜单热度是否可作立标证据"形成对位:Anthropic 主动披露密码学弱点是 v42 已立"立标需审计复现消融和真实部署"原则的实证案例

2. 反方 / 警示(合并)

  1. ByteByteGo ChatGPT Agent 三层架构 cost 数据不精确:"GPT-5.6 Sol cost 不到 Fable 5 一半"是方向性表述,缺精确数值(8000 字截断),精读全文前不宜引用为精确工程数据
  2. Echoverse "Co-evolution" 工程可复制性存疑:12 个深度领域合成世界构建成本极高(MSR 团队规模);对普通工程团队,"高保真合成环境"是资源密集型投入
  3. MirrorCode 评测成本极高 + Jack Clark "bootstrapping 工业文明"是推测性判断:单目标 14 小时 + $100-$400;25 目标全测需数十天 GPU 时间 + 数千美元;Jack Clark 在 Import AI 中的判断非研究结论
  4. Fairness Pruning 激活定位 ≠ 因果推断:通过激活差异识别"偏差相关神经元"≠ 这些神经元的激活差异直接导致下游偏差行为——结构关联不等于因果;v42 §2.5 反方第 3 条候选
  5. Fairness Pruning 实证规模限制:最高 3B 模型,GPT-5 / Claude Opus 5 / Gemini 3.5 Pro 等大模型上是否成立未验证;仅在 GLU 架构成立,Transformer MHA / MoE / SSM 架构泛化边界未知
  6. EU AI Act 治理信号叠加 = 多源压力但无具体可执行指标:4 治理信号叠加(监管 deadline + 厂商主动表态 + 第三方事件披露 + 自愿评估框架 + 联盟协议),但每条都未给出具体可测量标准
  7. BM25 Wins at Scale paper_cards 未建:HF Daily 38▲ 高票但无 paper_cards;与 R28 AAAI Subramanian 实证是否存在样本覆盖差异未核实
  8. SymCrypt AI 写 proof 的可靠性边界:论文明确"Agent(stochastic)写 proof 和中间 property",LLM 写 proof 能否承担生产密码学验证未独立验证
  9. MCP 2.0 stateless 规范仍在 12 个月弃用窗口内:企业生产部署成熟度需观察;Simon Willison 基于个人实验的分析,规模化部署可靠性未验证
  10. Lilian Weng "RSI 路径判断"是个人观点:非已被验证事实,v43 §5.3 趋势判断"可能在 2027 成为主线"应在 RSI 部分标注该判断为个人观点
  11. v42 §1.4 已立"评测分解工作流"原则 → 增量 5 Fairness Pruning 实证规模限制:从 3B 模型推到 ≥70B 模型是否仍激活级偏差定位 → 实证空缺
  12. work-queue.md 候选项 2607.26637 = Filesystem-Based Memory 已在 v42 §0.5 候选池未立视频脚本:选题榜长期未推动(v33-v42 沿用),v43 是否升格视频脚本需 Jay 综合判断

3. arXiv 号汇总(按主题归类,新增 vs 已立 v42)

3.1 新增 arXiv(本场首次出现,未在 v42 §7.1 附录)

arXiv 号 论文/工作 出现位置
2607.26497 BM25 Wins at Scale(HF Daily 38▲,无 paper_cards 待建) 增量 6
2607.28319 Fairness Pruning(paper_cards/684 已建,主 evaluation) 增量 5

3.2 已立 v42 §7.1 附录,本场作为激活/工业补全引用

arXiv 号 论文/工作 v42 位置 本场归入
2607.27958 Σ-Mem(paper_cards/683 主分类 agent) 已立 v42 §1.3 Memory 第五路候选 旁证 A
2607.26637 Filesystem-Based Memory(paper_cards/686 主分类 agent) 已立 v42 §1.3 文件系统记忆 work-queue.md 选题榜
2607.28580 DualG-MRAG(paper_cards/674 主分类 rag) 已立 v42 §1.2 RAG v43 §1.2 工业补全
2607.28397 GLM-RAG(paper_cards/675 主分类 rag) 已立 v42 §1.2 RAG v43 §1.2 工业补全
2607.28126 ConMem(paper_cards/676 主 rag 副 agent) 已立 v42 §1.2 RAG v43 §1.2 工业补全
2607.28263 CoMem(paper_cards/678 主 multimodal 副 rag) 已立 v42 §1.3 v43 §1.3 工业补全
2607.20891 MisKnow-Agent(paper_cards/687 主 agent) 已立 v42 §1.4 评测与可靠性 v43 §1.4 工业补全
2607.26769 See2Think(paper_cards/685 主 multimodal 副 evaluation) 已立 v42 §1.4 v43 §1.4 工业补全
2607.26784 SkillRise 已立 v42 §1.4 v43 §1.4 工业补全
2607.25308 CAST 已立 v42 §1.4 v43 §1.4 工业补全
2607.27146 MindForge 已立 v42 §1.1 Coding Agent v43 §1.1 工业补全
2607.27167 SpecFirst 已立 v42 §1.1 Coding Agent v43 §1.1 工业补全
2607.26314 StealthBench 已立 v42 §1.4 v43 §1.4 工业补全
2607.28374 LEDGERMIND 已立 v42 §1.4 v43 §1.4 工业补全
2607.24117 Grading the Narrators 已立 v42 §1.4 旁证 A Σ-Mem 对照

3.3 非论文来源(博客 / MSR 技术报告 / GitHub / Substack)

来源 工作 出现位置
blog.bytebytego.com ChatGPT Agent 三层架构访谈(OpenAI 工程师) 增量 1
github.com/microsoft/Echoverse 训练 Computer-Use Agent 合成世界环境 增量 2
github.com/epoch-research/MirrorCode 超长程编程任务 benchmark 增量 3
futureagi.substack.com LLM Evaluation Tools Guide 2026 + RAG 五指标体系 增量 4
simonwillison.net/2026/Jul/31/stateless-mcp MCP 2.0 stateless HTTP 格式 增量 8
lilianweng.github.io Harness Engineering 八元组公式 + 三 patterns 旁证 B
github.com/microsoft/SymCrypt Rust+Lean+Aeneas AI 辅助形式化验证 增量 7
anthropic.com/news/discovering-cryptographic-weaknesses-with-claude Claude Mythos Preview 旁证 C
anthropic.com/news/three-real-world-incidents-cybersecurity-evaluations Anthropic 3 起事件 增量 5 治理信号
politico.com Sam Altman 白宫自愿评估框架 增量 5 治理信号
huggingface.co/blog HF 加入 Open Secure AI Alliance 增量 5 治理信号
msr-blog.microsoft.com MSR 多源(Echoverse + SymCrypt) 增量 2 + 7
gradientflow.Substack.com RAG Reimagined 5 Breakthroughs(Douwe Kiela + Nvidia) 增量 6

4. 建议归入活文档 knowledge/llm-application.md 的具体操作

增量 目标节 操作类型
增量 1(ByteByteGo 三层架构) §1.1 应用架构 + §0 共识层 + §1.4 评测与可靠性 + §5 工程落地框架 #2 + #10 补全生产实例 + 共识实证 + 安全检查落地 + 失败恢复
增量 2(MSR Echoverse) §1.1 应用架构(训练时合成世界层)+ §1.4 评测与可靠性(训练时分解) + §5 工程落地框架 #8 分层评测(第四层) 训练时维度补全
增量 3(MirrorCode) §1.1 Coding Agent 评测第三档 + §1.4 评测与可靠性(评测时间粒度三档) + §5 #7 可重放性(CLI-only 黑盒接口边界)+ §3.2 争议(Jack Clark 观点 vs 研究结论对位) 评测时间粒度扩展
增量 4(FutureAGI 五指标) §1.2 RAG(工业指标对照)+ §1.4 评测与可靠性(工业工具实证) + §5 #5 证据账本(工业指标映射) + §3.1 共识 #5(工业工具实证) RAG 工业落地
增量 5(Fairness Pruning + 治理信号) §1.4 评测与可靠性(应用层偏差治理)+ §3.2 争议(激活定位 ≠ 因果推断) + §5 #9 安全与隐私(五重治理信号叠加) + §4 开放问题(跨架构泛化) 偏差治理 + 外部治理信号
增量 6(BM25 + OP-RAG) §1.2 RAG(RAG + 长上下文组合最优实证)+ §3.2 争议 #2(BM25 规模化反胜向量) RAG 范式再确认
增量 7(SymCrypt 形式化验证) §1.4 评测与可靠性(主动防御形式化验证)+ §3.1 共识 #2(实现层分解实证) + §5 #9 安全与隐私(密码学代码主动防御) + §3.2 争议(LLM 写 proof 可靠性) 主动防御
增量 8(MCP 2.0 stateless) §1.1 工具与协议(HTTP 格式对比 + uvx 可执行命令)+ §5 #3 状态分层(状态最小化原则) 协议实现层细节
旁证 A(Σ-Mem 第五路 Memory) §3.2 争议 #1(信誉记忆第五路 vs 原生 vs 外挂)+ §1.4 评测与可靠性(Grading the Narrators 多智能体可执行版) + §4 开放问题 #6(抗串谋部分回答) Memory 第五路候选
旁证 B(Lilian Weng 八元组) §1.1 应用架构(八元组公式 + 工具集定义)+ §5(v42 10 项 vs Harness 八元组对照映射) + §5.3 趋势判断(RSI 部分标注为个人观点) Harness 组件级定义
旁证 C(Claude Mythos 密码学) §5.1 已发生(应用层跃迁密码学研究用途)+ §5 #9 安全与隐私(AI 密码学研究维度) + §3.2 争议 #6(Anthropic 主动披露 vs 榜单立标对位) AI 密码学应用

5. 无显著新增量时说明

本日 llm-application 主题 24h 窗口净增量性质:

  1. v42 收官后 24h 窗口净增量 = 5 件主线 + 3 件旁证 = 8 件(vs 7-31 24h 窗口的 7 件主线 + 2 件旁证 = 9 件),数量级相近但性质不同
  2. 本场特征 = "v42 已立骨架的实例化与工业落地":不是"全新方向开掘"(如 7-30/7-31 的 4 件 P0 = DualG-MRAG + GLM-RAG + MisKnow-Agent + Filesystem-Based Memory),而是"生产实例数据化 + 协议实现层细化 + 评测工具层补全 + 治理信号加压"
  3. 核心增量 = OpenAI ChatGPT Agent 三层架构(ByteByteGo 8-1 访谈)+ MSR Echoverse + MirrorCode benchmark + FutureAGI 五指标体系 + Fairness Pruning + EU AI Act deadline:是 v42 §1.1 / §1.2 / §1.4 / §5 已立原则的生产实例与工业实证
  4. 治理信号叠加压力:EU AI Act deadline(20h 后)+ OpenAI 主动提前 24 小时 + Anthropic 3 起事件 + Sam Altman 白宫自愿评估框架 + HF 加入 Open Secure AI Alliance = 5 重压力,但无具体可执行指标
  5. 新增主分类 paper_cards(8-01 14:11 batch 688/674-687 共 15 张)全部已在 v42 §0.5 候选池(Σ-Mem + DualG-MRAG + GLM-RAG + Filesystem-Based Memory + MisKnow-Agent + ConMem + CoMem + See2Think + LEDGERMIND + ShadowDancer + Fairness Pruning + OmniScope + Voice Memory + SkillRise + MemoryArena 等);8-01 20:00 batch IDs 469-531 实际为旧论文补录,不构成本主题净增量
  6. HF Daily 8-01 票榜 15 件已立分布:CLBench-V(42▲)+ BM25 Wins at Scale(38▲)+ AskChem/Qwen-UI-Agent/Metis/PhiZero/Frontis-MA1/DistillAlign/VideoCoCo/Memory Decoder/Beacon/Flux-OPD/MPIE-Bench/ACE-Data-0/Beyond Borrowed Histories(其余 13 件)= Metis 已是 v42 已立,其余 14 件除 BM25 Wins at Scale 外与本主题弱邻接
  7. work-queue.md 候选项 2607.26637 = Filesystem-Based Memory 已在 v42 §0.5 候选池未立视频脚本:选题榜长期未推动(v33-v42 沿用),v43 是否升格视频脚本需 Jay 综合判断

今日实质新增量:8 件(5 重大 + 3 旁证)+ 涉及 arXiv 号 15 条(2 新增 + 13 v42 已立激活)+ 非论文来源 13 条


6. 本棒 v43 预消化关键议题

v42 收官后,v43 面临的核心问题:

  1. OpenAI ChatGPT Agent 三层架构(ByteByteGo 8-1)vs v42 §1.1 已立 Harness Engineering 三 pattern生产实例 vs 系统抽象如何分层映射? 两层抽象同时存在(OpenAI 工程师口径的"运行时 pipeline"切分 vs Lilian Weng 的"系统组件"切分),不互相替代但需要明确两者关系(v43 §1.1 整合时需说"两层抽象同时存在")
  2. MSR Echoverse"训练时合成世界"vs v42 §1.1 已立六层生产栈训练时维度是否构成第七层? v42 已立的"应用架构从模型中心到 harness 中心" + "评测必须分解工作流"原则可延伸,但 Echoverse 工程可复制性存疑(资源密集型投入),v43 是否把"训练时合成世界层"列为可选第七层需谨慎
  3. FutureAGI RAG 五指标 vs v42 §1.2 已立"决策与证据系统三上游问题"工业指标体系 vs 学术 RAG 决策框架如何统一? v42 已立"是否检索 / 结构与粒度 / 证据治理"三上游问题,FutureAGI 五指标把"证据治理"具体化为可测量指标;v43 是否把工业指标纳入 §1.2 框架作为实证层
  4. MirrorCode 数周级评测 vs v42 §1.4 已立"评测分解工作流"超长程评测是否适合生产 PR 快检? v42 已立的"PR 快检 / 夜间 judge / 线上监控 三层" 不含数周级;MirrorCode 适合 frontier model 长时间预算下的端到端能力测试,v43 §5 #8 分层评测是否新增"训练时 + 长程端到端"为第五层
  5. EU AI Act 治理信号叠加 vs v42 §5 #9 安全与隐私多源治理压力下,无具体可执行指标怎么办? 5 重治理信号叠加但缺测量标准;v43 是否建立"治理信号成熟度"作为可执行维度
  6. Σ-Mem 第五路 Memory vs v42 §1.3 已立四路是否升格为第五节?或停在 v42 §3.2 争议扩展层? v42 §3.2 争议 #1 已开列"原生记忆是否优于外挂记忆",Σ-Mem 是这条争议的扩展而非新方向;v43 §3.2 争议 #1 补充"信誉记忆是第五路,与前四路不同层面"
  7. Lilian Weng 八元组公式 vs v42 §5 工程落地 10 项组件级 vs 系统验收级如何对照映射? v42 §5 10 项是"系统验收层",Lilian Weng 八元组是"组件定义层";v43 建立 §5 10 项 vs 八元组的对照映射表
  8. 跨文档联动:Σ-Mem 入 rag.md R51 §2.9(Tom 已立)+ agent.md v37 §2.2(Spark 已立);Fairness Pruning 邻接 risk.md(demographic bias as risk factor)+ evaluation.md(v33 已立);MirrorCode 跨 agent.md(Spark 已立)+ engineering.md §2.95 + evaluation.md(Tom 已立)—— v43 更新时需确认跨文档一致性

Stephen · 2026-08-01 21:10 CST · llm-application E1 预消化简报 · 8 件增量(5 重大 + 3 旁证) · 涉及 arXiv 15 条(2 新增 + 13 v42 已立激活)+ 非论文来源 13 条