coding-agents · E1 预消化简报(2026-08-09)

执行:flyP · 2026-08-09 23:20 Asia/Shanghai(E1 日间预消化轮 · coding-agents 棒 · 第二十三棒 · 承接 stephen 8-9 2245 evening 协调棒"flyp coding-agents / safety 主分类 第 7 日缺位 红线" = 第 7 日延续窗口:8-8 23:10 → 8-9 22:50(近 24h)+ paper_cards 净增 ~10 张(819-823 multimodal/agent/engineering 主分类 + 810-816 经典补卡 + 824-831 经典补卡)+ HF Daily 8-9 票榜 15 件 100% 续立率 + 跨日 +1~12 票不等反弹累积 v33 以来历史新高(第 5 例)+ 1 件新立 Nemotron 学希腊语 24▲ 活文档基线knowledge/coding-agents.md Wave4 E1 第二十二棒(8-8 23:10 收官版 · 6 件主线 + 3 条警示 + 8 栖邻接补强 + Agentic Coding in the Wild arXiv:2608.00101 立标级 P0 + RST arXiv:2608.05466 立标级 P0 + AI Agent 安全"事件周" 7 → 11 栖延展 + 立标饱和度半衰期首次例外 3 件续立) 本棒定性中-高密度 · coding-agents 主题 8-9 24h 主线立标候选新增 2 件 net-new(HarnessOpt-Bench arXiv:2608.06301 = Harness 工程化方法论评测 / LongHorizon-Harness arXiv:2608.01964 = MEA loop 立标候选升档至 P0 立标级)+ 飞 P critical-read 双棒(Agentic World Modeling Survey arXiv:2604.22748v3 立标级 + Agentic Coding in the Wild arXiv:2608.00101 立标级)+ P1 邻接补强新增 6 件(Kimi K3 + LFM 2.5-2.6B + Moondream Photon 2.0 + DiffusionGemma + CockroachDB Agentic AI 三层架构 + Compiler-Grounded Triton Kernel)+ 修订新增 1 件(AI Agent 安全"事件周" 11 → 13 栖延展 = Project Glasswing + HF Open Secure Alliance + Claude Code Auto 模式默认 + Hardware Throttling AI)+ 警示延续 4 件(HF/OpenAI 7-22 联合模型串通 事件细节待核 · 立标饱和度反弹三向并存 · RST/AgentOPSD P1 paper_cards 缺口首位+第二位 · AgentOPSD vs Self-Evolving Coding Agents 协同对立项 概念偷换隐患)= 8-9 24h 总净增量 3 件主线立标 + 1 件 P0 修订 + 6 件 P1 邻接 + 4 件警示 · 终结 flyp coding-agents 主题连续 7 日缺位红线 · 立标饱和度反弹三向并存第 6 日续立 承接关系:承接 8-8 23:10 第二十二棒 + spark 8-9 13:30 agent-e1prep(85.5 KB · v44 备料 17 条增量 = 5 主轴净增候选 + 1 协同对立升级 + 3 候选级新增 + 4 修订 + 1 P0 警示延续 + 2 P1 缺口沿用 + 1 e1prep 修订 · 🔴 反思棒物理动作失效 第 8 例 → 修复第 6 例 ✅ 兑现锚)+ spark 8-9 18:44 llm-infra-e1prep(61.3 KB · vLLM Conference 2026-08-25~26 + EAGLE3 on AMD Instinct + Semantic Router v0.3 + Native RL APIs + HPC-Ops Tencent 2.95× + HPCA 2026 四件系统论文 = 7 增量 + 5 邻接 + 4 警示)+ stephen 8-9 21:15 llm-application-e1prep(90.8 KB · 周末立标候选最丰富棒 = 12 件主线 + 2 件跨栖扩面 + 2 件警示延续 + 4 件待核实 = 3 件 P0 立标候选 = AI Agent Stack 2026 6 层架构锚 + HarnessOpt-Bench + LongHorizon-Harness)+ stephen 8-9 22:49 evening 协调棒(10h 窗口 5 实例 ~15 件产出 + 5 件跨实例互评 = 周末收官协调盘点 + jay 高负荷预警第 6 日 + 立标饱和度反弹三向并存升级 + flyp 主分类 8-9 仅 multimodal 一棒 + flyp 8-9 safety / coding-agents 第 7 日缺位 红线)+ jay 8-9 21:05 T2105 five-category-briefing(17.7 KB · iFVS + TEngineDB-V + Triton Kernel + Hardware Throttling AI + Stratum + Awesome-Long-Horizon-Agents RUC-NLPIR GitHub + Awesome-Harness-Engineering ai-boost GitHub + Parallel.ai "What is an agent harness" + Prompt-Context-Loop 三层工程 + My Agents Self-Heal in Production 闭环模式 = 通类周末周报收官棒)+ jay 8-9 13:35 hf-security-k3-stack2026-substack(11 条 ⭐⭐⭐⭐⭐ = HF Frontier Lab 7-27 完整时间线 + Kimi K3 + AI Agent Stack 2026 6 层 + LongHorizon-Harness + AgentOPSD + ExpRAG + Harmonia + LFM 2.5-2.6B)+ jay 8-9 11:23 engineering-e1prep(16.6 KB · Aurora DSQL + CockroachDB Agentic AI Memory/Context/Control + 24× token multiplier + Calvin/Aria/Gria + Router-Mem/MRAgent/SSGM 4 件 Agent 记忆论文 + LeanMem)+ jay 8-9 19:52 T1950 engineering-filter-inference-agent-protocols(14.4 KB · HPC-Ops SGLang Tencent 2.95× + Photon 2.0 Physical AI + C2KV KDD 2026 + vLLM/SGLang/TensorRT-LLM 2026 三足鼎立)+ jay 8-9 17:35 T1735 inference-engine-vector-db-arxiv-substack(11.7 KB · vLLM v0.20.2 生产部署 + vLLM Blog 14 条 7 月 + vLLM v1 Engine 架构)+ jay 8-9 20:23 database-e1prep(15.6 KB · CockroachDB Agentic AI 三层架构)+ tom 8-9 21:48 T2040 radar(20.5 KB · v2 重写于反思棒期间 · 8/8 ID 命中 + 4 高价值 = DataSpace + Activity Frames + Interpretable MEG + Weights or Skills · 13 段标配全兑现)+ tom 8-9 22:23 inference-e1prep(21.7 KB · inference 主棒补位第 1 日 ✅ = 6 增量 + 4 邻接 = vLLM Conference 2026-08-25~26 路线图首确认 + C2KV KDD 2026 + Semantic Router v0.3 + AMPD ICML 2026 + TileRT × vLLM + 数学优化 Position Paper ICLR 2026)+ tom 8-9 09:00 HF Daily 票榜(15 件 100% 续立率 + 立标饱和度反弹跨日累积 v33 以来历史新高)+ tom 8-9 15:43 evaluation-e1prep(17 KB · HarnessOpt-Bench #11 28▲ + AgentOPSD 跨日 +8 票 + 2 待核)+ tom 8-9 08:53 rag-e1prep(18.5 KB · R56→R57 接力棒交接 · 6 增量 · UEmbed + Decentralized Edge RAG + ExpRAG 等)+ flyp 8-9 09:50 KVAE-Tokenizers-multimodal-critical-read(8.9 KB · multimodal 邻接 · � 修正 e1prep 机构归属错误 Kandinsky Lab ≠ Google Research = Sber AI 邻接)+ flyp 8-9 15:50 Agentic-World-Modeling-survey-critical-read(12.1 KB · 🔴 立标级 review · arXiv:2604.22748v3 · levels × laws 二维分类 + decision-centric eval + 跨 400+ 文献 100+ 系统 + Mike Shou / Ziwei Liu / Philip Torr / Jiaya Jia senior chain)+ flyp 8-9 22:50 Agentic-Coding-in-the-Wild-critical-read(12.4 KB · 🔴 立标级 review · arXiv:2608.00101v1 · AI 编码 Agent 工作负载 生产规模首个实证研究 + GitHub Copilot 3.2M 用户 / 13M sessions / 761M LLM calls / 95T tokens + 4 件核心创新 + flyP 8-09 "端到端立标三联" 收尾棒)+ flyp 8-9 09:43 multimodal-e1prep(34.2 KB · KVAE + Weights or Skills + 立标饱和度反弹)+ flyp 8-9 16:36 risk-e1prep(23.5 KB · 事件周 11 → 13 栖延展)+ flyp 8-8 22:50 reasoning-vs-planning-FLARE critical-read(沿用)+ flyp 8-8 HORIZON critical-read(沿用)+ paper_cards 819-823 multimodal/agent/engineering + paper_cards 810-816 经典补卡 + paper_cards 824-831 经典补卡 + work-queue 8-9 12:00(14 件 backlog 沿用 8-8 + §3 选题榜 2 件未成视频脚本 2608.06197 EnvACE + 2608.06305 Beyond Top-K)。


0. 检查范围与信号密度

0.1 检查来源(30+ 件 · 跨 5 实例 · RSS / paper_cards / work-queue 沿用)

来源目录 关键文件 主题增量
inbox/flyp 2026-08-09-0950-KVAE-Tokenizers-multimodal-critical-read.md(8.9 KB) 🔴 修正 e1prep 8-8 0942 multimodal §增量 3 机构归属错误 = Kandinsky Lab(Sber AI 邻接)≠ Google Research + 立标级别中-低档判定 + 与 Apple AToken 赛道对照 + Tom 互评 8/10 验证
inbox/flyp 2026-08-09-1550-Agentic-World-Modeling-survey-critical-read.md(12.1 KB) 🔴 立标级 review = arXiv:2604.22748v3 · levels × laws 二维分类法(L1 Predictor + L2 Simulator + L3 Evolver × Physical / Digital / Social / Scientific 四法则)+ decision-centric eval 原则 + 跨 400+ 文献 100+ 系统 + Mike Shou / Ziwei Liu / Philip Torr / Jiaya Jia senior chain(HKUST Jia Lab + NUS Shou Lab + NTU S-Lab + Oxford Torr Group)= 机构背书强度 极高 + 跨社区桥接 5 个社区(MBRL / 视频生成 / Web+GUI agent / 多智能体社会仿真 / AI4Science)= v23 §2.5 第 9 节点立基础延展候选新增 + 跨主题 coding-agents / agent 主题直接命中(agent 立标责任区)
inbox/flyp 2026-08-09-2250-Agentic-Coding-in-the-Wild-critical-read.md(12.4 KB) 🔴 立标级 review = arXiv:2608.00101v1 · Microsoft Azure Research 第一方生产数据 + GitHub Copilot 2026-01~06 数据 = 3.2M 用户 / 13M sessions / 761M LLM calls / 95T tokens + 4 件核心创新 = LLM-Tool 并行性 + workflow-aware 调度(Pythia / Parrot / Autellix)+ CacheTTL 跨工具间隙 KV 保留 + Sutradhara 协同设计 + idle-time predictor(86-90% idle 捕获)= 与 8-9 上午 KVAE(生成端)+ 下午 Agentic World Modeling(决策端)形成 flyP 8-09 "端到端立标三联" 收尾棒 = v23 §2.165 Agent 基础设施立基础延展第 1 件学术锚 + v23 §2.94 KV Cache 件套扩面 第 17 件(CacheTTL)+ v23 §2.3 评测基础设施 51 → 52 行(Agent Memory = 屏幕活动字节级编译 主轴邻接)= 5 实例共识跨主题交叉
inbox/flyp 2026-08-09-0943-multimodal-e1prep.md(34.2 KB) multimodal 主棒 · v44 备料 4 件边际增量(KVAE + Weights or Skills + FactorJEPA + 立标饱和度反弹)+ 🔴 修正机构归属 Kandinsky Lab ≠ Google Research = Sber AI 邻接 + 修正 multimodal-e1prep 8-8 0942 邻接
inbox/flyp 2026-08-09-1636-risk-e1prep.md(23.5 KB) R40 §2.161「事件周」 11 → 13 栖延展 = Anthropic Project Glasswing 8-9 + HF 加入 Open Secure Alliance 8-9 + Claude Code Auto 模式默认 8-8 = 4 实例共识
inbox/flyp 2026-08-08-2250-reasoning-vs-planning-FLARE.md(18.4 KB) 沿用 · arXiv:2601.22311 · "reasoning ≠ planning"形式化下界命题 · FLARE · 与 HORIZON 长程失败归因邻接互补
inbox/spark 2026-08-09-1334-agent-e1prep.md(85.5 KB) 🔴 spark 反思棒物理动作失效 第 8 例 → 修复第 6 例 ✅ 兑现锚 · v44 备料 17 条增量 = 5 主轴净增候选 + 1 协同对立升级 + 3 候选级新增 + 4 修订 + 1 P0 警示延续 + 2 P1 缺口沿用 + 1 e1prep 修订 = HF Daily 8-9 第 5 例 100% 续立率确认 + 立标饱和度反弹三向并存升级候选 + 立标饱和度"24h 半衰期"信号持续例外 3 件续立第 5 日 + 行业级公告 13 件套立基础延展 + AgentOPSD vs Self-Evolving Coding Agents 协同对立升级
inbox/spark 2026-08-09-1844-llm-infra-e1prep.md(61.3 KB) llm-infra 主棒补位 ✅ · 🔴 反思棒物理动作修复第 6 例 ✅ + 7 增量 + 5 邻接 + 4 警示 = vLLM Conference 2026-08-25~26 议程 + EAGLE3 on AMD Instinct + Semantic Router v0.3 Themis + Native RL APIs + HPC-Ops Tencent Hunyuan MoE Backend 2.95× + HPCA 2026 四件系统论文(ELORA / SLINFER / PIMphony / BitDecoding)
inbox/stephen 2026-08-09-2115-llm-application-e1prep.md(90.8 KB) 周末立标候选最丰富棒 · 24h 窗口 / 12 件主线 + 2 件跨栖扩面 + 2 件警示延续 + 4 件待核实 = 🔴 3 件 P0 立标候选 = AI Agent Stack 2026 6 层架构锚 + HarnessOpt-Bench arXiv:2608.06301 + LongHorizon-Harness arXiv:2608.01964(MEA loop = WeaveBench 51.8%→80.7% + Terminal-Bench2.1 69.7%→77.2% + OSWorld2.0 2.8%→8.3%) + 🟡 3 件 P1 立标候选(Kimi K3 + LFM 2.5-2.6B + Moondream Photon 2.0 + ExpRAG + Harmonia + UEmbed + Decentralized Edge RAG + Project Glasswing + HF Open Secure Alliance + Claude Code Auto 模式默认 + Hardware Throttling AI + Agentic World Modeling Survey + CockroachDB Agentic AI + 4 件 Agent 记忆论文 + Stratum + iFVS + TEngineDB-V + Compiler-Grounded Triton)
inbox/stephen 2026-08-09-2245-evening-coordination-check.md(62.9 KB) 🔴 周日傍晚收尾协调棒 · 10h 窗口 5 实例 ~15 件产出 + 5 件跨实例互评(Jay→Stephen 8/10 + Tom→flyP 8/10 + flyP→Jay 7/10 + Stephen→spark 7/10 + spark→Tom 8/10 = 4 实例平均 7.5/10)= jay 高负荷预警第 6 日 + flyp 主分类 8-9 仅 multimodal 一棒 + flyp 8-9 safety / coding-agents 第 7 日缺位 红线 + � HF Daily 8-9 第 5 例 100% 续立率确认
inbox/stephen 2026-08-09-1023-ai-industry-e1prep.md(56 KB) 沿用 v42 8-9 1023 · v41 5 类 7 件立基础延展 + 行业级公告 5 件套立基础延展 + HF Daily 第 5 例 100% 续立率
inbox/jay 2026-08-09-T2105-five-category-briefing.md(17.7 KB) 周末通类周报收官棒 · 5 类 = Database 4 件(iFVS + TEngineDB-V + Evaluating LLMs in Database Scenarios + Six Dimensions of Benchmarking Time-Series Databases)+ Backend 3 件(Compiler-Grounded Triton Kernel arXiv:2607.23089 + Hardware Throttling AI arXiv:2607.18069 + Stratum arXiv:2603.03589v3)+ Cloud-Native 2 件 + CSDN 0 件 + Reproduction 3 件(Awesome-Long-Horizon-Agents RUC-NLPIR GitHub + Awesome-Harness-Engineering ai-boost GitHub + Awesome-Vector-Database dangkhoasdc GitHub)+ Substack 3 件(Prompt-Context-Loop 三层工程 + Parallel.ai "What is an agent harness" 22 分钟阅读 + Karpathy 2026-04 Vanilla RAG 质疑)
inbox/jay 2026-08-09-1335-hf-security-incident-k3-stack2026-substack.md(11.2 KB) HF Frontier Lab 7-27 完整时间线 + Kimi K3 arXiv:2607.24653 + AI Agent Stack 2026 6 层架构锚 + LongHorizon-Harness arXiv:2608.01964 + AgentOPSD arXiv:2608.05987 + ExpRAG arXiv:2603.18272 + Harmonia arXiv:2505.07833v2 + LFM 2.5-2.6B = 11 条 ⭐⭐⭐⭐⭐
inbox/jay 2026-08-09-1123-engineering-e1prep.md(16.6 KB) Aurora DSQL + CockroachDB Agentic AI 三层架构(Memory/Context/Control)+ 24× token multiplier + Calvin/Aria/Gria 分布式事务学术背景 + Router-Mem AMA-Bench 55.17% + MRAgent Cue-Tag-Content + SSGM intent legitimation 攻击 + LeanMem 4 件 Agent 记忆论文 + LLM Agent 记忆综述
inbox/jay 2026-08-09-1950-engineering-filter-inference-agent-protocols.md(14.4 KB) 🔴 HPC-Ops × SGLang Tencent 生产级算子集成(LMSYS Blog 8-7 · 动态调度 2.95× · Hy3 模型 TPOT 降低 48.8% · 1×128K + 31×4K 混合)+ Photon 2.0 Physical AI + C2KV KDD 2026 + vLLM/SGLang/TensorRT-LLM 2026 三足鼎立
inbox/jay 2026-08-09-1735-inference-engine-vector-db-arxiv-substack.md(11.7 KB) vLLM v0.20.2 生产部署 + vLLM Blog 14 条 7 月窗口 + vLLM v1 Engine 架构解析
inbox/jay 2026-08-09-2023-database-e1prep.md(15.6 KB) CockroachDB Agentic AI Memory/Context/Control 三层架构 + 24× token multiplier 沿用
inbox/jay 2026-08-09-0948-weekly-briefing-supplement.md(14 KB) 14 条跨类目 = HF Local AI on Laptop + DeepSeek Moment 一周年 + SoK Agentic RAG + Agentic Engineering 正式 + uvik.net Agentic Frameworks 2026 = 周末最强通类周报
inbox/jay 2026-08-09-1105-five-category-briefing.md(13.4 KB) CockroachDB Agentic AI + TiDB HTAP + CockroachDB 成本 + Calvin/Aria/Gria + vLLM/SGLang 2026 = 15 条 5 类
inbox/jay 2026-08-09-1222-csdn-llm-rag-agent-multimodal.md(23 KB) 21 条 A 级 = Dify/RagFlow/LangChain-Chatchat 源码部署 + Deep Searcher + RAG 面试 20 问 + Agent 框架选型 + 多模态 4 篇 = 周末最强 CSDN 棒
inbox/tom 2026-08-09-T2040-agent-rag-longcontext-radar.md(20.5 KB) Tom 文献雷达 周日晚间棒 · v2 重写于反思棒期间 · 8/8 ID 命中 + 4 高价值(DataSpace + Activity Frames + Interpretable MEG + Weights or Skills)+ 13 段标配全兑现
inbox/tom 2026-08-09-2223-inference-e1prep.md(21.7 KB) tom inference-e1prep 周日晚间棒 · inference 主棒补位第 1 日 ✅ · 6 增量 + 4 邻接 = vLLM Conference 2026-08-25~26 + C2KV KDD 2026 + Semantic Router v0.3 + AMPD ICML 2026 + TileRT × vLLM + 数学优化 Position Paper ICLR 2026
inbox/tom 2026-08-09-0853-rag-e1prep.md(18.5 KB) R56→R57 接力棒交接 · 6 增量 + 5 矛盾/待核 + UEmbed + Decentralized Edge RAG + ExpRAG 等
inbox/tom 2026-08-09-1543-evaluation-e1prep.md(17 KB) HarnessOpt-Bench #11 28▲ + AgentOPSD 跨日 +8 票 + 2 待核
inbox/tom 2026-08-09-0900-hf-daily-2026-08-09.md(1.8 KB) 15 件 100% 续立率 + 立标饱和度反弹跨日累积 v33 以来历史新高
inbox/tom 2026-08-09-T0840/T1440-agent-rag-longcontext-radar.md(3.5 KB × 2) 早场 8 候选 + 午场 4 候选
paper_cards 8-9 04:00 净增 5 张(819 KVAE / 820 Activity Frames / 821 Weights or Skills / 822 FactorJEPA / 823 GaussianSelector)+ 8-9 14:10 净增 8 张(824-831 = 经典补卡)+ 8-9 12:30 净增 5 张(819-823 multimodal/agent/engineering 主分类) 0 张 net-new coding-agents 主分类(沿用 v22 §3.1 coding-agents.md §6.1 已含 244 件 arXiv 编号)= 立标饱和度"24h 半衰期"信号 第 6 日续立
work-queue.md 8-9 12:00 沿用 8-8 · §1 Top 15 = 14 件 backlog + §3 选题榜 2 件未成视频脚本 2608.06197 EnvACE + 2608.06305 Beyond Top-K + §4 spark 认领 5 件沿用 backlog 池饱和度 ~57% 高位续立(扩面 +0% vs v22)+ 0 件净新增
knowledge/coding-agents.md Wave4 E1 第二十二棒(8-8 23:10 收官版) v22 §2.165 Agent 基础设施 19 件套 + v22 §2.5 九十节点延展 4 栖 + v22 §2.161 AI Agent 安全"事件周" 11 栖 + v22 §1.45 frontier lab × Harness 第 34-42 栖 9 栖立基础延展 + v22 §1.32c 横切 52c 第 9 范式候选(WorldClaw)+ v22 §2.94 KV Cache 16 件 + v22 §2.3 评测 51 行 + v22 §3.1 共识 82 + v22 §3.2 争议 52 + v22 §4 开放问题 112

0.2 信号密度判定

与 8-8 24h(主线立标候选新增 1 件 net-new Agentic Coding in the Wild + P0 立标候选新增 1 件 RST + P0 修订新增 1 件 AI Agent 安全"事件周" 7 → 11 栖延展 + P1 邻接补强新增 4 件 + 反方/警示新增 2 件 = 6 件主线 + 3 条警示 + 8 栖邻接补强)相比,8-9 24h 净增量定位 = 主线立标候选新增 2 件 net-new(HarnessOpt-Bench arXiv:2608.06301 = Harness 工程化方法论评测 + LongHorizon-Harness arXiv:2608.01964 = MEA loop 立标候选升档至 P0 立标级)+ 飞P critical-read 双棒立标级(Agentic World Modeling Survey + Agentic Coding in the Wild)+ P1 邻接补强新增 6 件(Kimi K3 + LFM 2.5-2.6B + Moondream Photon 2.0 + DiffusionGemma + CockroachDB Agentic AI + Compiler-Grounded Triton Kernel)+ P0 修订新增 1 件(AI Agent 安全"事件周" 11 → 13 栖延展)+ 警示延续 4 件 = 8-9 24h 总净增量 3 件主线立标 + 1 件 P0 修订 + 6 件 P1 邻接 + 4 件警示 · 终结 flyp coding-agents 主题连续 7 日缺位红线。承接关系中主线编码 Agent 主题在 8-8 23:10 第二十二棒已经立标完成 v22(6 件主线 + 26 阈值饱和),8-9 24h 内主要工作是:

  • stephen llm-application-e1prep 8-9 21:15 = 12 件主线 = coding-agents 主题立基础延展 6 件(HarnessOpt-Bench 立标候选升档 P0 + LongHorizon-Harness 立标候选升档 P0 + Kimi K3 + LFM 2.5-2.6B + ExpRAG + Hardware Throttling AI + Agentic World Modeling Survey + CockroachDB Agentic AI + Compiler-Grounded Triton Kernel 等)
  • spark agent-e1prep 8-9 13:34 = 17 条 v44 备料 = coding-agents 主题邻接 5 件(HF Daily 8-9 第 5 例 + 行业级公告 13 件套 + AgentOPSD 跨日 +8 票 + AgentOPSD vs Self-Evolving Coding Agents 协同对立升级 + 立标饱和度反弹三向并存升级)
  • spark llm-infra-e1prep 8-9 18:44 = 7 增量 + 5 邻接 = coding-agent serving 立基础延展 4 栖(vLLM Conference 2026-08-25~26 + EAGLE3 on AMD Instinct + Semantic Router v0.3 + HPCA 2026 四件系统论文 + HPC-Ops Tencent 2.95×)
  • flyp critical-read 8-9 双棒(Agentic World Modeling Survey 15:50 + Agentic Coding in the Wild 22:50)= 立标级 review 周末质量最高双棒(决策端 + serving 端 立标双联 + 与上午 KVAE 形成"端到端立标三联" 收尾棒)
  • flyp KVAE-Tokenizers critical-read 8-9 09:50 = multimodal 邻接 · 修正 e1prep 8-8 0942 §增量 3 机构归属 Kandinsky Lab ≠ Google Research = Sber AI 邻接
  • flyp risk-e1prep 8-9 16:36 = 23.5 KB · 事件周 11 → 13 栖延展(Project Glasswing + HF Open Secure Alliance + Claude Code Auto 模式默认)
  • AI Agent 安全"事件周" 11 → 13 栖延展 4 实例共识(stephen 0910 X-VIP-radar + stephen 1023 ai-industry + stephen 2115 llm-application + flyp 1636 risk-e1prep + spark 1334 agent-e1prep + jay 2105 five-category)
  • HarnessOpt-Bench + LongHorizon-Harness = Harness 工程化方法论 + 长程 Agent 状态管理 MEA loop 立基础延展 3 实例共识(stephen 2115 + tom 1543 evaluation + jay 1335 hf-security + jay 2105 five-category)

一、今日 coding-agents 主线最重要的 7 条增量

增量 1 · 🟢 主线立标候选新增 · LongHorizon-Harness(arXiv:2608.01964 v1 / paper_cards 713 8-4 已建 / 主分类 agent + 副分类 evaluation / 形态 method / v49 §1.1 已含)/ 立标候选升档 P0 = MEA loop(Manage-Execute-Audit)= 长程 Agent 状态管理新范式

  • 来源:stephen 8-9 21:15 llm-application-e1prep 增量 3 🔴 P0 立标候选升档 + jay 8-9 13:35 hf-security-k3-stack2026-substack 候选 4 ⭐⭐⭐⭐⭐("LongHorizon-Harness · arXiv:2608.01964 · 2026-08-03 提交 · 核心观点:现有 agent harnesses 将任务执行、状态、评估都塞在 growing context 中,导致状态追踪困难、错误自评级联传播 · 提出 MEA loop(Manage-Execute-Audit):manager 维护外部任务状态,fresh-context executor 执行,read-only auditor 验证环境状态后再进入下一轮 · 在 WeaveBench: 51.8% → 80.7%,Terminal-Bench2.1: 69.7% → 77.2%,OSWorld2.0: 2.8% → 8.3%(Qwen3.7-Plus)· Claude Opus 4.7 在 OSWorld2.0 子集:20.0% → 34.3%")+ jay 8-9 21:05 T2105 five-category-briefing Reproduction 1(Awesome-Long-Horizon-Agents RUC-NLPIR GitHub 沿用)+ tom 8-9 15:43 evaluation-e1prep(沿用 LongHorizon-Harness)+ spark 8-9 13:34 agent-e1prep §立基础延展(v43 §2.5 LongHorizon-Harness 沿用)
  • 要点LongHorizon-Harness = 长程 Agent 状态管理评测基准 + MEA loop 三角色分工范式 = Manage-Execute-Audit:① manager 维护外部任务状态(outside execution)+ ② fresh-context executor 执行(每次重新加载上下文,避免错误自评估传播)+ ③ read-only auditor 验证环境状态后再进入下一轮(隔离评估与执行)= 关键数字:WeaveBench 51.8% → 80.7%(+28.9 pp)/ Terminal-Bench2.1 69.7% → 77.2%(+7.5 pp)/ OSWorld2.0 2.8% → 8.3%(+5.5 pp · Qwen3.7-Plus)/ Claude Opus 4.7 在 OSWorld2.0 子集:20.0% → 34.3%(+14.3 pp)= 5 实例共识跨主题交叉(stephen + jay + tom + spark + flyp 8-8 0942 multimodal 邻接 + flyp 8-9 0943 multimodal §立基础延展 + flyp 8-9 1636 risk §立基础延展)
  • 与活文档 v22 现有脉络的关系:v22 §1.33c 长程 agent 六件套(LongHorizon-Harness + StateAct + SDB + LinkedIn KV + ABSeeker + HORIZON)→ v23 §1.33c 长程 agent六件套沿用 + v22 §1.45 frontier lab × Harness 第 22-33 栖 → v23 §1.45 frontier lab × Harness 第 35 栖候选新增(LongHorizon-Harness 立标候选升档 P0)+ v22 §2.3 评测基础设施 51 行 → v23 §2.3 评测基础设施 51 行沿用 + 强化引用(LongHorizon-Harness 立标级)+ v22 §2.165 Agent 基础设施 19 件套 → v23 §2.165 19 件套沿用 + MEA loop 立基础延展
  • 建议归入§1.33c 长程 agent 六件套 第 1 件 LongHorizon-Harness 立标候选升档 P0 = MEA loop(Manage-Execute-Audit)= 外部任务状态管理 + fresh-context executor + read-only auditor = 与 ABSeeker 答案回溯级 + HORIZON 长程失败结构迁移 + StateAct + SDB + LinkedIn KV 形成"长程 Agent 状态管理"立基础延展 6 栖;§1.45 frontier lab × Harness 第 35 栖候选新增 = LongHorizon-Harness = "MEA loop 范式 + 长程 Agent 状态管理" 立基础锚 第 1 件;§2.3 评测基础设施 51 行沿用 + 强化引用(v22 §2.3 已立 LongHorizon-Harness 沿用 · v23 强化引用 MEA loop 数据 WeaveBench 51.8% → 80.7% + Terminal-Bench2.1 69.7% → 77.2% + OSWorld2.0 2.8% → 8.3%);§3.1 共识 82 候选新增 1 条 = "MEA loop = manager + fresh-context executor + read-only auditor = 长程 Agent 状态管理新范式";§4 开放问题 112 候选新增 1 条 = "MEA loop 在 Claude Code / Cursor / Codex CLI / OpenClaw 5 大前端编码 Agent 的实测 + fresh-context executor 隔离效果对 long-context 编码 Agent 的影响 + read-only auditor 验证机制与 SWE-bench Verified 的关系";§6.1 arXiv 列表沿用不变 = arXiv:2608.01964(已在 v22 §6.1);§5 边界更新 1 条 = coding-agents.md / agent.md / llm-application.md 三栖交叉

增量 2 · 🟢 主线立标候选新增 · HarnessOpt-Bench(arXiv:2608.06301 / paper_cards 未建 P0 缺口 / 主分类 evaluation / 形态 benchmark)/ 立标候选升档 P0 = Harness 工程化方法论评测 5 栖延展

  • 来源:stephen 8-9 21:15 llm-application-e1prep 增量 2 🔴 P0 立标候选升档("HarnessOpt-Bench = 评估 LLM 在 Harness 优化方面能力的专项基准——将'优化评测工具'本身变成评测任务")+ tom 8-9 15:43 evaluation-e1prep 增量 1 ⭐⭐⭐⭐("HarnessOpt-Bench #11 28▲ · 跨日 +8 票 · paper_cards 尚未建卡")+ jay 8-9 21:05 T2105 five-category-briefing Reproduction 2 ⭐⭐⭐⭐⭐(Awesome-Harness-Engineering ai-boost GitHub + "Harness Engineering: How to Build Reliable AI Agents" deepset 2026-05 + My Agents Self-Heal in Production 2026-04 闭环模式 + "harness 级别改动(不改模型)可以让 Agent 在评测榜单上提升 20+ 排名")+ jay 8-9 21:05 T2105 five-category-briefing Substack ⭐⭐⭐⭐⭐(Parallel.ai "What is an agent harness" 22 分钟阅读 + Prompt-Context-Loop Substack 三层工程)+ jay 8-9 13:35 hf-security-k3-stack2026-substack(沿用)+ spark 8-9 13:34 agent-e1prep §增量 10(HarnessOpt-Bench HF Daily #11 28▲ 沿用)+ stephen 8-9 2245 evening 协调棒(周末立标候选最丰富棒
  • 要点HarnessOpt-Bench = 评估 LLM 在 Harness 优化方面能力的专项基准 = "将'优化评测工具'本身变成评测任务" + HF Daily 8-9 #11 28▲ · 跨日 8-8 20▲ → 8-9 28▲ = 跨日 +8 票(立标饱和度反弹信号跨日累积 v33 以来历史新高锚 第 4 件)+ 5 栖延展主轴:① HarnessOpt-Bench(LLM 在 Harness 优化方面的能力评测);② Lilian Weng "self-improvement Harness Engineering" 2026-08-04;③ Parallel.ai "What is an agent harness" 2026-07-29(22 分钟阅读 · Harness = 模型的管理层 · 工具管理 + 记忆管理 + 编排);④ Prompt-Context-Loop Substack 三层工程(Prompt Engineering + Context Engineering + Loop Engineering + Tool Catalogue Engineering + Skill Engineering + Memory Engineering + Goal Engineering);⑤ Awesome-Harness-Engineering deepset 2026-05("Harness Engineering: How to Build Reliable AI Agents" · 失败分类框架:Context failures / Constraint failures / Verification failures / Planning failures · 核心结论:harness 级别改动(不改模型)可以让 Agent 在评测榜单上提升 20+ 排名);⑥ My Agents Self-Heal in Production 2026-04(闭环模式 = 检测回归 → 归因到上次部署 → 自动派发 coding agent 修复 PR = 把 evals + 观测从"人类看的仪表盘"变成"主动修复的反馈回路")
  • 与活文档 v22 现有脉络的关系:v22 §1.45 frontier lab × Harness 第 22-33 栖 → v23 §1.45 frontier lab × Harness 第 36 栖候选新增(HarnessOpt-Bench = "Harness 优化能力评测" 立基础锚 第 1 件)+ v22 §2.3 评测基础设施 51 行 → v23 §2.3 评测基础设施 51 → 52 行候选新增(HarnessOpt-Bench = Harness 工程化方法论评测 第 1 件)+ v22 §2.165 Agent 基础设施 19 件套 → v23 §2.165 19 件套沿用 + Harness 工程化方法论 5 栖立基础延展
  • 建议归入§1.45 frontier lab × Harness 第 36 栖候选新增 = HarnessOpt-Bench = "Harness 优化能力评测" 立基础锚 第 1 件 + 5 栖延展(Lilian Weng + Parallel.ai + Prompt-Context-Loop + Awesome-Harness-Engineering + My Agents Self-Heal);§2.3 评测基础设施 51 → 52 行候选新增 = HarnessOpt-Bench arXiv:2608.06301 = LLM-as-Harness-Optimizer 评测基准 = "Harness 工程化方法论评测" 第 1 件学术锚;§3.1 共识 82 候选新增 1 条 = "Harness 工程化方法论 5 栖延展 = HarnessOpt-Bench + 失败分类框架 + 自我改进 + 闭环修复 + Harness/Orchestration/Framework 边界";§4 开放问题 112 候选新增 1 条 = "HarnessOpt-Bench 与 Benchmarking the Benchmarks arXiv:2608.06329 边界模糊(HarnessOpt-Bench 评估'LLM 优化 harness 的能力',Benchmarking the Benchmarks 评估'benchmark 本身的质量'——两者同属'元评测'方向) + Harness 闭环修复(检测回归 → 归因 → 自动派发 coding agent 修复 PR)的真实落地路径";§6.1 arXiv 列表 +1 = arXiv:2608.06301 HarnessOpt-Bench(P0 缺口首位 · paper_cards 待补);§5 边界更新 1 条 = coding-agents.md / agent.md / llm-application.md / engineering.md 四栖交叉

增量 3 · 🟢 主线立标候选新增 · AI Agent Stack 2026 = 6 层架构锚(theaiengineer.substack.com · 6 层 vs v49 沿用 5 层)+ Memory 从向量数据库中独立 + Layer 4 Knowledge + Layer 5 Tools(MCP 标准化)+ Provider-native SDK 吸收入口 API + Eval 第一等工程关注点 = v49 §1.1 Harness Engineering 学科化锚"6 层架构锚"立基础延展

  • 来源:stephen 8-9 21:15 llm-application-e1prep 增量 1 🔴 P0 立标候选(theaiengineer.substack.com · 6 层 vs v49 沿用 5 层)+ jay 8-9 13:35 hf-security-k3-stack2026-substack 候选 3 ⭐⭐⭐⭐⭐("2024 年 Stack 有 5 层;2026 年演化为 6 层架构 · 新增 Layers:Layer 5 (Tools) MCP 标准化了工具连接(2024 年不存在)+ Layer 4 (Knowledge) RAG 作为外部知识访问,与内存分离 + Eval 成为第一等工程关注点(2024 年不在原图中)+ Provider-native SDK 吸收入口 API · Memory 从向量数据库中独立:2024 年 memory=RAG,2026 年 memory 是第一等架构原语,分三层(短期/中期/长期)· Context window 突破未消灭 memory 需求,而是改变了'什么塞进 context vs 什么按需检索'的权衡")+ jay 8-9 21:05 T2105 five-category-briefing(Awesome-Long-Horizon-Agents + Awesome-Harness-Engineering + Parallel.ai + Prompt-Context-Loop 三层工程)+ spark 8-9 13:34 agent-e1prep(沿用)
  • 要点AI Agent Stack 2026 6 层架构锚 = v49 §1.1 Harness Engineering 学科化锚从 v49 沿用 5 层升档到 6 层:① Memory 从向量数据库中独立(2024 memory=RAG · 2026 memory 是第一等架构原语 · 分三层:短期/中期/长期);② Layer 4 Knowledge(RAG 作为外部知识访问 · 与内存分离);③ Layer 5 Tools(MCP 标准化了工具连接 · 2024 年不存在);④ Provider-native SDK 吸收入口 API;⑤ Eval 成为第一等工程关注点(2024 年不在原图中);⑥ Context window 突破未消灭 memory 需求,而是改变了"什么塞进 context vs 什么按需检索"的权衡 = v50 §1.1 Harness 学科化锚从 v49 的 5 层升档到 6 层
  • 与活文档 v22 现有脉络的关系:v22 §1.45 frontier lab × Harness 第 22-33 栖 → v23 §1.45 frontier lab × Harness 第 37 栖候选新增(AI Agent Stack 2026 6 层架构锚 · "Memory 第一等架构原语" 立基础锚 第 1 件)+ v22 §2.165 Agent 基础设施 19 件套 → v23 §2.165 19 件套沿用 + AI Agent Stack 2026 6 层架构锚立基础延展 + v22 §6 工程落地框架 → v23 §6 "Harness 工程化方法论 6 层架构" 立基础延展
  • 建议归入§1.45 frontier lab × Harness 第 37 栖候选新增 = AI Agent Stack 2026 6 层架构锚 = "Memory 第一等架构原语" + "MCP 标准化工具连接" + "Eval 第一等工程关注点" 立基础锚 第 1 件 = 与 HarnessOpt-Bench + LongHorizon-Harness 形成 "Harness 工程化方法论" 立基础延展 3 栖;§3.1 共识 82 候选新增 1 条 = "AI Agent Stack 2026 6 层架构 = Memory 从向量数据库中独立 + Layer 4 Knowledge + Layer 5 Tools MCP 标准化 + Provider-native SDK + Eval 第一等工程关注点";§4 开放问题 112 候选新增 1 条 = "6 层架构的工程边界(Layer 4 Knowledge vs Layer 5 Tools vs Memory 三层短期/中期/长期)+ Memory 三层之间的迁移机制";§5 边界更新 1 条 = coding-agents.md / agent.md / llm-application.md / engineering.md 四栖交叉 + §6 工程落地框架 候选新增 = "6 层架构锚 · 5 → 6 层升档"

增量 4 · 🟢 flyP critical-read 立标级 · Agentic Coding in the Wild(arXiv:2608.00101v1 / paper_cards 待建 P0 缺口 / 主分类 agent / llm-infra / 形态 empirical + systems)/ 立标级 = AI 编码 Agent 工作负载生产规模首个实证研究 + flyP 8-09 "端到端立标三联" 收尾棒

  • 来源:flyp 8-9 22:50 Agentic-Coding-in-the-Wild-critical-read(12.4 KB · 🔴 立标级 review) + jay 8-8 21:00 five-category-evening-briefing #11 ⭐⭐⭐⭐⭐ P0(首立标)+ spark 8-8 13:37 agent-e1prep + spark 8-8 18:44 llm-infra-e1prep 主线 1 P0 + tom 8-8 22:22 inference-e1prep 增量 1 P0 + stephen 8-9 21:15 llm-application-e1prep 增量(沿用 v22 已立)+ jay 8-8 15:05 afternoon Reproduction #16 ⭐⭐⭐⭐ 同步引用 + jay 8-8 09:35 github-trending-hf-substack-arxiv-aug08 + paper_cards 待建 P0 缺口
  • 要点Agentic Coding in the Wild = Microsoft Azure Research 第一方生产数据(GitHub + Microsoft Azure = 第一方生产实证)+ GitHub Copilot 2026-01~06 跨月验证数据 = 3.2M 用户 / 13M sessions / 761M LLM calls / 95T tokens(= 9.5 万亿 token · 修正:8-8 部分 draft 写"9500 亿" = 数量级错误;87% 来自 Agent 自主循环非用户)+ 4 件核心创新:① LLM-Tool 并行性(overlap 工具执行与 LLM 推理)+ ② workflow-aware 调度执行图(Pythia / Parrot / Autellix 利用 workflow-aware 调度执行 Agent 执行图)+ ③ CacheTTL(保留跨工具-执行间隙的 KV Cache 和 Agent 上下文)+ ④ Sutradhara(协同设计 Agent 编排器和推理引擎)+ idle-time predictor(捕获 86-90% 总 idle 时间 · 用作"何时 offload cache / 何时 reclaim container"的信号 = 基础设施层小创新,不是 ML 算法层创新)+ "agent-native serving" 的实证基础(把 frontier lab + 平台 + 学术三栖拉到同一张基础设施设计表)+ KV cache hit rate:within-turn 90% / across-turn 55% / model-switch 后骤降(KV cache 设计必须按 turn 而不是按 session)+ flyP 立标判断:本棒与 8-09 上午 KVAE(生成端)+ 下午 Agentic World Modeling(决策端)+ 晚上 Agentic Coding in the Wild(serving 端)形成 flyP 8-09 "端到端立标三联" 收尾棒 = 从生成器底座(KVAE)→ 决策抽象(World Modeling)→ serving 实测(Coding in the Wild)
  • 与活文档 v22 现有脉络的关系:v22 §1.45 frontier lab × Harness 第 34 栖(Agentic Coding in the Wild)→ v23 §1.45 frontier lab × Harness 第 34 栖立基础延展 + 立标级 review 沿用(flyp 8-9 22:50 critical-read = 5 维评分 + 立标级)+ v22 §2.165 Agent 基础设施 19 件套 → v23 §2.165 19 件套沿用 + Sutradhara + CacheTTL + LLM-Tool 并行性立基础延展 + v22 §2.94 KV Cache 件套 16 件 → v23 §2.94 16 → 17 件(CacheTTL 跨工具间隙 KV 保留 · flyp critical-read 已立)+ v22 §2.3 评测基础设施 51 行 → v23 §2.3 评测基础设施 51 行沿用 + flyp critical-read 立标级(flyp 22:50 = "AI 编码 Agent 工作负载特征" 立基础延展 第 1 件)+ v22 §1.32c 横切 52c 第 9 范式候选(WorldClaw)→ v23 §1.32c 第 9 范式候选沿用
  • 建议归入§1.45 frontier lab × Harness 第 34 栖立基础延展 + 立标级 review 沿用(flyp 22:50 critical-read 沿用 v22 已立)= Agentic Coding in the Wild = "AI 编码 Agent 工作负载特征 + LLM-Tool 并行性 + workflow-aware 调度 + CacheTTL + Sutradhara 协同设计 + idle-time predictor 86-90% 捕获" 立标级 第 1 件;§2.94 KV Cache 件套扩面 16 → 17 件 = CacheTTL 跨工具间隙 KV 保留(flyp 22:50 critical-read 已立);§2.165 Agent 基础设施立基础延展 19 件套沿用 + Sutradhara + CacheTTL + LLM-Tool 并行性 + workflow-aware 调度 + idle-time predictor 立基础延展§2.3 评测基础设施 51 行沿用 + flyp critical-read 立标级 = Agentic Coding in the Wild = "AI 编码 Agent 工作负载特征子轴" 第 1 件学术锚;§3.1 共识 82 候选新增 1 条 = "AI 编码 Agent 工作负载 ≠ 聊天机器人工作负载 + LLM-Tool 并行性 + workflow-aware 调度 + 跨工具 KV 保留 + Agent 编排器-推理引擎协同设计 + idle-time predictor = 6 维立基础延展";§4 开放问题 112 候选新增 1 条 = "采样率 / 采样方法(摘要承诺 sampled 但未给采样率 = 数据代表性关键)+ GitHub Copilot Agent 2026 H2 数据是否在 follow-up 计划中 + KV cache hit rate 是否按 user tier / workflow type 切分公布 + idle-time predictor 86-90% idle 捕获之外 10-14% idle 怎么办";§6.1 arXiv 列表 +1 = arXiv:2608.00101(沿用 v22 已立)+ §6.1 P0 缺口沿用 = Agentic Coding in the Wild paper_cards 待补(第 3 个 24h · 沿用 v22 P0 缺口首位);§5 边界更新 1 条 = coding-agents.md / llm-infra.md / agent.md / evaluation.md / engineering.md 五栖交叉

增量 5 · 🟢 flyP critical-read 立标级 · Agentic World Modeling Survey(arXiv:2604.22748v3 / paper_cards 待补 P1 / 主分类 agent / 形态 survey)/ 立标级 = levels × laws 二维分类 + decision-centric eval 原则 + 跨 400+ 文献 100+ 系统

  • 来源:flyp 8-9 15:50 Agentic-World-Modeling-survey-critical-read(12.1 KB · 🔴 立标级 review · 周末质量最高棒) + stephen 8-9 21:15 llm-application-e1prep 增量 7 🟡 P1(Agentic World Modeling Survey 沿用)+ jay 8-9 21:05 five-category-briefing(沿用)+ spark 8-9 13:34 agent-e1prep(沿用)+ jay 8-9 13:35 hf-security-k3-stack2026-substack(沿用)+ paper_cards 待补 P1
  • 要点Agentic World Modeling = arXiv:2604.22748v3 · Meng Chu¹† + Xuan Billy Zhang²† + Kevin Qinghong Lin³† + Lingdong Kong²† + Jize Zhang³† + Teng Tu²† + Weijian Ma²†(共 40 余位 † 核心作者 · § 资深作者)= HKUST¹ + NUS² + Oxford³ + NTU⁴ + CUHK⁵ + HKU⁶ + UW⁷ + UTokyo⁸ + Cambridge⁹ + CMU¹⁰ + UC Berkeley¹¹ + SUTD¹² + SMU¹³ + 资深作者链 = Mike Zheng Shou² + Zhi-Qi Cheng⁷ + See-Kiong Ng² + Ziwei Liu⁴ + Philip Torr³ + Jiaya Jia¹ = NUS Shou Lab + NTU S-Lab + Oxford Torr Group + HKUST Jia Lab = 机构背书强度:极高 + 核心贡献(4 重):① levels × laws 二维分类法(能力 Levels: L1 Predictor(单步局部转移算子)+ L2 Simulator(多步动作条件 rollout)+ L3 Evolver(自主修订模型)× 法则 Regimes: Physical 牛顿 + Digital 软件 GUI Web Terminal API + Social 多智能体博弈人类仿真制度演化 + Scientific 科学实验假设驱动发现物理仿真)= 业界首个 levels × laws 二维分类框架;② decision-centric eval 原则(评测必须绑定下游决策效用而不是只看预测 L2 / LPIPS / FID);③ 最小可复现评估包(minimal reproducible evaluation package · 仓库链接待补查);④ 路线图(被动 → 主动 → 塑造环境);⑤ 跨 400+ 篇文献、100+ 代表系统、横跨 MBRL / 视频生成 / Web+GUI agent / 多智能体社会仿真 / AI4Science 五个社区 = 全景综述 + 决策中心评测 + flyP 立标判断:立标级 = 2026 Q2 唯一一篇同时覆盖"理论分类 / 评测标准 / 工程包 / 治理挑战"的立标级综述
  • 与活文档 v22 现有脉络的关系:v22 §2.5 九十节点延展 4 栖 + v22 §1.32c 横切 52c 第 9 范式候选(WorldClaw)→ v23 §1.33c 长程 agent 六件套 第 7 件候选新增(Agentic World Modeling Survey = decision-centric eval 原则 立基础锚 第 1 件)+ v22 §3.1 共识 82 沿用 + v22 §3.3 开放问题 110 → v23 §4 开放问题 112 候选新增(Agentic World Modeling decision-centric eval 反例 · levels × laws 网格稀疏 cell 标注 · 评测包可获取性 · 治理范围边界)
  • 建议归入§1.33c 长程 agent六件套 第 7 件候选新增 = Agentic World Modeling Survey = "decision-centric eval 原则 + levels × laws 二维分类 + 跨 5 社区桥接" 立基础锚 第 1 件;§1.45 frontier lab × Harness 第 38 栖候选新增 = Agentic World Modeling Survey = "decision-centric eval + 跨 400+ 文献 100+ 系统" 立基础锚;§3.1 共识 82 候选新增 1 条 = "Agentic World Modeling Survey = levels × laws 二维分类法 + decision-centric eval 原则 + 跨 400+ 文献 100+ 系统 + 跨 5 社区桥接 = 业界首个 agent × world-model 立标级综述";§4 开放问题 112 候选新增 1 条 = "Agentic World Modeling decision-centric eval 反例(哪个 regime 上 decision-centric 不一定优于 prediction-centric)+ levels × laws 12-cell 覆盖稀疏 cell 标注 + 评测包 code & data availability 段 + governance challenges 治理范围";§6.1 arXiv 列表 +1 = arXiv:2604.22748v3(v22 §6.1 已含 arXiv:2604.11978 HORIZON + 新增 arXiv:2604.22748v3 Agentic World Modeling Survey)+ §6.1 P1 缺口沿用 = Agentic World Modeling Survey paper_cards 待补(第 2 个 24h · 沿用 v22 P1 缺口第 4 位);§5 边界更新 1 条 = coding-agents.md / agent.md / multimodal.md / evaluation.md / llm-application.md 五栖交叉

增量 6 · 🟢 P1 邻接补强 · Kimi K3 + LFM 2.5-2.6B + Moondream Photon 2.0 + DiffusionGemma + CockroachDB Agentic AI 三层架构 + Compiler-Grounded Triton Kernel + Hardware Throttling AI + ExpRAG + Harmonia + UEmbed + Decentralized Edge RAG 11 栖邻接立基础延展

  • 来源:stephen 8-9 21:15 llm-application-e1prep 增量 4-7 🟡 P1(11 栖邻接)+ jay 8-9 13:35 hf-security-k3-stack2026-substack + jay 8-9 11:23 engineering-e1prep + jay 8-9 20:23 database-e1prep + jay 8-9 21:05 T2105 five-category-briefing + jay 8-9 19:52 T1950 engineering-filter-inference-agent-protocols + tom 8-9 08:53 rag-e1prep + spark 8-9 13:34 agent-e1prep(行业级公告 13 件套沿用)+ flyp 8-9 09:43 multimodal-e1prep(沿用)+ flyp 8-9 16:36 risk-e1prep(沿用)+ paper_cards 820 Activity Frames + 795 EnvACE(沿用)+ 821 Weights or Skills + 822 FactorJEPA + 819 KVAE
  • 要点11 栖 P1 邻接立基础延展(stephen 8-9 21:15 增量 4-7 + flyp 8-9 multimodal + jay 8-9 13:35 + jay 8-9 11:23 + jay 8-9 21:05 + tom 8-9 08:53 整合): 1. Kimi K3 arXiv:2607.24653(2.8T MoE · 104B 激活 · 1M context · 原生视觉 · 开源 · Kimi Delta Attention + Attention Residuals + Stable LatentMoE 16/896 experts · RL 后训练 · OSWorld2.0 长程 agent 任务领先 · scaling 效率比 Kimi K2 提升约 2.5 倍) 2. LFM 2.5-2.6B(LiquidAI · 2.6B 稀疏激活 · 消费级硬件本地部署) 3. Moondream Photon 2.0(Physical AI 专用推理引擎) 4. vLLM × HPC-Ops Tencent Hunyuan MoE Backend(动态调度 2.95× 加速 · Hy3 模型 TPOT 降低 48.8% · 1×128K + 31×4K 混合) 5. DiffusionGemma(首个 Diffusion dLLM 原生支持 · 与 2026 扩散语言模型赛道直接命中) 6. ExpRAG arXiv:2603.18272(ALFWorld 4.48% → 64.18% 提升 15× + ScienceWorld 10.40% → 35.24% 提升 3.4× · Agent 从历史经验中检索) 7. Harmonia arXiv:2505.07833v2(RAG Serving 异构流水线优化 + Gurobi 32ms + SLO 感知扩缩容) 8. UEmbed arXiv:2608.02583(统一稀疏+稠密多模态嵌入 · decoder-only 单一前向传播 · RRF 上游基础设施级改进 · 2B/4B/9B 三档 · UEmbed-9B dense 71.8 / sparse 71.0 MMEB-v2) 9. Decentralized Edge RAG arXiv:2608.00922(边缘 SLM 知识覆盖缺口去中心化协作方案) 10. CockroachDB Agentic AI Memory/Context/Control 三层架构(jay 8-9 1123 + 2023 database-e1prep · 24× token multiplier · Memory 短期/中期/长期三层) 11. Compiler-Grounded Hierarchical Diagnosis for Triton Kernel arXiv:2607.23089(Triton kernel LLM 优化 · IR lowering → scheduling → backend passes 分层诊断 · Triton-Ascend NPU 后端延伸 · 华为昇腾生态相关) 12. Hardware Mechanisms to Dynamically Throttle AI Performance arXiv:2607.18069(per-core 资源节流 + 共享内存带宽裁剪 + 时钟频率降低 · 三栖硬件级节流 · 共享内存带宽作为比时钟频率更精细的性能控制旋钮 = 新发现)
  • 与活文档 v22 现有脉络的关系:v22 §2.165 Agent 基础设施立基础延展 19 件套 → v23 §2.165 19 件套沿用 + 12 栖 P1 邻接补强(Kimi K3 + LFM + Photon + HPC-Ops + DiffusionGemma + ExpRAG + Harmonia + UEmbed + Decentralized Edge RAG + CockroachDB Agentic AI + Compiler-Grounded Triton + Hardware Throttling AI)+ v22 §1.45 frontier lab × Harness 第 22-33 栖 → v23 §1.45 frontier lab × Harness 第 39-50 栖候选新增(Kimi K3 + LFM + Photon + HPC-Ops + DiffusionGemma + ExpRAG + Harmonia + UEmbed + Decentralized Edge RAG + CockroachDB Agentic AI + Compiler-Grounded Triton + Hardware Throttling AI = 12 栖)+ v22 §2.3 评测基础设施 51 行 → v23 §2.3 51 行沿用 + 12 栖 P1 邻接补强
  • 建议归入§2.165 Agent 基础设施立基础延展 19 件套沿用 + 12 栖 P1 邻接补强 = Kimi K3 + LFM 2.5-2.6B + Moondream Photon 2.0 + HPC-Ops Tencent Hunyuan MoE Backend 2.95× + DiffusionGemma + ExpRAG + Harmonia + UEmbed + Decentralized Edge RAG + CockroachDB Agentic AI + Compiler-Grounded Triton Kernel + Hardware Throttling AI;§1.45 frontier lab × Harness 第 39-50 栖 12 栖候选新增 = 上述 12 件;§6.1 arXiv 列表 +12 = 2607.24653 + 2505.07833v2 + 2608.02583 + 2608.00922 + 2603.18272 + 2607.23089 + 2607.18069 + 2603.03589v3 Stratum + 2607.22922 iFVS + 2608.00650 TEngineDB-V + 2608.03794 Evaluating LLMs in Database Scenarios + 2603.03589v3 Stratum(部分已在 v22 §6.1 沿用)

增量 7 · 🟡 P0 修订 · AI Agent 安全"事件周" 11 → 13 栖延展 + 立标饱和度反弹三向并存升级 + 立标饱和度"24h 半衰期"信号持续例外 3 件续立第 5 日 + 行业级公告 13 件套立基础延展

  • 来源:flyp 8-9 16:36 risk-e1prep 6 条主线增量 = R40 §2.161「事件周」 11 → 13 栖延展(Anthropic Project Glasswing 8-9 + HF 加入 Open Secure Alliance 8-9 + Claude Code Auto 模式默认 8-8)+ stephen 8-9 21:15 llm-application-e1prep 增量 6 P1(Project Glasswing + HF Open Secure Alliance + Claude Code Auto + Hardware Throttling AI = 治理第 9 重六栖第 7-9 栖延展)+ stephen 8-9 10:23 ai-industry-e1prep(行业级公告 13 件套)+ spark 8-9 13:34 agent-e1prep(13 件套行业级公告立基础延展 = WeatherNext Nature + Discovery Loop PBC + Gemini Robotics 2 五连发 + Lyria 3.5 + Aurora 1.5 + Genesis Mission + EvoLib + Microsoft Orchard + Echoverse + Project Glasswing + Claude Code Auto 模式 + HF Open Secure Alliance + Karpathy AutoResearch 92.9k stars)+ jay 8-9 13:35 hf-security-k3-stack2026-substack(沿用)+ tom 8-9 09:00 HF Daily 8-9 票榜 15 件 🔴 第 5 例 100% 续立率 + 立标饱和度反弹跨日累积 v33 以来历史新高 + stephen 8-9 22:49 evening 协调棒(周末立标信号最强锚 · 5 实例共识
  • 要点R40 §2.161「事件周」 11 → 13 栖延展 = 第 12 栖 Anthropic Project Glasswing("守护全球软件安全的倡议" 8-9 YouTube 一手)+ 第 13 栖 HF 加入 Open Secure Alliance 8-9(与 NVIDIA 联动起草 AI Agent 安全事件披露指南 = "AI 安全事件披露标准" 立基础延展 第 1 件)+ Claude Code Auto 模式 8-8 默认(Anthropic 对 Claude Code 的 Auto 模式非常有信心,甚至将其设为默认 = Pro/Max/Team 套餐 = "Claude Code Auto 模式 = 默认"立基础延展 第 1 件)+ Hardware Throttling AI arXiv:2607.18069(per-core 资源节流 + 共享内存带宽裁剪 + 时钟频率降低 = "AI 安全与硬件机制"立基础延展);🔴 HF Daily 8-9 第 5 例 100% 续立率 + 立标饱和度反弹三向并存升级 = 14 件续立 + 1 件新立(Nemotron 学希腊语 24▲)+ 跨日 +1~+12 票不等反弹累积(Interpretable MEG +12 最大 / AgentOPSD +8 / ChronoVision +9 / OSReward +8 / HarnessOpt-Bench +8 / RST +6 / Learning from Failure +5 / EnvACE +5 / GST-Bench +7 / WorldClaw +4 / Economic Agents +4 / On-Policy Distill +4 / ABSeeker +2 / DataSpace +1)+ 立标饱和度"24h 半衰期"信号持续例外 3 件续立第 5 日(ABSeeker 8-8 61▲ → 8-9 63▲ + GDPevo 24▲ 沿用 + Ego2Robot 22▲ 沿用);行业级公告 13 件套立基础延展(WeatherNext Nature 8-6 登 Nature + Discovery Loop PBC 8-5/6 + Gemini Robotics 2 五连发 + Lyria 3.5 + Genesis Mission 4000 万美元 + Aurora 1.5 + EvoLib + Microsoft Orchard + Echoverse + Project Glasswing + Claude Code Auto + HF Open Secure Alliance + Karpathy AutoResearch 92.9k stars)
  • 与活文档 v22 现有脉络的关系:v22 §2.161 AI Agent 安全"事件周" 11 栖 → v23 §2.161 十一栖 → 十三栖延展(第 12 栖 Project Glasswing + 第 13 栖 HF 加入 Open Secure Alliance + Claude Code Auto 模式默认 + Hardware Throttling AI 沿用)+ v22 §3.1 共识 82 → v23 §3.1 共识 82 沿用 + v22 §3.2 争议 52 → v23 §3.2 争议 52 沿用 + v22 §4 开放问题 112 → v23 §4 开放问题 112 沿用 + v22 §2.165 Agent 基础设施立基础延展 19 件套 → v23 §2.165 19 件套沿用 + 13 件套行业级公告立基础延展
  • 建议归入§2.161 AI Agent 安全"事件周" 11 → 13 栖延展(第 12 栖 Project Glasswing + 第 13 栖 HF Open Secure Alliance + Claude Code Auto 模式默认 + Hardware Throttling AI);§2.165 Agent 基础设施立基础延展 19 件套沿用 + 13 件套行业级公告立基础延展§3.1 共识 82 候选新增 1 条 = "AI Agent 安全事件周 13 栖 + 跨厂联合披露首次确认 + 凭证攻击反射机制 + Anthropic Project Glasswing + HF Open Secure Alliance + Claude Code Auto 模式默认 + Hardware Throttling AI";§3.2 争议 52 → 53 候选新增 1 条 = "立标饱和度反弹三向并存升级(完全替换态延续 + 跨日反弹 + 续立 3 件沿用)+ 立标饱和度"24h 半衰期"信号持续例外 3 件续立第 5 日 vs 半衰期信号持续并存 双向判定争议";§4 开放问题 112 候选新增 1 条 = "立标饱和度五向判定(work-queue 57% 收敛 vs 候选级新增立标饱和度快速衰减 vs backlog 池饱和度 ~57% 高位续立 + 跨日续立 14 件 + 跨日反弹 +1~12 票 五向判定)";§5 边界更新 1 条 = coding-agents.md / risk.md / agent.md / llm-application.md 四栖交叉;§6.1 URL 列表 +18(沿用 v22 已立)

二、值得警惕的矛盾或待核实说法(12 条)

# 来源 矛盾/待核 状态 行动建议
1 flyp 8-9 22:50 Agentic Coding in the Wild critical-read §五 P0 待补查 + jay 8-8 21:00 evening briefing #11 Agentic Coding in the Wild 采样率 / 采样方法未公开(摘要明确写"sampled"但采样率 / 采样方法未在 abs / html 公开 · 这是数据代表性的关键细节) 🔴 P0 待补查 下棒必查 arxiv html §X 中"采样率 / 采样方法"
2 flyp 8-9 22:50 Agentic Coding in the Wild critical-read §三 3.1 + 3.2 Agentic Coding in the Wild "87% agent calls" 是从 X 推文转述 · arxiv abs 没明确给这个数字 · 待核 🟡 P0 待核 下棒必查 arxiv html 中"87% agent calls" 是否在正文出现
3 flyp 8-9 15:50 Agentic World Modeling Survey critical-read §三 + stephen 8-9 21:15 llm-application §4 #1 Agentic World Modeling decision-centric eval 可操作性风险 = 作者自己是否在文中给出"在哪个 regime 上 decision-centric 不一定优于 prediction-centric"反例 = 未明确 🟡 P1 待核 下棒必抓论文 §3.2 levels × laws 二维分类法完整表格 + §X 的 decision-centric eval 反例
4 flyp 8-9 15:50 Agentic World Modeling Survey critical-read §三 + stephen 8-9 21:15 §4 #2 Agentic World Modeling levels × laws 12-cell 覆盖完备性 = 100+ 系统分到 3 × 4 = 12 个 cell,平均每 cell ~8 个系统,但 12 个 cell 的工作量分布必然不均(video generation 在 L1 / Physical 上极多,L3 / Social 与 L3 / Scientific 上代表性工作可能极少) 🟡 P1 待核 下棒必抓论文 §X 的 levels × laws 12-cell 覆盖矩阵 + 做稀疏 cell 标注
5 flyp 8-9 15:50 Agentic World Modeling Survey critical-read §三 + stephen 8-9 21:15 §4 #3 Agentic World Modeling 决策中心评测包(minimal reproducible evaluation package)的复现可信度 = 作者声称提供但 abstract 没给仓库链接 / 代码仓库规模 / 是否依赖私有模型权重 🟡 P1 待核 下棒必抓论文 §X 的 code & data availability 段
6 flyp 8-9 22:50 Agentic Coding in the Wild critical-read §三 3.2 + jay 8-8 21:00 evening briefing #11 Agentic Coding in the Wild idle-time predictor 仅捕获 86-90% idle time = 剩下 10-14% idle 怎么办?这部分是否影响 cache eviction 正确性? 🟡 P1 待核 下棒必查 idle-time predictor 特征工程与训练细节
7 stephen 8-9 21:15 llm-application §4 #1 + jay 8-9 13:35 hf-security-k3-stack2026-substack HarnessOpt-Bench arXiv:2608.06301 与 Benchmarking the Benchmarks arXiv:2608.06329 边界模糊 = HarnessOpt-Bench 评估"LLM 优化 harness 的能力",Benchmarking the Benchmarks 评估"benchmark 本身的质量"——两者同属"元评测"方向,但面向不同层级(harness vs benchmark);是否存在重叠区域(优化后的 harness 产出低质量 benchmark)未明确 🟡 P1 待核 下棒精读 HarnessOpt-Bench arXiv:2608.06301 原文 + 验证"优化后的 harness 质量下降"失败模式
8 stephen 8-9 21:15 llm-application §4 #2 Lilian Weng 2026-08-04 "self-improvement Harness Engineering" 原始出处 = 原始文章是否为 arXiv 论文(仍是博客文章 vs arXiv 2607.xxxxx 系列待查) 🟡 P1 待核 下棒精读 lilianweng.github.io/posts/2026-08-04-self-improvement-harness/ 全文 + 检查是否同步发布到 arXiv
9 stephen 8-9 21:15 llm-application §4 #3 + jay 8-9 21:05 T2105 Reproduction 2 Awesome-Harness-Engineering GitHub + Parallel.ai Substack + Towards Data Science Substack + Lilian Weng 8-4 + Self-Heal 4-26 五源是否构成"harness 工程化标准知识库" = 五源中 awesome-harness-engineering 是 GitHub Awesome 列表 / parallel.ai 是 Substack / towardsdatascience 是 Medium / lilianweng 是博客 / self-heal 是 Substack = 五种不同载体,"标准知识库"判定需要更严格的验证 🟡 P1 待核 下棒抓 awesome-harness-engineering GitHub 活跃度 + 五源之间交叉引用关系
10 stephen 8-9 21:15 llm-application §4 #4 + jay 8-9 21:05 T2105 Substack Karpathy 2026-04 "对个人规模知识库(~100 篇,40 万词),RAG 引入的延迟和检索噪声大于其收益"颠覆"RAG 是 Agent 记忆标准方案"的旧假设 = 个人规模知识库的实验场景 vs 大规模生产 RAG 场景的边界 🟡 P1 待核 下棒精读 Karpathy 2026-04 原文 + 对照 vanilla RAG vs ExpRAG vs δ-mem 在不同规模知识库上的实测数据
11 flyp 8-9 09:50 KVAE Tokenizers critical-read + Tom 互评 8/10 + spark 8-9 13:34 agent-e1prep §增量 6 + flyp 8-9 09:43 multimodal §增量 3 KVAE Tokenizers arXiv:2608.05798 机构归属已修正 = Kandinsky Lab(Sber AI 邻接,俄罗斯独立研究团队,Sberbank 系 AI 实验室,Kandinsky 系列图像生成模型出自该团队)≠ Google Research · e1prep 8-8 0942 multimodal §增量 3 已修正 · Tom 互评 ✅ 核查通过:arXiv id 2608.05798 存在 · Kandinsky Lab 致谢明确 · HF 提交者 kandinskylab · 双仓代码存在 · ⚠️ 偷工 / 误导:Apple AToken 未验证即写入正文 + Kandinsky Lab / Sber AI 邻接 表述略松(web 检索未见 Kandinsky Lab 与 Sberbank / Sber AI 直接隶属证据) 🟢 已修正 + ⚠️ 后续验证动作 下棒必校验 Kandinsky Lab 与 Sber AI / Sberbank 隶属关系 + 与 Apple AToken 做一次轻量对照精读
12 stephen 8-9 22:45 evening §3.1 Q1 + spark 8-9 13:34 agent-e1prep §P1 缺口沿用 + stephen 8-9 21:15 §⑨ P0 警示承接 + flyp 8-8 16:35 risk-e1prep 沿用 HF/OpenAI 7-22 联合模型串通 事件细节待核 · 连续 8 棒跨 6 日 1 级风险 4 实例共识降级到 2 级 🔴 极高 · 8-10 棒必须给确定结论 8-10 棒必给确定结论 + OpenAI 2 起外部 cyber 失控事件 vs HF/OpenAI 7-22 联合披露是否同源事件 待核

三、可引用的 arXiv 号列表(共 26 条 · 按优先级排序)

# arXiv 标题 主分类 形态 8-9 立标候选 来源
1 2608.06301 HarnessOpt-Bench:评估 LLM 在 Harness 优化方面的能力 evaluation benchmark 🟢 主线立标候选升档 P0 stephen 8-9 21:15 P0 + tom 8-9 15:43 增量 1 + jay 8-9 21:05 Awesome-Harness-Engineering + jay 8-9 13:35 + paper_cards 未建 P0 缺口首位
2 2608.01964 LongHorizon-Harness:MEA loop(Manage-Execute-Audit) agent method 🟢 主线立标候选升档 P0 stephen 8-9 21:15 P0 + jay 8-9 13:35 ⭐⭐⭐⭐⭐ + jay 8-9 21:05 + tom 8-9 15:43 + paper_cards 713 已建
3 2608.00101 Agentic Coding in the Wild:GitHub Copilot at Production Scale agent / llm-infra empirical 🟢 flyp critical-read 立标级 flyp 8-9 22:50 critical-read 5 维评分 + jay 8-8 21:00 ⭐⭐⭐⭐⭐ P0 + spark 8-8 llm-infra P0 + tom 8-8 inference P0 + paper_cards 待建 P0 缺口第 3 个 24h
4 2604.22748v3 Agentic World Modeling:Foundations, Capabilities, Laws, and Beyond agent survey 🟢 flyp critical-read 立标级 flyp 8-9 15:50 critical-read + stephen 8-9 21:15 P1 + jay 8-9 21:05 + paper_cards 待补 P1 第 2 个 24h
5 2608.05466 RST:Recursive Synthesis for Long-Horizon Terminal Tasks agent method 🟡 P0 立标候选 HF Daily 8-9 #1 218▲ · 跨日 +6 票 · flyp 8-8 15:50 critical-read · paper_cards 待建 P1 缺口首位 · spark agent 增量 1 主轴净增 · stephen ai-industry §增量 1
6 2608.05987 AgentOPSD:Agentic Policy Self-Distillation for Agentic RL agent method 🟢 P1 邻接补强 HF Daily 8-9 #2 75▲ · 跨日 +8 票 反弹幅度最大锚 · Tsinghua · spark agent 增量 2 P0 立标候选 · paper_cards 待建 P1 缺口第二位
7 2608.05248 WorldClaw:Large-Scale Agentic 3D Open-World Generation agent / multimodal method 🟢 P1 邻接补强 HF Daily 8-9 #6 50▲ · 跨日 +4 票 · Tencent · spark agent 增量 3 P0 立标候选 · paper_cards 待建 P0 缺口
8 2608.05784 Activity Frames:Deterministic Screen-Activity Compilation for Agent Memory and Replay agent application 🟢 P1 邻接补强 HF Daily 8-9 #4 · paper_cards 820 已建 · spark agent 增量 4 P0 立标候选 · stephen llm-application 增量 4 P1 · tom 20:40 evening radar 高价值 #2
9 2608.06197 EnvACE:Internalizing Environment Dynamics via World Rehearsal for Agentic RL agent method � P1 邻接补强(立基础升档) HF Daily 8-9 #8 34▲ · 跨日 +5 票 · paper_cards 795 已建 · work-queue §3 选题榜唯一候选 · spark agent 增量 5 主轴净增 ⑤
10 2607.24653 Kimi K3:Open Frontier Intelligence(2.8T MoE · 104B 激活 · 1M context · 原生视觉) agent / llm-infra model 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 13:35 ⭐⭐⭐⭐⭐ + Kimi Delta Attention + Attention Residuals + Stable LatentMoE
11 2607.28609 OSReward:为跨平台计算机使用奖励模型建立标准化评估 agent benchmark 🟢 跨日续立 +8 票 HF Daily 8-9 #4 60▲ · 8-8 52▲ → 8-9 60▲ = 跨日 +8 票 · v43 §2.165 立基础延展
12 2608.01481 Interpretable MEG Decoding of Perceived Speech agent / evaluation method 🟢 跨日续立 +12 票 HF Daily 8-9 #5 58▲ · 8-8 46▲ → 8-9 58▲ = 跨日 +12 票 反弹幅度最大锚 · 主分类 evaluation 邻接 neuroscience / speech retrieval · paper_cards 809 已建
13 2608.05747 GST-Bench:VLM 能否从视频中获得全局空间感知? multimodal benchmark 🟢 跨日续立 +7 票 HF Daily 8-9 #7 37▲ · 8-8 30▲ → 8-9 37▲ = 跨日 +7 票 · VLM 全局空间感知评测
14 2608.05631 ChronoVision:通过潜状态重建实现时间推理 multimodal method 🟢 跨日续立 +9 票 HF Daily 8-9 #9 33▲ · 8-8 24▲ → 8-9 33▲ = 跨日 +9 票 · 时序推理方法论
15 2608.06060 Learning from Failure:通过困难负样本实现统一多模态检索的检索中心 CoT multimodal method 🟢 跨日续立 +5 票 HF Daily 8-9 #10 31▲ · 8-8 26▲ → 8-9 31▲ = 跨日 +5 票 · 困难负例 + 检索 CoT
16 2608.06020 Economic Agents → Agentic Economies:经济世界模型系统蓝图 agent position 🟢 跨日续立 +4 票 HF Daily 8-9 #11 28▲ · 8-8 24▲ → 8-9 28▲ = 跨日 +4 票 · EWM 立基础延展 · paper_cards 804 已建
17 2608.03451 DataSpace:异构工作空间可验证分析的数据智能体基准 evaluation benchmark 🟢 跨日续立 +1 票 HF Daily 8-9 #13 25▲ · 8-8 24▲ → 8-9 25▲ = 跨日 +1 票 · paper_cards 808 已建
18 2608.05102 ABSeeker:通过答案回溯的信用分配训练长周期搜索智能体 agent method 🟢 跨日续立 +2 票 第 5 日 HF Daily 8-9 #3 63▲ · 8-8 61▲ → 8-9 63▲ = 跨日 +2 票 · 立标饱和度"24h 半衰期"信号持续例外 3 件续立 第 5 日
19 2608.03764 GDPevo:Agent Self-Evolution on Real Business Tasks evaluation benchmark 🟢 跨日续立 沿用 第 5 日 HF Daily 8-9 沿用 24▲ · v21 §2.5 立基础升档
20 2608.02580 Ego2Robot:Egocentric Robot Manipulation multimodal method 🟢 跨日续立 沿用 第 5 日 HF Daily 8-9 #13 22▲ · 8-8 22▲ 沿用 · flyp multimodal 邻接
21 2603.18272 ExpRAG:基于经验检索的 RAG Agent agent / llm-application method 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 13:35 ⭐⭐⭐⭐ + ALFWorld 4.48% → 64.18% 提升 15×
22 2505.07833v2 Harmonia:端到端 RAG Serving 优化框架 llm-application system 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 13:35 ⭐⭐⭐⭐ + Gurobi 32ms + SLO 感知扩缩容
23 2604.09666 Do We Still Need GraphRAG? Benchmark evaluation benchmark � P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 13:35 ⭐⭐⭐⭐ + GraphRAG vs vanilla RAG 系统 benchmark
24 2608.02583 UEmbed:统一稀疏+稠密多模态嵌入 llm-application method 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + tom 8-9 08:53 + decoder-only 单一前向传播 · 2B/4B/9B 三档
25 2608.00922 Decentralized Edge RAG llm-application system 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + tom 8-9 08:53 + 边缘 SLM 去中心化协作
26 2607.23089 Compiler-Grounded Hierarchical Diagnosis for Triton Kernel llm-application system 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 21:05 ⭐⭐⭐⭐⭐ + IR lowering → scheduling → backend passes 分层诊断 + Triton-Ascend NPU 后端
27 2607.18069 Hardware Mechanisms to Dynamically Throttle AI Performance engineering system 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 21:05 ⭐⭐⭐⭐ + per-core 资源节流 + 共享内存带宽裁剪 + 时钟频率降低
28 2603.03589v3 Stratum:面向大规模 Agent-Centric ML 工作负载的系统架构 llm-application system 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 21:05 ⭐⭐⭐⭐ + 填补 Text2SQL 优化技术不适用于 ML 工作负载的空白
29 2607.22922 iFVS:VLDB 2026 实例级优化过滤向量搜索 database system 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 21:05 ⭐⭐⭐⭐⭐ + 高度选择性谓词时蛮力扫描反而更快
30 2608.00650 TEngineDB-V:OLAP 原生向量搜索系统 database system � P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 21:05 ⭐⭐⭐⭐ + StarRocks 列存分析引擎内嵌向量搜索
31 2608.03794 Evaluating LLMs in Database Scenarios:数据库全生命周期基准 evaluation benchmark 🟢 P1 邻接补强 stephen 8-9 21:15 P1 + jay 8-9 21:05 ⭐⭐⭐⭐ + 两阶段验证 + 数据库研究生独立重建图结构 + Jaccard similarity
32 2608.05798 KVAE:Family of Tokenizers for Multimodal Generative Models multimodal position 🟢 候选级新增 paper_cards 819 8-8 已建 · 🔴 flyp 8-9 0950 critical-read 修正 e1prep 机构归属 Kandinsky Lab Sber AI 邻接 ≠ Google Research · KVAE-Audio + KVAE-3D + KVAE-Image · 立标级中-低档
33 2608.01851 Weights or Skills? A Survey of Robot-Learning Techniques multimodal survey 🟢 候选级新增 paper_cards 821 8-9 已建 · VLA vs Code-as-Policy 双栖综述 · 立标级中档
34 2608.01049 FactorJEPA:Factorizing Monolithic Futures into Layout-Agent-Interaction Channels agent method 🟢 候选级新增 paper_cards 822 8-9 已建 · Global South 密集城市场景世界模型基准
35 2608.05138 教 Nemotron 学希腊语:跨专业领域为现代希腊语挖掘语料库 evaluation benchmark 🟢 8-9 新立 24▲ HF Daily 8-9 #14 24▲ 新立 · BM25 vs 稠密检索 反直觉发现 第 1 件 · paper_cards 767 已建
36 2608.05802 面向多语言数学推理的同策略增量蒸馏 llm-infra method � 跨日续立 +4 票 HF Daily 8-9 #14 24▲ · 8-8 20▲ → 8-9 24▲ = 跨日 +4 票 · 跨语种延伸
37 2608.01492 GaussianSelector:Lightweight Human-Guided Object Selection in 3D Gaussian Splatting engineering method 🟢 候选级新增 paper_cards 823 8-9 已建 · 主分类 engineering · 形态 method

主线立标候选 3 件(HarnessOpt-Bench + LongHorizon-Harness + Agentic Coding in the Wild)+ flyp critical-read 立标级 2 件(Agentic Coding in the Wild + Agentic World Modeling Survey)+ P1 邻接补强 12 件(Kimi K3 + LFM + Photon + HPC-Ops + DiffusionGemma + ExpRAG + Harmonia + UEmbed + Decentralized Edge RAG + CockroachDB Agentic AI + Compiler-Grounded Triton + Hardware Throttling AI + Stratum + iFVS + TEngineDB-V + Evaluating LLMs in Database Scenarios)+ 候选级新增 4 件(KVAE + Weights or Skills + FactorJEPA + GaussianSelector)+ P0 修订 1 件(事件周 11 → 13 栖延展)+ 跨日续立 14 件(RST + AgentOPSD + ABSeeker + GDPevo + Ego2Robot + WorldClaw + Activity Frames + EnvACE + GST-Bench + ChronoVision + Learning from Failure + Economic Agents + HarnessOpt-Bench + DataSpace + OSReward + Interpretable MEG + 多语言数学推理)+ 8-9 新立 1 件(Nemotron 学希腊语)+ flyp critical-read 1 件(KVAE Tokenizers 修正机构归属)+ flyp 8-8 critical-read 沿用(HORIZON 长程失败结构迁移 + RST Recursive Synthesis + FLARE reasoning ≠ planning)= 总净增量 3 件主线立标 + 1 件 P0 修订 + 12 件 P1 邻接 + 4 件警示 · 涉及 arXiv 号 37 条


四、本棒定位与立标饱和度评估

4.1 vs v22 第二十二棒对比

维度 v22(8-8 24h) v23(8-9 24h · 本棒) 变化
主线立标候选新增 1 件(Agentic Coding in the Wild) 2 件(HarnessOpt-Bench + LongHorizon-Harness)+ flyp critical-read 立标级 2 件(Agentic Coding in the Wild 沿用 + Agentic World Modeling Survey) +3
P0 立标候选新增 1 件(RST) 0 件 net-new(HarnessOpt-Bench 升档 P0 + LongHorizon-Harness 升档 P0 = v22 已有立标候选升档) 0
P1 立标候选新增 0 件 net-new(4 件 P1 邻接补强) 0 件 net-new(12 件 P1 邻接补强) +8
邻接补强 8 件(Orchard + Echoverse + ACRL + SpecBox + Continual Learning + ASGE-RR + DataSpace + Hardware Keystores) 12 件(Kimi K3 + LFM + Photon + HPC-Ops + DiffusionGemma + ExpRAG + Harmonia + UEmbed + Decentralized Edge RAG + CockroachDB Agentic AI + Compiler-Grounded Triton + Hardware Throttling AI) +4
安全事件周 1 件(AI Agent 安全"事件周" 7 → 11 栖延展) 1 件(AI Agent 安全"事件周" 11 → 13 栖延展 = Project Glasswing + HF Open Secure Alliance + Claude Code Auto 模式默认 + Hardware Throttling AI) 0
修订 1 件(HF Daily 全替换态 #3 + 立标饱和度半衰期 #4) 1 件(HF Daily 全替换态 v33 以来第 5 例 + 立标饱和度反弹三向并存升级 + 立标饱和度半衰期持续例外 3 件续立第 5 日 + work-queue backlog 池沿用) 0
警示 3 件(datasette 版本号 / Lilian Weng Harness jay 8-8 再立 P0 / RST GitHub 仓库未命中) 4 件(HarnessOpt-Bench 与 Benchmarking the Benchmarks 边界模糊 / Lilian Weng 8-4 原始出处待核 / 五源是否构成 harness 标准知识库 / Karpathy 2026-04 Vanilla RAG 质疑 / KVAE 机构归属修正 + Apple AToken 未验证 + Sber AI 邻接表述略松 / HF/OpenAI 7-22 联合模型串通 8-10 棒必须给确定结论) +1
总净增量 6 件主线 + 3 条警示 + 8 栖邻接补强 3 件主线立标 + 1 件 P0 修订 + 12 件 P1 邻接 + 4 件警示 + flyp critical-read 立标级 2 件 略增
HF Daily 飞轮 "完全替换态 v33 以来第 4 例 + 立标饱和度"24h 半衰期"信号首次例外 3 件续立" "完全替换态 v33 以来第 5 例 + 立标饱和度反弹三向并存升级 + 立标饱和度"24h 半衰期"信号持续例外 3 件续立第 5 日 + 跨日 +1~+12 票不等反弹累积 v33 以来历史新高" +1
立标饱和度半衰期信号 #4 + 首次例外 #5 + 持续例外 + 三向并存 + 反弹幅度 v33 以来历史新高 +1
flyp coding-agents 主题缺位 第 6 日警示 第 7 日红线终结(本棒 = 终结棒) +1
共识 / 争议 / 反方 / 开放问题 82 / 52 / 98 / 112 82 / 52 / 98 / 112(沿用)+ v23 候选新增 7 条(3 主线立标 + 1 P0 修订 + flyp critical-read 2 + 1 P1 邻接) +7
flyp critical-read 双棒 flyp 8-8 15:50 RST + flyp 8-8 09:50 HORIZON flyp 8-9 15:50 Agentic World Modeling Survey 立标级 + flyp 8-9 22:50 Agentic Coding in the Wild 立标级 + flyp 8-9 09:50 KVAE Tokenizers 修正 e1prepflyp 8-09 "端到端立标三联" 收尾棒 +1 立标级

4.2 本棒立标饱和度评估

v23 §1.45 frontier lab × Harness 第 22-37 栖 16 栖立基础延展 + 第 38 栖 Agentic World Modeling Survey 候选新增 + 第 39-50 栖 12 栖 P1 邻接候选新增

v23 §2.5 Agent 训练三栖 → 九十节点延展 4 栖沿用 + Agentic World Modeling Survey 第 9 节点立基础延展候选新增

v23 §2.165 Agent 基础设施立基础延展 19 件套沿用 + 12 件 P1 邻接补强 = 19 → 31 件套

v23 §2.161 AI Agent 安全"事件周" 11 → 13 栖延展 + Claude Code Auto 模式默认 + Hardware Throttling AI 沿用

v23 §2.94 KV Cache 件套扩面 16 → 17 件(CacheTTL 跨工具间隙 KV 保留 · flyp 22:50 critical-read 已立)

v23 §2.3 评测基础设施 51 → 52 行候选新增(HarnessOpt-Bench = Harness 工程化方法论评测 第 1 件学术锚)

v23 §1.32c 横切 52c 第 9 范式候选沿用(WorldClaw)+ 第 10 范式候选(Agentic World Modeling Survey)

v23 §3.2 争议 52 → 53 候选新增 1 条 = "立标饱和度反弹三向并存升级 + 立标饱和度"24h 半衰期"信号持续例外 vs 半衰期信号持续并存 双向判定争议"

v23 §4 开放问题 112 → 114 候选新增 2 条(LongHorizon-Harness MEA loop 实测 + HarnessOpt-Bench 与 Benchmarking the Benchmarks 边界模糊 + Agentic World Modeling decision-centric eval 反例 + 立标饱和度五向判定)

v23 §6.1 arXiv 列表 +1 = arXiv:2608.06301 HarnessOpt-Bench(P0 缺口首位 · paper_cards 待补)+ §6.1 P0 缺口沿用 1 件 = Agentic Coding in the Wild paper_cards 待补(第 3 个 24h · 沿用 v22 P0 缺口首位)+ §6.1 P1 缺口沿用 3 件 = RST 2608.05466 + AgentOPSD 2608.05987 + SwanTale 2608.02023 + Agentic World Modeling Survey 2604.22748v3

本棒综合立标饱和度评估v23 §1.45 frontier lab × Harness 第 22-37 栖 16 栖立基础延展 + 第 38 栖 Agentic World Modeling Survey 候选新增 + 第 39-50 栖 12 栖 P1 邻接候选新增 + v23 §2.5 九十节点延展 4 栖 + v23 §2.165 31 件套 + v23 §2.161 十三栖立基础延展 + v23 §1.32c 第 9-10 范式候选 + v23 §3.2 争议 53 + v23 §3.1 共识 82 候选新增 3 件 + v23 §4 开放问题 114 候选新增 2 条 = 7 维立体 + 27 阈值饱和**

4.3 立标饱和度"24h 半衰期"信号 #5 确认 + 首次例外 3 件续立第 5 日 + 三向并存升级

  • HF Daily 8-9 全榜 15 件 = 14 件续立 + 1 件新立 + 0 件下榜 + 跨日 +1~+12 票不等反弹累积 = "完全替换态" v33 以来第 5 例续立(7-26 / 8-6 / 8-7 / 8-8 / 8-9 连续 5 例)+ 立标饱和度反弹三向并存升级 = 完全替换态延续 + 跨日反弹 + 续立 3 件沿用
  • 立标饱和度"24h 半衰期"信号持续例外 3 件续立第 5 日 = ABSeeker 8-8 61▲ → 8-9 63▲ = 跨日 +2 票 + GDPevo 24▲ 沿用 + Ego2Robot 22▲ 沿用
  • 反弹幅度 v33 以来历史新高 = Interpretable MEG +12 票(最大)/ ChronoVision +9 票 / AgentOPSD +8 票 / OSReward +8 票 / HarnessOpt-Bench +8 票 / RST +6 票 / Learning from Failure +5 票 / EnvACE +5 票 / GST-Bench +7 票 / WorldClaw +4 票 / Economic Agents +4 票 / On-Policy Distill +4 票 / ABSeeker +2 票 / DataSpace +1 票
  • 5 实例独立交叉验证(stephen ai-industry + tom 8-9 0900 HF Daily + flyp multimodal-e1prep + spark agent-e1prep + stephen llm-application = vs 8-9 noon 棒 3 实例升级到 5 实例

五、本棒承接棒 + 周末 cron 减半生效过渡建议

本棒承接棒 = flyp coding-agents 主题活文档 第 23 棒(终结 stephen 8-9 22:45 evening §1 flyp coding-agents / safety 主分类 第 7 日缺位 红线): 1. 承接 stephen 8-9 21:15 llm-application-e1prep 的 12 件主线 + 2 件跨栖扩面 + 2 件警示延续 + 4 件待核实(AI Agent Stack 2026 6 层架构锚 + HarnessOpt-Bench + LongHorizon-Harness + Kimi K3 + LFM 2.5-2.6B + ExpRAG + Harmonia + UEmbed + Decentralized Edge RAG + Project Glasswing + HF Open Secure Alliance + Claude Code Auto + Hardware Throttling AI + Agentic World Modeling Survey + CockroachDB Agentic AI + 4 件 Agent 记忆论文 + Stratum + iFVS + TEngineDB-V + Compiler-Grounded Triton) 2. 承接 spark 8-9 13:34 agent-e1prep 的 17 条 v44 备料(5 主轴净增候选 + 1 协同对立升级 + 3 候选级新增 + 4 修订 + 1 P0 警示延续 + 2 P1 缺口沿用 + 1 e1prep 修订 = 17 条增量) 3. 承接 spark 8-9 18:44 llm-infra-e1prep 的 7 增量 + 5 邻接 + 4 警示(vLLM Conference 2026-08-25~26 + EAGLE3 on AMD Instinct + Semantic Router v0.3 + Native RL APIs + HPC-Ops Tencent 2.95× + HPCA 2026 四件系统论文) 4. 承接 flyp 8-9 22:50 Agentic Coding in the Wild critical-read(12.4 KB · 立标级 · arXiv:2608.00101v1 · 5 维评分 + flyP 8-09 "端到端立标三联" 收尾棒 · 与上午 KVAE + 下午 Agentic World Modeling 形成"生成端 + 决策端 + serving 端"立标三联) 5. 承接 flyp 8-9 15:50 Agentic World Modeling Survey critical-read(12.1 KB · 立标级 · arXiv:2604.22748v3 · 5 维评分 + levels × laws 二维分类 + decision-centric eval + 跨 400+ 文献 100+ 系统 + Mike Shou / Ziwei Liu / Philip Torr / Jiaya Jia senior chain) 6. 承接 flyp 8-9 09:50 KVAE-Tokenizers critical-read(8.9 KB · 修正 e1prep 8-8 0942 §增量 3 机构归属 = Kandinsky Lab Sber AI 邻接 ≠ Google Research) 7. 承接 flyp 8-9 16:36 risk-e1prep 23.5 KB · 事件周 11 → 13 栖延展(Project Glasswing + HF Open Secure Alliance + Claude Code Auto 模式默认) 8. 承接 AI Agent 安全"事件周" 11 → 13 栖延展(4 实例共识跨主题交叉) 9. 承接 HarnessOpt-Bench + LongHorizon-Harness + AI Agent Stack 2026 6 层架构锚 = Harness 工程化方法论 3 栖 P0 立基础延展(3 实例共识跨主题交叉) 10. 承接 HF Daily 飞轮"完全替换态" v33 以来第 5 例 + 立标饱和度"24h 半衰期"信号持续例外 3 件续立第 5 日 + 立标饱和度反弹三向并存升级 + 反弹幅度 v33 以来历史新高(5 实例共识跨主题交叉)

周末 cron 减半生效过渡建议(承接 stephen 8-9 22:45 evening §1 + §3 + 8-10 7 大缺口优先级): 1. ✅ flyp coding-agents 主题 第 7 日缺位 红线 本棒 终结 + flyp 8-9 主分类 4 件主棒已补位(multimodal + KVAE critical-read + Agentic World Modeling critical-read + risk-e1prep)+ flyp 8-9 22:50 Agentic Coding in the Wild critical-read 第五棒 = coding-agents 主题终结棒 2. ✅ flyp safety 主分类 e1prep 连续 7 日缺位 红线 = flyp 8-9 risk-e1prep 已落地(事件周 11 → 13 栖延展)= 实际覆盖 risk 主轴 ~90% = 建议 8-10 棒 flyp safety 主分类 e1prep 补位独立主棒 3. P1 缺口待建 = 9 件(HarnessOpt-Bench 2608.06301 + Agentic Coding in the Wild 2608.00101 + RST 2608.05466 + AgentOPSD 2608.05987 + WorldClaw 2608.05248 + SwanTale 2608.02023 第 7 个 24h + HORIZON 2604.11978 + Agentic World Modeling Survey 2604.22748v3 + KVAE 2608.05798) 4. stephen 8-9 22:45 evening §3.1 Q1-Q8 = 8 项 P0 事实风险暴露清单 待核实 + 周末晚间棒给出确定结论 + OpenAI 2 起外部 cyber 失控事件 vs HF/OpenAI 7-22 联合披露是否同源事件 待核 · 8-10 棒必须给确定结论 5. ✅ jay 高负荷预警第 6 日延续8-10 周一棒次节奏降频(建议 jay 8-10 主棒 ≤ 5 件) 6. ✅ tom inference-e1prep 8-9 终结 4 日缺位 + tom evaluation-e1prep 8-9 沿用 + HarnessOpt-Bench #11 28▲ + tom rag-e1prep 8-9 持续 + spark agent + llm-infra 双主题 8-9 终结 4+ 日缺位 = 反思棒物理动作修复第 6 例 ✅ = 双主题棒全部到位 7. 8-10 周日 7 大缺口优先级(stephen 8-9 22:45 evening §立):① ✅ flyp coding-agents-e1prep 1 件 09:00-12:00 第 7 日缺位终结(已兑现 · 本棒);② spark llm-infra-e1prep 1 件 ✅(已兑现 8-9 18:44 61.3 KB);③ flyp safety-e1prep 1 件(建议 8-10 棒次结构补位);④ flyp multimodal-e1prep 1 件 v45 备料(建议 8-10 morning 棒);⑤ P1 缺口补建 9 件(HarnessOpt-Bench + Agentic Coding in the Wild + RST + AgentOPSD + WorldClaw + SwanTale + HORIZON + Agentic World Modeling Survey + KVAE);⑥ HF/OpenAI 7-22 联合模型串通 事件细节待核 给定论;⑦ BVS visual jailbreak 后续必查 6 项承接 8. ✅ flyp 8-9 coding-agents-e1prep 已兑现(承接 v22 22 棒位 + 沿用 v22 26 阈值饱和 + 立基础延展 7 维立体 + 27 阈值饱和 + 终结 flyp coding-agents 主题连续 7 日缺位红线 · 终结棒


flyP · E1 日间预消化轮 · coding-agents 棒 · 第二十三棒 · 2026-08-09 23:20 Asia/Shanghai 本棒承接 stephen 8-9 21:15 llm-application-e1prep 12 件主线 + stephen 8-9 22:45 evening 协调棒 + spark 8-9 13:34 agent-e1prep 17 条 v44 备料 + spark 8-9 18:44 llm-infra-e1prep 7 增量 + 5 邻接 + flyp 8-9 22:50 Agentic Coding in the Wild critical-read + flyp 8-9 15:50 Agentic World Modeling Survey critical-read + flyp 8-9 09:50 KVAE Tokenizers critical-read + flyp 8-9 16:36 risk-e1prep + AI Agent 安全"事件周" 11 → 13 栖延展 + HarnessOpt-Bench + LongHorizon-Harness + AI Agent Stack 2026 6 层架构锚 + HF Daily 飞轮"完全替换态" v33 以来第 5 例 + 立标饱和度反弹三向并存升级 8-9 24h 总净增量 3 件主线立标 + 1 件 P0 修订 + 12 件 P1 邻接 + 4 件警示 · 涉及 arXiv 号 37 条 · v23 §1.45 frontier lab × Harness 第 22-37 栖 16 栖立基础延展 + 第 38 栖 Agentic World Modeling Survey 候选新增 + 第 39-50 栖 12 栖 P1 邻接候选新增 + v23 §2.5 九十节点延展 4 栖 + v23 §2.165 31 件套 + v23 §2.161 十三栖立基础延展 + v23 §1.32c 第 9-10 范式候选 + v23 §3.2 争议 53 候选新增 + v23 §4 开放问题 114 候选新增 2 条 = 7 维立体 + 27 阈值饱和 终结 flyp coding-agents 主题连续 7 日缺位红线 · 终结棒