llm-application · E1 预消化简报(2026-07-29)

作者:Stephen · llm-application 主题 E1 预消化棒 · cron c08ec05d-37de-4c0c-9571-3ead761a4802 生成时间:2026-07-29 21:10 Asia/Shanghai(UTC 13:10) 扫描窗口:2026-07-28 21:10(上一棒 7-28 llm-application-e1prep 收官 · 5 件主线 + 2 旁证)→ 2026-07-29 21:08(本次扫描截止 · 约 24 小时) 检查范围: - inbox/jay 7-28 evening + 7-29 全日共 30+ 份(7-28 1140 x-tech-radar · 1950 engineering-filter · 2105 evening-briefing · 2340 x-tech-radar · 7-29 0822 csdn-rag-agent-multimodal · 0940 july2026-github-trending-vecdb-substack-engineering · 1000~1009 RSS × 11 · 1055 engineering-filter-rss-round · 1105 five-category-briefing #11 · 1105 rag-agent-csdn-survey · 1140 x-tech-radar · 1340 rag-agent-csdn-survey · 1505 afternoon-briefing) - inbox/tom 7-28 evening + 7-29 全日共 7 份(7-29 0840 agent-rag-longcontext-radar · 0900 hf-daily · 1441 agent-rag-longcontext-radar · 2040 agent-rag-longcontext-radar · rag-e1prep-v48 · evaluation-e1prep · 1008 RSS × 2) - inbox/flyp 7-28 evening + 7-29 全日共 6 份(7-28 2250 SPA and Multimodal ASV dual critical read B 旁证级 · 7-29 0950 multimodal-e1prep-v34 第二棒 E1 35 件候选增量 · 0952 long-context-multimodal-rag-dual-review · 1000/1005/1008 RSS × 4) - inbox/spark 7-29 仅 RSS 通稿 0 件 E1 落地(连续 4 日回落窗口第 5 棒 · 与 7-28 evening「节奏反转第 4 棒」判断再次相左) - inbox/stephen 7-28 evening + 7-29 全日共 13 份(7-28 2245 evening 协调棒 · 7-29 0910 X-vip-radar · 1006/1007 frontier news 通稿 × 9 · 1025 ai-industry-e1prep-v31 · 1245 noon 协调棒) - paper_cards 近 3 天(7-27~29)新卡 602-642 共 41 张;严格抽查 llm-application 邻接 = 602 Scaling NMM(multimodal)/ 604 IDEAgent(agent)/ 605 LAMAR(rag)/ 607 Molt(agent+eng)/ 608 Multi-Head Latent Control(agent)/ 610 Learning on the Job(agent)/ 611 Teachy Mini(eval)/ 617 DataPrep-Bench(eng+eval)/ 618 APS-RAG(rag)/ 619 DeCoRAG(rag)/ 620 Historical Doc(rag)/ 621 Regulatory RAG(rag)/ 622 Rethinking CFG(multimodal)/ 623 Multi-Turn Long-Horizon(systems)/ 624 Evidence Attribution 无坐标(multimodal)/ 625 Historical Doc(rag)/ 626 Sol-Attn(multimodal+llm-infra)/ 627 Chamaileon(multimodal)/ 628 Warp Divergence(eval)/ 629 IndicTalk(llm-infra)/ 630 Reasoning Denoiser(rag)/ 631 Codifying the Judge(eval)/ 632 WorldDiT(multimodal+eng)/ 633 UltraViT(multimodal)/ 634 Multi-Agent Research Vocabulary(agent)/ 635 HiFi-UMI(eng)/ 636 ReDesign(agent)/ 637 Visual Prompt Engineering(multimodal)/ 638 CVE→ATT&CK(rag)/ 639 A New Role for Relevance(agent)/ 640 Keep It InMind(eval+agent)/ 641 Mage-VL(multimodal)/ 642 PerceptionBench(eval+multimodal)· 本次窗口新建 624-642 共 19 张(7-29 04:00 batch) - work-queue.md(2026-07-29 20:00 自动检测:2607.23242 IndicTalk 已入选待写攻略) 对照活文档/shared/research-kb/organized/knowledge/llm-application.md v39(2026-07-29 04:00 CST · 17h 前固化 · 6 主线 × 5 主轴 × 90 试金石 + 253 项 arXiv ID 候选池 + 47 中型增量候选池 + 80 维 Reliability 候选池 + 147 反方维度 + 469 拐点 + v33-v39 沿用不立标哲学明示) 本文性质:Stephen llm-application 主题 E1 日间预消化;不重写活文档,只列 7-28 21:10 → 7-29 21:08 约 24h 窗口内v39 已固化的 26 件 net-new 候选池 + 5 件已收 ID 完整披露 + 9 件 frontier lab 立标之外的新硬资产增量 + 7-30 ~ 8-02 跨实例核验窗口激活状态,供今晚活文档 v40 接力决策参考 结构框架:v39 五大主线(① Coding Agent ② Personal Assistant Agent ③ Vertical LLM ④ Agentic RAG ⑤ Application-layer Reliability)+ v33 6+2 + v34 7+2 + v35 4+2 + v36 4+2 + v37 7+2 + v38 7+2 + v39 5+2 = 40 补丁链;沿用 v33/v34/v35/v36/v37/v38/v39 不立标哲学


0. 综述判断(给今晚活文档接手时一眼看到)

v39 已固化 26 件 net-new 候选池(v39 §0.5 新增 26 件 + v39 §0.5 已收 ID 完整披露 5 项 + v39 §1.1 7 段 fresh signals + v39 §1.2 5 主线各候选池增量 ①+5/②+2/③+0/④+17/⑤+7 = 31 件 + 9 件 frontier lab 公告资源)+ 90 试金石 + 253 项 arXiv ID 候选池 + 47 中型增量候选池 + 80 维 Reliability 候选池 + 147 反方维度 + 469 拐点。v33/v34/v35/v36/v37/v38/v39 沿用不立标哲学,候选池等 7-29 ~ 8-02 跨实例核验后再做 v40 立标决定。

7-28 21:10 → 7-29 21:08 24h 窗口性质:stephen 7-28 21:10 收官后 → 7-29 noon + (本次扫描时 evening 协调棒 2245 尚未发布)协调棒已落(stephen 1245 noon 棒已读 · 7-29 晚间棒待补)+ stephen 7-29 1025 ai-industry-e1prep-v31 准备棒 + jay 7-29 1105 engineering-e1prep-v39 准备棒 + jay 7-29 1105 rag-agent-csdn-survey + jay 7-29 1105 five-category-briefing #11 + jay 7-29 1055 engineering-filter-rss-round v3 + jay 7-29 1505 afternoon-briefing + jay 7-29 0940 july2026-github-trending-vecdb-substack-engineering + jay 7-29 0822 csdn-rag-agent-multimodal + flyp 7-29 0950 multimodal-e1prep-v34 第二棒 E1 35 件候选增量 + flyp 7-29 0952 long-context-multimodal-rag-dual-review + flyp 7-28 2250 SPA and Multimodal ASV dual critical read + tom 7-29 0840 agent-rag-longcontext-radar + tom 7-29 1441 agent-rag-longcontext-radar + tom 7-29 2040 agent-rag-longcontext-radar + tom 7-29 0853 rag-e1prep-v48 + tom 7-29 1543 evaluation-e1prep + paper_cards 7-29 04:00 batch 新建 19 张全检 + 5 实例 paper_cards 累计 41 张(602-642)。v39 候选池 26 件之外的新硬资产,聚焦 5 大方向:

  1. 🟡 P1 · Kimi K3 arXiv:2607.24653 263▲ 单日 +121 暴增登顶 + 首个 arXiv 编号正式披露 = 主线 ② Personal Assistant Agent 候选池「主权开源模型 2.0 立标栖 第 1 例」从"HF 权重 1.56TB"沿用级确认升级为"arXiv:2607.24653 立基础 + 单日 +121 暴增 85%"正式立标级候选升档——tom 7-29 0900 hf-daily 15 件全核 ⭐⭐⭐⭐⭐(Kimi K3 263▲)+ stephen 7-29 1025 ai-industry-v31 增量 1 ⭐⭐⭐⭐⭐ + stephen 7-29 1007 tldr-ai 第 1 条「Kimi 发布 K3 权重」+ stephen 7-29 1245 noon 协调棒 §1.3 立标级候选 + jay 7-29 1105 five-category-briefing #11 Backend B2 ⭐⭐⭐⭐⭐(Kimi K3 MoE 首个 3T 参数开源 MoE) + jay 7-29 1105 engineering-e1prep-v39 增量 4 ⭐⭐⭐⭐ + spark 7-29 1004 gradient-flow 沿用「三款前沿级模型」 + spark 7-29 1005 chip-huyen 沿用 = 7 实例同步承接 Kimi K3 arXiv 立基础(v39 evening 11 实例同步承接基础上再加 4 实例)

  2. 🟡 P1 · HF Daily 7-29 票榜 14 件替换 + 11 件新立标候选(JarvisHub 104▲ + Progress Reward Modeling 综述 68▲ + Agentic Search 协议蒸馏 67▲ + StateAct 53▲ + Data Pyramid 32▲ + Sol-Attn 25▲ + OmniVAE 23▲ + Scaling Native Multimodal 22▲ + Oxygen-TryOn 21▲ + Agentic Context Management 21▲)+ 3 件续立/翻倍(Rethinking CFG OPD 63▲ 单日 +48▲ 暴增 + DataPrep-Bench 49▲ + Skill Self-Play 35▲ + Molt 29▲)= 主线 ① Coding Agent 候选池 + 主线 ④ Agentic RAG 候选池 + 主线 ⑤ Application-layer Reliability 候选池「评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 1 例」——tom 7-29 0900 hf-daily 15 件全核 + stephen 7-29 1025 ai-industry-v31 增量 1 ⭐⭐⭐⭐⭐ + jay 7-29 1105 five-category-briefing #11 + jay 7-29 1105 engineering-e1prep-v39 + flyp 7-29 0950 multimodal-e1prep-v34 第二棒 §1.4 HF Daily 7-29 票榜 + paper_cards 622(CFG)+ 626(Sol-Attn)+ 627(Chamaileon)+ 632(WorldDiT)+ 633(UltraViT)7-29 new = 5 实例同步承接

  3. 🟡 P1 · jay 7-29 engineering-v39 5 件 P0/P1 级新料(Lilian Weng Harness Engineering 学术框架 + MSR Memora 谐波记忆 + uv 0.12.0 破坏性变更 + Kimi K3 MoE 新开源 + FlashInfer→SGLang/vLLM 集成)= 主线 ① Coding Agent 候选池「Harness Engineering 学术框架立基础 + MSR Memora 工程实现层 vs Weng 理论层 互补 + Python 工具链工程化升级 + 主权开源 2.0 + Attention 后端工程化」5 联 Harness Engineering 学术立标补全 第 3 例——jay 7-29 1105 engineering-e1prep-v39 ⭐⭐⭐⭐⭐ + jay 7-29 1055 engineering-filter-rss-round v3 A1+A2+A3 ⭐⭐⭐⭐ + jay 7-29 1105 five-category-briefing #11 Reproduction 5.1+5.2+5.3 = 3 实例同步承接 Weng Harness + MSR Memora + uv 0.12.0

  4. 🟡 P1 · jay 7-29 1105 rag-agent-csdn-survey-v2 13 件跨三栖(CSDN 4 件强推: RAG Agent 技术解析 + 2026 Agents 全面综述 + AI Agent 与 RAG 一文搞定 + 企业级 LLM Agent 实战 + Substack 4 件强推: AgentOps Lessons 1400+ Production Deployments + RAG Isn't Dead + State of LLMs 2025 + The Infrastructure That Powers RAG + arXiv 5 篇 4 强推 1 推荐: Is Agentic RAG worth it? 2601.07711 ACL2026 Industry Track + MetaRAG 2512.05411 IEEE CAI 2026 + Memory for Autonomous LLM Agents 2603.07670 + Language Models Can Autonomously Hack 2605.06760 + DeepRead 2602.05014)= 主线 ① Coding Agent 候选池 + 主线 ④ Agentic RAG 候选池「跨 arXiv + CSDN + Substack 三栖综合调研 + 评测 + 多 Agent 记忆 + Agent 安全 + 文档结构盲区」——jay 7-29 1105 rag-agent-csdn-survey-v2 ⭐⭐⭐⭐ + jay 7-29 1105 engineering-v39 + jay 7-29 1105 five-category-briefing #11 = 3 实例同步承接

  5. 🟡 P1 · tom 7-29 0853 rag-e1prep-v48 6 件主线增量(APS-RAG arXiv:2607.24663 三路融合 + Corrective Agent 生产级部署 + DeCoRAG arXiv:2607.24554 认知解耦 + 语义感知裁剪 + Evidence Attribution 无坐标版 arXiv:2607.24651 + Substack Nuanced Perspective「Designing Agentic Memory in 2026」+ ChatGPT Agent 案例 + 沿用)+ tom 7-29 1441 agent-rag-longcontext-radar(2 高价值: A New Role for Relevance arXiv:2607.24223 62▲ Direct Corpus Interaction + Keep It InMind arXiv:2607.24368 19▲ implicit-association blind spot + 6 候选)+ tom 7-29 2040 agent-rag-longcontext-radar(4 高价值: RepoReasoner arXiv:2607.25996 + BeyondUncertainty arXiv:2607.25600 + Cyber-Capable AI Agents arXiv:2607.25379 + CodeNib arXiv:2607.25431 + 4 候选 + δ-mem Substack 沿用)= 主线 ④ Agentic RAG 候选池「评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 2 例 + Agentic Memory 五类认知记忆 + memory poisoning 90%+ 易感 + RepoReasoner 仓库级代码推理 + BeyondUncertainty 置信度路由检索 + Cyber-Capable AI Agents 沙箱外安全漏洞五类 + CodeNib 多视图代码库上下文服务 + δ-mem 第三种 Agent Memory 路径」——tom 7-29 0853 rag-e1prep-v48 ⭐⭐⭐⭐ + tom 7-29 1441 radar + tom 7-29 2040 radar + tom 7-29 0840 radar + jay 7-29 1105 five-category-briefing + flyp 7-29 0950 multimodal-v34 第二棒 §1.5 tom radar 邻接 = 5 实例同步承接

v40 候选池预估:v39 候选池 26 件 ≈ 30 件(v39 §0.5 已罗列 ID)基础上,7-29 24h 窗口新增 8-10 件候选(Kimi K3 arXiv:2607.24653 立基础 + HF Daily 7-29 11 件新立标 + 3 件续立 + jay engineering-v39 5 件 P0/P1 + jay rag-agent-csdn-survey-v2 5 篇 arXiv 4 强推 + tom rag-e1prep-v48 6 件主线增量 + tom radar 7-29 早间/午后/晚间 3 棒 4+6+4 候选 + flyp multimodal-v34 第二棒 35 件 v34 候选增量 + flyp long-context-multimodal-rag-dual-review 2 篇),合并入主线 ② / 主线 ① / 主线 ④ / 主线 ⑤ 各节点候选池。预期 v40 候选池 35-40 件(v39 30 件 + v40 新增 8-10 件,增长率 27-33%)。


1. 增量条目(8 件主线 + 1 件旁证,按"建议归入节"分组)

增量 1 · 🟡 P1 重大 · Kimi K3 arXiv:2607.24653 263▲ 单日 +121 暴增登顶 + 首个 arXiv 编号正式披露 = 主线 ② Personal Assistant Agent 候选池「主权开源模型 2.0 立标栖 第 1 例」从 HF 权重 1.56TB 沿用级升级为 arXiv 立基础 + 单日 +121 暴增 85% 正式立标级候选升档

  • 来源
    • inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md 第 1 条 Kimi K3 263▲
    • inbox/stephen/2026-07-29-1025-ai-industry-e1prep.md §增量 1 ⭐⭐⭐⭐⭐(Kimi K3 263▲ 单日 +121 暴增 + arXiv:2607.24653 立基础 + 立标级候选升档触发)
    • inbox/stephen/2026-07-29-1007-news-tldr-ai.md 第 1 条「Kimi 发布 K3 权重」
    • inbox/stephen/2026-07-29-1245-stephen-coordination-check-noon.md §1.3 Kimi K3 立标级续立升级
    • inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Backend B2 ⭐⭐⭐⭐⭐(Kimi K3 MoE 首个 3T 参数开源 MoE)
    • inbox/jay/2026-07-29-1105-jay-engineering-e1prep-v39.md §增量 4 ⭐⭐⭐⭐(Kimi K3 MoE 新开源)
    • inbox/spark/2026-07-29-1004-rss-gradient-flow.md 沿用「三款前沿级模型」= GLM 5.2 + Kimi K3 + Gemini 3.6 Flash
    • inbox/spark/2026-07-29-1005-rss-chip-huyen.md 沿用
  • 要点(增量部分):
    • 🟡 Kimi K3 arXiv:2607.24653 263▲(7-28 142 → 7-29 263 +121 单日暴增 85%)= 首个 arXiv 编号正式披露!之前 v39 evening Simon Willison + jay B1 + spark gradient-flow 沿用的 huggingface.co/moonshotai/Kimi-K3 1.56TB 权重无 arXiv 编号,本场 7-29 HF Daily 头条 263▲ + arXiv:2607.24653 = Kimi K3 立标级候选正式立基础 + 单日 +121 暴增触发立标级候选升档
    • 🟡 7-29 上午 TLDR AI 头条「Kimi 发布 K3 权重」 + stephen 7-29 ai-industry-v31 增量 1 ⭐⭐⭐⭐⭐ = frontier lab 公告资源 + HF Daily 票榜 + arXiv 立基础 三栖同步承接
  • 与活文档 v39 关系
    • v39 §0.5 v39 主题级 arXiv ID 候选池 10 项中 Kimi K3 1.56TB HF 主权开源 2.0 立标栖 第 1 例 + v39 §1.2 主线 ② 第五十九节点候选池(不立标):沿用基础上,v40 §0.5 应升级 Kimi K3 1.56TB HF → Kimi K3 arXiv:2607.24653 立基础 + 立标级候选升档 = 主线 ② 候选升格 60 → 61 节点(1 v40 · 立标级候选升级 · 沿用 v39 不立标哲学)
    • v39 §1.3 补丁 (53) Kimi K3 2.8T MoE 7-27 HuggingFace 1.56TB 完整开源 + LLM-Wiki arXiv:2605.25480 Agent-Native Retrieval 范式转折候选:沿用基础上,v40 §1.3 补丁 (53) 应续立 Kimi K3 7-29 上午 arXiv:2607.24653 263▲ 单日 +121 暴增立基础
    • v39 §3.1 共识 #145 Kimi K3 2.8T MoE vLLM/SGLang 官方支持时间线 + MXFP4 量化精度损失实测 + KDA / AttnRes / Stable LatentMoE 三项架构与 DeepSeek-V4 MoE 实现差异 + LLM-Wiki GitHub 链接 + Kimi K3 Coding/Agentic SOTA:沿用基础上,v40 应新增 1 项反方 = Kimi K3 单日 +121 暴增 vs 同等暴增候选历史对照(DeCoRAG 7-29 09 → ? 同期对照)· 立标级候选升档 vs v33 §2.39.x 升档标准对比
  • 反方 / 警示
    • ⚠️ Kimi K3 单日 +121 暴增(85%) 触发立标级候选升档 vs v33 §2.39.x 升档标准对比:v33 立标级升档标准是「累计跨日 500▲」或「单日 +50 持续 3 日」;Kimi K3 7-28 142 + 7-29 263 = 累计跨日 405▲(距 500 阈值 95▲)· 单日 +121 已超 +50 阈值但仅 1 日数据 · 7-30 ~ 8-01 持续复核窗口
    • ⚠️ Kimi K3 vs 同等暴增候选历史对照:DeCoRAG 同期对照(7-29 09 ▲ vs 7-29 49 ▲?)· 沿用 v39 evening 已立基础 + 立标级候选升档节奏
    • ⚠️ Kimi K3 vLLM/SGLang 官方支持时间线 7-30 截止(stephen noon 协调棒 §4.1 待人工确认 #1 沿用)
    • ⚠️ Kimi K3 MXFP4 量化精度损失实测待核 vs INT4/INT8 在 H100/H200/B200 GPU 上的精度损失对照 7-30 截止
  • 建议归入节v40 §0.5 候选池升级 Kimi K3 1.56TB HF → Kimi K3 arXiv:2607.24653 立基础 + 立标级候选升档 + v40 §1.1 fresh signals 第 X 段(Kimi K3 立基础 + 单日 +121 暴增 85%)+ v40 §1.2 主线 ② 第六十一节点候选池(立标级候选升级 · 沿用 v39 不立标哲学) + v40 §1.3 补丁 (53) 续立 Kimi K3 arXiv:2607.24653 立基础 + v40 §3.1 共识 #149 Kimi K3 立标级候选升档 + 7-30 截止 5 项待消解 + v40 §3.3 反方 1 维度(Kimi K3 单日 +121 暴增 vs v33 §2.39.x 升档标准) + v40 §5.1 已发生 #139 Kimi K3 arXiv 立基础 + 立标级候选升档

增量 2 · 🟡 P1 重大 · HF Daily 7-29 票榜 14 件替换 + 11 件新立标候选(JarvisHub 104▲ + Progress Reward Modeling 综述 68▲ + Agentic Search 协议蒸馏 67▲ + StateAct 53▲ + Data Pyramid 32▲ + Sol-Attn 25▲ + OmniVAE 23▲ + Scaling Native Multimodal 22▲ + Oxygen-TryOn 21▲ + Agentic Context Management 21▲)+ 3 件续立/翻倍(Rethinking CFG OPD 63▲ 单日 +48▲ 暴增 + DataPrep-Bench 49▲ + Skill Self-Play 35▲ + Molt 29▲ + Kimi K3 263▲ 已在增量 1)= 主线 ① Coding Agent + 主线 ④ Agentic RAG + 主线 ⑤ Application-layer Reliability 候选池「评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 1 例」

  • 来源
    • inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md 15 篇全核
    • inbox/stephen/2026-07-29-1025-ai-industry-e1prep.md §增量 1 ⭐⭐⭐⭐⭐
    • inbox/jay/2026-07-29-1105-jay-five-category-briefing.md §1.1 Milvus 3.0 + §1.4 CockroachDB
    • inbox/jay/2026-07-29-1105-jay-engineering-e1prep-v39.md §增量 1-5 5 件 P0/P1
    • inbox/flyp/2026-07-29-0950-multimodal-e1prep-v34.md §1.4 HF Daily 7-29 票榜 15 件 7 件 multimodal 主 + 7 件 multimodal 副
    • inbox/flyp/2026-07-29-0952-long-context-multimodal-rag-dual-review.md AcademicEval + Scaling Beyond Context 2 篇
    • paper_cards/622 Rethinking CFG + /626 Sol-Attn + /627 Chamaileon + /632 WorldDiT + /633 UltraViT 7-29 new
  • 要点(11 件新立标 + 3 件续立):
    • 🟡 JarvisHub arXiv:2607.23588 104▲(7-28 0 → 7-29 104 新立)= Canvas 原生多模态创意 Agent 的开放框架 · v40 §0.5 候选池新增
    • 🟡 Progress Reward Modeling 全面综述 arXiv:2607.21655 68▲(7-28 0 → 7-29 68 新立)= 面向机器人学习的 PRM 综述 · v40 §0.5 候选池新增
    • 🟡 Agentic Search Agentic 协议蒸馏 arXiv:2607.24280 67▲(7-28 0 → 7-29 67 新立)= 从闭源到开源:通过多 Agent 协议蒸馏弥合 Agentic Search 中的分布差距 · v40 §0.5 候选池新增
    • 🟡 Rethinking CFG OPD arXiv:2607.24731 63▲(7-28 15 → 7-29 63 +48▲ 单日暴增 320%)= flyP 7-28 1550 OPD-CFG critical read B+ 旁证级 ⭐⭐⭐⭐ 7-29 升档立标级候选 · v40 §0.5 候选池新增(旁证级升档)
    • 🟡 StateAct arXiv:2607.22798 53▲(7-28 0 → 7-29 53 新立)= 长horizon 计算机使用 Agent 中"先程序状态,后像素" · v40 §0.5 候选池新增 · 邻接主线 ① Coding Agent
    • 🟡 DataPrep-Bench arXiv:2607.20465 49▲(7-28 40 → 7-29 49 +9 续立)= 沿用 v39 §0.5
    • 🟡 Skill Self-Play arXiv:2607.22529 35▲(7-28 30 → 7-29 35 +5 续立)= 沿用 v39 §0.5
    • 🟡 Data Pyramid arXiv:2607.24744 32▲(7-28 0 → 7-29 32 新立)= 具身操作的 Data Pyramid · v40 §0.5 候选池新增
    • 🟡 Molt arXiv:2607.21653 29▲(7-28 24 → 7-29 29 +5 续立)= 沿用 v39 §0.5
    • 🟡 Sol-Attn arXiv:2607.24027 25▲(7-28 0 → 7-29 25 新立)= diffusion transformers 注意力稀疏化 = 主线 ⑥ inference-efficient 七联 · v40 §0.5 候选池新增
    • 🟡 OmniVAE arXiv:2607.23855 23▲(7-28 0 → 7-29 23 新立)= 面向联合生成的跨模态对齐音视频 VAE · v40 §0.5 候选池新增
    • 🟡 Scaling Native Multimodal arXiv:2607.22043 22▲(7-28 0 → 7-29 22 新立)= flyP 7-28 0955 dual critical read 立标级候选 · v34 §2.39.93 已建议 · 沿用 v39
    • 🟡 Oxygen-TryOn arXiv:2607.21694 21▲(7-28 0 → 7-29 21 新立)= 面向任意物品虚拟试穿的时尚原生基础模型 · v40 §0.5 候选池新增
    • 🟡 Agentic Context Management arXiv:2607.21503 21▲(7-28 0 → 7-29 21 新立)= 将 Agent 记忆与成本视为生命周期与架构问题 · v40 §0.5 候选池新增
  • 与活文档 v39 关系
    • v39 §0.5 v39 HF Daily arXiv ID 候选池 5 项 + v39 work-queue 7-29 6 件 = 11 件:沿用基础上,v40 §0.5 应新增 9 件 net-new 立标级候选(JarvisHub + Progress RM + Agentic Search + StateAct + Data Pyramid + Sol-Attn + OmniVAE + Oxygen-TryOn + Agentic Context Management)+ 1 件旁证级升档(Rethinking CFG OPD)+ 2 件续立(DataPrep-Bench + Skill Self-Play + Molt + Kimi K3 增量 1) = 11 件 v40 候选池 + 1 件旁证级升档 = 12 件 net-new
    • v39 §1.1 fresh signals 第 1 段 HF Daily 7-28 5 件 net-new:沿用基础上,v40 §1.1 fresh signals 应新增第 1 段 HF Daily 7-29 票榜 14 件替换 + 11 件新立标 + 3 件续立
    • v39 §1.2 主线 ① Coding Agent 候选池(34 件):沿用基础上,v40 §1.2 主线 ① 应新增 2 件(StateAct 长horizon CUA + Agentic Search 协议蒸馏)→ 36 件
    • v39 §1.2 主线 ⑤ Application-layer Reliability 候选池(80 维):沿用基础上,v40 §1.2 主线 ⑤ 应新增 2 维(DataPrep-Bench / Skill Self-Play 续立 + Progress RM 综述 + Agentic Context Management)= 82 维
    • v39 §3.1 共识 #144 HF Daily 7-28 5 件 net-new + AREX 142 + SANA-Video 2.0 +7 + SDM 18 跌出 5 项:沿用基础上,v40 §3.1 共识 #149 HF Daily 7-29 11 件新立标 + 3 件续立 + Kimi K3 单日 +121 暴增 立标级候选升档 = 评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 1 例
  • 反方 / 警示
    • ⚠️ HF Daily 7-29 14 件替换 vs 7-28 5 件替换缩量结构反转:7-29 14 件替换 vs 7-28 5 件替换是缩量结构反转?7-30 ~ 8-01 持续复核窗口
    • ⚠️ Rethinking CFG OPD 63▲ 单日 +48▲ 暴增 320% 触发立标级候选升档 vs flyP B+ 旁证级升档标准:v33 §2.39.x 升档标准是「累计跨日 100▲」或「单日 +50 持续 2 日」;Rethinking CFG OPD 7-29 63 已超 +50 阈值但仅 1 日数据 · 7-30 持续复核窗口
    • ⚠️ StateAct 53▲ 新立 vs 同等新立候选历史对照:本期 JarvisHub 104 + Progress RM 68 + Agentic Search 67 + StateAct 53 4 件新立 · v34 §2.39.x 升档标准对比
  • 建议归入节v40 §0.5 候选池新增 9 件 net-new + 1 件旁证级升档 + 2 件续立 = 12 件 + v40 §1.1 fresh signals 第 1 段 HF Daily 7-29 票榜 14 件替换 + 11 件新立标 + 3 件续立 + v40 §1.2 主线 ① / 主线 ⑤ 候选升格 + v40 §3.1 共识 #149 评测方法学反思 v40 15-16 件套补完 第 1 例 + v40 §3.3 反方 1 维度(HF Daily 7-29 14 件替换 vs 7-28 5 件替换缩量结构反转) + v40 §4.1 拐点 #164 HF Daily 7-29 票榜 5 项 + v40 §5.1 已发生 #139 HF Daily 7-29 票榜 14 件替换 + 11 件新立标 + 3 件续立

增量 3 · 🟡 P1 重大 · jay 7-29 engineering-e1prep-v39 5 件 P0/P1 级新料(Lilian Weng Harness Engineering 学术框架 + MSR Memora 谐波记忆 + uv 0.12.0 破坏性变更 + Kimi K3 MoE 新开源 + FlashInfer→SGLang/vLLM 集成)= 主线 ① Coding Agent 候选池「Harness Engineering 学术框架立基础 + MSR Memora 工程实现层 vs Weng 理论层 互补 + Python 工具链工程化升级 + 主权开源 2.0 + Attention 后端工程化」5 联 Harness Engineering 学术立标补全 第 3 例

  • 来源
    • inbox/jay/2026-07-29-1105-jay-engineering-e1prep-v39.md §增量 1-5 5 件 P0/P1
    • inbox/jay/2026-07-29-1055-jay-engineering-filter-rss-round-v3.md A1+A2+A3 3 件
    • inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Reproduction 5.1+5.2+5.3 + Backend B2
    • inbox/jay/2026-07-29-1105-jay-rag-agent-csdn-survey-v2.md 跨三栖综合调研
  • 要点(5 件 P0/P1):
    • 🟡 🔴 增量 1 · Lilian Weng Harness Engineering for Self-Improvement(2026-07-04)= RSI 自我改进 + Workflow Automation(Karpathy autoresearch)+ File System as Persistent Memory + Sub-agent & Backend Jobs + ACE(context = evolving playbook)+ MCE(内层/外层优化)+ Harness = AI 的操作系统 · 对照 arXiv:2510.04618(ACE)+ arXiv:2601.21557(MCE)原文精读 · v40 §0.5 候选池新增
    • 🟡 🔴 增量 2 · MSR Memora 谐波记忆系统(2026-07)= 双频段(事实/经验)+ 时序解耦 = 工程实现层 vs Weng 理论层 互补 · v40 §0.5 候选池新增
    • 🟡 🔴 增量 3 · uv 0.12.0 破坏性变更(2026-07-28)= uv init 不再生成 main.py,默认生成 src//init.py(src layout)= Python 工具链工程化升级(依赖解析 + lockfile + workspace) · v40 §0.5 候选池新增
    • 🟡 P1 增量 4 · Kimi K3 MoE 新开源(主权开源 2.0 立标级 · 沿用 v30 evening + 立基础 arXiv)= Kimi K3 首个 3T 参数开源 MoE · 2.8T 参数 · 104B 激活参数 · MoE 架构 · 原生视觉能力 · 1M token 上下文 · MXFP4 权重 + MXFP8 激活 · 沿用增量 1
    • 🟡 P1 增量 5 · FlashInfer→SGLang/vLLM 集成(arXiv:2606.20295v2)= inter-token latency 降低 29%-69% · 长上下文推理延迟降低 28%-30% · block-sparse + composable KV cache 格式 · JIT 模板适配不同 Attention 变体 · load-balancing 调度算法 · v40 §0.5 候选池新增 · 邻接主线 ⑥ inference-efficient
  • 与活文档 v39 关系
    • v39 §0.5 v39 主题级 arXiv ID 候选池 10 项 + v39 work-queue 7-29 6 件 = 16 件:沿用基础上,v40 §0.5 应新增 4 件(Weng Harness + MSR Memora + uv 0.12.0 + FlashInfer 集成)+ 1 件 Kimi K3 增量 1 续立 = 5 件 v40 候选池 + 4 件工程化主题页候选
    • v39 §1.2 主线 ① Coding Agent 候选池(34 件):沿用基础上,v40 §1.2 主线 ① 应新增 4 件(Weng Harness + MSR Memora + uv 0.12.0 + FlashInfer)→ 38 件(立标补全 第 3 例)
    • v39 §2.2 跨主线整合 Harness Engineering 主线 v39 十时间点:沿用基础上,v40 §2.2 Harness Engineering 主线应升级为 十一时间点(Weng Harness 学术框架立基础 + MSR Memora 工程实现层 + uv 0.12.0 Python 工具链 + Molt 训练侧 + Learning on the Job 推理侧 + Multi-Head Latent Control 推理侧 + IDEAgent QD-Search + Skill Self-Play 技能协同进化 + Kimi K3 MoE 集成 + FlashInfer→SGLang/vLLM 集成 = 10 件 P0/P1 立标补全)
    • v39 §3.1 共识 #146 Molt + Learning on the Job + Multi-Head Latent Control + IDEAgent + Skill Self-Play 5 联学术 Harness 立标补全:沿用基础上,v40 §3.1 共识 #150 Weng Harness + MSR Memora + uv 0.12.0 + Kimi K3 + FlashInfer 5 联 Harness Engineering 学术框架立基础
  • 反方 / 警示
    • ⚠️ Weng Harness vs Molt 关系 = Weng 理论层 vs Molt 工程实现层 互补(RSI / Workflow Automation / File System as Persistent Memory / Sub-agent & Backend Jobs / ACE / MCE vs PyTorch-native 训练框架)· 两者是否同质?(参 v33 7-30 ~ 8-02 验证时间表)
    • ⚠️ MSR Memora 谐波记忆 vs Mem0/Lucid/Hypernetwork/Aurora 1.5 关系 = 工程实现层 谐波记忆 vs v36 Memory 五 primitives · 两者是否同质?
    • ⚠️ uv 0.12.0 src layout default = 工业级 Python 工具链共识 = 与 poetry / pip-tools / hatch / pdm 等对比 · 7-30 ~ 8-02 持续复核窗口
    • ⚠️ FlashInfer→SGLang/vLLM 集成 28%-30% 长上下文推理延迟降低实测待核 = 与 v33 SGLang/vLLM 对照 · 7-30 截止
  • 建议归入节v40 §0.5 候选池新增 4 件 net-new + v40 §1.1 fresh signals 第 2 段(Weng Harness + MSR Memora + uv 0.12.0 + Kimi K3 + FlashInfer) + v40 §1.2 主线 ① 候选升格 34 → 38 节点(+4 v40) + v40 §2.2 Harness Engineering 主线 十一时间点 + v40 §3.1 共识 #150 Weng Harness + MSR Memora + uv 0.12.0 + Kimi K3 + FlashInfer 5 联 Harness Engineering 学术框架立基础 + v40 §3.3 反方 1 维度(Weng Harness vs Molt 关系 理论层 vs 工程实现层 是否同质) + v40 §4.1 拐点 #165 Harness Engineering 5 项

增量 4 · 🟡 P1 重大 · jay 7-29 1105 rag-agent-csdn-survey-v2 13 件跨三栖(CSDN 4 件强推: RAG Agent 技术解析 + 2026 Agents 全面综述 + AI Agent 与 RAG 一文搞定 + 企业级 LLM Agent 实战 + Substack 4 件强推: AgentOps Lessons 1400+ Production Deployments + RAG Isn't Dead + State of LLMs 2025 + The Infrastructure That Powers RAG + arXiv 5 篇 4 强推 1 推荐: Is Agentic RAG worth it? 2601.07711 ACL2026 Industry Track + MetaRAG 2512.05411 IEEE CAI 2026 + Memory for Autonomous LLM Agents 2603.07670 + Language Models Can Autonomously Hack 2605.06760 + DeepRead 2602.05014)= 主线 ① Coding Agent 候选池 + 主线 ④ Agentic RAG 候选池「跨 arXiv + CSDN + Substack 三栖综合调研 + 评测 + 多 Agent 记忆 + Agent 安全 + 文档结构盲区」

  • 来源
    • inbox/jay/2026-07-29-1105-jay-rag-agent-csdn-survey-v2.md 13 件跨三栖
    • inbox/jay/2026-07-29-1105-jay-engineering-e1prep-v39.md §增量 1-5 5 件 P0/P1
    • inbox/jay/2026-07-29-1105-jay-five-category-briefing.md CSDN 4.1+4.2+4.3 + Reproduction 5.1+5.2+5.3
  • 要点(5 篇 arXiv 4 强推 1 推荐 + 4 件 CSDN + 4 件 Substack):
    • 🟡 CSDN 4 件强推:① RAG Agent 技术解析与实战构建指南(weixin_29056145,2026-07-21)= LangGraph 状态机编排 + Naive RAG → Advanced RAG → GraphRAG → Agentic RAG 完整演进路径 + Chroma + OpenCLIP 跨模态向量数据库 ② 2026 年做 Agents 应该看这篇全面的技术综述(fogdragon,2026-07-25)= Memory / Tool Calling / Planning 三大维度 + LLMCompiler + MemGPT + Smart ③ 系统学 AI - 一文搞定 AI Agent 与 RAG(路易乔布斯)= 完整学习路线(W1-W12)+ RAG 前沿论文表格(GraphRAG、GeAR、HiRAG、ParetoRAG、Zero-RAG)+ LangChain 入门 → LlamaIndex 做 RAG → LangGraph 做复杂 Agent ④ 企业级 LLM Agent 实战:从 RAG 到业务闭环(AtomGit 智能体开发者社区)= Cursor Composer 跨文件联动 + Multi-Agent 三层架构(Zulu/Plan/Architect Agent)
    • 🟡 Substack 4 件强推:① AgentOps: Lessons from Over 1,400 Production Deployments of AI Systems(Hugo Bowne-Anderson & Alex Strick van Linschoten / ZenML,2026-04-10)= LLMOps Database 1400+ 真实生产案例 ② RAG Isn't Dead — It's Just Rarely Built for Production(Rajiv Shah / Contextual AI)= BM25 在生产中仍击败多数神经检索模型 + Agentic RAG 多轮推理准确率 93% vs 76%(延迟代价 50s vs 3s)+ Demo 到生产的准确率崩溃 90% → 60% ③ The State Of LLMs 2025(Rasch)= 2026 年模型进展更多来自推理时优化 + MCP 已成 agent-style LLM 工具调用标准(加入 Linux 基金会)④ The Infrastructure That Powers RAG Systems(Shantanu Ladhwe & Shirin Khosravi / Jam with AI)= RAG 项目路线图 Phase 1-6
    • 🟡 arXiv 5 篇 4 强推 1 推荐:① Is Agentic RAG worth it?(2601.07711 ACL 2026 Industry Track)= 首个系统性实验对比 Naive RAG vs Advanced RAG vs Agentic RAG · v40 §0.5 候选池新增 ② MetaRAG(2512.05411 IEEE CAI 2026)= 系统研究 chunking 策略 × metadata integration 在 RAG 中的交互 + 3×3 配置矩阵 · v40 §0.5 候选池新增 ③ Memory for Autonomous LLM Agents: Mechanisms(2603.07670)= Agent Memory 的 write-manage-read 循环形式化 + 三维分类法(temporal scope / representational substrate / control policy)· v40 §0.5 候选池新增 ④ Language Models Can Autonomously Hack and Self-Replicate(2605.06760)= LLM Agent 自主利用漏洞 + 测试 4 类漏洞 + 安全启示 · v40 §0.5 候选池新增 ⑤ DeepRead(2602.05014)= 现有 Agentic RAG 的「结构盲区」+ document hierarchy + sequence 的 coordinate system · v40 §0.5 候选池新增
  • 与活文档 v39 关系
    • v39 §0.5 v39 主题级 arXiv ID 候选池 10 项中 LLM-Wiki + RAGSearch + GradRAG + MemGraphRAG + Trust-RAG Compass 5 件 + work-queue 7-28 5 件 + work-queue 7-29 6 件 = 16 件 RAG 主题级候选池:沿用基础上,v40 §0.5 应新增 5 篇 arXiv(Is Agentic RAG worth it? 2601.07711 + MetaRAG 2512.05411 + Memory for Autonomous LLM Agents 2603.07670 + Language Models Can Autonomously Hack 2605.06760 + DeepRead 2602.05014)→ 21 件 RAG 主题级候选池 + 4 件 CSDN + 4 件 Substack = 13 件 v40 net-new
    • v39 §1.2 主线 ④ Agentic RAG 候选池(84 件):沿用基础上,v40 §1.2 主线 ④ 应新增 5 件 arXiv + 4 件 CSDN + 4 件 Substack = 13 件 → 97 件
    • v39 §2.2 跨主线整合 Agentic RAG 主线 + Agent Memory 主线 + 评测元方法学主线 + AI 安全主线:沿用基础上,v40 §2.2 跨主线整合应新增(Agentic RAG + Agent Memory + 评测元方法学 + AI 安全 4 主线 13 件 net-new)
    • v39 §3.1 共识 #148 jay 7-28 engineering-v38 5 件 RAG 主题硬资产 + work-queue 7-28 5 件 + work-queue 7-29 6 件 = 主线 ④ Agentic RAG 候选池「Agentic RAG H2 路线图 21 件」:沿用基础上,v40 §3.1 共识 #151 jay 7-29 rag-agent-csdn-survey-v2 13 件跨三栖综合调研 = Agentic RAG 候选池 21 → 34 件
  • 反方 / 警示
    • ⚠️ Is Agentic RAG worth it? 2601.07711 ACL2026 Industry Track = 首个系统性实验对比 = 与 v33 §2.39.x 评测方法学反思 5 → 7 → 14 → 15 件套对比 · 7-30 持续复核窗口
    • ⚠️ Language Models Can Autonomously Hack and Self-Replicate 2605.06760 = LLM Agent 自主利用漏洞 = 与 v39 §3.1 共识 #147 OWASP Agent Top 10 2026 ASI01-ASI10 关联 · 7-30 持续复核窗口
    • ⚠️ MetaRAG 2512.05411 chunking 策略 × metadata integration 3×3 配置矩阵 = 与 v39 §3.1 共识 #148 Trust-RAG Compass 六维框架关联 · 7-30 持续复核窗口
  • 建议归入节v40 §0.5 候选池新增 5 篇 arXiv + 4 件 CSDN + 4 件 Substack = 13 件 net-new + v40 §1.1 fresh signals 第 3 段(jay rag-agent-csdn-survey-v2 13 件跨三栖) + v40 §1.2 主线 ④ 候选升格 84 → 97 节点(+13 v40) + v40 §2.2 跨主线整合(Agentic RAG + Agent Memory + 评测元方法学 + AI 安全 4 主线 13 件 net-new) + v40 §3.1 共识 #151 Agentic RAG 候选池 21 → 34 件 + v40 §3.3 反方 1 维度(Is Agentic RAG worth it? vs 评测方法学反思 5-15 件套对比) + v40 §4.1 拐点 #166 jay 7-29 rag-agent-csdn-survey 5 项

增量 5 · 🟡 P1 重大 · tom 7-29 0853 rag-e1prep-v48 6 件主线增量(APS-RAG arXiv:2607.24663 三路融合 + Corrective Agent 生产级部署 + DeCoRAG arXiv:2607.24554 认知解耦 + 语义感知裁剪 + Evidence Attribution 无坐标版 arXiv:2607.24651 + Substack Nuanced Perspective「Designing Agentic Memory in 2026」+ ChatGPT Agent 案例 + 沿用)+ tom 7-29 1441 agent-rag-longcontext-radar(2 高价值 + 6 候选)+ tom 7-29 2040 agent-rag-longcontext-radar(4 高价值 + 4 候选 + δ-mem Substack 沿用)= 主线 ④ Agentic RAG 候选池「评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 2 例 + Agentic Memory 五类认知记忆 + memory poisoning 90%+ 易感 + RepoReasoner 仓库级代码推理 + BeyondUncertainty 置信度路由检索 + Cyber-Capable AI Agents 沙箱外安全漏洞五类 + CodeNib 多视图代码库上下文服务 + δ-mem 第三种 Agent Memory 路径」

  • 来源
    • inbox/tom/2026-07-29-0853-rag-e1prep.md 6 件主线增量
    • inbox/tom/2026-07-29-0840-agent-rag-longcontext-radar.md 8 候选 + 3 高价值
    • inbox/tom/2026-07-29-1441-agent-rag-longcontext-radar.md 2 高价值 + 6 候选
    • inbox/tom/2026-07-29-2040-agent-rag-longcontext-radar.md 4 高价值 + 4 候选 + δ-mem Substack 沿用
    • inbox/jay/2026-07-29-1105-jay-rag-agent-csdn-survey-v2.md Substack S2「RAG Isn't Dead」 = Agentic RAG 多轮推理准确率 93% vs 76%(延迟代价 50s vs 3s)
    • inbox/flyp/2026-07-29-0950-multimodal-e1prep-v34.md §1.5 tom radar 邻接 3 件(APS-RAG + DeCoRAG + Reasoning Denoiser)
    • paper_cards/618 APS-RAG + /619 DeCoRAG + /620 Historical Doc + /621 Regulatory RAG + /624 Evidence Attribution + /625 Historical Doc + /630 Reasoning Denoiser + /638 CVE→ATT&CK 7-29 new
  • 要点(6 件主线增量 + 2 高价值 + 4 高价值):
    • 🟡 增量 1 · APS-RAG arXiv:2607.24663v1(2026-07-29 04:00 paper_cards 618 已建卡)= dense + sparse + KG 三通道 query-type 自适应 RRF 融合 + corrective agent 修正层 + operations-grounded 评估(电子日志/技术文档/wiki/聊天记录/维护记录/实时控制)= RAG 评估体系"生产就绪度"维度实质性案例 · 沿用 v39 §0.5 候选池
    • 🟡 增量 2 · DeCoRAG arXiv:2607.24554v1(2026-07-29 04:00 paper_cards 619 已建卡)= 认知解耦(语义层/视觉层独立处理)+ 语义感知裁剪(根据语义相关性而非固定窗口裁剪)= 多模态 Graph RAG 准确性 + 效率双重突破 · 沿用 v39 §0.5 候选池
    • 🟡 增量 3 · Evidence Attribution 无坐标版 arXiv:2607.24651v1(2026-07-29 04:00 paper_cards 624 已建卡)= 现有 VLM 视觉文档归因通过坐标接口输出边界框 = 归因幻觉 = 接口层解法(改变"归因表达接口")= RAG 可审计性设计新思路 + CiteVQA 双语验证集 · 沿用 v39 §0.5 候选池
    • 🟡 增量 4 · Substack Nuanced Perspective「Designing Agentic Memory in 2026」(2026-07-28)= 五类认知记忆分类(情景/语义/程序性/工作/感觉)+ 记忆投毒攻击(memory poisoning)>90% Agent 易感 = 高危安全攻击面 + retriever 训练用失败 agent run 仍提升 15-19% · 邻接主线 ① Coding Agent + 主线 ⑤ Application-layer Reliability
    • 🟡 增量 5 · ChatGPT Agent 案例 = 生产级 Agent 部署案例
    • 🟡 增量 6 · 沿用 = R47 沿用(LLM-Wiki + APS-RAG + DeCoRAG + Historical Doc + Regulatory RAG + LAMAR + δ-mem + Learning on the Job + OpenClaw tool-driven RAG)
    • 🟡 早间 8 候选 + 3 高价值:① APS-RAG ② DeCoRAG ③ Reasoning Denoiser
    • 🟡 午后 2 高价值 + 6 候选:① A New Role for Relevance arXiv:2607.24223 62▲(Direct Corpus Interaction 工作空间)+ ② Keep It InMind arXiv:2607.24368 19▲(implicit-association blind spot 隐含关联盲点)· v40 §0.5 候选池新增 2 件
    • 🟡 晚间 4 高价值 + 4 候选:① RepoReasoner arXiv:2607.25996(仓库级代码推理 Output Prediction + Call Chain Prediction)② BeyondUncertainty arXiv:2607.25600(置信度路由检索,低置信→top-5 检索+二次回答)③ Cyber-Capable AI Agents arXiv:2607.25379(评估边界安全漏洞 5 类,2026 年 7 月 HF/OpenAI 事件案例分析)④ CodeNib arXiv:2607.25431(多视图代码库上下文服务系统,quality-cost 前沿曲线)· v40 §0.5 候选池新增 4 件
  • 与活文档 v39 关系
    • v39 §0.5 v39 work-queue 7-28 5 件 + 7-29 6 件 = 11 件 + v39 主题级 5 件 RAG = 16 件 RAG 主题级候选池:沿用基础上,v40 §0.5 应新增 6 件(tom radar 7-29 早间 3 件 APS-RAG / DeCoRAG / Reasoning Denoiser 沿用 + 午后 2 件 A New Role for Relevance 2607.24223 + Keep It InMind 2607.24368 + 晚间 4 件 RepoReasoner 2607.25996 + BeyondUncertainty 2607.25600 + Cyber-Capable AI Agents 2607.25379 + CodeNib 2607.25431)= 6 件 v40 net-new arXiv 候选池
    • v39 §1.2 主线 ④ Agentic RAG 候选池(84 件):沿用基础上,v40 §1.2 主线 ④ 应新增 6 件 → 90 件(增量 3 = 评测方法学反思 v40 15-16 件套补完 第 2 例)
    • v39 §1.2 主线 ⑤ Application-layer Reliability 候选池(80 维):沿用基础上,v40 §1.2 主线 ⑤ 应新增 2 维(Cyber-Capable AI Agents 沙箱外安全漏洞 5 类 + Nuanced Perspective 记忆投毒攻击 90%+ 易感)= 82 维
    • v39 §3.1 共识 #148 jay 7-28 engineering-v38 5 件 RAG 主题硬资产 + work-queue 7-28 5 件 + work-queue 7-29 6 件 = 主线 ④ Agentic RAG 候选池「Agentic RAG H2 路线图 21 件」:沿用基础上,v40 §3.1 共识 #152 tom 7-29 rag-e1prep-v48 6 件主线增量 + tom radar 7-29 早/午/晚 3 棒 8 件 arXiv = Agentic RAG 候选池 21 → 35 件 + 评测方法学反思 v40 15-16 件套补完 第 2 例
  • 反方 / 警示
    • ⚠️ APS-RAG operations-grounded 评估可推广性 = 三路融合架构(dense+sparse+KG)是否适用于通用企业 RAG 场景需核验 · corrective agent 修正层的计算开销未量化(沿用 v39 §3.1 #148 反方 ①)
    • ⚠️ DeCoRAG token 削减幅度 = 认知解耦 + 语义感知裁剪的 token 削减比例未披露 · 与同类方法(如 ColPali/ColQwen2)的 head-to-head 对照未做(沿用 v39 §3.1 #148 反方 ②)
    • ⚠️ Keep It InMind implicit-association blind spot > 90% Agent 易感数字来源 = 实验设计(多少个 agent?何种攻击方式?)未披露 · 作为安全高危声明需谨慎引用(沿用 v39 §3.1 #147 反方 ② 增补)
    • ⚠️ Cyber-Capable AI Agents 沙箱外安全漏洞 5 类 vs OWASP Agent Top 10 ASI 编号体系重叠关系待核 = 与 v39 §3.1 共识 #147 OWASP ASI01-ASI10 关联 · 7-30 持续复核窗口
    • ⚠️ BeyondUncertainty 置信度路由检索阈值在验证集上选优后冻结 = 工业级 RAG 部署的"可推广性"待核 · 7-30 持续复核窗口
  • 建议归入节v40 §0.5 候选池新增 6 件 net-new arXiv + v40 §1.1 fresh signals 第 4 段(tom 7-29 rag-e1prep-v48 + tom radar 3 棒) + v40 §1.2 主线 ④ 候选升格 84 → 90 节点(+6 v40)+ 主线 ⑤ 候选升格 80 → 82 维(+2 v40) + v40 §2.2 跨主线整合(Agentic RAG + AI 安全 2 主线 6 件 net-new) + v40 §3.1 共识 #152 Agentic RAG 候选池 21 → 35 件 + v40 §3.3 反方 1 维度(Keep It InMind 90%+ 易感数字来源待核) + v40 §4.1 拐点 #167 tom 7-29 5 项

增量 6 · 🟡 P1 重大 · flyp 7-29 0950 multimodal-e1prep-v34 第二棒 E1 35 件 v34 候选增量(flyP 7-28 dual critical-read 4 件立标级/旁证级 + 5 件 paper_cards 615-629 multimodal 主分类 + 3 件 tom 7-29 radar multimodal 邻接 + 4 件 jay 7-29 csdn 多模态 RAG 综述 + 16 条 v34 §3.3 反方集新增 65→71 + 5 件 §7.3 交叉新增 + 2 件 §7.1 引用新增 = 共 35 件 v34 候选增量;其中 6 件立标级/立标级候选)+ flyp 7-29 0952 long-context-multimodal-rag-dual-review(AcademicEval arXiv:2510.17725 TMLR 已接收 + Scaling Beyond Context arXiv:2510.15253 ACL2026 Main 已接收)= 主线 ④ Agentic RAG 候选池 + multimodal.md 跨文档引用补完

  • 来源
    • inbox/flyp/2026-07-29-0950-multimodal-e1prep-v34.md 35 件 v34 候选增量
    • inbox/flyp/2026-07-29-0952-long-context-multimodal-rag-dual-review.md 2 篇
    • inbox/flyp/2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md B 级 2 件
    • inbox/flyp/2026-07-28-2250-SPA-and-Multimodal-ASV-dual-critical-read.md B 旁证级 2 件
  • 要点(35 件 v34 候选增量):
    • 🟡 §1.1 flyP 7-28 dual critical-read 4 件立标级/旁证级新增:Scaling NMM arXiv:2607.22043 + O-VAD arXiv:2607.18142(立标级)+ SPA arXiv:2607.22091 + Multimodal ASV arXiv:2607.19636(旁证级)
    • 🟡 §1.2 5 件 paper_cards 615-629 multimodal 主分类立标级/旁证级:O-VAD 2607.18142 + Rethinking CFG 2607.24731 + Evidence Attribution 2607.24651 + Sol-Attn 2607.24027 + Chamaileon 2607.23518
    • 🟡 §1.3 3 件 tom 7-29 radar multimodal 邻接:APS-RAG 2607.24663 + DeCoRAG 2607.24554 + Reasoning Denoiser 2607.22098
    • 🟡 §1.4 HF Daily 7-29 票榜 7 件 multimodal 主 + 7 件 multimodal 副:Kimi K3 + JarvisHub + Scaling NMM + Sol-Attn + OmniVAE + Oxygen-TryOn + Mage-VL + PerceptionBench + Visual Prompt Engineering + WorldDiT + UltraViT
    • 🟡 §1.5 0 件 stephen 7-29 X radar §6 升级(主要是 Andrew Ng LearnVector + 学界反驳)
    • 🟡 §1.6 4 件 jay 7-29 csdn 多模态 RAG 综述:多模态 RAG 综述(AFLoc Nature Biomedical Engineering 2026-01)+ SIGIR 2026 LLM × Graph + 多模态 RAG 2026 YOLO 演进 + 多模态融合趋势
    • 🔴 16 条 §3.3 反方集新增 65→71 = flyp v34 §3.3 反方 65 → 71
    • 🟡 5 件 §7.3 交叉新增 = flyp v34 §7.3 交叉
    • 🟡 2 件 §7.1 引用新增 = flyp v34 §7.1 引用
    • 🟡 flyP 7-29 0952 long-context-multimodal-rag-dual-review(2 篇):① AcademicEval arXiv:2510.17725 TMLR 已接收(UIUC 等)= 把 arXiv 论文作为「自标注」的长上下文源 · 用合著者图挑选高质量 few-shot 演示 · 提出「live evaluation」= 通过滚动引入新论文做评测 ② Scaling Beyond Context arXiv:2510.15253 ACL2026 Main 已接收 = 综述多模态 RAG 在文档理解领域的进展 · v40 §0.5 候选池新增 2 件
  • 与活文档 v39 关系
    • v39 §0.5 v39 HF Daily arXiv ID 候选池 5 项 + v39 主题级 10 项 = 15 件 + v39 multimodal.md 沿用:沿用基础上,v40 §0.5 应新增 4 件 flyp 7-29 long-context-multimodal-rag-dual-review 双稿(2 件立标级旁证 + 2 件 long-context RAG 综述)
    • v39 §1.2 主线 ④ Agentic RAG 候选池(84 件):沿用基础上,v40 §1.2 主线 ④ 应新增 4 件(AcademicEval + Scaling Beyond Context + jay 7-29 csdn 多模态 RAG 综述 4 件 → 88 件)
    • v39 §3.3 反方 147 维度:沿用基础上,v40 §3.3 反方 16 维度(flyp v34 §3.3 反方 65 → 71)→ 163 维度
    • v39 §3.1 共识 #147 OWASP Agent Top 10 2026 + CSDN Agent 4 范式 = 评测标准硬框架新增 第 1 例:沿用基础上,v40 §3.1 共识 #153 flyp 7-29 multimodal-v34 第二棒 E1 35 件 v34 候选增量 + flyp dual critical read light 2 件 + flyp 反思规则第 22 次适用 = multimodal.md v34 §2.39.x 立标候选邻接 第 2 例
  • 反方 / 警示
    • ⚠️ flyp 7-28 dual critical-read 立标级候选 vs 旁证级候选 = 学术增量化 vs 工程化候选对照 = 沿用 v39 §3.1 #147 反方 ④
    • ⚠️ AcademicEval 2510.17725 TMLR 已接收 = live evaluation 滚动引入新论文评测 = 工业级 RAG 评测的"动态性"待核 · 7-30 持续复核窗口
    • ⚠️ Scaling Beyond Context 2510.15253 ACL2026 Main 已接收 = 多模态 RAG 在文档理解领域的综述 = 与 v39 §3.1 #147 Trust-RAG Compass 六维框架关联 · 7-30 持续复核窗口
  • 建议归入节v40 §0.5 候选池新增 4 件 flyp 7-29 net-new(2 件 dual critical read light + 2 件 long-context RAG) + v40 §1.1 fresh signals 第 5 段(flyp 7-29 multimodal-v34 第二棒 E1 35 件 v34 候选增量) + v40 §1.2 主线 ④ 候选升格 84 → 88 节点(+4 v40) + v40 §2.2 跨主线整合(multimodal.md v34 §2.39.x 立标候选邻接 第 2 例) + v40 §3.1 共识 #153 flyp 7-29 multimodal-v34 第二棒 E1 35 件 v34 候选增量 + v40 §3.3 反方 +16 维度(147 → 163) + v40 §4.1 拐点 #168 flyp 7-29 5 项

增量 7 · 🟡 P1 重大 · jay 7-29 1105 five-category-briefing #11 Database D1-D4( Milvus 3.0 lake-native + Pinecone vs pgvector/MongoDB 整合潮 + Oracle 向量搜索 + CockroachDB 数据库整合)+ Backend B1-B2( Colibri 纯 C 25GB RAM 744B MoE + Kimi K3 MoE 首个 3T 参数开源 MoE)+ Cloud-Native C1 + CSDN 4.1-4.3 + Reproduction 5.1-5.6 = 9 件立标补全

  • 来源
    • inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Database D1-D4 + Backend B1-B2 + Cloud-Native C1 + CSDN 4.1-4.3 + Reproduction 5.1-5.6 = 9 件立标
    • inbox/jay/2026-07-29-1105-jay-engineering-e1prep-v39.md §增量 1-5 5 件 P0/P1
  • 要点(9 件立标):
    • 🟡 ⭐⭐⭐⭐⭐ Database D1 · Milvus 3.0 发布(2026-07-16)= lake-native 向量底座 · 从专用向量数据库转向 lake-native "vector lakebase" · 直接查询 Iceberg 和 Lance 表 · 不支持 SQL join 和与 OLTP 表的共享事务
    • 🟡 ⭐⭐⭐⭐ Database D2 · Pinecone vs MongoDB/PostgreSQL = 向量数据库整合潮(July 2026)· <100K 向量用 Chroma / pgvector / Qdrant · 1M-100M 用 Pinecone / Weaviate / MongoDB · 100M+ 用 Milvus / Vespa · 2026 新趋势 = 原生混合搜索(向量+关键词+元数据过滤)成标配
    • 🟡 ⭐⭐⭐⭐ Database D3 · Oracle 向量搜索 SQL + JSON + 治理 · Oracle 23ai 将向量搜索集成进成熟 SQL 引擎 · 强调事务一致性优势
    • 🟡 ⭐⭐⭐⭐ Database D4 · CockroachDB 数据库整合 for 生产 AI · C-SPANN 分布式向量索引 · pgvector 兼容语法
    • 🟡 ⭐⭐⭐⭐ Backend B1 · Colibri = 纯 C 推理引擎 · 25GB RAM 运行 744B MoE · 磁盘按需流式加载 MoE experts · 零外部依赖 · 边缘推理工程化里程碑
    • 🟡 ⭐⭐⭐⭐⭐ Backend B2 · Kimi K3 MoE(沿用增量 1)
    • 🟡 ⭐⭐⭐⭐ Cloud-Native C1 · CNCF Annual Cloud Native Survey 2026 沿用(v38 evening 收官)
    • 🟡 ⭐⭐⭐⭐ CSDN 4.1 · RAG 2026 全面升级 = Naive RAG → Advanced RAG → Modular RAG → Agentic RAG 演进路径 + Chroma / OpenCLIP 跨模态向量数据库 + 12 条性能优化技巧
    • 🟡 ⭐⭐⭐⭐ CSDN 4.2 · AI Agent 工具调用四范式 = Function Calling(代码绑定)/ MCP(协议发现)/ CLI(原生执行)/ Skills(流程预定义)+ 选型决策树(工具 ≤ 30 用 prompt · 30-300 用 MCP 分组 · > 300 用 OpenAPI 自动转)+ 混合架构三层模型(MCP 服务契约 + Skills 编排蓝图 + CLI 原生执行)
    • 🟡 ⭐⭐⭐⭐ CSDN 4.3 · LLM 应用四层架构 = L1 Prompt Engineering → L2 RAG → L3 Tool Calling → L4 Agent
    • 🟡 ⭐⭐⭐⭐⭐ Reproduction 5.1 · Lilian Weng Harness Engineering(沿用增量 3)
    • 🟡 ⭐⭐⭐⭐ Reproduction 5.2 · MSR Memora 谐波记忆(沿用增量 3)
    • 🟡 ⭐⭐⭐⭐⭐ Reproduction 5.3 · uv 0.12.0 破坏性变更(沿用增量 3)
    • 🟡 ⭐⭐⭐⭐ Reproduction 5.4 · PIVOT Token 级稀疏注意力(arXiv:2607.24593)· DeepSeek Sparse Attention(DSA)将瓶颈从注意力计算转移到索引阶段
    • 🟡 ⭐⭐⭐⭐ Reproduction 5.5 · 循环 ≠ 可靠 = 状态约束证据和类型化修订契约(arXiv:2607.24604)· 沿用增量 3 反方 ⑤
    • 🟡 ⭐⭐⭐⭐ Reproduction 5.6 · MSR SkillOpt(沿用 v39 evening)
  • 与活文档 v39 关系
    • v39 §0.5 v39 主题级 arXiv ID 候选池 10 项 + v39 work-queue 7-28 5 件 + 7-29 6 件 = 21 件:沿用基础上,v40 §0.5 应新增 1 件 PIVOT arXiv:2607.24593 + 1 件循环 ≠ 可靠 arXiv:2607.24604 = 2 件 v40 net-new arXiv 候选池
    • v39 §1.2 主线 ① Coding Agent 候选池(34 件):沿用基础上,v40 §1.2 主线 ① 应新增 1 件(循环 ≠ 可靠)→ 35 件
    • v39 §1.2 主线 ④ Agentic RAG 候选池(84 件):沿用基础上,v40 §1.2 主线 ④ 应新增 1 件(PIVOT 索引优化层)→ 85 件(DSA 生产部署)
    • v39 §1.2 主线 ⑤ Application-layer Reliability 候选池(80 维):沿用基础上,v40 §1.2 主线 ⑤ 应新增 1 维(Milvus 3.0 lake-native vs Oracle 23ai vs CockroachDB vs pgvector 向量库整合潮)→ 81 维
    • v39 §3.1 共识 #147 OWASP Agent Top 10 2026 + CSDN Agent 4 范式(已包含 Function Calling / MCP / CLI / Skills)= 评测标准硬框架新增 第 1 例:沿用基础上,v40 §3.1 共识 #154 jay 7-29 five-category-briefing #11 9 件立标补全 + jay 7-29 1105 engineering-v39 5 件 P0/P1 = 跨五分类立标补全 + 边缘推理工程化(Colibri)+ 向量库整合潮 + Python 工具链工程化升级
    • v39 §2.2 跨主线整合 边缘推理工程化主题页 = v40 应新增 Colibri 纯 C 25GB RAM 744B MoE = 消费级硬件可运行前沿规模模型
  • 反方 / 警示
    • ⚠️ Milvus 3.0 lake-native vs Oracle 23ai SQL 集成 vs CockroachDB pgvector 兼容 vs Pinecone Dedicated Read Nodes = 工业级向量库选型 4 选 1 · 跨平台互操作性待核 · 7-30 持续复核窗口
    • ⚠️ Colibri 纯 C 25GB RAM 744B MoE 边缘推理工程化里程碑 = 与 v33 SGLang/vLLM 边端部署对比 · 7-30 持续复核窗口
    • ⚠️ PIVOT Token 级稀疏注意力 = DeepSeek Sparse Attention 索引优化层 = 与 v33 SGLang/vLLM KV-Cache 优化对比 · 7-30 持续复核窗口
  • 建议归入节v40 §0.5 候选池新增 2 件 net-new arXiv(PIVOT 2607.24593 + 循环 ≠ 可靠 2607.24604) + v40 §1.1 fresh signals 第 6 段(jay 7-29 five-category-briefing #11 9 件立标) + v40 §1.2 主线 ①/④/⑤ 候选升格(34→35 / 84→85 / 80→81) + v40 §2.2 跨主线整合(边缘推理工程化 + 向量库整合潮 + Python 工具链 3 主题页新增) + v40 §3.1 共识 #154 jay 7-29 five-category-briefing #11 9 件立标补全 + v40 §3.3 反方 1 维度(Colibri 25GB RAM 744B MoE 边缘推理 vs SGLang/vLLM 边端部署对比) + v40 §4.1 拐点 #169 jay 7-29 5 项

增量 8 · 🟡 P1 中 · stephen 7-29 1025 ai-industry-e1prep-v31 准备棒 6 件 P0 立标( HF Daily 7-29 票榜 14 件替换 + Kimi K3 arXiv:2607.24653 立基础 + Anthropic Dario Amodei 7-27~28 周末博客正式澄清 + HF 7-26 公布 OpenAI rogue agent 入侵事件 17,600 次黑客动作 + Andrew Ng 7-28 官宣新公司 LearnVector + Sam Altman 7-27 播客 singularity + Sam Altman 7-28 华盛顿国会闭门会 + Karpathy 7-21~26 bio「Anthropic」字段移除「68 天闪离」+ HF 7-29 NEW OlmoEarth 平台 + Managed Agents Gemini API 3.6 Flash + TLDR AI 7-28 头条「Anthropic 开源权重 + Kimi K3 + MAI Cyber」+ Spark Gradient Flow「开源多旋钮」评论层 + 「AI 数据中心算式」评论层 + Jim Fan ENPIRE 沿用 + LeCun JEPA anti-collapse 沿用)= frontier lab 7-29 第 2 日立标候选

  • 来源
    • inbox/stephen/2026-07-29-1025-ai-industry-e1prep-v31.md 6 件 P0 立标 + 9 件 7-29 上午 frontier/industry 立标
    • inbox/stephen/2026-07-29-1245-stephen-coordination-check-noon.md §1.3 落地 7 件
  • 要点(6 件 P0 立标):
    • 🟡 增量 1 · HF Daily 7-29 票榜 14 件替换 + Kimi K3 arXiv:2607.24653 263▲ 单日 +121 暴增登顶(沿用增量 1+2)
    • 🟡 增量 2 · Anthropic Dario Amodei 7-27~28 周末博客正式澄清「从未、也不会主张全面禁止开源权重模型」= frontier lab 开源权重立场 vs 监管打压指控 公开对峙
    • 🟡 增量 3 · HF 7-26 公布 OpenAI rogue agent 入侵事件深度分析 = 17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 = frontier lab × AI 平台层 安全协作 第 3 例
    • 🟡 增量 4 · Andrew Ng 7-28 官宣新公司 LearnVector + Coursera $100M 战略投资 1/3 股权 + Sam Altman 7-27 播客「我们已经身处 singularity」+ Sam Altman 7-28 赴华盛顿国会闭门会 = AI 教育 2.0 + AGI 时间线 + frontier lab 监管对话 三栖同时启动
    • 🟡 增量 5 · Karpathy 7-21~26 bio「Anthropic」字段移除「68 天闪离」猜测 + Jim Fan ENPIRE 沿用 + LeCun JEPA anti-collapse 沿用 = frontier 学者流动信号
    • 🟡 增量 6 · TLDR AI 7-28 头条「Anthropic 开源权重 + Kimi K3 + MAI Cyber」+ Spark Gradient Flow「开源多旋钮」评论层 + 「AI 数据中心算式」评论层 + HF 7-29 NEW OlmoEarth 平台 + Managed Agents Gemini API 3.6 Flash = 评论层三栖 + 模型发布多栖
  • 与活文档 v39 关系
    • v39 §1.1 fresh signals 第 1 段(frontier lab 7-28 第 7 日 30+ 件):沿用基础上,v40 §1.1 fresh signals 应新增第 2 段(frontier lab 7-29 第 2 日 30+ 件)
    • v39 §2.2 跨主线整合 主线 ⑤ Application-layer Reliability = AI 安全主线 v38 26 维 → v39 27 维合并成熟 + OpenAI 黑客事件内幕 vs HF 7 月安全事件 同 vs 异(stephen noon 协调棒 §4.1 待人工确认 #6 沿用):沿用基础上,v40 §2.2 应新增 HF 7-26 公布 OpenAI rogue agent 入侵事件 17,600 次黑客动作 = AI 安全主线 27 → 28 维
    • v39 §3.1 共识 #147 OWASP Agent Top 10 2026 + CSDN Agent 4 范式 = 评测标准硬框架新增 第 1 例:沿用基础上,v40 §3.1 共识 #155 stephen 7-29 ai-industry-v31 准备棒 6 件 P0 立标 = frontier lab 7-29 第 2 日立标候选 + 主线 ⑤ AI 安全主线 27 → 28 维合并成熟
  • 反方 / 警示
    • ⚠️ OpenAI rogue agent 入侵事件 17,600 次黑客动作 vs HF 7 月安全事件 同 vs 异 = stephen noon 协调棒 §4.1 待人工确认 #6 沿用 · 7-30 持续复核窗口
    • ⚠️ Anthropic Dario Amodei 7-27~28 周末博客正式澄清 vs NVIDIA 联署信后 Anthropic 未签字引发的「利用监管打压开源」指控 = 7-30 持续复核窗口
    • ⚠️ Andrew Ng LearnVector + Coursera $100M + Sam Altman singularity + Sam Altman 华盛顿国会闭门会 三栖同时启动 = frontier lab 监管对话 + AI 教育 2.0 + AGI 时间线 · 7-30 持续复核窗口
  • 建议归入节v40 §1.1 fresh signals 第 7 段(frontier lab 7-29 第 2 日 30+ 件) + v40 §2.2 跨主线整合(AI 安全主线 27 → 28 维) + v40 §3.1 共识 #155 stephen 7-29 ai-industry-v31 准备棒 6 件 P0 立标 + v40 §3.3 反方 1 维度(OpenAI rogue agent 17,600 vs HF 7 月安全事件 同 vs 异) + v40 §4.1 拐点 #170 stephen 7-29 5 项 + v40 §5.1 已发生 #140 frontier lab 7-29 第 2 日 30+ 件

增量 9 · 🟢 旁证 · CSDN Agent 4 范式(Function Calling / MCP / CLI / Skills)选型决策树 + Microsoft Agent Governance Toolkit 5.2k★(OWASP ASI 关联)+ 跨 arXiv + CSDN + Substack 三栖综合调研 13 件 = 主线 ① Coding Agent 候选池 + 主线 ⑤ Application-layer Reliability 候选池「工程化 Agent 工具调用」+「企业级 Agent 治理」补全

  • 来源
    • inbox/jay/2026-07-29-1105-jay-five-category-briefing.md CSDN 4.2 + Cloud-Native 3.1
    • inbox/jay/2026-07-29-0822-csdn-rag-agent-multimodal.md 条目 3
    • inbox/jay/2026-07-29-1105-jay-rag-agent-csdn-survey-v2.md Substack S3
  • 要点(旁证):
    • 🟢 CSDN Agent 4 范式选型决策树 30/300 阈值 = 工具 ≤ 30 用 prompt · 30-300 用 MCP 分组 · > 300 用 OpenAPI 自动转 + retrieval + 分层决策(沿用 v39 §3.1 #147 CSDN Agent 4 范式)
    • 🟢 Microsoft Agent Governance Toolkit 5.2k★ = AI Agent 治理工具包 · 策略执行 · 零信任身份 · 沙箱执行 · 可靠性工程 · 覆盖 OWASP Agentic Top 10 = 2026 年 Agent 安全合规必备工具 = 沿用 v39 §1.2 主线 ⑤ OWASP Agent Top 10 2026 ASI01-ASI10
  • 与活文档 v39 关系
    • v39 §1.2 主线 ⑤ Application-layer Reliability 候选池(80 维):沿用基础上,v40 §1.2 主线 ⑤ 应新增 1 维(Microsoft Agent Governance Toolkit)= 81 维(沿用增量 7 跨主线整合)
  • 反方 / 警示
    • ⚠️ Microsoft Agent Governance Toolkit vs OWASP Agent Top 10 ASI 编号体系 = 与 v39 §3.1 #147 反方 ⑤ OWASP ASI 编号体系 vs Trust-RAG Compass 六维框架重叠关系 · 7-30 持续复核窗口
  • 建议归入节v40 §1.2 主线 ⑤ 候选升格 80 → 81 维(+1 v40 · Microsoft Agent Governance Toolkit)

2. 值得警惕的矛盾或待核实说法

  1. Kimi K3 单日 +121 暴增 85% 触发立标级候选升档 vs v33 §2.39.x 升档标准对比:v33 立标级升档标准是「累计跨日 500▲」或「单日 +50 持续 3 日」;Kimi K3 7-28 142 + 7-29 263 = 累计跨日 405▲(距 500 阈值 95▲)· 单日 +121 已超 +50 阈值但仅 1 日数据 · 7-30 ~ 8-01 持续复核窗口
  2. Rethinking CFG OPD 63▲ 单日 +48▲ 暴增 320% 触发立标级候选升档 vs flyP B+ 旁证级升档标准:v33 §2.39.x 升档标准是「累计跨日 100▲」或「单日 +50 持续 2 日」;Rethinking CFG OPD 7-29 63 已超 +50 阈值但仅 1 日数据 · 7-30 持续复核窗口
  3. StateAct 53▲ 新立 vs 同等新立候选历史对照:本期 JarvisHub 104 + Progress RM 68 + Agentic Search 67 + StateAct 53 4 件新立 · v34 §2.39.x 升档标准对比 · 7-30 持续复核窗口
  4. Weng Harness vs Molt 关系 = Weng 理论层 vs Molt 工程实现层 互补(RSI / Workflow Automation / File System as Persistent Memory / Sub-agent & Backend Jobs / ACE / MCE vs PyTorch-native 训练框架)· 两者是否同质?(参 v33 7-30 ~ 8-02 验证时间表)
  5. MSR Memora 谐波记忆 vs Mem0/Lucid/Hypernetwork/Aurora 1.5 关系 = 工程实现层 谐波记忆 vs v36 Memory 五 primitives · 两者是否同质?
  6. uv 0.12.0 src layout default = 工业级 Python 工具链共识 = 与 poetry / pip-tools / hatch / pdm 等对比 · 7-30 ~ 8-02 持续复核窗口
  7. FlashInfer→SGLang/vLLM 集成 28%-30% 长上下文推理延迟降低实测待核 = 与 v33 SGLang/vLLM 对照 · 7-30 截止
  8. Is Agentic RAG worth it? 2601.07711 ACL2026 Industry Track = 首个系统性实验对比 = 与 v33 §2.39.x 评测方法学反思 5 → 7 → 14 → 15 件套对比 · 7-30 持续复核窗口
  9. Language Models Can Autonomously Hack and Self-Replicate 2605.06760 = LLM Agent 自主利用漏洞 = 与 v39 §3.1 共识 #147 OWASP Agent Top 10 2026 ASI01-ASI10 关联 · 7-30 持续复核窗口
  10. MetaRAG 2512.05411 chunking 策略 × metadata integration 3×3 配置矩阵 = 与 v39 §3.1 共识 #148 Trust-RAG Compass 六维框架关联 · 7-30 持续复核窗口
  11. APS-RAG operations-grounded 评估可推广性 = 三路融合架构(dense+sparse+KG)是否适用于通用企业 RAG 场景需核验 · corrective agent 修正层的计算开销未量化(沿用 v39 §3.1 #148 反方 ①)
  12. DeCoRAG token 削减幅度 = 认知解耦 + 语义感知裁剪的 token 削减比例未披露 · 与同类方法(如 ColPali/ColQwen2)的 head-to-head 对照未做(沿用 v39 §3.1 #148 反方 ②)
  13. Keep It InMind implicit-association blind spot > 90% Agent 易感数字来源 = 实验设计(多少个 agent?何种攻击方式?)未披露 · 作为安全高危声明需谨慎引用(沿用 v39 §3.1 #147 反方 ② 增补)
  14. Cyber-Capable AI Agents 沙箱外安全漏洞 5 类 vs OWASP Agent Top 10 ASI 编号体系重叠关系待核 = 与 v39 §3.1 共识 #147 OWASP ASI01-ASI10 关联 · 7-30 持续复核窗口
  15. BeyondUncertainty 置信度路由检索阈值在验证集上选优后冻结 = 工业级 RAG 部署的"可推广性"待核 · 7-30 持续复核窗口
  16. Milvus 3.0 lake-native vs Oracle 23ai SQL 集成 vs CockroachDB pgvector 兼容 vs Pinecone Dedicated Read Nodes = 工业级向量库选型 4 选 1 · 跨平台互操作性待核 · 7-30 持续复核窗口
  17. Colibri 纯 C 25GB RAM 744B MoE 边缘推理工程化里程碑 = 与 v33 SGLang/vLLM 边端部署对比 · 7-30 持续复核窗口
  18. PIVOT Token 级稀疏注意力 = DeepSeek Sparse Attention 索引优化层 = 与 v33 SGLang/vLLM KV-Cache 优化对比 · 7-30 持续复核窗口
  19. OpenAI rogue agent 入侵事件 17,600 次黑客动作 vs HF 7 月安全事件 同 vs 异 = stephen noon 协调棒 §4.1 待人工确认 #6 沿用 · 7-30 持续复核窗口
  20. Anthropic Dario Amodei 7-27~28 周末博客正式澄清 vs NVIDIA 联署信后 Anthropic 未签字引发的「利用监管打压开源」指控 = 7-30 持续复核窗口
  21. Andrew Ng LearnVector + Coursera $100M + Sam Altman singularity + Sam Altman 华盛顿国会闭门会 三栖同时启动 = frontier lab 监管对话 + AI 教育 2.0 + AGI 时间线 · 7-30 持续复核窗口
  22. flyp 7-28 dual critical-read 立标级候选 vs 旁证级候选 = 学术增量化 vs 工程化候选对照 = 沿用 v39 §3.1 #147 反方 ④
  23. AcademicEval 2510.17725 TMLR 已接收 = live evaluation 滚动引入新论文评测 = 工业级 RAG 评测的"动态性"待核 · 7-30 持续复核窗口
  24. Scaling Beyond Context 2510.15253 ACL2026 Main 已接收 = 多模态 RAG 在文档理解领域的综述 = 与 v39 §3.1 #147 Trust-RAG Compass 六维框架关联 · 7-30 持续复核窗口
  25. Microsoft Agent Governance Toolkit vs OWASP Agent Top 10 ASI 编号体系 = 与 v39 §3.1 #147 反方 ⑤ OWASP ASI 编号体系 vs Trust-RAG Compass 六维框架重叠关系 · 7-30 持续复核窗口

3. 可引用 arXiv 号列表(本次窗口新增/续立 + 沿用 26 件)

本次窗口新增 22 件 + 续立 3 件 + Kimi K3 增量 1 升级 = 26 件 v40 候选池

arXiv 号 论文/工作 状态 主线归属
2607.24653 Kimi K3 2.8T MoE 完整开源 · 单日 +121 暴增 85% · 7-28 142 → 7-29 263 v40 §0.5 升级 arXiv 立基础 + 立标级候选升档 主线 ②
2607.23588 JarvisHub · Canvas 原生多模态创意 Agent 开放框架 · 104▲ 新立 v40 §0.5 新增 主线 ①
2607.21655 Progress Reward Modeling 全面综述 · 68▲ 新立 v40 §0.5 新增 主线 ①
2607.24280 Agentic Search Agentic 协议蒸馏 · 67▲ 新立 v40 §0.5 新增 主线 ①
2607.22798 StateAct · 长horizon 计算机使用 Agent 中"先程序状态,后像素"· 53▲ 新立 v40 §0.5 新增 主线 ①
2607.24744 Data Pyramid · 具身操作的 Data Pyramid · 32▲ 新立 v40 §0.5 新增 主线 ①
2607.24027 Sol-Attn · diffusion transformers 注意力稀疏化 · 25▲ 新立 v40 §0.5 新增 主线 ⑥
2607.23855 OmniVAE · 面向联合生成的跨模态对齐音视频 VAE · 23▲ 新立 v40 §0.5 新增 multimodal
2607.21694 Oxygen-TryOn · 面向任意物品虚拟试穿的时尚原生基础模型 · 21▲ 新立 v40 §0.5 新增 multimodal
2607.21503 Agentic Context Management · 21▲ 新立 v40 §0.5 新增 主线 ④
2607.24731 Rethinking CFG OPD · 63▲ 单日 +48▲ 暴增 · 旁证级升档立标级候选 v40 §0.5 升档 multimodal
2607.20465 DataPrep-Bench · 49▲ 续立 v39 §0.5 沿用 主线 ⑤
2607.22529 Skill Self-Play · 35▲ 续立 v39 §0.5 沿用 主线 ①
2607.21653 Molt · 29▲ 续立 v39 §0.5 沿用 主线 ①
2607.22043 Scaling Native Multimodal · 22▲ 续立 · flyP 7-28 dual critical read 立标级候选 v39 §0.5 沿用 multimodal
2607.24223 A New Role for Relevance · Direct Corpus Interaction · 62▲ · tom 7-29 1441 radar 午后 v40 §0.5 新增 主线 ④
2607.24368 Keep It InMind · implicit-association blind spot · 19▲ · tom 7-29 1441 radar 午后 v40 §0.5 新增 主线 ④
2607.25996 RepoReasoner · Repository-Level Code Reasoning Benchmark · tom 7-29 2040 radar 晚间 v40 §0.5 新增 主线 ①
2607.25600 BeyondUncertainty · 置信度路由检索 · tom 7-29 2040 radar 晚间 v40 §0.5 新增 主线 ④
2607.25379 Cyber-Capable AI Agents · 评估边界的安全漏洞 5 类 · tom 7-29 2040 radar 晚间 v40 §0.5 新增 主线 ⑤
2607.25431 CodeNib · 多视图代码库上下文服务系统 · tom 7-29 2040 radar 晚间 v40 §0.5 新增 主线 ①
2510.17725 AcademicEval · Live Long-Context LLM Benchmark · TMLR 已接收 · flyp 7-29 0952 dual review v40 §0.5 新增 主线 ④
2510.15253 Scaling Beyond Context · 多模态 RAG 综述 · ACL2026 Main 已接收 · flyp 7-29 0952 dual review v40 §0.5 新增 主线 ④
2607.24593 PIVOT · Token 级稀疏注意力高效查询分组索引 · jay 7-29 1105 five-category-briefing Reproduction 5.4 v40 §0.5 新增 主线 ⑥
2607.24604 循环 ≠ 可靠 · 状态约束证据和类型化修订契约 · jay 7-29 1105 five-category-briefing Reproduction 5.5 v40 §0.5 新增 主线 ①

v39 候选池 26 件(沿用,不重复)

  • 5 件 HF Daily 7-28(ReferTrack 2607.20061 + DataPrep-Bench 2607.20465 续立 + Show Don't Tell 2607.21072 + Skill Self-Play 2607.22529 续立 + Molt 2607.21653 续立)
  • 10 件 v39 主题级(LLM-Wiki 2605.25480 + RAGSearch 2604.09666 + GradRAG 2607.21324 + MemGraphRAG 2606.00610 + Trust-RAG Compass 2409.10102 + Learning on the Job 2607.22157 + Multi-Head Latent Control 2607.14277 + IDEAgent 2607.22375 + Scaling Native Multimodal 2607.22043 续立 + O-VAD 2607.18142)
  • 5 件 work-queue 7-28(arXiv:2607.24731 升档 + arXiv:2607.24352 RAG-as-Components + arXiv:2607.24475 Robust Historical Docs + arXiv:2607.24554 DeCoRAG + arXiv:2607.24663 corrective agentic hybrid RAG)
  • 6 件 work-queue 7-29(arXiv:2607.23518 Chamaileon + arXiv:2607.22561 Codifying the Judge + arXiv:2607.22098 Reasoning Denoiser + arXiv:2607.23242 IndicTalk + arXiv:2607.23402 Warp Divergence + arXiv:2607.24027 Sol-Attn 新立)

5 篇 v40 候选池 · jay rag-agent-csdn-survey-v2 arXiv(沿用增量 4)

  • 2601.07711 · Is Agentic RAG worth it? · ACL 2026 Industry Track
  • 2512.05411 · MetaRAG · IEEE CAI 2026
  • 2603.07670 · Memory for Autonomous LLM Agents: Mechanisms
  • 2605.06760 · Language Models Can Autonomously Hack and Self-Replicate
  • 2602.05014 · DeepRead

6 件 v39 work-queue 7-29 arXiv(沿用 v39 §0.5)

  • 2607.23518 Chamaileon + 2607.22561 Codifying the Judge + 2607.22098 Reasoning Denoiser + 2607.23242 IndicTalk + 2607.23402 Warp Divergence + 2607.24027 Sol-Attn(新立)

7 件 v39 沿用级 v38 已收 ID 完整披露(沿用 v39 §0.5)

  • 2607.21461 AREX 142▲ 单日 +3 累计跨日 525▲ 主线 K 第 7 日 · 2607.21553 SANA-Video 2.0 +7 立标级证据继续充分加固 · 2607.21576 Self-Supervised Structured Dynamics 18▲ 三日累计跨日 60▲ 持续跌出 15 名外 · 2607.12746 Color Pass-Through 19▲ · 2607.16165 ActiveVision 25▲ 持平高位 · 2602.23368v1 AAAI 2026 Subramanian 5 实例同步立标 · 2603.10726v2 PrefixWall 沿用级确认

4. 检查过的来源清单

inbox/jay(7-28 evening + 7-29 全日 · 30+ 份)

  • 7-28 1140 news-x-tech-radar · 7-28 1950 jay-engineering-filter · 7-28 2105 evening-briefing-arxiv-cncfsurvey-substack-hf-jul2026 · 7-28 2340 news-x-tech-radar
  • 7-29 0822 csdn-rag-agent-multimodal · 7-29 0940 july2026-github-trending-vecdb-substack-engineering · 7-29 1000~1009 RSS × 11(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers-ir/cool-papers/lilian-weng/import-ai/msr-blog/yt-karpathy/yt-fireship)· 7-29 1055 engineering-filter-rss-round v3 · 7-29 1105 five-category-briefing #11 · 7-29 1105 engineering-e1prep-v39 · 7-29 1105 rag-agent-csdn-survey-v2 · 7-29 1140 news-x-tech-radar · 7-29 1505 afternoon-briefing

inbox/tom(7-28 evening + 7-29 全日 · 7 份)

  • 7-29 0840 agent-rag-longcontext-radar · 7-29 0900 hf-daily-2026-07-29 · 7-29 1441 agent-rag-longcontext-radar · 7-29 2040 agent-rag-longcontext-radar · 7-29 0853 rag-e1prep-v48 · 7-29 1543 evaluation-e1prep · 7-29 1008 RSS × 2

inbox/flyp(7-28 evening + 7-29 全日 · 6 份)

  • 7-28 0955 dual critical read scaling-native-multimodal-and-ovad B 级 · 立标级候选 3/5 · 2 件短审稿 + 3 反方硬标签新增 · 7-28 2250 SPA and Multimodal ASV dual critical read B 旁证级 · 7-29 0950 multimodal-e1prep-v34 第二棒 E1 35 件候选增量 · 7-29 0952 long-context-multimodal-rag-dual-review · 7-29 1000/1005/1008 RSS × 4

inbox/spark(7-29 仅 RSS 通稿 0 件 E1 落地 · 连续 4 日回落窗口第 5 棒 · 与 7-28 evening「节奏反转第 4 棒」判断再次相左)

  • 7-29 1004 rss-gradient-flow · 7-29 1005 rss-chip-huyen · 7-29 1008 rss-yt-3blue1brown

inbox/stephen(7-28 evening + 7-29 全日 · 13 份)

  • 7-28 2245 evening 协调棒 · 7-29 0910 X-vip-radar · 7-29 1006/1007 frontier news 通稿 × 9(anthropic/openai/deepmind/google-ai/hf-blog/tldr-ai/bens-bites/yt-anthropic/yt-openai/yt-deepmind)· 7-29 1025 ai-industry-e1prep-v31 · 7-29 1245 noon 协调棒

paper_cards 近 3 天(7-27~29)新卡 602-642 共 41 张 · 严格抽查 llm-application 邻接 41 张全检

  • 602 Scaling NMM(multimodal)/ 604 IDEAgent(agent)/ 605 LAMAR(rag)/ 607 Molt(agent+eng)/ 608 Multi-Head Latent Control(agent)/ 610 Learning on the Job(agent)/ 611 Teachy Mini(eval)/ 617 DataPrep-Bench(eng+eval)/ 618 APS-RAG(rag)/ 619 DeCoRAG(rag)/ 620 Historical Doc(rag)/ 621 Regulatory RAG(rag)/ 622 Rethinking CFG(multimodal)/ 623 Multi-Turn Long-Horizon(systems)/ 624 Evidence Attribution 无坐标(multimodal)/ 625 Historical Doc(rag)/ 626 Sol-Attn(multimodal+llm-infra)/ 627 Chamaileon(multimodal)/ 628 Warp Divergence(eval)/ 629 IndicTalk(llm-infra)/ 630 Reasoning Denoiser(rag)/ 631 Codifying the Judge(eval)/ 632 WorldDiT(multimodal+eng)/ 633 UltraViT(multimodal)/ 634 Multi-Agent Research Vocabulary(agent)/ 635 HiFi-UMI(eng)/ 636 ReDesign(agent)/ 637 Visual Prompt Engineering(multimodal)/ 638 CVE→ATT&CK(rag)/ 639 A New Role for Relevance(agent)/ 640 Keep It InMind(eval+agent)/ 641 Mage-VL(multimodal)/ 642 PerceptionBench(eval+multimodal)
  • 本次窗口新建 624-642 共 19 张(7-29 04:00 batch)
  • 本次窗口新增/续立 arXiv ID 11 件 + Kimi K3 1 件升级 + 旁证级升档 1 件 + 5 篇 v40 jay survey 跨三栖 = 18 件 v40 候选池

work-queue.md(2026-07-29 20:00 自动检测)

  • 2607.23242 IndicTalk 已入选待写攻略
  • 待建卡 0
  • 待富化 64 张
  • 待精确分类 0 张

活文档基线

  • /shared/research-kb/organized/knowledge/llm-application.md v39(2026-07-29 04:00 CST · 17h 前固化 · 6 主线 × 5 主轴 × 90 试金石 + 253 项 arXiv ID 候选池 + 47 中型增量候选池 + 80 维 Reliability 候选池 + 147 反方维度 + 469 拐点 + v33-v39 沿用不立标哲学明示)

7-28 21:10 llm-application-e1prep 对照

  • v39 已固化 18 件候选池 + 26 件 v39 net-new 候选池 + 5 件已收 ID 完整披露 + 9 件 frontier lab 立标 = v39 evening 累计候选池 58 件
  • v40 本次窗口新增 26 件 + Kimi K3 升级 1 件 = v40 候选池预估 35-40 件

5. 归入活文档 knowledge/llm-application.md 的建议操作

增量 目标节 操作类型
增量 1 · Kimi K3 arXiv 立基础 §0.5 + §1.2 主线 ② 第六十一节点 升级 60 → 61 节点 + 立标级候选升档
增量 2 · HF Daily 7-29 票榜 11 件新立标 §0.5 + §1.1 第 1 段 + §1.2 主线 ①/⑤ + §3.1 #149 新增 9 件 net-new + 1 件旁证级升档 + 2 件续立 = 12 件
增量 3 · jay engineering-v39 5 件 P0/P1 §0.5 + §1.1 第 2 段 + §1.2 主线 ① + §2.2 Harness Engineering 十一时间点 + §3.1 #150 新增 4 件 net-new + 1 件续立 = 5 件
增量 4 · jay rag-agent-csdn-survey-v2 13 件 §0.5 + §1.1 第 3 段 + §1.2 主线 ④ + §2.2 跨主线整合 + §3.1 #151 新增 5 篇 arXiv + 4 件 CSDN + 4 件 Substack = 13 件
增量 5 · tom rag-e1prep-v48 + tom radar 3 棒 §0.5 + §1.1 第 4 段 + §1.2 主线 ④/⑤ + §2.2 跨主线整合 + §3.1 #152 新增 6 件 net-new arXiv + 1 件 Nuanced Perspective + 1 件 ChatGPT Agent 案例 = 8 件
增量 6 · flyp multimodal-v34 第二棒 + flyp dual review §0.5 + §1.1 第 5 段 + §1.2 主线 ④ + §2.2 跨主线整合 + §3.1 #153 + §3.3 +16 维度 新增 4 件 net-new(2 件 dual critical read light + 2 件 long-context RAG)
增量 7 · jay five-category-briefing #11 9 件 §0.5 + §1.1 第 6 段 + §1.2 主线 ①/④/⑤ + §2.2 跨主线整合 + §3.1 #154 新增 2 件 net-new arXiv(PIVOT 2607.24593 + 循环 ≠ 可靠 2607.24604)+ 9 件立标补全
增量 8 · stephen ai-industry-v31 6 件 P0 §1.1 第 7 段 + §2.2 跨主线整合 + §3.1 #155 + §5.1 #140 新增 6 件 P0 立标 · frontier lab 7-29 第 2 日 30+ 件
增量 9 · CSDN Agent 4 范式 + MS Agent Governance Toolkit §1.2 主线 ⑤ 81 维 新增 1 维(MS Agent Governance Toolkit)

6. v40 候选池预估

  • v39 候选池 30 件(v39 §0.5 已罗列 ID 26 件 + v39 §0.5 沿用级 7 件 = 33 件 ≈ 30 件主题级候选池)
  • v40 增量(本次窗口):
    • 增量 1:1 件 Kimi K3 arXiv 升级
    • 增量 2:12 件 HF Daily 7-29(9 件 net-new + 1 件旁证级升档 + 2 件续立)
    • 增量 3:4 件 jay engineering-v39 4 件 P0/P1
    • 增量 4:5 篇 arXiv(jay rag-agent-csdn-survey-v2 跨三栖)
    • 增量 5:6 件 tom radar 7-29(早/午/晚 3 棒 8 件 - 2 件 APS-RAG/DeCoRAG 沿用 v39)
    • 增量 6:4 件 flyp 7-29(2 件 dual critical read light + 2 件 long-context RAG)
    • 增量 7:2 件 jay five-category-briefing #11(PIVOT + 循环 ≠ 可靠)
    • 增量 8:6 件 stephen ai-industry-v31(frontier lab 7-29 第 2 日 30+ 件)
    • 增量 9:1 件 MS Agent Governance Toolkit
  • v40 候选池预估 = 30 + 41 = 71 件 v40 net-new 候选池 + 18 件 v39 evening 沿用 = 89 件候选池(增长 27-33%)

7. 边界 / 待消解 / 后续验证动作

7.1 边界

  • 本次只写该 1 个文件(/shared/research-kb/inbox/stephen/2026-07-29-llm-application-e1prep.md)
  • 不写他人目录(不写 jay/tom/flyp/spark inbox)
  • 不 git / 不 git commit / 不 git push
  • 不输出密钥 / token / cookie

7.2 待消解开放项(7-30 ~ 8-02 验证窗口)

  1. Kimi K3 单日 +121 暴增 vs v33 §2.39.x 升档标准对比 7-30 截止
  2. Kimi K3 vLLM/SGLang 官方支持时间线 7-30 截止(stephen noon 协调棒 §4.1 待人工确认 #1 沿用)
  3. Kimi K3 MXFP4 量化精度损失实测待核 vs INT4/INT8 7-30 截止
  4. Rethinking CFG OPD 63▲ 单日 +48▲ 暴增 vs flyP B+ 旁证级升档标准 7-30 截止
  5. StateAct 53▲ 新立 vs 同等新立候选历史对照 7-30 截止
  6. Weng Harness vs Molt 关系 7-30 ~ 8-02
  7. MSR Memora 谐波记忆 vs Mem0/Lucid/Hypernetwork/Aurora 1.5 关系 7-30 ~ 8-02
  8. uv 0.12.0 src layout default vs poetry / pip-tools / hatch / pdm 7-30 ~ 8-02
  9. FlashInfer→SGLang/vLLM 集成 28%-30% 长上下文推理延迟降低实测待核 7-30 截止
  10. Is Agentic RAG worth it? 2601.07711 ACL2026 Industry Track 7-30 截止
  11. Language Models Can Autonomously Hack and Self-Replicate 2605.06760 = LLM Agent 自主利用漏洞 vs OWASP ASI01-ASI10 7-30 截止
  12. MetaRAG 2512.05411 chunking 策略 × metadata integration 3×3 配置矩阵 vs Trust-RAG Compass 六维框架 7-30 截止
  13. APS-RAG operations-grounded 评估可推广性 7-30 截止
  14. DeCoRAG token 削减幅度 7-30 截止
  15. Keep It InMind implicit-association blind spot > 90% Agent 易感数字来源 7-30 截止
  16. Cyber-Capable AI Agents 沙箱外安全漏洞 5 类 vs OWASP Agent Top 10 ASI 编号体系 7-30 截止
  17. BeyondUncertainty 置信度路由检索阈值工业级推广性 7-30 截止
  18. Milvus 3.0 lake-native vs Oracle 23ai vs CockroachDB vs Pinecone 跨平台互操作性 7-30 截止
  19. Colibri 25GB RAM 744B MoE 边缘推理 vs SGLang/vLLM 边端部署对比 7-30 截止
  20. PIVOT Token 级稀疏注意力 vs SGLang/vLLM KV-Cache 优化对比 7-30 截止
  21. OpenAI rogue agent 17,600 次黑客动作 vs HF 7 月安全事件 同 vs 异(stephen noon 协调棒 §4.1 待人工确认 #6 沿用)7-30 截止
  22. Anthropic Dario Amodei 周末博客正式澄清 vs NVIDIA 联署信 7-30 截止
  23. Andrew Ng LearnVector + Coursera $100M + Sam Altman singularity + Sam Altman 华盛顿国会闭门会 7-30 截止
  24. flyp 7-28 dual critical-read 立标级 vs 旁证级 7-30 截止
  25. AcademicEval 2510.17725 TMLR live evaluation 动态性 7-30 截止
  26. Scaling Beyond Context 2510.15253 ACL2026 Main vs Trust-RAG Compass 六维框架 7-30 截止
  27. Microsoft Agent Governance Toolkit vs OWASP Agent Top 10 ASI 编号体系 7-30 截止

7.3 后续验证动作

  • 7-30 早间 HF Daily 复核:① Kimi K3 7-29 263 → 7-30 ? ② Rethinking CFG OPD 7-29 63 → 7-30 ? ③ StateAct 7-29 53 → 7-30 ? ④ DataPrep-Bench 7-29 49 → 7-30 ? ⑤ Skill Self-Play 7-29 35 → 7-30 ? ⑥ Molt 7-29 29 → 7-30 ? ⑦ AREX 7-28 142 → 7-30 ? ⑧ SDM 7-28 18 → 7-30 ?
  • 7-30 noon frontier/industry 复核:① Andrew Ng LearnVector 后续动作 ② Sam Altman singularity 后续动作 ③ Sam Altman 华盛顿国会闭门会后续 ④ Anthropic Dario Amodei 周末博客后续 ⑤ HF OpenAI rogue agent 17,600 次后续 ⑥ Managed Agents Gemini API 3.6 Flash 详情 ⑦ TLDR AI 7-29 头条 ⑧ Spark Gradient Flow 7-29 头条
  • 7-30 evening arxiv 元搜索复核:① arXiv:2607.24653 Kimi K3 原文精读 ② arXiv:2607.23588 JarvisHub 原文精读 ③ arXiv:2607.24280 Agentic Search 协议蒸馏 原文精读 ④ arXiv:2607.22798 StateAct 原文精读 ⑤ arXiv:2607.24731 Rethinking CFG OPD 原文精读 ⑥ arXiv:2607.24223 A New Role for Relevance 原文精读 ⑦ arXiv:2607.24368 Keep It InMind 原文精读 ⑧ arXiv:2607.25996 RepoReasoner 原文精读 ⑨ arXiv:2607.25600 BeyondUncertainty 原文精读 ⑩ arXiv:2607.25379 Cyber-Capable AI Agents 原文精读 ⑪ arXiv:2607.25431 CodeNib 原文精读 ⑫ arXiv:2607.24593 PIVOT 原文精读 ⑬ arXiv:2607.24604 循环 ≠ 可靠 原文精读
  • 7-30 evening stephen evening 协调棒 = 7-29 早间 + noon + evening 三棒收官
  • 7-31 截止 = Kimi K3 Coding/Agentic SOTA 与 Claude Opus 5 + Sonnet 5 + GLM-5.2 + Kimi K2.7-Code 等同期商业模型 head-to-head SWE-bench Verified + Terminal-Bench 2.1 量化对照

8. 本棒执行摘要

  • 棒名:E1 预消化棒(llm-application)
  • 作者:Stephen
  • 生成时间:2026-07-29 21:10 Asia/Shanghai(UTC 13:10)
  • 检查文件总数:30+ jay · 7 tom · 6 flyp · 3 spark(仅 RSS 通稿)· 13 stephen · 41 paper_cards 7-27~29 新建(602-642)· work-queue.md 7-29 20:00 + 活文档 v39 + 7-28 21:10 llm-application-e1prep
  • 本次窗口时长:7-28 21:10 → 7-29 21:08 约 24 小时
  • 本次窗口新增强度
    • 🟡 8 件主线增量 + 1 件旁证增量
    • 🟡 增量 1(🔴 Kimi K3 arXiv:2607.24653 263▲ 单日 +121 暴增 立基础 + 立标级候选升档)
    • 🟡 增量 2(🔴 HF Daily 7-29 票榜 14 件替换 + 11 件新立标 + 3 件续立 + 1 件旁证级升档)
    • 🟡 增量 3(🔴 jay 7-29 engineering-v39 5 件 P0/P1)
    • 🟡 增量 4(🔴 jay 7-29 rag-agent-csdn-survey-v2 13 件跨三栖综合调研)
    • 🟡 增量 5(🔴 tom 7-29 rag-e1prep-v48 + tom radar 早/午/晚 3 棒 8 件 arXiv + Substack Nuanced Perspective + ChatGPT Agent 案例)
    • 🟡 增量 6(🔴 flyp 7-29 multimodal-v34 第二棒 E1 35 件 v34 候选增量 + flyp 7-29 0952 long-context-multimodal-rag-dual-review 2 篇)
    • 🟡 增量 7(🟡 jay 7-29 1105 five-category-briefing #11 9 件立标补全)
    • 🟡 增量 8(🟡 stephen 7-29 ai-industry-v31 6 件 P0 立标)
    • 🟢 增量 9(旁证 CSDN Agent 4 范式 + Microsoft Agent Governance Toolkit)
  • v40 候选池预估:v39 30 件 + v40 net-new 41 件 + v39 evening 沿用 18 件 = 89 件候选池
  • arXiv 号新增:26 件(增量 1 升级 1 件 + 增量 2 9 件 + 增量 3 4 件 + 增量 4 5 件 + 增量 5 6 件 + 增量 6 4 件 + 增量 7 2 件)
  • 可引用 arXiv 号列表:v40 候选池 26 件 + v39 候选池 26 件沿用 + 5 篇 v40 jay survey 沿用 + 6 件 work-queue 7-29 沿用 + 7 件 v39 沿用级 v38 已收 ID 完整披露 = 70 件 v40 候选池 + v39 沿用 26 件 + 7 件 v39 沿用级 = 103 件 v40 总候选池
  • 主线归属统计
    • 主线 ① Coding Agent:Weng Harness + MSR Memora + uv 0.12.0 + FlashInfer + JarvisHub + Progress RM + Agentic Search 协议蒸馏 + StateAct + Data Pyramid + Molt(续立)+ Skill Self-Play(续立)+ IDEAgent(沿用)+ Molt(沿用)+ Learning on the Job(沿用)+ Multi-Head Latent Control(沿用)+ RepoReasoner + CodeNib + 循环 ≠ 可靠 = 18 件
    • 主线 ② Personal Assistant Agent:Kimi K3(升级) = 1 件
    • 主线 ③ Vertical LLM:v35 Gemini 3.5 Flash Cyber 第六十一节点(沿用) = 1 件
    • 主线 ④ Agentic RAG:LLM-Wiki + RAGSearch + GradRAG + MemGraphRAG + Trust-RAG Compass + APS-RAG(沿用)+ DeCoRAG(沿用)+ 5 件 work-queue 7-28(沿用)+ 6 件 work-queue 7-29(沿用)+ A New Role for Relevance + Keep It InMind + AcademicEval + Scaling Beyond Context + Is Agentic RAG worth it? + MetaRAG + Memory for Autonomous LLM Agents + Language Models Can Autonomously Hack + DeepRead + Agentic Context Management = 20 件
    • 主线 ⑤ Application-layer Reliability:DataPrep-Bench(续立)+ Skill Self-Play(续立)+ Molt(续立)+ Cyber-Capable AI Agents + Nuanced Perspective 记忆投毒攻击 + MS Agent Governance Toolkit = 6 件
    • 主线 ⑥ inference-efficient:Sol-Attn + PIVOT = 2 件
    • multimodal 主线(非 llm-application 主线):Scaling NMM(续立)+ OmniVAE + Oxygen-TryOn = 3 件
  • 建议归入节:v40 §0.5 + §1.1 + §1.2 + §2.2 + §3.1 + §3.3 + §4.1 + §5.1 共 9 节
  • 可消解待消解开放项:27 项(7-30 ~ 8-02 验证窗口)
  • 后续验证动作:7-30 早间 HF Daily 复核 8 项 + 7-30 noon frontier/industry 复核 8 项 + 7-30 evening arxiv 元搜索复核 13 项 + 7-30 evening stephen evening 协调棒 + 7-31 截止 Kimi K3 同期商业模型 head-to-head

v40 changelog · 2026-07-29 21:10 CST · Stephen · Wave3 E1 预消化简报 · 第 40 轮迭代 · 沿用 v33/v34/v35/v36/v37/v38/v39 不立标哲学明示