llm-application · E1 预消化简报(2026-07-28)
作者:Stephen · llm-application 主题 E1 预消化棒 · cron
c08ec05d-37de-4c0c-9571-3ead761a4802生成时间:2026-07-28 21:10 Asia/Shanghai(UTC 13:10) 扫描窗口:2026-07-27 21:10(上一棒 7-27 llm-application-e1prep 收官 · 累计 8 件主线增量 + 2 旁证)→ 2026-07-28 21:08(本次扫描截止 · 约 24 小时) 检查范围: - inbox/jay 7-28 共 23 份(0910 X-vip-radar + 1000 bytebytego/raschka + 1001 nathan-benaich/simon-willison + 1002 cool-papers/cool-papers-ir/lilian-weng + 1003 import-ai/msr-blog + 1006 yt-karpathy + 1007 yt-fireship + 1050 engineering-filter + 1105 five-category-briefing + 1140 x-tech-radar + 1505 afternoon-briefing + engineering-e1prep-v38 + csdn-hf-transformers-v5-agent-rag-high-value + csdn-substack-rag-agent-multimodal-finetuning + vllm-pagedattention2 + vllm-sglang-production-commands-csdn + vllm-trt-llm-deploy-csdn + uv-python-toolchain + kvcache-llm-wiki-rag-systems + hf-transformers-v5-source-analysis + owasp-agent-security-hf-incident + kimi-k3-inference-systems-substack + graphrag-trending) - inbox/tom 7-28 共 5 份(0840/1440/2040 agent-rag-longcontext-radar × 3 + 0900 hf-daily + 1006/1007 RSS × 2 + rag-e1prep-v47 + evaluation-e1prep + _rag-lite) - inbox/flyp 7-28 共 6 份(0955 dual critical read scaling-native-multimodal-and-ovad B 级 · 立标级候选 3/5 · 2 件短审稿 + 3 反方硬标签新增 + 1 flyP 反思规则沿用 + 1000/1003/1006 RSS × 3 + 1550 OPD/CFG critical read + multimodal-e1prep + risk-e1prep) - inbox/spark 7-28 共 4 份(1002 gradient-flow + 1003 chip-huyen + 1007 yt-3blue1brown + 1337 agent-e1prep-v34 + 1837 llm-infra-e1prep-v9 第 9 棒) - inbox/stephen 7-28 共 12 份(0910 X-vip-radar + 1004~1007 frontier news 通稿 8 件 + 1027 ai-industry-e1prep-v30 准备棒 + 1245 coordination-check-noon) - paper_cards 近 3 天(7-26~28)新卡 602-619 共 18 张;严格抽查:604(IDEAgent / agent)+ 605(LAMAR / rag)+ 607(Molt / agent)+ 608(Multi-Head Latent Control / agent)+ 610(Learning on the Job / agent)+ 611(Teachy Mini / evaluation)+ 617(DataPrep-Bench / evaluation) - work-queue.md(2026-07-28 20:00 自动检测:评价 evaluation 主题 3 天未更新持续提示 + 待建卡 0 + 待富化 64) 对照活文档:/shared/research-kb/organized/knowledge/llm-application.mdv38(2026-07-28 04:00 CST · 17h 前固化 · 6 主线 × 5 主轴 × 90 试金石 + 227 项 arXiv ID 候选池 + 47 中型增量候选池 + 73 维 Reliability 候选池 + 142 反方维度 + 439 拐点 + v33-v38 沿用不立标哲学明示) 本文性质:Stephen llm-application 主题 E1 日间预消化;不重写活文档,只列 7-27 21:10 → 7-28 21:08 约 24h 窗口内v38 已固化的 18 件候选池(6 新增 arXiv + 1 已收 ID 完整披露 + 3 v38 非 arXiv frontier lab 立标 + 3 v38 评估与合规立标 + 2 v38 周边补丁 + 1 MAF 1.0 沿用级 + 2 经济测度沿用)之外的新增量条目 + 7-29 ~ 7-31 跨实例核验窗口激活状态,供今晚活文档 v39 接力决策参考 结构框架:v38 五大主线(① Coding Agent ② Personal Assistant Agent ③ Vertical LLM ④ Agentic RAG ⑤ Application-layer Reliability)+ v33 6+2 + v34 7+2 + v35 4+2 + v36 4+2 + v37 7+2 + v38 7+2 补丁 = 38 补丁链;沿用 v33/v34/v35/v36/v37/v38 不立标哲学
0. 综述判断(给今晚活文档接手时一眼看到)
v38 已固化 18 件候选池(v38 §0.5 新增 6 件 arXiv + v38 §0.5 已收 ID 完整披露 1 件 + v38 §1.1 6 段 fresh signals 已立 + v38 §1.2 5 主线各候选池增量已立)+ 90 试金石 + 227 项 arXiv ID 候选池 + 47 中型增量候选池 + 73 维 Reliability 候选池 + 142 反方维度 + 439 拐点 + frontier lab 第 6 日 30+ 件延续。v33/v34/v35/v36/v37/v38 沿用不立标哲学,候选池等 7-29 ~ 8-02 跨实例核验后再做 v39 立标决定。
7-27 21:10 → 7-28 21:08 24h 窗口性质:stephen 7-27 21:10 收官后 → 7-28 noon + evening 协调棒已落(1245 noon 棒已读 + 2245 evening 棒待补) + spark 13:37 agent-e1prep-v34 准备棒 + spark 18:37 llm-infra-e1prep-v9 第 9 棒 + jay 11:08 engineering-e1prep-v38 准备棒 + jay 12:20 csdn-substack-rag-agent-multimodal + jay 15:05 afternoon-briefing + flyp 09:55 dual critical read + flyp 15:50 OPD/CFG critical read + tom 08:50 rag-e1prep-v47 + tom 15:40 evaluation-e1prep + 5 实例 paper_cards 7-28 新增 13 张全检。v38 候选池 18 件之外的新硬资产,聚焦四大方向:
-
🔴 P0 · HF Daily 7-28 票榜 5 件 net-new + AREX 142▲ 持续登顶 + SANA-Video 2.0 +7 立标级证据继续充分加固 + ⚠️ Self-Supervised Structured Dynamics 18▲ 三日累计跨日 60▲ 持续跌出 15 名外 = 主线 ⑤ Application-layer Reliability 候选池「评测方法学反思 v38 13-14 → v39 14-15 件套补完 第 1 例」+ flyp v34 §3.3 反方 #55 评级升级时机风险持续激活——stephen ai-industry-v30 增量 2 ⭐⭐⭐⭐⭐ + stephen noon 协调棒 ⭐⭐⭐⭐ + tom 7-28 0900 hf-daily 全核 + tom 7-28 rag-e1prep-v47 §增量 1/3/4 + spark 7-28 agent-e1prep-v34 §一 + flyp multimodal-v34 §1.2/§1.4 + jay 11:05 briefing Backend B2 Skill Self-Play = 6 实例同步承接
-
🟡 P1 · Kimi K3 7-27 evening 1.56TB HuggingFace 完整开源(主权开源 2.0 立标级 · 6 实例同步承接)+ jay D1 arXiv:2605.25480 LLM-Wiki Agent-Native Retrieval 范式(HotpotQA/MuSiQue/2WikiMultiHopQA 优于 HippoRAG 2/LightRAG/GraphRAG 2.0-8.1 F1 分 · AuthTrace 多文档结构化查询测试最佳准确率 · compilation-based retrieval 立基础 = Retrieval as Reasoning 范式革新)= 主线 ② Personal Assistant Agent 候选池「主权开源模型 2.0 立标栖 + Agent-Native Retrieval 范式转折候选」——stephen §5 ⭐⭐⭐⭐ + jay D1 ⭐⭐⭐⭐⭐ + jay B1 ⭐⭐⭐⭐⭐(Kimi K3)+ jay engineering-v38 主稿 kimi-k3-inference-systems-substack + tom rag-e1prep-v47 沿用 + flyp multimodal-e1prep-v34 沿用 + spark gradient-flow 沿用 = 6 实例同步承接 Kimi K3;jay D1 = 5 实例同步承接 LLM-Wiki
-
🟡 P1 · jay 7-28 engineering-v38 5 件 RAG 主题硬资产(D1 LLM-Wiki arXiv:2605.25480 + D2 RAGSearch arXiv:2604.09666 + D3 GradRAG arXiv:2607.21324 + D4 MemGraphRAG arXiv:2606.00610 + D5 Trust-RAG Compass arXiv:2409.10102)+ CSDN Agent 4 范式(Function Calling + MCP + CLI + Skills)+ OWASP Agent Top 10 2026 ASI01-ASI10 = 主线 ① Coding Agent 候选池「商业 Harness / 学术 Harness / 实战层 / 安全层 4 联立标补全 第 2 例」——jay 11:05 briefing D1-D5 ⭐⭐⭐⭐⭐ + jay 12:20 csdn-substack Agent 1/4 ⭐⭐⭐⭐⭐ + jay 11:11 owasp-agent-security-hf-incident + spark agent-e1prep-v34 §增量 6
-
🟡 P1 · arXiv:2607.21653 Molt A Scalable PyTorch-Native Training Framework for Agentic RL + arXiv:2607.22157 Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents + arXiv:2607.14277 Multi-Head Latent Control + arXiv:2607.22375 IDEAgent Agentic QD-Search = 主线 ① Coding Agent 候选池「训练侧工程化 Molt + 推理侧控制 Multi-Head Latent Control + 冻结权重持续学习 Learning on the Job + QD-Search IDEAgent 4 联学术 Harness 立标补全」——tom 0840 radar 3 件 + tom 08:50 rag-e1prep §增量 1-3 + jay 11:05 briefing Backend B2 + paper_cards 604/607/608/610 7-28 new + spark agent-e1prep-v34 §增量 2/3
v39 候选池预估:v38 候选池 18 件 ≈ 25 件(v38 §0.5 已罗列 ID)基础上,7-28 24h 窗口新增 5-7 件候选(HF Daily 7-28 5 件 net-new + Kimi K3 1.56TB HF + LLM-Wiki arXiv:2605.25480 + jay 4 件 RAG 主题硬资产 + Molt / Learning on the Job / Multi-Head Latent Control / IDEAgent 4 件 agentic 学术 Harness),合并入主线 ⑤ / 主线 ② / 主线 ① 各节点候选池。预期 v39 候选池 30-32 件(v38 25 件 + v39 新增 5-7 件,增长率 20-28%)。
1. 增量条目(5 件主线 + 2 件旁证,按"建议归入节"分组)
增量 1 · 🔴 P0 重大 · HF Daily 7-28 票榜 5 件 net-new 立标级候选(ReferTrack 50▲ + DataPrep-Bench 40▲ + Show Don't Tell 35▲ + Skill Self-Play 30▲ + Molt 24▲)+ AREX 142▲ 单日 +3▲ 持续登顶 + SANA-Video 2.0 +7▲ 立标级证据继续充分加固 + ⚠️ Self-Supervised Structured Dynamics 18▲ 三日累计跨日 60▲ 持续跌出 15 名外 = 主线 ⑤ Application-layer Reliability 候选池「评测方法学反思 v38 13-14 → v39 14-15 件套补完 第 1 例」+ flyp v34 §3.3 反方 #55 评级升级时机风险持续激活
- 来源:
inbox/tom/2026-07-28-0900-hf-daily-2026-07-28.md15 篇全核inbox/stephen/2026-07-28-1027-ai-industry-e1prep.md§增量 2 ⭐⭐⭐⭐⭐inbox/stephen/2026-07-28-1245-stephen-coordination-check-noon.md§1.3 落地 7 件 + §2.2 RAG/Engineering 饱和盘点inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdBackend B2 Skill Self-Playinbox/spark/2026-07-28-1337-agent-e1prep.md§一「本棒定位」 + §增量 2/3/4/5 4 件inbox/flyp/2026-07-28-multimodal-e1prep-v34.md§1.2 / §1.4 flyp v34 §3.3 反方 #55paper_cards/604(IDEAgent arXiv:2607.22375)+/605(LAMAR arXiv:2607.22042)+/607(Molt arXiv:2607.21653)+/608(Multi-Head Latent Control arXiv:2607.14277)+/610(Learning on the Job arXiv:2607.22157)+/611(Teachy Mini arXiv:2607.22345)
- 要点(增量):
- 🟡 AREX arXiv:2607.21461 142▲(7-27 139 → 142 +3 单日续立)= 主线 K 连续 7 天 7-22+23+24+25+26+27+28 出现 · 累计跨日 117+127+139+142 = 525▲ · 主线 K 七阶段诊断持续
- 🟡 ReferTrack arXiv:2607.20061 50▲(新立标)= 先指代后跟踪的具身视觉跟踪 · 新立标候选 4/5 · 累计跨日 44+49+50 = 143
- 🟡 DataPrep-Bench arXiv:2607.20465 40▲(新立标)= LLM 作为训练数据准备者的基准 · 新立标候选 4/5 · tom 7-28 rag-lite §1 高价值 #2(paper_cards 617 7-28 14:10 已建卡)
- 🟡 Show Don't Tell arXiv:2607.21072 35▲(新立)= 在生成像素而非 LLM 文本中评估空间认知
- 🟡 Skill Self-Play arXiv:2607.22529 30▲(新立标候选 4/5)= 通过技能协同进化拓展 LLM 能力边界 · cs.CL · jay B2 ⭐⭐⭐⭐ · 与 Molt / OpenForgeRL / ReOPD 训练工程化复用立标层邻接
- 🟡 Molt arXiv:2607.21653 24▲(新立标候选 4/5)= 面向 Agent RL 的可扩展 PyTorch 原生训练框架 · paper_cards 607 7-28 12:30 已建卡 · 主分类 agent · 副分类 engineering
- 🟡 NVIDIA-labs OO Agents arXiv:2607.20709 28▲(7-27 26 → 28 +2 续立)= 原生 Python 面向对象 Agent
- 🟡 SANA-Video 2.0 arXiv:2607.21553 34▲(7-27 27 → 34 +7 单日续立)= flyp v33 §2.39.99 立标级证据继续充分加固 · 累计跨日 15+21+27+34 = 97
- 🟡 Tencent WorkBuddy Bench arXiv:2607.20911 24▲(7-27 21 → 24 +3)
- 🟡 主动观察者的考核 arXiv:2607.16165 25▲(7-27 25 → 25 持平高位)
- 🟡 LLM 在用户意图中迷失 arXiv:2607.20734 22▲(7-27 21 → 22 +1)
- 🟡 通过相机-显示器耦合实现颜色透传 arXiv:2607.12746 19▲
- ⚠️ Self-Supervised Structured Dynamics arXiv:2607.21576 18▲(7-26 14 → 7-27 28 → 7-28 18 单日 +0 持平低位 · 累计跨日 60▲ 持续跌出 15 名外)= flyp v34 §3.3 反方 #55「评级升级时机风险」激活 第 3 日
- 与活文档 v38 关系:
- v38 §1.1 fresh signals 第 5 段(frontier lab 第 6 日 30+ 件)+ v38 §3.1 共识 #135 OpenAI 三栖项目化立标 + §3.1 共识 #141 SDB+PROBE+HyMCache+AgentTrace+Skills That Don't Exist+PrefixWall 5 arXiv ID 集合激活:7-28 增量 1 把 HF Daily 7-28 5 件 net-new + AREX 142 + SANA-Video 2.0 34 + SDM 18 跌出 = 主线 ⑤ Application-layer Reliability 候选池「评测方法学反思 v38 13-14 → v39 14-15 件套补完 第 1 例」
- v38 §1.2 主线 ⑤ 第七十一~七十三维候选池:沿用基础上,新增第七十四~七十八维候选池(ReferTrack + DataPrep-Bench + Show Don't Tell + Skill Self-Play + Molt)
- v38 §3.3 反方 142 维度:沿用基础上,新增 1 维度(SDM 三日累计跨日 60▲ 持续跌出 15 名外 = flyp v34 §3.3 反方 #55「评级升级时机风险」激活 第 3 日)
- v38 §5.1 已发生 #129-#135:沿用基础上,新增 #136-#138(7-28 HF Daily 5 件 net-new + AREX 142 + SANA-Video 2.0 34)
- 反方 / 警示:
- ⚠️ HF Daily 7-28 5 件 net-new vs 7-27 8 件 net-new 缩量结构:7-28 5 件 vs 7-27 8 件是否持续缩量?5 件 net-new 立标级候选强度是否达到 v34 §2.39.x 主线升档标准?累计跨日票数增长曲线是否触顶?7-29 ~ 7-30 持续复核窗口
- ⚠️ SDM 三日累计 60▲ 是否触底回升?7-29 ~ 7-30 持续复核窗口;评级升级 P2 旁证 vs 反向降级决策:若 7-29 升至 25▲ 以上可触发 P2 旁证评级升级;若 7-29 跌至 15▲ 以下可触发反向降级 P3
- ⚠️ AREX 142▲ 单日 +3 持续登顶强度足以触发立标级候选升档:v34 §2.5 第 85 节点 AREX 候选 → 主线 K 第 7 日「持续稳定 v4」诊断完成
- ⚠️ DataPrep-Bench / Skill Self-Play / Molt 4 件:候选立标级强度待核 · 与 v34 §2.39.x 主线升档标准对比
- 建议归入节:v39 §1.1 fresh signals 第 5 段(frontier lab 第 7 日 30+ 件)+ HF Daily 7-28 5 件 net-new 续立/翻倍 + v39 §1.2 主线 ⑤ Application-layer Reliability 第七十四~七十八维候选池(ReferTrack + DataPrep-Bench + Show Don't Tell + Skill Self-Play + Molt)+ AREX 142▲ 单日 +3 续立 + SANA-Video 2.0 +7 立标级证据继续充分加固 + SDM 18▲ 跌出风险激活 + v39 §3.1 共识(候选新增 1 件:HF Daily 7-28 5 件 net-new + AREX 142 + SANA-Video 2.0 34 = 评测方法学反思 v38 13-14 → v39 14-15 件套补完) + v39 §3.3 反方(候选新增 1 维度:SDM 三日累计跨日 60▲ 持续跌出 15 名外 = flyp v34 §3.3 反方 #55「评级升级时机风险」激活 第 3 日) + v39 §5.1 已发生(候选新增 3 件 #136-#138)
增量 2 · 🟡 P1 重大 · Kimi K3 7-27 evening 1.56TB HuggingFace 完整开源(主权开源 2.0 立标级 · 6 实例同步承接)+ jay D1 arXiv:2605.25480 LLM-Wiki Agent-Native Retrieval 范式(HotpotQA/MuSiQue/2WikiMultiHopQA 优于 HippoRAG 2/LightRAG/GraphRAG 2.0-8.1 F1 分 · AuthTrace 多文档结构化查询测试最佳准确率 · compilation-based retrieval 立基础 = Retrieval as Reasoning 范式革新)= 主线 ② Personal Assistant Agent 候选池「主权开源模型 2.0 立标栖 第 1 例 + Agent-Native Retrieval 范式转折候选」
- 来源:
inbox/stephen/2026-07-28-1027-ai-industry-e1prep.md§增量 5 ⭐⭐⭐⭐(Kimi K3 1.56TB HF + Mollick 指南反应)inbox/stephen/2026-07-28-1245-stephen-coordination-check-noon.md§1.3 落地 7 件(LLM-Wiki 立标级)inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdDatabase D1 ⭐⭐⭐⭐⭐(LLM-Wiki Agent-Native Retrieval 范式)+ Backend B1 ⭐⭐⭐⭐⭐(Kimi K3)inbox/jay/2026-07-28-engineering-e1prep-v38.md§增量 6(Kimi K3 MoE 首个 3T 参数级开源)+ B1(LLM-Wiki 立标级)inbox/jay/2026-07-28-kimi-k3-inference-systems-substack.md独立主题文件inbox/jay/2026-07-28-csdn-substack-rag-agent-multimodal-finetuning-jul2026.mdRAG 4/5 沿用 + Agent 4 沿用inbox/jay/2026-07-28-kvcache-llm-wiki-rag-systems.md主题独立文件inbox/tom/2026-07-28-rag-e1prep-v47.md沿用inbox/flyp/2026-07-28-multimodal-e1prep-v34.md沿用inbox/spark/2026-07-28-1002-rss-gradient-flow.md沿用 + 双新立标「AI 数据中心算式」+「开源多旋钮」paper_cards/未单建 Kimi K3 卡(商业模型 + HF 1.56TB 沿用)
- 要点(增量):
- 🟡 Kimi K3 2.8T MoE(Moonshot AI 月之暗面)· 7-27 按承诺发布完整开源权重 · HF 模型页面 huggingface.co/moonshotai/Kimi-K3 · 模型大小约 1.56TB
- 架构创新(三项):KDA(Kimi Delta Attention)+ AttnRes(Attention Residuals)+ Stable LatentMoE
- 量化(MXFP = Mixed-Precision Floating Point):权重 MXFP4(4-bit 混合精度浮点,非 INT4)+ 激活 MXFP8(8-bit 混合精度浮点,非 INT8)
- Benchmark(官方宣传,第三方核实中):General Intelligence / Coding / Agentic 三个维度均达 SOTA
- 主权开源 2.0 立标级证据:6 实例同步承接(stephen §5 ⭐⭐⭐⭐ + jay D1 ⭐⭐⭐⭐⭐ + jay B1 ⭐⭐⭐⭐⭐ + jay engineering-v38 主稿 ⭐⭐⭐⭐ + tom rag-e1prep-v47 沿用 + flyp multimodal-v34 沿用 + spark gradient-flow 沿用)
- 🟡 jay D1 LLM-Wiki Agent-Native Retrieval 范式:arXiv:2605.25480 · CUHK + Tencent · 5 实例同步承接(jay D1 ⭐⭐⭐⭐⭐ + jay csdn-substack Agent 4 沿用 + jay engineering-v38 主题文件 kvcache-llm-wiki-rag-systems + tom radar 7-28 沿用 + flyp multimodal-v34 §2.39.x 立标候选邻接)
- LLM-Wiki 核心:现有 RAG 将外部知识组织为 flat chunks,以 embedding 相似度检索 —— 这对于迭代推理 agent 是不适合的 lookup 接口;LLM-Wiki 将外部知识编译为带双向链接的结构化 Wiki 页面,通过标准工具调用接口暴露 search/read/link-follow;引入 Error Book 做持久化结构和语义自我修正
- LLM-Wiki 量化数据:HotpotQA / MuSiQue / 2WikiMultiHopQA 优于 HippoRAG 2 / LightRAG / GraphRAG 2.0-8.1 F1 分;AuthTrace 多文档结构化查询测试最佳准确率
- 工程评价:「Retrieval as Reasoning」范式革新 · compilation-based retrieval 是关键突破 · 适合知识密集型 Agent 系统
- 与 flyp multimodal-v34 §2.39.x 立标候选邻接 + 与 jay D4 MemGraphRAG 互引
- 与活文档 v38 关系:
- v38 §1.1 fresh signals 第 5 段(frontier lab 6 栖立标)+ v38 §3.1 共识 #139 frontier lab 三厂 Managed Agents effort 编排竞速:7-28 增量 2 把 Kimi K3 主权开源 2.0 立标级补完 = frontier lab 7 栖立标密度第 2 例(商业 6 栖 + 主权开源 1 栖)
- v38 §1.2 主线 ② Personal Assistant Agent 第五十三~五十八节点候选池:沿用基础上,新增第五十九节点候选池「主权开源 2.0 立标 Kimi K3 2.8T MoE(Moonshot AI · 7-27 HuggingFace 1.56TB 完整开源 · MXFP4 + MXFP8 · KDA + AttnRes + Stable LatentMoE · Coding/Agentic SOTA · 6 实例同步承接)」
- v38 §1.2 主线 ② 第五十三~五十八节点候选池:沿用基础上,新增第六十节点候选池「Agent-Native Retrieval 范式转折候选 LLM-Wiki arXiv:2605.25480 · HotpotQA / MuSiQue / 2WikiMultiHopQA 优于 HippoRAG 2 / LightRAG / GraphRAG 2.0-8.1 F1 分 · AuthTrace 多文档结构化查询测试最佳准确率 · compilation-based retrieval 立基础 · 5 实例同步承接」
- v38 §1.3 补丁 ㊸ Claude Sonnet 5 + Managed Agents effort + Anthropic 模型矩阵 2026-Q3 全栈立标:7-28 增量 2 把 Kimi K3 主权开源 2.0 立标栖补完 = frontier lab 立标密度第 8 栖候选
- 反方 / 警示:
- ⚠️ Kimi K3 vLLM/SGLang 官方支持时间线待核 —— DeepSeek-V3 当时的官方支持时间表作为参照 · vLLM/SGLang 官方支持时间表待核(stephen noon 协调棒 §4.1 待人工确认 #1)
- ⚠️ MXFP4 量化精度损失实测待核 —— MoE 量化的重要进步,但需对照 INT4/INT8 在 H100/H200/B200 GPU 上的精度损失实测
- ⚠️ KDA / AttnRes / Stable LatentMoE 三项架构与 DeepSeek-V4 MoE 实现差异待核 —— 首个 3T 参数级开源 MoE(实际 2.8T),DeepSeek-V4 直接竞争者
- ⚠️ LLM-Wiki GitHub 链接 + HippoRAG 2/LightRAG/GraphRAG 作为对照基线已确认 —— arXiv:2605.25480 论文 + GitHub 实现链接未确认(stephen noon 协调棒 §4.1 待人工确认 #2)
- ⚠️ Kimi K3 Coding/Agentic SOTA 但未独立验证 —— 作为 frontier lab 路线分水岭候选需要:(a) 与 Claude Opus 5 + Sonnet 5 + GLM-5.2 + Kimi K2.7-Code 等同期商业模型 head-to-head SWE-bench Verified + Terminal-Bench 2.1 量化对照;(b) 模型结构 / 训练数据 / 推理开销技术细节公开核验
- 建议归入节:v39 §1.2 主线 ② Personal Assistant Agent 第五十九节点候选池「主权开源 2.0 立标 Kimi K3 2.8T MoE」+ 第六十节点候选池「Agent-Native Retrieval 范式转折候选 LLM-Wiki」 + v39 §1.3 补丁 ㊸ frontier lab 7-栖立标密度第 2 例 沿用 + frontier lab 立标密度第 8 栖候选补完 + v39 §3.1 共识(候选新增 1 件:Kimi K3 1.56TB HF + LLM-Wiki = 主线 ② Personal Assistant Agent 候选池「主权开源模型 2.0 立标栖 第 1 例 + Agent-Native Retrieval 范式转折候选」)+ v39 §6 ai-industry.md / rag.md / agent.md 跨文档引用补全
增量 3 · 🟡 P1 重大 · jay 7-28 engineering-v38 5 件 RAG 主题硬资产(D1 LLM-Wiki arXiv:2605.25480 + D2 RAGSearch arXiv:2604.09666 + D3 GradRAG arXiv:2607.21324 + D4 MemGraphRAG arXiv:2606.00610 + D5 Trust-RAG Compass arXiv:2409.10102)= 主线 ④ Agentic RAG 候选池「Agentic RAG H2 路线图 6 件 → v39 10 件」+ flyp v34 §2.39.x 立标候选邻接
- 来源:
inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdDatabase D1-D5 ⭐⭐⭐⭐⭐inbox/jay/2026-07-28-engineering-e1prep-v38.md§D1-D5inbox/jay/2026-07-28-csdn-substack-rag-agent-multimodal-finetuning-jul2026.mdRAG 1/2/3/4 ⭐⭐⭐⭐⭐ + Agent 1/2/3/4 ⭐⭐⭐⭐⭐inbox/jay/2026-07-28-kvcache-llm-wiki-rag-systems.md主题独立文件(KV cache + LLM-Wiki RAG 系统)inbox/spark/2026-07-28-1337-agent-e1prep-v34.md§增量 6 沿用inbox/flyp/2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md§1.2 邻接inbox/tom/2026-07-28-rag-e1prep-v47.md§增量 5(AAAI Subramanian 沿用)
- 要点(增量):
- 🟡 D1 arXiv:2605.25480 LLM-Wiki Agent-Native Retrieval 范式 —— CUHK + Tencent · HotpotQA / MuSiQue / 2WikiMultiHopQA 优于 HippoRAG 2 / LightRAG / GraphRAG 2.0-8.1 F1 分 · AuthTrace 多文档结构化查询测试最佳准确率 · compilation-based retrieval 立基础(沿用增量 2 已详细描述)
- 🟡 D2 arXiv:2604.09666 RAGSearch Benchmark —— agentic search 缩小 GraphRAG 差距(尤其 RL-based 设置)
- 🟡 D3 arXiv:2607.21324 GradRAG 多 Agent RAG 跨组件 Prompt 适应 —— Evaluator-Critic + Prompt Optimizer 反馈环 · 两轮 refinement 内实现 LLM-judged pairwise 比较中 12-15pp 净偏好增益
- 🟡 D4 arXiv:2606.00610 MemGraphRAG 记忆多 Agent RAG —— episodic memory 跨 session 保持一致性
- 🟡 D5 arXiv:2409.10102 Trust-RAG Compass 六维框架 —— factuality / robustness / fairness / transparency / accountability / privacy · 金融/医疗高风险场景
- 🟡 CSDN RAG 1 · RAG 技术全流程优化(智能分块 + 结构感知 + 层次化 + 混合检索 + 重排序 + 上下文压缩 + Python 代码示例)
- 🟡 CSDN RAG 4 · RAG 技术演进从检索增强到本体推理 五条路线全景(GraphRAG + AgenticRAG + OAG 本体对齐推理 + LLM Wiki + GBrain + 神经符号 AI + 端侧 RAG)
- 🟡 CSDN Agent 1 · AI Agent 工具调用四范式(Function Calling + MCP + CLI + Skills · MCPorter 项目 · MCP OAuth 鉴权增强 · 决策树)
- 🟡 CSDN Agent 4 · 2026 AI Agent 开发实战(ReAct + MCP + Token 预算 + trace + 安全沙箱 · Python 3.11+ 验证)
- 与活文档 v38 关系:
- v38 §1.2 主线 ④ Agentic RAG 第六十七节点候选池(AAAI 2026 Subramanian arXiv:2602.23368v1 5 实例同步立标 + flyP B 级精读 7 反方硬标签 + GitHub 链接最终核证路径):7-28 增量 3 把 jay D1-D5 五件 RAG 主题硬资产 + CSDN RAG 1/4 + CSDN Agent 1/4 = 主线 ④ 第六十八~七十二节点候选池补完
- v38 §1.3 补丁 ㊹ AAAI 2026 Subramanian arXiv:2602.23368v1 5 实例同步立标候选凝结 + flyP B 级精读 7 反方硬标签 + GitHub 链接最终核证路径 = RAG 范式转折立标 第 2 例 补完:7-28 增量 3 把 jay D1 LLM-Wiki 立标级候选补完 = RAG 范式转折立标 第 3 例
- v38 §2.2 跨主线整合「Agentic RAG 主线」:沿用基础上,新增 arXiv:2605.25480 LLM-Wiki + arXiv:2604.09666 RAGSearch + arXiv:2607.21324 GradRAG + arXiv:2606.00610 MemGraphRAG + arXiv:2409.10102 Trust-RAG Compass 五件 RAG 主题硬资产
- 反方 / 警示:
- ⚠️ LLM-Wiki GitHub 链接未确认 —— arXiv:2605.25480 论文 + GitHub 实现链接(stephen noon 协调棒 §4.1 待人工确认 #2)
- ⚠️ RAGSearch Benchmark 的 GraphRAG 缩小差距数字未量化 —— vs GraphRAG 2.0 head-to-head 待核
- ⚠️ GradRAG 12-15pp 偏好增益 vs LLM-judged 评估方法局限 —— Evaluator-Critic + Prompt Optimizer 反馈环 vs 独立第三方评测待核
- ⚠️ MemGraphRAG episodic memory 跨 session 一致性 vs 长上下文(>100K token)迁移性待核
- ⚠️ Trust-RAG Compass 六维框架 vs OWASP Agent Top 10 ASI 编号体系重叠关系待核 —— factuality/robustness/fairness/transparency/accountability/privacy 6 维 vs LLM01-LLM10 + ASI01-ASI10
- 建议归入节:v39 §1.2 主线 ④ Agentic RAG 第六十八~七十二节点候选池(LLM-Wiki + RAGSearch + GradRAG + MemGraphRAG + Trust-RAG Compass 5 件) + v39 §1.3 补丁 ㊹ RAG 范式转折立标 第 3 例 补完(LLM-Wiki 立标级候选) + v39 §2.2 跨主线整合「Agentic RAG 主线」补完 5 件 RAG 主题硬资产 + v39 §3.1 共识(候选新增 1 件:jay D1-D5 + CSDN RAG 1/4 + CSDN Agent 1/4 = 主线 ④ Agentic RAG 候选池「Agentic RAG H2 路线图 6 件 → v39 10 件」)+ v39 §6 rag.md / agent.md / longcontext.md 跨文档引用补全
增量 4 · 🟡 P1 重大 · arXiv:2607.21653 Molt A Scalable PyTorch-Native Training Framework for Agentic RL + arXiv:2607.22157 Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents + arXiv:2607.14277 Multi-Head Latent Control + arXiv:2607.22375 IDEAgent Agentic QD-Search = 主线 ① Coding Agent 候选池「训练侧工程化 Molt + 推理侧控制 Multi-Head Latent Control + 冻结权重持续学习 Learning on the Job + QD-Search IDEAgent 4 联学术 Harness 立标补全」
- 来源:
inbox/tom/2026-07-28-0840-agent-rag-longcontext-radar.md§高价值 1/2/3(Molt / Multi-Head Latent Control / Learning on the Job)inbox/tom/2026-07-28-1440-agent-rag-longcontext-radar.md沿用inbox/tom/2026-07-28-2040-agent-rag-longcontext-radar.mdLearning on the Job 沿用inbox/tom/2026-07-28-rag-e1prep-v47.md§增量 3(Learning on the Job)+ §增量 1(LAMAR 邻接)inbox/jay/2026-07-28-1105-jay-five-category-briefing.mdBackend B2 Skill Self-Play arXiv:2607.22529inbox/spark/2026-07-28-1337-agent-e1prep-v34.md§增量 2/3/4/5 4 件(Molt + Learning on the Job + IDEAgent + Multi-Head Latent Control)inbox/flyp/2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md沿用paper_cards/604(IDEAgent arXiv:2607.22375 / 7-28 02:10 新建卡 / 主分类 agent)+/607(Molt arXiv:2607.21653 / 7-28 12:30 / 主分类 agent / 副分类 engineering)+/608(Multi-Head Latent Control arXiv:2607.14277 / 7-28 / 主分类 agent)+/610(Learning on the Job arXiv:2607.22157 / 7-28 12:30 / 主分类 agent / 副分类 engineering)
- 要点(增量):
- 🟡 arXiv:2607.21653 Molt A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning · HF Daily 7-28 24▲ 新立标候选 · paper_cards 607 · 核心:Agentic RL 研究涉及"持续算法修改、新 estimators、新流水线阶段、新 rollout 方案"——主流框架(OpenForgeRL、ReOPD)每次变更都需要穿过 trainer + 分布式后端 + rollout 胶水代码,代价由研究者在每一次迭代中承担;Molt 用 PyTorch-native 设计,把"代码库足够紧凑清晰,研究者能在脑中整体把握,AI 编码助手也能完整阅读与理解"作为工程目标;Agent 本身在 Molt 中是一个标准 PyTorch 模块,而非外部黑盒
- 🟡 arXiv:2607.22157 Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents · paper_cards 610 · 核心:AI Agent 每次运行都在产生学习信号(outcome verdicts、事后纠正),但模型部署后即冻结,无法利用;解决方案:将外部记忆与自然语言规则蒸馏配对,每次 episode 将反馈转化为可检索的规则;$τ$-bench 银行场景:击败完整 RAG 基线(静态 RAG 检索全量知识库)
- 🟡 arXiv:2607.14277 Multi-Head Latent Control A Unified Interface for LLM Agent Decision Making · paper_cards 608 · 核心:现有 Agent 需要在推理时决定:继续推理 / 委托更强模型 / 请求更多信息 / 调用工具 / 弃权;现有方案依赖输入侧 prompt 路由或任务特定微调,跟随模型演化成本高;提出推理侧(inference-side)控制决策机制,将控制决定从 prompt 层剥离为独立接口
- 🟡 arXiv:2607.22375 IDEAgent Agentic Quality-Diversity Search for Research Idea Generation · paper_cards 604 · 核心:LLMs 在过去几年显著自动化了科学发现过程,但现有系统共享一个核心局限——它们仅针对 Quality 或 Diversity 中的一个目标独立地生成与优化 idea;本文主张研究 idea 生成应被视为两个目标的联合问题,并将其构建为 Quality-Diversity(QD)搜索;基于这一视角,提出 IDEAgent
- 🟡 arXiv:2607.22529 Skill Self-Play HF Daily 7-28 30▲ 新立标候选 · jay B2 · 核心:通过技能协同进化拓展 LLM 能力边界(cs.CL)
- 与活文档 v38 关系:
- v38 §1.2 主线 ① Coding Agent 第二十八~二十九节点候选池(AutoGen 2026-02 进入维护模式 + MAF 1.0 CSDN 12 强未入主流):7-28 增量 4 把 4 件学术 Harness 立标(Molt / Learning on the Job / Multi-Head Latent Control / IDEAgent)+ 1 件 Skill Self-Play = 主线 ① 第三十~三十四节点候选池补完 = 「训练侧工程化 Molt + 推理侧控制 Multi-Head Latent Control + 冻结权重持续学习 Learning on the Job + QD-Search IDEAgent + 技能协同进化 Skill Self-Play 5 联学术 Harness 立标补全」
- v38 §3.1 共识 #142 AutoGen 2026-02 进入维护模式 + LangGraph 33.9k stars vs CrewAI 52.8k stars + MAF 1.0 CSDN 12 强未入主流:7-28 增量 4 把 4 件学术 Harness 立标补完 = v37 §3.1 共识 #132 立标候选补完「Molt + Learning on the Job + Multi-Head Latent Control + IDEAgent + Skill Self-Play 5 件学术 Harness」
- v38 §3.2 争议 #133 MAF 1.0 统一 Semantic Kernel + AutoGen + Alice Labs 框架评分 S 级 vs LangGraph 1.0 主导地位 vs AutoGen 2026-02 进入维护模式 + CSDN 12 强 Benchmark MAF 1.0 未入主流:沿用基础上,新增争议候选(学术 Harness 立标强度 vs 商业 Harness 立标强度对照)
- 反方 / 警示:
- ⚠️ Molt 是否引入新方法论还是仅"工程美学"? —— 与 OpenForgeRL(harness-native proxy + K8s orchestrator)是同一立标层的不同切面(训练侧 vs 生产侧),但 Molt 是否引入新方法论还是仅工程美学,需要 Molt 与 OpenForgeRL head-to-head 实证(参 v33 7-30 ~ 8-02 验证时间表)
- ⚠️ Learning on the Job $τ$-bench 银行场景击败完整 RAG,但击败幅度未量化;$τ$-bench 银行场景之外跨领域迁移性待核;agent 工程化复用方向 vs "经验外部记忆" 路径学界边界仍开放
- ⚠️ Multi-Head Latent Control 与 v33 §1.32 横切 52(Multi-Agent 短视极化协调次优 POSG 形式化)对照 —— 推理侧控制决定 vs 多 Agent 协调的"推理侧 vs 协调侧"互补关系
- ⚠️ IDEAgent QD-Search vs v33 §2.1 综述与方法学骨架 14+23 + v31 AREX arXiv:2607.21461 BAAI bi-level 架构利用 discovery/verification 不对称 —— AREX = 自我改进侧;IDEAgent = idea diversity 侧 = QD-Search 范式与 RSI 范式互补
- ⚠️ Skill Self-Play arXiv:2607.22529 paper_card 尚未建卡 —— pipeline 漏斗节点 7-30 截止前必须补建卡
- 建议归入节:v39 §1.2 主线 ① Coding Agent 第三十~三十四节点候选池(Molt + Learning on the Job + Multi-Head Latent Control + IDEAgent + Skill Self-Play 5 联学术 Harness 立标补全) + v39 §3.1 共识(候选新增 1 件:5 联学术 Harness 立标补完 = v37 §3.1 共识 #132 立标候选补完) + v39 §3.2 争议(候选新增 1 件:学术 Harness 立标强度 vs 商业 Harness 立标强度对照) + v39 §6 agent.md / engineering.md 跨文档引用补全
增量 5 · 🟢 P2 旁证 · OWASP Agent Top 10 2026 ASI01-ASI10 + CSDN Agent 4 范式(Function Calling + MCP + CLI + Skills)+ HF 7 月安全事故 7-28 持续 + HF Cosmos-H-Dreams 外科手术机器人 + TLDR AI 7-27 头条三件(Claude Opus 5 + OpenAI 黑客事件内幕 + NVIDIA 开源权重联署信)= 主线 ⑤ Application-layer Reliability 候选池「AI 安全主线 v38 26 维 → v39 27 维合并成熟」+ frontier lab 7-28 第 7 日立标候选
- 来源:
inbox/jay/2026-07-28-owasp-agent-security-hf-incident.mdOWASP Agent Top 10 2026 ASI01-ASI10 + HF 7 月安全事故inbox/jay/2026-07-28-csdn-substack-rag-agent-multimodal-finetuning-jul2026.mdCSDN Agent 1/4inbox/stephen/2026-07-28-1005-news-hf-blog.md第 5 条(NVIDIA Cosmos-H-Dreams 外科手术机器人)inbox/stephen/2026-07-28-1005-news-tldr-ai.md第 1 条(Claude Opus 5 + OpenAI 黑客事件内幕 + NVIDIA 开源权重联署信)inbox/stephen/2026-07-28-1004-news-anthropic-news.md5 URL(我们对开放权重模型的立场 + 拓展 Cognizant 合作 + Claude Opus 5 + Project Pilot AI 操控无人机 + Claude Opus 5 系统卡)inbox/flyp/2026-07-28-risk-e1prep.md沿用
- 要点(增量):
- 🟡 OWASP Agent Top 10 2026 ASI01-ASI10:
- Prompt Injection(LLM01) = AI 等效 SQL Injection;机制:恶意 user input 污染 RAG 上下文 → 改变 agent 行为;缓解:SDP pipeline + Confidence scoring + human-in-the-loop 阈值
- Goal Hijack(ASI01) = 目标劫持;机制:Agent 收到初始目标后,被恶意输入重定向到意外目标;缓解:目标一致性验证 + Human approval + Structured output validation
- Agentic Threat Surface 独特性:"LLM generates words. Agent takes actions. Actions speak louder than words!" 传统 LLM 输出文本 vs Agent 输出 API 调用/文件写入/交易 — 攻击后果从误导信息升级为真实世界损害
- 高风险操作分类:HIGH RISK(external_write/financial_transaction/system_modification,需 human approval)+ MEDIUM RISK(tool_call/context_enrichment,需 structured output validation)+ LOW RISK(read_only,需 logging + monitoring)
- Agent Guardrails vs LLM Guardrails 演进:2024 = Input/Output 过滤器;2026 = Agent 行为约束系统(Tool call 授权 + rate limit 执行 + agent 实际动作验证)
- 🟡 CSDN Agent 4 范式:Function Calling(最基础的"给模型一组可用函数")+ MCP(Model Context Protocol,标准化工具/资源/提示的客户端-服务器协议)+ CLI(命令行工具,让 agent 直接调用 shell)+ Skills(agent-skills 工程化技能集合) = 工程层范式收敛
- 🟡 HF 7 月安全事故 7-28 持续 + HF Cosmos-H-Dreams 外科手术机器人(NVIDIA Cosmos 实时生成式仿真 + 外科手术机器人 = 物理 AI 在医疗机器人落地 + NVIDIA Cosmos 路线扩展)
- 🟡 TLDR AI 7-27 头条 3 件:① Claude Opus 5(7-24 evening 发布)② OpenAI 黑客事件内幕(沿用 v29 HF 7 月安全事件 + OpenAI × HF 联合披露 = 7-25~7-27 三日双披露窗口延伸)③ NVIDIA 开源权重联署信(承接 v29 Jim Fan 转 Jensen Huang "GOAT" + ByteByteGo 增量 3 NVIDIA 开源模型)
- 🟡 OWASP Agent Top 10 2026 ASI01-ASI10:
- 与活文档 v38 关系:
- v38 §1.2 主线 ⑤ Application-layer Reliability 第七十一~七十三维候选池:沿用基础上,新增第七十四维候选池「OWASP Agent Top 10 2026 ASI01-ASI10 + CSDN Agent 4 范式 = 评测标准硬框架新增」
- v38 §3.1 共识 #143 HF 7 月安全事件披露 + OpenAI × Hugging Face 联合披露模型评估期间安全事件:7-28 增量 5 把 OWASP Agent Top 10 ASI01-ASI10 + CSDN Agent 4 范式 + HF 7 月安全事故 7-28 持续 + HF Cosmos-H-Dreams 外科手术机器人 + TLDR AI 7-27 头条 3 件 = v39 §3.1 共识候选新增 1 件「AI 安全主线 v38 26 维 → v39 27 维合并成熟」
- v38 §3.3 反方 142 维度:沿用基础上,新增 1 维度(OWASP ASI 编号体系 vs Trust-RAG Compass 六维框架重叠关系待核)
- 反方 / 警示:
- ⚠️ OWASP ASI01-ASI10 评估基准成熟度 vs 工业级 agent 安全实测数据 —— OWASP 官方发布不久,工业级落地数据待核
- ⚠️ CSDN Agent 4 范式 vs Anthropic Managed Agents / OpenAI Presence / Google Gemini Managed Agents head-to-head 数字未量化 —— 三厂 effort 编排竞速能力 / 精度 / 异步任务 SLA 待核
- ⚠️ HF Cosmos-H-Dreams 外科手术机器人 vs v29 §2.114.10 NVIDIA 大本营内部升档关系 —— NVIDIA Cosmos 物理 AI 医疗机器人 vs Jensen Huang NVIDIA 4 万亿 + LeCun AMI Labs 路线分歧(stephen noon 协调棒 §4.1 待人工确认 #5)
- ⚠️ OpenAI 黑客事件内幕 vs HF 7 月安全事件 同 vs 异 —— HF 7 月安全事件披露 + OpenAI × HF 联合披露 = 7-25~7-27 三日双披露窗口延伸 · 7-28 TLDR AI「OpenAI 黑客事件内幕」是否为本事件延伸(stephen noon 协调棒 §4.1 待人工确认 #6)
- 建议归入节:v39 §1.2 主线 ⑤ Application-layer Reliability 第七十四维候选池「OWASP Agent Top 10 2026 ASI01-ASI10 + CSDN Agent 4 范式 = 评测标准硬框架新增」 + v39 §3.1 共识(候选新增 1 件:AI 安全主线 v38 26 维 → v39 27 维合并成熟) + v39 §3.3 反方(候选新增 1 维度:OWASP ASI 编号体系 vs Trust-RAG Compass 六维框架重叠关系待核) + v39 §6 risk.md / engineering.md 跨文档引用补全
增量 6 · 🟢 P2 旁证 · flyp 7-28 dual critical read: arXiv:2607.22043 Scaling Native Multimodal + arXiv:2607.18142 O-VAD = flyp v34 §2.39.x 立标候选新增 2 件 + 3 反方硬标签新增(#57/#58/#59)+ flyp 反思规则第 21 次适用
- 来源:
inbox/flyp/2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.mdB 级 · 立标级候选 3/5 · 2 件短审稿 + 3 反方硬标签新增 + 1 flyP 反思规则沿用inbox/flyp/2026-07-28-multimodal-e1prep.mdmultimodal v34 接力窗口第一棒inbox/stephen/2026-07-28-1027-ai-industry-e1prep.md§增量 4 ⭐⭐⭐⭐inbox/tom/2026-07-28-0840-agent-rag-longcontext-radar.md§高价值 3 O-VAD 沿用paper_cards/603 Scaling Native Multimodal+paper_cards/614 Three-Body Scattering等 7-28 新建卡
- 要点(增量):
- 🟡 arXiv:2607.22043 Scaling Native Multimodal Pre-Training From Scratch —— Haoyuan Wu et al. · CUHK + Tencent LLM Department · 2026-07-24 · 主分类 multimodal · 首次独立解耦 language vs multimodal objective 的 scaling law;固定 compute budget 下拟合
L ∝ C^(-α)compute-optimal law;发现 language 和 multimodal objective 的指数不同;提出 language-multimodal Pareto frontier:沿 Pareto 曲线移动 → 任一 compute budget 可指定"最优 model size + 文本 token 数 + 多模态 token 数"的部署级训练配置 = NMM scaling law 立基础 + Shukor 2025 / Emu3.5 流派(主线 1「统一多模态生成」立基础) - 🟡 arXiv:2607.18142 O-VAD Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning —— ECCV 2026 accepted · 工业 VAD 主流会议接收 · 免训练的 agentic 框架 · 强调物体状态演化追踪而非通用 VLM 开放域异常检测 = 主线 7「垂直域多模态」邻接工业质检
- 🟡 flyp 7-28 dual critical read 3 反方硬标签新增:
- 反方 #57:"NMM scaling law 已被 Shukor 2025 与 Beyond-LLMs 同时建立,本工作的边际贡献是 Tencent 自己的实证 + Pareto frontier 命名,学术增量是否足以开 v34 立标候选需谨慎"
- 反方 #58:"compute-optimal allocation 是否对 inference-efficient / vision-token 压缩技术鲁棒?没做 ablation 之前不应直接当作 v34 立标候选"
- 反方 #59:"late vs early fusion 没独立对比 → 不能直接说 'native 路线优于 late-fusion'"
- 🟡 flyp 反思规则第 21 次适用(沿用 7-13 起连续规则)
- 🟡 arXiv:2607.22043 Scaling Native Multimodal Pre-Training From Scratch —— Haoyuan Wu et al. · CUHK + Tencent LLM Department · 2026-07-24 · 主分类 multimodal · 首次独立解耦 language vs multimodal objective 的 scaling law;固定 compute budget 下拟合
- 与活文档 v38 关系:
- v38 §6 multimodal.md 跨文档引用补全:沿用基础上,新增 multimodal.md v34 §2.39.x 立标候选 4 件中 2 件短审稿(scaling-native-multimodal 立基础 + O-VAD 工业质检)= flyp multimodal-e1prep v34 接力窗口第一棒
- v38 §3.3 反方 142 维度:沿用基础上,新增 3 维度(反方 #57 NMM scaling law 边际贡献谨慎 + #58 compute-optimal allocation 鲁棒性待核 + #59 late vs early fusion 未独立对比)
- v38 §5.1 已发生:沿用基础上,新增 flyp v34 §3.3 反方 #55 评级升级时机风险持续激活 + flyp 反思规则第 21 次适用
- 反方 / 警示:
- ⚠️ Scaling Native Multimodal compute-optimal ablation(7-30 截止) + late vs early fusion 对照(8-02 截止) + inference-efficient 鲁棒性(8-15 截止) —— 三个后续验证截止日
- ⚠️ O-VAD ECCV 2026 accepted vs 免训练 agentic 框架的工业质检实测数据 —— 工业落地实测数据待核
- 建议归入节:v39 §6 multimodal.md v34 §2.39.x 立标候选 4 件中 2 件短审稿(scaling-native-multimodal + O-VAD) + v39 §3.3 反方(候选新增 3 维度:反方 #57/#58/#59) + v39 §5.1 已发生(flyp v34 §3.3 反方 #55 评级升级时机风险持续激活 + flyp 反思规则第 21 次适用)
增量 7 · 🟢 P2 旁证 · flyp 7-28 15:50 OPD/CFG critical read(arXiv:2607.24731 Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation)+ work-queue.md 5 件 v38 候选池 arXiv(Rethinking CFG + Retrieval-Augmented LLMs as Components + Robust Interpretation Historical Documents + DeCoRAG + corrective agentic hybrid RAG)= 主线 ④ Agentic RAG 候选池「评测方法学反思 v38 13-14 → v39 14-15 件套补完 第 2 例」+ flyp v34 §2.39.x 立标候选沿用
- 来源:
inbox/flyp/2026-07-28-1550-opd-cfg-multiturn-longhorizon-critical-read.md(待读)inbox/flyp/2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md沿用/shared/research-kb/organized/queue/work-queue.md2026-07-28 20:00 自动检测 · §1 高价值待深度解读 Top 15/共 5:- arXiv:2607.24731 · Rethinking Classifier-Free Guidance in On-Policy Diffusion D(illation)
- arXiv:2607.24352 · Retrieval-Augmented Large Language Models as Components of C(omponents of ...)
- arXiv:2607.24475 · Robust Interpretation of Historical Documents in Knowledge G(raphs)
- arXiv:2607.24554 · DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping fo(r ...)
- arXiv:2607.24663 · A corrective agentic hybrid RAG and an operations-grounded e(valuation ...)
- 要点(增量):
- 🟡 work-queue.md 2026-07-28 20:00 自动检测 5 件高价值待深度解读 Top 15/共 5:
- arXiv:2607.24731 · Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
- arXiv:2607.24352 · Retrieval-Augmented LLMs as Components of ...
- arXiv:2607.24475 · Robust Interpretation of Historical Documents in Knowledge Graphs
- arXiv:2607.24554 · DeCoRAG · Cognitive Decoupling and Semantic-Aware Cropping for ...
- arXiv:2607.24663 · A corrective agentic hybrid RAG and an operations-grounded evaluation ...
- 🟡 flyp 7-28 15:50 OPD/CFG critical read(待读)
- 🟡 work-queue.md 2026-07-28 20:00 自动检测 5 件高价值待深度解读 Top 15/共 5:
- 与活文档 v38 关系:
- v38 §1.2 主线 ④ Agentic RAG 第六十七节点候选池:沿用基础上,新增 5 件 work-queue.md 高价值待深度解读 = 「评测方法学反思 v38 13-14 → v39 14-15 件套补完 第 2 例」+ 「Agentic RAG H2 路线图 6 件 → v39 10 件 → 15 件」
- v38 §3.1 共识 #133 ~ #143:沿用基础上,新增候选 5 件 work-queue.md 高价值待深度解读
- v38 §4.1 拐点 #150-#157:沿用基础上,新增候选 5 件 work-queue.md 高价值待深度解读(50 项 → 55 项)
- 反方 / 警示:
- ⚠️ arXiv:2607.24731 Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation vs v34 §2.39.x 立标候选 = 多模态主线 1 邻接
- ⚠️ arXiv:2607.24352 Retrieval-Augmented LLMs as Components of ... vs v34 §2.39.x 立标候选 = RAG 主线邻接
- ⚠️ arXiv:2607.24554 DeCoRAG Cognitive Decoupling and Semantic-Aware Cropping vs v34 §2.39.x 立标候选 = RAG 主线邻接
- ⚠️ arXiv:2607.24663 corrective agentic hybrid RAG and an operations-grounded evaluation vs v34 §2.39.x 立标候选 = RAG 主线邻接
- 建议归入节:v39 §1.2 主线 ④ Agentic RAG(候选新增 5 件 work-queue.md 高价值待深度解读) + v39 §3.1 共识(候选新增 5 件) + v39 §4.1 拐点(候选新增 5 件 · 50 → 55)
2. 值得警惕的矛盾或待核实说法
矛盾 1 · HF Daily 7-28 5 件 net-new vs 7-27 8 件 net-new 缩量结构
- 7-27 8 件 net-new:AREX 139 + SLAI T-Rex + K12-KGraph + 视觉对比自蒸馏 + 超越相关性中心检索 + SANA-Video 2.0 +6 + NVIDIA-labs OO Agents + LLM 在用户意图中迷失 + Tencent WorkBuddy Bench + 主动观察者的考核
- 7-28 5 件 net-new:ReferTrack + DataPrep-Bench + Show Don't Tell + Skill Self-Play + Molt
- 待核实:7-28 5 件 net-new vs 7-27 8 件 net-new 是否持续缩量;5 件 net-new 立标级候选强度是否达到 v34 §2.39.x 主线升档标准;累计跨日票数增长曲线是否触顶
矛盾 2 · Self-Supervised Structured Dynamics 18▲ 三日累计跨日 60▲ 持续跌出 15 名外 vs 评级升级时机风险
- 7-26 单日 14→28▲ 翻倍最大升幅(v33 §2.39.91 P3 → P2 旁证评级升级决策触发)
- 7-27 次日 28→18▲ 单日 -10 跌出前 15 名边缘
- 7-28 三日 18→18▲ 单日 +0 持续低位
- 待核实:SDM 三日累计 60▲ 是否触底回升;7-29 ~ 7-30 持续复核窗口;评级升级 P2 旁证 vs 反向降级决策
矛盾 3 · Kimi K3 Coding/Agentic SOTA 但未独立验证 vs frontier lab 路线分水岭候选
- 官方声称 Coding/Agentic SOTA,但截至 2026-07-28 第三方核实尚未完成
- 作为 frontier lab 路线分水岭候选需要:(a) 与 Claude Opus 5 + Sonnet 5 + GLM-5.2 + Kimi K2.7-Code 等同期商业模型 head-to-head SWE-bench Verified + Terminal-Bench 2.1 量化对照;(b) 模型结构 / 训练数据 / 推理开销技术细节公开核验
矛盾 4 · LLM-Wiki GitHub 链接 + HippoRAG 2/LightRAG/GraphRAG 作为对照基线已确认 vs arXiv:2605.25480 GitHub 实现链接未确认
- arXiv:2605.25480 论文 + GitHub 实现链接(stephen noon 协调棒 §4.1 待人工确认 #2)
- 7-29 ~ 7-30 截止前核证
矛盾 5 · OWASP Agent Top 10 ASI01-ASI10 评估基准成熟度 vs 工业级 agent 安全实测数据
- OWASP 官方发布不久,工业级落地数据待核
- OWASP ASI 编号体系 vs Trust-RAG Compass 六维框架重叠关系待核
矛盾 6 · flyp v34 §3.3 反方新增 3 条(#57/#58/#59) vs Scaling Native Multimodal 立标级候选升档
- 反方 #57 NMM scaling law 已被 Shukor 2025 与 Beyond-LLMs 同时建立,本工作的边际贡献是 Tencent 自己的实证 + Pareto frontier 命名
- 反方 #58 compute-optimal allocation 是否对 inference-efficient / vision-token 压缩技术鲁棒
- 反方 #59 late vs early fusion 没独立对比
- 三个后续验证截止日:compute-optimal ablation(7-30) + late vs early fusion 对照(8-02) + inference-efficient 鲁棒性(8-15)
矛盾 7 · AAAI 2026 Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止临近
- 今天 7-28 = 7-29 验证前夜:若无主动核验动作,7-29 到期验证可能落空
- 4 验证截止日:2026-07-29(v1 PDF 全文细节 + shell 工具列表)+ 2026-07-30(AAAI 2026 main vs industry track 区分)+ 2026-07-31(不同 LLM 迁移性 + 混合方案对照)+ 2026-08-15(长上下文/多模态跨任务迁移性)
矛盾 8 · CSDN Agent 4 范式 vs Anthropic Managed Agents / OpenAI Presence / Google Gemini Managed Agents head-to-head 数字未量化
- 三厂 effort 编排竞速能力 / 精度 / 异步任务 SLA 待核
- v39 §3.3 反方 142 维度候选新增
矛盾 9 · Kimi K3 vLLM/SGLang 官方支持时间线待核 vs MXFP4 量化精度损失实测待核
- Kimi K3 vLLM/SGLang 官方支持时间表待核(stephen noon 协调棒 §4.1 待人工确认 #1)
- DeepSeek-V3 当时的官方支持时间表作为参照
- MXFP4 量化精度损失在 H100/H200/B200 GPU 上实测待核
矛盾 10 · HF Cosmos-H-Dreams 外科手术机器人 vs v29 §2.114.10 NVIDIA 大本营内部升档关系待核
- NVIDIA Cosmos 物理 AI 医疗机器人 vs Jensen Huang NVIDIA 4 万亿 + LeCun AMI Labs 路线分歧(stephen noon 协调棒 §4.1 待人工确认 #5)
- 同 vs 异 待核
矛盾 11 · HF 7 月安全事件 vs OpenAI 黑客事件 同 vs 异 待核
- HF 7 月安全事件披露 + OpenAI × HF 联合披露 = 7-25~7-27 三日双披露窗口延伸 · 7-28 TLDR AI「OpenAI 黑客事件内幕」是否为本事件延伸(stephen noon 协调棒 §4.1 待人工确认 #6)
3. 可引用 arXiv 号列表
新增立标级候选(HF Daily 7-28 net-new · 5 件)
- arXiv:2607.20061(ReferTrack 先指代后跟踪的具身视觉跟踪)
- arXiv:2607.20465(DataPrep-Bench LLM 作为训练数据准备者的基准 · paper_cards 617)
- arXiv:2607.21072(Show Don't Tell 在生成像素而非 LLM 文本中评估空间认知)
- arXiv:2607.22529(Skill Self-Play 通过技能协同进化拓展 LLM 能力边界 · paper_cards 未建)
- arXiv:2607.21653(Molt 面向 Agent RL 的可扩展 PyTorch 原生训练框架 · paper_cards 607)
主线 ① Coding Agent 候选(5 件学术 Harness 立标 · 7-28 new)
- arXiv:2607.21653(Molt · paper_cards 607)
- arXiv:2607.22157(Learning on the Job · paper_cards 610)
- arXiv:2607.14277(Multi-Head Latent Control · paper_cards 608)
- arXiv:2607.22375(IDEAgent Agentic QD-Search · paper_cards 604)
- arXiv:2607.22529(Skill Self-Play · paper_cards 未建)
主线 ② Personal Assistant Agent 候选(2 件)
- arXiv:2605.25480(LLM-Wiki Agent-Native Retrieval 范式 · jay D1 立标级 · GitHub 链接未确认)
- arXiv:2607.22529(Skill Self-Play · jay B2)
主线 ④ Agentic RAG 候选(5 件 jay engineering-v38 + 5 件 work-queue.md = 10 件)
- arXiv:2605.25480(LLM-Wiki Agent-Native Retrieval 范式 · jay D1 立标级)
- arXiv:2604.09666(RAGSearch Benchmark agentic search 缩小 GraphRAG 差距 · jay D2)
- arXiv:2607.21324(GradRAG 多 Agent RAG 跨组件 Prompt 适应 12-15pp 偏好增益 · jay D3)
- arXiv:2606.00610(MemGraphRAG 记忆多 Agent RAG · jay D4)
- arXiv:2409.10102(Trust-RAG Compass 六维框架 · jay D5)
- arXiv:2607.24731(Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation · work-queue.md 高价值)
- arXiv:2607.24352(Retrieval-Augmented LLMs as Components of ... · work-queue.md 高价值)
- arXiv:2607.24475(Robust Interpretation of Historical Documents in Knowledge Graphs · work-queue.md 高价值)
- arXiv:2607.24554(DeCoRAG Cognitive Decoupling and Semantic-Aware Cropping · work-queue.md 高价值)
- arXiv:2607.24663(A corrective agentic hybrid RAG and an operations-grounded evaluation · work-queue.md 高价值)
主线 ⑤ Application-layer Reliability 候选(沿用 v38 18 件 + 5 件 HF Daily 7-28 net-new + 2 件 flyp dual critical read)
- arXiv:2607.21461(AREX 142▲ 持续登顶 · 沿用)
- arXiv:2607.21553(SANA-Video 2.0 34▲ +7▲ · flyp v33 §2.39.99 · 沿用)
- arXiv:2607.21576(Self-Supervised Structured Dynamics 18▲ ⚠️ 跌出风险 · 沿用 + flyp v34 §3.3 反方 #55)
- arXiv:2607.20061(ReferTrack 50▲ · 新立标)
- arXiv:2607.20465(DataPrep-Bench 40▲ · 新立标)
- arXiv:2607.21072(Show Don't Tell 35▲ · 新立)
- arXiv:2607.22529(Skill Self-Play 30▲ · 新立标)
- arXiv:2607.21653(Molt 24▲ · 新立标)
- arXiv:2607.22043(Scaling Native Multimodal Pre-Training From Scratch · flyp dual critical read · 立标级候选 3/5)
- arXiv:2607.18142(O-VAD Industrial Video Anomaly Detection · flyp dual critical read · ECCV 2026 accepted)
v38 已固化 arXiv ID 候选池(沿用 · 18 件)
- arXiv:2605.20173(SDB Stochastic-Deterministic Boundary · v38 已收)
- arXiv:2605.08717(PROBE Failure-Anchored Recovery Framework for SWE Agents · v38 已收)
- arXiv:2607.18141(HyMCache CXL-Hybrid Memory KV Cache · v38 已收)
- arXiv:2602.10133(AgentTrace AAAI 2026 Workshop LaMAS · v38 已收)
- arXiv:2607.12340(Skills That Don't Exist · v38 已收)
- arXiv:2603.10726v2(PrefixWall KV Cache Side-Channel 沿用级 · v38 已收)
- arXiv:2602.23368v1(AAAI 2026 Subramanian Keyword Search · v38 已收 ID 完整披露)
沿用级未变 arXiv ID(7-27 → 7-28 24h 无新数据)
- arXiv:2607.20709(NVIDIA-labs OO Agents 28▲)
- arXiv:2607.20911(Tencent WorkBuddy Bench 24▲)
- arXiv:2607.16165(主动观察者的考核 25▲)
- arXiv:2607.20734(LLM 在用户意图中迷失 22▲)
- arXiv:2607.12746(颜色透传 19▲)
- arXiv:2607.22042(LAMAR 语言感知多语言对齐 Reranker · paper_cards 605 · tom rag-e1prep §1 立标)
paper_cards 7-28 新建卡 18 张抽查
- 604-2607.22375(IDEAgent Agentic QD-Search / 主分类 agent)
- 605-2607.22042(LAMAR / 主分类 rag)
- 607-2607.21653(Molt / 主分类 agent / 副分类 engineering)
- 608-2607.14277(Multi-Head Latent Control / 主分类 agent)
- 610-2607.22157(Learning on the Job / 主分类 agent / 副分类 engineering)
- 611-2607.22345(Teachy Mini / 主分类 evaluation)
- 617-2607.20465(DataPrep-Bench / 主分类 engineering / 副分类 evaluation)
4. 检查过的来源清单
jay(7-28 · 23 份)
- 2026-07-28-0910-news-x-vip-radar
- 2026-07-28-1000-rss-bytebytego
- 2026-07-28-1000-rss-raschka
- 2026-07-28-1001-rss-nathan-benaich
- 2026-07-28-1001-rss-simon-willison
- 2026-07-28-1002-rss-cool-papers
- 2026-07-28-1002-rss-cool-papers-ir
- 2026-07-28-1002-rss-lilian-weng
- 2026-07-28-1003-rss-import-ai
- 2026-07-28-1003-rss-msr-blog
- 2026-07-28-1006-rss-yt-karpathy
- 2026-07-28-1007-rss-yt-fireship
- 2026-07-28-1050-jay-engineering-filter
- 2026-07-28-1105-jay-five-category-briefing
- 2026-07-28-1140-news-x-tech-radar
- 2026-07-28-1505-jay-five-category-afternoon-briefing
- 2026-07-28-engineering-e1prep-v38
- 2026-07-28-csdn-hf-transformers-v5-agent-rag-high-value
- 2026-07-28-csdn-substack-rag-agent-multimodal-finetuning
- 2026-07-28-vllm-pagedattention2
- 2026-07-28-vllm-sglang-production-commands-csdn
- 2026-07-28-vllm-trt-llm-deploy-csdn
- 2026-07-28-uv-python-toolchain
- 2026-07-28-kvcache-llm-wiki-rag-systems
- 2026-07-28-hf-transformers-v5-source-analysis
- 2026-07-28-owasp-agent-security-hf-incident
- 2026-07-28-kimi-k3-inference-systems-substack
- 2026-07-28-graphrag-trending
tom(7-28 · 5 份)
- 2026-07-28-0840-agent-rag-longcontext-radar
- 2026-07-28-0900-hf-daily-2026-07-28
- 2026-07-28-1006-rss-yt-yannic-kilcher
- 2026-07-28-1007-rss-yt-lex-fridman
- 2026-07-28-rag-e1prep-v47
- 2026-07-28-evaluation-e1prep
- 2026-07-28T1440-agent-rag-longcontext-radar
- 2026-07-28T2040-agent-rag-longcontext-radar
- 2026-07-28_rag-lite
flyp(7-28 · 6 份)
- 2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad
- 2026-07-28-1000-rss-cameron-wolfe
- 2026-07-28-1003-rss-interconnects
- 2026-07-28-1006-rss-yt-ai-explained
- 2026-07-28-1550-opd-cfg-multiturn-longhorizon-critical-read
- 2026-07-28-multimodal-e1prep
- 2026-07-28-risk-e1prep
spark(7-28 · 4 份)
- 2026-07-28-1002-rss-gradient-flow
- 2026-07-28-1003-rss-chip-huyen
- 2026-07-28-1007-rss-yt-3blue1brown
- 2026-07-28-1337-agent-e1prep
- 2026-07-28-1837-llm-infra-e1prep
stephen(7-28 · 12 份)
- 2026-07-28-0910-news-x-vip-radar
- 2026-07-28-1004-news-anthropic-news
- 2026-07-28-1004-news-openai-news
- 2026-07-28-1005-news-deepmind-news
- 2026-07-28-1005-news-google-ai
- 2026-07-28-1005-news-hf-blog
- 2026-07-28-1005-news-tldr-ai
- 2026-07-28-1006-news-bens-bites
- 2026-07-28-1007-news-yt-anthropic
- 2026-07-28-1007-news-yt-deepmind
- 2026-07-28-1007-news-yt-openai
- 2026-07-28-1027-ai-industry-e1prep-v30
- 2026-07-28-1245-stephen-coordination-check-noon
paper_cards(7-28 · 13 张新卡抽查)
- 602-2607.16859(Dataset Distillation by Influence Matching / 主分类 engineering)
- 603-2607.22043(Scaling Native Multimodal / 主分类 multimodal / flyp dual critical read)
- 604-2607.22375(IDEAgent / 主分类 agent)
- 605-2607.22042(LAMAR / 主分类 rag / tom rag-e1prep §1 立标)
- 606-2607-21848(Closing the Loop / 主分类 multimodal)
- 607-2607.21653(Molt / 主分类 agent / engineering 副分类)
- 608-2607.14277(Multi-Head Latent Control / 主分类 agent)
- 609-2607.12756(VisCo / 主分类 multimodal / vLLM KVpop/LCA 邻接)
- 610-2607.22157(Learning on the Job / 主分类 agent / engineering 副分类)
- 611-2607.22345(Teachy Mini / 主分类 evaluation)
- 612-2607.22091(Spectral Prior / 主分类 multimodal)
- 613-2607.19636(Multimodal Speaker Verification / 主分类 multimodal)
- 614-2607.18198(Three-Body Scattering / 主分类 multimodal)
work-queue.md(2026-07-28 20:00 自动检测)
- §1 高价值待深度解读 Top 15/共 5:
- arXiv:2607.24731 · Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
- arXiv:2607.24352 · Retrieval-Augmented LLMs as Components of ...
- arXiv:2607.24475 · Robust Interpretation of Historical Documents in Knowledge Graphs
- arXiv:2607.24554 · DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for ...
- arXiv:2607.24663 · A corrective agentic hybrid RAG and an operations-grounded evaluation ...
- ⚠️ evaluation 主题活文档 3 天未更新持续提示 + 待建卡 0 + 待富化 64
5. 归入活文档 knowledge/llm-application.md 的建议操作
| 增量 | 目标节 | 操作类型 |
|---|---|---|
| 增量 1(HF Daily 7-28 5 件 net-new + AREX 142 + SANA-Video 2.0 +7 + SDM 18 跌出) | §1.1 fresh signals 第 5 段 + §1.2 主线 ⑤ 第七十四~七十八维 + §3.1 共识(候选新增 1 件)+ §3.3 反方(候选新增 1 维度)+ §5.1 已发生(候选新增 3 件 #136-#138) | 新增 5 件候选 + 1 维度反方 + 3 件已发生 |
| 增量 2(Kimi K3 1.56TB HF + LLM-Wiki) | §1.2 主线 ② 第五十九~六十节点 + §1.3 补丁 ㊸ frontier lab 7-栖立标密度第 2 例 + §3.1 共识(候选新增 1 件) | 新增 2 节点候选 + frontier lab 立标密度第 8 栖候选补完 |
| 增量 3(jay D1-D5 + CSDN RAG 1/4 + CSDN Agent 1/4) | §1.2 主线 ④ 第六十八~七十二节点 + §1.3 补丁 ㊹ RAG 范式转折立标 第 3 例 + §2.2 跨主线整合「Agentic RAG 主线」 + §3.1 共识(候选新增 1 件) | 新增 5 节点候选 + RAG 范式转折立标第 3 例补完 |
| 增量 4(Molt + Learning on the Job + Multi-Head Latent Control + IDEAgent + Skill Self-Play 5 件) | §1.2 主线 ① 第三十~三十四节点 + §3.1 共识(候选新增 1 件:5 联学术 Harness 立标补完)+ §3.2 争议(候选新增 1 件:学术 Harness 立标强度 vs 商业 Harness 立标强度对照) | 新增 5 节点候选 + 1 件共识 + 1 件争议 |
| 增量 5(OWASP Agent Top 10 + CSDN Agent 4 范式 + HF 7 月安全 + HF Cosmos-H-Dreams + TLDR AI 7-27 头条) | §1.2 主线 ⑤ 第七十四维 + §3.1 共识(候选新增 1 件:AI 安全主线 v38 26 维 → v39 27 维合并成熟)+ §3.3 反方(候选新增 1 维度) | 新增 1 维候选 + 1 件共识 + 1 维度反方 |
| 增量 6(flyp dual critical read + 3 反方硬标签新增) | §6 multimodal.md v34 §2.39.x 立标候选 4 件中 2 件短审稿 + §3.3 反方(候选新增 3 维度:反方 #57/#58/#59)+ §5.1 已发生(flyp v34 §3.3 反方 #55 评级升级时机风险持续激活 + flyp 反思规则第 21 次适用) | 新增 2 件短审稿 + 3 维度反方 |
| 增量 7(work-queue.md 5 件高价值待深度解读) | §1.2 主线 ④(候选新增 5 件)+ §3.1 共识(候选新增 5 件)+ §4.1 拐点(候选新增 5 件 · 50 → 55) | 新增 5 件候选 |
6. v39 候选池预估
v38 候选池 25 件(v38 §0.5 已罗列 ID)基础上,7-28 24h 窗口新增: - 5 件 HF Daily 7-28 net-new 立标级候选 - 1 件 Kimi K3 1.56TB HF 主权开源 2.0 立标级(主线 ② 第 5 栖候选) - 1 件 LLM-Wiki arXiv:2605.25480 Agent-Native Retrieval 范式转折候选(主线 ② 第 6 栖候选 + 主线 ④ 第 3 例补完) - 5 件 jay engineering-v38 RAG 主题硬资产(主线 ④ 第 6 例 → 第 10 例) - 5 件学术 Harness 立标(Molt + Learning on the Job + Multi-Head Latent Control + IDEAgent + Skill Self-Play · 主线 ① 第 5 件 → 第 9 件) - 2 件 flyp dual critical read 立标级候选(multimodal.md v34 §2.39.x) - 5 件 work-queue.md 高价值待深度解读(主线 ④ 第 11 例 → 第 15 例) - 1 维度 OWASP Agent Top 10 ASI01-ASI10(主线 ⑤ 第 74 维) - 4 维度 flyp 7-28 dual critical read 反方硬标签(主线 ⑤ §3.3 #136-#142 沿用基础上 + #142-#146) - 1 维度 SDM 跌出风险(flyp v34 §3.3 反方 #55 第 3 日激活)
预期 v39 候选池 30-32 件(v38 25 件 + v39 新增 5-7 件,增长率 20-28%)。
7. 边界 / 待消解 / 后续验证动作
7.1 边界
- 不重写活文档:本棒仅列 v38 候选池 25 件之外的新增量条目 + 7-29 ~ 7-31 跨实例核验窗口激活状态,供今晚活文档 v39 接力决策参考
- 不立标哲学明示:沿用 v33/v34/v35/v36/v37/v38 不立标哲学,候选池等 7-29 ~ 8-02 跨实例核验后再做 v39 立标决定
- 不写入他人目录:仅写
/shared/research-kb/inbox/stephen/2026-07-28-llm-application-e1prep.md1 个文件 - 不 git:本棒不执行 git commit / git push / gh pr 等 GitHub 写入操作
- 不输出密钥:本棒不输出任何密钥 / cookie / token / 验证码 / 证券账户 / 私密账号信息
7.2 待消解(next 棒接力 · 7-29 ~ 8-02 跨实例核验窗口)
- AAAI 2026 Subramanian arXiv:2602.23368v1 v1 PDF 全文细节 + shell 工具列表(7-29 截止)
- AAAI 2026 main vs industry track 区分(7-30 截止)
- 不同 LLM(Claude Opus 5 / Sonnet 5 / GPT-5.6 Sol / Gemini 3.6 Flash)迁移性 + 混合方案对照(7-31 截止)
- AAAI Subramanian 长上下文/多模态跨任务迁移性(8-15 截止)
- Scaling Native Multimodal compute-optimal ablation(7-30 截止)
- Scaling Native Multimodal late vs early fusion 对照(8-02 截止)
- Scaling Native Multimodal inference-efficient 鲁棒性(8-15 截止)
- LLM-Wiki arXiv:2605.25480 GitHub 实现链接核证(7-29 ~ 7-30)
- Kimi K3 vLLM/SGLang 官方支持时间表核证(7-29 ~ 7-30)
- MXFP4 量化在 NVIDIA H100/H200/B200 GPU 上精度损失实测(7-29 ~ 7-30)
- KDA / AttnRes / Stable LatentMoE 三项架构与 DeepSeek-V4 MoE 实现差异对比(7-29 ~ 7-30)
- HF Cosmos-H-Dreams 外科手术机器人 vs v29 §2.114.10 NVIDIA 大本营内部升档关系(7-29 ~ 7-30)
- HF 7 月安全事件 vs OpenAI 黑客事件 同 vs 异 核证(7-29)
- HF Daily 7-28 5 件 net-new vs 7-27 8 件 net-new 缩量结构持续复核(7-29 ~ 7-30)
- SDM 18▲ 三日累计跨日 60▲ 触底回升 or 反向降级决策窗口(7-29 ~ 7-30)
- AREX 142▲ 单日 +3 持续登顶强度 vs 主线 K 第 7 日「持续稳定 v4」诊断(7-29)
- SANA-Video 2.0 +7▲ 立标级证据继续充分加固 vs flyp v33 §2.39.99 立标(7-29)
- Molt 与 OpenForgeRL head-to-head 实证(参 v33 7-30 ~ 8-02 验证时间表)
- Learning on the Job $τ$-bench 银行场景 vs 通用 RAG 击败幅度量化 + 多领域迁移性(7-29 ~ 7-30)
- OWASP Agent Top 10 ASI01-ASI10 评估基准成熟度 vs 工业级 agent 安全实测数据(7-29 ~ 8-02)
- OWASP ASI 编号体系 vs Trust-RAG Compass 六维框架重叠关系(7-29 ~ 7-30)
- CSDN Agent 4 范式 vs Anthropic Managed Agents / OpenAI Presence / Google Gemini Managed Agents head-to-head 数字(7-29 ~ 8-02)
- GradRAG 12-15pp 偏好增益 vs LLM-judged 评估方法局限 + 独立第三方评测(7-29 ~ 7-30)
- MemGraphRAG episodic memory 跨 session 一致性 vs 长上下文(>100K token)迁移性(7-29 ~ 7-30)
- arXiv:2607.22529 Skill Self-Play paper_card 7-30 截止前必须补建卡
8. 本棒执行摘要
| 项目 | 内容 |
|---|---|
| 本棒主题 | 7-28 evening llm-application E1 预消化 · 承接 v38(7-28 04:00 收官)· 为今晚 v39 接力预习备料 |
| 本棒扫描 | stephen 13 份 + jay 28 份 + tom 9 份 + flyp 7 份 + spark 5 份 + paper_cards 13 张 + work-queue.md = 75 项 |
| 本棒定性 | 5 实例 E1/radar/briefing/csdn/critical-read 全员在岗 + 1 件统一主线立标候选(Kimi K3 主权开源 2.0 立标级 · 6 实例同步承接)+ jay engineering-v38 主轴 8 主题分化饱和 + jay 5 件 RAG 主题硬资产(D1-D5)+ jay 3 件 CSDN 主稿(10+4+2 件 CSDN 高价值)+ tom rag-v47 5 件增量 + HF Daily 7-28 票榜 5 件 net-new 续立/翻倍 + flyp dual critical read v34 §2.39.x 立标候选 4 件中 2 件短审稿 + flyp v34 §3.3 反方 #55 评级升级时机风险持续激活 + 3 反方硬标签新增 + work-queue.md 5 件高价值待深度解读 + llm-infra 主题活文档已 7-27 05:37 收官 = v39 活文档准备棒 |
| 本棒新立标 | 5 件 HF Daily 7-28 net-new 立标级候选 + 1 件 Kimi K3 主权开源 2.0 立标级 + 1 件 LLM-Wiki 立标级 + 5 件 jay engineering-v38 RAG 主题硬资产 + 5 件学术 Harness 立标 + 2 件 flyp dual critical read 立标级候选 + 5 件 work-queue.md 高价值待深度解读 = 24 件候选(主线 ① / ② / ④ / ⑤ 跨主线分布) |
| 本棒冲突/缺口 | 11 件矛盾 + 6 件持续缺口待人工确认(Kimi K3 vLLM/SGLang 官方支持时间线 + LLM-Wiki GitHub 链接 + Scaling Native Multimodal compute-optimal ablation 数据 + Nathan Benaich 欧洲 AI 主权具体路径 + Cosmos-H-Dreams 外科手术机器人 vs NVIDIA 大本营内部升档关系 + HF 7 月安全事件 vs OpenAI 黑客事件 同 vs 异)+ spark E1 节奏连续 3 日回落第 3 棒 + evaluation 主题活文档 3 天未更新 + Kimi K3 沿用一致性 1 件 + HF Daily SDM 18▲ 跌出风险 1 件 + AAAI Subramanian 7 反方首批 7-29 验证截止临近 |
| 本棒执行写入 | /shared/research-kb/inbox/stephen/2026-07-28-llm-application-e1prep.md(本棒自身) |
| 本棒 GitHub 写入 | ❌ 不执行 · 7-28 evening 22:45 协调棒收官时由单独同步任务处理 v39 收官 |
| 下一步 | 7-28 evening 协调棒收官 → v39 活文档同步任务串行处理 → 7-29 noon 协调棒接力 |
Stephen · 2026-07-28 21:10 CST · E1 预消化简报 · 5 件主线增量 + 2 件旁证 = 7 件净增量 · 涉及 arXiv 号 17 个 + v38 沿用 7 个 · v38 已固化 25 件候选池 + v39 预期新增 5-7 件 = 30-32 件候选池