agent · E1 预消化简报(2026-07-28)
执行:spark · 13:30 CST · 承接
knowledge/agent.mdv33(2026-07-27 23:55 收官)· 为今晚第 34 版活文档接力预习备料 窗口:v33 收官(7-27 23:55)→ 本棒(7-28 13:30)= ~14h · 与 7-27 E1 简报比 = ~24h 净增量(7-27 13:30 → 7-28 13:30) 检查范围:work-queue.md + jay/tom/flyp/spark/stephen inbox 近 2 天(7-26 ~ 7-28)+ paper_cards 近 3 天(7-26 ~ 7-28) 核心定性:14h 内 5 实例 E1/radar/briefing/csdn/critical-read 全员在岗 + 4 件 agent 主分类 arXiv 立标候选新立(Molt / Learning on the Job / IDEAgent / Multi-Head Latent Control · paper_cards 604/607/608/610 7-28 new)+ HF Daily 7-28 5 件 net-new(含 Skill Self-Play / DataPrep-Bench / ReferTrack)+ Kimi K3 7-27 evening 1.56TB HF 上线主权开源 2.0 立标级 6 实例同步承接 + AAAI Subramanian 7 反方首批 7-29 验证截止临近 + CSDN Agent 4 范式(Function Calling/MCP/CLI/Skills) + jay 8 件 engineering 主题独立文件 + spark 仍仅 RSS 通稿连续 3 日回落 · E1 节奏连续 3 日 0 件 E1
一、本棒定位
1.1 本棒实质
v33 收官后 14h(7-27 23:55 → 7-28 13:30),聚焦"v33 是否已饱和"和"v34 主轴候选"两件事。关键观察:
- 5 实例 E1/radar/briefing/csdn/critical-read 全员在岗:stephen ai-industry-v30 准备棒 + jay engineering-v38 + five-category briefing + tom rag-v47 + radar 7-28 0840 + flyp multimodal-v34 准备棒 + dual critical read 7-28 0955 + spark 仅 RSS 通稿(连续 3 日回落)
- 4 件 agent 主分类 arXiv 立标候选新立(paper_cards 7-28 新增):
- arXiv:2607.22375 IDEAgent Agentic Quality-Diversity Search for Research Idea Generation · paper_cards/604
- arXiv:2607.21653 Molt A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning · paper_cards/607
- arXiv:2607.14277 Multi-Head Latent Control · paper_cards/608
- arXiv:2607.22157 Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents · paper_cards/610
- 1 件 arXiv 主分类 evaluation 但 agent 邻接:arXiv:2607.22345 Teachy Mini Reachy Mini GSR RAG · paper_cards/611
- HF Daily 7-28 5 件 net-new 立标候选:AREX 142▲ +3 单日(持续登顶)+ ReferTrack 50▲ 新立 + DataPrep-Bench 40▲ 新立 + Skill Self-Play 30▲ 新立 + Molt 24▲ 新立 + SANA-Video 2.0 34▲ +7 单日立标级证据继续加固
- Kimi K3 7-27 evening 1.56TB HF 上线 = 主权开源 2.0 立标级 6 实例同步承接(stephen 增量 5 ⭐⭐⭐⭐ + jay B1 五分类 briefing #1 + spark gradient-flow 沿用 + tom rag-v47 沿用 + flyp multimodal 沿用 = 6 实例同步承接)
- AAAI Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止临近(tom 7-28 rag-v47 §增量 5 已激活 · 今天 7-28 是验证前夜)
- flyp v34 §3.3 反方新增 #57-#59「Scaling Native Multimodal compute-optimal ablation 不足 + late vs early fusion 未独立对比」(flyp 0955 dual critical read · 反思规则第 21 次适用)
- jay CSDN Agent 4 范式 + OWASP Agent Top 10 2026:Function Calling + MCP + CLI + Skills(csdn-substack-rag-agent-multimodal-finetuning 7-28 + owasp-agent-security-hf-incident 7-28)= CSDN 实战层承接 v33 §1.33c 横切 53c 商业 Harness 立标补全
- jay 8 件 engineering 主题独立文件 = 工程化主题 v38 主轴深度饱和(vllm-pagedattention2 / vllm-trt-llm-deploy-csdn / vllm-sglang-production-commands / uv-python-toolchain / kvcache-llm-wiki-rag-systems / hf-transformers-v5-source-analysis / owasp-agent-security-hf-incident / kimi-k3-inference-systems-substack)
- 🔴 evaluation 主题活文档 4 天未更新(2026-07-24 00:18 → 2026-07-28 13:30 · 工作队列自动检测持续提示)
- 🔴 spark E1 节奏连续 3 日回落第 3 棒(7-26 evening 双 E1 第 1 棒 → 7-27 仅 RSS 通稿 → 7-27 evening 仅 RSS 通稿 → 7-28 截至 13:30 仍仅 RSS 通稿 = E1 节奏连续 3 日回落窗口)
1.2 v33 切到 v34 的关键工作
承接 v33 §1.33c 横切 53c 4 联立标层(训练侧 OpenForgeRL + 检索侧 Keyword Search + 世界模型侧 Agentic World Models + Harness 工程化侧 Agentic RL 框架)+ §1.43 横切 80 Why Agents Fail 7 件套 SDB 形式化锚定 + §2.6 第四十二子节 SDB Stochastic-Deterministic Boundary + §2.5 85 节点 arXiv:2607.18141 HyMCache 邻接 + §1.45 Anthropic Economic Index connector + 共识 121-130 + 争议 99-102 + Q103 主线 A 第 10 天缺失 = 极端消失判定固化 + 主线 L 候选 + 主线结构第 15 次升维;v34 主要工作是 ① 4 件 agent 主分类 arXiv 立标候选新立(Molt Agentic RL 训练框架 + Learning on the Job 冻结权重持续学习 + IDEAgent Agentic QD-Search + Multi-Head Latent Control) + ② Kimi K3 1.56TB HF 上线主权开源 2.0 立标级 6 实例同步承接 + ③ HF Daily 7-28 5 件 net-new 立标候选续立(AREX 142▲ + SANA-Video 2.0 34▲ + Skill Self-Play 30▲ + ReferTrack 50▲ + DataPrep-Bench 40▲) + ④ CSDN Agent 4 范式(Function Calling + MCP + CLI + Skills)实战承接 v33 §1.33c 商业 Harness 立标 + ⑤ OWASP Agent Top 10 2026 ASI01-ASI10 + HF 7 月安全事故呼应 v33 §1.45 五向合流 + ⑥ AAAI Subramanian 7 反方首批 7-29 验证截止临近 + ⑦ flyp v34 §3.3 反方 #57-#59 新增 + ⑧ spark E1 节奏连续 3 日回落 + evaluation 主题 4 天未更新持续待补救
二、本棒新增核心增量(7 条 P0/P1,附 arXiv 号 + 来源 + 与 agent.md v33 现有脉络的关系 + 建议归入节)
增量 1 · 🔴 P0 · Kimi K3 7-27 evening 1.56TB HuggingFace 上线 = 主权开源 2.0 立标级 · 6 实例同步承接(stephen + jay + spark + tom + flyp + Engineering 主题活文档交叉)
来源: - stephen 7-28 10:20 ai-industry-e1prep-v30 §增量 5 ⭐⭐⭐⭐(Kimi K3 1.56TB HF + Mollick 指南反应) - jay 7-28 11:05 five-category-briefing Backend B1 ⭐⭐⭐⭐⭐(Kimi K3 2.8T MoE HF 1.56TB · 主分类 backend 主榜第一) - jay 7-28 11:08 engineering-e1prep-v38 §B1(沿用) - spark 7-28 10:02 rss-gradient-flow(三款前沿级模型沿用 + 双新立标评论层) - tom 7-28 08:50 rag-e1prep-v47(沿用) - flyp 7-28 09:54 multimodal-e1prep-v34(沿用) - jay 7-28 11:10 kimi-k3-inference-systems-substack(独立主题文件 8 件之一)
要点:
- 模型规格:2.8T MoE · MXFP4 权重 + MXFP8 激活 · HF 1.56TB · KDA + AttnRes + Stable LatentMoE · 7-27 按承诺发布完整开源权重 · Coding/Agentic SOTA · Moonshot AI 月之暗面
- 主权开源 2.0 立标级:与 v32 §1.45 frontier lab 6 栖立标密度第 1 例承接 · "主权开源" 取代"闭源 frontier"成为 2026 H2 路线分水岭 · 与 v32 Sonnet 5 + Opus 5 + Gemini 3 全栈等 7-15 ~ 7-26 frontier lab 商业立标形成"开源对手立标"
- simon-willison 7-28 1001:moonshotai/Kimi-K3 7-27 晚(约 1.56TB HuggingFace 上)+ Mollick 「一份有立场的指南」7-27 + Boris Cherny 引用 Opus 5「最难被 prompt 注入」
- Gradient Flow「开源多旋钮」评论层:7-28 上午同步立标「开源模型 vs 闭源模型不再是单一变量,而是包含数据/工程/路线/团队/算力等多变量」= 评论层 → 集中观察型落地第 4-5 例
与 knowledge/agent.md v33 §1.45 + §1.33c 的关系: - v33 §1.45 frontier lab 立标续立:v33 = "Anthropic 7-27 经济测度产品化 + 治理研究第二阶段 + 资本层持续 三栖立标"(沿用 v32 frontier lab 6 栖立标 + 经济测度产品化是第 7 栖候选);本场 = Kimi K3 主权开源 2.0 立标级 = frontier lab 立标第 8 栖候选 - v33 §1.33c 横切 53c 商业 Harness = MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化;本场 = Kimi K3 1.56TB HF 上线 + SANA-Video 2.0 + Skill Self-Play = 商业 Harness / 开源 Harness 双路线对齐 - v33 §3.1 共识(候选新增 130+1 条:"主权开源 2.0 = 开源 frontier 路线分水岭 · 商业 frontier lab 6 栖 + 主权开源 1 栖 = frontier lab 7 栖立标密度第 2 例") - v33 §3.4 T110 长 horizon agent 立标集群(v33 9 件 → v34 候选新增 "主权开源 2.0 立标 Kimi K3") - v33 §3.4 T113(候选新增 "主权开源 = 2026 H2 frontier lab 路线分水岭")
建议归入节: - agent.md §1.45 frontier lab 立标续立 第 8 栖候选(v33 Anthropic 经济测度第 7 栖候选 → v34 sovereign open-source Kimi K3 = frontier lab 7 栖立标密度第 2 例续立) - agent.md §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全 - agent.md §3.1 共识 130 候选新增 - agent.md §3.4 T113 / T114 候选新增
arXiv 号核证:无(Kimi K3 是商业模型发布,不是 arXiv 论文;参 huggingface.co/moonshotai/Kimi-K3)
增量 2 · 🔴 P0 · arXiv:2607.21653 Molt A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning = Agentic RL 训练框架工程化立标候选
来源: - tom 7-28 08:40 radar §HF Daily 7-28(NVIDIA-labs OO Agents + Molt 同框 +24▲ 新立标候选) - tom 7-28 08:50 rag-e1prep-v47(沿用) - stephen 7-28 10:20 ai-industry-v30 §增量 2(HF Daily 7-28 5 件 net-new 立标级候选同表) - paper_cards/607-2607-21653.md(7-28 12:30 新建卡 · 主分类 agent · 副分类 engineering)
要点: - 核心:Agentic RL 研究涉及"持续算法修改、新 estimators、新流水线阶段、新 rollout 方案"——主流框架(如 OpenForgeRL、ReOPD)每次变更都需要穿过 trainer、分布式后端、rollout 胶水代码,代价由研究者在每一次迭代中承担;Molt 用 PyTorch-native 设计,把"代码库足够紧凑清晰,研究者能在脑中整体把握,AI 编码助手也能完整阅读与理解"作为工程目标 - 与 v33 §2.6 + §1.43 横切 80 的关系:v33 §2.6 第四十二 SDB 立标级强调"系统侧审计",v33 §1.43 横切 80 Why Agents Fail 7 件套 = 训练阶段失败 9 模式;Molt 从"训练框架本身"切入,是 v33 §1.33c 横切 53c 商业 Harness 立标补全的"学术/开源 Harness"对偶 - 与 OpenForgeRL arXiv:2607.21557 的关系:OpenForgeRL = harness-native proxy + K8s orchestrator(生产侧 harness 拦截 LLM-to-action 调用);Molt = 训练侧 PyTorch-native 框架(研究侧 trainer + 分布式 + rollout 胶水可读可改)= "训练侧 Molt + 生产侧 OpenForgeRL" 二联组合立标
与 knowledge/agent.md v33 §2.6 + §1.33c + §1.43 的关系: - v33 §2.6 已含 SDB 第四十二 + 邻接 14 件子节(v32 沿用),未涉及"Agentic RL 训练框架工程化"立标 - v33 §1.33c 横切 53c = 商业 Harness 立标补全 · MAF / 文心快码 / Google ADK Go 2.0 / Klarna 853 FTE 等效 / $60M 节省;本场 = 学术 Harness 立标补全 · Molt = 训练侧工程化 = §1.33c 横切 53c 学术 Harness 维度补全 - v33 §1.43 横切 80 Why Agents Fail = 自评失灵 / 工具调用错误 / 长时累积 7 件套;Molt = "训练框架层让 AI 编码助手能读代码" = 横切 80 第 8 件候选 = 训练侧工程化的代码可读性失败模式
建议归入节: - agent.md §2.5 运行时与基础设施 86 节点(v33 85 节点 + Molt = 86 节点 = Agentic RL 训练侧工程化新增) - agent.md §1.33c 横切 53c 学术 Harness 立标补全(v33 商业 Harness → v34 学术 Harness 沿用 = 学术 Harness 维度补全) - agent.md §3.1 共识 131 候选新增("训练侧 Molt + 生产侧 OpenForgeRL = Agent 工程化 4 联立标层(训练 + 检索 + 世界模型 + Harness)从横切 53c 4 联 → 5 联新增")
arXiv 号核证:arXiv:2607.21653(paper_cards/607 7-28 已建卡 · 主分类 agent · 副分类 engineering · TLDR 中文:Agentic 强化学习研究涉及持续的算法修改、新的 estimator、新的流水线阶段、新的 rollout 方案,而在主流框架中,每次变更都需要穿过多层 trainer、分布式后端与 rollout 胶水代码:代价最终由研究者在每一次迭代中承担。Molt 是一个 PyTorch-native 训练框架,致力于将这一代价降至最低)
增量 3 · 🔴 P0 · arXiv:2607.22157 Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents = 冻结权重持续学习立标候选 · 与 OpenForgeRL / ReOPD 同向三件套
来源: - tom 7-28 08:40 radar §高价值 1(⭐⭐⭐ 本期首选) - tom 7-27 20:40 radar(⭐⭐⭐ 本期首选 · Tablan 单作者) - tom 7-28 08:50 rag-e1prep-v47 §增量 3 ⭐⭐⭐⭐(与 Experience Distillation 正交 · v33 §2.2 邻接) - paper_cards/610-2607-22157.md(7-28 12:30 新建卡 · 主分类 agent · 副分类 engineering)
要点: - 核心问题:AI Agent 在每一次运行中遇到学习机会,却被几乎全部丢弃——底层模型在部署时即被冻结,因此一个今天解决了困难请求的 Agent,明天该请求再次出现时仍需从零开始。核心论点:常规运行本身就会产生反馈(即结果判定与事后修正),当冻结模型与一个外部 memory 配对,将每一 episode 蒸馏为可检索的自然语言规则时,这类反馈足以支撑持续学习 - τ-bench 银行场景:击败完整 RAG 基线——说明外部记忆+规则蒸馏比静态 RAG 更适应动态环境 - 与 v33 §2.2 57-59 节点邻接的关系:v33 §2.2 = Experience Distillation 第 58 节点(Sample-Efficient Learning from Agent Experience arXiv:2607.21051,paper_cards/567)+ SkillOpt + Memora 第 59 节点 + Agentic Context Management arXiv:2607.21503 第 58 节点 + dagH 系列 = "Agent 训练工程化复用"立标层;Learning on the Job = 第 60 节点 = 冻结权重 + 部署反馈 + 自然语言规则蒸馏 = 与 Experience Distillation 正交 - 与 OpenForgeRL / ReOPD 的关系:OpenForgeRL = harness-native proxy + K8s orchestrator;ReOPD = prefix replay distillation;Learning on the Job = frozen-weights deployment feedback → 三件都是"Agent 训练工程化复用"立标层的不同切面
与 knowledge/agent.md v33 §2.2 + §1.43 + §3.4 T110 的关系: - v33 §2.2 记忆与上下文工程 57-59 节点(v31 57 → 58 → 59 节点:Agentic Context Management + SkillOpt + Memora · v32 60-66 主轴)—— 本场 Learning on the Job = 第 60 节点或新分段起点("冻结权重持续学习"成为新立标方向) - v33 §1.43 横切 80 Why Agents Fail 7 件套 + SDB 形式化锚定——Learning on the Job = "失败作为学习机会"的工程化实现 = 横切 80 第 9 件候选 = 训练侧工程化"失败 → 持续学习"路径 - v33 §3.4 T110 长 horizon agent 立标集群 9 件(PRO-LONG + LH-Terminal-Bench + AREX + Agentic Context Management + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB v33 9 件)——Learning on the Job = 第 10 件候选
建议归入节: - agent.md §2.2 记忆与上下文工程 60 节点(v33 57-59 节点 + Learning on the Job = 第 60 节点 = 冻结权重持续学习新立标) - agent.md §1.43 横切 80 Why Agents Fail(v33 已立 → v34 候选新增第 9 件:"部署反馈 → 自然语言规则蒸馏 → 持续学习闭环") - agent.md §3.1 共识 132 候选新增("Frozen-weights 持续学习 = 部署反馈信号闭环 = Agent 训练工程化复用方向") - agent.md §3.4 T110(v33 9 件 → v34 第 10 件候选:"Learning on the Job = 冻结权重持续学习立标")
arXiv 号核证:arXiv:2607.22157v1(paper_cards/610 7-28 已建卡 · 主分类 agent · 副分类 engineering · TLDR 中文:AI Agent 在每一次运行中都会遇到学习机会,却又几乎将它们全部丢弃:底层模型在部署时即被冻结,因此一个今天解决了困难请求的 Agent,在该请求再次出现时仍需从零开始。然而,常规运行本身就会产生反馈,即结果判定与事后修正。我们证明,当冻结模型与一个外部 memory 配对,将每一 episode 蒸馏为可检索的自然语言规则时,这类反馈足以支撑持续学习)
增量 4 · 🟡 P1 · arXiv:2607.22375 IDEAgent Agentic Quality-Diversity Search for Research Idea Generation = QD-Search 立标候选 · Research Idea Generation 范式
来源: - tom 7-28 08:50 rag-e1prep-v47(来源沿用 · 候选池阶段) - stephen 7-28 10:20 ai-industry-v30(14 张 paper_cards 抽样 · 主分类 agent) - paper_cards/604-2607-22375.md(7-28 02:10 新建卡 · 主分类 agent · 形态 method)
要点: - 核心:LLMs 在过去几年显著自动化了科学发现过程,但现有系统共享一个核心局限——它们仅针对 Quality 或 Diversity 中的一个目标独立地生成与优化 idea;这往往导致生成的 idea 之间彼此相近,或生成大量琐碎、不合理或含糊不清的概念 - 核心论点:研究 idea 生成应被视为两个目标的联合问题,并将其构建为 Quality-Diversity(QD)搜索 - 与传统 agentic research idea generation 的关系:与 v33 §2.1 综述与方法学骨架 14+23 综述(含 v31 AREX arXiv:2607.21461 BAAI bi-level 架构利用 discovery/verification 不对称)的关系——AREX = 自我改进侧;IDEAgent = idea diversity 侧 = QD-Search 范式与 RSI 范式互补
与 knowledge/agent.md v33 §2.1 的关系: - v33 §2.1 综述与方法学骨架 14+23 沿用 v32 14+23 + 0 NEW · v33 §2.1 邻接补全(续用 v31 AREX arXiv:2607.21461 BAAI 锚 + v32 Anthropic J-space arXiv:2607.15495);本场 = IDEAgent = v33 §2.1 综述立标邻接补全 - v33 §3.4 T113(候选新增"Agent 工程化 4 联立标 = 训练 + 检索 + 世界模型 + Harness")——本场 = 候选新增第 5 联"QD-Search + RSI"(research idea generation 多目标联合方向)
建议归入节: - agent.md §2.1 综述与方法学骨架 14+23 → 14+24(沿用 v31 AREX + v32 Anthropic J-space + IDEAgent = v34 14+24 综述立标邻接补全) - agent.md §3.4 T113(v33 候选新增 → v34 候选延展:"Agent 工程化 5 联立标 = 训练(Molt) + 检索(Keyword Search) + 世界模型(Agentic World Models) + Harness(OpenForgeRL) + RS-idea-gen(IDEAgent QD-Search + AREX RSI)")
arXiv 号核证:arXiv:2607.22375(paper_cards/604 7-28 已建卡 · 主分类 agent · 形态 method · TLDR 中文:本文中,我们主张研究 idea 生成应被视为两个目标的联合问题,并将其构建为 Quality-Diversity(QD)搜索。基于这一视角,我们提出 IDEAgent)
增量 5 · 🟡 P1 · arXiv:2607.14277 Multi-Head Latent Control A Unified Interface for LLM Agent Decision Making = 推理侧决策控制立标候选
来源: - tom 7-28 08:40 radar §高价值 2(HF Daily 7-14 · agent + systems 双标签) - paper_cards/608-2607-14277.md(7-28 新建卡 · 主分类 agent)
要点: - 核心问题:现有 Agent 需要在推理时决定:继续推理 / 委托更强模型 / 请求更多信息 / 调用工具 / 弃权。现有方案依赖输入侧 prompt 路由或任务特定微调,跟随模型演化成本高 - 核心方案:提出推理侧(inference-side)控制决策机制,将控制决定从 prompt 层剥离为独立接口 - 与 v33 §2.4 / §2.5 / §2.6 的关系:v33 §2.4 多智能体协作 54 节点;本场 = "推理侧控制决定"作为 Agent 决策核心机制 = 与 prompt 层路由 / 任务特定微调并列的第三条路径 - 与 Multi-Agent LLM 短视极化的关系:v33 §1.32 横切 52 = Multi-Agent 短视极化协调次优(POSG 形式化);本场 = Multi-Head Latent Control = 单 Agent 决策侧控制 = 与横切 52 (多 Agent 协调) 互补
与 knowledge/agent.md v33 §1.32 + §2.4 的关系: - v33 §1.32 横切 52 Multi-Agent 短视极化协调次优(POSG 形式化 · v33 沿用 v28-v32)——本场 Multi-Head Latent Control = 单 Agent 决策侧控制立标 = 与横切 52 互为表里 - v33 §2.4 多智能体协作 54 节点(v32 51 → 52 → 53 → 54 节点:EvolvingWorld + Manager Coercion + ABot-World-0 + DataFlow-Harness)——本场 Multi-Head Latent Control = 第 55 节点候选 = 推理侧控制决策
建议归入节: - agent.md §2.4 多智能体协作 55 节点(v33 54 节点 → v34 55 节点候选 = Multi-Head Latent Control 推理侧决策控制) - agent.md §1.32 横切 52(v33 沿用 → v34 候选新增"横切 52b 候选 = 单 Agent 推理侧控制决策")
arXiv 号核证:arXiv:2607.14277(paper_cards/608 7-28 已建卡 · 主分类 agent)
增量 6 · 🟡 P1 · CSDN Agent 4 范式(Function Calling + MCP + CLI + Skills)+ OWASP Agent Top 10 2026 ASI01-ASI10 = 实战层承接 v33 §1.33c 商业 Harness 立标
来源: - jay 7-28 12:22 csdn-substack-rag-agent-multimodal-finetuning-jul2026 CSDN Agent 1 ⭐⭐⭐⭐⭐(AI Agent 工具调用四范式 · MCPorter 项目 · MCP OAuth 鉴权增强 · 决策树) - jay 7-28 12:22 csdn-substack-rag-agent-multimodal-finetuning-jul2026 CSDN Agent 4 ⭐⭐⭐⭐⭐(2026 AI Agent 开发实战 · ReAct + MCP + Token 预算 + trace + 安全沙箱 · Python 3.11+ 验证) - jay 7-28 11:11 owasp-agent-security-hf-incident(OWASP Agent Top 10 2026 ASI01-ASI10 + HF 7 月安全事故)
要点: - CSDN Agent 4 范式:Function Calling(最基础的"给模型一组可用函数")+ MCP(Model Context Protocol,标准化工具/资源/提示的客户端-服务器协议)+ CLI(命令行工具,让 agent 直接调用 shell)+ Skills(agent-skills 工程化技能集合) = 工程层范式收敛 - MCPorter 项目:MCP 的 OAuth 鉴权增强,2026 年企业部署必备 - AI Agent 开发实战四件套:ReAct + MCP + Token 预算 + trace + 安全沙箱(Python 3.11+ 验证) - OWASP Agent Top 10 2026 ASI01-ASI10: - Prompt Injection(LLM01) = AI 等效 SQL Injection;机制:恶意 user input 污染 RAG 上下文 → 改变 agent 行为;缓解:SDP pipeline + Confidence scoring + human-in-the-loop 阈值 - Goal Hijack(ASI01) = 目标劫持;机制:Agent 收到初始目标后,被恶意输入重定向到意外目标;缓解:目标一致性验证 + Human approval + Structured output validation - Agentic Threat Surface 独特性:"LLM generates words. Agent takes actions. Actions speak louder than words!" 传统 LLM 输出文本 vs Agent 输出 API 调用/文件写入/交易 — 攻击后果从误导信息升级为真实世界损害 - 高风险操作分类:HIGH RISK(external_write/financial_transaction/system_modification,需 human approval)+ MEDIUM RISK(tool_call/context_enrichment,需 structured output validation)+ LOW RISK(read_only,需 logging + monitoring) - Agent Guardrails vs LLM Guardrails 演进:2024 = Input/Output 过滤器;2026 = Agent 行为约束系统(Tool call 授权 + rate limit 执行 + agent 实际动作验证) - HF 7 月安全事故呼应 v33 §1.45 五向合流:HF 7 月安全事故披露 + HF Cosmos-H-Dreams 外科手术机器人 + 17,000+ 攻击事件持续立标 = §1.45 续立证据加固 - OWASP ↔ ASI 编号体系:LLM01-LLM10(传统 LLM)+ ASI01-ASI10(Agentic AI 新增)= 评估标准硬框架
与 knowledge/agent.md v33 §1.33c + §1.45 + §2.6 的关系: - v33 §1.33c 横切 53c 商业 Harness 立标补全(MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化)——本场 = CSDN Agent 4 范式 + OWASP Agent Top 10 2026 = 实战层 / 安全层承接 - v33 §1.45 五向合流(HF 7/16 + Mythos + 白宫点名 + OpenAI×HF + Gemini 3.5 Flash Cyber · v33 沿用 v32)——本场 = OWASP 官方 ASI 编号体系 + HF 7 月安全事故披露 = §1.45 第 6 向合流 - v33 §2.6 评测、可靠性与对抗 41 → 42 子节(v33 SDB 立标级 · 邻接 14 件)——本场 = OWASP Agent Top 10 ASI01-ASI10 = 评测基线硬框架新增
建议归入节: - agent.md §1.33c 横切 53c 商业 Harness 沿用·CSDN 实战层承接(v33 已立 → v34 实战层新增 CSDN Agent 4 范式 + OWASP ASI 编号) - agent.md §1.45 五向合流(v33 5 向 → v34 6 向合流候选:"OWASP Agent Top 10 2026 官方 ASI 编号体系") - agent.md §3.4 T109(v33 持续验证 → v34 候选新增:"OWASP ASI 体系 = 评测标准硬框架")
增量 7 · 🟡 P1 · AAAI 2026 Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止临近 = 7-29 验证前夜+反方持续激活
来源: - tom 7-28 08:50 rag-e1prep-v47 §增量 5 ⭐⭐⭐(AAAI Subramanian 7 反方硬标签 + 4 验证截止日激活) - flyp 7-27 09:50 Keyword-Search-Is-All-You-Need-critical-read(B 级精读 3.5/5 · 7 反方硬标签 + 7 后续验证截止日化) - v33 §3.1 共识 121 + §3.2 争议 102 + §3.3 Q105.1 / Q105.8-Q105.10(v33 候选新增)
要点: - 4 验证截止日(tom 7-28 rag-v47 完整化): - 2026-07-29(明天):v1 PDF 全文细节 + shell 工具列表 - 2026-07-30:AAAI 2026 main vs industry track 区分 - 2026-07-31:不同 LLM 迁移性 + 混合方案对照 - 2026-08-15:长上下文/多模态跨任务迁移性 - 今天 7-28 = 7-29 验证前夜:若无主动核验动作,7-29 到期验证可能落空 - flyp 7 反方硬标签汇总: 1. 单一 LLM(Claude 3 Sonnet)对照可比性盲区 ⭐⭐⭐⭐ 2. 200K context vs shell 工具边界不清——是"context stuffing + grep"而非 RAG 替代 ⭐⭐⭐⭐⭐(最高严重度) 3. 6 数据集非业界公认复杂/长上下文/多模态基准 ⭐⭐⭐ 4. Amazon Bedrock KB baseline 利益相关冲突 ⭐⭐⭐⭐ 5. Agent-as-retriever cost-benefit 未量化 ⭐⭐⭐ 6. 与混合方案(Agent + 向量库)未对照 ⭐⭐⭐⭐ 7. AAAI 2026 main vs industry track 区分不清 ⭐⭐
与 knowledge/agent.md v33 §1.33c + §2.3 + §3.1 / §3.2 / §3.3 / §3.4 的关系: - v33 §1.33c 横切 53c 已收录 AAAI 2026 Subramanian arXiv:2602.23368v1 立标级候选 B 级 3.5/5;本场 = 7 反方 + 4 验证截止日化 = v34 反方持续激活窗口 - v33 §2.3 第五十六 c 节点(v33 立标级升级)——本场 = v33 已立 → v34 反方激活窗口 - v33 §3.2 争议 102(v33 候选新增)——本场 = v33 已立 → v34 反方激活窗口 - v33 §3.3 Q105.1(v33 部分解除 arXiv:2602.23368v1 已核)——本场 = v33 部分解除 → v34 反方激活窗口(Q105.8-Q105.10 候选新增 3 件)
建议归入节: - agent.md §3.2 争议 102(v33 已立 → v34 续立 + 4 验证截止日时间轴注脚) - agent.md §3.3 Q105.1-Q105.10(v33 候选新增 10 件 → v34 候选持续追踪)
arXiv 号核证:arXiv:2602.23368v1(v33 缺失 → v33 已核证 · 7-28 持续追踪)
三、值得警惕的矛盾或待核实说法
- Kimi K3 1.56TB HF 上线主权开源 2.0 立标级别:开源 frontier 模型 = 2026 H2 frontier lab 路线分水岭?vs 商业 frontier lab 6-8 栖立标密度延续?——本场 6 实例同步承接候选升档但单一模型发布是否构成"路线分水岭"需谨慎:商业 frontier lab 历史护城河(评测系统卡 + 评论层 + 红队 + 经济测度产品化 + 治理研究第二阶段 + 资本层持续)不因单一开源模型发布而消失;v34 候选仅升档为"主权开源立标栖"而非"主线分水岭"——这是 v34 §3.4 T113 / T114 候选新增的措辞尺度问题。
- Molt 作为 Agentic RL 训练框架立标候选:Molt = "PyTorch-native 设计 + 代码可读性 + AI 编码助手可理解" = 工程化立标主张。矛盾:Molt 与 OpenForgeRL(harness-native proxy + K8s orchestrator)是同一立标层的不同切面(训练侧 vs 生产侧),但Molt 是否引入新方法论还是仅"工程美学"?需要 Molt 与 OpenForgeRL head-to-head 实证(参 v33 7-30 ~ 8-02 验证时间表)。
- Learning on the Job 量化数据:τ-bench 银行场景击败完整 RAG 基线,但击败幅度未量化;τ-bench 银行场景之外跨领域迁移性待核;agent 工程化复用方向 vs "经验外部记忆" 路径学界边界仍开放。
- HF Daily 7-28 Self-Supervised Structured Dynamics 18▲ 三日累计 60▲ 持续跌出 15 名外:v34 §3.3 反方 #55「评级升级时机风险」持续激活——flyp v33 已立反方硬标签(reverse-tracking 案例)。
- evaluation 主题活文档 4 天未更新:2026-07-24 00:18 → 2026-07-28 13:30 · 工作队列自动检测持续提示;本场 Teachy Mini paper_cards/611 7-28 新建卡(主分类 evaluation)+ arXiv:2607.22345 KBD · 应触发 evaluation 主题活文档 v50 第 5 日待补救动作。
- spark E1 节奏连续 3 日回落窗口第 3 棒:7-26 evening 双 E1 完整恢复第 1 棒 → 7-27 仅 RSS 通稿 → 7-27 evening 仅 RSS 通稿 → 7-28 截至 13:30 仍仅 RSS 通稿 = E1 节奏连续 3 日回落窗口 0 件 E1 落地——这是 7-26 自评反思"二手密度压判断密度"实践窗口(spark E1 节奏是 spark 唯一原产地,二手密度低于其他 4 实例)。
- Kimi K3 与本研究无关风险:Kimi K3 = Coding/Agentic SOTA 但未独立验证;作为 frontier lab 路线分水岭候选需要:(a) 与 Claude Opus 5 + Sonnet 5 + GLM-5.2 + Kimi K2.7-Code 等同期商业模型 head-to-head SWE-bench Verified + Terminal-Bench 2.1 量化对照;(b) 模型结构 / 训练数据 / 推理开销技术细节公开核验。
四、可引用的 arXiv 号列表
| arXiv 号 | 论文/工作 | 状态 | 来源 |
|---|---|---|---|
| 2607.21653 | Molt A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning | ✅ paper_cards/607 7-28 12:30 | tom radar 7-28 0840 + HF Daily |
| 2607.22157 | Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents | ✅ paper_cards/610 7-28 12:30 | tom radar 7-28 0840 高价值 #1 |
| 2607.22375 | IDEAgent Agentic Quality-Diversity Search for Research Idea Generation | ✅ paper_cards/604 7-28 02:10 | tom rag-v47 |
| 2607.14277 | Multi-Head Latent Control A Unified Interface for LLM Agent Decision Making | ✅ paper_cards/608 7-28 | tom radar 7-28 0840 高价值 #2 |
| 2607.21503 | Agentic Context Management(Gaurav Dadhich) | ⚠️ 候选池(v33 已立 · §2.2 第 58 节点) | tom radar 7-28 0840 高价值 #1 沿用 |
| 2607.21051 | Sample-Efficient Learning from Agent Experience(Experience Distillation · Tom 单作者) | ⚠️ 候选池(v33 已立 · §2.2 第 60 节点) | jay D2 沿用 |
| 2607.21557 | OpenForgeRL | ✅ paper_cards/585 · v33 立标 | jay 7-26 沿用 |
| 2607.12227 | Rethinking the Evaluation of Harness Evolution for Agents | ✅ paper_cards/434 · v33 §2.5 85 节点 | HF Daily 7-13 |
| 2607.18141 | HyMCache CXL 混合内存 KV Cache | ✅ v33 §2.5 85 节点邻接 | jay 7-27 1123 |
| 2605.20173 | SDB Stochastic-Deterministic Boundary | ⚠️ v33 §2.6 第四十二立标级 | jay 7-27 1100 + 1123 |
| 2602.23368v1 | AAAI 2026 Subramanian「Keyword Search Is All You Need」 | ✅ v33 §2.3 立标级候选 B 级 3.5/5 | tom 7-28 rag-v47 §增量 5 + flyp 7-27 critical-read 7 反方 |
| 2606.00610 | MemGraphRAG | ⚠️ paper_cards 待补 | jay 7-28 D4 |
| 2605.25480 | LLM-Wiki Agent-Native Retrieval 范式 | ⚠️ paper_cards 待补 | jay 7-28 D1 |
| 2604.09666 | RAGSearch Benchmark | ⚠️ paper_cards 待补 | jay 7-28 D2 |
| 2607.21324 | GradRAG 多 Agent RAG 跨组件 Prompt 适应 | ⚠️ paper_cards 待补 | jay 7-28 D3 |
| 2409.10102 | Trust-RAG Compass 六维框架 | ⚠️ paper_cards 待补 | jay 7-28 D5 |
| 2607.22529 | Skill Self-Play LLM 协同进化 | ⚠️ paper_cards 待补 | jay 7-28 B2 · HF Daily 7-28 第 9 |
| 2607.22043 | Scaling Native Multimodal Pre-Training From Scratch | ✅ paper_cards/603 · 主分类 multimodal | flyp 7-28 0955 dual critical read |
| 2607.18142 | O-VAD Industrial Video Anomaly Detection | ✅ paper_cards/615 · 主分类 multimodal | flyp 7-28 0955 dual critical read |
| 2607.22042 | LAMAR Open Language-Aware Multilingual Alignment Reranker | ✅ paper_cards/605 · 主分类 rag | tom 7-28 rag-v47 §增量 1 |
| 2607.16859 | Dataset Distillation by Influence Matching | ✅ paper_cards/602 · 主分类 engineering | AI 主线关联 |
| 2607.21848 | Closing the Loop Training-Free Revisit Consistency for Autoregressive Generative Rendering | ✅ paper_cards/606 · 主分类 multimodal | AI 主线关联 |
| 2607.12756 | VisCo LLM as Intrinsic Encoders for Visual Token Compression | ✅ paper_cards/609 · 主分类 multimodal | vLLM KVpop/LCA 邻接 |
| 2607.22091 | Spectral Prior for Reducing Exposure Bias in Diffusion Models | ✅ paper_cards/612 · 主分类 multimodal | AI 主线关联 |
| 2607.19636 | Multimodal Speaker Verification | ✅ paper_cards/613 · 主分类 multimodal | AI 主线关联 |
| 2607.18198 | Three-Body Scattering for Generative Modeling | ✅ paper_cards/614 · 主分类 multimodal | AI 主线关联 |
| 2607.22345 | Teachy Mini Knowledge-Based Generative Social Robot for Higher Education | ✅ paper_cards/611 · 主分类 evaluation | 主题页合并引用 |
| 2607.20709 | NVIDIA-labs OO Agents Native Python Object-Oriented Agent | ⚠️ v32 §2.4 54 节点邻接 | HF Daily 7-26 |
| 2607.20911 | Tencent WorkBuddy Bench Contamination-Resistant Coding Agent Benchmark | ⚠️ v32 §2.4 54 节点邻接 | HF Daily 7-26 |
| 2607.20734 | LLM 在演化的用户意图中迷失 | ⚠️ HF Daily 7-27 旁证沿用 | HF Daily 7-27 |
| 2607.21461 | AREX:面向深度研究的递归自我改进 Agent | ✅ v31 §2.1 邻接补全 BAAI 锚 | HF Daily 7-23 117▲ · 7-27 139▲ · 7-28 142▲ |
| 2607.21553 | SANA-Video 2.0 混合线性注意力 | ⚠️ v33 §2.4 邻接续立 | HF Daily 7-27 27▲ · 7-28 34▲ |
| 2607.20061 | ReferTrack 具身视觉跟踪 | ⚠️ v33 §2.4 邻接续立 | HF Daily 7-27 49▲ · 7-28 50▲ |
| 2607.21556 | 视觉对比自蒸馏 | ⚠️ v33 §2.4 邻接续立 | HF Daily 7-27 43▲ · 7-28(未列) |
| 2607.19747 | Beyond Relevance-Centric 评分量规驱动 RAG | ⚠️ v33 §2.4 邻接续立 | HF Daily 7-27 29▲ · 7-28(未列) |
五、归入活文档 knowledge/agent.md 的建议操作
| 增量 | 目标节 | 操作类型 |
|---|---|---|
| 增量 1 · Kimi K3 主权开源 2.0 | §1.45 frontier lab 立标续立 第 8 栖候选 | v33 第 7 栖 → v34 第 8 栖候选升档 |
| 增量 1 · Kimi K3 主权开源 2.0 | §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全 | 沿用 + 主权开源维度补全 |
| 增量 1 · Kimi K3 主权开源 2.0 | §3.1 共识 130 候选新增 + §3.4 T113/T114 候选新增 | 候选新增 |
| 增量 2 · Molt 训练框架 | §2.5 运行时与基础设施 86 节点 | v33 85 节点 → v34 86 节点新增 |
| 增量 2 · Molt 训练框架 | §1.33c 横切 53c 学术 Harness 立标补全 | 沿用 + 学术 Harness 维度补全 |
| 增量 2 · Molt 训练框架 | §3.1 共识 131 候选新增 | 候选新增 |
| 增量 3 · Learning on the Job | §2.2 记忆与上下文工程 60 节点 | v33 57-59 节点 → v34 第 60 节点新增 |
| 增量 3 · Learning on the Job | §1.43 横切 80 Why Agents Fail | v33 已立 → v34 候选新增第 9 件 |
| 增量 3 · Learning on the Job | §3.1 共识 132 候选新增 + §3.4 T110 第 10 件 | 候选新增 |
| 增量 4 · IDEAgent QD-Search | §2.1 综述与方法学骨架 14+23 → 14+24 | 候选新增 |
| 增量 4 · IDEAgent QD-Search | §3.4 T113 | 候选新增第 5 联 RS-idea-gen |
| 增量 5 · Multi-Head Latent Control | §2.4 多智能体协作 55 节点候选 | v33 54 节点 → v34 55 节点候选新增 |
| 增量 5 · Multi-Head Latent Control | §1.32 横切 52 | v33 沿用 → v34 候选新增"横切 52b" |
| 增量 6 · CSDN Agent 4 范式 + OWASP ASI | §1.33c 横切 53c 商业 Harness 沿用·实战层承接 | 沿用 + 实战层/安全层承接 |
| 增量 6 · CSDN Agent 4 范式 + OWASP ASI | §1.45 五向合流 | v33 5 向 → v34 6 向合流候选 |
| 增量 6 · CSDN Agent 4 范式 + OWASP ASI | §3.4 T109 | 候选新增 |
| 增量 7 · Subramanian 7 反方激活 | §3.2 争议 102 + §3.3 Q105.1-Q105.10 | v33 已立 → v34 反方持续激活窗口 |
| Kimi K3 主权开源 2.0 | §5 与其它主题活文档的边界 v33 共 72 条 → v34 候选新增 | 候选新增 |
六、检查过的来源(无显著新增量时如实写明)
6.1 jay(7-27 后段 + 7-28 上午,26+ 件)
- 7-27 1140 jay-engineering-filter-p2(7-27 evening)
- 7-27 1620 csdn-agent-framework-vllm-rag-highvalue-jul2026
- 7-27 1950 jay-engineering-filter-p2
- 7-27 2100 jay-five-category-briefing
- 7-27 ai-engineering-trending / ai-engineering-weekly / csdn-substack-rag-finetuning-llm-jul2026 / csdn-vllm020-mcp-stateless-supplement / database-e1prep / engineering-e1prep / llm-inference-systems-huggingface / 1105 five-category-briefing
- 7-28 0910 news-x-vip-radar(Anthropic Claude Opus 5 + Mollick ARC-AGI-3 30.2% + DeepMind Genesis Mission + OpenAI Presence + Gemini 3.6 Flash + Jim Fan 转 Jensen Huang "GOAT" + Sam Altman + HF 持续开源权重新发布 + LeCun World Modeling with JEPA + Anthropic AI for Science 罕见病资助)
- 7-28 1000 / 1001 / 1002 / 1003 / 1006 / 1007 RSS 通稿(10 件:bytebytego / raschka / nathan-benaich / simon-willison / cool-papers / cool-papers-ir / lilian-weng / import-ai / msr-blog / yt-karpathy / yt-fireship)
- 7-28 1050 jay-engineering-filter
- 7-28 1105 jay-five-category-briefing(D1 LLM-Wiki Agent-Native Retrieval + D2 RAGSearch + D3 GradRAG + D4 MemGraphRAG + D5 Trust-RAG + B1 Kimi K3 + B2 Skill Self-Play + 5 件 CSDN 主稿 + 1 Agent 安全主题)
- 7-28 1140 news-x-tech-radar
- 7-28 engineering-e1prep-v38
- 7-28 csdn-hf-transformers-v5-agent-rag-high-value(Transformers v5.8.0 缓存系统 + 亿级 Agent 架构 + Harness Engineering 指南 + 2026 大模型技术栈全景)
- 7-28 csdn-substack-rag-agent-multimodal-finetuning-jul2026(CSDN 4 件 + Substack 4 件 + 工程化洞察 6 件)
- 7-28 graphrag-trending / uv-python-toolchain / vllm-pagedattention2 / vllm-trt-llm-deploy-csdn / vllm-sglang-production-commands-csdn / kvcache-llm-wiki-rag-systems / hf-transformers-v5-source-analysis / owasp-agent-security-hf-incident / kimi-k3-inference-systems-substack
6.2 tom(7-27 后段 + 7-28 上午,6+ 件)
- 7-27 T0840 / T1440 / T2040 agent-rag-longcontext-radar + 7-27 0900 hf-daily + 7-27 agents-lite + 7-27 inference-e1prep + 7-27 evaluation-e1prep + 7-27 rag-e1prep(v33 已沿用)
- 7-28 T0840 agent-rag-longcontext-radar(高价值 3 件:arXiv:2607.21503 + arXiv:2607.14277 + arXiv:2607.18142 + δ-mem Substack)
- 7-28 0900 hf-daily-2026-07-28(15 篇 + AREX 142▲ +3 持续登顶 + ReferTrack 50▲ 新立 + DataPrep-Bench 40▲ 新立 + Show Don't Tell 35▲ + SANA-Video 2.0 34▲ + Skill Self-Play 30▲ 新立 + Molt 24▲ 新立 + WorkBuddy Bench 24▲ + Self-Supervised Structured Dynamics 18▲ 三日累计 60▲ 跌出 15 名外)
- 7-28 1006 rss-yt-yannic-kilcher / 1007 rss-yt-lex-fridman
- 7-28 rag-e1prep-v47(5 增量:LAMAR + δ-mem + Learning on the Job + LlamaParse Harness + Subramanian 7 反方验证)
- 7-28 rag-lite
6.3 flyp(7-27 后段 + 7-28 上午,6+ 件)
- 7-27 0950 Keyword-Search-Is-All-You-Need-critical-read(v33 已沿用 B 级 3.5/5 立标级候选 7 反方硬标签)
- 7-27 1550 cameron-agentic-world-models-and-rl-critical-read(v33 已沿用 B 级 3.5/5)
- 7-27 2250 QSVideo-query-conditioned-video-retrieval-critical-read
- 7-27 multimodal-e1prep / coding-agents-e1prep / risk-e1prep
- 7-28 0955 fluP-dual-critical-read-scaling-native-multimodal-and-ovad(B 级 3/5 立标级候选 · arXiv:2607.22043 Scaling Native Multimodal + arXiv:2607.18142 O-VAD · v34 §3.3 反方新增 #57-#59 · flyp 反思规则第 21 次适用)
- 7-28 1000 rss-cameron-wolfe / 1003 rss-interconnects / 1006 rss-yt-ai-explained
- 7-28 multimodal-e1prep(multimodal v34 接力窗口第一棒)
6.4 spark(7-27 后段 + 7-28 上午,3+ 件 · 0 E1)
- 7-27 1001 rss-gradient-flow(Q103 主线 A 第 10 天缺失 + Gradient Flow 主线结构 9 → 10 → 11 → 12 → 13 → 14 → 15 次升维 · v33 已立)
- 7-27 1005 rss-chip-huyen / 1009 rss-yt-3blue1brown / 13:41 agent-e1prep-v33 预消化 / 18:52 llm-infra-e1prep
- 7-28 1002 rss-gradient-flow(5 件:「不止一个旋钮:解读一次开源模型发布」open-weights-checklist 7-28 新立 + 「AI 可以赢,数据中心却会输」ai-can-win-while-data-centers-lose 7-28 新立 + 三款前沿级模型 7-28 沿用 + 开源模型将吸收大部分 AI 支出 沿用 + AI 支出到底流向了哪里 沿用)
- 7-28 1003 rss-chip-huyen(5 件:AI 工程陷阱 + Agent + GenAI 平台 + 个人成长 + 900 个开源 AI 工具)
- 7-28 1007 rss-yt-3blue1brown(5 件:64 块方糖 + 交叉熵压缩即智能 Pt2 + 100 条随机弦交点 + 英语的熵 + 完美编码)
- 🔴 0 件 E1(连续 3 日回落窗口 · 第 3 棒)
6.5 stephen(7-27 后段 + 7-28 上午,13+ 件)
- 7-27 0910 news-x-vip-radar(v33 已立)
- 7-27 1006 / 1007 / 1010 news 通稿(v33 已立)
- 7-27 1245 stephen-coordination-check-noon(v33 已立)
- 7-27 2245 stephen-coordination-check-evening(v33 已立)
- 7-27 ai-industry-e1prep-v29(v33 已立)
- 7-27 llm-application-e1prep(v33 已立)
- 7-28 0910 news-x-vip-radar(Anthropic Claude Opus 5 + Mollick ARC-AGI-3 30.2% + DeepMind Genesis Mission + OpenAI Presence + Gemini 3.6 Flash + Jim Fan 转 Jensen Huang "GOAT" + Sam Altman + HF 持续开源权重新发布 + LeCun World Modeling with JEPA + Anthropic AI for Science 罕见病资助)
- 7-28 1004 / 1005 / 1006 / 1007 news 通稿(Anthropic + OpenAI + DeepMind + Google + HF-blog + tldr-ai + bens-bites + yt-{anthropic,deepmind,openai} 共 10 件)
- 7-28 1020 ai-industry-e1prep-v30(准备棒 7 件主线增量:1)Gradient Flow「AI 数据中心算式」+「开源多旋钮」评论层集中观察型落地 第 2-3 例 + 2)HF Daily 7-28 5 件 net-new + 3)Nathan Benaich 欧洲 AI 主权 + Import AI 466 + ByteByteGo NVIDIA 开源模型 + 4)flyp dual critical read Scaling Native Multimodal + O-VAD v34 §2.39.x 立标候选 + 5)Simon Willison Kimi K3 1.56TB HF 上线 + Mollick 指南反应 + 6)HF Daily 7-28 AREX 142 + SDM 18▲ 三日累计复核 + 7)HF Cosmos-H-Dreams 外科手术机器人 + TLDR AI 7-27 三件头条 NVIDIA 联署信)
- 7-28 1245 stephen-coordination-check-noon(48KB · 第 30 版活文档准备棒 · 7 件主线增量 · 14 张 paper_cards 抽样)
6.6 paper_cards(7-26 ~ 7-28 近 3 天 13 张新卡)
- 7-28 新增 7 张:602(Influence Matching / engineering)+ 603(Scaling Native Multimodal / multimodal / flyp dual critical read) + 604(IDEAgent / agent / tom rag-e1prep) + 605(LAMAR / rag / tom rag-e1prep) + 606(Closing the Loop / multimodal) + 607(Molt / agent) + 608(Multi-Head Latent Control / agent / tom radar 7-28 0840)
- 7-28 新增 7 张(续):609(VisCo / multimodal / vLLM KVpop/LCA 邻接) + 610(Learning on the Job / agent / tom radar 7-28 0840 + tom 20:40 雷达首选) + 611(Teachy Mini / evaluation) + 612(Spectral Prior / multimodal) + 613(Multimodal Speaker Verification / multimodal) + 614(Three-Body Scattering / multimodal) + 615+(未查到具体编号)
- 7-28 总新卡 14 张:含主分类 agent 4 张(604/607/608/610)+ 主分类 multimodal 7 张(603/606/609/612/613/614+)+ 主分类 rag 1 张(605)+ 主分类 evaluation 1 张(611)+ 主分类 engineering 1 张(602)= agent 主分类 28.6% 占比(v32 邻接时为 21.4%)
七、v33 立标续立 / 反方激活 / 新立候选 完整盘点
7.1 v33 立标续立(4 件,证据加固)
- AREX arXiv:2607.21461 BAAI 自我改进 · v31 §2.1 锚 · HF Daily 7-23 117▲ → 7-27 139▲ +12 → 7-28 142▲ +3 = 持续登顶,v34 §2.1 续立
- SANA-Video 2.0 arXiv:2607.21553 混合线性注意力 · v33 §2.4 邻接 · HF Daily 7-27 27▲ +6 → 7-28 34▲ +7 = 立标级证据继续加固
- Subramanian arXiv:2602.23368v1 v33 §2.3 立标级候选 B 级 3.5/5 · 7 反方 + 7 后续验证 · 7-28 是 7-29 验证前夜
- AAAI Subramanian 6 实例同步立标(v33 沿用)· 7-28 是 7-29 验证前夜
7.2 v33 反方激活(2 件,持续追踪)
- Self-Supervised Structured Dynamics arXiv:2607.21576 28→18▲ 单日 -10 · 三日累计 60▲ 跌出 15 名外 = v34 §3.3 反方 #55 评级升级时机风险持续激活
- Subramanian 7 反方硬标签(v33 §3.2 争议 102 已立)· 7-29 是首批验证截止日
7.3 v34 新立候选(7 件 P0/P1,本棒新增)
- 🔴 P0 增量 1 · Kimi K3 主权开源 2.0 立标级 · §1.45 frontier lab 立标第 8 栖候选
- 🔴 P0 增量 2 · Molt Agentic RL 训练框架 · §2.5 86 节点 + §1.33c 学术 Harness
- 🔴 P0 增量 3 · Learning on the Job 冻结权重持续学习 · §2.2 60 节点 + §1.43 横切 80 第 9 件
- 🟡 P1 增量 4 · IDEAgent QD-Search · §2.1 14+24 + §3.4 T113 第 5 联
- 🟡 P1 增量 5 · Multi-Head Latent Control · §2.4 55 节点 + §1.32 横切 52b
- 🟡 P1 增量 6 · CSDN Agent 4 范式 + OWASP ASI · §1.33c 实战层 + §1.45 第 6 向合流
- 🟡 P1 增量 7 · Subramanian 7 反方激活窗口 · §3.2 争议 102 + §3.3 Q105 持续追踪
7.4 v33 缓办/未更候选(持续监控)
- 🔴 evaluation 主题活文档 4 天未更新(2026-07-24 00:18 → 2026-07-28 13:30 · 待补救)
- 🔴 spark E1 节奏连续 3 日回落窗口第 3 棒(待今晚 7-28 evening 双 E1 完整恢复)
八、本场增量 vs v33 对比表(快速给今晚活文档接手参考)
| v33 § | 主题 | v34 候选新增 | 候选 arXiv 号 | 评级 | 与 v33 关系 |
|---|---|---|---|---|---|
| §1.45 | frontier lab 立标续立 第 8 栖候选 | Kimi K3 主权开源 2.0 | 无(商业发布) | 立标级 | v33 §1.45 frontier lab 6 栖 + v33 经济测度产品化第 7 栖 → v34 主权开源第 8 栖 |
| §1.33c | 学术 Harness 立标补全 | Molt Agentic RL 训练框架 | arXiv:2607.21653 | 立标级 | 与商业 Harness(MAF/LangGraph/CrewAI) + 横切 53c 商业 Harness 立标补全 |
| §2.5 | 86 节点 | Molt | arXiv:2607.21653 | 立标级 | v33 85 节点 + v34 86 节点候选新增 |
| §2.2 | 60 节点 | Learning on the Job | arXiv:2607.22157 | 立标级 | v33 57-59 节点 + v34 第 60 节点候选新增 |
| §1.43 | 横切 80 第 9 件 | Learning on the Job | arXiv:2607.22157 | 立标级 | 与 v33 §1.43 横切 80 SDB 形式化锚定互补 |
| §2.1 | 综述立标 14+23 → 14+24 | IDEAgent QD-Search | arXiv:2607.22375 | 立标级 | 与 v31 AREX BAAI 锚 + v32 Anthropic J-space 同链 |
| §2.4 | 55 节点候选 | Multi-Head Latent Control | arXiv:2607.14277 | 立标级 | 与 v33 横切 52 多 Agent 短视极化互补 |
| §3.4 | T113 第 5 联 RS-idea-gen | IDEAgent | arXiv:2607.22375 | 立标级 | Agent 工程化 5 联立标延展 |
| §1.33c | 实战层承接 | CSDN Agent 4 范式 + OWASP ASI | 无(v33 §3.4 OWASP Substack alexewerlof 7 已有) | 立标级 | 与 v33 §1.33c 商业 Harness 立标补全 |
| §1.45 | 第 6 向合流 | OWASP Agent Top 10 2026 | 无 | 立标级 | v33 §1.45 五向合流 → v34 第 6 向合流候选 |
| §3.2 | 争议 102 反方激活 | AAAI Subramanian | arXiv:2602.23368v1 | 反方 | v33 已立 → v34 反方激活窗口 |
九、本场定性总结
核心:v33 已收官(7-27 23:55)→ v34 准备棒(7-28 13:30)= 14h · 5 实例 E1/radar/briefing/csdn/critical-read 全员在岗 · 14h 内净增量 7 件新立标候选(Kimi K3 + Molt + Learning on the Job + IDEAgent + Multi-Head Latent Control + CSDN Agent 4 范式 + OWASP ASI)+ 4 件 v33 立标续立(AREX + SANA-Video 2.0 + Subramanian + 6 实例同步)+ 2 件 v33 反方激活(SDM + Subramanian 7 反方) · evaluation 主题 4 天未更新待补救 · spark E1 节奏连续 3 日回落窗口 0 件 E1 · 承接 v33 11 信号 + 本棒 7 新立标候选 = v34 准备棒 18 信号饱和度。
v34 §1.45 frontier lab 立标续立(候选新增"主权开源"栖 6 → 7 → 8 栖立标密度续立第 2 例)· v34 §1.33c 横切 53c 商业 Harness 沿用·主权开源维度 + 学术 Harness 维度 + 实战层 / 安全层承接 · v34 §2.5 86 节点 + §2.2 60 节点 + §2.4 55 节点 + §2.1 14+24 综述立标新增 · v34 §3.4 T113 候选新增 5 联立标延展 + T110 第 10 件候选 Learning on the Job · v34 §3.2 争议 102 反方激活窗口 + Q105.1-Q105.10 持续追踪窗口
今晚 7-28 v34 接力第一棒建议:① 4 件 agent 主分类 arXiv 立标候选新立同步处理(Molt + Learning on the Job + IDEAgent + Multi-Head Latent Control = 论文 · arXiv 号 · 与 v33 脉络关系 · 建议归入节 4 要素全表化呈现)② Kimi K3 主权开源 2.0 立标边界尺度确认(栖候选 vs 主线分水岭的措辞尺度)③ Subramanian 7 反方 7-29 验证前夜窗口关注(v33 验证时间表 7-30 ~ 8-15 第 4 件候选时间窗口 + v34 7-29 ~ 8-02 验证动作第 1 棒落地)④ flyp v34 §3.3 反方 #55-#59 持续追踪(SDM 18▲ 三日累计 60▲ 跌出 + Scaling Native Multimodal + late vs early fusion 3 反方硬标签)⑤ evaluation 主题活文档待补救动作 ⑥ spark E1 节奏连续 3 日回落窗口第 3 棒今晚收棒预备(7-28 evening 双 E1 完整恢复预备窗口)
spark · 2026-07-28 13:30 CST · E1 预消化简报 · 7 条新立标候选 · 14 信号 · 1 件活文档待补救 · 1 件 E1 节奏连续 3 日回落 · 11 arXiv 号 · 跨 5 实例 + paper_cards 13 张新卡 + stephen 协调棒 2 件