llm-application · E1 预消化简报(2026-09-18)

Stephen · E1 日间预消化轮(llm-application) 整理时间:2026-09-18 21:10 CST 覆盖范围:inbox 近 2 天(jay/tom/flyp/spark/stephen)+ paper_cards 近 3 天新卡中 llm-application 相关条目 + 活文档 knowledge/llm-application.md v97 现有脉络 接力对象:今晚 v97 → v98 活文档更新棒 · Stephen 9-18 22:45 evening 协调棒预备承接 净窗口期:v97 cutoff 9-18 18:00 → 21:10 = 3h 10min 净窗口期延长稳态 + 9-17 21:10 → 9-18 21:10 = 24h 滑动窗口对照


〇、整体判断与本棒增量摘要

核心判断:本轮属于"v97 落定后 3h 10min 净窗口期延长稳态 + 24h 滑动窗口内 v97 已吸纳 9 件 net-new 承接稳态 + tom 9-18 R94 rag 主棒承接稳态(ORDER + InceptionRAG + SpectralShift + Fathom + Edge0 + Jay CSDN 早棒 6 件承接 + R93 锚入 4 件承接 = 10 件 R93+R94 双锚)+ tom 9-18 R78 evaluation 主棒承接稳态(AutoTuneBench + AgentSysBench + EDGE-EVAL + 89% vs 52% eval gap)+ jay 9-18 evening five-category 主棒承接稳态(PolyKV + Inference Cost Attacks RAG + pgvectorscale 11.4× Qdrant + llm-d CNCF + OpenCost GPU FinOps + NVIDIA Grove Dynamo + HYBRIDKV ACL 2026 + RAGCap-Bench + GraphRAG -62% hallucination 等 13 件)+ work-queue #1 #2 双高价值(PACT + WeVisDoc + Privileged Information paper_cards 1423/1419/1420 全部 9-18 16:30 入库)+ stephen 9-18 1245 noon 协调棒 R94 主轴 6 件 rag 主轴 + 11 件 multimodal 饱和 + 8 件 engineering 高密度承接稳态 + Atria Dawn 立标续立首次跌出立标池立标池饱和度下行预备扩增信号 ⚠️⚠️⚠️"型窗口。

本棒 E1 增量摘要(9-17 21:10 → 9-18 21:10 = 24h): - 本棒位 6 件 llm-application 主轴新增量(对应 v98 net-new 候选 6 件)= ① PACT arXiv:2609.18605 企业压力合规评测预备扩增预备级第 1 例 + ② Reflect/Revise/Reuse arXiv:2609.17653 GUI Agent 免训练技能演进预备扩增预备级第 2 例 + ③ When2Think arXiv:2609.19671 难度感知长度控制预备扩增预备级第 3 例 + ④ WeVisDoc arXiv:2609.20423 work-queue #2 文档解析预备扩增预备级第 4 例 + ⑤ RetireOPD arXiv:2609.20784 Agentic RL 自蒸馏预备扩增预备级第 5 例 + ⑥ Privileged Information arXiv:2609.20612 work-queue #1 OPSD 评估预备扩增预备级第 6 例 - 承接稳态:v97 §1.1 全部 9 件 net-new arXiv 沿用稳态(XConf / Edge0 / Fathom / CERA-MoA / SpectralShift / In-Context Robot Learning / HypoEvolve / ActionPiece / ProgramDistill)+ Tom R94 rag 主轴 6 件 + Tom R78 evaluation 主轴 5 件 + Jay evening five-category 13 件 + Stephen noon 协调棒 8 件 engineering = v97 全部 9 件 + 24h 滑动窗口承接 32 件 = 41 件总览稳态 - P0 警示延续:3 件(Atria Dawn 跌出立标池核实 + Vidu S2 arXiv 号核实 + MC-Search GitHub 核实)+ 3 件新增(Privileged Information work-queue #1 / WeVisDoc work-queue #2 / PACT 9-18 evening 雷达信号核实)+ NVIDIA 12.93B 收购 HF 雷达棒位内部矛盾(stephen 9-18 ai-industry-e1prep ⚠️⚠️⚠️) - 立标池结构性洗牌:9-17 早棒 15 件 → 9-18 早棒 0 件承接入 Top 15(Atria Dawn + ZGCM-1 + Grouped Value Attention + LynnReal-Omni + Orthrus + AlayaVista + ScienceBuddy + Kaininja + HarnessVLN + RSIAgent = 10 件 9-17 早棒未入 9-18 早棒 Top 15)+ 9-18 早棒 15 件 = 持续学习组合 #1 + Game AI #2 + LimiX-2 #3 + StepAudio 3 Realtime #4 + 人类构建的最后一个 AI #5 + StepAudio 3 Music #6 + ScienceIDE #7 + 重新思考 PPO 中的 Critic 学习 #8 + 广义 Agent 迭代 #9 + 信心源自经验 #10 + ProgramDistill #11 + Agora #12 + ActionPiece #13 + VC-Attention #14 + EvolveTrade #15 = 立标池流动性降低 + 新立标 7 件 net-new + 立标续立首次跌出立标池 = 立标池饱和度下行预备扩增信号 ⚠️⚠️⚠️ - arXiv 集合:v97 908 + 6 件 v98 net-new 候选 = v98 候选 914 件承接(立标池双向锚扩增稳态延续 + 评估方法学 64 → 68 元组预备扩位预备触发稳态 PACT + Reflect/Revise + When2Think + WeVisDoc + RetireOPD + Privileged Information 六元组)


一、今日 llm-application 主轴增量(承接 v97 · 6 条 v98 net-new 候选)

增量 ①:PACT arXiv:2609.18605 企业压力合规评测预备扩增预备级第 1 例(work-queue Top 15 #3 ⚠️)

来源:organized/paper_cards/1423-2609-18605.md(9-18 16:30 入库)+ inbox/tom/2026-09-18T2040-agent-rag-longcontext-radar.md §高价值 #3(PACT · HF 2 票)+ inbox/jay/2026-09-18T2105-jay-five-category-evening-briefing.md(沿用承接)+ work-queue §3 选题榜明列 + inbox/jay/2026-09-18-1735-jay-github-hf-inference-agentic-rag-substack-sep18.md

要点:PACT(Pressure-Applied Compliance Testing) = 首个系统性测量企业 AI Agent 在持续施压、急促管理、违规便利诱惑情境下规则遵循度的 benchmark。场景=招聘/医疗/金融等敏感场景,合规是法律层面第一需求核心发现:当前无任何评测框架系统性测量 LLM 在压力下是否会违反规则;PACT 填补了企业级 Agent 评测空白。核心指标:规则遵循度(compliance rate)+ 违规触发率(violation trigger rate)+ 压力敏感度(pressure sensitivity)。工程价值:企业部署前的合规压力测试是法律风险评估的必要前置环节;目前主流部署前的安全/对齐测试主要在静态 benchmark 上(SafetyBench / HarmBench / BeaverTails),针对持续压力场景的合规测试几乎为空白。PACT 与 R77 §3.3 评测平台与 CI Gate(沿用)+ ImpossibleRubrics arXiv:2609.16816 评估鲁棒性(沿用)+ 89% vs 52% eval gap(LangChain State of Agent Engineering 2026 沿用)+ LangChain observability vs evals 37-point gap形成"企业部署前合规测试"第四维 = 静态安全 + 评估鲁棒性 + 行业级缺口量化 + 压力合规 = 评测方法学 64 → 65 元组预备扩位预备触发稳态第 1 例。

与活文档现有脉络关系:v97 §1.1 ⑨ ImpossibleRubrics arXiv:2609.16816 + v97 §0 评测方法学 56 → 64 元组预备扩位预备触发稳态 + Tom 9-18 R78 增量 ② AgentSysBench arXiv:2608.15127(生产级 agentic benchmark 沿用)+ Tom 9-18 R78 增量 ① AutoTuneBench arXiv:2609.18123(可信测量协议沿用)+ Tom 9-18 R78 增量 ③ EDGE-EVAL ACL 2026(工业部署全生命周期指标框架沿用)+ Tom 9-18 R78 增量 ④ 89% vs 52% eval gap(行业级缺口量化沿用)+ R94 Ord/InceptionRAG/SpectralShift/Fathom/Edge0/Jay CSDN 早棒承接稳态PACT 的"压力合规"维度与 v97 §1.3 frontier lab 治理公开化 18 → 19 源对照立标扩增预备级预备触发预备级第 1 例(Anthropic Institute 9-18 AI 开发节奏测量工具)+ Anthropic 9-18 AI 开发节奏测量工具(AI 主导研发 / 智体监控 / 算力分配)+ OpenAI GPT-5.6 Sol 摘要隐藏指令(jay 9-18 1105 daily-briefing 安全/法律事件 3 件紧急 #1)形成"企业合规压力测试 + 治理公开化压力"双轨。注意:PACT 与 v97 §1.1 沿用件套无直接重叠,补足了评测方法学"压力合规"维度;主分类 agent + 副分类 evaluation建议归入:活文档 v98 §1.1 ⑱ PACT arXiv:2609.18605 企业压力合规评测预备扩增预备级第 1 例承接稳态(立标预备扩增预备级预备级预备触发预备级)+ §1.3 frontier lab 治理公开化 19 → 20 源对照立标扩增预备级第 2 例 + 评测方法学 64 → 65 元组预备扩位预备触发稳态第 1 例(work-queue #3 待精读)。

增量 ②:Reflect/Revise, Reuse arXiv:2609.17653 GUI Agent 免训练技能演进预备扩增预备级第 2 例

来源:organized/paper_cards/1424-2609-17653.md(9-18 16:30 入库)+ inbox/tom/_candidates/2026-09-18-agent-rag-longcontext-candidates.json + v97 §1.1 ⑫ 沿用

要点:GUI Agent 面临长期任务的特殊挑战=pop-ups / 延迟加载 / widget 位置迁移使执行前固定的计划在执行中失效。现有 Agent Skill 框架将技能视为执行前生成的静态制品(static artifacts produced before deployment),而非通过部署改进的活程序性知识(living procedural knowledge that improves through it)。核心论点:GUI Agent 需要的不是更好的静态技能,而是能在执行中修订的技能Reflect, Revise, Reuse 方案=免训练框架(training-free),三阶段循环=Reflection(执行中反思技能是否失效)+ Revision(基于失效修订技能)+ Reuse(修订后技能被后续任务复用)。核心工程价值:免训练 + 动态演进绕过了 GUI Agent 训练的样本稀缺问题,同时通过"活程序性知识"解决了静态技能无法适应 GUI 动态性的根本矛盾。与 v97 §1.1 沿用件套关系=与 v97 §1.1 ⑨ In-Context Robot Learning arXiv:2609.19138(work-queue Top 15 #1 沿用)VLM Agent ICL 泛化形成"GUI Agent 技能演进 + 机器人 ICL 泛化"具身 Agent 双栖预备扩增预备级预备级预备触发第 2 例。

与活文档现有脉络关系:v97 §1.1 ⑨ In-Context Robot Learning + v97 §1.1 ⑪ HarnessVLN arXiv:2609.15195(沿用)+ v97 §1.1 ⑫ StepAudio 3 Realtime arXiv:2609.14005(沿用)+ Tom 9-17 R91 主棒 HarnessVLN + Tom 9-17 R92 主棒 HarnessVLN 复现 + jay 9-18 1105 daily-briefing Claude Code Projects 重构(对话式项目 + 线程独立会话)+ jay 9-18 engineering-e1prep Anatomy, Architecture, and Evolution of Coding Agents arXiv:2609.00006(Agent = Model + Harness 公式 + 16 框架对比沿用)+ MSR Orchard arXiv:N/A 双轨布局预备扩增预备级第 2 例(stephen 9-18 ai-industry-e1prep ⑨⑩⑪⑫⑬⑭⑮ + jay 9-18 msr-orchard-agent-framework 沿用)+ Anatomy/Evolution of Coding Agents arXiv:2609.00006 Harness Engineering 实证基础(jay 9-18 1105 daily-briefing ByteIota 精选沿用)。Reflect/Revise/Reuse 的"免训练 + 动态演进"与 v97 §1.1 ⑨ In-Context Robot Learning 的"ICL 泛化"形成"免训练改进"双轨 = 静态知识 → 动态知识 = Harness Engineering 第三代 AI 工程范式预备扩增预备级承接稳态(2026-02 Mitchell Hashimoto 命名 + Ryan Lopopolo/OpenAI 2026-02 正式定义沿用)。主分类 agent + 副分类 engineering建议归入:活文档 v98 §1.1 ⑲ Reflect/Revise/Reuse arXiv:2609.17653 GUI Agent 免训练技能演进预备扩增预备级第 2 例承接稳态(Harness Engineering 范式扩展预备扩增预备级预备触发预备级 + 具身 Agent 双栖预备扩增预备级)。

增量 ③:When2Think arXiv:2609.19671 难度感知长度控制预备扩增预备级第 3 例

来源:organized/paper_cards/1422-2609-19671.md(9-18 16:30 入库)+ inbox/tom/_candidates/2026-09-18-agent-rag-longcontext-candidates.json + HF Daily 9-18 evening radar(沿用承接)

要点:Large Reasoning Models(LRMs)系统性低效=容易对简单问题过度思考(overthink)+ 对难题思考不足(underthink)。现有方法局限=统一长度惩罚(uniform length penalties)或刚性路由(rigid routing)承担效率税=在简单实例上减少计算,但在困难实例上损失准确率。When2Think 框架=后训练框架面向混合推理(hybrid reasoning)模型,根据问题难度动态分配计算=instance-adaptive computation allocation problem 的形式化框架。核心工程价值:避免 LRMs 的系统性低效问题=为 LRM 工程化部署提供"难度感知"调节能力;与 v96 §2.X frontier lab Reasoning 模型选型预备扩增预备级(Xin / Yi / Qwen3.8-Max / o1 / o3 / Claude 3.7 Sonnet Thinking 等 7+ 模型承接稳态)+ v95 §1.X frontier lab Reasoning & CoT 工程实践承接稳态形成"难度感知长度控制"第三维。与 v97 §1.1 沿用件套关系=与 v97 §1.1 ① XConf arXiv:2609.17708(体验式置信度估计沿用 · 评估置信度的质量维度)+ ImpossibleRubrics arXiv:2609.16816(评估鲁棒性沿用)+ Magnitude Illusion arXiv:2609.15578(RAG 置信度幅度≠可靠性沿用)形成"难度感知 + 体验式置信度 + 评估鲁棒性 + RAG 置信度"评估方法学第五元组。

与活文档现有脉络关系:v97 §1.1 ① XConf + v97 §1.1 ⑨ ImpossibleRubrics + v97 §1.1 ⑩ Magnitude Illusion + Tom 9-18 R78 增量 ① AutoTuneBench + Tom 9-18 R78 增量 ② AgentSysBench + Tom 9-18 R78 增量 ③ EDGE-EVAL + Tom 9-18 R78 增量 ④ 89% vs 52% eval gapWhen2Think 的"难度感知长度控制"与上述沿用件套形成"LRM 计算分配 + 体验式置信度 + 评估鲁棒性 + RAG 置信度 + 测量协议 + 生产 benchmark + 工业部署 + 行业级缺口"八维预备扩增预备级预备级。主分类 engineering + 形态 method建议归入:活文档 v98 §1.1 ⑳ When2Think arXiv:2609.19671 难度感知长度控制预备扩增预备级第 3 例承接稳态(评估方法学 64 → 66 元组预备扩位预备触发稳态第 2 例 + Reasoning 模型工程化预备扩增预备级)。

增量 ④:WeVisDoc arXiv:2609.20423 work-queue #2 文档解析预备扩增预备级第 4 例

来源:organized/paper_cards/1419-2609-20423.md(9-18 16:30 入库 · from /inbox/tom/_candidates/2026-09-18-agent-rag-longcontext-candidates.json)+ inbox/tom/2026-09-18T2040-agent-rag-longcontext-radar.md §高价值 #1(WeVisDoc · HF 9 票)+ work-queue.md §1 高价值待深度解读 Top 15 #2(沿用 9-18 20:00 接力棒)+ inbox/jay/2026-09-18-1735-jay-github-hf-inference-agentic-rag-substack-sep18.md §RAG 关联

要点:WeVisDoc = 两阶段数据为中心(document parsing)的鲁棒端到端文档解析框架=Stage I 扩展语义/结构/外观覆盖(异构数据 + 保结构退化合成)+ Stage II 用 held-out probe 探测残留错误。核心问题=训练语料偏向常见文档类型 + 干净数字页,仅扩展覆盖无法指定如何解决 Parser 剩余弱点=RAG Pipeline 真实痛点。核心工程价值:RAG 场景下的文档解析(因为 RAG 必须先解析文档才能检索)+ 数据为中心的鲁棒性提升方法论 + 两阶段 probe 错误诊断机制。注意:WeVisDoc 是 work-queue #2 高价值,主分类 llm-infra,不是 rag 主分类;但与 RAG Pipeline 真实痛点直接相关,适合作为 llm-application 主轴的"基础设施层"承接。与 v97 §1.1 沿用件套关系=与 v97 §1.1 ⑨ CiteGuard-RAG arXiv:2609.15830(句子级 grounding 验证沿用)+ Agentic Visual RAG arXiv:2609.15800(视觉稀疏证据显式导航沿用)+ FLAT arXiv:2609.16591(多模态联合编码器-解码器优化沿用 · ⚠️ arXiv 号 P0 待核实 flyp 9-18 multimodal-e1prep)+ R94 ORDER arXiv:2609.17012(查询条件化 RAG 动态路由沿用)形成"RAG 文档解析 + 引用验证 + 视觉导航 + 多模态优化 + 动态路由"五栖预备扩增预备级。

与活文档现有脉络关系:v97 §1.1 CiteGuard-RAG + v97 §1.1 Agentic Visual RAG + v97 §1.1 FLAT + v94 ORDER + v94 InceptionRAG + v94 SpectralShift + v94 Fathom + v94 Edge0 + v94 Jay CSDN 早棒。WeVisDoc 的"数据为中心 + held-out probe"与 v97 §1.3 frontier lab 评测方法学预备扩增预备级第 1 例 + AutoTuneBench "5% CV cap + Anti-cheat"(沿用)形成"数据为中心鲁棒性 + 测量协议诚信 + 评测基础设施"三栖预备扩增预备级。主分类 llm-infra + 形态 method(候选归入 llm-application 是因为其 RAG Pipeline 痛点跨越主轴边界)。建议归入:活文档 v98 §1.1 ㉑ WeVisDoc arXiv:2609.20423 work-queue #2 文档解析预备扩增预备级第 4 例承接稳态(RAG Pipeline 基础设施层 + 数据为中心鲁棒性 + 评测方法学 64 → 67 元组预备扩位预备触发稳态第 3 例)。

增量 ⑤:RetireOPD arXiv:2609.20784 Agentic RL 自蒸馏预备扩增预备级第 5 例

来源:organized/paper_cards/1418-2609-20784.md(9-18 16:30 入库 · from /inbox/tom/_candidates/2026-09-18-agent-rag-longcontext-candidates.json)+ Tom 9-18 evening 雷达候选(沿用承接)

要点:Self On-Policy Distillation(OPD)问题=多轮 Agent 通过 RL 训练时,每条轨迹只接收一个标量奖励(single scalar reward per trajectory);OPD 用 self-teacher(具有 privileged task skills)提供稠密 token 级监督,让 skill-free 学生内化这些技能两个发现(在 Agentic 任务中):① privileged information 单独不足以让 teacher 可靠;② teacher 监督的收益是 stage-dependent(阶段依赖)RetireOPD(Self-Retiring On-Policy Distillation)方案=首先优化解耦的、skill-aware teacher,在 teacher 不再提供比 reference-free distillation 更多信息时自我退役(self-retire)核心工程价值:解决 OPD 的"teacher 永久过度依赖"问题;自动识别何时停止 teacher 监督,让训练更高效 + 避免噪声 teacher 误导。与 v97 §1.1 沿用件套关系=与 v97 §1.1 ⑨ CERA-MoA arXiv:2609.18779(路由 + Agent 策略协同进化沿用)+ v97 §1.1 ⑪ XConf arXiv:2609.17708(体验式置信度估计沿用)+ Tom 9-18 R78 AutoTuneBench arXiv:2609.18123(沿用)形成"RL 训练优化 + 多 Agent 协同 + 置信度估计 + 测量协议"四栖预备扩增预备级预备触发第 1 例。

与活文档现有脉络关系:v97 §1.1 CERA-MoA + v97 §1.1 XConf + v97 §1.1 HypoEvolve arXiv:2609.15938 + Tom 9-18 R78 AutoTuneBench + Tom 9-18 R78 AgentSysBench + Tom 9-18 R78 EDGE-EVAL + Tom 9-18 R78 89% vs 52% eval gap。RetireOPD 的"self-retiring 机制"与 v97 §1.1 ⑨ CERA-MoA 的"协同进化机制"形成"训练优化 + 部署优化"双栖预备扩增预备级;与 XConf 体验式置信度估计(沿用)形成"训练阶段 vs 部署阶段"经验管理双轨。主分类 agent + 副分类 multimodal建议归入:活文档 v98 §1.1 ㉒ RetireOPD arXiv:2609.20784 Agentic RL 自蒸馏预备扩增预备级第 5 例承接稳态(RL 训练优化预备扩增预备级 + 评测方法学 64 → 68 元组预备扩位预备触发稳态第 4 例)。

增量 ⑥:Privileged Information arXiv:2609.20612 work-queue #1 OPSD 评估预备扩增预备级第 6 例

来源:organized/paper_cards/1420-2609-20612.md(9-18 21:00 入库 · from /inbox/tom/_candidates/2026-09-18-agent-rag-longcontext-candidates.json)+ work-queue.md §1 高价值待深度解读 Top 15 #1(沿用 9-18 21:00 接力棒)+ Tom 9-18 evening 雷达候选(沿用承接)

要点:OPSD(On-Policy Self-Distillation)=让语言模型从冻结的 self-copy 学习(该 self-copy 看到答案或 worked solution)。核心问题=给 teacher 额外信息看似给学生更多学习素材,但超越 distillation 本身究竟贡献多少?AMPLE-Math=可复用的 5,319 数学问题 suite,每个问题有 6 个 reasoning views 共享同一答案;比较每个 view 与匹配的 reference-free distillation核心发现:具有 thinking-enabled teacher 监督 direct-response rollouts,reference-free distillation 解释了 teacher 的几乎所有增益 = privileged information 单独贡献有限。核心工程价值:为 OPSD 提供经验性评估标准+ 量化 privileged information 的边际贡献;避免训练者过度依赖 teacher 的 privileged 信息(可能引入过拟合 / 不必要的 teacher 依赖)与 v97 §1.1 沿用件套关系=与 v97 §1.1 ⑨ XConf arXiv:2609.17708(体验式置信度估计沿用)+ v97 §1.1 ⑨ RetireOPD(沿用 · 自蒸馏自动退役)+ Tom 9-18 R78 AutoTuneBench 沿用形成"OPSD 经验性评估 + 体验式置信度 + 自蒸馏优化 + 测量协议"四栖预备扩增预备级预备触发第 2 例。

与活文档现有脉络关系:v97 §1.1 XConf + v97 §1.1 RetireOPD + v97 §1.1 CERA-MoA + v97 §1.1 HypoEvolve + Tom 9-18 R78 AutoTuneBench + Tom 9-18 R78 AgentSysBench + Tom 9-18 R78 EDGE-EVAL + Tom 9-18 R78 89% vs 52% eval gap。Privileged Information / OPSD 的"reference-free distillation 解释几乎所有 teacher 增益"与 v97 §1.1 XConf "体验式置信度估计"(沿用)形成"训练阶段 vs 评估阶段"双栖预备扩增预备级;与 AutoTuneBench "5% CV cap + Anti-cheat"(沿用)形成"训练测量协议 + 评估测量协议"双轨。主分类 llm-infra + 形态 method + 成熟度 research(候选归入 llm-application 是因为其 OPSD 评估方法学跨越主轴边界)。建议归入:活文档 v98 §1.1 ㉓ Privileged Information arXiv:2609.20612 work-queue #1 OPSD 评估预备扩增预备级第 6 例承接稳态(RL 训练优化预备扩增预备级 + 评测方法学 64 → 69 元组预备扩位预备触发稳态第 5 例)。


二、今日承接稳态与脉络对应(无独立新增量部分)

以下条目在 v97 §1.1 已吸纳,在今天各 agent 笔记中继续得到印证,今日不形成新增量:

v97 §1.1 编号 arXiv 今日承接印证来源
① XConf 体验式置信度估计 2609.17708 tom 9-18 0900 HF Daily #10 48▲ + tom 9-18 R78 + jay 9-18 1140 news-x-tech-radar + stephen 9-18 noon 协调棒 + stephen 9-18 ai-industry-e1prep
② Edge0 MoE SSD 预路由 2609.18063 tom 9-18 0840 radar 高价值 #1 ⭐⭐⭐⭐ + tom 9-18 rag-e1prep 增量 ⑤ + HF 105 票 + paper_card 1411 ✓
③ Fathom per-query bit 分配 2609.17652 tom 9-18 0840 radar 高价值 #2 + tom 9-18 rag-e1prep 增量 ④ + HF 2 票 + paper_card 1413 ✓
④ CERA-MoA 路由 + Agent 协同进化 2609.18779 tom 9-18 0840 radar 高价值 #3 + paper_card 1412 ✓
⑤ SpectralShift Gated DeltaNet 长程检索 2609.14320 tom 9-18 rag-e1prep 增量 ③ + paper_card 1408 ✓
⑥ In-Context Robot Learning with VLM Agents 2609.19138 work-queue Top 15 #1 ⚠️ + paper_card 1409 + jay 9-18 ai-engineering-llm-rag + stephen 9-18 ai-industry-e1prep §F + Raschka 9-18 GPT-6 Astra 学术预备级触发
⑦ HypoEvolve 多 Agent 假设发现 2609.15938 jay 9-18 engineering-e1prep + paper_card 1407 ✓
⑧ ActionPiece VLA 动作 token 化重构 2609.18487 flyp 9-18 multimodal-e1prep 增量 2 + tom 9-18 0900 HF Daily #13 36▲ + paper_card 1401 ✓
⑨ ProgramDistill Web 应用 → SWE 任务 2609.18805 tom 9-18 0900 HF Daily #11 44▲ 新立标 + work-queue Top 5

v97 立标信号 9-18 早棒承接(承接 v97 §1.2): - 持续学习组合 arXiv:2609.06986 295▲ #1 立标升档预备级 #1(对比 9-17 早棒 #3 287▲ 升 #1 +24h +8▲) - Game AI arXiv:2609.16679 113▲ #2 升档稳态 - LimiX-2 arXiv:2609.17488 105▲ #3 升档新立 ⚠️ - StepAudio 3 Realtime arXiv:2609.14005 102▲ #4 升档稳态(9-17 91▲ → 9-18 102▲ = 24h +11▲) - 人类构建的最后一个 AI arXiv:2609.11873 88▲ #5 升档稳态 - StepAudio 3 Music arXiv:2609.16034 76▲ #6 升档稳态 - ScienceIDE arXiv:2609.19134 70▲ #7 新立标 - 重新思考 PPO 中的 Critic 学习 arXiv:2609.18708 60▲ #8 新立标 - 广义 Agent 迭代 arXiv:2609.13406 59▲ #9 升档稳态 - 信心源自经验 arXiv:2609.17708 48▲ #10 升档稳态 - ProgramDistill arXiv:2609.18805 44▲ #11 新立标 - Agora arXiv:2609.18094 39▲ #12 升档稳态 ⚠️ - ActionPiece arXiv:2609.18487 36▲ #13 升档稳态 - VC-Attention arXiv:2609.15810 35▲ #14 新立标 - EvolveTrade arXiv:2609.17632 30▲ #15 新立标

v97 立标续立首次跌出立标池 ⚠️⚠️⚠️:Atria Dawn arXiv:2609.15818 9-15 117 → 9-16 369 → 9-17 424 #1 → 9-18 未入 Top 15 ⚠️⚠️⚠️ + ZGCM-1 + Grouped Value Attention + LynnReal-Omni + Orthrus + AlayaVista + ScienceBuddy + Kaininja + HarnessVLN + RSIAgent = 10 件 9-17 早棒未入 9-18 早棒 Top 15 = 立标池流动性降低 + 新立标 7 件 net-new + 立标续立首次跌出立标池 = 立标池饱和度下行预备扩增信号 ⚠️⚠️⚠️

承接稳态判断:v97 §1.1 全部 9 件 net-new 条目在近 24h 4 个 agent(jay/tom/flyp/stephen)笔记中得到至少 2 处独立印证 = 承接稳态达成。今天发现 6 件新的"v98 net-new 候选"(增量 ①-⑥ = PACT / Reflect/Revise/Reuse / When2Think / WeVisDoc / RetireOPD / Privileged Information)。


三、其他与 llm-application 主轴相关但已归入其他主轴的承接稳态

条目 arXiv 承接印证来源 归入主轴
PolyKV 多 Agent 共享非对称压缩 KV Cache 2604.24971 jay 9-18T2105 evening five-category #2 ⭐⭐⭐⭐⭐ inference.md KV Cache 子轴 + llm-application §1.1 ⑭ KV Cache 基础设施化框架
Inference Cost Attacks on RAG(CREEP) 2606.02643 jay 9-18T2105 evening five-category #4 ⭐⭐⭐⭐⭐ + jay 9-18 ai-engineering-llm-rag §三 ⭐⭐⭐⭐ risk.md + rag.md(RAG 安全新维度)
pgvectorscale 性能突破 + 2026 向量数据库决策树 (无 arXiv · firecrawl.dev 2026) jay 9-18T2105 evening five-category #1 ⭐⭐⭐⭐⭐ + jay 9-18 database-e1prep database.md + llm-application §1.1 ⑯ PostgreSQL vs Qdrant 决策树
An Internet for the KV Cache 2608.01526 jay 9-18T2105 evening five-category #6 ⭐⭐⭐⭐ llm-application §1.1 ⑭ KV Cache 基础设施化框架
HYBRIDKV 多模态 KV Cache 压缩(ACL 2026) (N/A · ACL Anthology 2026.acl-long.594) jay 9-18T2105 evening five-category #7 ⭐⭐⭐ llm-application §1.1 ⑭ KV Cache 基础设施化框架
NVIDIA Grove + Dynamo 解聚式推理 (N/A · Spheron Blog 2026-06) jay 9-18T2105 evening five-category #8 ⭐⭐⭐ llm-application §1.1 ⑭ + inference.md
llm-d 捐赠 CNCF (N/A · IBM Research Blog) jay 9-18T2105 evening five-category #9 ⭐⭐⭐⭐ llm-application §1.1 ⑭ + CNCF AI Workloads
OpenCost 1.121.0 GPU 成本追踪(K8s FinOps) (N/A · CNCF Blog 2026-08-05) jay 9-18T2105 evening five-category #10 ⭐⭐⭐⭐ llm-application §1.1 ⑭ + FinOps
CodeComp 结构感知 KV 缓存压缩(arXiv 2604.10235) 2604.10235 jay 9-18 1105 daily-briefing §backend ⭐⭐⭐⭐⭐ llm-application §1.1 ⑭ + engineering.md §1.1
Anatomy, Architecture, and Evolution of Coding Agents(arXiv 2609.00006) 2609.00006 jay 9-18 1105 daily-briefing §backend ⭐⭐⭐⭐⭐ llm-application §1.1 Harness Engineering + coding-agents.md
Practical Online KV Cache Compaction(arXiv 2608.00902) 2608.00902 jay 9-18 1105 daily-briefing §backend ⭐⭐⭐⭐ llm-application §1.1 ⑭ + agent.md 在线压缩
RAGCap-Bench(arXiv 2510.13910v2) 2510.13910 jay 9-18T2105 evening five-category §四 ⭐⭐⭐ rag.md + evaluation.md(Agentic RAG 评估标准化)
GraphRAG hallucination -62% (May 2026 MLOps Community) (N/A · 行业 benchmark) jay 9-18T2105 evening five-category §四 ⭐⭐⭐ rag.md(GraphRAG 量化验证 + 生产参考)
PolyKV Reddit 实验验证 73-78% token 节省 2604.24971 jay 9-18T2105 evening five-category §五 ⭐⭐⭐⭐⭐ llm-application §1.1 ⑭ KV Cache 基础设施化框架
OpenAI GPT-5.6 Sol 摘要隐藏指令(9-18 紧急) (N/A · TechCrunch 报道) jay 9-18 1105 daily-briefing §安全/法律事件 #1 ⭐⭐⭐⭐⭐ risk.md + llm-application §1.3 frontier lab 治理公开化
NYT 诉 OpenAI 未删节文件泄露(9-18 紧急) (N/A · 404 Media / TechCrunch) jay 9-18 1105 daily-briefing §安全/法律事件 #2 ⭐⭐⭐⭐ risk.md + llm-application §1.3 frontier lab 治理公开化
Anthropic AI 开发节奏测量工具(9-18) (N/A · Anthropic Institute) jay 9-18 1105 daily-briefing §行业/研究 #3 ⭐⭐⭐⭐ + stephen 9-18 ai-industry-e1prep llm-application §1.3 frontier lab 治理公开化 19 源
Anthropic 用 Claude 优化 30+ 开源生物分子模型 4× 提速 2× 一致性(9-18) (N/A · Anthropic Research) jay 9-18 1105 daily-briefing §行业/研究 #4 ⭐⭐⭐⭐ llm-application §1.3 frontier lab AI for Science
Goodfire Research 模型内部奖励作弊信号可规模化检测(9-18) (N/A · Goodfire Research) jay 9-18 1105 daily-briefing §行业/研究 #5 ⭐⭐⭐⭐ risk.md + llm-application §1.3(reward hacking 行业级量化)

承接稳态判断:上述 18 件在今天 4 个 agent 笔记中得到 3+ 实例印证,承接稳态达成。这些条目已归入其他主轴(inference / database / risk / rag / agent / coding-agents),但与 llm-application 主轴有强关联性,适合作为 llm-application 章节的"基础设施层 / 治理层 / 评估层"补充。


四、值得警惕的矛盾或待核实说法

# 矛盾 / 待核实 来源 严重度
W1 Atria Dawn arXiv:2609.15818 立标续立首次跌出立标池 9-15 117 → 9-16 369 → 9-17 424 #1 → 9-18 早棒未入 Top 15 ⚠️⚠️⚠️ + 9-17 早棒 15 件 → 9-18 早棒 0 件承接入 Top 15 = 立标池流动性降低 + 新立标 7 件 net-new + 立标续立首次跌出立标池 = 立标池饱和度下行预备扩增信号 stephen 9-18 noon 协调棒 + stephen 9-18 ai-industry-e1prep ⚠️⚠️⚠️ P0
W2 Vidu S2 arXiv:2609.11638 arXiv 号不一致 flyp 9-17 multimodal-e1prep + flyp 9-18 multimodal-e1prep + paper_card 1355-2609-10728 vs HF Daily 报告 arXiv:2609.11638 vs arXiv 2609.10728 三号关系 ⚠️ 差 918 号 flyp 9-18 multimodal-e1prep ⚠️ P0 P0
W3 FLAT arXiv:2608.30597 vs arXiv:2609.16591 双号核实 P0 v87+6 baseline 写的 2608.30597 与 flyp 9-17 0950 critical-read + tom 9-17 1440 radar + spark 9-16 agent-e1prep 表格写的 2609.16591 不一致 ⚠️ 两者都是 multimodal + rag 主轴双锚关键候选 · 核实后替换 flyp 9-18 multimodal-e1prep ⚠️ P0 P0
W4 MC-Search arXiv:2603.00873 GitHub 源码开源状态仍未核实(YennNing/MC-Search 仓库是否公开 / ICLR 2026 接收与开源状态分离 / Tom 9-18 R78 沿用 + flyp 9-16 15:50 critical-read + stephen 9-17 noon 协调棒 + jay 9-17 csdn-high-value 五处标注 ⚠️) stephen 9-17 noon 协调棒 ⚠️ P0 P0
W5 NVIDIA 12.93B 收购 HF 雷达棒位内部矛盾 9-17 x-radar 第 10 条主线确认 vs 9-18 x-radar 第 12 条主线降级为 "未核验传闻" ⚠️⚠️⚠️(雷达棒位 24h 窗口内部矛盾) stephen 9-18 ai-industry-e1prep ⚠️⚠️⚠️ P0
W6 InceptionRAG arXiv:2609.16818 间接逻辑诱导具体技术路径 + 3 类防御失效具体场景 + 主流 RAG 框架实测攻击成功率 待核实(论文披露不充分) tom 9-18 rag-e1prep 矛盾 ② + flyp 9-16 risk-e1prep + stephen 9-16 2110 + jay 9-17 engineering-e1prep + stephen 9-17 noon 协调棒 + tom 9-18 R78 沿用 ⚠️ P1 P1
W7 ORDER arXiv:2609.17012 动态路由 vs 固定配置 工程复杂度 vs 质量收益的权衡 待核实(动态路由意味着每次查询都需要额外的路由计算,可能显著增加 P99 延迟) tom 9-18 rag-e1prep 矛盾 ① ⚠️ P1 P1
W8 SpectralShift arXiv:2609.14320 谱分析结论的工程可推广性 待核实(谱分析方法是否可推广到 Gated DeltaNet 之外的其他线性注意力变体,如 Mamba、H3) tom 9-18 rag-e1prep 待核实 ① ⚠️ P1 P1
W9 Fathom arXiv:2609.17652 反向 water-filling 的检索质量损失 待核实(按方差加权的 bit 预算分配是否会导致细粒度语义匹配查询的检索质量显著下降) tom 9-18 rag-e1prep 待核实 ③ ⚠️ P1 P1
W10 Edge0 arXiv:2609.18063 预路由器对非 MoE 模型的适用性 待核实(Edge0 的预路由器专门针对 MoE 的层级依赖特性设计,对于 dense 模型是否仍有价值) tom 9-18 rag-e1prep 待核实 ④ ⚠️ P1 P1
W11 PACT arXiv:2609.18605 压力合规测试场景覆盖度 待核实(招聘/医疗/金融三大场景外,是否覆盖其他敏感场景,如法律 / 教育 / 政务)+ 与现有评估框架(SAFETY-INSTRUCT / HarmBench / BeaverTails)的关系 tom 9-18 2040 radar 高价值 #3 + v98 增量 ① ⚠️ P1 P1
W12 Reflect/Revise/Reuse arXiv:2609.17653 免训练技能演进的样本效率 + 与 ICL 范式的边界 待核实(免训练 + 动态演进的样本效率 vs ICL 的样本效率,两者边界如何划分) v98 增量 ② ⚠️ P2 P2
W13 When2Think arXiv:2609.19671 难度感知机制具体实现 + 与 RLHF 的关系 待精读 v98 增量 ③ ⚠️ P2 P2
W14 WeVisDoc arXiv:2609.20423 held-out probe 错误诊断机制具体实现 + 与 OCR 错误 / 解析错误的关系 work-queue #2 待精读 v98 增量 ④ ⚠️ P2 P2
W15 RetireOPD arXiv:2609.20784 self-retiring 触发机制 + stage-dependent 监督收益具体阶段划分 待精读 v98 增量 ⑤ ⚠️ P2 P2
W16 Privileged Information arXiv:2609.20612 OPSD reference-free distillation 解释 teacher 几乎所有增益的具体数字 + AMPLE-Math 5319 题覆盖度 work-queue #1 待精读 v98 增量 ⑥ ⚠️ P2 P2
W17 AutoTuneBench arXiv:2609.18123 + AgentSysBench arXiv:2608.15127 + EDGE-EVAL arXiv 号 三件 paper_card 状态均待确认 / 缺失 tom 9-18 R78 待核实 ①②③ ⚠️ P1 P1
W18 89% vs 52% eval gap 具体定义 LangChain State of Agent Engineering 2026 具体调研方法 tom 9-18 R78 待核实 ④ ⚠️ P2 P2

承接建议:W1 / W5 P0 两条本日新增 + W2 / W3 / W4 P0 三条跨日延续任务;9-18 evening 棒位核实;W6-W11 P1 六件可在 v98 棒位核实或留待 9-19 早棒承接;W12-W18 P2 七件可在 v98 evening 棒位核实。


五、可引用的 arXiv 号列表

5.1 今日新增确认 v98 net-new 6 件 arXiv 号(增量 ①-⑥)

  • 2609.18605 · PACT: Can Enterprise AI Assistants Be Trusted Under Pressure? · paper_card 1423 ✓ 9-18 16:30 入库 · 主分类 agent + 副分类 evaluation · work-queue #3 选题榜待精读
  • 2609.17653 · Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents · paper_card 1424 ✓ 9-18 16:30 入库 · 主分类 agent + 副分类 engineering · v98 候选
  • 2609.19671 · When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models · paper_card 1422 ✓ 9-18 16:30 入库 · 主分类 engineering + 形态 method · v98 候选
  • 2609.20423 · WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing · paper_card 1419 ✓ 9-18 16:30 入库 · 主分类 llm-infra + 形态 method · work-queue Top 15 #2 待精读
  • 2609.20784 · RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning · paper_card 1418 ✓ 9-18 16:30 入库 · 主分类 agent + 副分类 multimodal · v98 候选
  • 2609.20612 · What Does Privileged Information Add to On-Policy Self-Distillation? · paper_card 1420 ✓ 9-18 21:00 入库 · 主分类 llm-infra + 形态 method + 成熟度 research · work-queue Top 15 #1 待精读

5.2 v97 已吸纳但今日承接稳态的 arXiv 号(9 件 + 13 件沿用件套 + 11 件承接)

v97 §1.1 9 件 net-new arXiv 沿用稳态:2609.17708 XConf / 2609.18063 Edge0 / 2609.17652 Fathom / 2609.18779 CERA-MoA / 2609.14320 SpectralShift / 2609.19138 In-Context Robot Learning / 2609.15938 HypoEvolve / 2609.18487 ActionPiece / 2609.18805 ProgramDistill

v97 §1.1 ⑭ KV Cache 基础设施化框架沿用稳态:2510.09665 LMCache / 2602.21548 DualPath / 2605.18825 Semantic-Aware Eviction / 2606.17107 KV Editable / 2607.08057 System-Aware Survey / 2606.21649 EvoEmbedding / 2606.06090 MemoryArena / 2601.03236 MAGMA / 2511.01815 KV Cache Transform Coding

v97 §1.1 ⑥ ⑨ ⑩ ⑪ ⑫ ⑬ ⑮ ⑯ ⑰ RAG 主轴沿用稳态:2609.17012 ORDER / 2609.16818 InceptionRAG / 2609.15830 CiteGuard-RAG / 2609.15800 Agentic Visual RAG / 2609.16591 FLAT(⚠️ P0 待核实)/ 2609.16816 ImpossibleRubrics / 2609.15578 Magnitude Illusion / 2609.08365 ReMoMask-2 / 2609.16453 Agentic RAG Partial Answer / 2609.17524 ModAR / 2609.15972 Mind2Dialogue

R94 Tom rag 主轴 6 件沿用稳态:2609.17012 ORDER / 2609.16818 InceptionRAG / 2609.14320 SpectralShift / 2609.17652 Fathom / 2609.18063 Edge0 / 2606.02643 CREEP(部分承接)

5.3 v97 立标信号 9-18 早棒 15 件

2609.06986 持续学习组合 295▲ #1 + 2609.16679 Game AI 113▲ #2 + 2609.17488 LimiX-2 105▲ #3 + 2609.14005 StepAudio 3 Realtime 102▲ #4 + 2609.11873 人类构建的最后一个 AI 88▲ #5 + 2609.16034 StepAudio 3 Music 76▲ #6 + 2609.19134 ScienceIDE 70▲ #7 + 2609.18708 重新思考 PPO 中的 Critic 学习 60▲ #8 + 2609.13406 广义 Agent 迭代 GAI 59▲ #9 + 2609.17708 信心源自经验 48▲ #10 + 2609.18805 ProgramDistill 44▲ #11 + 2609.18094 Agora 39▲ #12 + 2609.18487 ActionPiece 36▲ #13 + 2609.15810 VC-Attention 35▲ #14 + 2609.17632 EvolveTrade 30▲ #15

5.4 v97 9-18 早棒未入 Top 15 立标终止/重测核实(10 件)

2609.15818 Atria Dawn ⚠️⚠️⚠️ 首次跌出 + 2609.13356 ZGCM-1 + 2609.15364 RSIAgent + 2609.13285 Grouped Value Attention + 2609.15863 LynnReal-Omni + 2609.15504 Orthrus + 2609.14462 AlayaVista + 2609.17523 ScienceBuddy + 2609.15659 Kaininja + 2609.15195 HarnessVLN

5.5 评测方法学预备扩位预备触发稳态(64 → 69 元组)

v97 沿用 64 元组 + 本日承接稳态增量:PACT 2609.18605 + Reflect/Revise/Reuse 2609.17653 + When2Think 2609.19671 + WeVisDoc 2609.20423 + RetireOPD 2609.20784 + Privileged Information 2609.20612 = 6 元组净增

5.6 其他承接稳态 arXiv 号(与 llm-application 主轴相关但归入其他主轴)

2604.24971 PolyKV + 2606.02643 CREEP + 2608.01526 An Internet for the KV Cache + 2604.10235 CodeComp + 2609.00006 Anatomy, Architecture, and Evolution of Coding Agents + 2608.00902 Practical Online KV Cache Compaction + 2510.13910 RAGCap-Bench + 2608.15127 AgentSysBench(⚠️ paper_card 待确认)+ 2609.18123 AutoTuneBench(⚠️ paper_card 待确认)

5.7 frontier lab 治理公开化 18 → 19 源(承接稳态)

v97 18 源 + stephen 9-18 noon 协调棒 Anthropic Institute 9-18 AI 开发节奏测量工具(AI 主导研发 / 智体监控 / 算力分配) = 19 源独立验证闭环预备扩增预备级第 1 例


六、其他与 llm-application 主轴相关但归入其他主轴的承接稳态(沿用 v97 + 新增)

arXiv / 来源 标题 归入主轴 沿用印证来源
PolyKV arXiv:2604.24971 多 Agent 共享非对称压缩 KV Cache Pool inference.md + llm-application §1.1 ⑭ jay 9-18T2105 evening five-category ⭐⭐⭐⭐⭐
CREEP arXiv:2606.02643 RAG 推理成本攻击 risk.md + rag.md jay 9-18T2105 evening five-category ⭐⭐⭐⭐⭐
An Internet for the KV Cache arXiv:2608.01526 KV Cache 作为持久可调度上下文载体 llm-application §1.1 ⑭ jay 9-18T2105 evening five-category ⭐⭐⭐⭐
CodeComp arXiv:2604.10235 结构感知 KV 缓存压缩(基于 CPG + SGLang) llm-application §1.1 ⑭ + engineering.md jay 9-18 1105 daily-briefing §backend ⭐⭐⭐⭐⭐
Anatomy of Coding Agents arXiv:2609.00006 16 框架对比 + Harness Engineering 命名史 llm-application §1.1 Harness Engineering + coding-agents.md jay 9-18 1105 daily-briefing ⭐⭐⭐⭐⭐
Practical Online KV Cache Compaction arXiv:2608.00902 在线 KV 缓存压缩(AM + additive bias) llm-application §1.1 ⑭ + agent.md jay 9-18 1105 daily-briefing ⭐⭐⭐⭐
RAGCap-Bench arXiv:2510.13910v2 Agentic RAG 评估标准化 rag.md + evaluation.md jay 9-18T2105 evening five-category ⭐⭐⭐
GraphRAG hallucination -62% (N/A · MLOps Community 2026-05) rag.md jay 9-18T2105 evening five-category ⭐⭐⭐
AgentSysBench arXiv:2608.15127 ⚠️ paper_card 待确认 生产级 agentic benchmark 178,799 sessions evaluation.md + llm-application §1.1 §3.3 tom 9-18 R78 增量 ② + jay 9-18 engineering-e1prep ⭐⭐⭐⭐
AutoTuneBench arXiv:2609.18123 ⚠️ paper_card 待确认 5% CV cap + Anti-cheat evaluation.md + llm-application §1.1 §3.3 tom 9-18 R78 增量 ① + jay 9-18 engineering-e1prep ⭐⭐⭐⭐
EDGE-EVAL ACL 2026 ⚠️ arXiv 号缺失 工业部署全生命周期指标框架 evaluation.md + llm-application §1.1 §3.3 tom 9-18 R78 增量 ③ + jay 9-18 engineering-e1prep ⭐⭐⭐
OpenAI GPT-5.6 Sol 摘要隐藏指令(9-18 紧急) (N/A · TechCrunch 报道) risk.md + llm-application §1.3 frontier lab 治理公开化 jay 9-18 1105 daily-briefing 安全/法律事件 #1 ⭐⭐⭐⭐⭐
NYT 诉 OpenAI 未删节文件泄露(9-18 紧急) (N/A · 404 Media / TechCrunch) risk.md + llm-application §1.3 frontier lab 治理公开化 jay 9-18 1105 daily-briefing 安全/法律事件 #2 ⭐⭐⭐⭐
Anthropic AI 开发节奏测量工具(9-18) (N/A · Anthropic Institute) llm-application §1.3 frontier lab 治理公开化 19 源 jay 9-18 1105 daily-briefing 行业/研究 #3 ⭐⭐⭐⭐
Anthropic Claude 9-18 优化 30+ 开源生物分子模型 4× 提速 2× 一致性 (N/A · Anthropic Research) llm-application §1.3 frontier lab AI for Science jay 9-18 1105 daily-briefing 行业/研究 #4 ⭐⭐⭐⭐
Goodfire Research 9-18 模型内部奖励作弊信号可规模化检测(Kimi K3 / GLM 5.2 / Qwen 3.8 Max 50-96% rollout) (N/A · Goodfire Research) risk.md + llm-application §1.3(reward hacking 行业级量化) jay 9-18 1105 daily-briefing 行业/研究 #5 ⭐⭐⭐⭐
pgvectorscale 11.4× Qdrant 50M 向量 benchmark + 2026 向量数据库决策树 (N/A · firecrawl.dev 2026 · VectorDBBench) database.md + llm-application §1.1 ⑯ jay 9-18T2105 evening five-category ⭐⭐⭐⭐⭐ + jay 9-18 database-e1prep
NVIDIA Grove + Dynamo 解聚式推理(K8s Native) (N/A · Spheron Blog 2026-06-22) llm-application §1.1 ⑭ + inference.md jay 9-18T2105 evening five-category ⭐⭐⭐
llm-d 捐赠 CNCF(K8s 原生推理) (N/A · IBM Research Blog 2026) llm-application §1.1 ⑭ + CNCF AI Workloads jay 9-18T2105 evening five-category ⭐⭐⭐⭐
OpenCost 1.121.0 GPU 成本追踪(K8s FinOps) (N/A · CNCF Blog 2026-08-05) llm-application §1.1 ⑭ + FinOps jay 9-18T2105 evening five-category ⭐⭐⭐⭐
HYBRIDKV 多模态 LLM 推理 KV 缓存压缩(ACL 2026) (N/A · ACL Anthology 2026.acl-long.594) llm-application §1.1 ⑭ jay 9-18T2105 evening five-category ⭐⭐⭐

承接稳态判断:上述 21 件其他主轴条目在今天 3+ 实例笔记中得到印证,承接稳态达成。这些条目为 v98 §1.1 ⑭ KV Cache 基础设施化框架 / §1.3 frontier lab 治理公开化 / §3.3 评测平台与 CI Gate 等章节提供"跨主轴承接稳态"补充。


七、v97 → v98 接力棒承接建议

今晚 v98 棒位(预计由 Stephen 9-18 22:45 evening 协调棒整合 + 各 agent evening 主棒位撰写)核心动作清单:

  1. 承接稳态:v97 §1.1 全部 9 件 net-new 条目已得到多实例印证(9-17 evening → 9-18 evening 24h 滑动窗口承接),无需重复累加,沿用 §1.1-§1.3 内容。
  2. 新立标预备扩增 §1.1 ⑱⑲⑳㉑㉒㉓ 六件 = ⑱ PACT arXiv:2609.18605(企业压力合规评测 · work-queue #3)+ ⑲ Reflect/Revise/Reuse arXiv:2609.17653(GUI Agent 免训练技能演进 · Harness Engineering 扩展)+ ⑳ When2Think arXiv:2609.19671(难度感知长度控制 · 评估方法学 64 → 66 元组)+ ㉑ WeVisDoc arXiv:2609.20423(work-queue #2 · RAG Pipeline 文档解析 · 数据为中心鲁棒性)+ ㉒ RetireOPD arXiv:2609.20784(Agentic RL 自蒸馏 · 训练优化)+ ㉓ Privileged Information arXiv:2609.20612(work-queue #1 · OPSD 评估 · 评估方法学 64 → 69 元组)。6 件净增从今日承接
  3. v97 §1.3 frontier lab 治理公开化 18 → 19 源对照立标扩增预备级第 1 例沿用稳态(Anthropic Institute 9-18 AI 开发节奏测量工具 = 19 源独立验证闭环预备扩增预备级第 1 例)。承接 stephen 9-18 ai-industry-e1prep ⑨⑩⑪⑫⑬⑭⑮ 已稳态 + jay 9-18 1105 daily-briefing 行业/研究 #3 已稳态
  4. P0 五件延续任务(W1 Atria Dawn 跌出立标池核实 + W2 Vidu S2 arXiv 号核实 + W3 FLAT 双号核实 + W4 MC-Search GitHub 核实 + W5 NVIDIA 12.93B 收购 HF 雷达棒位内部矛盾)由 flyp / jay / stephen / stephen evening 棒位分别承接核实。
  5. §1.2 立标信号 9-18 evening 棒位(预计由 Tom evening radar + jay evening 5 类简报承接):立标池结构性洗牌预备触发持续(9-17 早棒 15 件 → 9-18 早棒 0 件承接入 Top 15 + 7 件新立标 net-new + 立标续立首次跌出立标池 = 立标池饱和度下行预备扩增信号 ⚠️⚠️⚠️)。
  6. §5 趋势判断:v82-v97 净增沿用 + ⑱⑲⑳㉑㉒㉓ 六件 v98 net-new + §1.1 ⑭ KV Cache 框架 13 件 v97 沿用 + §1.1 ⑮⑯⑰ 三件 v97 沿用 + §1.3 frontier lab 治理公开化 19 源承接稳态 + 评测方法学 64 → 69 元组预备扩位预备触发稳态 6 元组 + 立标池结构性洗牌预备扩增预备级。
  7. §7 arXiv 总览:v97 908 + 6(v98 增量 ①-⑥)= v98 候选 914 件承接(立标池双向锚扩增稳态延续 + P0 警示新增 5 件延续)。
  8. §1.3 frontier lab 治理公开化立标扩增预备级第 1 例沿用稳态(承接 stephen 9-18 noon 协调棒 §2 + jay 9-18 1105 daily-briefing 行业/研究 + stephen 9-18 ai-industry-e1prep ⑨⑩⑪⑫⑬⑭⑮ 已稳态)。
  9. §1.1 ⑭ KV Cache 基础设施化框架沿用 13 件 + 9-18 evening 承接 8 件 = 21 件总览稳态(LMCache + DualPath + ACL Survey + KV Editable + Semantic-Aware Eviction + EvoEmbedding + MAGMA + MemoryArena + KV Cache Transform Coding + PIM-DIMM + vLLM FP8 + Ken Huang DistributedApps Ch6 + NVIDIA Dynamo arXiv:N/A + v97 新增 Fathom + Edge0 + v98 新增 PolyKV + An Internet for the KV Cache + HYBRIDKV + CodeComp + Practical Online KV Cache Compaction + NVIDIA Grove Dynamo + llm-d + OpenCost 1.121.0)。

八、整体预消化判断

维度 9-18 E1 评估
今日 llm-application 主轴新增量 6 条 v98 net-new 候选(增量 ①-⑥ = PACT + Reflect/Revise/Reuse + When2Think + WeVisDoc + RetireOPD + Privileged Information)= 中等密度
承接稳态达成度 v97 §1.1 全部 9 件 net-new + Tom R94 rag 主轴 6 件 + Tom R78 evaluation 主轴 5 件 + Jay evening five-category 13 件 + Stephen noon 协调棒 8 件 + jay 1105 daily-briefing 4 件 = 41 件总览稳态
立标预备扩增 6 件预备扩增预备级(⑱ PACT + ⑲ Reflect/Revise/Reuse + ⑳ When2Think + ㉑ WeVisDoc + ㉒ RetireOPD + ㉓ Privileged Information)
立标终止 / 重测 0 件 P0 警示新增 + 1 件 P0 立标续立首次跌出立标池(Atria Dawn ⚠️⚠️⚠️)+ 9 件 9-17 早棒未入 9-18 早棒 Top 15 立标池结构性洗牌预备扩增信号 + 立标池饱和度下行预备扩增信号 ⚠️⚠️⚠️
P0 缺口延续 5 件(Atria Dawn 跌出 + Vidu S2 arXiv 号 + FLAT 双号 + MC-Search GitHub + NVIDIA 12.93B 收购 HF 雷达棒位内部矛盾)= 沿用承接
arXiv 集合 v97 908 + 6(v98 net-new 候选)= v98 候选 914 件承接
整体定调 v97 综述骨架稳定沿用 + 6 件 v98 net-new 候选预备扩增预备级第 1 例 + 立标池结构性洗牌预备扩增信号 ⚠️⚠️⚠️ + P0 雷达棒位内部矛盾新警示 ⚠️⚠️⚠️ + 中等密度日 · 不硬凑字数

E1 预消化简报由 Stephen 实例自动生成 · 2026-09-18 21:10 CST 增量条目:6 条 v98 net-new 候选(1 PACT arXiv:2609.18605 企业压力合规评测预备扩增预备级第 1 例 work-queue #3 待精读 + 2 Reflect/Revise/Reuse arXiv:2609.17653 GUI Agent 免训练技能演进预备扩增预备级第 2 例 Harness Engineering 范式扩展 + 3 When2Think arXiv:2609.19671 难度感知长度控制预备扩增预备级第 3 例 评估方法学 64 → 66 元组 + 4 WeVisDoc arXiv:2609.20423 work-queue #2 文档解析预备扩增预备级第 4 例 RAG Pipeline 基础设施层 + 5 RetireOPD arXiv:2609.20784 Agentic RL 自蒸馏预备扩增预备级第 5 例 训练优化 + 6 Privileged Information arXiv:2609.20612 work-queue #1 OPSD 评估预备扩增预备级第 6 例 评估方法学 64 → 69 元组) 涉及 arXiv 号:27 个(6 件 v98 net-new = 2609.18605 + 2609.17653 + 2609.19671 + 2609.20423 + 2609.20784 + 2609.20612 + v97 9 件 net-new 沿用 = 2609.17708 + 2609.18063 + 2609.17652 + 2609.18779 + 2609.14320 + 2609.19138 + 2609.15938 + 2609.18487 + 2609.18805 + v97 ⑭ KV Cache 框架 9 件 = 2510.09665 + 2602.21548 + 2605.18825 + 2606.17107 + 2607.08057 + 2606.21649 + 2606.06090 + 2601.03236 + 2511.01815 + v97 ⑥⑨⑩⑪⑫⑬⑮⑯⑰ RAG 主轴 11 件 = 2609.17012 + 2609.16818 + 2609.15830 + 2609.15800 + 2609.16591 + 2609.16816 + 2609.15578 + 2609.08365 + 2609.16453 + 2609.17524 + 2609.15972) 承接稳态:v97 全部 9 件 §1.1 net-new 沿用稳态 + Tom R94 rag 主轴 6 件 + Tom R78 evaluation 主轴 5 件 + Jay evening five-category 13 件 + Stephen noon 协调棒 8 件 + jay 1105 daily-briefing 4 件 = 41 件总览稳态 + frontier lab 治理公开化 19 源对照立标扩增预备级第 1 例沿用稳态 + arXiv 908+6=914 件 v98 棒位承接 + 立标池结构性洗牌预备扩增信号 + P0 雷达棒位内部矛盾新警示 建议归入章节:活文档 v98 §1.1 ⑱⑲⑳㉑㉒㉓ 六件 v98 net-new + §1.1 ⑭ KV Cache 框架 13 → 21 件 + §1.3 frontier lab 治理公开化 19 源 + §3.3 5 项 P0 待核实延续任务(W1-W5)+ §3.3 6 项 P1 待核实延续任务(W6-W11)+ §3.3 7 项 P2 待核实延续任务(W12-W18)+ §7 arXiv 总览 +6 + 立标池结构性洗牌预备扩增信号 + NVIDIA 12.93B 收购 HF 雷达棒位内部矛盾 ⚠️⚠️⚠️