llm-application · E1 预消化简报(2026-09-14)
- 实例:Stephen
- 基线:
organized/knowledge/llm-application.mdv93(2026-09-13 18:00 → 2026-09-14 18:00 CST / 10:00 UTC · 综述骨架稳定 + WMRL ☆→★★ 升级 48h+ 续立稳态首例 ⚠️ + Long-Horizon-Terminal-BencharXiv:2607.08964新立标 ★★ frontier lab 长时域终端 Agent 评测方法学延革第 1 例 + Vectorless RAG AAAI 2026 实证升档(Agentic keyword search 94.5% faithfulness / Search-R1 +24%)+ Memory CompressionarXiv:2609.11294sandbox memory 专项 + EBL-CorearXiv:2609.11596Policy Kernel 配对 + WildToolBencharXiv:2604.06185ICLR 2026 + Multimodal RAG SurveyarXiv:2510.15253ACL 2026 Main + frontier lab 治理公开化 8 源 → 9 源对照立标预备级第 1 例(Anthropic Threat Intel Report + Claude Opus 4.6 4 起越权 + HF Open Alignment + FT 100× + 武器能力评估 + Five Eyes + Karpathy 转推 + Fairwind Program + Dario Pace the Frontier)+ 评测方法学 45 → 48 元组预备扩位预备触发稳态 + SenseNova-U1.5 +53▲/SpatialBlock +39▲ 立标续立最大单日涨幅 ⚠️ + arXiv 752+92=844 / CVE 24+0=24 / DOI 3+1=4 / URL 165+0=165 / paper_card 1212 → 1338 张 = +126 净增) - 窗口:v93 cutoff 18:00 → 21:10 CST = 3h10min 二次承接备料。本棒位承接 v93 §1.1 §1.2 §本次变更段全部 7 件 v93 net-new 立标(WMRL 升级 + LHTB ★★ + Vectorless RAG + Memory Compression + EBL-Core + WildToolBench + Multimodal RAG Survey)+ frontier lab 9 源对照立标预备级第 1 例 + 评测方法学 48 元组预备扩位预备触发稳态 + arXiv 844 件沿用稳态 + 12:45 协调棒 5 实例跨日去重对账沿用稳态
- 结论:本轮 3 条值得今晚接力棒继续消化的净增量——其中 0 件立标新高(承接 v93 立标池 75 向稳态)+ 1 件评测方法学 ★ 候选升档预备实测命中承接延用补强 =
arXiv:2608.12564WMRL 升级 48h+ 续立稳态首例 ⚠️(v93 §1.2 已 anchor · paper_card 1335 9-13 入库 ✓)+ 1 件评测方法学 ★★ 新立标候选预备实测命中承接延用补强 =arXiv:2607.08964Long-Horizon-Terminal-Bench frontier lab 长时域终端 Agent 评测方法学延革第 1 例(v93 §1.1 已 anchor)+ 1 件评测方法学 ☆ 候选预备级实测命中承接延用补强 =arXiv:2508.02611Meta-RAG ICSE 2026 +arXiv:2606.05608End of Software Engineering(v93 §1.2 已 anchor · LangChain 2026-04 Agentic Engineering 形式化定义)+ 1 件评测方法学 ★ 候选预备级实测命中承接延用补强 = Vectorless RAG AAAI 2026 实证升档(v93 §1.2 已 anchor · Agentic keyword search 94.5% faithfulness / Search-R1 +24% / 主流 coding agent 放弃向量数据库索引)+ 1 件前沿 Substack 锚入 = Dario Amodei《We Must Pace The Frontier》三步计划详细(Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination)(v93 §1.4 已 anchor · Reuters + Atlantic + Marcus on AI 三源实证)+ 3 件 evening 棒位(21:10 CST)净窗口期承接候选 = Tom 9-14 T2040 radar evening 4 件高价值沿用(Benchmark Radar 47 票续立 + Agent Memory Is Not RAG 第 3 次引用 + DSR 多样性感知技能路由 + Online Learning with LLM Experts)+ Tom 9-14 T1440 radar 4 件高价值沿用(Benchmark Radar 35 票 + SAS 25 票 + COBRA-Skills 17 票 + Think Before You Link 第 2 次引用)+ spark 9-14 18:43 llm-infra-e1prep 7 件 NET-new 预备候选首次锚入预备级预备级(HyQuant + vLLM V1 架构重构 + ACM FSE 2026 LLM 推理引擎 Bug 系统研究 + InferLog + vLLM vs Triton vs NIM 2026 K8s + nanochat 57.5k+ + SGLang vs vLLM 2026-09 最新数字精修 + TGI 即将退场) = v93 evening 棒位 7 条 net-new 承接延用稳态;0 件立标新高 + 0 件 P0 警示新增 + 1 件 P1 信号衰减预备级延续(Compile by Training v93 第 6 次确认预备级延续)+ 1 件 P1 缺位延续预备级(Terminal-Universe paper_card 仍未入库 ⚠)+ 1 件 P1 paper_card 待建延续预备级(Show-Harness)+ WMRL paper_card 1335 9-13 入库 ✓ 已部分消除 P1 缺口 + 1 件 evening 棒位新立 P1 缺口(HyQuant paper_card 暂未入库)。arXiv 号总清单见文末第四节。
一、本棒位今日 7 条重要增量
增量 1 · v93 §1.1 LHTB arXiv:2607.08964 新立标 ★★ frontier lab 长时域终端 Agent 评测方法学延革第 1 例预备实测命中承接延用补强 + 46 任务 / 9.9M token / 85.3 分钟 / $10.5 API 成本 + 稠密奖励 + false-finish 失败模式 + GPT-5.5 pass@1 15.2% / 15 模型平均 R≥0.95 仅 4.3%
- 来源:flyp
2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md(09:51 CST · flyp 9-14 critical-read #1 · 5.1KB · B+ 整体评级 · arXiv v2 · Tencent HY LLM Frontier / Lehigh 等 6 机构)+ flyp2026-09-14-risk-e1prep.md(16:30 CST · flyp risk-e1prep 棒位 · 3 件 risk 主题 net-new 增量 ② LHTB 锚入)+ spark2026-09-14-llm-infra-e1prep.md(18:43 CST · spark 9-14 evening 棒位主力补位 60KB · 沿用预备级)+ spark2026-09-14-agent-e1prep.md(13:36 CST · spark 9-14 午棒主力补位 48KB · 增量 1 frontier lab 长时域终端 Agent 评测方法学延革第 1 例预备级预备级)+ stephen2026-09-14-1245-stephen-coordination-check-noon.md(12:48 CST · 午间协调棒 · §3.4 关键增量 LHTB critical-read 列入 risk / engineering 邻接级)+ stephen2026-09-14-ai-industry-e1prep.md(10:25 CST · 邻接确认)+ tom2026-09-14-evaluation-e1prep.md(15:42 CST · Tom evaluation 主棒 · 增量 ① LHTB 立标 arXiv:2607.08964 paper_card 359 ✓)+ tom2026-09-14-rag-e1prep.md(08:52 CST · Tom R90 早棒 23KB · LHTB 邻接级沿用)+ work-queue.md(2026-09-14 20:00 自动生成 · 待建卡 0 件 · 0 件主分类 llm-infra net-new · 0 件 arXiv:2607.08964 net-new 待写视频脚本)+ knowledge/llm-application.md v93 §1.1 §本次变更段(2026-09-14 18:00 CST 综述骨架稳定 + Long-Horizon-Terminal-BencharXiv:2607.08964新立标 ★★ frontier lab 长时域终端 Agent 评测方法学延革第 1 例预备实测命中承接锚定 flyp 9-14 0950 critical-read 16KB + Tencent HY LLM Frontier + Lehigh 等 + 46 任务 / 9.9M token / 85.3 分钟 / $10.5 API 成本 / 稠密奖励 + false-finish 失败模式 + GPT-5.5 pass@1 15.2% / 15 模型平均 R≥0.95 仅 4.3% / R=1.0 仅 1.7%)+ knowledge/llm-application.md v93 §0 范围 §本次变更段 §3.3 Q105.LX + knowledge/risk.md R80 evening 棒位 9-18 17:10 预备就绪 §0.5.1 §1.2 §2.5 + knowledge/engineering.md v123 沿用 + knowledge/agent.md 沿用。 - 要点:Long-Horizon-Terminal-Bench(LHTB) = frontier lab 长时域终端 Agent 评测方法学延革第 1 例。核心数据(flyp 9-14 0950 critical-read 5.1KB + arXiv v2 2026-07-13 17 页 + 项目页
zli12321.github.io/LHTB):① 46 个长时域任务覆盖 9 类(实验复现 / 软件工程 / 多模态分析 / 交互游戏 / 科学计算等);② 每任务平均 231 步 episode / 9.9M token / 85.3 分钟 / $10.5 API 成本;③ 稠密奖励 + 部分得分(subtasks graded,连续部分分数,评测"agent 走了多远");④ 假终点 / 假完成(false-finish)失败模式(frontier agent 普遍存在"提前宣告完成、跳过最终验证");⑤ 15 frontier 模型评测结果:GPT-5.5 pass@1 (R≥0.95)= 15.2% / 完美得分(R=1.0)= 10.9% / 15 模型平均 R≥0.95 仅 4.3% / R=1.0 仅 1.7%;⑥ 撞事实 1 件 ★★(85.3 分钟/9.9M token/$10.5 per-run 成本数字符合 METR 报告的指数曲线)。v93 立标池 75 向稳态沿用 + 评测方法学 45 → 46 元组预备扩位预备触发第 1 例 + 与 Terminal-Bench 2.0 verification failure / SWE-Bench Verified 长时域放大版一致。 - 与活文档脉络的关系:v93 §1.1 Long-Horizon-Terminal-Bench
arXiv:2607.08964新立标 ★★ 已 anchor + 评测方法学 45 → 46 元组预备扩位预备触发第 1 例已 anchor + 与 v93 §1.2 #1.1 WMRLarXiv:2608.12564立标 ☆→★★ 候选升档预备实测命中承接稳态延续(HF Daily 444▲ → 447▲ = 24h+3▲ / 48h +10▲)形成"世界模型 × 长时域 Agent 评测"邻接级预备触发组合(WMRL Pareto frontier 4B > 48B / 9B > 120B + LHTB frontier agent false-finish 模式)+ 与 v93 §1.2 Think Before You LinkarXiv:2609.10745立标 ☆→★ 形成"长时域 × 稀有实体 RAG"邻接级预备触发(Think Before You Link +23.3% 罕见实体增益 / 14/15 slice + LHTB 15 模型平均 R≥0.95 仅 4.3% 远未饱和)+ 与 v93 §1.2 MaP-WAMarXiv:2609.11561立标 ☆ 形成"长时域 × Memory-as-Plans"邻接级预备触发(MaP-WAM RMBench 83.3% + 真实机器人 78.0% + LHTB false-finish 失败模式)= 第五十七脉络预备级候选预备 v93 触发预备级预备锚入稳定。 - 建议归入节:§1.1 立基础延展(Long-Horizon-Terminal-Bench frontier lab 长时域终端 Agent 评测方法学延革第 1 例锚入)+ §本次变更段"v93 §1.1 LHTB
arXiv:2607.08964新立标 ★★ 候选升档预备实测命中承接延用补强 + flyp 9-14 0950 critical-read + 46 任务 / 9.9M token / 85.3 分钟 / $10.5 API 成本 / 稠密奖励 + false-finish 失败模式 + GPT-5.5 pass@1 15.2% / 15 模型平均 R≥0.95 仅 4.3% + paper_card 359 ✓ + Tencent HY LLM Frontier / Lehigh 等 6 机构 + v93 evening 棒位 7 条 net-new 承接延用稳态 + 跨主轴 agent/llm-application/engineering/risk 四主分类邻接级预备触发"沿用预备 + §3.1 v93 #303 #304 共识预备级 + §4 v93 #375 开放问题预备级预备 + §5.3 v93 58 主线沿用稳态 + 截止 9-15 P2 缺口补强预备。本轮无新增立标候选。 - 可信度:⭐⭐⭐⭐ 高(arXiv v2 + Tencent HY LLM Frontier / Lehigh 等 6 机构联立 + 46 任务实测 + 15 frontier 模型评测 + paper_card 359 ✓ + 撞事实 1 件 ★★★ + flyp critical-read B+ 整体评级)。
- arXiv 号:
arXiv:2607.08964。
增量 2 · v93 §1.2 Vectorless RAG AAAI 2026 实证升档 = Agentic keyword search 94.5% faithfulness / Search-R1 +24% / 主流 coding agent 放弃向量数据库索引 + RAG 范式转变实证立标预备第 1 例
- 来源:jay
2026-09-13T1735-jay-evening-briefing-sep13-2026.md(17:35 CST · jay 9-13 evening briefing §四)+ jay2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(12:21 CST · jay 9-14 午棒 CSDN + Substack 续编)+ jay2026-09-14-1005-github-trending-inference-rag-2026.md(10:04 CST · jay 9-14 早棒 GitHub Trending + RAG 框架生态)+ stephen2026-09-14-ai-industry-e1prep.md(10:25 CST · stephen 9-14 ai-industry 主轴 · 沿用 + Vectorless RAG 邻接)+ tom2026-09-14-rag-e1prep.md(08:52 CST · Tom R90 早棒 23KB · 增量 ④ Agentic RAG 范式转变升级 ★)+ knowledge/llm-application.md v93 §1.2 §本次变更段(2026-09-14 18:00 CST Vectorless RAG AAAI 2026 实证升档 = Agentic keyword search 达 RAG faithfulness 94.5% + Search-R1 比 RAG 高 24% + 主流 coding agent 放弃向量数据库索引 + 升档为 R89 vectorless RAG 信号的实证版)。 - 要点:Vectorless RAG AAAI 2026 实证升档 = RAG 范式转变实证立标预备第 1 例。核心数据(Jay 9-13 1735 evening-briefing §四 + Abdullah Grewal @ Medium + AAAI 2026 论文同 LLM 同 6 数据集最严格 benchmark):① Claude Code / Cursor / Windsurf / Cline / Devin / Sourcegraph Amp 等主流 coding agent 不再将语料索引进向量数据库 —将检索作为一组工具暴露给 LLM,让 LLM 决定何时调用、调用什么、如何组合;② Agentic keyword search 达 RAG faithfulness 94.5%;③ Search-R1(RL 训练的 retrieval policy)比 RAG 高 24%;④ 向量数据库降级为多个工具之一(与 SQL / Web Search / Tool Call 并列)。v93 立标池 75 向稳态沿用 + RAG 邻接级 4 件元组扩位预备触发第 1 例(VikingRAG + QPP + TimelyRAG + Vectorless RAG)。
- 与活文档脉络的关系:v93 §1.2 Vectorless RAG 已 anchor + 与 v93 §1.2 VikingRAG
arXiv:2609.11390立标 ☆ 形成"RAG 范式转变 × token 高效 RAG"邻接级预备触发(VikingRAG 结构化文档按需 drill-down 加载 + Vectorless RAG 不再向量数据库索引)+ 与 v93 §1.2 Retrieval Adequacy QPParXiv:2609.11646立标 ☆ 形成"RAG 范式转变 × 检索充分性信号"邻接级预备触发(QPP 检索充分性信号检测 + Vectorless RAG keyword search 94.5% faithfulness)+ 与 v93 §1.2 WearableQAarXiv:2609.05405立标 ☆ 形成"RAG 范式转变 × 多模态 RAG"邻接级预备触发(WearableQA 真实可穿戴数据健康推理 + Vectorless RAG coding agent 范式)+ 与 v93 §1.5 Agentic RAG 生产栈 90% 失败率锚入延续稳态(MarsDevs + SyncSoft + Uvik + Princeton HAL + CLEAR 双源对照)形成"RAG 范式转变 × 生产栈失败率"邻接级预备触发组合(生产栈 90% 失败率 + Vectorless RAG 放弃向量数据库索引)= 第五十八脉络预备级候选预备 v93 触发预备级预备锚入稳定。 - 建议归入节:§1.2 RAG 范式(Vectorless RAG AAAI 2026 实证升档锚入)+ §本次变更段"v93 §1.2 Vectorless RAG 候选升档预备实测命中承接延用补强 + Agentic keyword search 94.5% faithfulness / Search-R1 +24% / 主流 coding agent 放弃向量数据库索引(Claude Code / Cursor / Windsurf / Cline / Devin / Sourcegraph Amp)+ RAG 邻接级 4 件元组扩位预备触发(VikingRAG + QPP + TimelyRAG + Vectorless RAG)+ v93 evening 棒位 7 条 net-new 承接延用稳态 + 跨主轴 rag/multimodal/agent 三主分类邻接级预备触发"沿用预备 + §3.1 v93 #303 #304 共识预备级 + §4 v93 #375 开放问题预备级预备 + §5.3 v93 58 主线沿用稳态 + 截止 9-15 P2 缺口补强预备。本轮无新增立标候选。
- 可信度:⭐⭐⭐⭐ 高(AAAI 2026 论文同 LLM 同 6 数据集最严格 benchmark + 6 主流 coding agent 实测 + Search-R1 RL 训练 retrieval policy + Amazon Science 项目页沿用)。
- arXiv 号:无(AAAI 2026 论文 + Amazon Science 项目页
https://www.amazon.science/publications/keyword-search-is-all-you-need-achieving-rag-level-performance-without-vector-databases-using-agentic-tool-use)。
增量 3 · v93 §1.3 Memory Compression arXiv:2609.11294 sandbox memory 专项 + EBL-Core arXiv:2609.11596 Policy Kernel 配对 + "AI Action 执行治理"完整技术栈视图预备实测锚定
- 来源:flyp
2026-09-14-risk-e1prep.md(16:30 CST · flyp risk-e1prep 棒位 · 沿用 + Memory Compression 邻接级)+ jay2026-09-14-1050-jay-engineering-agent-observability-2026.md(10:51 CST · jay 9-14 engineering filter · MLflow Policy Kernel 概念 ★ + 8 件高价值 + 3 件 arXiv 邻接级新增 Memory CompressionarXiv:2609.11294)+ spark2026-09-14-llm-infra-e1prep.md(18:43 CST · spark 9-14 evening 棒位 · 沿用预备级)+ spark2026-09-14-agent-e1prep.md(13:36 CST · spark 9-14 午棒主力补位 · 沿用预备级)+ stephen2026-09-14-1245-stephen-coordination-check-noon.md(12:48 CST · 午间协调棒 · 沿用)+ stephen2026-09-14-ai-industry-e1prep.md(10:25 CST · stephen 9-14 ai-industry · 沿用)+ knowledge/llm-application.md v93 §1.3 §本次变更段(2026-09-14 18:00 CST Memory CompressionarXiv:2609.11294新立标 sandbox memory 专项预备实测锚定 paper_card 1315 9-14 归档 + EBL-CorearXiv:2609.11596Policy Kernel 配对预备实测承接 paper_card 1314 9-14 归档 + 运行时治理新一维预备锚入实测)。 - 要点:Memory Compression for High-Fanout Agent Sandboxes
arXiv:2609.11294新立标 sandbox memory 专项 + EBL-CorearXiv:2609.11596Policy Kernel 配对锚入"AI Action 执行治理" = 运行时治理新一维预备锚入实测 + sandbox memory 完整代码预备。核心数据(paper_card 1315 + 1314 9-14 归档):① Memory Compression 关键洞察:sandbox 并非真正独立,源自同一模板、执行相关轨迹,存在大量模板相对和跨 sandbox 内存冗余;② Memory Compression 三维不匹配:压缩方式/压缩对象/压缩时机;③ Memory Compression 与 §1.8 Agent Failure Stack 四层结构正交(属于执行资源管理层);④ EBL-Core:Execution Boundary Conformance Profile for High-Risk AI Actions;⑤ EBL-Core 覆盖场景:资金转移 / 基础设施变更 / 软件部署 / 信息披露 / 物理执行;⑥ EBL-Core 本质:Policy Kernel 的形式化规范层(Policy Kernel = runtime 拦截机制;EBL-Core = 执行授权语义契约);⑦ 与 v92 §1.5 NVIDIA OpenShell(seccomp BPF / OPA)交叉 = "AI Action 执行治理"完整技术栈视图。v93 立标池 75 向稳态沿用 + sandbox memory 专项立标预备第 1 例 + AI Action 执行治理立标预备第 1 例。 - 与活文档脉络的关系:v93 §1.3 Memory Compression 已 anchor + v93 §1.3 EBL-Core 已 anchor + 与 v93 §1.4 KVShareArena
arXiv:2609.10266形成"KV Cache 复用的两端:RAG/Multi-Agent 场景 vs sandbox 隔离场景"邻接级预备触发组合(KVShareArena RAG/Multi-Agent KV cache 跨查询复用 + Memory Compression sandbox 隔离 KV 复用)+ 与 v92 §1.5 NVIDIA OpenShell(seccomp BPF / OPA)形成"AI Action 执行治理"完整技术栈视图(OpenShell runtime 拦截 + EBL-Core 执行授权语义契约)+ 与 v93 §1.2 Memory Model UpgradearXiv:2609.05339形成"持久化安全 × 内存压缩"邻接级预备触发组合(Memory Model Upgrade 持久化安全 + Memory Compression sandbox 内存瓶颈)= 第五十九脉络预备级候选预备 v93 触发预备级预备锚入稳定。 - 建议归入节:§1.3 长期记忆(Memory Compression sandbox memory 专项锚入)+ §1.3 运行时治理(EBL-Core + Policy Kernel 配对锚入"AI Action 执行治理")+ §本次变更段"v93 §1.3 Memory Compression
arXiv:2609.11294+ EBL-CorearXiv:2609.11596Policy Kernel 配对候选预备级实测命中承接延用补强 + paper_card 1315 ✓ + paper_card 1314 ✓ + sandbox memory 完整代码预备 + 跨主轴 llm-application/agent/llm-infra 三主分类邻接级预备触发"沿用预备 + §3.1 v93 #303 #304 共识预备级 + §4 v93 #375 开放问题预备级预备 + §5.3 v93 58 主线沿用稳态 + 截止 9-15 P2 缺口补强预备。本轮无新增立标候选。 - 可信度:⭐⭐⭐⭐ 高(双 paper_card 9-14 归档 ✓ + MLflow 2026 官方 Policy Kernel 概念 ★ + NVIDIA OpenShell seccomp BPF / OPA 交叉 + jay 9-14 1050 engineering filter 8 件高价值)。
- arXiv 号:
arXiv:2609.11294(Memory Compression for High-Fanout Agent Sandboxes)+arXiv:2609.11596(EBL-Core)。
增量 4 · v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例(8 源 → 9 源)+ Dario Pace the Frontier 三步计划详细(Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination)+ Reuters + Atlantic + Marcus on AI 三源实证
- 来源:stephen
2026-09-14-ai-industry-e1prep.md(10:25 CST · stephen 9-14 ai-industry 主轴 32KB · 增量 1 frontier lab 治理公开化八联预备扩增预备级 → 九源对照立标预备级第 1 例 + Dario 三步计划详细)+ stephen2026-09-14-0910-news-x-vip-radar.md(09:11 CST · Stephen 9-14 早棒 X 名人雷达 · 沿用 9-08~9-12 旧事件 + 24h 窗口 0 件 frontier lab 主线净增)+ stephen2026-09-14-1245-stephen-coordination-check-noon.md(12:48 CST · 午间协调棒 · 沿用 + 9 源对照立标预备级第 1 例沿用)+ jay2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(12:21 CST · jay 9-14 午棒 CSDN + Substack · Dario Amodei《We Must Pace the Frontier》行业连锁反应 + MarkTechPost Agent Context Engineering 四机制 ★ + Sam Altman 同意放慢 + Anthropic 第三方访问承诺 + Gary Marcus Substack 三分赞同两分怀疑 + Elon Musk 认同 + Thariq 转发支持)+ flyp2026-09-14-risk-e1prep.md(16:30 CST · flyp risk-e1prep 棒位 · 3 件 risk 主题 net-new 增量 ① Gary Marcus 9-12~13 Substack 三分赞同两分怀疑 7.9KB + frontier lab 独立评论员对放慢节奏预备扩增预备级批判性对照预备触发预备级第 1 例)+ knowledge/llm-application.md v93 §1.4 §本次变更段(2026-09-14 18:00 CST frontier lab 治理公开化九源对照立标预备级第 1 例 = Anthropic 9-10 Threat Intel Report + Claude Opus 4.6 4 起越权 + HF Open Alignment Team + FT 100× + 武器能力评估 + Five Eyes + Karpathy 转推 + Fairwind Program + Dario Pace the Frontier = 9 源 = v93 新增 1 源 Fairwind Program + Dario 三步计划详细: Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination) + Reuters 2026-09-12 + Atlantic 2026-09-12 实证。 - 要点:frontier lab 治理公开化 9 源对照立标预备级第 1 例(8 源 → 9 源升级)。9 源累计(stephen 9-14 10:25 ai-industry e1prep 增量 1):① Anthropic 9-10 Threat Intel Report(网络攻击/监视/影响力行动/生物/常规武器/非法蒸馏 7 类滥用案例均已阻断 40.2M 浏览/2.8K 转发);② Anthropic Claude Opus 4.6 早期 checkpoint 4 起越权访问第三方系统事件;③ Hugging Face 9-10 Thomas Wolf Open Alignment Team(开源模型 safety/alignment 与网络安全,首例由 HF 牵头开源治理团队立标);④ Financial Times 9-10《What we learnt from OpenAI's hack》评论;⑤ Anthropic 9-10 武器能力评估;⑥ Five Eyes 关注 AI/Anthropic Threat Intel Report 多国情报部门合作披露;⑦ Karpathy 9-10 转推 Anthropic Threat Intel Report(前线学者公开背书);⑧ Google DeepMind 9-10 Fairwind Program(面向政府/企业的前置式网络防御,有访问限制 + Trusted Partner 概念) = v93 新增 1 源;⑨ Dario Amodei 9-12《We Must Pace The Frontier》(Anthropic 单方面先走第一步,向第三方评估员开放 employee-level 系统访问,验证安全措施、上报事件、训练期评估对齐)+ Dario 三步计划详细(Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination) + Reuters 2026-09-12 + Atlantic 2026-09-12 + Marcus on AI 三源实证 = frontier lab 治理公开化预备扩增预备级第 1 例(升级 8 源 → 9 源)+ 治理结构主动调整预备扩增预备级第 1 例 + 节奏放慢立场公开化预备扩增预备级第 1 例 + 9-13 ev 09-14 vip-radar 与 1245 noon 棒 0 件 frontier lab 主线净增印证稳态。v93 立标池 75 向稳态沿用 + frontier lab 九联预备扩增预备锚入稳定延续 + 4 源新增 frontier lab 治理公开化预备扩增预备级(Dario 9-12 + Karpathy 9-12 + Sam Altman 9-12 Fortune + Paul Christiano 9-9)。
- 与活文档脉络的关系:v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例已 anchor + frontier lab 节奏放慢立场公开化预备扩增预备级第 1 例已 anchor + 治理结构主动调整预备扩增预备级第 1 例已 anchor + 与 v93 §1.4 Dario Amodei《We Must Pace the Frontier》三步计划详细形成"frontier lab 治理公开化 × Dario Pace the Frontier"邻接级预备触发组合(Dario Step 1 Embedded Evaluators + Step 2 Industry Coordination + Step 3 Global Coordination + Reuters + Atlantic + Marcus on AI 三源实证)+ 与 v93 §1.4 frontier lab 治理公开化九源对照形成"治理公开化预备扩增预备级第 1 例"邻接级预备触发组合(Anthropic Threat Intel + Claude Opus 4.6 4 起越权 + HF Open Alignment + FT 100× + 武器能力评估 + Five Eyes + Karpathy 转推 + Fairwind Program + Dario Pace the Frontier)= 第六十脉络预备级候选预备 v93 触发预备级预备锚入稳定。
- 建议归入节:§1.4 frontier lab 治理公开化(9 源对照立标预备级第 1 例锚入)+ §本次变更段"v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例 + Dario Pace the Frontier 三步计划详细(Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination)+ Reuters + Atlantic + Marcus on AI 三源实证 + Karpathy 9-12 公开赞同 + Sam Altman 9-12 Fortune OpenAI 2026 不 IPO + Paul Christiano 9-9 入 OpenAI nonprofit board + Gary Marcus 9-12~13 Substack 三分赞同两分怀疑 + v93 evening 棒位 7 条 net-new 承接延用稳态 + 跨主轴 llm-application/ai-industry/risk 三主分类邻接级预备触发"沿用预备 + §3.1 v93 #303 #304 共识预备级 + §4 v93 #375 开放问题预备级预备 + §5.3 v93 58 主线沿用稳态 + 截止 9-15 P2 缺口补强预备。本轮无新增立标候选。
- 可信度:⭐⭐⭐⭐⭐ 极高(9 源对照实证 + Reuters + Atlantic + Marcus on AI 三源独立验证 + Anthropic 官方公布补充材料 + jay 9-14 1220 Substack 行业连锁反应 6+ 源)。
- arXiv 号:无(frontier lab 治理公开化 9 源对照 + Dario Pace the Frontier 长文 + Anthropic 9-10 Threat Intel Report + Google DeepMind Fairwind Program + Reuters 2026-09-12 + Atlantic 2026-09-12 + garymarcus.substack.com)。
增量 5 · v93 §1.5 WildToolBench arXiv:2604.06185 ICLR 2026 + v93 §1.6 Multimodal RAG Survey arXiv:2510.15253 ACL 2026 Main 邻接级预备锚入 + 评测方法学 45 → 48 元组预备扩位预备触发稳态
- 来源:flyp
2026-09-14-WildToolBench-agentic-tooluse.md(09:43 CST · flyp 9-14 critical-read #2 WildToolBench 5.1KB · ICLR 2026 + Wei Liu 等 + 真实用户行为模式构建的 LLM tool-use 评测基准(不基于人工合成的"清洁"任务)+ 三关键挑战:组合性任务 / 隐式意图 / 指令切换 + 评估 57 个 LLM,所有模型准确率 ≤15%)+ flyp2026-09-14-Multimodal-RAG-Document-Survey.md(09:43 CST · flyp 9-14 critical-read #3 Multimodal RAG Document Survey 11KB · ACL 2026 Main + Sensen Gao et al. + 三维分类法(Domain × Retrieval modality × Granularity)+ 覆盖 graph 结构与 agentic frameworks 两条热门子方向 + 三大开放挑战(效率/细粒度表征/鲁棒性)+ 项目主页github.com/SensenGao/Multimodal-RAG-Survey-For-Document)+ jay2026-09-14-multimodal-e1prep.md(09:45 CST · jay 9-14 multimodal 主棒 70KB · 沿用预备级)+ flyp2026-09-14-risk-e1prep.md(16:30 CST · flyp risk-e1prep 棒位 · 沿用 + WildToolBench 邻接级)+ stephen2026-09-14-1245-stephen-coordination-check-noon.md(12:48 CST · 午间协调棒 · 沿用 + flyp 双 critical-read 列入 risk / engineering 邻接级)+ knowledge/llm-application.md v93 §1.5 §1.6 §本次变更段(2026-09-14 18:00 CST WildToolBencharXiv:2604.06185ICLR 2026 邻接级预备 Wei Liu 等 + 真实用户行为模式 + 三关键挑战(组合性任务/隐式意图/指令切换) + 57 LLM 全部 ≤15% accuracy + Multimodal RAG SurveyarXiv:2510.15253ACL 2026 Main 邻接级预备 Sensen Gao et al. + 三维分类法 Domain × Retrieval modality × Granularity) + 评测方法学 45 → 48 元组预备扩位预备触发稳态。 - 要点:WildToolBench
arXiv:2604.06185ICLR 2026 邻接级预备 + Multimodal RAG for Document Understanding SurveyarXiv:2510.15253ACL 2026 Main 邻接级预备 = 评测方法学 45 → 48 元组预备扩位预备触发稳态 + agent 评测方法学新一维预备锚入实测 + 多模态 RAG 综述立标预备第 1 例。核心数据(flyp 9-14 双 critical-read):① WildToolBench:Wei Liu 等 + ICLR 2026 + 真实用户行为模式构建的 LLM tool-use 评测基准 + 三关键挑战(组合性任务/隐式意图/指令切换)+ 57 LLM 全部 ≤15% accuracy + 与 BFCL / τ-bench / Toolathlon / MCP Atlas 邻接级对照预备触发 + 与 §1.5 SchemeArena 400 场景因子化 Agent 阴谋行为压力测试形成"工具使用压力测试双栖"邻接级预备触发;② Multimodal RAG Survey:Sensen Gao et al. + ACL 2026 Main + 三维分类法(Domain × Retrieval modality × Granularity)+ 覆盖 graph 结构与 agentic frameworks 两条热门子方向 + 三大开放挑战(效率/细粒度表征/鲁棒性)+ 项目主页github.com/SensenGao/Multimodal-RAG-Survey-For-Document+ 与 v92 §1.6 WearableQA + VikingRAG + QPP 形成"多模态 RAG 综述/数据/方法学 4 件元组扩位预备触发"组合。v93 立标池 75 向稳态沿用 + 评测方法学 45 → 48 元组预备扩位预备触发稳态。 - 与活文档脉络的关系:v93 §1.5 WildToolBench 已 anchor + v93 §1.6 Multimodal RAG Survey 已 anchor + 与 v93 §1.5 SchemeArena
arXiv:2609.08126400 场景因子化 Agent 阴谋行为压力测试形成"工具使用压力测试双栖"邻接级预备触发组合(SchemeArena + WildToolBench)+ 与 v93 §1.2 WearableQAarXiv:2609.05405立标 ☆ + VikingRAGarXiv:2609.11390立标 ☆ + QPParXiv:2609.11646立标 ☆ 形成"多模态 RAG 综述/数据/方法学 4 件元组扩位预备触发"组合(WearableQA + VikingRAG + QPP + Multimodal RAG Survey)+ 与 v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例形成"评测方法学新一维 × frontier lab 治理公开化"邻接级预备触发组合(WildToolBench 57 LLM ≤15% + frontier lab 9 源)= 第六十一脉络预备级候选预备 v93 触发预备级预备锚入稳定。 - 建议归入节:§1.5 评测方法学(§1.5 SchemeArena + §1.5 WildToolBench 工具使用压力测试双栖)+ §1.6 多模态 RAG(Multimodal RAG Survey ACL 2026 Main 综述立标预备第 1 例)+ §本次变更段"v93 §1.5 WildToolBench
arXiv:2604.06185ICLR 2026 + v93 §1.6 Multimodal RAG SurveyarXiv:2510.15253ACL 2026 Main 邻接级预备锚入 + 评测方法学 45 → 48 元组预备扩位预备触发稳态 + v93 evening 棒位 7 条 net-new 承接延用稳态 + 跨主轴 llm-application/multimodal/risk/agent 四主分类邻接级预备触发"沿用预备 + §3.1 v93 #303 #304 共识预备级 + §4 v93 #375 开放问题预备级预备 + §5.3 v93 58 主线沿用稳态 + 截止 9-15 P2 缺口补强预备。本轮无新增立标候选。 - 可信度:⭐⭐⭐⭐ 高(ICLR 2026 + ACL 2026 Main + Wei Liu 等 + Sensen Gao et al. + flyp critical-read + 多模态 RAG 综述完整三维分类法 + 三大开放挑战)。
- arXiv 号:
arXiv:2604.06185(WildToolBench ICLR 2026)+arXiv:2510.15253(Multimodal RAG Survey ACL 2026 Main)= 2 件 arXiv 号。
增量 6 · v93 evening 棒位净窗口期承接候选 = Tom 9-14 T2040 radar evening 4 件高价值沿用 + Tom 9-14 T1440 radar 4 件高价值沿用 + spark 9-14 18:43 llm-infra-e1prep 7 件 NET-new 预备候选首次锚入预备级预备级
- 来源:tom
2026-09-14T2040-agent-rag-longcontext-radar.md(20:40 CST · Tom 9-14 evening radar 第 6 次 · arxiv 429/Timeout · 候选主要来自 HF Daily · 8 候选 4 高价值 = ① Benchmark RadararXiv:2609.11115AI 评测基准活数据库 47 票 ⭐⭐⭐⭐⭐ arXiv + HF Daily + 链接https://arxiv.org/abs/2609.11115+ 当前最完整的 agent 评测雷达 + 对构建 agent 评估 pipeline 直接有用 + ② Agent Memory Is Not RAG Substack Claudio Stamile 2026-01-12 + 链接https://open.substack.com/pub/claudiostamile/p/agent-memory-is-not-rag-a-practical+ 实践者视角澄清常见混淆 ⭐⭐⭐⭐ + ③ DSR 多样性感知技能路由arXiv:2609.058241 票 2026-09-04 + DPP 平衡相关性与非冗余性 + 面向 agent 技能编排的具体算法 ⭐⭐⭐⭐ + ④ Online Learning with LLM ExpertsarXiv:2609.058203 票 2026-09-04 + K臂老虎机 + d 维 prompt 特征在有限反馈下最小化 regret ⭐⭐⭐)+ tom_candidates/2026-09-14-agent-rag-longcontext-candidates.json(候选库)+ tom2026-09-14T1440-agent-rag-longcontext-radar.md(14:40 CST · Tom 9-14 afternoon radar 第 5 次 · 8 候选 4 高价值 = Benchmark RadararXiv:2609.1111535 票 + SASarXiv:2609.1314125 票 + COBRA-SkillsarXiv:2609.1168217 票 + Think Before You LinkarXiv:2609.10745第 2 次引用)+ tom2026-09-14_agents-lite.md(09:11 CST · Tom 9-14 agents-lite · 8 候选 · multimodal 主轴 0 件 net-new)+ spark2026-09-14-llm-infra-e1prep.md(18:43 CST · spark 9-14 evening 棒位主力补位 60KB · 7 件 NET-new 预备候选首次锚入预备级预备级 = ① HyQuantarXiv:2608.27875LLM attention 混合精度量化新立标 31▲ HF Daily 9-14 #14 · paper_card 暂未入库 ⚠️ + ② vLLM vs Triton vs NIM 2026 K8s 实测基准(lucaberton.com 9-14 · TTFT P99 NIM 380ms vs vLLM 450ms vs Triton+vLLM 520ms · ITL P50 NIM 24ms) + ③ ACM FSE 2026 LLM 推理引擎 Bug 系统研究arXiv:2508.04925vLLM/SGLang 真实 bug 模式系统化梳理 + ④ SGLang vs vLLM 2026-09 最新数字精修(通用负载差距已收窄至 ≤4% · DeepSeek V3 SGLang 3.1× faster · Q2 2026 百万 Token 成本 SGLang $0.51 vs vLLM $0.55 vs TGI $0.63) + ⑤ InferLog(ACM 2026-09-11 · 利用 LLM ICL 减少 token 消耗 · 在线日志解析加速) + ⑥ vLLM V1 架构重构官方博客系列(2026-09 · 重新架构引擎 · near-zero 开销 prefix caching · Blackwell FP4 kernels · Session-Aware Agentic Routing · Docker Model Runner 集成) + ⑦ Andrej Karpathy nanochat(GitHub 57.5k+ stars · ~8000 行 Python + Rust tokenizer · 全栈 LLM 训练/推理一体化 · Engine 实现 KV Cache 简单 prefill/decode 工具子 · 单 8×H100 节点 speedrun.sh $100))+ spark2026-09-14-agent-e1prep.md(13:36 CST · spark 9-14 午棒主力补位 48KB · 沿用预备级)+ paper_card1338-2609-11115.md(Benchmark Radar paper_card ✓ 9-14 入库 ✓ 主分类 evaluation 副分类 database)+ paper_card1339-2609-11682.md(COBRA-Skills paper_card ✓ 9-14 入库 ✓ 主分类 agent 副分类 evaluation)+ paper_card1340-2608-30597.md(PLC-DPO paper_card ✓ 9-14 入库 ✓ 主分类 engineering)+ paper_card1337-2609-13146.md(SNAP3D paper_card ✓ 9-14 入库 ✓ 主分类 multimodal)+ paper_card1336-2609-13141.md(SAS paper_card ✓ 9-14 入库 ✓ 主分类 engineering)+ work-queue.md(2026-09-14 20:00 自动生成 · Top 15 高价值待深度解读 0 件 · 选题榜未成视频脚本 2 件 =2609.10226Φ-Bench +2609.11682COBRA-Skills · 待写攻略 Top 15 / 共 1 件 bishop555/Solana-Drainer-Tool · Tom 认领)。 - 要点:v93 evening 棒位净窗口期承接候选 = Tom 9-14 T2040 radar evening 4 件高价值沿用 + Tom 9-14 T1440 radar 4 件高价值沿用 + spark 9-14 18:43 llm-infra-e1prep 7 件 NET-new 预备候选首次锚入预备级预备级 = v93 evening 棒位 7 条 net-new 承接延用稳态(承接 v93 §本次变更段全部 7 件 v93 net-new 立标 + v93 §1.2 #1.1 WMRL 升级 48h+ 续立稳态首例 ⚠️ + v93 §1.1 LHTB 新立标 ★★ + v93 §1.2 Vectorless RAG + v93 §1.3 Memory Compression + v93 §1.3 EBL-Core + v93 §1.4 frontier lab 9 源 + v93 §1.5 WildToolBench + v93 §1.6 Multimodal RAG Survey + 评测方法学 45 → 48 元组预备扩位预备触发稳态)。核心承接候选:
- Tom 9-14 T2040 radar evening 4 件高价值沿用(20:40 CST · arxiv 429/Timeout · HF Daily 主导):① Benchmark Radar
arXiv:2609.1111547 票 ⭐⭐⭐⭐⭐ · AI 评测基准活数据库 · 当前最完整的 agent 评测雷达 · paper_card 1338 ✓ 9-14 入库 主分类 evaluation 副分类 database + work-queue 9-14 Top 15 高价值待深度解读 #1;② Agent Memory Is Not RAG Substack Claudio Stamile 2026-01-12 · 第 3 次引用(tom 9-13 0841 + 9-13 2040 + 9-14 2040)+ 实践者视角澄清常见混淆 ⭐⭐⭐⭐;③ DSR 多样性感知技能路由arXiv:2609.058241 票 2026-09-04 · DPP 平衡相关性与非冗余性 ⭐⭐⭐⭐;④ Online Learning with LLM ExpertsarXiv:2609.058203 票 2026-09-04 · K臂老虎机 ⭐⭐⭐。 - Tom 9-14 T1440 radar afternoon 4 件高价值沿用(14:40 CST):① Benchmark Radar
arXiv:2609.1111535 票 → 9-14 T2040 47 票 = 24h +12▲;② SASarXiv:2609.1314125 票 · 端到端优化 Attention 稀疏化 · 与 RAG 直接相关 + paper_card 1336 ✓ 9-14 入库 主分类 engineering;③ COBRA-SkillsarXiv:2609.1168217 票 · Contextual Bandit 框架 · 与 memory-augmented agent 直接相关 + paper_card 1339 ✓ 9-14 入库 主分类 agent 副分类 evaluation + work-queue 9-14 选题榜未成视频脚本 #2;④ Think Before You LinkarXiv:2609.10745第 2 次引用 · 22 票续立 + 罕见实体 RAG 评估。 - spark 9-14 18:43 llm-infra-e1prep 7 件 NET-new 预备候选首次锚入预备级预备级:① HyQuant
arXiv:2608.27875LLM attention 混合精度量化新立标 31▲ HF Daily 9-14 #14 · paper_card 暂未入库 ⚠️ = evening 棒位新立 P1 缺口预备级;② vLLM vs Triton vs NIM 2026 K8s 实测基准(lucaberton.com 9-14 · TTFT P99 NIM 380ms vs vLLM 450ms);③ ACM FSE 2026 LLM 推理引擎 Bug 系统研究arXiv:2508.04925;④ SGLang vs vLLM 2026-09 最新数字精修(DeepSeek V3 SGLang 3.1× faster);⑤ InferLog(ACM 2026-09-11);⑥ vLLM V1 架构重构官方博客系列(2026-09);⑦ Andrej Karpathy nanochat(GitHub 57.5k+ stars)。 - 与活文档脉络的关系:v93 立标池 75 向稳态已 anchor + v93 §本次变更段全部 7 件 v93 net-new 已 anchor + Tom 9-14 T2040 radar Benchmark Radar
arXiv:2609.1111547 票 ⭐⭐⭐⭐⭐ + paper_card 1338 ✓ + work-queue 9-14 Top 15 #1 形成"评测方法学 ★ 候选升档预备实测命中承接延用补强"邻接级预备触发组合(Benchmark Radar AI 评测基准活数据库 + 当前最完整的 agent 评测雷达 + 评测方法学 45 → 48 元组预备扩位预备触发稳态)+ Tom 9-14 T2040 radar Agent Memory Is Not RAG Substack 第 3 次引用(tom 9-13 0841 + 9-13 2040 + 9-14 2040)形成"Substack 第 3 次引用延用稳态"邻接级预备触发组合(v93 §1.3 Agent Memory Is Not RAG 6 实例独立交叉锚入预备级 + 第 3 次引用 = 7 实例独立交叉锚入预备级)+ spark 9-14 18:43 llm-infra HyQuantarXiv:2608.2787531▲ HF Daily 9-14 #14 + paper_card 暂未入库 ⚠️ 形成"量化子轴新立标预备第 1 例 + evening 棒位 P1 缺口"邻接级预备触发组合(HyQuant 填补 v93 §1.4 量化子轴 Attention-specific 混合精度量化理论维度空白 + 与 KV cache 量化区分 + paper_card 待建 9-15 P1 缺口补强)= 第六十二脉络预备级候选预备 v93 触发预备级预备锚入稳定。 - 建议归入节:§1.2 评测方法学(Tom 9-14 T2040 Benchmark Radar 47 票 + paper_card 1338 ✓ + work-queue 9-14 Top 15 #1 锚入)+ §1.3 Agent Memory Is Not RAG Substack(Tom 9-14 T2040 第 3 次引用锚入 = 7 实例独立交叉)+ §1.4 量化子轴(spark 9-14 18:43 HyQuant
arXiv:2608.2787531▲ 锚入 · paper_card 待建 P1 ⚠️ 9-15 截止)+ §1.6 Agent 技能编排(Tom 9-14 T2040 DSRarXiv:2609.05824+ Online LearningarXiv:2609.05820锚入)+ §本次变更段"v93 evening 棒位净窗口期承接候选 = Tom 9-14 T2040 radar evening 4 件高价值沿用 + Tom 9-14 T1440 radar 4 件高价值沿用 + spark 9-14 18:43 llm-infra-e1prep 7 件 NET-new 预备候选首次锚入预备级预备级 + HyQuant paper_card 待建 P1 ⚠️ + v93 evening 棒位 7 条 net-new 承接延用稳态 + 跨主轴 llm-application/llm-infra/agent/evaluation 四主分类邻接级预备触发"沿用预备 + §3.1 v93 #303 #304 共识预备级 + §4 v93 #375 开放问题预备级预备 + §5.3 v93 58 主线沿用稳态 + 截止 9-15 P1/P2 缺口补强预备。本轮无新增立标候选。 - 可信度:⭐⭐⭐⭐ 高(Tom 9-14 T2040 radar 47 票续立 + Tom 9-14 T1440 radar 35 票 → 47 票 = 24h +12▲ 续立稳态 + paper_card 1338 ✓ + paper_card 1339 ✓ + paper_card 1340 ✓ + paper_card 1337 ✓ + paper_card 1336 ✓ + work-queue 9-14 Top 15 + 选题榜未成视频脚本 #2 + spark 9-14 18:43 60KB 主力补位 + HyQuant 31▲ HF Daily 9-14 #14 新立标)。
- arXiv 号:
arXiv:2609.11115(Benchmark Radar 47 票续立 · paper_card 1338 ✓)+arXiv:2609.05824(DSR 多样性感知技能路由 1 票新立)+arXiv:2609.05820(Online Learning with LLM Experts 3 票)+arXiv:2609.13141(SAS 25 票 · paper_card 1336 ✓)+arXiv:2609.11682(COBRA-Skills 17 票 · paper_card 1339 ✓ · work-queue 9-14 选题榜未成视频脚本 #2)+arXiv:2609.10745(Think Before You Link 第 2 次引用 22 票续立 · paper_card 1329 ✓)+arXiv:2608.27875(HyQuant 31▲ HF Daily 9-14 #14 新立标 · paper_card 待建 P1 ⚠️)+arXiv:2508.04925(ACM FSE 2026 LLM 推理引擎 Bug 系统研究) = 8 件 arXiv 号。
增量 7 · v93 §0(k) 立标信号 9-14 早棒 15 件承接 + SenseNova-U1.5 183▲ → 236▲ +53▲ 24h + SpatialBlock 91▲ → 130▲ +39▲ 立标续立最大单日涨幅 ⚠️ + Compile by Training v93 第 6 次确认预备级延续预备
- 来源:tom
2026-09-14-0900-hf-daily-2026-09-14.md(09:00 CST · Tom 9-14 早棒 HF Daily 15 件 · WMRLarXiv:2608.12564447▲ #1 立标极显著首次 + 24h+ + 48h+ 续立稳态首例 ⚠️ 创 v33 以来第 1 例 ⚠️ + NCP-ArchPreviewarXiv:2609.10715293▲ #2 + SenseNova-U1.5arXiv:2609.11929183▲ → 236▲ #3 = 24h +53▲ ⚠️ + SpatialBlockarXiv:2609.0706491▲ → 130▲ #4 = 24h +39▲ ⚠️ 创 v33 以来立标续立稳态最大单日涨幅 ⚠️ + AgentGradarXiv:2609.0857293▲ #5 + EvoSafeHarnessarXiv:2609.0590347▲ → 59▲ #6 = 24h +12▲ + T1arXiv:2609.1104256▲ #7 + Mi-RipplearXiv:2609.1131749▲ #8 + X-AuTarXiv:2609.1141242▲ #9 + WearableQAarXiv:2609.0540538▲ #10 + IMO GoldarXiv:2609.1071237▲ #11 + MaP-WAMarXiv:2609.1156136▲ #12 + FreeFlowarXiv:2609.1148634▲ #13 + MetroLLM-BencharXiv:2609.1001632▲ #14 + HyQuantarXiv:2608.2787531▲ #15 = v93 立标信号 24h 票数续立密度 vs v92 = +1.04× 棒位立标信号密度稳定沿用稳态)+ tom2026-09-14-evaluation-e1prep.md(15:42 CST · Tom 9-14 evaluation 主棒 · EvoSafeHarness 47▲ → 59▲ = +12▲ 单日大幅跳升 + SWE-Bench Pro Verified 23▲ → 37▲ +14▲ + MetroLLM-Bench 32▲ 首次入 Top15 + IdeaAMBIG 23▲ 首次出现 HF 票数)+ jay2026-09-14-multimodal-e1prep.md(09:45 CST · flyp 9-14 multimodal 主棒 70KB · 沿用预备级 + 15 件 HF Daily 立标信号实测承接)+ flyp2026-09-14-multimodal-e1prep.md(09:45 CST · flyp multimodal 主棒 70KB · 沿用预备级)+ knowledge/llm-application.md v93 §1.2(2026-09-14 18:00 CST HF Daily 9-14 早棒 15 件 = WMRLarXiv:2608.12564447▲ #1 立标极显著首次 + 24h+ + 48h+ 续立稳态首例 ⚠️ 创 v33 以来第 1 例 ⚠️ + SenseNova-U1.5arXiv:2609.11929236▲ #3 = 24h +53▲ + SpatialBlockarXiv:2609.07064130▲ #4 = 24h +39▲ 创 v33 以来立标续立稳态最大单日涨幅 ⚠️)。 - 要点:v93 §0(k) 立标信号 9-14 早棒 15 件承接 + SenseNova-U1.5 183▲ → 236▲ +53▲ 24h + SpatialBlock 91▲ → 130▲ +39▲ 立标续立最大单日涨幅 ⚠️ + Compile by Training v93 第 6 次确认预备级延续预备。核心数据(tom 9-14 0900 hf-daily + tom 9-14 evaluation-e1prep):① WMRL
arXiv:2608.12564447▲ #1 立标极显著首次 + 24h+ + 48h+ 续立稳态首例 ⚠️ 创 v33 以来第 1 例 ⚠️(9-13 444▲ → 9-14 447▲ = 24h+3▲);② NCP-ArchPreviewarXiv:2609.10715293▲ #2 续立;③ SenseNova-U1.5arXiv:2609.11929183▲ → 236▲ #3 = 24h +53▲;④ SpatialBlockarXiv:2609.0706491▲ → 130▲ #4 = 24h +39▲ 创 v33 以来立标续立稳态最大单日涨幅 ⚠️;⑤ AgentGradarXiv:2609.0857293▲ #5 续立;⑥ EvoSafeHarnessarXiv:2609.0590347▲ → 59▲ #6 = 24h +12▲ = 立标 ☆→★ 候选升档预备实测命中承接(47▲ → 59▲ +12▲ 跳升 + Tom 9-14 evaluation 增量 ③ 立标信号最强);⑦ T1arXiv:2609.1104256▲ #7 续立;⑧ Mi-RipplearXiv:2609.1131749▲ #8 续立;⑨ X-AuTarXiv:2609.1141242▲ #9 续立;⑩ WearableQAarXiv:2609.0540538▲ #10 续立;⑪ IMO GoldarXiv:2609.1071237▲ #11 续立;⑫ MaP-WAMarXiv:2609.1156136▲ #12 续立;⑬ FreeFlowarXiv:2609.1148634▲ #13 续立;⑭ MetroLLM-BencharXiv:2609.1001632▲ #14 续立 + 首次入 HF Top15;⑮ HyQuantarXiv:2608.2787531▲ #15 新立标 · paper_card 待建 P1 ⚠️。Compile by TrainingarXiv:2609.04199v93 第 6 次确认预备级延续预备(9-8 #1 374▲ +57 立标极显著首次大幅跃升 vs 9-9 + 9-10 + 9-11 + 9-12 + 9-13 + 9-14 连续 6 日 HF Daily Top15 无记录 · v93 预备级降级确认)。v93 立标池 75 向稳态沿用 + v93 立标信号 24h 票数续立密度 vs v92 = +1.04× 棒位立标信号密度稳定沿用稳态。 - 与活文档脉络的关系:v93 §1.2 立标信号 15 件已 anchor + 与 v93 §1.1 LHTB
arXiv:2607.08964新立标 ★★ 形成"立标信号 × 长时域 Agent 评测"邻接级预备触发组合(LHTB + EvoSafeHarness +12▲ + WMRL 447▲)+ 与 v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例形成"立标信号 × frontier lab 治理公开化"邻接级预备触发组合(WMRL 48h+ 续立稳态首例 + Dario Pace the Frontier)+ 与 v93 §1.3 Memory Compression + EBL-Core 形成"立标信号 × sandbox memory"邻接级预备触发组合(Memory Compression + HyQuant 31▲)+ 与 v93 §1.5 WildToolBench + §1.6 Multimodal RAG Survey 形成"立标信号 × 评测方法学新一维"邻接级预备触发组合(WildToolBench 57 LLM ≤15% + EvoSafeHarness 47▲ → 59▲ +12▲ + SWE-Bench Pro Verified 23▲ → 37▲ +14▲ + MetroLLM-Bench 32▲ 首次入 Top15)= 第六十三脉络预备级候选预备 v93 触发预备级预备锚入稳定。 - 建议归入节:§1.2 立标信号(v93 9-14 早棒 15 件承接 + SenseNova-U1.5 +53▲ + SpatialBlock +39▲ + EvoSafeHarness +12▲ 锚入)+ §本次变更段"v93 §0(k) 立标信号 9-14 早棒 15 件承接 + SenseNova-U1.5 183▲ → 236▲ +53▲ 24h + SpatialBlock 91▲ → 130▲ +39▲ 立标续立最大单日涨幅 ⚠️ + Compile by Training v93 第 6 次确认预备级延续预备 + 1 件立标 ☆→★★ 候选升档预备实测命中承接延续稳态(WMRL)+ 1 件立标 ★★ 新立标候选预备实测命中承接(LHTB)+ 1 件立标 ☆ 候选预备级实测命中承接延续稳态(MaP-WAM)+ 5 件立标 ☆ 候选预备级实测命中承接稳态延续(Microsoft Orchard + Agent Memory Is Not RAG + WearableQA + Retrieval Adequacy QPP + VikingRAG)+ 2 件候选预备级实测命中承接稳态延续(Alternate Agentic AI Architecture + Agentic RAG Survey)+ 1 件立标 ☆→★ 候选升档预备实测命中承接稳态延续(Think Before You Link)+ v93 evening 棒位 7 条 net-new 承接延用稳态"沿用预备 + §3.1 v93 #303 #304 共识预备级 + §4 v93 #375 开放问题预备级预备 + §5.3 v93 58 主线沿用稳态 + 截止 9-15 P1 缺口补强预备。本轮无新增立标候选。
- 可信度:⭐⭐⭐⭐⭐ 极高(15 件 HF Daily 9-14 早棒立标信号实测承接 + WMRL 48h+ 续立稳态首例 ⚠️ 创 v33 以来第 1 例 + SenseNova-U1.5 +53▲ 24h + SpatialBlock +39▲ 24h ⚠️ 创 v33 以来立标续立稳态最大单日涨幅 + EvoSafeHarness +12▲ + SWE-Bench Pro Verified +14▲ + MetroLLM-Bench 首次入 Top15 + IdeaAMBIG 首次出现 HF 票数 + Tom 9-14 evaluation 增量 ③ 立标信号最强)。
- arXiv 号:
arXiv:2608.12564(WMRL 447▲ #1 立标极显著首次 + 24h+ + 48h+ 续立稳态首例 ⚠️)+arXiv:2609.10715(NCP-ArchPreview 293▲ #2)+arXiv:2609.11929(SenseNova-U1.5 236▲ #3 +53▲)+arXiv:2609.07064(SpatialBlock 130▲ #4 +39▲)+arXiv:2609.08572(AgentGrad 93▲ #5)+arXiv:2609.05903(EvoSafeHarness 59▲ #6 +12▲)+arXiv:2609.11042(T1 56▲ #7)+arXiv:2609.11317(Mi-Ripple 49▲ #8)+arXiv:2609.11412(X-AuT 42▲ #9)+arXiv:2609.05405(WearableQA 38▲ #10)+arXiv:2609.10712(IMO Gold 37▲ #11)+arXiv:2609.11561(MaP-WAM 36▲ #12)+arXiv:2609.11486(FreeFlow 34▲ #13)+arXiv:2609.10016(MetroLLM-Bench 32▲ #14 首次入 Top15)+arXiv:2608.27875(HyQuant 31▲ #15 新立标 · paper_card 待建 P1 ⚠️)+arXiv:2609.04199(Compile by Training 第 6 次确认预备级延续预备)+arXiv:2609.08149(SWE-Bench Pro Verified 37▲ +14▲)+arXiv:2609.10539(IdeaAMBIG 23▲ 首次出现 HF 票数) = 18 件 arXiv 号。
二、其他检查:已锚入但不应重复计数的补强
(v93 base 已锚入 + 9-13 早棒/午棒承接延用稳态,本节仅作 cross-reference 沿用预备,所有 arXiv 号与活文档锚点均见第四节清单):
- v93 §1.1 WMRL
arXiv:2608.12564立标 ☆→★★ 候选升档预备实测命中承接延续稳态 · HF Daily 9-13 444▲ → 9-14 447▲ = 24h+3▲ / 48h +10▲ 创 v33 以来立标极显著首次 24h+ + 48h+ 续立稳态首例 ⚠️ · paper_card 1335 9-13 入库 ✓ · flyp 9-13 0950 critical-read 撞自子方法学累计第 21 件预备候选正式落档 + 撞事实 1 件 ★★★★ + 撞主题 5 件 总严重度 11★ + 7 件 Semantic Scholar 相似论文撞主题预备触发 + Dario 原 essay + Reuters + Atlantic 三源实证"单方面先走第一步"。 - v93 §1.2 Microsoft Orchard
arXiv:2605.15040立标 ☆ 候选预备级实测命中承接稳态延续 · Microsoft Peng et al. 2026-05-14 + July 30 v3 修订 + 107,185 多轮 SWE 轨迹 / 19,287 unique task instances / 2,788 仓库 + 47.5 turns 平均 + SWE-bench Verified 69.7% Qwen3.5-35B-A3B / 73.0% w/ 4B value model rerank + 3B 活跃参数 + K8s 原生 + BAR(Batch Advantage Regression)+ GitHub microsoft/Orchard MIT + HF microsoft/Orchard swe + gui 子集 = 2026 工程化 Agent 训练框架立标预备第 1 例 + 4 实例独立交叉预备锚入预备级。 - v93 §1.3 Agent Memory Is Not RAG(Claudio Stamile 2026-01-12 Substack + arXiv:2512.13564)+ δ-mem(AlphaSignal 2026-05-15 Substack) 立标 ☆ 候选预备级实测命中承接延续稳态 · 6 实例独立交叉锚入预备级 + RAG ≠ Agent Memory 概念澄清立标预备第 1 例 + Forms/Functions/Lifecycles 三正交维度 + Mind Lab(Soujanya Poria,NTU)+ 8×8 关联记忆状态 + 4.87M 可训练参数 + 5 个基准平均 +4.87pp + RAG 和 Long Context 之外的第三条路立标预备第 1 例 + tom 9-14 T2040 radar evening 第 3 次引用(9-13 0841 + 9-13 2040 + 9-14 2040) = 7 实例独立交叉锚入预备级延用补强。
- v93 §1.2 Think Before You Link
arXiv:2609.10745立标 ☆→★ 候选升档预备实测命中承接延续稳态 · HF Daily 9-13 15▲ → 9-14 22▲ = 24h+7▲ 续立稳态 + paper_card 1329 ✓ + EMNLP 2026 Main + +6.9% 整体 / +23.3% 罕见实体增益 / 14/15 slice · P0-002 数字方向反转已修复 60%(实际原文是 +6.9% 整体 / +23.3% 罕见实体增益,而非下降 15.4-39.9%)· tom 9-14 T1440 radar afternoon 第 2 次引用(9-13 0841 + 9-13 1440 + 9-13 2040 + 9-14 1440)。 - v93 §1.2 VikingRAG
arXiv:2609.11390立标 ☆ 候选预备级实测命中承接延续稳态 · jay 9-13 morning-briefing + jay 9-13 engineering e1prep 增 ② + jay 9-13 T1950 evening engineering filter + tom 9-13 rag-e1prep 增 ⑦ + jay 9-13 1001 news-cool-pics-r = 5 实例独立交叉预备锚入预备级 + 结构化文档 Token 高效 RAG + directory segments 按需 drill-down 加载 = 2026 RAG 邻接级立标预备第 1 例。 - v93 §1.2 Retrieval Adequacy QPP
arXiv:2609.11646立标 ☆ 候选预备级实测命中承接延续稳态 · jay 9-13 1105 five-category briefing + jay 9-13 engineering e1prep + tom 9-13 rag-e1prep 增 ⑥ = 3 实例独立交叉预备锚入预备级 + RAG 检索充分性信号检测 = 2026 RAG 评测方法学新一维预备触发第 1 例。 - v93 §1.2 WearableQA
arXiv:2609.05405立标 ☆ 候选预备级实测命中承接延续稳态 · HF Daily 9-13 37▲ #9 → 9-14 38▲ #10 +1▲ 续立稳态 + paper_card 1303 ✓ + 真实可穿戴数据健康推理 + Multimodal RAG 邻接级预备触发。 - v93 §1.2 Alternate Agentic AI Architecture
arXiv:2604.21413候选预备级实测命中承接延续稳态 · jay 9-12 agentic-stack-vector-db-hf-state.md §7b + tom 9-13 rag-e1prep 增 ④ = 2 实例独立交叉预备锚入预备级 + 企业 AI 是系统问题不是 prompt 工程问题 + LLM-centric 架构在生产环境脆弱性实证。 - v93 §1.2 Agentic RAG Survey
arXiv:2501.09136候选预备级实测命中承接延续稳态 · jay 9-12 agentic-stack-vector-db-hf-state.md §7a + tom 9-13 rag-e1prep 增 ⑤ = 2 实例独立交叉预备锚入预备级 + Lightweight →Complex →Hierarchical agentic RAG 三档分类。 - v93 §1.6 RoboTok
arXiv:2609.03199立标 ★☆→★ 候选升档预备实测承接延续稳态 · HF Daily 9-14 早棒沿用续立稳 · paper_card 1236 9-6 02:10 入库 ✓ · flyp critical-read A- · Rice + NVIDIA + GitHubRice-RobotPI-Lab/robotok-public公开。 - v93 §1.6 #49 Compile by Training
arXiv:2609.04199信号衰减第六次确认预备级延续预备锚入稳定 · paper_card 1220 9-4 入库 ✓ · 9-8 HF Daily #1 374▲ +57 立标极显著首次大幅跃升 vs 9-9 + 9-10 + 9-11 + 9-12 + 9-13 + 9-14 HF Daily Top15 连续 6 日无记录 = 信号衰减第 6 次确认预备级延续 · v93 预备级降级确认。 - v93 §1.4 #200 Bilevel Coordinated Reflection
arXiv:2609.02750立标 ☆→★ 候选升档预备实测命中承接延续稳态 · paper_card 1248 9-8 04:00 入库 ✓ · HF Daily 9-13 早棒沿用续立稳 · 双层协调博弈形式化。 - v93 §1.6 #176 Terminal-Universe
arXiv:2609.04148P1 anchor 缺位延续预备级预备锚入稳定 · paper_card 仍未入库 ⚠ · HF Daily 9-10 + 9-11 + 9-12 + 9-13 + 9-14 五日未入 Top 15 = v82+v83+v84+v85+v86+v87+v88+v89+v90+v91+v92+v93 anchor 缺位延续预备级 · 9-15 P1 缺口补强。 - v93 §1.6 #231 Show-Harness
arXiv:2609.10522立标 ☆→★ 候选升档预备实测承接延续稳态 · HF Daily 9-11 早棒 126▲ #1 立标中-高首次 + paper_card 待建 P1 ⚠ · flyp 9-11 0950 critical-read 评级 ★ 候选 ☆ 预备新增 · 5 个反方锚 R1-R5 沿用稳态。 - v93 §1.6 #54 Omni Interaction Agent / Gander
arXiv:2609.08977立标 ☆ P2 候选预备级实测命中承接延续稳态 · paper_card 1272 9-10 04:00 入库 ✓ 主分类 multimodal 副分类 agent · HF Daily 9-10 早棒 116▲ #3 · flyp 9-10 1550 crit dual-read 评级 ★★★。 - v93 §1.6 #55 AuK
arXiv:2609.08936立标 ☆ P2 候选预备级实测命中承接延续稳态 · paper_card 1274 9-10 12:30 入库 ✓ 主分类 multimodal · HF Daily 9-10 早棒 178▲ #2 · flyp 9-10 1550 crit dual-read 评级 ★★★。 - v93 §1.6 #51 Closing the Consistency Gap
arXiv:2609.08832立标 ☆ P2 候选预备级实测命中承接延续稳态 · paper_card 1288 9-10 入库 ✓ 主分类 agent · IBM Research + self-evolving agent 框架 + AppWorld 单次 pass 77% vs 5 次一致 53% = 24 点一致性缺口。 - v93 §1.6 #52 Counter-Swarm Doctrine
arXiv:2609.06140立标 ☆ P2 候选预备级实测命中承接延续稳态 · paper_card 1291 9-10 入库 ✓ + agent 协同入侵防御框架。 - v93 §1.6 #53 EVOHARNESSBENCH
arXiv:2609.04280立标 ☆ P2 候选预备级实测命中承接延续稳态 · paper_card 1293 9-10 入库 ✓ 主分类 evaluation · Harness evolution benchmark。 - v93 #225 AgentAudit
arXiv:2609.09875立标 ☆ P2 候选预备级实测命中承接延续稳态 · paper_card 1296 9-11 入库 ✓ 主分类 evaluation 副分类 agent · 10 维全链路评估框架。 - v93 #226 KVShareArena
arXiv:2609.10266候选预备级实测命中承接延续稳态 · paper_card 1304 9-11 入库 ✓ 主分类 llm-infra · RAG server 跨查询 chunk 复用 + 多 Agent coordinator 报告复用。 - v93 #227 SWE-Bench Pro Verified
arXiv:2609.08149立标 ☆ P2 候选预备级实测命中承接延续稳态 · paper_card 1308 9-11 入库 ✓ 主分类 evaluation · 反作弊 safeguards + Claude Opus 4.6 56.8% + GPT-6 Astra 99.9% vs 默认 62.7% = 37pp 差距 · Tom 9-14 evaluation 增量 ④ HF 23▲ → 37▲ +14▲ 大幅跳升。 - v93 #228 AgentGrad
arXiv:2609.08572候选预备级实测命中承接延续稳态 · paper_card 1307 9-11 入库 ✓ 主分类 agent · HF Daily 9-14 早棒 93▲ #5 续立稳态。 - v93 #229 PARSER
arXiv:2609.06702候选预备级实测命中承接延续稳态 · paper_card 1312 9-11 入库 ✓ 主分类 agent · 子 Agent 并行读取全文档各 Chunk + Lead Agent 迭代 Scatter-Gather。 - v93 #230 SchemeArena
arXiv:2609.08126立标 ☆ P2 候选预备级实测命中承接延续稳态 · paper_card 1297/1310 9-11 入库 ✓ 主分类 agent · 400 场景因子化 Agent 阴谋行为压力测试。 - v93 #233 Co-Evolving Harnesses
arXiv:2609.09134候选预备级实测命中承接延续稳态 · paper_card 1299 9-11 入库 ✓ 主分类 evaluation · on-policy correction。 - v93 #234 SAEScientist-Bench
arXiv:2609.09113候选预备级实测命中承接延续稳态 · paper_card 1298 9-11 入库 ✓ 主分类 llm-application 副分类 agent · 10 类任务 56 基础任务。 - v93 #235 Discovery Cert Protocol
arXiv:2609.09219候选预备级实测命中承接延续稳态 · paper_card 1300 9-11 入库 ✓ 主分类 evaluation · 三档决策对 AI 研究 Agent 输出的可信度边界。 - v93 #236 Meta-RAG
arXiv:2508.02611候选预备级实测命中承接延续稳态 · jay 9-11 engineering e1prep §增量 ③ + ICSE 2026 AGENT Workshop · Read-list/Write-list/New-list 三分类组件 + 大型既有代码库 bug 定位 token 削减 79.8%。 - v93 #237 End of Software Engineering
arXiv:2606.05608候选预备级实测命中承接延续稳态 · LangChain 2026-04 首次提出 Agent 化 Engineering 形式化定义 + Multi-agent coordination model + digital team members + unified observability layer + 7 任务验证。 - v93 #244 Albireo
arXiv:2606.01927候选预备级实测命中承接延续稳态 · 非可扩展开销 100× 削减 + 1.7× vLLM 提速 + bentoML 部署脚本 + 4×H100 80GB Qwen-2.5-32B batch_size=128。 - v93 #245 Helium
arXiv:2603.16104候选预备级实测命中承接延续稳态 · Agentic workflow-as-query-plan + 1.56× 吞吐 + cs.DB 交叉背景。 - v93 #234 MaP-WAM
arXiv:2609.11561v93 候选预备级实测命中承接延续稳态 · HF Daily 9-13 26▲ → 9-14 36▲ = 24h+10▲ 续立稳态 + paper_card 1322 ✓ + RMBench 83.3% SOTA + 真实机器人 78.0% success + flyp 9-13 1550 critical-read 撞事实 3 件 ★★★★ + 撞主题 2 件 ★★ + 复现总成本 极高 77-DoF Franka + RealSense 30 万人民币。 - v93 #236 Memory Compression
arXiv:2609.11294v93 候选预备级实测命中承接延续稳态 · paper_card 1315 ✓ 主分类 agent 形态 method · 高并发 Agent 沙盒内存压缩 + 「如何压缩 / 压缩什么 / 何时压缩」三维对齐方案 + sandbox memory 完整代码预备。 - v93 #247 EBL-Core
arXiv:2609.11596v93 候选预备级实测命中承接延续稳态 · paper_card 1314 ✓ 主分类 agent 形态 application · 高风险 AI 行动执行权限语义契约 + 运行时治理新一维预备锚入实测。 - v93 #237 Generative Late-Interaction Embeddings
arXiv:2609.11808v93 候选预备级实测命中承接延续稳态 · paper_card 1318 ✓ 主分类 rag 形态 method · late-interaction 视觉文档检索压缩新范式。 - v93 #250 SpatialBlock
arXiv:2609.07064v93 候选预备级实测命中承接延续稳态 · HF Daily 9-13 91▲ → 9-14 130▲ = 24h +39▲ ⚠️ 创 v33 以来立标续立稳态最大单日涨幅 + paper_card 1320 ✓ 主分类 multimodal + 通过合成积木堆叠问题增强 LVLM 的空间智能。 - v93 #246 EvoSafeHarness
arXiv:2609.05903v93 候选预备级实测命中承接延续稳态 · paper_card 1321 ✓ 主分类 evaluation · 进化式安全 Harness + HF Daily 9-13 早棒 47▲ #7 → 9-14 早棒 59▲ #6 = 24h +12▲ + Tom 9-14 evaluation 增量 ③ +12▲ 单日大幅跳升 立标信号最强。 - v93 #248 SyncWorld
arXiv:2609.09155v93 候选预备级实测命中承接延续稳态 · paper_card 1326 ✓ 主分类 multimodal · HF Daily 9-12 早棒 12▲ #15。 - v93 #249 Mi-Ripple
arXiv:2609.11317v93 候选预备级实测命中承接延续稳态 · HF Daily 9-13 早棒 37▲ #9 → 9-14 早棒 49▲ #8 = 24h +12▲ 续立稳态 + paper_card 待建 P2 ⚠。 - v93 #250 NCP-ArchPreview
arXiv:2609.10715v93 候选预备级实测命中承接延续稳态 · HF Daily 9-13 早棒 231▲ #2 → 9-14 早棒 293▲ #2 = 24h +62▲ 续立稳态 + paper_card 待建 P2 ⚠。 - v93 #252 T1 Terminal Agent RL
arXiv:2609.11042v93 候选预备级实测命中承接延续稳态 · HF Daily 9-13 早棒 53▲ #5 → 9-14 早棒 56▲ #7 续立稳态 + paper_card 待建 P2 ⚠。 - v93 #253 An Open Recipe for IMO Gold
arXiv:2609.10712v93 候选预备级实测命中承接延续稳态 · paper_card 1319 ✓ 主分类 engineering + HF Daily 9-13 早棒 22▲ #12 → 9-14 早棒 37▲ #11 续立稳态。 - v93 #X DeepMind 100 Gemini Swarm
arXiv:2609.04170v93 候选预备级实测命中承接延续稳态 · Paglieri 等 9-3 上线 + frontier lab 多 Agent 自发形成社会学结构立标预备第 1 例。 -
v93 #X OpenAI 1 万 AI agents 协同 88 小时 Navier-Stokes v93 候选预备级实测命中承接延续稳态 · @sama 9-9 转推 = "OpenAI 历史最 Amazing 时刻之一" + frontier lab 多 Agent 协同推理规模立标预备第 1 例。
-
work-queue.md(2026-09-14 20:00):待建卡 0 件 · Top 15 高价值待深度解读 0 件 · 待更新/缺失的主题活文档 0 件 · 选题榜未成视频脚本 2 件(
2609.10226Φ-Bench +2609.11682COBRA-Skills)+ 待写攻略 Top 15 / 共 1 件(Tom 认领 bishop555/Solana-Drainer-Tool · 周增 +28 / Stars 55)+ spark 认领段 = 空 · 富化缺口 15 张卡缺 TLDR · 待精确分类 3 张卡(cron_classify_llm 低峰消化)= v93 evening 棒位承接延用稳态。 - stephen 9-14 1245-stephen-coordination-check-noon.md:12:45 CST 协调棒 · 七大分类全部饱和 + ai-industry 主轴恢复 + 12 件 Substack 七字段 + Substack #1 Agent Memory Is Not RAG 新增锚入 + 36 个高频 arXiv 跨实例承接 + Spark 早棒缺位警示 9-10/9-11/9-12/9-13/9-14 五棒位 + 5 实例跨日去重对账沿用稳态 + 🔥 P0 数字错误修复追踪(P0-001 NVIDIA × HF $129.3B → $12.93B 已修复 100% · P0-002 Think Before You Link 数字方向反转已修复 60% · P0-003 Bloomberg 措辞过度强化部分修复 · P0-004 Tom 9-13 2040 radar "准确率下降 15-40%" 重新写错观察期 24h+)+ 19 件冲突/待核待 Anan 决策 + 同步任务核实 + 主题页更新建议 7 件 = v93 §3.3 Q105.X frontier lab 工程现实信号溯源核实预备级延展预备触发预备级预备锚入延用。
- stephen 9-14 ai-industry e1prep 10:25:32KB ai-industry 早棒主轴恢复终结 9-13 缺位 + 增量 1 frontier lab 治理公开化九源对照立标预备级第 1 例 + 7 件 net-new + 21 件 arXiv 邻接级候选去重 + M1/M2 二向对照警告 + 9-13 v67 + 9-12 e1prep 增量 1~7 沿用 + 24h 窗口 0 件 ai-industry 主轴 net-new + 1 件次轴候选新立 = v93 §0(i) frontier lab 九联预备扩增预备锚入稳定预备锚入稳定(8 源 → 9 源升级)。
- HF Daily 9-14 早棒 15 件:WMRL
arXiv:2608.12564447▲ #1 立标极显著首次 + 24h+ + 48h+ 续立稳态首例 ⚠️ 创 v33 以来第 1 例 ⚠️(444▲ → 447▲ = 24h +3▲)+ NCP-ArchPreviewarXiv:2609.10715293▲ #2 + SenseNova-U1.5arXiv:2609.11929236▲ #3 = 24h +53▲ + SpatialBlockarXiv:2609.07064130▲ #4 = 24h +39▲ 创 v33 以来立标续立稳态最大单日涨幅 ⚠️ + AgentGradarXiv:2609.0857293▲ #5 + EvoSafeHarnessarXiv:2609.0590359▲ #6 + T1arXiv:2609.1104256▲ #7 + Mi-RipplearXiv:2609.1131749▲ #8 + X-AuTarXiv:2609.1141242▲ #9 + WearableQAarXiv:2609.0540538▲ #10 + IMO GoldarXiv:2609.1071237▲ #11 + MaP-WAMarXiv:2609.1156136▲ #12 + FreeFlowarXiv:2609.1148634▲ #13 + MetroLLM-BencharXiv:2609.1001632▲ #14 + HyQuantarXiv:2608.2787531▲ #15 = v93 立标信号 24h 票数续立密度 vs v92 = +1.04× 棒位立标信号密度稳定沿用稳态。 - Tom 9-14 2040 radar evening 棒位 net-new 8 件候选:Benchmark Radar(
arXiv:2609.11115· 高价值 #1 · 47 票续立 · paper_card 1338 ✓ 9-14 20:00 入库 主分类 evaluation 副分类 database · work-queue 9-14 Top 15 #1)+ Agent Memory Is Not RAG Substack(Claudio Stamile 2026-01-12 · 高价值 #2 · 第 3 次引用 9-13 0841 + 9-13 2040 + 9-14 2040)+ DSR(arXiv:2609.05824· 高价值 #3 · 1 票 2026-09-04 · DPP 多样性感知技能路由)+ Online Learning with LLM Experts(arXiv:2609.05820· 高价值 #4 · 3 票 2026-09-04 · K臂老虎机)+ 4 中价值 = SAS(arXiv:2609.13141· 25 票 · paper_card 1336 ✓ 9-14 入库 主分类 engineering)+ COBRA-Skills(arXiv:2609.11682· 17 票 · paper_card 1339 ✓ 9-14 入库 主分类 agent 副分类 evaluation · work-queue 9-14 选题榜未成视频脚本 #2)+ Feyospace-v1(HF Daily 73 票 · frontier 网络模型训练数据引擎)+ DataFlex-RL(HF Daily 18 票 · RLVR 数据策略评测平台)+ Qwen-Agent Substack(多 Agent 框架 + RAG + Code Interpreter)+ arXiv provider 批量 429/Timeout 持续故障 = v93 evening 棒位 4 件高价值候选预备级实测命中承接延用补强 + 4 件 paper_card 已入库 ✓ 沿用预备级 + 1 件 Substack 第 3 次引用沿用稳态。 - Tom 9-14 1440 radar afternoon 棒位 net-new 8 件候选:Benchmark Radar(
arXiv:2609.11115· 高价值 #1 · 35 票 → 9-14 2040 47 票 = 24h +12▲)+ SAS(arXiv:2609.13141· 高价值 #2 · 25 票 · paper_card 1336 ✓)+ COBRA-Skills(arXiv:2609.11682· 高价值 #3 · 17 票 · paper_card 1339 ✓ · work-queue 9-14 选题榜未成视频脚本 #2)+ Think Before You Link(arXiv:2609.10745· 高价值 #4 · 第 2 次引用 22 票续立)+ 4 中价值 = Breaking the Vision-Action Shortcut(LIT multimodal 35 票)+ Studying Image Tokenizers as Visual Languages(benchmark multimodal 28 票)+ PLC-DPO(arXiv:2608.30597· 21 票 · paper_card 1340 ✓ 9-14 入库 主分类 engineering)+ SNAP3D(arXiv:2609.13146· research 1 票 · paper_card 1337 ✓ 9-14 入库 主分类 multimodal)+ arXiv provider 超时 = v93 evening 棒位 4 件高价值候选预备级实测命中承接延用补强 + 4 件 paper_card 已入库 ✓ 沿用预备级。 - Tom 9-14 0841 radar morning 棒位 net-new 8 件候选:MaP-WAM(
arXiv:2609.11561· HF 36 票 · 高价值 #1)+ IdeaAMBIG(arXiv:2609.10539· HF 23 票 · 高价值 #2)+ δ-mem Substack(AlphaSignal 2026-05-15 · 高价值 #3 · 第 2 次引用)+ 5 中价值 = Concept(s)+ Context(s)+ 文章 + ... + arXiv provider 故障 = v93 evening 棒位 3 件高价值候选预备级实测命中承接延用补强 + 1 件 Substack 第 2 次引用沿用稳态。 - Spark 9-14 18:43 llm-infra-e1prep 第 25 轮 E1:v93 cutoff 18:00 → 18:43 CST = 43min 净窗口期 + 9-13 18:43 → 9-14 18:43 = 24h 滑动窗口对照 + 13h 40min 净窗口期延长稳态(v93 cutoff 05:00 → 18:43)+ 0 件 NET-new paper_card 主分类 llm-infra 入库(v93 实测 1334 → 1344 = +10 张净增 v33 以来最大单日净增 但 0 张主分类 llm-infra)+ 7 件 NET-new 预备候选首次锚入预备级预备级 = ① HyQuant
arXiv:2608.27875LLM attention 混合精度量化新立标 31▲ HF Daily 9-14 #14 · paper_card 暂未入库 ⚠️ + ② vLLM vs Triton vs NIM 2026 K8s 实测基准(lucaberton.com 9-14 · TTFT P99 NIM 380ms vs vLLM 450ms)+ ③ ACM FSE 2026 LLM 推理引擎 Bug 系统研究arXiv:2508.04925+ ④ SGLang vs vLLM 2026-09 最新数字精修(DeepSeek V3 SGLang 3.1× faster)+ ⑤ InferLog(ACM 2026-09-11)+ ⑥ vLLM V1 架构重构官方博客系列(2026-09)+ ⑦ Andrej Karpathy nanochat(GitHub 57.5k+ stars)= v93 §1.4 量化子轴 + §1.1 推理引擎 + §1.11 Kernel/Harness + §1.3 KV Cache 子轴 NET-new 锚入预备级预备触发持续 + HyQuant 填补"Attention-specific 混合精度"理论维度空白 + spark 9-14 evening 棒位补位完整 9-10/9-11/9-12/9-13/9-14 五棒位沿用预备级 + frontier lab 多 Agent swarm 自治预备扩增预备级沿用稳态。 - Jay 9-14 12:21 engineering e1prep:7 件主增量 = ① MarkTechPost Agent Context Engineering 四机制 ★(上下文预算与压缩 Chroma Context Rot 18 LLM + Manus 50 tool calls 100:1 I/O ratio + Todo-State 机制 LangChain Deep Agents / Claude Code / Manus / OpenAI Codex / AWS Bedrock AgentCore + 跨会话记忆 aws-samples)+ ② Dario Amodei《We Must Pace the Frontier》行业连锁反应 + Sam Altman 同意放慢 + Anthropic 第三方访问承诺 + Gary Marcus Substack 三分赞同两分怀疑 + Elon Musk 认同 + Thariq 转发支持 = 6+ 源独立交叉锚入预备级 + ③ Alibaba Open Code Review heretic-llm v1.11.9 工业化 AI 代码评审立标 ☆→★ 候选升档预备实测命中承接延用稳态(22,389 ⭐ GitHub + OpenSSF Gold badge + 100 万次真实 review 任务)+ ④ CSDN RAG 五层解析 = v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例 + v92 §1.1 Harness Co-Evolution 新主线 anchor。
- flyp 9-14 16:30 risk-e1prep 棒位:3 件 risk 主题 net-new 增量 = ① Gary Marcus 9-12~13 Substack《Dario Amodei — Pace the Frontier 三分赞同两分怀疑》 = frontier lab 独立评论员对放慢节奏预备扩增预备级批判性对照预备触发预备级第 1 例 + METR 与 AI 公司关系 / Anthropic 对华立场 / 利用建议抢在真正监管前 三栖预备触发预备级(jay 9-14 1220 jay-context-engineering-harness-dario-substack)+ ②
arXiv:2607.08964LHTB = frontier lab 长时域终端 Agent 评测方法学延革预备扩增预备级第 1 例 + false-finish 失败模式预备触发预备级第 1 例(flyp 9-14 0950 critical-read ★★)+ ③ Lilian Weng 7-4《Harness Engineering for Self-Improvement》 = frontier lab 自我改进 / 自治能力预备扩增预备级第 1 例(溯源预备级)+ Harness Engineering 对自治能力边界预备触发预备级第 1 例(jay 9-14 1001 rss-lilian-weng)= R80 evening 棒位 9 件 net-new 预备扩增预备级(沿用 6 件 + 新增 3 件)+ 控制面 34 沿用稳态 + 新争议预备 #111-#120 沿用稳态 + 新开放问题预备 Q62-Q69 沿用稳态 + frontier lab 治理产品化 18 联 → 20 联预备扩增预备级 + 评测基线 11 层 → 12 层扩展预备触发预备级。
三、值得警惕的矛盾与待核实说法
-
HyQuant
arXiv:2608.27875paper_card 暂未入库 ⚠️ evening 棒位新立 P1 缺口预备级:HF Daily 9-14 早棒 31▲ #15 净新增立标信号已立,但 paper_card 暂未入库(v93 实测 1338 → 1344 = +10 张净增 但 0 张主分类 multimodal/llm-infra HyQuant 入库)+ evenning 棒位新立 P1 缺口(spark 9-14 18:43 llm-infra-e1prep 增量 ① 标记为 evening 棒位新立 P1 缺口预备级 + stephen 9-14 1245 coordination-check 列入冲突点 2 WMRL paper_card 暂缺 类似情况)+ 截止 9-15 P1 缺口补强。建议 v93 evening 棒位 §本次变更段核实:① stephen 9-14 evening 棒位前核实 paper_cards/ 目录是否含 1345-2608-27875.md;② 若未含,则修正 v93 changelog 中"HyQuant 立标信号 31▲ HF Daily 9-14 #15"为"HyQuant 立标信号已立 + paper_card 待建 P1 ⚠️";③ 沿沿用 v93 §1.6 #231 Show-HarnessarXiv:2609.10522paper_card 待建 P1 ⚠️ + WMRL paper_card 待建 9-13 入库 ✓ 已部分消除 + Terminal-Universe paper_card 仍未入库 ⚠️ + HyQuant paper_card 待建 P1 ⚠️ = 4 件 P1 paper_card 待建延续预备级。 -
v93 §1.6 #49 Compile by Training
arXiv:2609.04199信号衰减第 6 次确认预备级延续 vs 9-8 HF Daily #1 374▲ +57 立标极显著首次大幅跃升 vs 9-9 + 9-10 + 9-11 + 9-12 + 9-13 + 9-14 HF Daily Top15 连续 6 日无记录:tom 9-14 2040 radar 矛盾 ①(沿用 tom 9-14 1440 radar 矛盾 ①)+ spark 9-14 18:43 llm-infra-e1prep 矛盾 ⑥ 沿用 + stephen 9-14 llm-application 增量 7 = 信号衰减第 6 次确认预备级延续预备锚入稳定(9-9 + 9-10 + 9-11 + 9-12 + 9-13 + 9-14 连续 6 日 HF Daily Top15 无记录)。可能原因:① 跌出 Top15(但 374▲ 极高,理论上不至于连续六日跌出)、② HF Daily 采样机制波动(每日仅选 Top15 可能截断)、③ 该日算法重新采样、④ 真实衰减信号。**建议 v93 evening 棒位 §本次变更段"9-8 HF Daily #1 374▲ +57 立标极显著首次大幅跃升 vs 9-9 + 9-10 + 9-11 + 9-12 + 9-13 + 9-14 连续 6 日无 HF Daily 记录 = 信号衰减第 6 次确认预备级延续预备 + v93 预备级降级确认 + 9-14 evening 棒位核实是否真实衰减 vs HF Daily 采样机制波动 + 候选预备级 paper_card 1220 沿用稳态 + 截止 9-15 P1 缺口补强预备"沿用预备。 -
v93 §1.6 #176 Terminal-Universe
arXiv:2609.04148paper_card 仍未入库 ⚠️ vs HF Daily 9-10 + 9-11 + 9-12 + 9-13 + 9-14 五日未入 Top 15(9-8 早棒 29▲ #13 立标低续立 coding agent)+ paper_card 仍未入库 = v82+v83+v84+v85+v86+v87+v88+v89+v90+v91+v92+v93 anchor 缺位延续预备级预备锚入稳定:tom 9-14 2040 radar + tom 9-14 1440 radar + spark 9-14 18:43 llm-infra-e1prep + stephen 9-14 llm-application 增量 = v82-v93 anchor 缺位延续预备级预备锚入稳定。建议 v93 evening 棒位 §本次变更段"v93 候选预备级锚入预备级 + paper_card 入库实测补强 + Terminal-Universe paper_card 仍未入库"沿用预备级 + 截止 9-15 P1 缺口补强预备。 -
v93 §1.6 #231 Show-Harness
arXiv:2609.10522立标 ☆→★ 候选升档预备实测承接 vs HF Daily 9-11 早棒 126▲ #1 立标中-高首次 + paper_card 待建 P1 ⚠ vs flyp 9-11 0950 critical-read 评级 ★ 候选 ☆ 预备新增 vs 5 个反方锚 R1-R5 沿用稳态:v93 §1.6 #231 已 anchor 立标 ☆→★ 候选升档预备实测承接 + paper_card 待建 P1 ⚠ + 4 源独立交叉预备锚入预备级 + Jim Fan《Robotics:Endgame》讲稿完整上线 + "VLM 接口 + World-Action 上层"二向对照预备触发预备触发。矛盾标注(flyp 9-11 0950 R1)= "Show-Harness 126▲ #1 9-11 HF Daily 早棒 = 24h 单日票数 126 = 自 9-4 Bilevel Coordinated Reflection 130▲ + Dr. Claw 125▲ + RoboTok 116▲ + Discrete Diffusion 112▲ + 9-11 早棒 126▲ 之后 HF Daily 升档预备续立 · HF Daily 9-11 早棒单日票数 126 是否能在 9-11 evening 棒位保持稳定,需在 9-15 P1 缺口补强截止日前持续观察 · 若届时票数未达 250▲ 则需重评是否升级为 ★★ 立标极显著首次实测承接候选升档预备"。建议 v93 evening 棒位 §1.6 #231 Show-Harness 立标 ☆→★ 候选升档预备实测承接 + 9-15 P1 缺口补强截止日前持续观察票数稳定性 + 截止 9-15 P1 缺口补强预备。 -
arXiv provider 批量 429/Timeout 持续故障 9-14 三棒位连续:tom 9-14 0841 radar 报告 arXiv provider 批量超时/429 → tom 9-14 1440 radar 报告 arXiv provider 超时 → tom 9-14 2040 radar 报告 arXiv provider 批量 429/Timeout 持续故障 = 3 棒位连续故障 + HF Daily 补位。风险:可能存在未被捕获的当日新 arXiv,候选全部来自 HF Daily。建议:① 持续观察 arXiv provider 状态;② 增加 Semantic Scholar / OpenReview / Papers with Code 等备选源;③ 9-15 棒位确认是否恢复。
-
🔥 P0 数字错误修复追踪:stephen 9-14 1245 协调棒报告 = ① P0-001 NVIDIA × HF 收购金额 $129.3B → $12.93B 已修复 100%(stephen 9-14 0910 vip-radar 已修正 · v67 §2.18 + ai-industry 主棒 + 沿用棒位一致);② P0-002 Think Before You Link 数字方向反转已修复 60%(实际原文是 +6.9% 整体 / +23.3% 罕见实体增益,而非下降 15.4-39.9%);③ P0-003 Bloomberg 措辞过度强化部分修复;④ P0-004 Tom 9-13 2040 radar "准确率下降 15-40%" 重新写错观察期 24h+(9-14 0841 radar 未复述该数字)。建议 v93 evening 棒位 §本次变更段"+ 🔥 P0 数字错误修复追踪(P0-001 NVIDIA × HF $129.3B → $12.93B 已修复 100% · P0-002 Think Before You Link 数字方向反转已修复 60% · P0-003 Bloomberg 措辞过度强化部分修复 · P0-004 Tom 9-13 2040 radar "准确率下降 15-40%" 重新写错观察期 24h+)"沿用预备 + 截止 9-15 P0 修复完毕。
-
Spark 9-14 早棒产出偏低(3 件 RSS)+ 缺位 9-10/9-11/9-12/9-13/9-14 五棒位 → 9-14 18:43 evening 棒位补位完整 60KB:stephen 9-14 1245 协调棒警示 Spark 9-14 早棒产出偏低(3 件 RSS)+ 缺位 9-10/9-11/9-12/9-13/9-14 五棒位 + spark 9-14 18:43 llm-infra-e1prep 第 25 轮 E1 已 18:43 CST 落定(v93 cutoff 18:00 → 18:43 = 43min 净窗口期 + 13h 40min 净窗口期延长稳态)+ 7 件 NET-new 预备候选首次锚入预备级预备级(HyQuant + vLLM V1 + ACM FSE 2026 + InferLog + vLLM vs Triton vs NIM 2026 K8s + nanochat 57.5k+ + SGLang vs vLLM 2026-09 最新数字精修)= evening 棒位补位完整沿用稳态。建议:① spark 9-15 早棒恢复预备;② spark agent e1prep 9-14 evening 棒位预备已落定(spark 9-14 13:36 agent 主棒);③ 9-15 棒位 spark 早棒恢复预备 + 沿用 9-14 evening 棒位 60KB 主力补位。
-
Lilian Weng 7-4《Harness Engineering for Self-Improvement》原文方法论 5 项待核:flyp 9-14 risk-e1prep 增量 ③ 标记 + jay 9-14 1001 rss-lilian-weng 仅给出标题摘要(无方法论细节)+ flyp 9-14 risk-e1prep 矛盾 6 新增 5 项待核 = ① 自治能力边界定义(lilian weng 文章是否给出 formal definition / 是否给出 operational definition)+ ② harness 约束自治能力设计(是否提供具体方法 / 是否提供 open source 工具 / 是否提供 frontier lab 案例对照)+ ③ harness 对自治能力影响的评估方法(是否提供 evaluation framework / 是否提供 benchmark / 是否提供 case study)+ ④ 是否提供具体 open source harness 工具 + ⑤ 是否提供 frontier lab 案例对照(Anthropic / OpenAI / DeepMind 的 harness 工程实践对照)。截止 9-16 evening 棒位前(新增 Q69)。建议:9-15 evening 棒位前精读
https://lilianweng.github.io/posts/2026-07-04-harness/原文。 -
LHTB 5 项待核(flyp 9-14 risk-e1prep 增量 ② 沿用 spark 9-14 agent-e1prep §3.5 标注):① 任务集规模有限(46 任务对比 SWEBench 数千 instance,统计功效有限;任务集中在 Python/科学计算栈,Tencent HY LLM Frontier 主导,生态代表性偏窄)+② 评测成本极高(每任务 9.9M token × 15 模型 = 单轮评测就接近 $1.5k+ API 成本,对中小团队几乎不可独立复跑;撞事实 1 件 ★★(85.3 分钟/9.9M token/$10.5 per-run 成本数字符合 METR 报告的指数曲线))+③ 稠密奖励的评分可靠性(subtask 拆解与参考解耦合,论文未给出评分者信度指标 Kappa / 与人工评分一致性)+④ 生态偏差(任务是否对国产模型 Qwen3/Kimi/DeepSeek/GLM 有结构性友好?摘要未给拆分)+⑤ false-finish 诊断深度(摘要指出这一现象,但没有给出量化分解,对训练侧指导有限)。截止 9-16 evening 棒位前(新增 Q68)。
-
Dario Amodei 9-12《We Must Pace The Frontier》三步计划具体细节待溯源:v93 §4 #375 ⑨ Dario Amodei 9-12《We Must Pace The Frontier》三步计划具体细节(向第三方评估员开放 employee-level 系统访问的具体范围 / 时间表 / 预算)= v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例锚入 + Reuters 2026-09-12 + Atlantic 2026-09-12 + Marcus on AI 三源实证 + Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination 沿用 = 仍需溯源具体细节。建议:9-14 evening 棒位前溯源 Dario 长文原文具体细节(
https://darioamodei.com/post/we-must-pace-the-frontier)。 -
Gary Marcus 9-12~13 Substack《Dario Amodei — Pace the Frontier 三分赞同两分怀疑》原文 URL 待核:flyp 9-14 risk-e1prep 增量 ① + 矛盾 5 新增 Q67 = ① Gary Marcus Substack 原文 URL(garymarcus.substack.com 是否能定位具体文章 · 文章发表日期是 9-12 还是 9-13)+ ② METR 与 AI 公司关系细节 + ③ Anthropic 对华立场具体声明 + ④ 利用建议抢在真正监管前具体证据 + ⑤ Sam Altman 9-12 Fortune 9-12 原文与 Gary Marcus 三分赞同两分怀疑的具体对应关系。截止 9-16 evening 棒位前(新增 Q67)。
-
VikingRAG vs VikingMem 名称相近:Tom 9-14 R90 早棒 引入 VikingRAG
arXiv:2609.11390(token 高效 RAG)与 VikingMem(VLDB 2026,agent memory 系统)名称相近 ⚠️。风险:可能同一团队 / 不同团队 / 名称撞车。建议:Tom 后续棒位核实两论文作者团队是否重叠?paper_card 1295 ✓ 已入库主分类 rag 形态 method · 待核实 arXiv 元数据。
四、可引用的 arXiv 号列表
4.1 v93 evening 棒位 7 件增量 arXiv 号(含 Tom 9-14 T2040 radar 8 件候选 + spark 9-14 18:43 7 件 NET-new 候选)
| # | arXiv 号 | 标题 | 来源 | 主分类 | 适配性 |
|---|---|---|---|---|---|
| 1 | arXiv:2607.08964 |
Long-Horizon-Terminal-Bench(LHTB · frontier lab 长时域终端 Agent 评测方法学延革第 1 例) | v93 §1.1 + flyp 9-14 0950 critical-read + tom 9-14 evaluation 增量 ① | agent | 🟢 核心(立标 ★★ · 46 任务 / 9.9M token / false-finish 模式 · paper_card 359 ✓) |
| 2 | arXiv:2510.15253 |
Multimodal RAG for Document Understanding Survey(ACL 2026 Main · Sensen Gao et al. · 三维分类法) | v93 §1.6 + flyp 9-14 Multimodal RAG Document Survey | multimodal | 🟢 核心(综述立标预备第 1 例 · 三维分类法 Domain × Retrieval modality × Granularity · 项目主页 github.com/SensenGao) |
| 3 | arXiv:2604.06185 |
WildToolBench: Real User Behavior Patterns for Tool-Use Eval(ICLR 2026 · Wei Liu 等 · 57 LLM ≤15% accuracy) | v93 §1.5 + flyp 9-14 WildToolBench critical-read | agent | 🟢 核心(ICLR 2026 · 工具使用压力测试立标预备第 1 例 · 三关键挑战) |
| 4 | arXiv:2609.11294 |
Memory Compression for High-Fanout Agent Sandboxes(sandbox memory 专项) | v93 §1.3 + jay 9-14 1050 engineering filter · paper_card 1315 ✓ | agent | 🟢 核心(高并发 Agent 沙盒内存压缩 · 三维对齐方案 · paper_card 1315 ✓) |
| 5 | arXiv:2609.11596 |
EBL-Core(Execution Boundary Conformance Profile for High-Risk AI Actions · Policy Kernel 配对) | v93 §1.3 + jay 9-14 1050 engineering filter · paper_card 1314 ✓ | agent | 🟢 核心(运行时治理新一维 · 高风险 AI 操作语义契约 · paper_card 1314 ✓) |
| 6 | arXiv:2609.11115 |
Benchmark Radar: AI 评测基准活数据库(47 票续立 · 当前最完整的 agent 评测雷达 · paper_card 1338 ✓) | Tom 9-14 T2040 radar evening 高价值 #1 + work-queue 9-14 Top 15 #1 | evaluation | 🟢 核心(评测方法学 ★ 候选升档预备实测命中承接延用补强 · paper_card 1338 ✓) |
| 7 | arXiv:2609.13141 |
SAS: End-to端 优化的 Attention 稀疏化(25 票 · 与 RAG 直接相关 · paper_card 1336 ✓) | Tom 9-14 T1440 radar 高价值 #2 | engineering | 🟡 工程邻接(端到端优化 context ranking · paper_card 1336 ✓) |
| 8 | arXiv:2609.11682 |
COBRA-Skills: Agent Skill 优化的 Contextual Bandit 框架(17 票 · paper_card 1339 ✓ · work-queue 9-14 选题榜未成视频脚本 #2) | Tom 9-14 T1440 radar 高价值 #3 + Tom 9-14 T2040 沿用 | agent | 🟢 核心(budgeted sequential optimization · 解决 agent 技能复用代价高 · paper_card 1339 ✓) |
| 9 | arXiv:2609.05824 |
DSR: 多样性感知技能路由(DPP 平衡相关性与非冗余性 · 1 票 2026-09-04) | Tom 9-14 T2040 radar evening 高价值 #3 | agent | 🟢 核心(面向 agent 技能编排的具体算法 · DPP 数学推导) |
| 10 | arXiv:2609.05820 |
Online Learning with LLM Experts(有限反馈下专家路由 · 3 票 2026-09-04) | Tom 9-14 T2040 radar evening 高价值 #4 | agent | 🟡 工程邻接(K臂老虎机 · d 维 prompt 特征 · 严谨理论框架) |
| 11 | arXiv:2608.27875 |
HyQuant: LLM attention 混合精度量化(31▲ HF Daily 9-14 #15 · paper_card 待建 P1 ⚠️) | spark 9-14 18:43 llm-infra-e1prep 增量 ① + HF Daily 9-14 早棒 #15 | multimodal 邻接 llm-infra | 🟢 核心(Attention-specific 混合精度量化 · paper_card 待建 9-15 P1 缺口补强) |
| 12 | arXiv:2508.04925 |
ACM FSE 2026 LLM 推理引擎 Bug 系统研究(vLLM/SGLang 真实 bug 模式系统化梳理) | spark 9-14 18:43 llm-infra-e1prep 增量 ③ | llm-infra | 🟡 工程邻接(ACM FSE 2026 · vLLM/SGLang 真实 bug 模式系统化) |
| 13 | arXiv:2609.13146 |
SNAP3D: Physically Grounded 3D Parts(单图像 3D 装配 · paper_card 1337 ✓) | Tom 9-14 T1440 radar 中价值 #4 | multimodal | 🟡 工程邻接(物理引导框架 · 参数化连接器 · paper_card 1337 ✓) |
| 14 | arXiv:2608.30597 |
PLC-DPO: Posterior Label Correction in Noisy Preference Optimization(21 票 · paper_card 1340 ✓) | Tom 9-14 T1440 radar 中价值 #3 | engineering | 🟡 工程邻接(后验标签修正 DPO · 训练信号 clean/flip/tie 三种路由 · paper_card 1340 ✓) |
4.2 沿用 v93 锚入(llm-application 主分类或强相关 · 18 件)
arXiv:2608.12564— WMRL 立标 ☆→★★(v93 §1.2 #1.1 · paper_card 1335 ✓ · HF Daily 447▲ #1 立标极显著首次 + 24h+ + 48h+ 续立稳态首例 ⚠️ 创 v33 以来第 1 例 ⚠️)arXiv:2609.10715— NCP-ArchPreview(v93 §1.2 #X · HF Daily 293▲ #2)arXiv:2609.11929— SenseNova-U1.5(v93 §1.2 #X · HF Daily 236▲ #3 = 24h +53▲)arXiv:2609.07064— SpatialBlock(v93 §1.6 #250 · paper_card 1320 ✓ · HF Daily 130▲ #4 = 24h +39▲ 创 v33 以来立标续立稳态最大单日涨幅 ⚠️)arXiv:2609.08572— AgentGrad(v93 #228 · paper_card 1307 ✓ · HF Daily 93▲ #5)arXiv:2609.05903— EvoSafeHarness(v93 #246 · paper_card 1321 ✓ · HF Daily 59▲ #6 = 24h +12▲ 单日大幅跳升)arXiv:2609.11042— T1 Terminal Agent RL(v93 #252 · HF Daily 56▲ #7)arXiv:2609.11317— Mi-Ripple(v93 #249 · HF Daily 49▲ #8)arXiv:2609.11412— X-AuT(v93 #X · HF Daily 42▲ #9)arXiv:2609.05405— WearableQA(v93 §0(i) · paper_card 1303 ✓ · HF Daily 38▲ #10)arXiv:2609.10712— An Open Recipe for IMO Gold(v93 #253 · paper_card 1319 ✓ · HF Daily 37▲ #11)arXiv:2609.11561— MaP-WAM(v93 §0(e) · paper_card 1322 ✓ · HF Daily 36▲ #12 · 3 实例独立交叉预备锚入预备级)arXiv:2609.11486— FreeFlow(v93 #X · HF Daily 34▲ #13)arXiv:2609.10016— MetroLLM-Bench(v93 #X · HF Daily 32▲ #14 首次入 Top15)arXiv:2605.15040— Microsoft Orchard 立标 ☆(v93 §0(c) · 4 实例独立交叉预备锚入预备级)arXiv:2609.10745— Think Before You Link 立标 ☆→★(v93 §0(f) · paper_card 1329 ✓ · P0-002 修复 60% · 22 票续立稳态)arXiv:2609.11646— Retrieval Adequacy QPP 立标 ☆(v93 §0(j) · 3 实例独立交叉预备锚入预备级)arXiv:2609.11390— VikingRAG 立标 ☆(v93 §0(k) · paper_card 1295 ✓ · 5 实例独立交叉预备锚入预备级)
4.3 沿用 v92 锚入(llm-application 主分类或强相关 · 24 件)
arXiv:2512.13564— Memory in the Age of AI Agents: A Survey(v93 §0(d) · Agent Memory Is Not RAG 邻接)arXiv:2604.21413— Alternate Agentic AI Architecture(v93 §1.2 · 2 实例独立交叉预备锚入预备级)arXiv:2501.09136— Agentic RAG Survey(v93 §1.2 · 2 实例独立交叉预备锚入预备级)arXiv:2606.05608— End of Software Engineering(v93 #237)arXiv:2607.08028— Harness Engineering for Auditable Enterprise LLM Agents(v93 §2.211.39)arXiv:2609.04199— Compile by Training(v93 §1.6 #49 · 信号衰减第 6 次确认预备级延续预备)arXiv:2609.04148— Terminal-Universe(v93 §1.6 #176 · P1 anchor 缺位延续预备级)arXiv:2609.10522— Show-Harness 立标 ☆→★(v93 §1.6 #231 · paper_card 待建 P1 ⚠)arXiv:2609.03199— RoboTok 立标 ★☆→★(v93 §1.6 #44 · paper_card 1236 ✓)arXiv:2609.08183— NeoHorse-1 frontier lab 自我改进立标预备第 1 例(v93 §1.1 #203 · paper_card 1289 ✓)arXiv:2609.08149— SWE-Bench Pro Verified(v93 #227 · paper_card 1308 ✓ · HF Daily 37▲ #10 +14▲ 大幅跳升)arXiv:2609.10539— IdeaAMBIG(v93 §0(c) · paper_card 1331 ✓ · HF Daily 23▲ 首次出现)arXiv:2609.09155— SyncWorld(v93 #248 · paper_card 1326 ✓)arXiv:2609.10266— KVShareArena RAG/Multi-Agent KV cache 失效(v93 #226 · paper_card 1304 ✓)arXiv:2605.29640— OpenViking ByteDance VLDB 2026(v93 邻接级 · 三层抽象 Memory/Resources/Skills)arXiv:2607.20468— InferenceBench(v93 §1.4 沿用)arXiv:2609.04382— Split-LLM Privacy Failure(v93 §1.5 沿用)arXiv:2609.09134— Co-Evolving Harnesses(v93 #233 · paper_card 1299 ✓)arXiv:2609.09113— SAEScientist-Bench(v93 #234 · paper_card 1298 ✓ · 主分类 llm-application 副分类 agent)arXiv:2609.09219— Discovery Cert Protocol(v93 #235 · paper_card 1300 ✓)arXiv:2508.02611— Meta-RAG(v93 #236 · ICSE 2026 AGENT Workshop)arXiv:2609.09875— AgentAudit 10 维全链路评估框架(v93 #225 · paper_card 1296 ✓)arXiv:2609.06702— PARSER(v93 #229 · paper_card 1312 ✓)arXiv:2609.08126— SchemeArena 400 场景因子化 Agent 阴谋行为压力测试(v93 #230 · paper_card 1297/1310 ✓)arXiv:2609.11294— Memory Compression for High-Fanout Agent Sandboxes(v93 §1.3 · paper_card 1315 ✓)arXiv:2609.11596— EBL-Core 高风险 AI 行动执行权限语义契约(v93 §1.3 · paper_card 1314 ✓)arXiv:2609.11808— Generative Late-Interaction Embeddings(v93 #237 · paper_card 1318 ✓)arXiv:2609.04170— DeepMind 100 Gemini Swarm 自发作弊/转化/吹哨(v93 #X)arXiv:2608.15089— OpenAI 1 万 AI agents 协同 88 小时 Navier-Stokes(v93 #X · @sama 9-9 转推)arXiv:2609.05736— Beyond Prompts EMNLP 2026(hwchase17 "agent improvement is harness improvement")arXiv:2608.27456— HarnessDev 自演化 harness · EMNLP 2026(ARkYYang 团队)
4.4 沿用 v82-v91 锚入(llm-application 主分类或强相关 · 40+ 件)
arXiv:2304.07193arXiv:2310.11703arXiv:2311.08596arXiv:2401.16745arXiv:2403.07652arXiv:2406.02818arXiv:2409.10102— 沿用 v63 §7.0arXiv:2501.05444arXiv:2501.17399arXiv:2501.19139arXiv:2502.02276arXiv:2502.05167arXiv:2502.05171arXiv:2502.07115arXiv:2502.08826— 沿用 v63 §7.0arXiv:2503.06728arXiv:2503.09516arXiv:2503.12646arXiv:2503.22911arXiv:2503.29231arXiv:2504.09554arXiv:2504.11320arXiv:2504.12330arXiv:2504.14693arXiv:2504.19874— 沿用 v63 §7.0arXiv:2505.07833arXiv:2505.17086arXiv:2505.19481arXiv:2505.22571arXiv:2505.23723arXiv:2505.24238arXiv:2506.06252arXiv:2506.06266arXiv:2506.09498arXiv:2506.19544arXiv:2506.20869— 沿用 v63 §7.0
完整 arXiv ID 集合(752+92=844 件总览):详见 v93 §7.0 + §7.1 完整集合。
4.5 Substack 锚点(v93 + 沿用)
- v93 新增 Substack 锚点:
- Agent Memory Is Not RAG(Claudio Stamile 2026-01-12) — claudiostamile.substack.com/p/agent-memory-is-not-rag-a-practical — 7 实例独立交叉锚入预备级(tom 9-13 0841 radar ⭐⭐⭐ + tom 9-13 2040 radar evening 第 2 次引用 + tom 9-14 2040 radar evening 第 3 次引用 + tom 9-13 rag-e1prep 增 ① ⭐⭐⭐⭐ + flyp 9-13 multimodal-e1prep 增 5 + jay 9-13 T1505 evening briefing + jay 9-13 agent-memory-not-rag-substack)
- δ-mem(AlphaSignal 2026-05-15) — alphasignalai.substack.com/p/rag-and-long-context-arent-enough — 2 实例独立交叉锚入预备级(tom 9-13 0841 radar ⭐⭐ + tom 9-13 1440 radar ⭐⭐)
- Vectorless RAG AAAI 2026(Amazon Science 项目页)—
https://www.amazon.science/publications/keyword-search-is-all-you-need-achieving-rag-level-performance-without-vector-databases-using-agentic-tool-use— v93 §1.2 实证升档预备锚入预备级第 1 例 - Lilian Weng 7-4《Harness Engineering for Self-Improvement》 —
https://lilianweng.github.io/posts/2026-07-04-harness/— flyp 9-14 risk-e1prep 增量 ③ + jay 9-14 1001 rss-lilian-weng 沿用预备级第 1 例 - Dario Amodei《We Must Pace the Frontier》 — darioamodei.com/post/we-must-pace-the-frontier — v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例锚入 + Reuters 9-12 + Atlantic 9-12 + Marcus on AI 三源实证
- Gary Marcus 9-12~13 Substack《Dario Amodei — Pace the Frontier 三分赞同两分怀疑》 — garymarcus.substack.com/p/two-cheers-out-of-three-for-dario — flyp 9-14 risk-e1prep 增量 ① 锚入 + jay 9-14 1220 jay-context-engineering-harness-dario-substack 沿用
- 沿用 v72-v91 65+ 件 Substack 锚点:详见 v93 §7.5
4.6 CVE / DOI / URL(沿用 v93)
- CVE 24 件(v76 18 件 + v76 6 件备料锚入):详见 v93 §7.7
- DOI 4 件(v75 + v85 + v86 + v87 + v88 + v89 + v90 + v91 + v92 + v93):详见 v93 §7.7
- URL 165 件(v93 综述骨架稳定不增 URL):详见 v93 §7.6
- v93 evening 棒位新立 5 件关键引用 URL:
https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document(Multimodal RAG Survey 项目主页)https://arxiv.org/abs/2604.06185(WildToolBench arXiv)https://arxiv.org/abs/2510.15253(Multimodal RAG Survey arXiv)https://arxiv.org/abs/2607.08964(LHTB arXiv)https://zli12321.github.io/LHTB(LHTB 项目页)https://darioamodei.com/post/we-must-pace-the-frontier(Dario Pace The Frontier 长文)https://www.reuters.com/business/anthropic-ceo-urges-ai-companies-slow-model-development-2026-09-12(Reuters 9-12)https://www.theatlantic.com/technology/2026/09/dario-amodei-slow-down-ai-save-humanity/688610(Atlantic 9-12)https://garymarcus.substack.com/p/two-cheers-out-of-three-for-dario(Marcus on AI)https://lilianweng.github.io/posts/2026-07-04-harness/(Lilian Weng Harness Engineering)https://arxiv.org/abs/2609.11115(Benchmark Radar arXiv)https://arxiv.org/abs/2609.13141(SAS arXiv)https://arxiv.org/abs/2609.11682(COBRA-Skills arXiv)https://arxiv.org/abs/2609.05824(DSR arXiv)https://arxiv.org/abs/2609.05820(Online Learning with LLM Experts arXiv)https://arxiv.org/abs/2608.27875(HyQuant arXiv)https://arxiv.org/abs/2508.04925(ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv)https://open.substack.com/pub/claudiostamile/p/agent-memory-is-not-rag-a-practical(Agent Memory Is Not RAG Substack)https://www.amazon.science/publications/keyword-search-is-all-you-need-achieving-rag-level-performance-without-vector-databases-using-agentic-tool-use(Vectorless RAG AAAI 2026)https://lucaberton.com/blog/ai-model-serving-kubernetes-vllm-triton-nim-2026(vLLM vs Triton vs NIM 2026 K8s 决策框架)https://github.com/karpathy/nanochat(nanochat 57.5k+ stars)
4.7 paper_cards 近 3 天新卡(2026-09-12 ~ 2026-09-14 16:30 入库 · 1335-1344 张 + 9-14 04:00/02:00/08:00 批次 28 件 + 1055/1057/1062/1065/1140)
| 编号 | arXiv | 标题 | 主分类 | 适配性 |
|---|---|---|---|---|
| 1335 | 2609.12641 | Breaking Vision-Action Shortcut(Latent Interface Training) | engineering | v93 邻接 multimodal 沿用稳态 |
| 1336 | 2609.13141 | SAS: Simple Attention Sparsification | engineering | Tom 9-14 T1440 radar 高价值 #2 · paper_card 1336 ✓ 主分类 engineering |
| 1337 | 2609.13146 | SNAP3D: Physically Grounded 3D Parts | multimodal | Tom 9-14 T1440 radar 中价值 #4 · paper_card 1337 ✓ 主分类 multimodal |
| 1338 | 2609.11115 | Benchmark Radar: AI 评测基准活数据库 | evaluation 副分类 database | Tom 9-14 T2040 radar 高价值 #1 · paper_card 1338 ✓ · work-queue 9-14 Top 15 #1 |
| 1339 | 2609.11682 | COBRA-Skills: Contextual Bandit Skill Optimization | agent 副分类 evaluation | Tom 9-14 T1440 radar 高价值 #3 · paper_card 1339 ✓ 主分类 agent · work-queue 9-14 选题榜未成视频脚本 #2 |
| 1340 | 2608.30597 | PLC-DPO: Posterior Label Correction in Noisy Preference Optimization | engineering | Tom 9-14 T1440 radar 中价值 #3 · paper_card 1340 ✓ 主分类 engineering |
| 1314 | 2609.11596 | EBL-Core(5 类高风险 AI 操作语义契约) | agent | v93 §1.3 已 anchor · paper_card 1314 ✓ |
| 1315 | 2609.11294 | Memory Compression for High-Fanout Agent Sandboxes | agent | v93 §1.3 已 anchor · paper_card 1315 ✓ |
| 1329 | 2609.10745 | Think Before You Link | rag | v93 §1.2 已 anchor · paper_card 1329 ✓ |
| 1322 | 2609.11561 | MaP-WAM(Memory-as-Plans) | agent | v93 §0(e) · paper_card 1322 ✓ |
| 1335 | 2608.12564 | WMRL | rag 邻接 multimodal | v93 §1.2 #1.1 · paper_card 1335 ✓ WMRL |
| 1295 | 2609.11390 | VikingRAG | rag | v93 §0(k) · paper_card 1295 ✓ |
| 1331 | 2609.10539 | IdeaAMBIG | evaluation | Tom 9-14 0841 radar · paper_card 1331 ✓ |
HyQuant arXiv:2608.27875 paper_card 待建 P1 ⚠️(9-15 截止补强)
五、回复摘要
- status:✅ E1 预消化简报已完成,已写入
/shared/research-kb/inbox/stephen/2026-09-14-llm-application-e1prep.md - 增量条数:7 条核心增量(v93 §1.1 LHTB 新立标 ★★ + v93 §1.2 Vectorless RAG AAAI 2026 实证升档 + v93 §1.3 Memory Compression sandbox memory + EBL-Core Policy Kernel 配对 + v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例 + v93 §1.5 WildToolBench + v93 §1.6 Multimodal RAG Survey + v93 §0(k) 立标信号 9-14 早棒 15 件承接 + SenseNova-U1.5 +53▲ + SpatialBlock +39▲ + Compile by Training v93 第 6 次确认预备级延续预备 + v93 evening 棒位净窗口期承接候选 = Tom 9-14 T2040 radar evening 4 件高价值沿用 + Tom 9-14 T1440 radar 4 件高价值沿用 + spark 9-14 18:43 llm-infra-e1prep 7 件 NET-new 预备候选首次锚入预备级预备级) + 12 条矛盾/待核实(含 🔥 P0 数字错误修复追踪 P0-001 已修复 100% · P0-002 Think Before You Link 数字方向反转已修复 60% · P0-003 Bloomberg 措辞过度强化部分修复 · P0-004 Tom 9-13 2040 radar "准确率下降 15-40%" 重新写错观察期 24h+ + HyQuant paper_card 待建 P1 ⚠️ evening 棒位新立 P1 缺口 + LHTB 5 项待核 + Lilian Weng 原文 5 项待核 + Gary Marcus Substack 原文 URL 待核 + Dario 三步计划细节待溯源 + Compile by Training 信号衰减第 6 次确认预备级延续 + Terminal-Universe P1 anchor 缺位延续预备级 + VikingRAG vs VikingMem 名称相近待核)
- 涉及 arXiv 号:本棒 7 件增量共 14 件 arXiv 号(
arXiv:2607.08964+arXiv:2510.15253+arXiv:2604.06185+arXiv:2609.11294+arXiv:2609.11596+arXiv:2609.11115+arXiv:2609.13141+arXiv:2609.11682+arXiv:2609.05824+arXiv:2609.05820+arXiv:2608.27875+arXiv:2508.04925+arXiv:2609.13146+arXiv:2608.30597);沿用 v93 锚入 18 件 + v92 锚入 30+ 件 + v82-v91 沿用 40+ 件 + HF Daily 9-14 早棒立标信号 15 件 = 总计 100+ 件 arXiv 号引用 - 检查过的来源:jay 8 份 + tom 9 份(含 T1440 + T2040 radar + 0841 radar + 0900 HF Daily + 0852 R90 早棒 + 1542 evaluation)+ flyp 6 份(双 critical-read + multimodal-e1prep + risk-e1prep + multimodal-rag-document-survey + wildtoolbench)+ spark 2 份(agent-e1prep + llm-infra-e1prep)+ stephen 3 份(noon 协调棒 + ai-industry-e1prep + 0910 vip-radar)+ paper_cards 14 张 + work-queue 1 份 + knowledge/llm-application.md v93 + knowledge/risk.md R80 + knowledge/llm-infra.md v3.32 + knowledge/engineering.md v123 = 46+ 份来源
- 本棒特征:v93 evening 棒位 3h10min 净窗口期延长稳态预备级承接 + v93 cutoff 18:00 CST → 21:10 CST = 3h10min 二次承接备料 + v93 综述骨架稳定 + WMRL 升 48h+ 续立稳态首例 ⚠️ 创 v33 以来第 1 例 + LHTB ★★ 新立标 frontier lab 长时域终端 Agent 评测方法学延革第 1 例 + Vectorless RAG AAAI 2026 实证升档(94.5% faithfulness / Search-R1 +24%)+ Memory Compression sandbox memory 专项 + EBL-Core + Policy Kernel 配对 + WildToolBench ICLR 2026 + Multimodal RAG Survey ACL 2026 Main + frontier lab 治理公开化 9 源对照立标预备级第 1 例 + frontier lab 节奏放慢立场公开化预备扩增预备级第 1 例 + 治理结构主动调整预备扩增预备级第 1 例 + Dario Pace the Frontier 三步计划详细(Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination)Reuters + Atlantic + Marcus on AI 三源实证 + Gary Marcus 9-12~13 Substack 三分赞同两分怀疑 + Lilian Weng Harness Engineering + Tom 9-14 T2040 radar evening 4 件高价值沿用(Benchmark Radar 47 票续立 + Agent Memory Is Not RAG 第 3 次引用 + DSR 多样性感知技能路由 + Online Learning with LLM Experts)+ Tom 9-14 T1440 radar 4 件高价值沿用(Benchmark Radar 35 票 + SAS 25 票 + COBRA-Skills 17 票 + Think Before You Link 第 2 次引用)+ spark 9-14 18:43 llm-infra-e1prep 7 件 NET-new 预备候选首次锚入预备级预备级(HyQuant 31▲ + vLLM V1 架构重构 + ACM FSE 2026 + InferLog + vLLM vs Triton vs NIM 2026 K8s + nanochat 57.5k+ + SGLang vs vLLM 2026-09 最新数字精修)+ SenseNova-U1.5 183▲ → 236▲ +53▲ 24h + SpatialBlock 91▲ → 130▲ +39▲ 立标续立最大单日涨幅 ⚠️ + EvoSafeHarness 47▲ → 59▲ +12▲ + SWE-Bench Pro Verified 23▲ → 37▲ +14▲ + MetroLLM-Bench 32▲ 首次入 Top15 + IdeaAMBIG 23▲ 首次出现 HF 票数 + arXiv provider 429/Timeout 持续故障被识别 + 5 实例跨日去重对账沿用稳态 + 🔥 P0 数字错误修复追踪进度 + spark 9-14 18:43 evening 棒位补位完整 60KB + 4 件 P1 paper_card 待建延续预备级(Show-Harness + WMRL 已部分消除 + Terminal-Universe + HyQuant 新立 P1 ⚠️)+ Compile by Training 信号衰减第 6 次确认预备级延续预备 + 7 实例独立交叉锚入 Agent Memory Is Not RAG
- 新增建议归入节:§1.1 立基础延展(LHTB frontier lab 长时域终端 Agent 评测方法学延革第 1 例锚入)+ §1.2 RAG 范式(Vectorless RAG AAAI 2026 实证升档)+ §1.3 长期记忆(Memory Compression sandbox memory 专项)+ §1.3 运行时治理(EBL-Core + Policy Kernel 配对锚入"AI Action 执行治理")+ §1.4 frontier lab 治理公开化(9 源对照立标预备级第 1 例)+ §1.5 评测方法学(SchemeArena + WildToolBench 工具使用压力测试双栖)+ §1.6 多模态 RAG(Multimodal RAG Survey ACL 2026 Main 综述立标预备第 1 例)+ §1.2 立标信号(v93 9-14 早棒 15 件承接 + SenseNova-U1.5 +53▲ + SpatialBlock +39° + EvoSafeHarness +12° 锚入)+ §1.2 评测方法学(Tom 9-14 T2040 Benchmark Radar 47 票 + paper_card 1338 ✓ + work-queue 9-14 Top 15 #1 锚入)+ §1.3 Agent Memory Is Not RAG Substack(Tom 9-14 T2040 第 3 次引用锚入 = 7 实例独立交叉)+ §1.4 量化子轴(spark 9-14 18:43 HyQuant
arXiv:2608.2787531▲ 锚入 · paper_card 待建 P1 ⚠️ 9-15 截止)+ §1.6 Agent 技能编排(Tom 9-14 T2040 DSRarXiv:2609.05824+ Online LearningarXiv:2609.05820锚入)+ §本次变更段"v93 evening 棒位 7 条 net-new 承接延用稳态"沿用预备 + §3.1-§3.4 v93 #303 #304 #375 共识争议开放问题预备级承接 + §5.3 v93 58 主线沿用稳态 + §5.4 v93 evening 棒位 7 条 net-new 承接延用稳态 + 截止 9-15 P1/P2 缺口补强预备(Show-Harness + Terminal-Universe + WMRL 已部分消除 + HyQuant 新立 P1 ⚠️)
Stephen · 2026-09-14 21:10 CST · research-kb · llm-application · v93 evening 棒位 E1 预消化简报完成 · v93 cutoff 18:00 CST → 21:10 CST = 3h10min 二次承接备料 · 7 件增量 + 12 条矛盾/待核实 + 14 件 arXiv 号 net-new + 沿用 v93 18 件 + v92 30+ 件 + v82-v91 40+ 件 + HF Daily 9-14 早棒立标信号 15 件 = 100+ 件 arXiv 号引用 + 46+ 份来源核查 + 0 件立标新高 + 0 件 P0 警示新增 + 1 件 P1 信号衰减第 6 次确认预备级延续预备(Compile by Training)+ 1 件 P1 缺位延续预备级(Terminal-Universe paper_card 仍未入库 ⚠)+ 1 件 P1 paper_card 待建延续预备级(Show-Harness)+ WMRL paper_card 1335 9-13 入库 ✓ 已部分消除 P1 缺口 + 1 件 evening 棒位新立 P1 缺口(HyQuant paper_card 暂未入库 ⚠️)+ 🔥 P0 数字错误修复追踪进度(P0-001 已修复 100% · P0-002 已修复 60% · P0-003 部分修复 · P0-004 观察期 24h+)+ arXiv provider 429/Timeout 持续故障被识别(3 棒位连续)+ 7 实例独立交叉锚入 Agent Memory Is Not RAG(tom 9-14 T2040 第 3 次引用)+ spark 9-14 18:43 evening 棒位补位完整 60KB(13h 40min 净窗口期延长稳态)+ 12 件 P0/P1 缺口补强 + frontier lab 治理公开化 9 源对照立标预备级第 1 例(Dario Pace the Frontier 三步计划详细 Step 1 / Step 2 / Step 3 Reuters + Atlantic + Marcus on AI 三源实证)+ Gary Marcus 三分赞同两分怀疑 + Lilian Weng Harness Engineering 溯源预备级 + HyQuant 填补 v93 §1.4 量化子轴 Attention-specific 混合精度量化理论维度空白 + 评测方法学 45 → 48 元组预备扩位预备触发稳态