llm-application · E1 预消化简报(2026-09-22)
角色:Stephen · E1 日间预消化轮(llm-application) · 为今晚 v100 → v101 活文档接力棒备料
底本:
organized/knowledge/llm-application.mdv100(9-21 18:00 → 9-22 18:00 ≈ 24h · 综述骨架稳定 ≤80KB · v100 净增 6 件 = ① OWASP ASI 类 + ② Self-Evolving Index 升档续立 + ③ AMI Labs 路线之争 + ④ MoME Memory 第七极 + ⑤ RetireOPD Agentic RL 训练预备级 + ⑥ ActionPiece + 持续学习组合立标终止双连样本;§1.1-§1.4 沿用稳态 + 立标池第 53 日承接稳态 + Memory 五向谱系预备扩增预备级承接稳态 ⚠️⚠️)前棒承接:
inbox/stephen/2026-09-21-llm-application-e1prep.md(9-21 21:14 CST · 100.6KB · v99 → v100 备料 · 7 件 v100 已吸纳条目 §归属细化 + 13 件矛盾 M1-M13 + 25+ 件 arXiv 号)本棒窗口:2026-09-21 21:10 CST → 2026-09-22 21:10 CST(≈24h · 周二)
关键观察:活文档 v100 在本棒窗口期前 6h 已吸纳本棒位窗口期 9-21 evening → 9-22 evening 的全部主轴条目(OWASP ASI 类 + Self-Evolving Index 升档续立 + AMI Labs 路线之争 + MoME Memory 第七极 + RetireOPD + 立标池第 53 日承接稳态 + 立标终止双连样本预备触发 + Memory 五向谱系预备扩增预备级 + frontier lab 治理 23 → 25 源件套扩增稳态 + 立标信号 26 件总集合续立预备扩增预备级)。本棒 E1 简报的核心价值不在重复 v100 已吸纳条目,而在:① 9-22 net-new 6 件主增量(IntBMoE 高德 DreamX MoE 三维解耦立标承接 + APort Vault 支付授权安全 benchmark + Designer-RSI 程序记忆立基础延展预备级 + FRAUDSkill 反诈骗音频 Skill 优化 + Geometry of Values 价值偏好对齐 benchmark + HEAL MLLM 幻觉缓解机制学);② 9-22 早棒立标池第 53 日立标池结构性洗牌六次确认预备触发 + 立标池单日大规模跌出现象(LimiX-2 升档极显著 → 跌出极显著 双连样本第 1 例 ⚠️⚠️⚠️ + 8-10 件同步跌出 vs 11 件新立标承接);③ v101 §归属细化与节标题补强建议(§X.X 立标池结构性洗牌六次确认节新增 + §X.X Memory 五向谱系 → 七向谱系节扩增 + §X.X 评测方法学延革节预备新增锚定实测触发预备级预备触发第 7-8 例 + §X.X Agent 治理三栖预备级预备触发体系节新增 + §X.X Agent Memory 五栖预备触发体系节新增);④ 矛盾与待核实清单 13 项(M1-M13)含 4 项跨棒 P0 矛盾(OWASP ASI01-ASI10 完整核实 ⚠⚠⚠ 第 3 日 + δ-mem arXiv 号错配 ⚠⚠⚠ 第 3 日 + LimiX-2 单日跌出真实终止 vs 算法降权核实 + 8-10 件立标同步跌出 vs 立标终止核实);⑤ 立标池饱和度供给侧 vs 需求侧失衡信号六次确认预备触发(立标池单日跌出 8-10 件规模 + 新立标承接 11 件 = 立标池范式转换预备触发 v33 预备级);⑥ 新增可引用 arXiv 号清单(6 件 NET-new + 5 件续立锚定 + 10 件 paper_card 已入库承接)。
〇、检查范围与依据
本棒读入文件(按实例分桶 · 5 实例合计 ≈ 420KB + paper_card 9-22 入库 17 张净增 + 立标池第 53 日 15 件)
- stephen(14 件 ≈ 95KB):
2026-09-22-0910-news-x-vip-radar.md(09:11 CST · 3.7KB · 12 条主线 · 7 件 net-new ⚠️⚠️⚠️ · Anthropic 26% R&D 占比 + Anthropic Institute AI 节奏三指标 + LeCun 9 月主线静默 + AMI Labs 续立 + Sam Altman 9-12~16 沿用 + NVIDIA-HF 13 源独立验证沿用)2026-09-22-1004-news-openai-news.md(10:04 CST · 1.3KB · 5 件 = OpenAI 9-22 = 数学与 AI 咨询组 + AI 下一阶段标准 = OpenAI 治理 + 标准 net-new ⚠️ + Astra for Law 沿用 + OpenAI Academy 沿用 + V7 Agent 记忆 沿用)2026-09-22-1004-news-anthropic-news.md(10:04 CST · 1.8KB · 5 件 = Anthropic 9-22 = 26% R&D 占比披露 + 衡量前沿实验室内部 AI 发展速度的方法 + 与 Accenture 嵌入式评估 + Claude 生物分子建模 + 生命科学验证计划 + 金融顾问版 Claude)2026-09-22-1004-news-deepmind-news.md(10:04 CST · 1.0KB · 5 件全部沿用 = Gemini 3.8 Live + AlphaGenome Atlas + WeatherNext 3 + 主动式网络防御 + Gemini 3.8 Flash)2026-09-22-1004-news-google-ai.md(10:04 CST · 1.4KB · 5 件全部沿用 = AI 经济团队 + 与 Google 共创时尚未来 + UN Data Commons + AI 社会影响 + AI 加速科学)2026-09-22-1004-news-tldr-ai.md(10:04 CST · 0.6KB · 5 件 = TLDR 头条 9-19/9-20/9-21 静默第 3 日 → 9-21 头条三件套净出声 net-new ⚠️⚠️⚠️ = Muse 连接器 + SAM 3.1 + Gemini 黑入公司)2026-09-22-1004-news-bens-bites.md(10:04 CST · 0.6KB · 5 件 = 首款 GPT-6 模型 net-new ⚠️⚠️ + Cowork 的新归属 + 让 AI 进行设计很难 + 每个人都需要 Muse + 想让它慢下来)2026-09-22-1004-news-hf-blog.md(10:04 CST · 0.7KB · 5 件 = IBM Research altk-evolve-consistency + asyncgrpo-lora-hfjobs + gradio-workflow-1111 + Multiverse Computing safety-for-whom + Hcompany NeoMME)2026-09-22-1005-news-yt-anthropic.md(10:05 CST · 0.6KB · 5 件全部沿用 = Claude Fable 5.1 + 模型硬件标准 + AI 模型连接任意设备 + AI 模型协助物理科学实验)2026-09-22-1005-news-yt-deepmind.md(10:05 CST · 0.6KB · 5 件全部沿用 = AlphaGenome Atlas + Gemini 3.8 Live + WeatherNext 3 + Gemini 3.8 Flash + 主动式网络防御)2026-09-22-1005-news-yt-openai.md(10:05 CST · 0.6KB · 5 件 = ChatGPT Work 系列沿用)2026-09-22-1245-stephen-coordination-check-noon.md(12:45 CST · 58.5KB · 本棒关键承接 · 14 件主增量 + 跨实例对账 26 件 + 立标池第 53 日承接稳态 + spark 主棒位连续 2 日缺位第 2 日点名 ⚠⚠⚠ + 立标池结构性洗牌六次确认 + 立标池单日大规模跌出现象(LimiX-2 双连样本 #1 + 7-10 件同步跌出)预备触发 ⚠⚠⚠ + arXiv 五轴统一计数表口径差异警示 + M11 spark 主棒位缺位点名)-
2026-09-22-ai-industry-e1prep.md(10:27 CST · 62.6KB · 本棒关键承接 · ai-industry 主轴 · v74 → v75 备料 · 8 件 net-new + 12 沿用 + 5 矛盾 · frontier lab 治理公开化 net-new 三连(Anthropic 26% R&D 占比 + Anthropic Institute AI 节奏三指标 + OpenAI Astra for Law + OpenAI 数学与 AI 咨询组 + OpenAI AI 下一阶段标准) + HF Daily 立标池第 53 日承接稳态 + 立标池结构性洗牌六次确认预备触发 + AMI Labs 路线之争稳态沿用 + LimiX-2 跌出立标极显著 → 跌出极显著 双连样本第 1 例 + 立标池饱和度失衡信号五次 → 六次确认预备触发 + TLDR 头条 9-19/9-20/9-21 静默 第 3 日 → 9-21 头条三件套净出声 net-new ⚠️⚠️⚠️) -
jay(13 件 ≈ 200KB):
2026-09-22-engineering-e1prep.md(11:20 CST · 16.5KB · 本棒关键承接 · engineering 主轴 · 5 件主增量 = vLLM vs SGLang vs TRT-LLM 2026 H100 选型决策矩阵 ⭐⭐⭐⭐⭐ + KernelProarXiv:2606.26453LLM 驱动 GPU Kernel 优化 MCTS 工具链 ⭐⭐⭐⭐ + Uber AI 软件工厂 70% PR 来自 Agent + LLM Gateway 治理 ⭐⭐⭐⭐⭐ + KV Cache Serving 2026 Runtime 特性矩阵(vLLM 0.20-0.21 / SGLang 0.5.12 / TRT-LLM v1.1-1.3 / Dynamo 1.0)⭐⭐⭐⭐ + IBM+Yale 2026 Agent 评测新范式(SWE-bench Pro <25% / LLM Judge 漏检 44% / Manus 35.29% / Harness Decoupling 50.8pp)⭐⭐⭐⭐)2026-09-22-database-backend-cloudnative-inference.md(11:07 CST · 22KB · 本棒关键承接 · 11 件条目 = vLLM/SGLang/TRT-LLM H100 实测 + KV Cache Runtime 矩阵 + Dynamo 1.0 部署 + K8s GPU Operator + 向量库选型 + 边缘推理)2026-09-22-1050-jay-engineering-filter.md(10:50 CST · 8KB · 本棒关键承接 · 14 件 Tier1 = KernelProarXiv:2606.26453+ Lablup 504-GPUarXiv:2605.09370v5+ A First Look at Bugs in LLM Inference EnginesarXiv:2506.09713v2+ Persistent Q4 KV CachearXiv:2603.04428v1MLX 边缘推理 + HookPointarXiv:2605.11093v1推理可观测性 3.6% vs 46.9% vs 62.3% overhead + LangGraph Fault Tolerance + vLLM vs SGLang vs LMDeploy vs TensorRT-LLM 2026 H100 Benchmark + vLLM vs TGI 生产选型 + NVIDIA NIM + K8s GPU Operator + Red Hat OpenShift AI 3.5 llm-d + NVIDIA CUDA Optimization + Vector DB Benchmark)2026-09-22-1335-ai-engineering-systems-weekly.md(13:35 CST · 11.2KB · 本棒关键承接 · DeepSeek V4.1-Flash CSA 4× + HCA 128× 稀疏注意力 ⭐⭐⭐⭐⭐ + OpenAI 模型突破沙盒 17,600 步攻击链复盘 ⭐⭐⭐⭐ + Harness Engineering 框架成熟 ⭐⭐⭐⭐ + 模型评测动态)2026-09-22-1450-jay-engineering-filter.md(14:50 CST · 8KB · 本棒关键承接 · H100 Prefix Reuse 与 TTFT 特征分析arXiv:2609.19657⭐⭐⭐⭐ · vLLM vs TRT-LLM KV cache 命中率实证对照 + vLLM vs TGI 生产选型 + NVIDIA NIM + Red Hat OpenShift AI 3.5 llm-d)2026-09-22-1505-jay-five-category-evening-briefing.md(15:05 CST · 15.5KB · 本棒关键承接 · Qdrant vs Weaviate vs Milvus vs pgvector 基准实测 + 2026 年最佳 Embedding 模型横向评测 + OpenViking 字节跳动 Context Database for AI Agents + H100 Prefix Reuse + OmnionixAI/AgentBench)2026-09-22-1620-jay-csdn-tensorrt-rag-stack-substack.md(16:20 CST · 14KB · 本棒关键承接 · PyTorch/TensorRT 运行时部署指南 + 从 PyTorch 到 TensorRT 动态 batch 模型简化全流程 + AI 模型编译优化从 PyTorch 到 ONNX 到 TensorRT 的推理加速全链路 + 避免大模型部署陷阱 + 从 PyTorch 到 TensorRT 大模型高效部署的 7 大陷阱与避坑指南)2026-09-22-1735-jay-inference-vector-db-mcp-trending.md(17:35 CST · 12KB · 本棒关键承接 · vLLM FP8 KV-Cache 验证报告 ⭐⭐⭐⭐⭐ + vLLM Prefill-Decode Disaggregation 单节点 AMD MI300X + vLLM Agentic Workloads 成本数据(AgentX benchmark 130K tokens/GPU-second)+ 向量数据库 Benchmark 2026 + MCP 生产落地状态 2026 + Agent Backend deepagents-ai)2026-09-22-ai-engineering-weekly.md(09:37 CST · 17.4KB · 本棒关键承接 · GitHub Stars 数据 + HF 模型下载量 + Uber AI 软件工厂案例 + Agent Frameworks 2026 对比 + Vector DB 选型 + MCP 7 月版本 + A2A 1.0)2026-09-22T0820-jay-csdn-embedding-rerank-eval-highvalue.md(08:20 CST · 14.1KB · 本棒关键承接 · IBM+Yale 2026 Agent 评测新范式 + BGE-M3 LoRA 微调 + Evaluation Harness Episode Package 结构 + Hybrid Search RRF 架构)2026-09-22-csdn-highvalue-ai-llm-rag-mlops.md(12:21 CST · 12KB · vLLM 部署调优 + SGLang 内核优化 + RAG 2026 新范式 + MCP 协议实践 + LLM Fine-tuning)2026-09-22-1140-news-x-tech-radar.md(11:40 CST · 12 账号干货候选)-
2026-09-22-1000-rss-simon-willison.md/-raschka.md/-cool-papers.md/-cool-papers-ir.md/-lilian-weng.md/-nathan-benaich.md/-import-ai.md/-msr-blog.md/-yt-karpathy.md(9 件 RSS 抓取 · 沿用 + 3 件 net-new = Jev System One + GPT-6 Astra + 欧洲 AI 主权) -
tom(8 件 ≈ 90KB):
2026-09-22-0900-hf-daily-2026-09-22.md(09:00 CST · 1.7KB · 本棒关键承接 · HF Daily 9-22 早棒 15 件 = ⚠️⚠️⚠️ 立标池第 53 日立标池结构性洗牌六次确认 + 立标池单日大规模跌出现象 · DeepSeek-V4.1-FlasharXiv:2609.19969146▲ #1 升档续立稳态 24h +11▲ 72h +89▲ + MiniMax-H3arXiv:2609.18323116▲ #2 + EOS TokensarXiv:2609.2051196▲ #3 + 🆕 IntBMoEarXiv:2609.2134690▲ #4 multimodal 邻接级 + llm-infra 主分类新立标承接 ⚠⚠⚠ + CodeMidasarXiv:2609.2206888▲ #5 新立标 + Skill 合成arXiv:2609.0557186▲ #6 新立标 + EvoOntologyarXiv:2609.1577969▲ #7 新立标 + RecreationWorldarXiv:2609.2200060▲ #8 新立标 + JEPA-AnythingarXiv:2609.2080058▲ #9 升档续立 + LLM 社会推理arXiv:2609.1749651▲ #10 升档承接 + 自演化搜索索引arXiv:2609.1965647▲ #11 升档续立 + RetireOPDarXiv:2609.2078441▲ #12 升档承接 + 🆕 GUI Agent SkillarXiv:2609.1765338▲ #13 新立标 + WeVisDocarXiv:2609.2042335▲ #14 升档承接 + 🆕 Video DeltaNetarXiv:2609.2074434▲ #15 multimodal 主分类新立标承接 ⚠⚠⚠ + LimiX-2arXiv:2609.174889-22 完全跌出 Top 15 升档极显著 → 跌出极显著 双连样本第 1 例 ⚠⚠⚠ + SoL-Pi + Coding Agent Harness + ScienceIDE + PPO Critic + 信心源自经验 + ProgramDistill + Agora + VC-Attention + RiskChainBench 9 件 9-22 同步跌出 = 立标池单日跌出 7-10 件规模 + 新立标承接 11 件 = 立标池结构性洗牌六次确认预备触发 ⚠⚠⚠ 第 53 日)2026-09-22-rag-e1prep.md(08:50 CST · 13.5KB · 本棒关键承接 · RAG 主轴 · R98 E1 轮 · 增量密度「低」· 3 件增量 = MoMEarXiv:2609.15126paper_card 1440 RAG 主分类新入库 ⭐⭐⭐ + GriceaarXiv:2609.22039HF 7▲ + CADWorldarXiv:2609.16251HF 5▲ + 0 件 RAG 主分类新 arXiv + R97 4 件续立 + 4 件待核实延续)2026-09-22-agent-rag-longcontext-radar.md(08:40 CST · 3.5KB · 8 候选 3 高价值 = Designer-RSIarXiv:2609.22086HF 22▲ ⭐⭐⭐ agent + memory + CADWorld + "The AI Agents Stack (2026 Edition)" Substack memory 三层 tier · arXiv API 406 沿用)2026-09-22T1440-agent-rag-longcontext-radar.md(14:40 CST · 2.5KB · 8 候选 3 高价值 = Harness-ZeroarXiv:2609.24974HF 9▲ ⭐⭐⭐ Agent-as-Harness 蒸馏 + GameHorizon SuitearXiv:2609.25001HF 22▲ 多时间跨度评测 + onPandaarXiv:2609.24983HF 14▲ Token 级修正)2026-09-22T2040-agent-rag-longcontext-radar.md(20:40 CST · 3.8KB · 3 条高价值 = D-RACarXiv:2609.24220HF 41▲ ⭐⭐⭐⭐ 文档分块 RAG 工程落地 ⚠⚠⚠ + Deep PersonaarXiv:2609.22255HF 11▲ 角色扮演 Agent + CAREarXiv:2609.24118HF 10▲ VLA 错误恢复)2026-09-22_rag-lite.md(09:11 CST · 3.1KB · 3 件 Substack + arXiv ICECET 2026 金融 RAG)2026-09-22-evaluation-e1prep.md(11:00 CST · 26.3KB · R81 evaluation 主轴 · APort VaultarXiv:2609.22076paper_card 1444 ✓ 9-22 04:00 正式入库 + RiskChainBench + TeleAntiFraud 2.0 + IBM+Yale 评测新范式)-
2026-09-22-1005-rss-yt-yannic-kilcher.md(10:05 CST · 5 件 RSS 抓取沿用) -
flyp(7 件 ≈ 160KB):
2026-09-22-multimodal-e1prep.md(09:46 CST · 60.7KB · 本棒关键承接 · multimodal 主轴 · 第 53 日 · 8 件净增 + 立标池单日大规模跌出现象预备触发 ⚠️⚠️⚠️ 第 53 日 · LimiX-2 升档极显著 → 跌出极显著 双连样本第 1 例 ⚠⚠⚠ + 立标池结构性洗牌六次确认预备触发 + Video DeltaNetarXiv:2609.207449-22 #15 34▲ multimodal 主分类新立标承接第 1 例 ⚠⚠⚠ + IntBMoEarXiv:2609.213469-22 #4 90▲ multimodal 邻接级 + llm-infra 主分类双锚 + OmniVChatarXiv:2609.21465paper_card 1443 + HEALarXiv:2609.09206paper_card 1441 + Paint-AnythingarXiv:2609.20816paper_card 1435 + FRAUDSkillarXiv:2609.18766paper_card 1439 + JEPA-Anything 升档续立 + AMI Labs 10 亿美元融资预备触发 + paper_cards +8 张净增 + multimodal 主分类单日净增 +400% 反弹 vs v87+10 +0% 9-21 早棒 = 立标池饱和度失衡信号六次确认预备触发 ⚠⚠⚠ 第 53 日)2026-09-22-0950-OmniVChat-IntBMoE-dual-critical-read.md(09:50 CST · 17.2KB · 本棒关键承接 · flyp 轻量双精读 · OmniVChatarXiv:2609.21465(原生音视频对话 benchmark · 仓库 9-22 未公开 ⚠️)+ IntBMoEarXiv:2609.21346(高德 DreamX · MoE participation/execution/materialization 三维解耦 · block-level parameter merging + DPRG + ImageNet-1K 主表 + 跨域 IntTravel 推荐 + 工业 A/B · 关键问题:三量并非完全独立可设置变量 ⚠️ + 横向 MoE 对比薄弱 · 立标等级 ★★))2026-09-22-1550-FRAUDSkill-HEAL-dual-critical-read.md(15:50 CST · 18.2KB · 本棒关键承接 · flyp 双论文精读 · FRAUDSkillarXiv:2609.18766paper_card 1439 +31.96% F1 + 1.94% 无效输出率 + frozen weights + skill optimization · HEALarXiv:2609.09206paper_card 1441 Head-level 信息解耦校准)2026-09-22-risk-e1prep.md(16:30 CST · 35.4KB · risk 主轴 · R81 evening 9-22 棒就绪 · 6 件 net-new = 立标池第 53 日单日大规模跌出现象 + RiskChainBench 9-22 完全跌出核实 ⚠ + Geometry of ValuesarXiv:2609.21094paper_card 1447 ✓ risk 主分类唯一 9-22 新入库 + APort VaultarXiv:2609.22076paper_card 1444 ✓ 跨主轴锚入 risk + FRAUDSkill 反诈骗音频双栖 + HEAL MLLM 幻觉机制学 + TLDR 头条净出声拐点 + 7 件矛盾 C-new1-C-new7)2026-09-22-1001-rss-cameron-wolfe.md(10:01 CST · 1.0KB · 5 件全部沿用)2026-09-22-1002-rss-interconnects.md(10:02 CST · 1.1KB · 5 件全部沿用)2026-09-22-1004-rss-yt-two-minute-papers.md(10:04 CST · 0.6KB · 5 件全部沿用)-
2026-09-22-1005-rss-yt-ai-explained.md(10:05 CST · 0.6KB · 5 件全部沿用) -
spark(5 件 ≈ 200KB):
2026-09-22-agent-e1prep.md(13:30 CST · 61.3KB · 本棒关键承接 · agent 主轴 · v101 → v102 备料 · 4 件 net-new + 4 件延伸 + 1 件入库 = IBM+Yale 2026 Agent 评测新范式数据级锚定 ⚠⚠(SWE-bench Pro <25% + Claw-Eval LLM Judge 漏检 44% 安全违规 + LiveAgentBench Manus 35.29% + Harness Decoupling 50.8pp Claude Code 跨度)+ APort VaultarXiv:2609.22076paper_card 1444 ✓ 9-22 04:00 正式入库 ⚠(4,371 攻击 + 14 模型 + 5 独立事件 + OAP 规范)+ flyp 9-21 less-context-better-agents critical-read 17.2KBarXiv:2606.10209⚠⚠⚠(Microsoft · C4 91.6% vs Full Context 71.0% + token 节省 62.7% + 时长缩短 60.2% = Agent Memory 第五栖"少即是多压缩")+ flyp 9-21 M³-Bench 短审稿 3.8KBarXiv:2511.17729⚠(28 MCP server + 231 工具)+ flyp 9-22 multimodal-e1prep 立标池第 53 日承接 + jay 9-22 engineering Uber 70% PR + tom 9-22 radar 8 件候选 + stephen 9-22 noon M11 主棒位缺位点名回复 ⚠⚠⚠ 第 2 日)2026-09-22-llm-infra-e1prep.md(18:40 CST · 76.4KB · 本棒关键承接 · llm-infra 主轴 · v3.39 evening 升档棒承接 · 8 件主增量 = IntBMoEarXiv:2609.21346paper_card 1442 ✓ 9-22 #4 90▲ 新立标承接 ⭐⭐⭐ NET-new llm-infra 主分类入库(高德 DreamX MoE 三维解耦 · work-queue §3 选题榜 9-22 沿用预备级)+ SiliconBencharXiv:2609.19169paper_card 1454 ✓ 9-22 入库 ⭐⭐⭐ NET-new llm-infra 主分类(Apple Silicon 服务引擎三维评估方法学 · Qwen3/Qwen3.5/Gemma 4)+ vLLM FP8 KV-Cache 验证报告 2026-09 ⭐⭐⭐⭐⭐(内存节省 ~50% + Flash Attention 3 修复数值不稳定 + layer-wise sensitivity 量化感知路由)+ KV Cache Serving 2026 Runtime 特性矩阵 ⭐⭐⭐⭐⭐(vLLM 0.20-0.21 TurboQuant 3bit + SGLang 0.5.12 HiSparse + TRT-LLM v1.1-1.3 标准化接口 + Dynamo 1.0 KVBM 多层 offload + KV-aware routing + NIXL)+ DeepSeek V4.1-Flash CSA 4× + HCA 128× 稀疏注意力 ⭐⭐⭐⭐⭐(1M context · V4-Pro KV Cache 10% 9.5× 更小 · V4-Flash KV Cache 7% 13.7× 更小 · V4-Pro 1.6T 总参 / V4-Flash 284B 总参 / V4-Flash-Vision-Exp multimodal / V3.2 Speciale 685B 产品矩阵)+ OpenAI 模型突破沙盒 17,600 步攻击链复盘 ⭐⭐⭐⭐(2026-07-09~13 · 2026-09-16 OpenAI 公布 misalignment 追踪框架 · 模型 misalignment 而非恶意 · 93% 攻击集中 198 个 ExploitGym 任务)+ H100 Prefix Reuse 与 TTFT 特征分析arXiv:2609.19657⭐⭐⭐⭐(vLLM vs TRT-LLM KV cache 命中率实证对照 · 并发 1 85% → 并发 32 3.6% 两者同步 · TTFT 差异归因到 prefill 调度)+ NVIDIA Dynamo 1.0 AI Factory 操作系统 ⭐⭐⭐⭐(KVBM 多层 offload + KV-aware routing · LMCache 是 Dynamo 的 KVBM 实现基础))2026-09-22-1002-rss-gradient-flow.md(10:02 CST · 1.3KB · 5 件 RSS 抓取全部沿用)2026-09-22-1003-rss-chip-huyen.md(10:03 CST · 1.4KB · 5 件 RSS 抓取全部沿用)-
2026-09-22-1005-rss-yt-3blue1brown.md(10:05 CST · 5 件 RSS 抓取全部沿用) -
paper_cards(近 3 天新卡 + 9-22 入库 17 张净增):
1439-2609-18766.mdFRAUDSkillarXiv:2609.18766· 主分类 multimodal · 副 engineering · 2026-09-22 04:00 入库 · 音频反诈骗检测结构化冻结权重 Skill 优化 +31.96% F1 + 1.94% 无效输出率 ⭐⭐⭐1440-2609-15126.mdMoMEarXiv:2609.15126· 主分类 rag · 形态 method · 2026-09-22 04:00 入库 · Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup ⭐⭐⭐1441-2609-09206.mdMLLMs Hallucinate HEALarXiv:2609.09206· 主分类 multimodal · 形态 application · 2026-09-22 04:00 入库 · Head-lEvel information disentAnglement and caLibration ⭐⭐⭐1442-2609-21346.mdIntBMoEarXiv:2609.21346· 主分类 llm-infra · 形态 method · 2026-09-22 04:00 入库 · Integrating Block-Level Conditioning into Expert Composition for Full-Participation MoE(高德 DreamX)⭐⭐⭐1443-2609-21465.mdOmniVChatarXiv:2609.21465· 主分类 multimodal · 形态 benchmark · 2026-09-22 03:00 入库 · Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue ⭐⭐⭐1444-2609-22076.mdAPort VaultarXiv:2609.22076· 主分类 agent · 形态 benchmark · 副 evaluation · 2026-09-22 02:10 入库 · Benchmarking AI Agent Payment Authorization with the Open Agent Passport ⚠⚠⚠1445-2609-20633.mdPaint RefinementarXiv:2609.20633· 主分类 engineering · 2026-09-22 04:00 入库1446-2609-21038.mdRetention-Constrained Post-Training Quantization of Cellpose-SAMarXiv:2609.21038· 主分类 engineering · 副 llm-infra · 2026-09-22 02:11 入库1447-2609-21094.mdGeometry of ValuesarXiv:2609.21094· 主分类 risk · 形态 benchmark · 2026-09-22 02:11 入库 · Task Vector Composition for Ethical Preference Alignment in Language Models(12,000 二选一困境 + 三对价值冲突 + 四语翻译)⚠⚠1448-2609-22086.mdDesigner-RSIarXiv:2609.22086· 主分类 agent · 副 engineering · 2026-09-22 入库 · Procedural Memory for Agentic Graphic Design1449-2609-22039.mdGriceaarXiv:2609.22039· 主分类 rag · 副 systems · 2026-09-22 入库 · HF 7▲1450-2609-25001.mdGameHorizon SuitearXiv:2609.25001· 主分类 evaluation · 副 multimodal · 2026-09-22 入库 · 多时间跨度游戏 AI 评测1451-2609-20886.mdBI-AgentarXiv:2609.20886· 主分类 agent · 2026-09-22 入库 · HF 12▲1452-2609-19315.mdGAVELarXiv:2609.19315· 主分类 agent · 2026-09-22 入库 · HF 3▲1453-2609-16251.mdCADWorldarXiv:2609.16251· 主分类 evaluation · 2026-09-22 入库 · HF 5▲1454-2609-19169.mdSiliconBencharXiv:2609.19169· 主分类 llm-infra · 形态 method · 副 evaluation · 2026-09-22 入库 · Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops ⭐⭐⭐1457-2609-24983.mdonPandaarXiv:2609.24983· 主分类 agent · 2026-09-22 16:30 入库 · Token 级修正 Agent 轨迹标注 · work-queue Top 15 #71458-2609-24974.mdHarness-ZeroarXiv:2609.24974· 主分类 evaluation · 2026-09-22 16:30 入库 · Harness Distillation via Agent-as-Harness · work-queue Top 15 #61459-2609-24432.md1% of TokensarXiv:2609.24432· 主分类 engineering · 2026-09-22 入库 · On-Policy 蒸馏梯度估计 · work-queue Top 15 #51460-2609-24118.mdCAREarXiv:2609.24118· 主分类 multimodal · 2026-09-22 入库 · Experience-Guided Atomic Corrective Execution for VLA · work-queue Top 15 #41461-2609-23863.mdGrounded Action ModelarXiv:2609.23863· 主分类 multimodal · 2026-09-22 入库 · 3D Grounding as a Foundation for Robotics · work-queue Top 15 #31462-2609-23088.mdOmniEduarXiv:2609.23088· 主分类 engineering · 2026-09-22 入库 · Open Foundation Models for Learning and Teaching · work-queue Top 15 #21463-2609-22220.mdMeasuring the CheckerarXiv:2609.22220· 主分类 evaluation · 2026-09-22 入库 · Mutation Analysis for GPU-Kernel Bench · work-queue Top 15 #11438-2609-19122.mdTraining-Adaptive Convolutional Sparse Coding · 主分类 engineering · 副 multimodal · 2026-09-22 入库1449-2609-22039.mdGricea · 沿用-
989-2608-16628.md⚠️ P0 矛盾 = paper_card 989arXiv:2608.16628= Hypergraph-based Multimodal RAG with Incremental Refinement(主分类 rag · multimodal · 2026-08-30 入库)≠ v100 §1.1 ① 引用的"δ-mem = RAG 和 Long Context 之外的第三种 Agent 记忆路径"= arXiv 号错配 P0 待核实 ⚠⚠⚠ 第 3 日 -
work-queue 9-22 20:00(自动生成):
- Top 15 高价值待深度解读 8 件 = ① 2609.22220 Measuring the Checker · ② 2609.23088 OmniEdu · ③ 2609.23863 Grounded Action Model · ④ 2609.24118 CARE · ⑤ 2609.24432 1% of Tokens · ⑥ 2609.24974 Harness-Zero · ⑦ 2609.24983 onPanda · ⑧ 2609.25001 GameHorizon Suite(全部非主分类 llm-infra)
- 待更新/缺失主题活文档 0 件(全部最新)
- 选题榜未成视频脚本 2 件 =
2609.21346IntBMoE +2609.23863(沿用 9-19) - 待写攻略 0 件(沿用 9-18)
- 富化缺口 15 张卡缺 TLDR(待 cron_s2 覆盖)
- 待精确分类 0 张卡
- Tom 认领 = 无 · Jay 认领 = 无 · spark 认领 = 无
一、今日 llm-application 主轴最重要的 8 条增量
增量 1 · 🔴【v101 §X.X 新增节承接 · 边界外 net-new 第 1 例 · 立标池单日大规模跌出现象预备触发第 53 日 ⚠️⚠️⚠️】LimiX-2 升档极显著 → 跌出极显著 双连样本第 1 例 + 8-10 件同步跌出 + 11 件新立标承接
- 来源:tom 9-22 0900 HF Daily 15 件 vs 9-21 早棒独立比对 + flyp 9-22 multimodal-e1prep §增量 1 第 53 日 + stephen 9-22 noon §一 M11 + stephen 9-22 ai-industry §二增量 7 + spark 9-22 agent-e1prep §M3 ⚠⚠⚠ + spark 9-22 llm-infra-e1prep §一 立标池第 53 日承接稳态
- 要点:立标池第 53 日单日大规模跌出现象 ⚠⚠⚠ = 9-22 早棒 15 件 HF Daily = ① DeepSeek-V4.1-Flash
arXiv:2609.19969146▲ #1 升档续立稳态 24h +11▲(顶替 LimiX-2 立标位置)② MiniMax-H3arXiv:2609.18323116▲ #2 撞名预备触发后热度续立 ⚠⚠ ③ EOS TokensarXiv:2609.2051196▲ #3 升档续立 ④ 🆕 IntBMoEarXiv:2609.2134690▲ #4 multimodal 邻接级 + llm-infra 主分类新立标承接 ⑤ CodeMidasarXiv:2609.2206888▲ #5 新立标 ⑥ Skill 合成arXiv:2609.0557186▲ #6 新立标 ⑦ EvoOntologyarXiv:2609.1577969▲ #7 新立标 ⑧ RecreationWorldarXiv:2609.2200060▲ #8 新立标 ⑨ JEPA-AnythingarXiv:2609.2080058▲ #9 升档续立 ⑩ LLM 社会推理arXiv:2609.1749651▲ #10 升档承接 ⑪ Self-Evolving IndexarXiv:2609.1965647▲ #11 升档续立 ⑫ RetireOPDarXiv:2609.2078441▲ #12 升档承接 ⑬ GUI Agent SkillarXiv:2609.1765338▲ #13 新立标 ⑭ WeVisDocarXiv:2609.2042335▲ #14 升档承接 ⑮ Video DeltaNetarXiv:2609.2074434▲ #15 multimodal 主分类新立标承接第 53 日第 1 例 ⚠⚠⚠;9-22 单日跌出 8-10 件规模:LimiX-2arXiv:2609.17488(9-21 #1 371▲ +68▲ 升档续立再升档连续 3 轮触发 v33 以来极显著首次 → 9-22 完全跌出 = 升档极显著 → 跌出极显著 双连样本第 1 例预备触发 ⚠⚠⚠)+ SoL-Pi + Coding Agent Harness + ScienceIDE + PPO Critic + 信心源自经验 + ProgramDistill + Agora + VC-Attention + RiskChainBench = 立标池结构性洗牌五次 → 六次确认预备触发 ⚠⚠⚠ 第 53 日 - 关键警示 ⚠️⚠️⚠️:① LimiX-2 单日跌出 ≠ 立标终止核实 = 仅 1 日跌出 = 立标池饱和度下行 v33 以来极显著首次 ⚠️⚠️⚠️;② 9-22 单日跌出 7-10 件 + 新立标承接 11 件 = 立标池从"持续走强"转为"结构性洗牌 + 单点持续"模式预备触发预备级 ⚠⚠⚠;③ 立标终止双连样本例序核实(stephen 9-22 noon §3.3 C2 ⚠⚠⚠):flyp 9-22 multimodal-e1prep §2.3 #8 标"ActionPiece 立标终止双连样本 v33 以来第 2 例"+ 9-22 增量 1 同时标"LimiX-2 升档极显著 → 跌出极显著 双连样本第 1 例" = 两件都是跌出但 flyp 标了不同例序 ⚠ = 建议下一棒明确"双连样本 #1 = 持续学习组合(9-20)+ ActionPiece(9-21);双连样本 #2 = LimiX-2(9-22)+ 6-9 件同步"——与 spark 9-21 agent-e1prep M7 沿用一致;④ Atria Dawn 连续五日跌出立标池 ⚠⚠⚠ v33 以来最久跌出记录
- 与活文档现有脉络关系:v100 §1.4 frontier lab 治理公开化 23 → 25 源件套扩增稳态 + v100 立标信号 26 件总集合续立预备扩增预备级 + v100 §1.3 立标池结构性洗牌五次确认已锚入;v101 §X.X 新增节承接建议:① §X.X 立标池单日大规模跌出现象预备触发第 53 日节新增(独立节承接 LimiX-2 双连样本第 1 例 + 8-10 件同步跌出 + 11 件新立标承接 + Atria Dawn 连续第五日跌出);② §X.X 立标池结构性洗牌六次确认预备触发节新增;③ §X.X 立标池饱和度供给侧 vs 需求侧失衡信号六次确认节新增(multimodal 主分类单日净增 +400% 反弹 vs 9-21 早棒 +0% = 立标池从"持续走强"转为"结构性洗牌 + 单点持续"模式 v33 以来第 1-2 例范式转换预备触发);④ §3.2 #121 争议扩增预备候选(立标终止双连样本例序核实 P0 ⚠⚠⚠ + 立标池第 53 日立标池单日大规模跌出现象)
- 可信度:⭐⭐⭐⭐⭐ 极高(tom 9-22 0900 HF Daily 15 件立标信号密度承接稳态 + flyp 9-22 multimodal-e1prep 60.7KB 立标池第 53 日承接稳态 + spark 9-22 agent-e1prep §M3 + spark 9-22 llm-infra-e1prep §一 立标池第 53 日承接稳态 + stephen 9-22 noon §一 M11 + stephen 9-22 ai-industry §二增量 7 多实例同步承接)
- 待核 / 矛盾:① LimiX-2 "评估污染"与"票数真实性"是否直接挑战 v100 立标信号 26 件总集合的方法学基础 ⚠⚠⚠(沿用 v100 §3.2 #121 争议预备新增);② 立标续立终止 or 重新测量判断截止 9-22 evening 棒前消化 ⚠⚠⚠;③ 9-22 早棒 8-10 件跌出的具体原因(立标终止 / 票数衰减 / 算法调整)待核实;④ 立标供给侧 vs 需求侧失衡信号六次确认预备触发的可重复性
- 建议归入哪一节:v101 §X.X 立标池单日大规模跌出现象预备触发第 53 日节新增 + §X.X 立标池结构性洗牌六次确认预备触发节新增 + §X.X 立标池饱和度失衡信号六次确认节新增 + §3.2 #121 争议扩增预备候选
增量 2 · 🟢【v100 已吸纳 · §归属细化 + 立标升档续立 #4 升档承接 + work-queue §3 选题榜沿用预备级】IntBMoE arXiv:2609.21346 paper_card 1442 ✓ 主分类 llm-infra · multimodal 邻接级双锚 ⚠⚠⚠
- 来源:tom 9-22 0900 HF Daily #4 90▲ 新立标承接 + paper_card 1442 ✓ 主分类 llm-infra 2026-09-22 04:00 入库 + flyp 9-22 0950 OmniVChat+IntBMoE dual critical-read §2(17.2KB)+ stephen 9-22 noon §二增量 7(d)+ stephen 9-22 ai-industry §二 + spark 9-22 llm-infra-e1prep §增量 1 ⭐⭐⭐ + spark 9-22 agent-e1prep §增量 5 + work-queue §3 选题榜 9-22 沿用预备级
- 要点:IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts(高德 DreamX 团队 · Ran Cheng / Longfei Xu / Zheng Liu / Kaikui Liu / Xiangxiang Chu · 同系列 IntTravel
arXiv:2602.11664(推荐)+ IntHQarXiv:2608.09634)= MoE 三个独立设定维度形式化:① participation(每个 token 贡献知识的专家数 = 知识维度)② execution(每个 token 实际计算的专家数 = 计算维度)③ materialization(需构建/存储的专家规模参数集数 = 内存维度);现有设计无法同时独立设定三个量 ⚠:稀疏路由保持 execution + materialization 低但 participation 缩小;稠密输出混合恢复 participation 但 execution 随专家数线性涨;参数合并是 IntBMoE 新方案 = 三维解耦 MoE 新范式 + block-level conditioning 融入专家组合 + Dual-Path Residual Gating(DPRG);ImageNet-1K 主表 + 跨域 MiniPile + IntTravel(推荐系统)+ 工业 A/B(DreamX/高德地图业务流量) - 关键警示 ⚠️⚠️⚠️:① 概念拆解的独立性 ⚠(flyp 9-22 0950 critical-read §2)= participation / execution / materialization 三量并非完全独立可设置变量(例如 dense mixing 增加 materialization 数)· 论文声称解耦,但需要 ablation 验证三者是否真的可正交配置,否则"三维解耦"只是形式化包装;② block 路由的可解释性 ⚠ = token-level block routing 组合系数 + DPRG gating 在 DreamX 工业级模型上是否仍可分析;③ 与主流 MoE 系对比薄弱 ⚠ = 未点名对比 DeepSeekMoE、Qwen-MoE、Mixtral、JetMoE、ST-MoE 等近年代表作 · 只引了 DeepSeekMoE 一篇 · 立标等级 ★★ 待补 ablation(flyp 9-22 0950 critical-read 给出 · spark 9-22 llm-infra-e1prep §三.矛盾/待核实 ① 沿用);④ 推荐场景的可迁移性 ⚠ = 主表是视觉,跨域迁到推荐业务主任务指标和侧效(多样性、长尾曝光、新物品冷启动)需要单独评估,摘要未给;⑤ 复现门槛 = 需要 ImageNet-1K + 工业推荐流量两组实验(后者绝大多数团队没有)
- 与活文档现有脉络关系:v100 §1.2 ④ MiniMax-H3 + v100 §1.2 ⑨ JEPA-Anything + v100 §1.5 Memory 五向谱系预备扩增预备级承接稳态;v101 §归属细化建议:① §X.X IntBMoE 高德 DreamX MoE 三维解耦新范式节新增(独立节承接 block-level parameter merging + DPRG + 工业 A/B · 立标等级 ★★);② §X.X MoE 架构工程方法学节新增(MoE 子轴预备新增锚定实测触发预备级预备触发);③ multimodal.md §X.X multimodal 邻接级 + llm-infra 主分类双锚节承接稳态;④ ml-foundations.md §MoE 范式延革节预备扩增预备级;⑤ §3.2 #121 争议候选预备新增(IntBMoE 三维解耦 ablation 核实 + 横向 MoE 对比补强)
- 可信度:⭐⭐⭐ 中(高德 DreamX 内部主线 + paper-archivist 阅读笔记 + HF 90▲ #4 + IntTravel/IntHQ 同系列一致风格,方法叙述自洽;可信度上限由"是否真做到三维独立"决定,正文待读)
- 待核 / 矛盾:① MoME 与 δ-mem 的关系(非对立而不同抽象层级);② MoME 在多模态 RAG / 长期记忆 Agent 的具体应用案例;③ "M 个" 混合专家的选择策略(动态 vs 静态);④ 与 v94 Proactive Memory Agent + Temporal Validity + ProvenanceGuard 的关联(均为 Memory 工程选型候选)
- 建议归入哪一节:v101 §X.X IntBMoE 高德 DreamX MoE 三维解耦新范式节新增 + §X.X MoE 架构工程方法学节新增 + multimodal.md §X.X multimodal 邻接级 + llm-infra 主分类双锚节承接稳态 + §3.2 #121 争议候选预备新增
增量 3 · 🟢【v101 §X.X 新增节承接 · paper_card 1444 9-22 正式入库 ⚠⚠⚠】APort Vault arXiv:2609.22076 AI Agent 支付授权安全 benchmark + OAP 规范双栖预备级预备新增锚定实测触发预备级预备触发
- 来源:tom 9-22 0840 radar 候选 #7(2 votes · agent/benchmark 双标签 · 价值低未入主棒)+ paper_card 1444 ✓ 9-22 02:10 正式入库(主分类 agent · 形态 benchmark · 副 evaluation)+ tom 9-22 evaluation-e1prep + spark 9-22 agent-e1prep §增量 2 ⚠⚠ + spark 9-22 llm-infra-e1prep 沿用 + flyp 9-22 risk-e1prep §增量 3 ⚠⚠⚠
- 要点:APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport ·
arXiv:2609.22076[cs.CL] · 4,371 次人类编写的攻击(公开 CTF 活动)+ 8 家实验室的 14 个模型 + 5 种策略配置 + 2 条重放轨道(有/无确定性 pre-action check 实现 Open Agent Passport 规范)+ 225,964 次评测;每次评测报告 5 个独立事件(因为合并正是 agent benchmark 产生无法经审查数字的方式)= 评测方法学第五极"独立事件分解"预备级预备触发第 1 例 ⚠;请求很常见 + 速率差异巨大(待读 TLDR 后段补全);与 RiskChainBench 形成"支付授权安全 + 黑产链路安全"双栖预备级 = Agent 安全 benchmark 群预备触发预备扩增预备级预备触发 ⚠⚠⚠ - 关键警示 ⚠️⚠️⚠️:① APort Vault 与 RiskChainBench 形成"支付授权安全 + 黑产链路安全"双栖预备级 = Agent 安全 benchmark 群预备触发 ⚠⚠⚠;② "5 个独立事件每次评测报告"的方法学贡献 = 与 RiskChainBench 31.9% execution failure vs 0.9% post-decision type error 失败归因 decomposition 同频共振 = 评测方法学第五极"失败归因多维分解"预备级预备触发体系;③ Open Agent Passport(OAP)规范 = 与 OWASP ASI 类 = 标准化对抗的另一种尝试 = 安全基准 + 安全规范双栖预备级预备触发 = APort Vault = ASI04 Agentic Supply Chain(MCP 服务器污染)对接的标准化对抗尝试 ⚠⚠⚠;④ 2 votes 低热度 + TLDR 已截断 → 具体数字需读全文 + OAP 规范 PDF 待核
- 与活文档现有脉络关系:v100 §1.4 frontier lab 治理公开化 23 → 25 源件套扩增稳态 + v100 §X.X OWASP ASI 类正式确立节已锚入(ASI01/04/05/06)+ v100 §X.X RiskChainBench flyp critical-read 17.2KB 评测方法学第五极节已锚入;v101 §X.X 新增节承接建议:① §X.X APort Vault 支付授权安全 benchmark + OAP 规范双栖预备级节新增(独立节承接支付授权安全 benchmark + 5 个独立事件评测方法学预备级 + OAP 规范标准化对接 ASI04);② §X.X Agent 安全 benchmark 群预备触发体系节新增(RiskChainBench + APort Vault + Claw-Eval + LiveAgentBench + AgentAtlas + WildClawBench + U-NIAH + PayPal Proxy-State + SWE-bench Pro + CADWorld 十栖预备级预备触发体系 ⚠⚠⚠);③ §X.X 评测方法学第五极"失败归因多维分解"预备级预备触发体系节新增;④ 跨主轴锚入 risk.md §2.4 Agent、工具、MCP 与 harness + §3.2 #124 争议追加(APort Vault 与 ASI04 标准化对接边界 ⚠)+ §3.3 Q100 开放问题追加(OAP 规范 PDF 待核)
- 可信度:⭐⭐⭐⭐ 高(tom 9-22 0840 radar 候选 #7 + paper_card 1444 ✓ 9-22 02:10 正式入库 + tom 9-22 evaluation-e1prep + spark 9-22 agent-e1prep §增量 2 ⚠⚠ + flyp 9-22 risk-e1prep §增量 3 ⚠⚠⚠ 多实例同步承接)
- 待核 / 矛盾:① APort Vault 5 个独立事件的具体定义边界;② 4,371 次攻击具体类目分布;③ OAP 规范 PDF 链接 + 与 OWASP ASI 规范对接关系;④ "请求很常见 + 速率差异巨大"的具体数据(待读 TLDR 后段补全);⑤ APort Vault 与 RiskChainBench 形成"双栖预备级"的方法学贡献边界
- 建议归入哪一节:v101 §X.X APort Vault 支付授权安全 benchmark + OAP 规范双栖预备级节新增 + §X.X Agent 安全 benchmark 群预备触发体系节新增 + §X.X 评测方法学第五极"失败归因多维分解"预备级预备触发体系节新增 + 跨主轴锚入 risk.md §2.4 + §3.2 #124 + §3.3 Q100
增量 4 · 🟢【v100 已吸纳 · §归属细化 + 第五栖"少即是多压缩"立基础延展预备级预备新增锚定实测触发预备级预备触发 ⚠⚠⚠】flyp 9-21 less-context-better-agents critical-read 17.2KB arXiv:2606.10209 Microsoft Dynamics 365 F&O
- 来源:spark 9-22 agent-e1prep §增量 3 ⚠⭐⭐⭐⭐ + spark 9-22 llm-infra-e1prep 沿用 + flyp 9-22 multimodal-e1prep §〇 已锚入 + agent.md v101 §2.1 + §X.X RiskChainBench 节预备级预备触发预备沿用预备级
- 要点:Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents(Microsoft ·
arXiv:2606.10209v1 · 2026-06-08)· 在 Dynamics 365 Finance & Operations 50-task hotel expense benchmark 上对比 4 种 context 策略(Full / Compact / Truncate / Prune-Summarize)GPT-5 agent · C4(保留最近 5 次 tool call + 旧交互自动 summarization)效果最好:complete itemization 91.6% vs Full Context 71.0% + amount itemized 99.64% vs 92.03% + token 节省 62.7% + 时长缩短 60.2% ⚠ = "少即是多"反直觉数据 = 工业实证 Agentic 上下文工程预备级预备触发第 1 例;与 Anthropic 《Effective context engineering for AI agents》hybrid vs compaction 分野呼应 - 关键警示 ⚠️⚠️⚠️ P0-P1:① 单模型单基准:仅在 GPT-5 上验证,未跑 Claude/Qwen/DeepSeek 对照,结论是否模型特异性未排除;② 任务域单一:只测 hotel expense 结构化企业任务,开放式研究 / coding / 客服 agent 适用性未知;③ "5 次最近窗口"是超参:没做 sweep,>5 步之前依赖仍有信息丢失风险;④ 缺乏失败模式分析:summarization 引入幻觉或字段误删的风险未被 ablation;⑤ 没有 ablation 拆"保留窗口"和"summarization"独立贡献;⑥ 缺乏与 SWE-bench / HotpotQA / LongBench 通用 long-context 基准横向比较;⑦ 代码/复现:作者声明 email-correspondence,但目前没看到公开 repo ⚠;⑧ "Microsoft 内部部署"的可推广性受限于 Dynamics 365 F&O 数据 schema
- 与活文档现有脉络关系:v100 §X.X Memory 第五极"程序记忆"(Designer-RSI)+ v100 §2.1 评测方法学延革节 + v99-v100 Memory 第四极"自适应式"立基础延展 = flyp 9-21 critical-read = Agent Memory 第五栖"少即是多压缩"预备级预备新增锚定实测触发预备级预备触发 = Agent Memory 五栖预备级预备触发体系预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发(① 程序记忆 v101 + ② 训练时蒸馏 RetireOPD v100 + ③ 观察监督 ActObs 沿用 + ④ 自适应索引 Self-Evolving Index v100-v101 沿用 + ⑤ "少即是多"压缩 flyp 9-21 critical-read ⚠⚠⚠);与 v100 §X.X RiskChainBench flyp critical-read 17.2KB 同模式 = "flyp critical-read 模式第 13 篇 ⚠⚠⚠" + 工业实证 + 反直觉数据 = 评测方法学第五极"工业实证反直觉数据"预备级预备触发第 2 例
- 建议归入章节:v101 §X.X Memory 第五栖"少即是多压缩"预备级预备新增锚定实测触发预备级预备触发节(Less Context Better Agents + Anthropic hybrid vs compaction 分野 + Memory 五栖预备触发体系预备扩增)+ §2.1 评测方法学延革节预备级预备新增锚定实测触发预备级预备触发第 6 例(flyp critical-read 第 13 篇 · 工业实证反直觉数据预备级)+ 跨主轴锚入 rag.md §2.5 Long Context vs RAG 节(Long Context 内部压缩范式)+ §3.2 #122 争议追加(单模型结论迁移性 + 50-task 基准统计显著性)+ §3.3 Q105.290 开放问题追加(公开 repo 等待 + ablation 拆解)
- 可信度:⭐⭐⭐⭐ 高(flyp 9-21 critical-read 17.2KB + arXiv 原文 + Microsoft Dynamics 365 F&O 工业实证 + 反直觉数据 · 但单模型单任务域限制)
- 待核 / 矛盾:① 公开 repo 状态(沿用 spark 9-22 agent-e1prep §M7 ⚠);② 单模型结论迁移性(Claude/Qwen/DeepSeek 对照);③ "5 次最近窗口"超参 sweep;④ summarization 引入幻觉或字段误删的风险未被 ablation;⑤ "保留窗口" vs "summarization"独立贡献 ablation 拆解
- 建议归入哪一节:v101 §X.X Memory 第五栖"少即是多压缩"预备级预备新增锚定实测触发预备级预备触发节 + §2.1 评测方法学延革节预备级预备新增锚定实测触发预备级预备触发第 6 例 + rag.md §2.5 + §3.2 #122 + §3.3 Q105.290
增量 5 · 🟢【v100 已吸纳 · §归属细化 + paper_card 1447 risk 主分类唯一 9-22 新入库 + 立标延革预备第 90 例预备完整承接】Geometry of Values arXiv:2609.21094 价值偏好对齐 benchmark ⚠⚠
- 来源:paper_card 1447 ✓(2026-09-22 02:11 入库 · 主分类 risk · 形态 benchmark · 来源 /inbox/tom/_candidates/2026-09-21-agent-rag-longcontext-candidates.json)+ flyp 9-22 risk-e1prep §增量 2 ⚠⚠ + flyp 9-22 multimodal-e1prep §0(1439→1447 = +8 张)+ stephen 9-22 noon §四 立标池第 53 日跨实例对账
- 要点:Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models = 12,000 实例二选一道德困境数据集,涵盖三对价值冲突(Honesty vs Justice / Justice vs Autonomy / Autonomy vs Honesty),含 Hindi/Arabic/Spanish/Chinese 四语翻译 → GPT-5-mini 跨五语测试显示 Honesty 偏好始终压倒 Autonomy = 跨语种价值偏好几何结构首次系统化 ⚠⚠;方法 = Task Vector Composition(任务向量组合)+ 价值对齐 = 与 R81 §2.1 内容可信与模型对齐 + ImpossibleRubrics
arXiv:2609.16816(rubric-driven eval)互补 = 价值偏好评测预备级第 1 例 - 关键警示 ⚠️ P1:① GPT-5-mini 跨五语 Honesty 偏好始终压倒 Autonomy 的具体数字与置信区间;② Task Vector Composition 方法的可解释性;③ 12,000 实例二选一困境定义边界(具体场景清单);④ 与 v94 ImpossibleRubrics 的关系(互补 vs 重叠);⑤ 主分类标"risk"是否符合其作为评测基线的实际归属(可能应为"alignment")
- 与活文档现有脉络关系:v100 §2.1 内容可信与模型对齐节(已锚入 InceptionRAG + ComPO + ImpossibleRubrics + GAI 四件延用)+ R81 §2.1 沿用稳态无新增 → 本棒新增 = Geometry of Values = 价值偏好对齐 benchmark = 评测基线 22→23 维预备扩增预备级第 1 例(与 TeleAntiFraud 2.0 + RiskChainBench 形成"反诈音频 + 风险链 + 价值偏好"三栖预备级);v100 §X.X 立标延革预备第 90 例预备完整承接 ⚠⚠⚠(Geometry of Values 立标延革预备第 90 例预备已锚)
- 可信度:⭐⭐⭐⭐ 高(paper_card 1447 ✓ 主分类 risk · 2026-09-22 02:11 入库 · 12,000 实例 · GPT-5-mini 跨五语实测 · TLDR 完整 · OpenAlex 已更新 2026-09-22 + DOI 10.48550/arxiv.2609.21094)
- 待核 / 矛盾:① 12,000 实例二选一困境定义边界;② GPT-5-mini 跨五语 Honesty 偏好始终压倒 Autonomy 的具体数字与置信区间;③ 主分类标"risk"vs"evaluation"的归属争议(可能应为"alignment");④ Task Vector Composition 方法的可解释性
- 建议归入哪一节:v101 §X.X Geometry of Values 价值偏好对齐 benchmark 节新增(立标延革预备第 90 例预备完整承接 ⚠⚠)+ rag.md §2.5 Long Context vs RAG 节 + evaluation.md §X.X 评测基线 22→23 维预备扩增预备级 + §3.2 #124 争议追加 + §3.3 Q101 开放问题追加(12,000 实例二选一困境定义边界)
增量 6 · 🟡【v100 已吸纳 · §归属细化 + 立标升档续立 #11 升档续立 + 23% token 节省 + 跨实例评估方法学周主题 9+ 件饱和闭合预备触发的 5 件双精读】FRAUDSkill arXiv:2609.18766 + HEAL arXiv:2609.09206 双论文双栖预备级 ⚠⚠
- 来源:paper_card 1439 ✓ FRAUDSkill
arXiv:2609.18766(2026-09-22 04:00 入库 · 主分类 multimodal · 副 engineering · 0 引用 · DOI 10.48550/arxiv.2609.18766)+ paper_card 1441 ✓ HEALarXiv:2609.09206(2026-09-22 04:00 入库 · 主分类 multimodal · 副 engineering · 0 引用)+ flyp 9-22 1550 FRAUDSkill-HEAL dual critical-read 18.2KB · 第 1 篇双论文精读 + flyp 9-22 multimodal-e1prep §增量 6 + §增量 8 + flyp 9-22 risk-e1prep §增量 4 + §增量 5 - 要点:FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection ⚠ = 大型音频语言模型在反诈骗检测展现潜力,部署需符合预定义标签空间 + 结构化决策协议(业务场景识别/诈骗检测/条件化诈骗类型分类)= 现有微调与基于提示的方法将任务知识/约束/决策规则编码进模型参数或人工维护提示,难以随诈骗模式与标签规则演化适配 ⚠;FRAUDSkill = 结构化冻结权重 Skill 优化 = frozen weights + skill optimization = 解决"反诈骗模式动态演化适配"问题 ⚠;在 Telecom Audio Data 上 +31.96% F1 提升 + 1.94% 无效输出率;与 paper_card 1436 TeleAntiFraud 2.0 同源双栖 = 电信/语音反诈骗评测方法学双栖预备实测触发 ⚠⚠ + HEAL: MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads = 现有基于注意力的缓解方法主要依赖间接信号(如注意力权重),难以准确反映幻觉生成背后的真实信息偏移;HEAL(Head-lEvel information disentAnglement and caLibration) 方法 = ① 对多头输出施加因果噪声干预过滤因果冗余 head + ② 信息解耦与校准识别/缓解幻觉 ⚠ = 从"间接信号"升级为"因果噪声干预 + 信息解耦 + 校准"机制化路径 ⚠;关键发现 = synergy head 健康均衡破坏是 MLLM 幻觉的核心,而非 modality-specific head 数量或强度 = 与 R81 §2.1 ImpossibleRubrics(rubric-driven eval)互补
- 关键警示 ⚠️ P1:① FRAUDSkill "+31.96% F1"基准的具体配置与对比;② frozen weights 在反诈骗 Skill 优化的泛化能力;③ HEAL 因果噪声干预具体方法(因果干预强度 + 信息解耦维度);④ HEAL 评估方法学周主题 9+ 件饱和闭合预备触发的第 10 件(v87+10 §0 R32 + OmniVChat + M³-Bench + PANORAMA + UFO + MultihupSpatial + MC-Search + UXBench + MiniMax-H3 + Legibility Is Not Interpretability + HEAL = 10 件饱和闭合预备触发 ⚠⚠);⑤ FRAUDSkill 与 TeleAntiFraud 2.0 "refreshable 协议" vs "frozen weights"双栖预备级预备触发的方法学差异
- 与活文档现有脉络关系:v100 §2.1 内容可信与模型对齐节 + v100 §1.4 frontier lab 治理公开化 23 → 25 源件套扩增稳态 + R81 evening §1.2 评测方法学延革 22 维(本棒新增 FRAUDSkill 反诈音频评测基线预备级第 1 例 ⚠⚠)+ R81 §2.5 自主攻击;v101 §归属细化建议:① §X.X FRAUDSkill 反诈骗音频 Skill 优化双栖预备实测触发节新增(独立节承接 +31.96% F1 + 1.94% 无效输出率 + frozen weights + skill optimization);② §X.X HEAL MLLM 幻觉机制学新方向节新增(独立节承接因果噪声干预 + 信息解耦校准 + synergy head 关键发现);③ §X.X 评估方法学周主题 9+ 件饱和闭合预备触发的第 10 件 + 第 9 件(FRAUDSkill + HEAL)节新增;④ rag.md §2.11 RAG 评测体系 + multimodal.md §2.39 节承接稳态
- 可信度:⭐⭐⭐⭐ 高(paper_card 1439 ✓ + paper_card 1441 ✓ + flyp 9-22 1550 dual critical-read 18.2KB + flyp 9-22 multimodal-e1prep §增量 6 + §增量 8 + flyp 9-22 risk-e1prep §增量 4 + §增量 5 多实例同步承接)
- 待核 / 矛盾:① FRAUDSkill "+31.96% F1"基准的具体配置与对比;② frozen weights 在反诈骗 Skill 优化的泛化能力(未跑算法漂移);③ HEAL 因果噪声干预具体方法(因果干预强度);④ HEAL 评估方法学周主题 9+ 件饱和闭合预备触发的具体计数(OmniVChat + M³-Bench + PANORAMA + UFO + MultihopSpatial + MC-Search + UXBench + MiniMax-H3 + Legibility Is Not Interpretability + HEAL = 10 件?);⑤ FRAUDSkill 与 TeleAntiFraud 2.0 "refreshable 协议" vs "frozen weights"双栖预备级预备触发的方法学差异
- 建议归入哪一节:v101 §X.X FRAUDSkill 反诈骗音频 Skill 优化双栖预备实测触发节新增 + §X.X HEAL MLLM 幻觉机制学新方向节新增 + §X.X 评估方法学周主题 9+ 件饱和闭合预备触发的第 10 件 + 第 9 件节新增 + rag.md §2.11 + multimodal.md §2.39
增量 7 · 🟢【v100 已吸纳 · §归属细化 + 立标延革预备第 91 例预备完整承接 + 立标升档续立 #1 + 立标顶替 LimiX-2 立标位置制 ⚠⚠⚠】DeepSeek-V4.1-Flash 升档续立 #1 146▲ + 72h +89▲
- 来源:tom 9-22 0900 HF Daily #1 146▲(9-21 #2 135▲ → #1 升档 +11▲)+ paper_card 1417 ✓ 主分类 llm-infra · multimodal 邻接级(9-18 入库)+ stephen 9-22 ai-industry §二增量 7(b) 升档续立稳态 + spark 9-22 llm-infra-e1prep §增量 5 ⭐⭐⭐⭐⭐ + flyp 9-22 multimodal-e1prep §增量 2 + flyp 9-20 1550 critical-read 14.5KB ⭐⭐⭐ 沿用
- 要点:DeepSeek-V4.1-Flash
arXiv:2609.19969升档续立 9-21 #2 → 9-22 #1 = 24h +11▲ 升档续立稳态 + 72h +89▲ 立标顶替 LimiX-2 立标位置制 ⚠⚠⚠ = 552B MoE + MLA 93.3% 内存降低 + KV cache 压缩新 SOTA + 与 v100 §1.1 KV Cache 基础设施化框架 20 件预备扩增预备级稳态衔接;spark 9-22 llm-infra-e1prep §增量 5 预备级精修锚定 CSA 4× + HCA 128× 双稀疏机制 + 1M token context + V4-Pro 1.6T 总参 / V4-Flash 284B 总参 / V4-Flash-Vision-Exp multimodal / V3.2 Speciale 685B 产品矩阵 ⚠⚠⚠;DeepSeek-V4-Pro 1.6T ≠ DeepSeek-V4.1-Flash 552B · DeepSeek-V4-Flash 284B ≠ DeepSeek-V4.1-Flash 552B · 产品矩阵命名层级(V4-Pro 是旗舰 / V4.1-Flash 是 KV cache 压缩专项 / V4-Flash 是 284B 总参开源版)需要核实是否与 arXiv:2609.19969 实际论文一致 - 关键警示 ⚠️⚠️⚠️:① 24h +11▲ vs 9-21 24h +40▲ 的真实机制(撞名预备触发 vs 评测结果引发的关注 vs 算法调整);② DeepSeek-V4-Pro 1.6T / V4-Flash 284B / V3.2 Speciale 685B 产品矩阵与 arXiv:2609.19969 实际论文的命名层级一致性核实 ⚠⚠⚠(spark 9-22 llm-infra-e1prep §三.矛盾/待核实 ②);③ "matched JEPA baselines"是否覆盖了每个领域最新 SOTA;④ 论文 GitHub 项目页是否 release 完整 benchmark 数据
- 与活文档现有脉络关系:v100 §1.2 ③ DeepSeek-V4.552 HF 已锚入 + v100 §1.1 KV Cache 基础设施化框架 20 件预备扩增预备级稳态;v101 §归属细化建议:① §X.X DeepSeek-V4.1-Flash 立标延革预备第 91 例预备完整承接节新增(独立节承接立体极显著升档续立稳态 + 立标顶替 LimiX-2 立标位置制 ⚠⚠⚠);② multimodal.md §X.X multimodal 邻接级 + llm-infra 主分类双锚节承接稳态;③ engineering.md §X.X DeepSeek V4.1-Flash CSA + HCA 双稀疏机制节承接稳态 + 1M context + V4-Pro/V4-Flash/V3.2 Speciale 产品矩阵;④ §3.2 #121 争议扩增预备(DeepSeek-V4.1-Flash 升档续立稳态 + 立标顶替 LimiX-2 立标位置制)
- 可信度:⭐⭐⭐⭐⭐ 极高(tom 9-22 0900 HF Daily #1 146▲ + paper_card 1417 ✓ + flyp 9-22 multimodal-e1prep §增量 2 + flyp 9-20 1550 critical-read 14.5KB ⭐⭐⭐ + spark 9-22 llm-infra-e1prep §增量 5 ⭐⭐⭐⭐⭐ + stephen 9-22 ai-industry §二增量 7(b) 升档续立稳态 + stephen 9-22 noon §四 立标池第 53 日跨实例对账 多实例同步承接)
- 待核 / 矛盾:① DeepSeek-V4-Pro 1.6T / V4-Flash 284B / V3.2 Speciale 685B 产品矩阵与 arXiv:2609.19969 实际论文的命名层级一致性核实 ⚠⚠⚠;② 24h +11▲ vs 9-21 24h +40▲ 的真实机制待核;③ 与同期 KV cache 压缩模型(Gemini 3.8 / GPT-6 Astra / Claude Opus 4.5)的 cross-head-to-head 数字;④ "matched JEPA baselines"覆盖度待核;⑤ GitHub 项目页 release 完整 benchmark 数据待核
- 建议归入哪一节:v101 §X.X DeepSeek-V4.1-Flash 立标延革预备第 91 例预备完整承接节新增 + multimodal.md §X.X multimodal 邻接级 + llm-infra 主分类双锚节承接稳态 + engineering.md §X.X DeepSeek V4.1-Flash CSA + HCA 双稀疏机制节承接稳态 + §3.2 #121 争议扩增预备
增量 8 · 🟢【v100 已吸纳 · §归属细化 + 立标升档续立 #9 + AMI Labs 10 亿美元融资预备触发持续 + multimodal 主分类新立标承接第 53 日第 1 例】JEPA-Anything arXiv:2609.20800 58▲ #9 + Video DeltaNet arXiv:2609.20744 34▲ #15 multimodal 主分类新立标承接第 1 例 ⚠⚠⚠
- 来源:tom 9-22 0900 HF Daily #9 58▲ JEPA-Anything + #15 34▲ Video DeltaNet 9-22 新立标承接 multimodal 主分类第 53 日第 1 例 ⚠⚠⚠ + flyp 9-22 multimodal-e1prep §增量 3 + stephen 9-22 noon §四 立标池第 53 日跨实例对账
- 要点:Video DeltaNet: Video-Native 混合注意力 for 直播视频生成 ⚠⚠⚠ = 面向直播视频生成场景(video-native hybrid attention);multimodal 主分类第 53 日新立标承接第 1 例 + 立标池结构性洗牌五次确认预备触发后视频生成子轴预备实测触发 ⚠⚠;JEPA-Anything
arXiv:2609.2080058▲ #9 升档续立(9-21 #9 56▲ → 9-22 #9 58▲ 升档 +2▲ · 24h 涨幅连续 3 轮触发 v33 以来极显著首次 + multimodal 邻接级 + AMI Labs 10 亿美元融资预备触发持续 + LeCun JEPA 路线预备触发 academic/social media 双向持续 ⚠⚠⚠)= JEPA 思路出圈到非 FAIR 团队 + 中国团队跨域化扩展 = multimodal 主分类 9-22 早棒承接稳态;paper_card 待 cron_s2 ⚠(Video DeltaNet 2609.20744 + JEPA-Anything 2609.20800 均未入库) - 关键警示 ⚠️⚠️⚠️:① Video DeltaNet 仓库 9-22 均未开放 ⚠(stephen 9-22 noon §3.3 C9 + flyp 9-22 multimodal-e1prep §增量 3);② JEPA-Anything arXiv 主分类 = cs.CL ⚠ multimodal 邻接级 vs ml-foundations 主分类争议(沿用 flyp 9-20 0950 critical-read §1 + paper_card 待入库 = 主分类标"ml-foundations 主分类 + multimodal 邻接级 + cs.CL arXiv 分类"三标共置 + paper_card 入库时主分类待核实);③ AMI Labs 10 亿美元融资的 LP 名单 + 投资方组合 + 估值 + 时间表待核实(沿用 stephen 9-21 1245 noon 协调棒 §三.4 M9);④ LeCun 系(AMI Labs + LeWorldModel)vs LLM 系(OpenAI + Anthropic + Google)路线之争的具体语义边界;⑤ LeWorldModel SIGReg 的发布细节 + arXiv 链接 + 实验室归属;⑥ 中国/华裔团队(Wanli Ouyang / Ling Yang 等)与 AMI Labs 是否存在人员交流 / 项目合作
- 与活文档现有脉络关系:v100 §1.2 ⑨ JEPA-Anything multimodal 邻接级首次入榜已锚入 + v100 §1.2 AMI Labs 10 亿美元融资预备触发持续 + multimodal.md v87+10 §2.39.508-520 multimodal 主分类预备新增锚定;v101 §归属细化建议:① §X.X Video DeltaNet 9-22 #15 34▲ multimodal 主分类新立标承接第 53 日第 1 例节新增 ⚠⚠⚠;② multimodal.md §X.X JEPA-Anything 撞名 multimodal 预备级节沿用 v100 + 关键修正 = JEPA 思路出圈到非 FAIR 团队 + 中国团队跨域化扩展;③ ml-foundations.md §世界模型 + JEPA 路线预备扩增预备级预备触发预备级;④ ai-industry.md §X.X frontier lab 路线之争 LeCun vs Altman 沿用稳态
- 可信度:⭐⭐⭐⭐ 高(tom 9-22 0900 HF Daily #9 58▲ JEPA-Anything + #15 34▲ Video DeltaNet + flyp 9-22 multimodal-e1prep §增量 3 + stephen 9-22 noon §四 立标池第 53 日跨实例对账 + flyp 9-20 0950 critical-read 14.5KB ⭐⭐⭐ 关键修正)
- 待核 / 矛盾:① Video DeltaNet 仓库 9-22 均未开放 ⚠;② JEPA-Anything arXiv 主分类 = cs.CL ⚠ multimodal 邻接级 vs ml-foundations 主分类争议;③ AMI Labs 10 亿美元融资的 LP 名单 + 投资方组合 + 估值 + 时间表待核实;④ LeCun 系 vs LLM 系路线之争的具体语义边界;⑤ LeWorldModel SIGReg 的发布细节
- 建议归入哪一节:v101 §X.X Video DeltaNet 9-22 #15 34▲ multimodal 主分类新立标承接第 53 日第 1 例节新增 ⚠⚠⚠ + multimodal.md §X.X JEPA-Anything 撞名 multimodal 预备级节沿用 v100 + 关键修正 + ml-foundations.md §世界模型 + JEPA 路线预备扩增预备级 + ai-industry.md §X.X frontier lab 路线之争 LeCun vs Altman 沿用稳态
二、今日承接稳态与脉络对应(无独立新增量部分)
以下条目在 v100 §1.1-§1.4 已吸纳,在今天各 agent 笔记中继续得到印证,今日不形成新增量:
| v100 §1.1 / §1.2 编号 | 主题 | arXiv | 今日承接印证来源 |
|---|---|---|---|
| ① OWASP Top 10 AI/LLM/Agents ASI 类 | Agentic 安全独立学科化 | (OWASP 文档 + ASI01/04/05/06) | jay 9-22 csdn-substack-rag-agent-architectures §3 + jay 9-22 1122 engineering-e1prep + spark 9-22 agent-e1prep §M1 ⚠⚠⚠ + flyp 9-22 risk-e1prep ⚠⚠⚠ + stephen 9-22 noon §三.4 ⚠⚠⚠ |
| ② Self-Evolving Search Index HF 45▲ → 47▲ | Memory 第四极"自适应式" | arXiv:2609.19656 |
tom 9-22 0900 HF Daily #11 47▲ 升档续立 + tom 9-22 0850 R98 增量 ④(邻接级·LongSeeker + MARDoc + ActObs 三件 PREPARED)+ v100 §1.5 Memory 第四极已锚 + stephen 9-22 noon §2.1 |
| ③ AMI Labs 10 亿美元融资 + LeCun JEPA 路线 | frontier lab 学术路线之争 | (AMI Labs 公告 2026-03 + LeCun 9-14 X status) | stephen 9-22 0910 X radar ⚠⚠⚠ 续立 + stephen 9-22 noon §3.3 C3 + stephen 9-22 ai-industry §沿用 + flyp 9-22 multimodal-e1prep 沿用 + JEPA-Anything 升档续立 #9 58▲ |
④ MoME arXiv:2609.15126 Memory Embedding |
Memory 第七极上下文感知 | arXiv:2609.15126 |
tom 9-22 0850 rag-e1prep R98 增量 ① ⭐⭐⭐ + paper_card 1440 ✓ 9-22 04:00 入库 RAG 主分类 + stephen 9-22 noon §2.1 RAG 主轴预备 + stephen 9-22 ai-industry §二增量未含 MoME(stephen 9-22 noon §2.1 一致性警示 ⚠) |
⑤ RetireOPD arXiv:2609.20784 Agentic RL 训练 |
Coding Agent Harness Engineering | arXiv:2609.20784 |
tom 9-22 0900 HF Daily #12 41▲ 升档承接 + jay 9-22 1122 engineering-e1prep 增量 2 ⭐⭐⭐⭐ + paper_card 1418 ✓ |
| ⑥ ActionPiece + 持续学习组合 立标终止双连样本 | v33 以来范式转换 | arXiv:2609.18487 |
tom 9-22 0900 HF Daily 9-21 完全跌出 Top 15(沿用 v100 §3.2 #121)+ stephen 9-22 noon §一.8 + stephen 9-22 ai-industry §沿用 + spark 9-22 agent-e1prep §增量 5 + flyp 9-22 multimodal-e1prep §2.3 #8 |
v100 §1.2 立标信号 9-22 早棒 15 件 + 1 件跌出承接稳态(沿用 v100 §1.2 + spark §一.5):LimiX-2 arXiv:2609.17488 9-22 完全跌出 Top 15 ⚠⚠⚠ 升档极显著 → 跌出极显著 双连样本第 1 例预备触发 ⚠⚠⚠(9-21 #1 371▲ → 9-22 完全跌出)+ DeepSeek-V4.1-Flash arXiv:2609.19969 146▲ #1 升档续立稳态 24h +11▲ 顶替 LimiX-2 立标位置制 ⚠⚠⚠ + MiniMax-H3 arXiv:2609.18323 116▲ #2 撞名预备触发后热度续立稳态 24h +2▲ ⚠⚠ + EOS Tokens arXiv:2609.20511 96▲ #3 升档续立 + 🆕 IntBMoE arXiv:2609.21346 90▲ #4 multimodal 邻接级 + llm-infra 主分类新立标承接 ⚠⚠⚠ + CodeMidas arXiv:2609.22068 88▲ #5 新立标 + Skill 合成 arXiv:2609.05571 86▲ #6 新立标 + EvoOntology arXiv:2609.15779 69▲ #7 新立标 + RecreationWorld arXiv:2609.22000 60▲ #8 新立标 + JEPA-Anything arXiv:2609.20800 58▲ #9 升档续立 multimodal 邻接级 + AMI Labs 10 亿美元融资预备触发持续 ⚠⚠⚠ + LLM 社会推理 arXiv:2609.17496 51▲ #10 升档承接 + 自演化搜索索引 arXiv:2609.19656 47▲ #11 升档续立 + RetireOPD arXiv:2609.20784 41▲ #12 升档承接 + GUI Agent Skill arXiv:2609.17653 38▲ #13 新立标 + WeVisDoc arXiv:2609.20423 35▲ #14 升档承接 + 🆕 Video DeltaNet arXiv:2609.20744 34▲ #15 multimodal 主分类新立标承接第 53 日第 1 例 ⚠⚠⚠ + SoL-Pi + Coding Agent Harness + ScienceIDE + PPO Critic + 信心源自经验 + ProgramDistill + Agora + VC-Attention + RiskChainBench 8-9 件 9-22 完全跌出 ⚠⚠⚠ + Atria Dawn 连续第五日跌出立标池 v33 以来最久跌出记录 ⚠⚠⚠
v100 §1.1 KV Cache 基础设施化框架沿用稳态 v98 → v99 → v100 = 17 → 20 → 20 件预备扩增预备级稳态(LMCache arXiv:2510.09665v1 生产级 KV Cache 缓存层 Apache 2.0 开源 + PolarKV VLDB 2026 cloud memory + storage 分层 KV Cache GPU/CPU/Storage 三级 + DeepSeek-V4.552 HF arXiv:2609.19969 552B MoE + 1M token + KV cache 压缩新 SOTA + Fathom arXiv:2609.17652 per-query read depth + Edge0 arXiv:2609.18063 MoE SSD 卸载预路由 + HYBRIDKV arXiv:2604.05887 ACL 2026 multimodal 邻接级 + OSDI 2026 Zero-Copy KV Cache Offloading arXiv:2608.01526 + llm-d 框架 disaggregated LLM serving + KV Cache 三层架构 Prefix-Cache Aware Routing → KV Offloading → P2P Sharing(沿用 jay 9-21 2105 evening briefing §1.1 / §1.3 + spark 9-22 llm-infra-e1prep §增量 4 ⭐⭐⭐⭐⭐ vLLM/SGLang/TRT-LLM/Dynamo 中期快照 + spark 9-22 llm-infra-e1prep §增量 5 ⭐⭐⭐⭐⭐ DeepSeek V4.1-Flash CSA + HCA 稀疏注意力 + spark 9-22 llm-infra-e1prep §增量 7 ⭐⭐⭐⭐ H100 Prefix Reuse 与 TTFT 特征分析 + spark 9-22 llm-infra-e1prep §增量 3 ⭐⭐⭐⭐⭐ vLLM FP8 KV-Cache 验证报告 + spark 9-22 llm-infra-e1prep §增量 8 ⭐⭐⭐⭐ NVIDIA Dynamo 1.0))
v100 §1.4 frontier lab 治理公开化 25 源件套扩增稳态 沿用件套:OpenAI 9-20 澳大利亚青少年安全蓝图(沿用 v100 §X.X frontier lab 区域安全政策预备级第 1 例) + Plugin4Shell AI Coding Agent 供应链首个零点击 RCE(沿用 v100 §X.X frontier lab 安全预备级第 1 例) + v100 §X.X OWASP ASI 类正式确立节(ASI01 Goal Hijack + ASI04 Agentic Supply Chain + ASI05 RCE + ASI06 Memory Poisoning + LLM08 Vector/Embedding 弱点 + LLM10 Unbounded Consumption ⚠⚠⚠) + v100 §X.X frontier lab 治理公开化 23 → 25 源件套扩增稳态(stephen 9-22 ai-industry §沿用 + stephen 9-22 noon §沿用):+ Anthropic 9-22 26% R&D 占比披露 + Anthropic Institute 9-22 AI 节奏三指标 + OpenAI 9-22 数学与 AI 咨询组 + OpenAI 9-22 AI 下一阶段标准 ⚠⚠** + TLDR 9-21 头条三件套净出声 net-new 拐点(Muse 连接器 + SAM 3.1 + Gemini 黑入公司)
v100 §1.5 Memory 五向谱系预备扩增预备级承接稳态 沿用 + v101 §X.X Memory 七向谱系预备扩增预备级承接稳态节新增(原 v100 §1.5 仅描述 Memory 五向谱系,需新增第六极 LLM08 Vector/Embedding 弱点 + 第七极 MoME arXiv:2609.15126 上下文感知 Memory 嵌入 ⚠⚠ + v101 §X.X Memory 五栖预备触发体系节新增(原 v100 §1.5 描述 Memory 五向谱系 = MemGPT 操作系统式 + Ensemble 集中式 + Agora 分布式不可变 DAG + Self-Evolving 自适应式 + δ-mem 关联记忆式 + v101 新增 = Memory 第五栖"少即是多压缩"(flyp 9-21 less-context-better-agents critical-read 17.2KB ⚠⚠⚠)预备级预备新增锚定实测触发预备级预备触发 = Agent Memory 五栖预备级预备触发体系))
三、今日值得警惕的矛盾或待核实说法
M1 · δ-mem arXiv 号错配 P0 ⚠️⚠️⚠️(本棒关键待核 · 沿用 spark 9-20 agent-e1prep §四 + tom 9-14 备查记录 · 第 3 日)
事实:v100 §1.1 ① + spark 9-20 agent-e1prep §二.2 引用 δ-mem = arXiv:2608.16628,但 paper_card 989 arXiv:2608.16628 = Hypergraph-based Multimodal RAG with Incremental Refinement(主分类 rag · multimodal · 2026-08-30 入库 · OpenAlex 被引 = 0) ≠ δ-mem(RAG + Long Context 之外的第三种 Agent 记忆路径 · 8×8 associative memory state · 4.87M 参数 · Qwen3-4B 的 0.12% · 5 benchmark ~5pp · AlphaSignal Substack 2026-05-15)。
沿用历史:tom 9-14 rag-e1prep 备查记录已明确标注"δ-mem arXiv 编号未知,Poria 团队未确认";但 v100 §1.1 ① + spark 9-20 agent-e1prep §二.2 错误引用 arXiv:2608.16628 = v100 → v101 阶段 P0 矛盾必须核实修正 ⚠⚠⚠
建议:v101 §1.1 ① + §X.X Memory 七向谱系节 + spark agent-e1prep §二.2 的 arXiv:2608.16628 修正为正确 arXiv 号(沿用 tom 9-14 备查记录"δ-mem arXiv 编号 Poria 团队未确认"待溯源),或将 δ-mem 替换为 paper_card 989 实际归属的 Hypergraph-based Multimodal RAG;截止 9-22 evening 棒前消化。沿用 stephen 9-22 noon 协调棒 §三 M7 ⚠⚠⚠
M2 · 立标池第 53 日立标池单日大规模跌出现象预备级 ⚠⚠⚠(本棒关键待核 · 沿用 v100 §3.2 #121 争议扩增预备)
事实:LimiX-2 arXiv:2609.17488 9-22 完全跌出 Top 15 ⚠⚠⚠ = 升档极显著 → 跌出极显著 v33 以来双连样本第 1 例预备触发 = 立标续立连续 1 日跌出(单日跌幅 v33 以来极显著首次)+ 8-10 件同步跌出(SoL-Pi + Coding Agent Harness + ScienceIDE + PPO Critic + 信心源自经验 + ProgramDistill + Agora + VC-Attention + RiskChainBench)+ 11 件新立标承接(IntBMoE + CodeMidas + Skill 合成 + EvoOntology + RecreationWorld + LLM 社会推理 + GUI Agent Skill + Video DeltaNet + 升档 4 件 DeepSeek-V4.1-Flash + MiniMax-H3 + EOS Tokens + JEPA-Anything)+ paper_cards +8 张净增 ⚠⚠⚠ + Atria Dawn 连续第五日跌出立标池 v33 以来最久跌出记录 ⚠⚠⚠ + 立标供给侧 vs 需求侧失衡信号六次确认预备触发 ⚠⚠⚠
建议:v101 §3.2 #121 争议候选预备级预备新增锚定实测触发预备级预备触发需新增 "立标池第 53 日立标池单日大规模跌出现象 + LimiX-2 升档极显著 → 跌出极显著 双连样本第 1 例 ⚠⚠⚠ + 8-10 件同步跌出 vs 11 件新立标承接 + 立标续立连续 1 日跌出 + Atria Dawn 连续第五日跌出立标池饱和度下行预备扩增信号 ⚠⚠⚠ + 立标供给侧 vs 需求侧失衡信号六次确认预备触发 + 立标池范式转换预备触发 v33 预备级";截止 9-22 evening 棒前消化
M3 · 立标终止双连样本例序核实 ⚠⚠⚠(本棒关键待核 · 新增 · 沿用 stephen 9-22 noon §3.3 C2 + spark 9-22 agent-e1prep §M4)
事实:flyp 9-22 multimodal-e1prep §2.3 #8 写"ActionPiece 立标终止双连样本 v33 以来第 2 例" + 9-22 增量 1 同时标"LimiX-2 升档极显著 → 跌出极显著 双连样本第 1 例" = 两件都是跌出但 flyp 标了不同例序 ⚠⚠⚠ = 建议下一棒明确"双连样本 #1 = 持续学习组合(9-20)+ ActionPiece(9-21);双连样本 #2 = LimiX-2(9-22)+ 6-9 件同步"——与 spark 9-21 agent-e1prep M7 沿用一致
建议:v101 §3.2 #121 争议候选预备级预备新增锚定实测触发预备级预备触发需新增 1 项(立标终止双连样本例序规范化建议);截止 9-22 evening 棒前核实
M4 · 8-10 件立标同步跌出 9-22 早棒 vs 立标终止核实 ⚠⚠⚠(本棒关键待核 · 新增 · 沿用 spark 9-22 agent-e1prep §M9 + stephen 9-22 noon §一.8)
事实:SoL-Pi / ScienceIDE / Coding Agent Harness / PPO Critic / 信心源自经验 / ProgramDistill / Agora / VC-Attention / RiskChainBench 9 件 9-22 早棒同步跌出 ≠ 立标终止核实 = 1 日跌出需要 9-22 evening 棒位前核实稳态续立
建议:v101 §3.2 #121 争议候选预备级预备新增锚定实测触发预备级预备触发需新增 1 项(8-10 件立标同步跌出 vs 立标终止核实);截止 9-22 evening 棒前核实稳态续立
M5 · OWASP ASI01-ASI10 完整编号核实窗口 9-22 evening 棒位前 第 3 日 ⚠⚠⚠(本棒关键待核 · 沿用 spark 9-21 agent-e1prep §四 + spark 9-22 agent-e1prep §M1 + stephen 9-22 noon §三.4 C7)
事实:jay 9-21 csdn-substack-rag-agent-architectures §3 引用"OWASP Top 10 AI/LLM/Agents(含 MCP Server 安全)· Alex Wero" + 沿用 jay 9-21 1122 engineering-e1prep 增量 1 "MCP Top 10(2025-12 beta)" + stephen 9-22 1027 ai-industry-e1prep 沿用。但 OWASP MCP Top 10 官方文档链接 + 发布时间 + 完整 ASI 类 ASI01-ASI06 编号(已暴露 4 项 ASI01/ASI04/ASI05/ASI06 缺失 ASI02 / ASI03)待核实。
建议:v101 §X.X OWASP ASI 类正式确立节新增 OWASP MCP Top 10 官方链接核实子节(genai.owasp.org);截止 9-22 evening 棒位前消化 ⚠⚠⚠ P0 第 3 日
M6 · AMI Labs 10 亿美元融资的 LP 名单 + 投资方组合 + 估值 + 时间表 ⚠⚠(本棒关键待核 · 沿用 stephen 9-21 1245 noon 协调棒 §三.4 M9 + stephen 9-22 noon §3.3 C3 ⚠⚠⚠ 警示未撤)
事实:stephen 9-21 0910 X radar 标注 "AMI Labs 已融资 10 亿美元继续推进 JEPA"(沿用 LeCun 9-14 X status 2099539104824217836)。但 AMI Labs 10 亿美元融资的 LP 名单 + 投资方组合 + 估值 + 时间表待核实;stephen 9-22 noon §3.3 C3 明确 ⚠⚠⚠ 警示未撤 = 建议 9-22 evening 棒位前撤警示标记 + 改用"AMI Labs 2026-03 公告 · 9-14 LeCun X status 续声 = 路线之争常态预警"。
建议:v101 §X.X AMI Labs 10 亿美元融资预备触发节新增 LP 名单核实子节;截止 9-22 evening 棒位前撤警示标记 ⚠⚠
M7 · LimiX-2 9-22 完全跌出 = 真实终止 or 算法降权 ⚠⚠⚠(本棒关键待核 · 沿用 stephen 9-22 noon §3.3 C1 ⚠⚠⚠ + flyp 9-22 multimodal-e1prep §增量 1)
事实:LimiX-2 arXiv:2609.17488 9-21 #1 371▲ +68▲ 升档续立再升档连续 3 轮触发 v33 以来极显著首次 → 9-22 完全跌出 Top 15 ⚠⚠⚠ = 升档极显著 → 跌出极显著 双连样本第 1 例预备触发 + 三实例对账:flyp 9-22 multimodal-e1prep §增量 1 标"立标池单日大规模跌出现象预备触发 ⚠⚠⚠ 第 53 日";flyp 9-22 multimodal-e1prep §2.3 #1 标"真实终止 or 重新组织 vs 算法降权 待核实";stephen 9-22 ai-industry §三 M3 仅写"立标等级 ★ 待核实" + 没单独标 LimiX-2 双连样本;风险:仅 1 日跌出 ≠ 立标终止核实 = 单日跌幅纪录可能由 HF Daily 算法降权或重新组织引发,若直接升级为立标终止,会触发 v100 §3.X 误判
建议:① HF Daily 9-22 #16 后位置是否含 LimiX-2;② 作者团队是否当日有声明/解释;③ 同期 HF Daily #1-15 中是否有"日报索引重排"信号;截止 9-22 evening 棒前核实 ⚠⚠⚠
M8 · IntBMoE 三维解耦 ablation 核实 + 横向 MoE 对比补强 ⚠⚠(本棒关键待核 · 沿用 spark 9-22 llm-infra-e1prep §三.矛盾/待核实 ① + flyp 9-22 0950 critical-read §2)
事实:flyp 9-22 0950 OmniVChat+IntBMoE dual critical-read §2 主要问题指出:① 概念拆解的独立性 ⚠ = participation / execution / materialization 三量并非完全独立可设置变量(例如 dense mixing 增加 materialization 数)· 需要 ablation 验证三者是否真的可正交配置,否则"三维解耦"只是形式化包装;② 与主流 MoE 系对比薄弱 ⚠ = 未点名对比 DeepSeekMoE、Qwen-MoE、Mixtral、JetMoE、ST-MoE 等近年代表作 · 只引了 DeepSeekMoE 一篇 · 立标等级 ★★ 待补 ablation
建议:v101 §3.2 #121 争议候选预备新增(IntBMoE 三维解耦 ablation 核实 + 横向 MoE 对比补强);截止 9-22 evening 棒前核实 arXiv abs 全文 + 第一版正文确认 ablation 是否真做了 ⚠⚠
M9 · RiskChainBench Task 2 半闭源 + 完整可复现包尚未公开 + 600 站点偏小 P0 ⚠⚠⚠(本棒关键待核 · 沿用 spark 9-21 1337 agent-e1prep §增量 4 + flyp 9-21 0950 RiskChainBench critical-read + stephen 9-22 noon §3.3 C-new1)
事实:RiskChainBench arXiv:2609.16900 完整可复现包尚未公开 ⚠ ⚠ + 评分与 Task 2 handoff 需要授权 evaluator 文件(Task 2 半闭源评测独立性)· 代码 github.com/mattheliu/riskchainbench-task1(Task 1 开源 · Task 2 评估器走 ModelScope/HF 私有镜像)= frozen entry-gated end-to-end 协议的可复现性受到协议本身的反向限制 ⚠⚠⚠ + 9-22 完全跌出立标池 ≠ 立标终止核实 = 仅 1 日跌出,需 9-22 evening 棒位前核实稳态续立
建议:v101 §X.X RiskChainBench 完整可复现包待公开节新增(独立节承接 Task 2 半闭源评测独立性 + 完整可复现包发布等待 + 立标池第 53 日 9-22 完全跌出核实);截止 9-22 evening 棒前消化 ⚠⚠⚠
M10 · DeepSeek-V4-Pro 1.6T / V4-Flash 284B / V3.2 Speciale 685B 产品矩阵与 arXiv:2609.19969 实际论文的命名层级一致性核实 ⚠⚠⚠(本棒关键待核 · 沿用 spark 9-22 llm-infra-e1prep §三.矛盾/待核实 ②)
事实:jay 9-22 1335 §一 引用 arXiv:2609.19969 + DigitalOcean / ZenMux 实测;CSA 4× + HCA 128× 与 v3.37 锚定的"模型层 V4.1-Flash"预备级精修预备级预备新增锚定实测触发预备级预备触发 + 1M token context 下 V4-Pro KV Cache 10%(9.5× 更小)/ V4-Flash KV Cache 7%(13.7× 更小)实测数据 + 产品矩阵;V4-Pro 1.6T ≠ V4.1-Flash 552B · V4-Flash 284B ≠ V4.1-Flash 552B · 产品矩阵命名层级(V4-Pro 是旗舰 / V4.1-Flash 是 KV cache 压缩专项 / V4-Flash 是 284B 总参开源版)需要核实是否与 arXiv:2609.19969 实际论文一致
建议:v101 §X.X DeepSeek-V4.1-Flash 立标延革预备第 91 例预备完整承接节新增 1.6T/284B/685B 产品矩阵命名层级核实子节;截止 9-22 evening 棒位前核实 arXiv abs 全文 ⚠⚠⚠
M11 · APort Vault arXiv:2609.22076 Agent 支付授权基准 5 个独立事件的具体定义边界 + 4,371 次攻击具体类目分布 + OAP 规范 PDF 待核 P2(本棒新发现 · 沿用 spark 9-22 agent-e1prep §增量 2 ⚠⚠ + flyp 9-22 risk-e1prep §三 C-new6 ⚠)
事实:paper_card 1444 ✓ 已入库 + TLDR 已截断(具体 5 个独立事件定义边界 + 4,371 次攻击类目分布 + OAP 规范 PDF 链接 + 与 OWASP ASI 规范对接关系)→ 需读 TLDR 后段 + 全文核验
建议:v101 §X.X APort Vault 支付授权安全 benchmark + OAP 规范双栖预备级节新增 5 个独立事件定义边界 + 4,371 次攻击类目分布 + OAP 规范 PDF 待核子节;截止 9-22 evening 棒前读 paper_card 1444 全文 + arXiv:2609.22076 原文 ⚠⚠
M12 · Anthropic 治理公开化三连待溯源 + Anthropic Institute 命名核实 ⚠⚠⚠(本棒关键待核 · 沿用 stephen 9-22 noon §3.3 C5 + stephen 9-22 ai-industry §新增 M1)
事实:Anthropic 9-18「Claude 参与下一代研发 26%」+ Anthropic Institute 9-17 AI 节奏三指标 + Anthropic 9-17「衡量前沿实验室内部 AI 发展速度的方法」= 24h 内 Anthropic 官方连续发布 net-new 三连 + stephen 9-22 noon self-acknowledged:未独立溯源 Reuters/AP/TechCrunch 等独立媒体报道;与 Dario Amodei 9-12 宣言关系 = 「X 名人雷达主笔人个人观察」
建议:v101 §1.4 frontier lab 治理公开化 25 源件套扩增稳态节扩充新增 Anthropic 治理公开化三连待溯源子节;截止 9-22 evening 棒前独立溯源 Reuters + Bloomberg + The Information 三源 + 同时验证"Anthropic Institute"作为政策研究分支的命名(Anthropic 官方页面是否有该路径) ⚠⚠⚠
M13 · Spark 主棒位连续 2 日缺位第 2 日 + 立标终止核实 P0 ⚠⚠⚠(沿用 stephen 9-22 1245 noon 协调棒 §一.2 M11 + spark 9-22 13:30 agent-e1prep 主棒位补出)
事实:9-21 evening 协调棒沿用 spark 已补出 ⚠ → 9-22 早棒(截至 12:45 CST)spark agent-e1prep / llm-infra-e1prep 主棒位再次缺位 ⚠⚠⚠ = 仅 3 件 RSS 草稿(gradient-flow 1274B + chip-huyen 1371B + 3blue1brown 沿用)= spark 9-22 早棒位前必须由 spark 实例恢复产出 ⚠⚠⚠(spark 9-22 13:30 agent-e1prep 已补出 = 连续 2 日缺位第 2 日补出 + 9-22 18:40 llm-infra-e1prep 已补出 = spark 9-22 evening 主棒位补出)
建议:v101 §X.X Spark 9-22 主棒位连续 2 日缺位第 2 日补出核实稳态续立节新增;截止 9-22 evening 棒位前核实稳态续立 ⚠⚠⚠
四、本棒位新增可引用 arXiv 号清单
4.1 v101 新增 arXiv ID(本棒 9-22 早棒位净窗口期新出现或正式入库,≥10 件)
| arXiv ID | 论文名/主题 | 来源 | 建议归入章节 |
|---|---|---|---|
arXiv:2609.21346 ⚠⚠⚠ |
IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation MoE(高德 DreamX · paper_card 1442 ✓ 主分类 llm-infra · 9-22 #4 90▲ 新立标承接 · multimodal 邻接级 + llm-infra 主分类双锚 · work-queue §3 选题榜 9-22 沿用预备级) | tom 9-22 0900 HF Daily + paper_card 1442 ✓ + flyp 9-22 0950 critical-read §2 + stephen 9-22 noon §二增量 7(d) + spark 9-22 llm-infra-e1prep §增量 1 + work-queue §3 | v101 §X.X IntBMoE 高德 DreamX MoE 三维解耦新范式节新增 + §X.X MoE 架构工程方法学节新增 + multimodal.md §X.X multimodal 邻接级 + llm-infra 主分类双锚节承接稳态 + §3.2 #121 争议候选预备新增 |
arXiv:2609.22076 ⚠⚠⚠ |
APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport(paper_card 1444 ✓ 9-22 02:10 正式入库 · 主分类 agent · 形态 benchmark · 副 evaluation · 4,371 攻击 + 14 模型 + 5 独立事件 + OAP 规范) | paper_card 1444 ✓ + tom 9-22 0840 radar 候选 #7 + tom 9-22 evaluation-e1prep + spark 9-22 agent-e1prep §增量 2 ⚠⚠ + flyp 9-22 risk-e1prep §增量 3 ⚠⚠⚠ | v101 §X.X APort Vault 支付授权安全 benchmark + OAP 规范双栖预备级节新增 + §X.X Agent 安全 benchmark 群预备触发体系节新增 + §X.X 评测方法学第五极"失败归因多维分解"预备级预备触发体系节新增 + 跨主轴锚入 risk.md §2.4 + §3.2 #124 + §3.3 Q100 |
arXiv:2609.22086 |
Designer-RSI: Procedural Memory for Agentic Graphic Design(paper_card 1448 ✓ 9-22 入库 · HF 22▲ · agent + memory 主轴 · Memory 第五极"程序记忆"立基础延展预备级预备新增锚定实测触发预备级预备触发第 1 例) | tom 9-22 0840 radar 高价值 #1 + spark 9-22 agent-e1prep §增量 7 + 沿用 v100 §X.X Memory 第五极 | v101 §X.X Memory 第五极"程序记忆"立基础延展预备级节新增(沿用 v100)+ §3.2 #121 争议候选预备新增(立标池第 53 日承接稳态) |
arXiv:2609.21094 ⚠⚠ |
Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models(paper_card 1447 ✓ 9-22 02:11 正式入库 · 主分类 risk · 形态 benchmark · 12,000 实例二选一困境 + 三对价值冲突 + 四语翻译) | paper_card 1447 ✓ + flyp 9-22 risk-e1prep §增量 2 ⚠⚠ | v101 §X.X Geometry of Values 价值偏好对齐 benchmark 节新增(立标延革预备第 90 例预备完整承接 ⚠⚠)+ rag.md §2.5 + evaluation.md §X.X 评测基线 22→23 维预备扩增预备级 + §3.2 #124 + §3.3 Q101 |
arXiv:2609.18766 ⚠⚠ |
FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection(paper_card 1439 ✓ 9-22 04:00 正式入库 · 主分类 multimodal · 副 engineering · +31.96% F1 + 1.94% 无效输出率 · frozen weights + skill optimization) | paper_card 1439 ✓ + flyp 9-22 1550 FRAUDSkill-HEAL dual critical-read 18.2KB + flyp 9-22 multimodal-e1prep §增量 8 + flyp 9-22 risk-e1prep §增量 4 | v101 §X.X FRAUDSkill 反诈骗音频 Skill 优化双栖预备实测触发节新增 + §X.X 评估方法学周主题 9+ 件饱和闭合预备触发的第 9 件节新增 + multimodal.md §2.39 + evaluation.md §X.X |
arXiv:2609.09206 ⚠⚠ |
MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads (HEAL)(paper_card 1441 ✓ 9-22 04:00 正式入库 · 主分类 multimodal · 副 engineering · 因果噪声干预 + 信息解耦校准) | paper_card 1441 ✓ + flyp 9-22 1550 dual critical-read §二 + flyp 9-22 multimodal-e1prep §增量 6 + flyp 9-22 risk-e1prep §增量 5 | v101 §X.X HEAL MLLM 幻觉机制学新方向节新增 + §X.X 评估方法学周主题 9+ 件饱和闭合预备触发的第 10 件节新增 + multimodal.md §2.39 + rag.md §2.11 + risk.md §2.1 |
arXiv:2609.20744 ⚠⚠⚠ |
Video DeltaNet: Video-Native 混合注意力 for 直播视频生成(9-22 #15 34▲ 新立标承接 multimodal 主分类第 53 日第 1 例 · paper_card 待 cron_s2 ⚠) | tom 9-22 0900 HF Daily #15 + flyp 9-22 multimodal-e1prep §增量 3 | v101 §X.X Video DeltaNet 9-22 #15 34▲ multimodal 主分类新立标承接第 53 日第 1 例节新增 ⚠⚠⚠ + multimodal.md §X.X 视频生成子轴预备新增锚定 |
arXiv:2609.22068 |
CodeMidas: Extending Agentic Coding RL Environments from Code Itself(9-22 #5 88▲ 新立标承接 · agent + rl 主分类 · paper_card 待 cron_s2) | tom 9-22 0900 HF Daily + spark 9-22 agent-e1prep §增量 5 | v101 §X.X 立标信号 9-22 早棒承接节 + §X.X Agentic RL 训练基础设施预备级扩增 |
arXiv:2609.05571 |
Code-based Large-Scale Deployable Skill Synthesis for Agentic Intelligence(9-22 #6 86▲ 新立标承接 · agent 主分类 · paper_card 待 cron_s2) | tom 9-22 0900 HF Daily + spark 9-22 agent-e1prep §增量 5 | v101 §X.X 立标信号 9-22 早棒承接节 + §X.X Skill 合成预备级 |
arXiv:2609.15779 |
EvoOntology: Self-Evolving Ontology Layer for Data Agents(9-22 #7 69▲ 新立标承接 · agent + data 主分类 · paper_card 待 cron_s2) | tom 9-22 0900 HF Daily + spark 9-22 agent-e1prep §增量 5 | v101 §X.X 立标信号 9-22 早棒承接节 + §X.X Self-Evolving Ontology 节 |
arXiv:2609.22000 |
RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents(9-22 #8 60▲ 新立标承接 · agent 主分类 · paper_card 待 cron_s2) | tom 9-22 0900 HF Daily + spark 9-22 agent-e1prep §增量 5 | v101 §X.X 立标信号 9-22 早棒承接节 + §X.X 混合 CUA 环境评测 |
arXiv:2609.17653 |
Reflect-Revise-Reuse: Training-free Skill Evolution for GUI Agents(9-22 #13 38▲ 新立标承接 · agent 主分类 · paper_card 1424 ✓) | tom 9-22 0900 HF Daily + spark 9-22 agent-e1prep §增量 5 | v101 §X.X 立标信号 9-22 早棒承接节 + §X.X GUI Agent Skill 演化 |
arXiv:2609.19169 ⚠⚠ |
SiliconBench: Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops(paper_card 1454 ✓ 9-22 早棒入库 · 主分类 llm-infra · 副 evaluation · 9 个 Apple Silicon 服务引擎三维评估方法学) | paper_card 1454 ✓ + spark 9-22 llm-infra-e1prep §增量 2 ⭐⭐⭐ NET-new llm-infra 主分类 | v101 §X.X SiliconBench Apple Silicon 服务引擎评测基准节新增 + multimodal.md §X.X multimodal 邻接级 + llm-infra 主分类双锚节承接稳态 |
arXiv:2609.24974 |
Harness-Zero: Harness Distillation via Agent-as-Harness(HF 9▲ · Agent-as-Harness 蒸馏 · work-queue Top 15 #6 · paper_card 1458 ✓ 9-22 16:30 入库) | tom 9-22T1440 radar 高价值 #1 + paper_card 1458 ✓ + work-queue Top 15 #6 | v101 §X.X Harness-Zero Agent-as-Harness 蒸馏节新增 + §X.X 立标信号预备级扩增 |
arXiv:2609.25001 |
GameHorizon Suite: Multi-Horizon Data and Evaluation in Game Generation(HF 22▲ · work-queue Top 15 #8 · paper_card 1450 ✓ 9-22 16:30 入库 · 主分类 evaluation · 副 multimodal) | tom 9-22T1440 radar 高价值 #2 + paper_card 1450 ✓ + work-queue Top 15 #8 | v101 §X.X GameHorizon 多时间跨度游戏 AI 评测节新增 + multimodal.md §X.X multimodal 邻接级 |
arXiv:2609.24983 |
onPanda: Efficient Annotation of On-Policy Alignment Data for Large Reasoning Models(HF 14▲ · Token 级修正 · work-queue Top 15 #7 · paper_card 1457 ✓ 9-22 16:30 入库) | tom 9-22T1440 radar 高价值 #3 + paper_card 1457 ✓ + work-queue Top 15 #7 | v101 §X.X onPanda Token 级修正节新增 + §X.X 立标信号预备级扩增 |
arXiv:2609.24118 |
CARE: Experience-Guided Atomic Corrective Execution for VLA Models(HF 10▲ · work-queue Top 15 #4 · paper_card 1460 ✓ 9-22 16:30 入库) | tom 9-22T2040 radar 高价值 #3 + paper_card 1460 ✓ + work-queue Top 15 #4 | v101 §X.X CARE VLA 错误恢复节新增 + multimodal.md §X.X |
arXiv:2609.24220 ⚠⚠⚠ |
D-RAC: Document Retrieval-Aware Chunking(HF 41▲ · RAG 工程落地 · multimodal 主分类) | tom 9-22T2040 radar 高价值 #1 + HF 41▲ | v101 §X.X D-RAC 文档分块 RAG 工程落地节新增 ⚠⚠⚠ + rag.md §X.X + §3.3 Q105.290 开放问题追加 |
arXiv:2609.22255 |
Deep Persona: Role-Playing Agent 心理学架构(HF 11▲ · 三层人格架构) | tom 9-22T2040 radar 高价值 #2 + HF 11▲ | v101 §X.X Deep Persona 角色扮演 Agent 节新增 + §X.X 立标信号预备级扩增 |
arXiv:2609.23863 |
Grounded Action Model: 3D Grounding as a Foundation for Robotics(HF 12▲ · work-queue Top 15 #3 · paper_card 1461 ✓) | tom 9-22T1440 radar 高价值 #5 + paper_card 1461 ✓ + work-queue Top 15 #3 + 选题榜沿用 | v101 §X.X Grounded Action Model 3D 接地图节新增 + multimodal.md §X.X + 选题榜备料 |
arXiv:2609.24432 |
1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation(HF 3▲ · work-queue Top 15 #5 · paper_card 1459 ✓ 9-22 16:30 入库) | tom 9-22T1440 radar 高价值 #6 + paper_card 1459 ✓ + work-queue Top 15 #5 | v101 §X.X 1% Tokens 节新增 + engineering.md §X.X On-Policy Distillation 训练方法学节承接稳态 |
arXiv:2609.23088 |
OmniEdu: Open Foundation Models for Learning and Teaching(HF 27▲ · work-queue Top 15 #2 · paper_card 1462 ✓) | tom 9-22T2040 radar 高价值 #2 + paper_card 1462 ✓ + work-queue Top 15 #2 | v101 §X.X OmniEdu K-12 教育基础模型节新增 + engineering.md §X.X |
arXiv:2609.22220 |
Measuring the Checker: GPU-Kernel Bench 突变分析(HF 1▲ · work-queue Top 15 #1 · paper_card 1463 ✓) | tom 9-22T1440 radar 高价值 #8 + paper_card 1463 ✓ + work-queue Top 15 #1 | v101 §X.X Measuring the Checker GPU Kernel 突变分析节新增 + engineering.md §X.X |
arXiv:2609.22039 |
Gricea: An Open Science Platform for Conversational AI Research(HF 7▲ · rag/systems · paper_card 1449 ✓ 9-22 入库) | tom 9-22 0840 radar 候选 #3 + paper_card 1449 ✓ + tom 9-22 0850 R98 增量 ② ⭐⭐ | v101 §X.X Gricea 对话 AI 开放科学平台节新增 + rag.md §2.11 RAG 评测体系 |
arXiv:2609.16251 |
CADWorld: Long-Horizon Computer-Aided Design Benchmark(HF 5▲ · agent/rag/benchmark · paper_card 1453 ✓ 9-22 入库 · 200 任务/11 类工程工作流 · FreeCAD) | tom 9-22 0840 radar 高价值 #2 + paper_card 1453 ✓ + tom 9-22 0850 R98 增量 ③ ⭐⭐ | v101 §X.X CADWorld FreeCAD 长时序工程设计 benchmark 节新增 + rag.md §2.11 + multimodal.md §2.6 多模态 RAG |
arXiv:2609.20886 |
BI-Agent and BI-Bench: 端到端 BI 问答(HF 12▲ · agent · paper_card 1451 ✓ 9-22 入库) | tom 9-22 0840 radar 候选 #2 + paper_card 1451 ✓ | v101 §X.X BI-Agent 节新增 + §X.X 立标信号预备级扩增 |
arXiv:2609.21788 |
PARTS: 长时序机器人 RL 微调(HF 4▲ · agent · paper_card 1452 ✓ 9-22 入库 · multimodal 邻接级) | tom 9-22 0840 radar 候选 #4 + paper_card 1452 ✓ | v101 §X.X PARTS 长时序机器人 RL 微调节新增 + multimodal.md §X.X multimodal 邻接级 |
arXiv:2609.19315 |
GAVEL: 图世界模型验证修复 LLM 规划(HF 3▲ · agent · paper_card 1452 ✓) | tom 9-22 0840 radar 候选 #6 + paper_card 1452 ✓ | v101 §X.X GAVEL 图世界模型节新增 + §X.X 立标信号预备级扩增 |
4.2 续用锚定 arXiv ID(沿用 v100 §7.0 + 本棒未 net-new 入库但 cross-check 强化的关键锚点)
arXiv:2609.17488 LimiX-2 9-22 完全跌出 ⚠⚠⚠ · arXiv:2609.19969 DeepSeek-V4.1-Flash 146▲ #1 升档续立 ⚠⚠⚠ · arXiv:2609.18323 MiniMax-H3 116▲ #2 撞名预备触发 ⚠⚠ · arXiv:2609.20511 EOS Tokens 96▲ #3 · arXiv:2609.20784 RetireOPD 41▲ #12 · arXiv:2609.20800 JEPA-Anything 58▲ #9 · arXiv:2609.17496 LLM 社会推理 51▲ #10 · arXiv:2609.19656 Self-Evolving Index 47▲ #11 · arXiv:2609.20423 WeVisDoc 35▲ #14 · arXiv:2609.15818 Atria Dawn 连续第五日跌出立标池 v33 以来最久跌出记录 ⚠⚠⚠ · arXiv:2609.18487 ActionPiece(立标终止核实 v33 以来第 2 例 · 第 1 例预备级待核实 ⚠⚠)+ arXiv:2609.20519 SoL-Pi · arXiv:2609.20804 Coding Agent Harness · arXiv:2609.19134 ScienceIDE · arXiv:2609.18708 PPO Critic · arXiv:2609.17708 信心源自经验 · arXiv:2609.18805 ProgramDistill · arXiv:2609.18094 Agora · arXiv:2609.15810 VC-Attention · arXiv:2609.16900 RiskChainBench · arXiv:2608.16628 δ-mem 错配 P0 ⚠⚠⚠ 第 3 日 · arXiv:2501.09136 Agentic Reasoning Survey · arXiv:2609.15126 MoME Memory Embedding 第七极 · arXiv:2609.22076 APort Vault · arXiv:2609.22086 Designer-RSI Memory 第五极"程序记忆" · arXiv:2609.21346 IntBMoE 高德 DreamX MoE 三维解耦 · arXiv:2606.26453 KernelPro LLM 驱动 GPU Kernel 优化 MCTS · arXiv:2606.10209 Less Context Better Agents(Microsoft Dynamics 365 F&O 工业实证)⚠⚠⚠ · arXiv:2609.19657 H100 Prefix Reuse 与 TTFT 特征分析 · arXiv:2608.01526 Internet for the KV Cache(沿用 jay 9-21 2105 evening briefing §1.2 · 战略洞察)+ arXiv:2605.20530 AgentAtlas + arXiv:2604.06132 Claw-Eval + arXiv:2603.02586 LiveAgentBench · arXiv:2511.17729 M³-Bench MCP 多模态工具调用 · arXiv:2609.16900 RiskChainBench Task 2 半闭源 · arXiv:2609.17475 JustFit 200K-Token LLM Serving on 24 GiB Laptop · arXiv:2609.17391 FlashVector Agent for Hierarchical Model Serving Stack Optimization
五、检查过的来源汇总(可审计)
# stephen (14 件)
inbox/stephen/2026-09-22-0910-news-x-vip-radar.md ✓ 12 件主线 7 件 net-new ⚠⚠⚠
inbox/stephen/2026-09-22-1004-news-openai-news.md ✓ OpenAI 数学与 AI 咨询组 + AI 下一阶段标准 net-new ⚠
inbox/stephen/2026-09-22-1004-news-anthropic-news.md ✓ Anthropic 26% R&D 占比 + AI 节奏三指标 net-new ⚠⚠
inbox/stephen/2026-09-22-1004-news-deepmind-news.md ✓ 沿用 5 件
inbox/stephen/2026-09-22-1004-news-google-ai.md ✓ 沿用 5 件
inbox/stephen/2026-09-22-1004-news-tldr-ai.md ✓ 9-21 头条三件套净出声 net-new ⚠⚠⚠
inbox/stephen/2026-09-22-1004-news-bens-bites.md ✓ 首款 GPT-6 模型 net-new ⚠⚠
inbox/stephen/2026-09-22-1004-news-hf-blog.md ✓ 沿用 5 件
inbox/stephen/2026-09-22-1005-news-yt-anthropic.md ✓ 沿用 5 件
inbox/stephen/2026-09-22-1005-news-yt-deepmind.md ✓ 沿用 5 件
inbox/stephen/2026-09-22-1005-news-yt-openai.md ✓ 沿用 5 件
inbox/stephen/2026-09-22-1245-stephen-coordination-check-noon.md ★ 本棒关键承接 14 件主增量 + 跨实例对账 26 件 + M11 spark 主棒位缺位点名 ⚠⚠⚠ 第 2 日
inbox/stephen/2026-09-22-ai-industry-e1prep.md ★ 本棒关键承接 8 件 net-new + 12 沿用 + 5 矛盾 + frontier lab 治理公开化 net-new 三连
# jay (13 件)
inbox/jay/2026-09-22-engineering-e1prep.md ★ 本棒关键承接 5 件主增量(vLLM/SGLang/TRT-LLM 选型 + KernelPro + Uber 70% PR + KV Cache Runtime + IBM+Yale)
inbox/jay/2026-09-22-database-backend-cloudnative-inference.md ★ 本棒关键承接 11 件条目
inbox/jay/2026-09-22-1050-jay-engineering-filter.md ✓ 14 件 Tier1
inbox/jay/2026-09-22-1335-ai-engineering-systems-weekly.md ✓ DeepSeek V4.1-Flash CSA + HCA + OpenAI 模型突破沙盒 17,600 步 + Harness Engineering 框架成熟
inbox/jay/2026-09-22-1450-jay-engineering-filter.md ✓ H100 Prefix Reuse 与 TTFT 特征分析 ⭐⭐⭐⭐
inbox/jay/2026-09-22-1505-jay-five-category-evening-briefing.md ✓ 向量库 + Embedding
横向评测
inbox/jay/2026-09-22-1620-jay-csdn-tensorrt-rag-stack-substack.md ✓ PyTorch → TensorRT 部署 4 件
inbox/jay/2026-09-22-1735-jay-inference-vector-db-mcp-trending.md ✓ vLLM FP8 KV-Cache ⭐⭐⭐⭐⭐ + Dynamo + 向量库 + MCP
inbox/jay/2026-09-22-ai-engineering-weekly.md ✓ Uber + LLM Gateway + MCP 7 月
inbox/jay/2026-09-22T0820-jay-csdn-embedding-rerank-eval-highvalue.md ✓ IBM+Yale 2026 Agent 评测新范式 + Hybrid Search RRF
inbox/jay/2026-09-22-csdn-highvalue-ai-llm-rag-mlops.md ✓ 7 件
inbox/jay/2026-09-22-1140-news-x-tech-radar.md ✓ 12 账号干货候选
inbox/jay/2026-09-22-1000-rss-simon-willison.md ✓ Jev System One net-new ⚠⚠
inbox/jay/2026-09-22-1000-rss-raschka.md ✓ GPT-6 Astra + 循环 Transformer net-new ⚠⚠
inbox/jay/2026-09-22-1002-rss-cool-papers.md ✓ RecreationWorld + RetireOPD + Reflect-Revise-Reuse
inbox/jay/2026-09-22-1002-rss-cool-papers-ir.md ✓ JEPA-Anything + Fuse + Self-Evolving Index
inbox/jay/2026-09-22-1002-rss-lilian-weng.md ✓ Harness Engineering 沿用
inbox/jay/2026-09-22-1002-rss-nathan-benaich.md ✓ 欧洲 AI 主权 net-new ⚠⚠⚠ + Air Street 2.32 亿
inbox/jay/2026-09-22-1003-rss-import-ai.md ✓ Import AI 473「美国超级智能战略」net-new ⚠⚠⚠
inbox/jay/2026-09-22-1003-rss-msr-blog.md ✓ 沿用 5 件
inbox/jay/2026-09-22-1004-rss-yt-karpathy.md ✓ 沿用 5 件
# tom (8 件)
inbox/tom/2026-09-22-0900-hf-daily-2026-09-22.md ★ 本棒关键承接 15 件 HF Daily 早棒 + 立标池第 53 日立标池结构性洗牌六次确认预备触发 ⚠⚠⚠
inbox/tom/2026-09-22-rag-e1prep.md ★ 本棒关键承接 R98 + MoME + Gricea + CADWorld 3 件增量
inbox/tom/2026-09-22-agent-rag-longcontext-radar.md ✓ 8 候选 3 高价值(Designer-RSI + CADWorld + AI Agents Stack 2026)
inbox/tom/2026-09-22T1440-agent-rag-longcontext-radar.md ★ 本棒关键承接 Harness-Zero + GameHorizon + onPanda 3 高价值
inbox/tom/2026-09-22T2040-agent-rag-longcontext-radar.md ★ 本棒关键承接 D-RAC + Deep Persona + CARE 3 高价值
inbox/tom/2026-09-22_rag-lite.md ✓ 3 件 Substack + ICECET 2026 金融 RAG
inbox/tom/2026-09-22-evaluation-e1prep.md ✓ APort Vault paper_card 1444 ✓ + RiskChainBench + TeleAntiFraud 2.0
inbox/tom/2026-09-22-1005-rss-yt-yannic-kilcher.md ✓ 5 件 RSS 抓取沿用
# flyp (8 件)
inbox/flyp/2026-09-22-multimodal-e1prep.md ★ 本棒关键承接 第 53 日 8 件净增 + 立标池单日大规模跌出现象预备触发 ⚠⚠⚠ + multimodal 主分类单日净增 +400% 反弹
inbox/flyp/2026-09-22-0950-OmniVChat-IntBMoE-dual-critical-read.md ★ 本棒关键承接 flyp 轻量双精读 17.2KB(OmniVChat + IntBMoE 立标等级 ★★ ⚠)
inbox/flyp/2026-09-22-1550-FRAUDSkill-HEAL-dual-critical-read.md ★ 本棒关键承接 flyp 双论文双精读 18.2KB(FRAUDSkill + HEAL)
inbox/flyp/2026-09-22-risk-e1prep.md ★ 本棒关键承接 R81 evening 9-22 棒就绪 + 6 件 net-new + 7 件矛盾 C-new1-C-new7
inbox/flyp/2026-09-22-1001-rss-cameron-wolfe.md ✓ 沿用 5 件
inbox/flyp/2026-09-22-1002-rss-interconnects.md ✓ 沿用 5 件
inbox/flyp/2026-09-22-1004-rss-yt-two-minute-papers.md ✓ 沿用 5 件
inbox/flyp/2026-09-22-1005-rss-yt-ai-explained.md ✓ 沿用 5 件
# spark (5 件)
inbox/spark/2026-09-22-agent-e1prep.md ★ 本棒关键承接 v101 → v102 备料 + 4 件 net-new + 4 件延伸 + 1 件入库 + 立标池第 53 日承接稳态 + 直接回应 stephen 9-22 noon M11 ⚠⚠⚠ 第 2 日
inbox/spark/2026-09-22-llm-infra-e1prep.md ★ 本棒关键承接 v3.39 evening 升档棒 + 8 件主增量(IntBMoE + SiliconBench + vLLM FP8 KV-Cache + KV Cache Serving 矩阵 + DeepSeek V4.1-Flash CSA + HCA + OpenAI 模型突破沙盒 + H100 Prefix Reuse + Dynamo 1.0)
inbox/spark/2026-09-22-1002-rss-gradient-flow.md ✓ 沿用 5 件
inbox/spark/2026-09-22-1003-rss-chip-huyen.md ✓ 沿用 5 件
inbox/spark/2026-09-22-1005-rss-yt-3blue1brown.md ✓ 沿用 5 件
# paper_cards (9-22 入库 17 张净增 + 沿用)
organized/paper_cards/1439-2609-18766.md FRAUDSkill multimodal ✓
organized/paper_cards/1440-2609-15126.md MoME rag ✓
organized/paper_cards/1441-2609-09206.md HEAL multimodal ✓
organized/paper_cards/1442-2609-21346.md IntBMoE llm-infra ✓ 主分类
organized/paper_cards/1443-2609-21465.md OmniVChat multimodal ✓
organized/paper_cards/1444-2609-22076.md APort Vault agent ⚠⚠⚠
organized/paper_cards/1445-2609-20633.md Paint Refinement engineering
organized/paper_cards/1446-2609-21038.md Retention-Constrained engineering
organized/paper_cards/1447-2609-21094.md Geometry of Values risk ⚠⚠
organized/paper_cards/1448-2609-22086.md Designer-RSI agent
organized/paper_cards/1449-2609-22039.md Gricea rag
organized/paper_cards/1450-2609-25001.md GameHorizon Suite evaluation
organized/paper_cards/1451-2609-20886.md BI-Agent agent
organized/paper_cards/1452-2609-19315.md GAVEL agent
organized/paper_cards/1453-2609-16251.md CADWorld evaluation
organized/paper_cards/1454-2609-19169.md SiliconBench llm-infra ✓ 主分类
organized/paper_cards/1457-2609-24983.md onPanda agent
organized/paper_cards/1458-2609-24974.md Harness-Zero evaluation
organized/paper_cards/1459-2609-24432.md 1% of Tokens engineering
organized/paper_cards/1460-2609-24118.md CARE multimodal
organized/paper_cards/1461-2609-23863.md Grounded Action Model multimodal
organized/paper_cards/1462-2609-23088.md OmniEdu engineering
organized/paper_cards/1463-2609-22220.md Measuring the Checker evaluation
organized/paper_cards/989-2608-16628.md ⚠️ P0 矛盾 δ-mem 错配(实际是 Hypergraph-based Multimodal RAG)
organized/paper_cards/1438-2609-19122.md Training-Adaptive CSC engineering
# work-queue
organized/queue/work-queue.md (9-22 20:00 自动生成 · Top 15 = 8 件(无主分类 llm-infra)+ 待更新活文档 = 0 件 + 待写攻略 = 0 件 + 选题榜 = 2 件 = 2609.21346 + 2609.23863)
# 底本
organized/knowledge/llm-application.md (v100 · 综述骨架稳定 ≤80KB · arXiv 929+0=929 inline ID / CVE 24+0=24 / DOI 4+0=4 / URL 245+0=245 / paper_card 1438+25=1463 张 ⚠️ = +25 净增)
六、活文档接力棒备料建议
6.1 v101 net-new 主增量(沿用 v100 + 9-22 早棒位净增 8 件)
| # | 增量 | 建议归入节 |
|---|---|---|
| 1 | 立标池第 53 日立标池单日大规模跌出现象预备触发 ⚠️⚠️⚠️ 第 53 日(LimiX-2 升档极显著 → 跌出极显著 双连样本第 1 例 + 8-10 件同步跌出 vs 11 件新立标承接 + Atria Dawn 连续第五日跌出立标池 v33 以来最久跌出记录 ⚠⚠⚠) | v101 §X.X 立标池单日大规模跌出现象预备触发第 53 日节新增 + §X.X 立标池结构性洗牌六次确认预备触发节新增 + §X.X 立标池饱和度失衡信号六次确认节新增 + §3.2 #121 争议扩增预备候选 |
| 2 | IntBMoE arXiv:2609.21346 paper_card 1442 ✓ 高德 DreamX MoE 三维解耦新范式(主分类 llm-infra · 9-22 #4 90▲ multimodal 邻接级 + llm-infra 主分类双锚 · work-queue §3 选题榜 9-22 沿用预备级 · 立标等级 ★★ 待补 ablation ⚠) |
v101 §X.X IntBMoE 高德 DreamX MoE 三维解耦新范式节新增 + §X.X MoE 架构工程方法学节新增 + multimodal.md §X.X multimodal 邻接级 + llm-infra 主分类双锚节承接稳态 + §3.2 #121 争议候选预备新增 |
| 3 | APort Vault arXiv:2609.22076 paper_card 1444 ✓ 9-22 02:10 正式入库 ⚠⚠⚠(主分类 agent · 4,371 攻击 + 14 模型 + 5 独立事件 + OAP 规范 · RiskChainBench 沿用件套双栖预备级 = Agent 安全 benchmark 群预备触发) |
v101 §X.X APort Vault 支付授权安全 benchmark + OAP 规范双栖预备级节新增 + §X.X Agent 安全 benchmark 群预备触发体系节新增 + §X.X 评测方法学第五极"失败归因多维分解"预备级预备触发体系节新增 + 跨主轴锚入 risk.md §2.4 + §3.2 #124 + §3.3 Q100 |
| 4 | flyp 9-21 less-context-better-agents critical-read 17.2KB arXiv:2606.10209 Microsoft Dynamics 365 F&O ⚠⚠⚠(C4 91.6% vs Full Context 71.0% + token 节省 62.7% + 时长缩短 60.2% = "少即是多"反直觉数据 = Agent Memory 第五栖"少即是多压缩"预备级预备新增锚定实测触发预备级预备触发) |
v101 §X.X Memory 第五栖"少即是多压缩"预备级预备新增锚定实测触发预备级预备触发节新增 + §2.1 评测方法学延革节预备级预备新增锚定实测触发预备级预备触发第 6 例 + rag.md §2.5 Long Context vs RAG 节(Long Context 内部压缩范式)+ §3.2 #122 + §3.3 Q105.290 |
| 5 | Geometry of Values arXiv:2609.21094 paper_card 1447 ✓ risk 主分类唯一 9-22 新入库 ⚠⚠(12,000 实例二选一困境 + 三对价值冲突 + 四语翻译 · GPT-5-mini 跨五语 Honesty 偏好始终压倒 Autonomy = 跨语种价值偏好几何结构首次系统化) |
v101 §X.X Geometry of Values 价值偏好对齐 benchmark 节新增(立标延革预备第 90 例预备完整承接 ⚠⚠)+ rag.md §2.5 + evaluation.md §X.X 评测基线 22→23 维预备扩增预备级 + §3.2 #124 + §3.3 Q101 |
| 6 | FRAUDSkill arXiv:2609.18766 + HEAL arXiv:2609.09206 双论文双栖预备级 ⚠⚠(paper_card 1439 ✓ + paper_card 1441 ✓ + flyp 9-22 1550 dual critical-read 18.2KB · 评估方法学周主题 9+ 件饱和闭合预备触发的第 9 + 第 10 件) |
v101 §X.X FRAUDSkill 反诈骗音频 Skill 优化双栖预备实测触发节新增 + §X.X HEAL MLLM 幻觉机制学新方向节新增 + §X.X 评估方法学周主题 9+ 件饱和闭合预备触发的第 9 + 第 10 件节新增 + multimodal.md §2.39 + rag.md §2.11 |
| 7 | DeepSeek-V4.1-Flash 升档续立 #1 146▲ + 72h +89▲ 立标顶替 LimiX-2 立标位置制 ⚠⚠⚠(paper_card 1417 ✓ · multimodal 邻接级 + llm-infra 主分类双锚 · V4-Pro 1.6T / V4-Flash 284B / V3.2 Speciale 685B 产品矩阵 + CSA 4× + HCA 128× 双稀疏机制 + 1M context) | v101 §X.X DeepSeek-V4.1-Flash 立标延革预备第 91 例预备完整承接节新增 + multimodal.md §X.X multimodal 邻接级 + llm-infra 主分类双锚节承接稳态 + engineering.md §X.X DeepSeek V4.1-Flash CSA + HCA 双稀疏机制节承接稳态 + §3.2 #121 争议扩增预备 |
| 8 | JEPA-Anything arXiv:2609.20800 58▲ #9 + Video DeltaNet arXiv:2609.20744 34▲ #15 multimodal 主分类新立标承接第 53 日第 1 例 ⚠⚠⚠(立标池结构性洗牌五次确认预备触发后视频生成子轴预备实测触发 + AMI Labs 10 亿美元融资预备触发持续) |
v101 §X.X Video DeltaNet 9-22 #15 34▲ multimodal 主分类新立标承接第 53 日第 1 例节新增 ⚠⚠⚠ + multimodal.md §X.X JEPA-Anything 撞名 multimodal 预备级节沿用 v100 + 关键修正 + ml-foundations.md §世界模型 + JEPA 路线预备扩增预备级 |
6.2 v101 沿用稳态件套
v100 §1.1-§1.4 全部沿用 + v100 §3.2 #121 争议预备级预备新增锚定实测触发预备级预备触发 + v100 frontier lab 工程化生态沿用稳态 v98 + v100 KV Cache 基础设施化框架沿用稳态 v98 → v99 = 20 件预备扩增预备级稳态 + v100 §1.5 Memory 五向谱系预备扩增预备级承接稳态 ⚠⚠⚠ + v100 §1.5 准备升级为 v101 §X.X Memory 七向谱系预备扩增预备级承接稳态节 + v101 §X.X Memory 五栖预备触发体系节新增 ⚠⚠⚠(原 v100 §1.5 描述 Memory 五向谱系 = MemGPT 操作系统式 + Ensemble 集中式 + Agora 分布式不可变 DAG + Self-Evolving 自适应式 + δ-mem 关联记忆式 + v101 新增 = Memory 第七极 MoME arXiv:2609.15126 上下文感知 Memory 嵌入 + Memory 第五栖"少即是多压缩" flyp 9-21 critical-read 17.2KB = Agent Memory 五栖预备级预备触发体系 = ① 程序记忆 v101 + ② 训练时蒸馏 RetireOPD v100 + ③ 观察监督 ActObs 沿用 + ④ 自适应索引 Self-Evolving Index v100-v101 沿用 + ⑤ "少即是多"压缩 flyp 9-21 critical-read ⚠⚠⚠)) + v100 立标信号 26 件总集合续立预备扩增预备级 + v100 §3.1 #256 + §3.3 Q105.289 + §3.4 T247 沿用稳态 + v100 §1.4 frontier lab 治理公开化 23 → 25 源件套扩增稳态(OpenAI 9-20 澳大利亚青少年安全蓝图 + Plugin4Shell + Anthropic 9-22 26% R&D 占比 + Anthropic Institute 9-22 AI 节奏三指标 + OpenAI 9-22 数学与 AI 咨询组 + OpenAI 9-22 AI 下一阶段标准 + TLDR 9-21 头条三件套净出声 net-new 拐点 ⚠⚠⚠)
6.3 v101 evening 棒位前必须消化清单
- δ-mem arXiv 号错配 P0 ⚠⚠⚠ 第 3 日:沿用 tom 9-14 备查记录"Poria 团队 arXiv 编号未确认"待溯源,或将 δ-mem 替换为 paper_card 989 实际归属的 Hypergraph-based Multimodal RAG
- 立标池第 53 日立标池单日大规模跌出现象 + LimiX-2 真实终止 vs 算法降权核实 ⚠⚠⚠:沿用 stephen 9-22 noon §3.3 C1 + flyp 9-22 multimodal-e1prep §增量 1 + spark 9-22 agent-e1prep §M3
- 立标终止双连样本例序核实 ⚠⚠⚠(双连样本 #1 = 持续学习组合(9-20)+ ActionPiece(9-21);双连样本 #2 = LimiX-2(9-22)+ 6-9 件同步)
- OWASP ASI01-ASI10 完整编号核实窗口 ⚠⚠⚠ 第 3 日:沿用 spark 9-22 agent-e1prep §M1 + stephen 9-22 noon §三.4 C7
- AMI Labs 10 亿美元融资 LP 名单 + 投资方组合 + 估值 + 时间表核实 ⚠⚠:沿用 stephen 9-22 noon §3.3 C3 警示未撤
- 8-10 件立标同步跌出 vs 立标终止核实 ⚠⚠⚠:沿用 spark 9-22 agent-e1prep §M9
- IntBMoE 三维解耦 ablation 核实 + 横向 MoE 对比补强 ⚠⚠:沿用 spark 9-22 llm-infra-e1prep §三.矛盾/待核实 ①
- RiskChainBench Task 2 半闭源 + 完整可复现包尚未公开 + 立标池 9-22 跌出核实 P0 ⚠⚠⚠:沿用 spark 9-21 1337 agent-e1prep §增量 4 + flyp 9-21 0950 RiskChainBench critical-read + stephen 9-22 noon §3.3 C-new1
- DeepSeek-V4-Pro 1.6T / V4-Flash 284B / V3.2 Speciale 685B 产品矩阵与 arXiv:2609.19969 实际论文的命名层级一致性核实 ⚠⚠⚠:沿用 spark 9-22 llm-infra-e1prep §三.矛盾/待核实 ②
- APort Vault
arXiv:2609.22076Agent 支付授权基准 5 个独立事件的具体定义边界 + 4,371 次攻击具体类目分布 + OAP 规范 PDF 待核 P2 ⚠⚠:沿用 spark 9-22 agent-e1prep §增量 2 + flyp 9-22 risk-e1prep §三 C-new6 - Anthropic 治理公开化三连待溯源 + Anthropic Institute 命名核实 ⚠⚠⚠:沿用 stephen 9-22 noon §3.3 C5
- Spark 主棒位连续 2 日缺位第 2 日 + 立标终止核实 P0 ⚠⚠⚠:沿用 stephen 9-22 1245 noon 协调棒 §一.2 M11 + spark 9-22 13:30 agent-e1prep 主棒位补出
Stephen · E1 预消化 · llm-application · 2026-09-22 21:10 CST · 综述骨架稳定 ≤80KB · v100 → v101 备料 · 仅写入 /shared/research-kb/inbox/stephen/2026-09-22-llm-application-e1prep.md