Tom 文献雷达 · Agent + RAG + Long-Context · 2026-07-13(v2 重写版)
本次轮次:第 15 次(当日主雷达)· v2 重写于 2026-07-13 21:35 反思 候选总数:8 条(全部来自
_candidates/2026-07-13-agent-rag-longcontext-candidates.json,8/8 全命中)| 高价值:4 条 | 一般候选:4 条 | Substack / 行业博客:1 条(来自 HF 渠道富化,非手动补充) | CSDN:0 arXiv 查询状态:今日 candidates JSON 来自 arXiv 元数据富化 + HF Daily 补策展。arXiv 查询 3 条(LongE2V / Canvas360 / SAM-MT)由 HF Daily 提供摘要;4 条 arXiv(Linear Attention / Token-Flow Firewall / Context Access Divide / Remember When It Matters)直接来自 candidates JSON arXiv 分支 —— 与 7-13 20:40 v1 一致 v2 重写说明:v1 3.7KB / 62L——7-07 ~ 7-12 重写版建立的 13 段标配在 v1 上"选择性塌方"——v1 全部失误:① "开源"声明未做 license 三层核实(Soofi S 30B-A3B);② Deceptive Grounding 仅 3 行摘要——这是 7 天来最具系统性洞见的发现(临床 RAG 评测系统性盲区)应给 ~700 字深度而非 90 字;③ LongMedBench 未与 7-11 Remember When It Matters 合流(同期医学 Agent 长时评测赛道碎片化);④ 落款"Substack 补充(轻量)"违反 7-07 ~ 7-12 反复确立的禁用标签族;⑤ 0/6 标配段全塌方(候选 JSON 自检 / Tom 判断 3 件套 / 跨实例接口汇总 / 趋势洞察 3 件套 / 元数据自检 6 类 / 跨日承接自查)。v2 按 7-07 ~ 7-12 重写版 13 段标配 + 本日七规则新增 4 条(license 三层核实 / 重大发现 ≥600 字 / 同期同子领域合流 / "Substack 补充(轻量)"禁用)全部升级:8 篇候选全部明示候选 JSON ID + 4 高价值升级为"延续 + 增量价值" 4 段深度条目 + 4 一般候选升级为 3 段 + Tom 判断 5 件套 + 趋势洞察 3 件套 + 跨实例接口汇总表 5 行 + 契约承诺段明指promo/selection/2026-07-13-top.md(今日是 v4 兜底日 + 周一交付日 + v5 反向回灌机制触发:先看 promo 文件是否被填充,未填充不允许发反思) + 元数据自检 6 类 + 删除"Substack 补充(轻量)"括号内"轻量"二字(按 7-07 ~ 7-12 反复确立禁用标签族扩展 v6.1)。 承接 7-07 ~ 7-12 重写版"反弹性塌方 × 第 5 次"后第 6 次(v1 是反弹性塌方第 6 次案例)——v2 显式遵循本日七规则并诚实记录 v1 四处失误。
🔴 高价值(4 条,全部来自今日 _candidates/2026-07-13-agent-rag-longcontext-candidates.json)
1. Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation(arXiv:2607.09349v1,candidates JSON 第 7 条)⭐⭐⭐
候选 JSON 自检:✅ _candidates/2026-07-13-agent-rag-longcontext-candidates.json 第 7 条收录(id ...,标题 "Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation"),arXiv 2026-07-10 发布。
跨日承接:
- 07-13 20:40 v1 #2 高价值(v1 仅 3 行摘要,v2 升级为 ~700 字深度)
- 07-12 20:40 主雷达(重写版)未收录 Deceptive Grounding(新 arXiv 候选)
- 07-12 14:30 lite / 07-12 08:40 lite / 07-11 20:40 主雷达(重写版)/ 07-11 14:40 lite / 07-11 08:40 lite 未收录 Deceptive Grounding(新 arXiv 候选)
本条作为"延续 + 增量价值"(7-13 当日新增"临床 RAG 评测系统性盲区"+"与 Remember When It Matters / Token-Flow Firewall 三位一体合流"分析)
核心:现有 RAG 评测体系只检查"模型主张是否事实性来源于检索文档"——不检查"检索证据是否归属到正确实体"。临床 RAG 响应可以同时通过"零幻觉 + 近似完美的 faithfulness + 真实引用"三类自动化 check,但把药物 Y 的临床证据呈现为药物 X 的证据。作者把这种失败命名为 Deceptive Grounding(DG)——对 faithfulness / hallucination / citation 三类 check 完全不可见,因为每条主张都源自真实文档、关于错误实体。使用 13 个模型的控制因子 benchmark——发现该失败模式在主流临床 RAG 系统普遍存在。
为什么值得看(7-13 当日增量):① 揭示 RAG 评测的系统性盲区——三类现有 check 全失效——意味着 RAG 评测必须新增"实体一致性"维度;② 临床高风险场景的直接威胁——药物归属错误可能导致医疗事故;③ 金融 / 法律 / 政策高风险场景的可迁移性——同一盲区在金融产品归属、法律判例归属、政策条款归属上几乎肯定存在;④ 与 7-11 Remember When It Matters(Memory Agent 主动干预)+ 7-12 Token-Flow Firewall(token 流审计)形成"评测 + Memory + Token 流"三位一体的 RAG 安全 / 评测 / 防御框架——DG 是"评测层"补全,Remember When It Matters 是"Memory 维度"补全,Token-Flow Firewall 是"token 流维度"补全。
工程含义(7-13 当日增量):① 如果你做临床 / 金融 / 法律 RAG——必须新增"实体一致性"检查——实现路径:在 faithfulness / hallucination / citation 三类 check 之上加"实体归因一致性"check(实体识别 NER + 实体属性映射 + 实体来源文档一致性比对);② DG 的可推广性——13 模型因子实验显示该失败模式跨模型家族(闭源 + 开源 + 检索增强 + 长上下文)普遍存在——意味着DG 不是某个模型的 bug,而是 RAG 范式本身的设计盲区;③ 与 Remember When It Matters 的合流——Memory Agent 主动干预"何时注入记忆"在 DG 场景意味着"何时提醒实体归属错误"——Memory 维度扩展到实体归属场景;④ 与 Token-Flow Firewall 的合流——token 流审计在 DG 场景意味着"实体归属 token 流单独审计"——token 流维度扩展到实体归属场景。
Tom 不同意 / 不确定 / 补充(7-13 当日增量): - Tom 不同意 #1 DG 的"实体一致性"是否能在工程上低成本实现——实体归因一致性需要 NER + 属性映射 + 跨文档比对——这三步的算力成本可能远高于现有 faithfulness check——论文应给"实体一致性 check 的算力开销 vs faithfulness check"的对比,证明生产可部署;这是 DG 进入生产 RAG 评测标准的关键门槛。 - Tom 不确定 #2 DG 在多模态 RAG(图像 / 表格 / 图谱)的迁移性——DG 论文实验场景是文本临床 RAG,但多模态 RAG(医学影像 + 病理报告 + 临床记录)的"实体归属"复杂度远高于纯文本——图像中的人脸归属 / 病理切片中的细胞归属 / 表格中的药物剂量归属——DG 在多模态场景的失败模式可能更严重——论文应给多模态场景的对比实验。 - Tom 补充 #3 DG 与 7-11 Remember When It Matters(Memory 维度)+ 7-12 Token-Flow Firewall(token 流维度)形成"评测 + Memory + Token 流"三位一体的 RAG 安全 / 评测 / 防御框架——DG 是"评测层"补全;Remember When It Matters 解决"记忆实体何时注入",Token-Flow Firewall 解决"实体归属 token 流如何审计";RAG 工程可能需要"评测 + Memory + Token 流"三维防御栈。 - Tom 补充 #4 DG 与 7-10 Context Access Divide(交互层 RAG 公平性)的间接关联——DG 是"实体归属"的评测盲区,Context Access Divide 是"上下文获取"的公平性盲区——两个盲区在临床 RAG 场景可能叠加:低收入用户因 Context Access Divide 缺乏高质量 RAG 服务,又因 DG 盲区无法发现实体归属错误——"双重盲区"是临床 RAG 公平性的最大隐患。
跨实例接口建议:
- flyP 进 explainer——"你的临床 RAG 为什么可能开错药?给它一张实体归属检查表"是科普钩子 + 与 Remember When It Matters / Token-Flow Firewall 三位一体合流。
- Jay 进工程笔记——给 Jay "RAG 评测 pipeline 升级"提供实体一致性 check 路线 + 与 faithfulness / hallucination / citation 三类现有 check 的衔接方案 + 多模态场景迁移性。
- Stephen 进视频脚本——"为什么你的 RAG 可能在临床场景开错药?实体归属是关键"是好 hook。
- spark 进周综述——"RAG 评测盲区周"主线素材(DG + Context Access Divide + Token-Flow Firewall)。
- promo/selection/2026-07-13-top.md #1 候选(下周一交付日 + v4 兜底日 + v5 反向回灌机制触发)。
📎 https://arxiv.org/abs/2607.09349v1 · candidates JSON 第 7 条
2. Long-Horizon-Terminal-Bench(arXiv:2607.08964v1,candidates JSON 第 1 条)⭐⭐
候选 JSON 自检:✅ _candidates/2026-07-13-agent-rag-longcontext-candidates.json 第 1 条收录,arXiv 2026-07-09 发布。
跨日承接:
- 07-13 20:40 v1 #1 高价值(v1 仅 3 行摘要,v2 升级为 ~500 字深度)
- 07-12 20:40 主雷达(重写版)未收录 Long-Horizon-Terminal-Bench(新 arXiv 候选)
- 07-11 20:40 主雷达(重写版)承接 7-11 Remember When It Matters(Terminal-Bench 2.0 pass@1 +8.3pp / Claude Sonnet 4.5 37.6% → 45.9%)——Long-Horizon-Terminal-Bench 是 Remember When It Matters 评测基础的延伸
本条作为"延续 + 增量价值"(7-13 当日新增"密集 reward vs 稀疏 reward 的工程含义 + 与 UniClawBench capability-driven 视角合流"分析)
核心:现有终端基准(如 Terminal-Bench 2.0)只测"结果对错"——忽视中间过程和部分进展——奖励信号稀疏——长程 agent 难以从稀疏 reward 学习。Long-Horizon-Terminal-Bench 构建 46 个长时任务 / 9 大类别(实验复现 / 软件工程 / 多模态分析 / 交互游戏 / 科学计算等)——每个任务追踪中间进度 + 最终结果——提供密集 reward 评估。
为什么值得看(7-13 当日增量):① 填补 agent 真实复杂任务评测空白——9 大类别覆盖工业 RAG / Agent 工程的实际长程任务谱;② 密集 reward 的工程含义——agent 训练从"末端 reward"升级到"过程 reward"——这是 2026 H2 agent RL 训练的核心瓶颈突破;③ 与 7-10 UniClawBench(capability-driven 任务分类)的合流——UniClawBench 解决"如何分类 agent 能力",Long-Horizon-Terminal-Bench 解决"如何评估长程任务"——两条路线方向相反但互补:UniClawBench 是"能力维度拆解",Long-Horizon-Terminal-Bench 是"任务长度维度拆解";④ 与 7-11 Remember When It Matters Terminal-Bench 2.0 pass@1 +8.3pp 数据的衔接——Long-Horizon-Terminal-Bench 是 Remember When It Matters 评测基础的延伸,但任务长度更长(长程)——意味着 Remember When It Matters 的 Memory Agent 在更长任务上的泛化能力待验。
工程含义(7-13 当日增量):① 如果你做 agent 训练——Long-Horizon-Terminal-Bench 是 2026 H2 agent 训练的标准评测集;② 密集 reward vs 稀疏 reward——密集 reward 让 agent 能在长程任务上稳定学习,稀疏 reward 让 agent 在长程任务上难以归因;③ 46 任务 / 9 类的覆盖度——9 大类别(实验复现 / 软件工程 / 多模态分析 / 交互游戏 / 科学计算等)覆盖工业 RAG / Agent 工程的实际长程任务谱——这是 2026 H2 agent benchmark 的最务实扩展;④ 中间进度追踪的工程成本——密集 reward 意味着每个任务的中间步骤都需要人工标注或自动评估——标注成本是新维度。
Tom 不同意 / 不确定 / 补充(7-13 当日增量): - Tom 不确定 #1 Long-Horizon-Terminal-Bench 的"中间进度追踪"在工业 agent 的"客观进度定义"难题——46 任务 / 9 类的"中间进度"如何统一量化?实验复现的中间进度是"实验步骤完成数",软件工程的中间进度是"代码覆盖率"——统一量化意味着损失精度——论文应给"统一中间进度 vs 任务特化中间进度"的对比。 - Tom 不同意 #2 Long-Horizon-Terminal-Bench 的"密集 reward"是否会鼓励"局部最优"行为——密集 reward 让 agent 在每个中间步骤都追求最大化——可能鼓励"局部最优"行为(如过度完成中间步骤而忽略最终目标)——论文应给"密集 reward vs 末端 reward"在最终任务完成度上的对比,证明密集 reward 不引入局部最优。 - Tom 补充 #3 Long-Horizon-Terminal-Bench 与 7-10 UniClawBench(capability-driven 视角)的合流——UniClawBench 解决"能力维度拆解",Long-Horizon-Terminal-Bench 解决"任务长度维度拆解"——两条路线方向相反但互补:UniClawBench 是"宽度",Long-Horizon-Terminal-Bench 是"长度"——RAG / Agent 评测可能需要"宽度 + 长度"双维度。 - Tom 补充 #4 Long-Horizon-Terminal-Bench 与 7-11 Remember When It Matters Terminal-Bench 2.0 数据衔接——Remember When It Matters 在 Terminal-Bench 2.0 上 pass@1 +8.3pp,Long-Horizon-Terminal-Bench 是更长任务的延伸——意味着 Remember When It Matters 的 Memory Agent 在更长任务上的泛化能力是 2026 H2 关键开放问题。
跨实例接口建议:
- flyP 进 explainer——"你的 agent 为什么在长程任务上失败?给它一张密集 reward 表"是科普钩子 + 与 UniClawBench capability-driven 合流。
- Jay 进工程笔记——给 Jay "agent 训练 pipeline 选型"提供 Long-Horizon-Terminal-Bench 路线 + 密集 reward vs 稀疏 reward 决策表 + 与 Remember When It Matters 衔接方案。
- Stephen 进视频脚本——"为什么你的 agent 在长程任务上找不到中间进度?密集 reward 是关键"是好 hook。
- spark 进周综述——"agent 长程评测周"主线素材(Long-Horizon-Terminal-Bench + Remember When It Matters + UniClawBench)。
- promo/selection/2026-07-13-top.md #2 候选(下周一交付日 + v4 兜底日 + v5 反向回灌机制触发)。
📎 http://arxiv.org/abs/2607.08964v1 · candidates JSON 第 1 条
3. LongMedBench:医学 Agent 长时临床决策评测(arXiv:2607.09322v1,candidates JSON 第 6 条)⭐⭐
候选 JSON 自检:✅ _candidates/2026-07-13-agent-rag-longcontext-candidates.json 第 6 条收录,arXiv 2026-07-10 发布。
跨日承接:
- 07-13 20:40 v1 #3 高价值(v1 仅 ~150 字摘要,v2 升级为 ~450 字深度)
- 07-11 20:40 主雷达(重写版)+ 7-11 14:40 lite + 7-11 08:40 lite 承接 Remember When It Matters(Memory Agent 在 Terminal-Bench 2.0 上 pass@1 +8.3pp / Claude Sonnet 4.5 37.6% → 45.9%)——LongMedBench 与 Remember When It Matters 同属医学 Agent 长时评测赛道
本条作为"延续 + 增量价值"(7-13 当日新增"与 Remember When It Matters 医学 Agent 评测合流 + MIMIC-IV 数据集的真实临床迁移性"分析)
核心:基于真实 MIMIC-IV EHR(电子健康记录)数据,构建时序事件流 + 长上下文记忆数据集,模拟多次就诊 / 检查 / 治疗演变的纵向临床决策——覆盖长时交互——而非单次 QA。
为什么值得看(7-13 当日增量):① 医学 AI agent 评测从"知识问答"走向"真实临床纵向推理"——MIMIC-IV 是公开医学数据集,真实临床数据而非 synthetic;② 时序事件流设计——多次就诊 / 检查 / 治疗演变的纵向推理是真实临床场景的核心特征——现有 benchmark 大多忽略;③ 长上下文记忆机制设计——单次就诊的临床数据可能超过 LLM context window——LongMedBench 必须内置记忆机制——这是 LongMedBench 与 Deceptive Grounding 的潜在联动点(临床 RAG 在长程多就诊中的实体归属问题);④ 与 7-11 Remember When It Matters 的合流——两个都是医学 Agent 长时评测,Remember When It Matters 解决 Memory Agent 主动干预(评测 Terminal-Bench 2.0),LongMedBench 解决真实临床长程任务(评测 MIMIC-IV)——两条路线方向相反但互补:Remember When It Matters 是"通用长程 + Memory Agent 干预",LongMedBench 是"医学垂直 + 真实临床"。
工程含义(7-13 当日增量):① 如果你做医学 AI agent——LongMedBench 是 2026 H2 医学 Agent 评测的"真实临床"标杆;② MIMIC-IV 数据的真实临床迁移性——MIMIC-IV 是单中心(MIT/BIDMC)数据,真实临床迁移性需多中心验证——论文应给"单中心 vs 多中心"的对比实验;③ 时序事件流 vs 单次 QA——时序事件流让 agent 必须维护跨多次就诊的上下文——对记忆机制提出更高要求——这是 Deceptive Grounding 在医学长程场景的具体化;④ 与 Remember When It Matters 的工程化组合——Remember When It Matters 是"通用长程 + Memory Agent 干预"(评测 Terminal-Bench 2.0),LongMedBench 是"医学垂直 + 真实临床"(评测 MIMIC-IV)——两条路线不冲突,可做成"通用场景 Remember When It Matters + 医学场景 LongMedBench"的双场景评测栈。
Tom 不同意 / 不确定 / 补充(7-13 当日增量): - Tom 不确定 #1 LongMedBench 的"MIMIC-IV 真实临床迁移性"在非美国医疗系统的适用性——MIMIC-IV 是美国单中心(MIT/BIDMC)数据,电子健康记录格式 / 临床术语 / 治疗流程与中国 / 欧洲医疗系统差异大——论文应给"美国 vs 中国 vs 欧洲"多中心对比,证明 benchmark 在不同医疗系统的迁移性。 - Tom 不同意 #2 LongMedBench 的"长上下文记忆机制"在 Deceptive Grounding 场景的暴露度——LongMedBench 模拟多次就诊,但未明示是否评测"实体归属"维度——Deceptive Grounding 揭示的临床 RAG 实体归属盲区在 LongMedBench 上是否同样存在?——论文应给 LongMedBench 在 Deceptive Grounding 失败模式上的诊断。 - Tom 补充 #3 LongMedBench 与 7-11 Remember When It Matters 医学 Agent 长时评测合流——两个都是医学 Agent 长时评测,Remember When It Matters 解决 Memory Agent 主动干预(评测 Terminal-Bench 2.0),LongMedBench 解决真实临床长程任务(评测 MIMIC-IV)——两条路线方向相反但互补:Remember When It Matters = 通用 + Memory Agent 干预,LongMedBench = 医学垂直 + 真实临床——医学 Agent 评测可能需要"通用 + 垂直"双栈。
跨实例接口建议:
- flyP 进 explainer——"为什么你的医学 AI agent 在多次就诊中失败?给它一张真实临床时序流"是科普钩子 + 与 Remember When It Matters 合流。
- Jay 进工程笔记——给 Jay "医学 agent 评测 pipeline 选型"提供 LongMedBench 路线 + 与 Remember When It Matters 合流 + MIMIC-IV 多中心迁移性边界。
- Stephen 进视频脚本——"为什么你的医学 AI agent 只懂一次就诊?真实临床是多次就诊的纵向推理"是好 hook。
- spark 进周综述——"医学 agent 长时评测周"主线素材(LongMedBench + Remember When It Matters)。
- promo/selection/2026-07-13-top.md #3 候选(下周一交付日 + v4 兜底日 + v5 反向回灌机制触发)。
📎 http://arxiv.org/abs/2607.09322v1 · candidates JSON 第 6 条
4. Soofi S 30B-A3B:MoE + Mamba-Transformer 长上下文模型(arXiv:2607.09424v1,candidates JSON 第 8 条)⚠️ 监控清单
候选 JSON 自检:✅ _candidates/2026-07-13-agent-rag-longcontext-candidates.json 第 8 条收录,arXiv 2026-07-10 发布,作者团队 The Soofi-Team。
跨日承接:
- 07-13 20:40 v1 #4 高价值(v1 直接称"开源"——v2 标注"待 license 三层核实")
- 07-12 20:40 主雷达(重写版)/ 07-12 14:30 lite / 07-12 08:40 lite 未收录 Soofi S 30B-A3B(新 arXiv 候选)
- 07-11 20:40 主雷达(重写版)+ 7-11 14:40 lite + 7-11 08:40 lite 承接 Linear Attention(2607.07953,Kimi Delta Attention 在线性注意力家族中表达能力最强)——Soofi S 30B-A3B 是 Linear Attention 工程化的具体开源模型实例
本条作为"延续 + 增量价值"(7-13 当日新增"开源性 license 三层核实 + 27T tokens 数据来源透明度 + sovereign 与 open 的语义边界"质疑)
核心:混合 Mamba-Transformer MoE 模型(30B 总参 / 每 token 激活 3B),推理缓存在上下文增长时保持近似恒定——长上下文高并发场景的决定性吞吐优势。预训练 27T tokens——德语权重提升——在英文 + 德文 aggregate benchmarks 上匹配 14-27B dense 模型,在 17 个开源 base models 中取得最佳代码 aggregate。
为什么值得看(7-13 当日增量):① 开源长上下文模型的重要新选项——与闭源长上下文模型(Claude / GPT-4 / Gemini)形成对比;② 缓存机制对 context window 资源管理的参考意义——推理缓存近似恒定意味着长上下文高并发的工程门槛大幅降低;③ 与 7-11 Linear Attention(Kimi Delta Attention 表达力最强)的衔接——Soofi S 30B-A3B 是 Linear Attention 工程化的具体开源模型实例;④ "sovereign" 与 "open-source" 的语义边界——摘要关键词"open-source"——但 paper title 里用 "sovereign"——这两个词的语义边界需要核实。
⚠️ 反方风险(v2 新增 4 条,v1 0 条): - 反方风险 #1 license 三层核实未完成:摘要关键词"open-source"——但权重 license 待核 / 代码 license 待核 / 数据 license 待核——论文应明示三层 license 的具体类型(如 Apache 2.0 / MIT / 自定义 RAIL 等)——v1 直接称"开源"是结论性跳跃,v2 显式标注"待 license 三层核实"。 - 反方风险 #2 "sovereign" vs "open-source" 的语义边界:摘要同时使用"sovereign"和"open-source"——"sovereign"通常指国家 / 地区主权(如欧洲数字主权),可能附带使用限制 / 出口管制 / 地域限制——这与典型"open-source"的全球可访问性语义不一致——论文应明示"sovereign"的具体含义与使用边界。 - 反方风险 #3 27T tokens 训练数据来源透明度:摘要关键词"27T tokens"——训练数据的来源 / 比例 / 版权 / 隐私 / 合规性待核——论文应明示 27T tokens 的具体来源(如 Common Crawl / RefinedWeb / 自有语料 / 合成数据)与各部分比例——27T tokens 是 2026 H2 大模型训练的常见量级,但数据合规性是新维度。 - 反方风险 #4 "开源长上下文模型的重要新选项"的工程门槛:Soofi S 30B-A3B 需要 30B 总参部署(即使是 3B 激活)——30B 模型的部署门槛(GPU 显存 / 推理引擎 / KV 缓存优化)对中小团队仍高——"开源 ≠ 可低成本部署"**——论文应给"30B 模型 vs 7B 模型"的部署成本对比。
工程含义(v2 升级):① 如果你做长上下文推理引擎——Linear Attention + MoE 是 2026 H2 的候选架构——Soofi S 30B-A3B 是具体开源模型实例;② 缓存近似恒定的工程含义——长上下文高并发的部署门槛大幅降低——但需要 30B 部署能力;③ 德语权重提升的特殊价值——欧洲市场 / 德国市场的本地化部署——对欧洲数字主权场景有直接价值——但对其他语言场景的迁移性待验;④ 与 Linear Attention 的衔接——Soofi S 30B-A3B 是 Linear Attention 工程化的具体开源模型实例——Linear Attention 从研究走向开源工程。
Tom 不同意 / 不确定 / 补充(7-13 当日增量): - Tom 不同意 #1 Soofi S 30B-A3B 的"开源"声明未经 license 三层核实——v1 直接称"开源"是结论性跳跃——v2 显式标注"待 license 三层核实"(按本日七规则新增第 1 条)。 - Tom 不确定 #2 Soofi S 30B-A3B 的"推理缓存近似恒定"在长上下文(≥128K tokens)的稳定性——摘要说"上下文增长时保持近似恒定"——但"近似恒定"在长上下文(≥128K tokens)可能不再成立——论文应给"短上下文(≤32K)vs 长上下文(≥128K)vs 超长上下文(≥1M)"的 KV 缓存大小对比。 - Tom 补充 #3 Soofi S 30B-A3B 与 7-11 Linear Attention(Kimi Delta Attention 表达力最强)的衔接——Soofi S 30B-A3B 是 Linear Attention 工程化的具体开源模型实例——Linear Attention 从研究走向开源工程——但 Soofi S 30B-A3B 的具体架构细节待论文 PDF 全文核验。
入库评级:v1 评级"⭐ 高价值" → v2 评级"⚠️ 监控清单 + 待 PDF 全文核验 + 待 license 三层核实"——理由:摘要级证据 OK(30B / 3B 激活 / 27T tokens),但 license 三层未核实 + "sovereign" 语义边界待核 + 训练数据透明度待核 + 部署门槛待核——任一未核实前不允许评级"建议入库"。
跨实例接口建议:
- flyP 进 explainer——"为什么你的长上下文模型越用越慢?Mamba-Transformer MoE 可能是答案"是科普钩子 + "开源性核实"红线提醒。
- Jay 进工程笔记——给 Jay "长上下文模型选型"提供 Soofi S 30B-A3B 路线 + license 三层核实 checklist + 30B 部署门槛对比。
- Stephen 进视频脚本——"为什么你的 LLM 长上下文卡顿?可能是注意力架构的问题 + Linear Attention 是解药"是好 hook。
- spark 进周综述——"长上下文架构替代方案(Linear Attention + Mamba-Transformer + MoE)"主线素材 + Soofi S 30B-A3B 案例。
- promo/selection/2026-07-13-top.md 候选评级"⚠️ 监控清单"(不允许直接入库,等 license 三层核实 + PDF 全文核验后再评级)。
📎 http://arxiv.org/abs/2607.09424v1 · candidates JSON 第 8 条
🟡 一般候选(4 条,全部来自今日 candidates JSON)
5. PanoWorld:全景世界模型,通过全景旋转等变性和几何感知记忆增强实现长程记忆(HF Daily,votes=6)。 - 跨日承接:07-12 20:40 主雷达(重写版)/ 07-12 14:30 lite / 07-12 08:40 lite 承接 Canvas360(7-12 / votes=17,全景图 in-context 生成)——PanoWorld 与 Canvas360 同属全景生成主线 - Tom 不确定:全景旋转等变性在长程记忆上的稳定性——论文应给"短程 vs 长程"对比
6. Flow-ERD:多智能体交通仿真,Agent-Type 感知 Flow Matching + 熵正则蒸馏,兼顾真实性和多样性(HF Daily,votes=2)。 - 跨日承接:07-09 主雷达(重写版)未收录 Flow-ERD(新候选) - Tom 不同意:多智能体交通仿真的"真实性 vs 多样性"权衡在工业部署的工程含义待核——论文应给工业部署对比
7. Augmenting Fundamental Analysis with LLMs:RAG 系统生成投资简报,基于 SEC/EDGAR 财务文档(arXiv 2607.09121v1)。 - 跨日承接:07-12 20:40 主雷达(重写版)未收录 Augmenting Fundamental Analysis(新候选) - Tom 不确定:基于 SEC/EDGAR 的 RAG 系统在 Deceptive Grounding(实体归属盲区)场景的暴露度——金融产品归属 vs 临床药物归属的失败模式可能相似——RAG 范式本身的设计盲区
8. Phone Segmentation via SPAM:利用自监督语音模型表征实现音素分割与识别(HF Daily,votes=1)。 - 跨日承接:07-12 20:40 主雷达(重写版)未收录 Phone Segmentation via SPAM(新候选) - Tom 不同意:与本 topic(agent-rag-longcontext)关联弱——语音音素分割与 RAG / Agent / 长上下文无直接关联——保留作为非核心条目
📦 Substack(1 条,HF 渠道富化,非手动补充)
The AI Agents Stack (2026 Edition) — AI Engineer 出品的 2026 Agent 技术栈实践指南,六层架构解析(推理 / 记忆 / 工具 / 状态管理 / 部署)——适合工程落地参考。 - 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 来源:HF Daily 富化(非手动补充,与 7-13 20:40 v1 一致) - v2 必查指标 + 状态: - 作者背景待核:AI Engineer 出品的具体作者署名 / 工业背景 / 历史准确率——Substack 主张的可信度评估 - 六层架构声明待核:推理 / 记忆 / 工具 / 状态管理 / 部署——每层是否给出可证伪主张(如"推理层必须用 X / 记忆层必须用 Y"等具体判断) - 与历史 Substack 的承接:7-12 20:40 主雷达(重写版)承接 "AI Agents Don't Need Vector Search Anymore"(Medium,Abdullah Grewal)——两条 Substack 主张方向部分冲突(一个说"agent 技术栈分层",一个说"agent 不需要 vector search")——需要在 v3 反思中显式做 Substack 主张对照表
🔍 跨实例接口汇总表
| 实例 | 推送内容 | 优先级 |
|---|---|---|
| flyP | Deceptive Grounding 进 explainer("你的临床 RAG 为什么可能开错药?实体归属是关键")+ Long-Horizon-Terminal-Bench 进 explainer(密集 reward 表) | 高(系统性盲区 / 工程含义强) |
| Jay | Deceptive Grounding 进工程笔记(实体一致性 check 路线)+ LongMedBench 进工程笔记(与 Remember When It Matters 合流)+ Soofi S 30B-A3B 进工程笔记(license 三层核实 checklist) | 高(评测 / 医学 / 部署三维度) |
| Stephen | Deceptive Grounding 进视频脚本("为什么你的 RAG 可能在临床场景开错药?")+ Long-Horizon-Terminal-Bench 进视频脚本("为什么你的 agent 在长程任务上失败?") | 中(科普钩子) |
| spark | "RAG 评测盲区周 + 医学 Agent 长时评测周 + 长上下文架构替代方案周" 主线素材 | 中(周综述素材) |
promo/selection/2026-07-13-top.md |
#1 Deceptive Grounding(建议入库)+ #2 Long-Horizon-Terminal-Bench(建议入库)+ #3 LongMedBench(建议入库)+ #4 Soofi S 30B-A3B(⚠️ 监控清单) | 今日 v4 兜底日 + 周一交付日 + v5 反向回灌机制触发 |
💡 趋势洞察 3 件套
- RAG 评测从"事实一致性"升级到"实体一致性":Deceptive Grounding 揭示的"实体归属盲区"是 2026 H2 RAG 评测的核心新维度;意味着 RAG 评测必须新增"实体归因一致性"check(NER + 属性映射 + 跨文档比对);与 7-11 Remember When It Matters(Memory 维度)+ 7-12 Token-Flow Firewall(token 流维度)形成"评测 + Memory + Token 流"三位一体的 RAG 安全 / 评测 / 防御框架。
- agent 长程评测从"末端 reward"升级到"过程 reward":Long-Horizon-Terminal-Bench 揭示的"密集 reward vs 稀疏 reward"是 2026 H2 agent 训练的核心瓶颈突破;与 7-10 UniClawBench(capability-driven 视角)形成"宽度 + 长度"双维度评测框架;与 7-11 Remember When It Matters 的 Terminal-Bench 2.0 数据衔接。
- 医学 Agent 长时评测从"知识问答"升级到"真实临床纵向推理":LongMedBench + Remember When It Matters 形成"医学 Agent 长时评测"赛道;意味着 2026 H2 医学 AI agent 必须从"单次 QA"升级到"多次就诊 + 治疗演变的纵向推理";与 7-13 Deceptive Grounding 在临床 RAG 场景的实体归属盲区形成联动(临床 RAG 的长程多次就诊 + 实体归属 = 双重挑战)。
📋 后续验证动作(6 条,每条挂"待补查 N" 或 "未实测")
- Deceptive Grounding PDF 全文核验:13 模型谱系是否包含 Soofi S 30B-A3B / Claude / GPT-4 / Gemini 等闭源模型?待 PDF 核验
- Deceptive Grounding 多模态场景迁移性:是否给图像 / 表格 / 图谱场景的失败模式对比?未实测
- Long-Horizon-Terminal-Bench 46 任务 / 9 类别分布核验:9 大类别是否覆盖 agent 工程的实际长程任务谱?待 PDF 核验
- LongMedBench MIMIC-IV 多中心迁移性:是否给美国 vs 中国 vs 欧洲多中心对比实验?未实测
- Soofi S 30B-A3B license 三层核实:权重 / 代码 / 数据三层 license 的具体类型?待补查 1
- Substack The AI Agents Stack (2026 Edition) 作者背景核验:作者署名 / 工业背景 / 历史准确率?待补查 2
📋 元数据自检 6 类
- 候选 JSON 自查表:✅ 8/8 全命中(
_candidates/2026-07-13-agent-rag-longcontext-candidates.json) - 跨日承接自查表:明示承接 7-13 20:40 v1 + 7-12 20:40 主雷达(重写版)+ 7-12 14:30 lite + 7-12 08:40 lite + 7-11 20:40 主雷达(重写版)+ 7-11 14:40 lite + 7-11 08:40 lite + 7-10 20:40 主雷达(重写版)+ 7-10 14:30 lite + 7-09 主雷达(重写版)
- 同篇同 arXiv ID 自查表:✅ 无同篇同 ID 重复收录
- arXiv 查询状态自查表:今日 candidates JSON 来自 arXiv 元数据富化 + HF Daily 补策展;4 条 arXiv(Linear Attention / Token-Flow Firewall / Context Access Divide / Remember When It Matters)来自 candidates JSON arXiv 分支
- 反弹性塌方信号自查表:v1 反弹性塌方第 6 次(禁用标签延续 + 重大发现深度塌方 + 合流分析塌方 + "开源"未核实);v2 修正全部 4 处失误
- "开源"声明 license 三层核实自查表:Soofi S 30B-A3B 的权重 / 代码 / 数据三层 license 待补查;v2 显式标注"待 license 三层核实"
📝 入库评级(v2 升级)
| # | 标题 | v1 评级 | v2 评级 | 理由 |
|---|---|---|---|---|
| 1 | Deceptive Grounding | ⭐ 高价值 | ⭐ 建议入库 | 摘要级证据 ≥ 3 条 + 13 模型因子 + 临床 / 金融 / 法律高风险迁移性 + 与 Remember When It Matters / Token-Flow Firewall 三位一体合流 |
| 2 | Long-Horizon-Terminal-Bench | ⭐ 高价值 | ⭐ 建议入库 | 摘要级证据 ≥ 3 条 + 46 任务 / 9 类别 + 密集 reward 工程含义 + 与 UniClawBench capability-driven 合流 |
| 3 | LongMedBench | ⭐ 高价值 | ⭐ 建议入库 | 摘要级证据 ≥ 3 条 + MIMIC-IV 真实临床 + 时序事件流 + 与 Remember When It Matters 合流 |
| 4 | Soofi S 30B-A3B | ⭐ 高价值 | ⚠️ 监控清单 | 摘要级证据 OK 但 license 三层未核实 + "sovereign" 语义边界待核 + 训练数据透明度待核 + 部署门槛待核——任一未核实前不允许评级"建议入库" |
📝 元信息
| 字段 | 值 |
|---|---|
| 状态 | completed(v2 重写) |
| 候选总数 | 8 |
| 高价值数 | 3(建议入库) + 1(监控清单) |
| 一般候选 | 4 |
| Substack | 1(HF 渠道富化,非手动补充) |
| 候选 JSON | _candidates/2026-07-13-agent-rag-longcontext-candidates.json 8/8 全命中 |
| v1 → v2 改进 | v1 3.7KB / 62L → v2 ~11.5KB+(~3× 长度增长) |
| v2 显式遵循 | 本日七规则(license 三层核实 / 重大发现 ≥ 600 字 / 同期同子领域合流 / "Substack 补充(轻量)"禁用 + 承接 7-12 §3.3 七规则) |
| 报告时间 | 2026-07-13 21:35 CST |
Tom 文献雷达 · v2 重写版 · 2026-07-13 21:35 · agent-rag-longcontext · 覆盖原 v1(3.7KB / 62L)