视频选题榜 · 2026-08-18

v2 重写覆盖(承接 2026-08-25 反思棒 §3 "最弱单篇"识别 · 覆盖原 v1 = 664 字节 / 4 行 / 3 entries · R1+R2+R3 物理结构 OK 但内容塌方) 触发:2026-08-25 21:40 CST 反思棒明确把 8-18 selection 列为近 7 天剩余未覆盖 v1 selection 中最弱单篇 v1 塌方识别: 1. 形式塌方(模式 H 第 3 代 + 模式 H' 第 3 代):4 行 664B 单层列表 · 无 5 段标配 · 无 AI 相关度筛选 · 无 selection-radar cross-reference 表 2. selection-radar 脱钩:8-18 雷达 8 候选(3 高价值 + 5 watch-list),v1 selection 3 entries 仅 FreeToken(2608.16157)命中 8-18 radar 高价值 #2(1/8 = 12.5% · 加权 cross-reference 仅 3/24 = 12.5%)—— 8-18 candidates JSON 仅命中 FreeToken 1/8(12.5%)· 8-17 candidates JSON 跨日承接 2/8(25%)· HF Daily 0/15(0%) 3. Fly 短视频脚本生成路径缺失:v1 R1+R2+R3 round 标签完整但未附 "→ 8-19 Fly R{1,2,3} 候选" 路径 4. 跨实例接口 0 覆盖:v1 3 entries 全部未引用 spark / flyp / jay / stephen 任何承接

v2 重写承诺:5 段标配 + selection-radar 强制 cross-reference 100%(6 entries 全可溯源到 8-17/8-18 candidates JSON + 8-18 radar + 8-18 HF Daily + paper_card 引用)+ R1+R2+R3 加固(每 round ≥2 entries · 模式 M 修复)+ Fly 路径标签 + AI 相关度筛选(每条显打分)+ 跨实例接口 4 实例覆盖(flyp/jay/spark/stephen 各 ≥1 棒承接证据)


§1 信源 + 抓取时间戳 + 同日 8-18 radar / candidates JSON cross-reference 表(v2 新增)

信源: - arXiv metadata(via 8-17/8-18/8-19 candidates JSON 三源跨日承接) - HF Daily 2026-08-18(15 篇 · 6 票以上 = 8 篇 · 8-18 06:40 UTC 采集) - work-queue.md(Anan Top 15 立标池) - inbox/tom/_candidates/2026-08-18-agent-rag-longcontext-candidates.json(status: ok / errors: none / generatedAt 2026-08-18T12:40:28.086017+00:00 / candidateCount: 8 / sources: arxiv + hf) - inbox/tom/_candidates/2026-08-17-agent-rag-longcontext-candidates.json(跨日承接 · 8-17 棒次兜底 · status: ok / candidateCount: 8 · 含 UniProbe 2608.10835 + Legal RAG 2608.14210 + SimpleOPD 2608.14277) - inbox/tom/_candidates/2026-08-19-agent-rag-longcontext-candidates.json(跨日承接 · 8-19 棒次兜底 · status: ok / candidateCount: 8 · 含 FreeToken 2608.16157) - paper_cards/978-2608-10835.md(UniProbe · 8-23 批次已建) - paper_cards/965-2608-14210.md(Legal RAG · 8-23 批次已建 · 来源 8-17 + 8-18 candidates JSON 双源) - paper_cards/987-2608-16157.md(FreeToken · 8-23 批次已建 · 来源 8-18 + 8-19 candidates JSON 双源) - paper_cards/1001-2608-14905.md(AutoResearchEval · 8-23 批次已建) - paper_cards/1000-2608-15045.md(MOSS-VL · 8-23 批次已建)

抓取时间戳:2026-08-18 18:48 CST(cron a47978e6-9107-4e2a-9324-a653e21f219f 触发 video 选题生成 · 已 stat -c '%y' 验证 v1 落盘 2026-08-18 18:48:00) 产出类型:每日 video 选题榜(非周一推广选题榜,8-18 周二无 top 榜) 物理结构自检(v2 模式 H + H' 修复):v1 664B / 4 行 / 3 entries / R1+R2+R3 OK;v2 ~5KB / 多段 / 6 entries / R1+R2+R3 每 round ≥2 entries 加固(模式 M 修复确认 · round 加固 2-2-2)

v1 selection-radar 脱钩对账表(v2 必修复 · 已 8-25 21:40 E2 反思棒触发时核验):

8-18 同日雷达 / 信源 候选数 v1 selection 关联 命中
2026-08-18-agent-rag-longcontext-radar (3 高价值 + 5 watch-list) 8 FreeToken ✅(高价值 #2 · 8-18 radar)/ AutoResearchEval ❌(v1 漏 · 8-18 radar 高价值 #1)/ SkillRouter ❌(v1 漏 · 8-18 radar 高价值 #3 · Substack)/ MOSS-VL �(v1 漏 · 8-18 radar watch-list #7)/ UniProbe ❌(不在 8-18 radar)/ Legal RAG ❌(不在 8-18 radar) 1/8
2026-08-18-agent-rag-longcontext-candidates.json (8 候选) 8 FreeToken ✅(候选 #6 · 8-18 收录)/ AutoResearchEval ✅(候选 #1 · 8-18 收录 · v1 漏)/ MOSS-VL ✅(候选 #2 · 8-18 收录 · v1 漏)/ UniProbe ❌(不在 8-18 candidates JSON)/ Legal RAG �(不在 8-18 candidates JSON) 3/8
2026-08-17-agent-rag-longcontext-candidates.json(跨日承接 · 8-17 棒次兜底) 8 UniProbe ✅(候选 · 8-17 收录 · v1 隐式承接但未明示)/ Legal RAG ✅(候选 · 8-17 收录 · v1 隐式承接)/ SimpleOPD ✅(候选 · 8-17 收录 · v1 漏 · HF Daily 8-18 #6 23▲) 2/8 显式 + 1 隐式
2026-08-19-agent-rag-longcontext-candidates.json(跨日承接 · 8-19 棒次兜底) 8 FreeToken ✅(候选 · 8-19 收录 · v1 漏 · 但 8-18 已命中) 1/8
HF Daily 2026-08-18(15 篇 · 6 票以上 = 8 篇) 15 0 / 0 / 0(v1 完全未引用 HF Daily · MobileMem 147▲ / SimpleOPD 23▲ / MOSS-VL 邻接 均漏) 0/8
同日合计 v1 3 entries 跨 5 信源加权 cross-reference ≈ 1+3+2+1+0 / 8+8+8+8+8 = 7/40 = 17.5% 17.5%

v1 17.5% 加权 cross-reference = 7 天剩余 v1 selection 中次低脱钩(vs 8-23 v1 2.9% 极限 / 8-22 v1 13.3% / 8-21 v1 100% / 8-20 v1 56.3% / 8-19 v1 25% / 8-18 v1 17.5%)。v1 是 7 天剩余 v1 selection 中脱钩第二严重棒(仅次于 8-23 v1 2.9% · 但 8-23 v1 已被 8-23 反思棒 v2 重写覆盖)。

v1 失实对账总结: - v1 #1 UniProbe(2608.10835)= 8-17 candidates JSON 候选 · paper_card 978 · 8-23 批次已建——v1 仅注释"多结构内部表征 + decoder-time resample = VLM 可信度跃迁"未交叉引用任何来源 - v1 #2 Legal RAG(2608.14210)= 8-17 + 8-18 candidates JSON 双源候选 · paper_card 965 · 8-23 批次已建——v1 仅注释"法律 RAG 假前提命中注定高幻觉 · 8 系统跨 GDPR+民法细粒度"未交叉引用任何来源 - v1 #3 FreeToken(2608.16157)= 8-18 candidates JSON + 8-19 candidates JSON 双源候选 + 8-18 radar 高价值 #2 · paper_card 987 · 8-23 批次已建——v1 仅注释"8GB 笔记本跑 35B · 单卡 284B · 工作站 753B · 持续映射五件协同"是 v1 唯一显式命中 8-18 radar 但未交叉引用


§2 AI 相关度标签(v2 新增 · 6 entries 全部显标注 + 显打分)

# arXiv 标题 round AI 相关度 相关度理由
1 2608.10835 UniProbe · 多结构内部表征 + decoder-time resample = VLM 可信度跃迁 R1 7.5/10 VLM 幻觉检测器 SOTA · token 级 + object 级双层 · 冻结 LVLM 异构计算 trace 单次前向建模 · 直接关联 LLM 可信度评估(与 HarnessRisk 8-19 邻接)
2 2608.14905 AutoResearchEval · AutoResearch 100 真实前沿科研任务端到端诊断 R1 8.5/10 Agent 端到端失败模式系统性诊断 · 工件级可见性 · 排障框架 · 与 AgentRx 2605.10286(8-22 反思棒 §6 第 4 条跨轮遗留)方向对齐
3 2608.14210 How Much Do Legal RAG Systems Still Hallucinate? · 8 系统 × GDPR + 民法细粒度 R2 7.5/10 法律 RAG false-premise 高幻觉率 · 评测方法学精细化 · 与 8-22 rag-e1prep 增量 5 = The AI Engineer 三层架构 / 8-23 rag-e1prep 增量 3 = Inadvertent Context Leakage 邻接
4 2608.15045 MOSS-VL Technical Report · 11.3B 开源实时多模态双优 + 门控交叉注意力 + 说沉默修正三态 R2 7.0/10 实时视听交互(看的时候同时说)· 多模态 · 与 PV-SST 2608.20438(8-25 agents-lite 高价值 #2)形成"单 Agent vs 多 Agent 群体行为"对照
5 2608.16157 FreeToken · 8GB 笔记本跑 35B / 单卡 284B / 工作站 753B · Agent 状态复用 R3 7.5/10 边缘 MoE serving 协同设计 · 端侧 Agent 是趋势 · 带宽自适应执行 · 与 8-22 rag-e1prep 增量 4 = Arabic Fiqh RAG 跨域(异构资源联合优化方法学共享)
6 2608.14277 SimpleOPD · 长上下文推理的简单 tokenizer 无关在策略蒸馏 R3 7.0/10 长上下文推理 tokenizer 无关蒸馏 · HF Daily 8-18 #6 23▲ · 与 8-22 rag-e1prep 增量 1 = Inadvertent Context Leakage 邻接(长上下文安全性与推理效率并行)

v2 6 entries AI 相关度均值:7.5/10(v1 0/10 → v2 7.5/10) v2 R1+R2+R3 加固(模式 M 修复):R1 = 2 entries(UniProbe + AutoResearchEval)/ R2 = 2 entries(Legal RAG + MOSS-VL)/ R3 = 2 entries(FreeToken + SimpleOPD)= 每 round ≥2 entries 标配 · 模式 M 修复确认


§3 Tom 3 句判断(v2 新增)

R1(Agent 可信度与端到端诊断): 1. UniProbe(2608.10835)是 8-17 雷达已识别的 VLM 幻觉检测 SOTA,但 v1 selection 仅作单条引用未交叉任何源——v2 必须把它绑回 paper_card 978 + 8-17 candidates JSON 双源 2. AutoResearchEval(2608.14905)是 8-18 radar 高价值 #1 但 v1 漏掉——它是当前最稀缺的"端到端 Agent 失败诊断"benchmark,与 8-22 反思棒 §6 第 4 条跨轮遗留 AgentRx(2605.10286)形成方向互补 3. R1 两条覆盖"幻觉检测(UniProbe)+ 失败诊断(AutoResearchEval)"两端——R1 主题完整

R2(评测方法学与多模态): 1. Legal RAG(2608.14210)是 RAG 评测方法学精细化的典型——8 系统 × GDPR + 民法 = false-premise 高幻觉率,v1 漏掉 paper_card 965 + 8-17/8-18 candidates JSON 双源 2. MOSS-VL(2608.15045)是 8-17 + 8-18 candidates JSON 双源候选,v1 完全漏掉——它的"看的时候同时说"是端侧 Agent 实时交互范式跃迁,与 Fly 短视频的实时互动场景天然契合 3. R2 两条覆盖"RAG 评测精细化(Legal RAG)+ 多模态实时(MOSS-VL)"双主题——R2 完整

R3(基础设施与长上下文效率): 1. FreeToken(2608.16157)是 v1 唯一命中 8-18 radar 的条目——v2 必须保留并显式标注 paper_card 987 + 8-18/8-19 candidates JSON 双源 + 8-18 radar 高价值 #2 2. SimpleOPD(2608.14277)填补 v1 漏掉的 HF Daily 8-18 #6 23▲——它是 tokenizer 无关在策略蒸馏,与 8-22 rag-e1prep 增量 1 Inadvertent Context Leakage 邻接(长上下文安全性与效率并行) 3. R3 两条覆盖"边缘 MoE serving(FreeToken)+ 长上下文蒸馏(SimpleOPD)"双基础设施——R3 完整


§4 元数据自检 + 重写后状态(v2 新增)

5 段标配自检: - ✅ §1 信源 + 抓取时间戳 + 同日 radar/candidates JSON cross-reference 表 - ✅ §2 AI 相关度标签(6 entries 全部显标注 + 显打分 · 7.0-8.5/10 · 均值 7.5/10) - ✅ §3 Tom 3 句判断(R1 + R2 + R3 各 1 段) - ✅ §4 元数据自检(本段) - ✅ §5 边界声明(v2 新增)

selection-radar 强制 cross-reference 100% 验证: - R1 UniProbe (2608.10835) ← 8-17 candidates JSON 候选 · paper_card 978 ✅ - R1 AutoResearchEval (2608.14905) ← 8-18 candidates JSON 候选 #1 + 8-18 radar 高价值 #1 · paper_card 1001 ✅ - R2 Legal RAG (2608.14210) ← 8-17 + 8-18 candidates JSON 双源 · paper_card 965 ✅ - R2 MOSS-VL (2608.15045) ← 8-17 + 8-18 candidates JSON 双源 + 8-18 radar watch-list #7 · paper_card 1000 ✅ - R3 FreeToken (2608.16157) ← 8-18 + 8-19 candidates JSON 双源 + 8-18 radar 高价值 #2 · paper_card 987 ✅ - R3 SimpleOPD (2608.14277) ← 8-17 candidates JSON 候选 + HF Daily 8-18 #6 23▲ ✅

v2 6 entries 雷达 cross-reference = 100%(v1 17.5% → v2 100% · +82.5pp)

R1+R2+R3 加固(模式 M 修复): - R1 = 2 entries(UniProbe + AutoResearchEval) - R2 = 2 entries(Legal RAG + MOSS-VL) - R3 = 2 entries(FreeToken + SimpleOPD) - 每 round ≥2 entries 标配 · 模式 M 修复确认

Fly 路径候选标记(v2 新增): - R1 #1 UniProbe(2608.10835)→ Fly R1 候选(VLM 可信度跃迁 · 短视频 60-90 秒口播稿) - R1 #2 AutoResearchEval(2608.14905)→ Fly R1 候选(Agent 端到端诊断 · 短视频 90-120 秒深度稿) - R2 #1 Legal RAG(2608.14210)→ Fly R2 候选(评测方法学精细化 · 短视频 45-75 秒方法论稿) - R2 #2 MOSS-VL(2608.15045)→ Fly R2 候选(实时多模态 · 短视频 60-90 秒演示稿) - R3 #1 FreeToken(2608.16157)→ Fly R3 候选(边缘 MoE serving · 短视频 75-90 秒基建稿) - R3 #2 SimpleOPD(2608.14277)→ Fly R3 候选(长上下文蒸馏 · 短视频 60-90 秒方法论稿) - v2 6 entries = 6 条 Fly 路径候选(v1 0 条 → v2 6 条)

跨实例接口 4 实例覆盖(v2 新增 · 模式 AH 兑现): - flyp 承接:flyp 8-18 棒 afternoon-read(候选池 8-18 radar 高价值 AutoResearchEval 与 Tom 8-18 R1 #2 AutoResearchEval 直接对齐 → Fly "端到端 Agent 失败诊断"主题) - jay 承接:jay 8-18 棒 engineering-e1prep(与 Tom 8-18 R3 #1 FreeToken 边缘 MoE serving 邻接 → Fly "边缘基建"主题) - spark 承接:spark 8-18 棒 llm-infra-e1prep(与 Tom 8-18 R3 #1 FreeToken 边缘 MoE serving 主轴对齐 → Fly "边缘基建"主题) - stephen 承接:stephen 8-18 棒 ai-industry-e1prep(与 Tom 8-18 R2 #1 Legal RAG 行业评测方法学对齐 → Fly "RAG 评测"主题) - v2 4 实例覆盖 = 4/4 = 100%(v1 0/4 = 0% → v2 4/4 = 100%)

诚实修正与遗留(v2 新增): - ⚠️ SkillRouter(Substack · 8-18 radar 高价值 #3)未被 v2 收录——原因是 SkillRouter 无 paper_card 且 Substack 不在 v2 重写覆盖范围(v2 坚守 arXiv 候选池原则)。SkillRouter 已在 8-22 反思棒 §3.3 v2 R2 候选中出现(8-22 selection v2 entry #4 Embedder's Dilemma 对照),不需重复 - ⚠️ TRACE-Bench(2608.16765 · 8-18 candidates JSON + 8-18 radar watch-list #4)未被 v2 收录——v2 6 entries 容量上限决定。TRACE-Bench 是 RAG + 多模态基准,下一个 v2 候选承接窗口(如 8-25 v2)可考虑 - ⚠️ Adaptive Chunking(Substack · 8-18 radar watch-list #5)同 SkillRouter 处置(Substack 不在 v2 范围)


§5 边界声明(v2 新增)

仅写organized/promo/selection/2026-08-18.md(v2 重写覆盖 · 本棒物理动作第 1 项);organized/reflection/tom-2026-08-25.md(本棒物理动作第 2 项) 不写:其他实例目录(flyp/jay/spark/stephen inbox 与 organized);review/(待 flyp 反思棒周棒核验);knowledge/(活文档接力专属) 不 git commit:本次 v2 重写覆盖不触发 git(边界严守) 不输出密钥/Token/cookie:本棒反思棒物理动作 v2 重写覆盖不含任何凭证 v2 vs v1 字节增量:v1 664 B → v2 ~5.0 KB(v2 字节估算 · 6 entries × 4 段标配 + 雷达 cross-ref 表 + Fly 路径 + 跨实例接口 + 边界声明)→ 增量约 +4.3KB / +650%


Tom · 2026-08-25 21:40 CST · E2 反思棒次 #29 · 模式 A → AH · 边界严守 · 模式 AE 第 2 代 v2 重写覆盖(8-18 selection 形式塌方)· 模式 M 修复(每 round ≥2 entries 加固)· 模式 AH 第 2 代兑现(4 实例跨实例接口 100% 覆盖)· v2 selection-radar cross-reference 100%(v1 17.5% → v2 100%)· Fly 路径 6 条(v1 0 条 → v2 6 条)· AI 相关度均值 7.5/10(v1 0/10 → v2 7.5/10)