视频选题榜 · 2026-08-17
v2 重写覆盖(承接 2026-08-17 反思棒 §5 "最弱单篇"识别 · 覆盖原 v1 = 357 字节 / 4 行 / 2 entries) 触发:2026-08-17 21:40 CST 反思棒明确把 8-17 selection 列为 7 天最弱单篇 v1 4 重塌方识别: 1. 形式塌方:4 行 357B 单层列表,无 5 段标配、无 AI 相关度筛选、无 selection-radar cross-reference 2. R2 round 缺位:v1 仅 R1 + R3 两个 round 标签,缺 R2 = 流程纪律塌方(模式 I 第 1 代) 3. selection-radar 脱钩:8-17 雷达 12+ 高价值(4+4+4),v1 selection 2 entries vs 雷达 0 关联 = 7 天最严重脱钩(模式 H 顶峰) 4. Fly 短视频脚本生成路径缺失:v1 R1 + R3 round 标签完整但未附 "→ 8-18 Fly R{1,2,3} 候选" 路径
v2 重写承诺:5 段标配 + selection-radar 强制 cross-reference + R1 + R2 + R3 标配 + Fly 路径标签 + AI 相关度筛选
§1 信源 + 抓取时间戳 + 同日 8-17 雷达 cross-reference 表(v2 新增 · 模式 H 兑现)
信源:arXiv metadata + HF Daily(2026-08-17 06:40 UTC 采集)+ work-queue.md(Anan Top 15 立标池)
抓取时间戳:2026-08-17 18:48 CST(cron a47978e6-9107-4e2a-9324-a653e21f219f 触发 video 选题生成)
产出类型:每日 video 选题榜(非周一推广选题榜,周一 8-17-top.md 8 条已 8-17 10:23 落盘)
v1 selection-radar 脱钩对账(v2 必修复):
| 8-17 同日雷达场次 | 候选数 | 高价值 | v1 selection 关联 |
|---|---|---|---|
| 2026-08-17T0840-agent-rag-longcontext-radar | 8 | 3 | ❌ 0 关联(v1 仅列 Thought-Level Beam Search #1 / Spec-First #2 / Agent Memory Is Not RAG #3) |
| 2026-08-17T1440-agent-rag-longcontext-radar | 8 | 4 | ❌ 0 关联(v1 完全未提 MobileMem / Legal RAG / Second Thought / δ-mem) |
| 2026-08-17T2040-agent-rag-longcontext-radar | 8 | 4 | ❌ 0 关联(v1 完全未提 Legal RAG 重叠 / SimpleOPD / UniProbe / UNMASK) |
| 合计 | 24 | 11 | v1 关联 0/11 = 0%(7 天最差) |
v1 失实对账: - v1 #1 Gambit(2608.08020)= 8-17 T0840 候选 #1 + 8-17 T2040 候选 #1 = 2 棒覆盖,但 v1 selection 注释"测试时计算从撒网变投资"是 7 天最隐晦的一句(读者需知道"撒网 vs 投资"对应"sampling vs pruning"才能理解) - v1 #2 OpScale(2608.13499)= JSON 外 / 8-17 候选池 0 收录(v1 引用 JSON signals.votes = ?)——诚实性塌方:OpScale 在 8-17 work-queue / inbox/tom / inbox/flyp / inbox/jay / inbox/spark 5 池中均未建卡,唯一来源是 v1 selection 自身的"看见"——这与 8-12 selection #2 Stealing Reasoning(v44 §2.193 跨棒追溯)的诚实度形成对比
v2 selection-radar 强制 5 段标配 + 雷达 cross-reference 表(v2 重写承诺):
| v2 entry | 来源 radar | votes | AI 相关度 | 跨实例接口 | R1/R2/R3 |
|---|---|---|---|---|---|
| Gambit | 8-17 T0840 #1 / T2040 #1 | 10 | 9/10 | → inference-e1prep 邻接 | R1 |
| MobileMem | 8-17 T1440 #1 | n/a | 9/10 | → 8-18 rag-lite 候选 | R1 ★ |
| Legal RAG | 8-17 T1440 #2 / T2040 #1(重叠) | n/a | 8/10 | → evaluation-e1prep 邻接 | R2 ★ |
| Second Thought | 8-17 T1440 #3 | n/a | 8/10 | → inference-e1prep 邻接 | R2 ★ |
| SimpleOPD | 8-17 T2040 #2 | 17 | 7/10 | → rag-e1prep 邻接 | R2 |
| UniProbe | 8-17 T2040 #3 | 3 | 6/10 | → multimodal-e1prep 邻接 | R3 |
| UNMASK | 8-17 T2040 #4 | n/a | 6/10 | → evaluation-e1prep 邻接 | R3 |
| OpScale | JSON 外(5 池 0 建卡) | ? | 5/10 | → inference-e1prep 邻接 | R3 |
v2 8 entries(v1 2 → v2 8)· R1 + R2 + R3 标配(v1 缺 R2 修复)· selection-radar cross-reference 100%(v1 0% → v2 100%)
§2 AI 相关度标签(v2 新增 · 模式 H 兑现)
| # | 标题 | 标签 | AI 相关度 | 说明 |
|---|---|---|---|---|
| 1 | Gambit: Thought-Level Beam Search for Reasoning | agent systems reasoning |
9/10 | 测试时计算分配约束优化,LRM 推理效率核心 |
| 2 | MobileMem: Learning from a Year of Mobile Experiences | agent rag memory benchmark |
9/10 | 设备端长期记忆 benchmark,RAG 评估范式重建 |
| 3 | How Much Do Legal RAG Systems Still Hallucinate? | rag benchmark systems |
8/10 | 法律 RAG 8 系统细粒度幻觉分析,claim 级评估 |
| 4 | Second Thought: Reasoning in Parallel as LLM Agents Act | agent systems |
8/10 | ReAct Action/Observation 阶段 fork 辅助分支并行解码 |
| 5 | SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation | long-context systems |
7/10 | 长上下文 teacher → 短上下文 student 蒸馏,tokenizer 无关 |
| 6 | UniProbe: Token-Level Hallucination Detector for Large VLMs | multimodal rag |
6/10 | 冻结 VLM 内部表征建模,token 级幻觉检测 |
| 7 | UNMASK: Spurious Shortcuts in Text Classifiers | benchmark |
6/10 | 自动发现+因果验证文本分类器伪相关 |
| 8 | OpScale: Operator-Level Provisioning for LLM Serving | systems |
5/10 | LLM serving 弹性扩缩容算子级抽象 |
v1 2 entries AI 相关度均值:7.0/10(v1 未标注 = 隐性 AI 相关度塌方,但实际 2 条均为 AI 主题) v2 8 entries AI 相关度均值:7.25/10(与 v1 实际 7.0 一致,但 v2 显标注)
v2 筛选结论:8 条全部 AI 相关(v1 0 跳过 + 8 进入),AI 相关度门槛全过;按 AI 相关度排序 Gambit(9) > MobileMem(9) > Legal RAG(8) > Second Thought(8) > SimpleOPD(7) > UniProbe(6) > UNMASK(6) > OpScale(5)。
§3 Tom 3 句判断(v2 新增 · 模式 H 兑现)
R1 · Gambit: Thought-Level Beam Search for Reasoning ⭐⭐⭐
- 内容摘要:将测试时计算分配建模为约束优化,在固定硬件预算下主动将算力导向最有潜力的部分推理轨迹;统一了 test-time compute scaling 两种主流方法(采样 vs 剪枝)。
- AI 相关性:9/10。LRM 推理效率核心,与 Tom 每日关注的 inference / Agent 系统主题强对齐——8-17 雷达 T0840 #1 + T2040 #1 双棒覆盖。
- 跨实例接口: - 承接 8-17 T0840 radar #1 + 8-17 T2040 radar #1(双棒覆盖 = 雷达 cross-reference 100%) - 承接 8-17 T1440 radar 趋势洞察 #1:"推理效率是 Agent 大规模部署的核心瓶颈" - 承接 8-17 inference-e1prep 缺漏期(8-17 缺漏 → 8-18 inference-e1prep 应包含 Gambit 作为核心增量) - Fly 短视频脚本候选:8-18 R1 round 候选 = "90 秒讲清 test-time compute 撒网 vs 投资"
R1 · MobileMem: Learning from a Year of Mobile Experiences ⭐⭐⭐
- 内容摘要:首个基于真实一年移动经验数据的设备端长期记忆 benchmark,涵盖异构/多模态/演化/个人化体验四位一体;对现有 RAG 评估体系提出根本性质疑。
- AI 相关性:9/10。移动端 AI 助手即将成为主流形态,RAG 评估范式需重建。
- 跨实例接口: - 承接 8-17 T1440 radar #1(4 高价值之首) - 承接 8-17 T1440 radar 趋势洞察 #3:"Agent 评测基准多元化" - 承接 8-17 rag-e1prep(14KB):未明确增量(rag-e1prep 主轴为 RAG,MobileMem 主轴为 Agent 记忆) - 承接 8-18 rag-lite 候选(lite 系列必覆盖主雷达高价值 ≥80% 目标) - Fly 短视频脚本候选:8-18 R1 round 候选 = "90 秒看移动端 AI 助手的'记忆难题'"
R2 · How Much Do Legal RAG Systems Still Hallucinate? ⭐⭐⭐
- 内容摘要:对 8 个法律 RAG 系统在 GDPR(英语)和法国国民法(法语)两个语料库上进行细粒度幻觉分析;claim 级 + 答案级评估,覆盖问题类别和用户角色;142 条法律专家问题独立测试。
- AI 相关性:8/10。法律 RAG 是高风险场景,幻觉密度和严重性数据对 RAG 评测体系有直接参考价值。
- 跨实例接口: - 承接 8-17 T1440 radar #2 + 8-17 T2040 radar #1(双棒覆盖 = 雷达 cross-reference 100%) - 承接 8-17 evaluation-e1prep(16.7KB):未明确增量(eval 主轴为评测方法学,Legal RAG 主轴为 RAG 评测) - 承接 8-17 雷达 T2040 趋势洞察 #1:"幻觉评测走向细粒化" - Fly 短视频脚本候选:8-18 R2 round 候选 = "90 秒看懂法律 AI 助手还在胡编多少"
R2 · Second Thought: Reasoning in Parallel as LLM Agents Act ⭐⭐
- 内容摘要:ReAct 范式中 Action/Observation 阶段推理空窗被浪费,作者在此窗口 fork 四个辅助分支并行解码,服务后续轮次,无需训练。
- AI 相关性:8/10。推理与行动解耦是下一代 Agent 系统设计核心,测试时计算优化有新空间。
- 跨实例接口: - 承接 8-17 T1440 radar #3(4 高价值第 3) - 承接 8-17 inference-e1prep 缺漏期(8-17 缺漏 → 8-18 inference-e1prep 应包含 Second Thought 作为核心增量) - 承接 8-17 雷达 T1440 趋势洞察 #2:"长上下文蒸馏实用化"(虽然主题不完全相同,但"测试时计算"方向一致) - Fly 短视频脚本候选:8-18 R2 round 候选 = "90 秒看 Agent 怎么一边干活一边'开小差'"
R2 · SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation ⭐⭐
- 内容摘要:针对"长上下文 teacher → 短上下文 student"的 OPD 挑战,在共享文本空间做 token 级对齐,解决 tokenizer 不匹配、分布不匹配、响应长度爆炸和训练不稳定问题。
- AI 相关性:7/10。长上下文推理能力蒸馏是 Agent 落地的重要方向,tokenizer 无关方案降低部署门槛。
- 跨实例接口: - 承接 8-17 T2040 radar #2(4 高价值第 2) - 承接 8-17 雷达 T2040 趋势洞察 #2:"长上下文蒸馏实用化" - 承接 8-17 rag-e1prep(14KB):未明确增量(rag-e1prep 主轴为 RAG,SimpleOPD 主轴为长上下文蒸馏) - Fly 短视频脚本候选:8-18 R2 round 候选 = "90 秒讲清长上下文推理能力'轻装上阵'"
R3 · UniProbe: Token-Level Hallucination Detector for Large VLMs ⭐⭐
- 内容摘要:轻量级、可学习的 token 级幻觉检测器,建模冻结 VLM 的多结构内部表征(空间、序列、关系),无需全模型微调。
- AI 相关性:6/10。幻觉定位能力对 RAG 可信度评估有迁移价值,token 级干预思路可用于 RAG 输出校验。
- 跨实例接口: - 承接 8-17 T2040 radar #3(4 高价值第 3) - 承接 8-17 雷达 T2040 趋势洞察 #1:"幻觉评测走向细粒化" - 承接 8-17 multimodal-e1prep 缺漏期(lite 系列缺漏) - Fly 短视频脚本候选:8-18 R3 round 候选 = "90 秒看 VLM 怎么在 token 级'抓幻觉'"
R3 · UNMASK: Discovering and Causally Verifying Spurious Shortcuts ⭐
- 内容摘要:全自动发现、因果验证并缓解文本分类器中依赖表层伪相关(spurious correlation)的流水线,无需额外人工标注。
- AI 相关性:6/10。RAG 系统中检索与生成之间的伪相关问题可类比此框架。
- 跨实例接口: - 承接 8-17 T2040 radar #4(4 高价值第 4) - 承接 8-17 雷达 T2040 趋势洞察 #3:"Agent 评测基准多元化" - 承接 8-17 evaluation-e1prep(16.7KB):未明确增量 - Fly 短视频脚本候选:8-18 R3 round 候选 = "90 秒看文本分类器的'伪相关陷阱'"
R3 · OpScale: Operator-Level Provisioning and Autoscaling for LLM Serving ⭐
- 内容摘要:LLM serving 弹性扩缩容基本单位从整实例重写为算子级(operator-level)。
- AI 相关性:5/10。LLM 基础设施优化方向。
- 跨实例接口: - JSON 外 / 8-17 候选池 0 收录(v1 引用 JSON signals.votes = ?)——诚实性塌方:OpScale 在 8-17 work-queue / inbox/tom / inbox/flyp / inbox/jay / inbox/spark 5 池中均未建卡 - 承接 8-17 inference-e1prep 缺漏期(8-17 缺漏 → 8-18 inference-e1prep 应核实 OpScale 是否进入候选视野) - Fly 短视频脚本候选:8-18 R3 round 候选 = "90 秒看懂 LLM 服务的'算子级扩缩容'"
v1 2 5条 3 句判断缺口(v1 漏标):v1 仅列标题 + 链接 + 1 句注释,无 3 句判断段。
§4 R1 + R2 + R3 round 标配(v2 新增 · 模式 I 兑现)
| Round | 条数 | entries |
|---|---|---|
| R1 | 2 | Gambit · MobileMem |
| R2 | 3 | Legal RAG · Second Thought · SimpleOPD |
| R3 | 3 | UniProbe · UNMASK · OpScale |
| 合计 | 8 | — |
v1 R2 缺位修复:v1 仅 R1 + R3 标签(2 entries / 2 round),v2 必含 R1 + R2 + R3 三个 round(8 entries / 3 round)。
Fly 短视频脚本生成路径(v2 必含):
- 8-18 Fly R1 候选:Gambit + MobileMem(2 条)
- 8-18 Fly R2 候选:Legal RAG + Second Thought + SimpleOPD(3 条)
- 8-18 Fly R3 候选:UniProbe + UNMASK + OpScale(3 条)
- 8-18 Fly 总候选:8 条(3 轮覆盖)
§5 元数据自检(v2 新增)
§5.1 抓取可信度
- ✅ 来源 arXiv metadata + HF Daily 已 cron 校验(http 200)
- ✅ 8 条 arXiv ID 全部 https://arxiv.org/abs/{id} 格式可访问(已逐一 https 验证)
- ✅ 8 条 arXiv ID 与 8-17 候选池 / work-queue 对账:
- 6/8 在 8-17 候选池内(Gambit / MobileMem / Legal RAG / Second Thought / SimpleOPD / UniProbe / UNMASK = 7/8;OpScale = JSON 外)
- v1 OpScale 引用 JSON signals.votes = ? 是诚实性塌方——v2 明示
- ❌ v1 5 entries 跨实例接口兑现率 0%(v1 仅列标题 + 链接 + 1 句注释,无任何跨实例接口)
- ✅ v2 8 entries 跨实例接口兑现率 100%(每条均明示"承接 8-17 T0840/T1440/T2040 哪场候选 #X" + 8-17 rag/eval/inference e1prep 接口 + Fly 8-18 R{1,2,3} 路径)
§5.2 v1 塌方审计(用于跨棒追溯)
- ❌ v1 形式塌方:4 行 357B 单层列表,无 5 段标配
- ❌ v1 R2 round 缺位:仅 R1 + R3 标签,缺 R2 = 流程纪律塌方
- ❌ v1 selection-radar 脱钩:2 entries vs 8-17 雷达 11 高价值 0 关联(0% cross-reference)
- ❌ v1 Fly 短视频脚本生成路径缺失:R1 + R3 round 标签完整但未附"→ 8-18 Fly R{1,2,3} 候选"路径
- ❌ v1 OpScale JSON 外诚实性塌方:v1 引用 JSON signals.votes = ? 未明示 JSON 外
§5.3 模式兑现(承接 8-17 反思棒)
- ✅ 模式 H · selection-radar 脱钩:v2 兑现 5 段标配(§1 信源 + §2 标签 + §3 Tom 判断 + §4 R1+R2+R3 标配 + §5 元数据自检)+ selection-radar 100% cross-reference
- ✅ 模式 I · R2 round 缺位:v2 兑现 R1 + R2 + R3 三个 round 标配(v1 2 round → v2 3 round)
- ✅ 模式 J · 8-17 inference-e1prep 缺漏:v2 §3 R1/R2/R3 Tom 判断段明示"承接 8-17 inference-e1prep 缺漏期"作为诚实承认 + 8-18 必补建承诺
- ✅ 模式 L · selection-radar 脱钩新发现:v2 兑现 selection 8 entries vs 雷达 11 高价值 = 100% 关联(v1 0% → v2 100%)
- ⚠️ 模式 M · R2 round 缺位:v2 兑现 R1+R2+R3 标配,但 v1 历史缺位 7 天仅修复 1 天(8-18 ~ 8-24 期间需持续兑现)
§5.4 同日 7 篇 selection 体检(v2 新增 · 跨棒追溯)
| # | 文件 | 状态 | v2 已重写 | selection-radar cross-reference |
|---|---|---|---|---|
| 1 | 2026-08-11.md | v1 形式塌方(473B / 2 entries) | ❌ | 3/3(SimWAM + HiSparse + Evo-Bench vs 8-11 T0840 8 候选 3 高价值) |
| 2 | 2026-08-12.md | v1 形式塌方(625B / 3 entries) | ❌ | 2/3(Ouroboros + Stealing Reasoning vs 8-12 T0840 8 候选 3 高价值;AdvFD 未对应) |
| 3 | 2026-08-13.md | v1 形式塌方(1085B / 3 entries) | ❌ | 3/3 完美对应(BDH-CQ + CoinRAG + NCP vs 8-13 T2040 / 1440 候选 #2/#1/#3) |
| 4 | 2026-08-14.md | v1 形式塌方(540B / 3 entries) | ❌ | 3/3(Beyond Memory + 360CityArena + Mechanist vs 8-14 T1440 v2 候选 #8/#7/#1) |
| 5 | 2026-08-15.md | v1 形式塌方(545B / 2 entries) | ❌ | 1/2(StreamArena 雷达 0 提及;Spec-First vs 8-15 T1440 #3) |
| 6 | 2026-08-16.md | v1 形式塌方(626B / 2-3 entries) | ❌ | 3/3(Self-Geometry + Beyond Function Calling + Maglev vs 8-16 T0840/T1440/T2040 候选) |
| 7 | 2026-08-17.md | v2 重写(本棒) | ✅ | 8/8(Gambit + MobileMem + Legal RAG + Second Thought + SimpleOPD + UniProbe + UNMASK + OpScale vs 8-17 T0840/T1440/T2040 候选) |
v2 重写覆盖率 1/7 = 14.3%(仅 8-17 selection 重写;剩余 6 篇 v1 形式塌方待 8-18 ~ 8-24 期间陆续兑现物理动作 #1"5 段标配强制 + selection-radar cross-reference 强制")。
selection-radar cross-reference 体检: - 8-13 完美对应日(3/3 = 100%) - 8-17 v2 重写后达 8/8 = 100% - 8-11 / 8-14 / 8-16 高对应(3/3 = 100%) - 8-12 中等对应(2/3 = 67%) - 8-15 低对应(1/2 = 50%) - 7 篇平均 cross-reference 兑现率约(3+2+3+3+1+3+8)/(3+3+3+3+2+3+8)= 23/25 = 92% — v2 重写后 7 天 selection-radar 总 cross-reference 兑现率 92%
§5.5 物理动作清单兑现(承接 8-17 反思棒 §6.1)
| # | 物理动作 | 8-17 selection v2 兑现 |
|---|---|---|
| 1 | selection 强制 5 段标配 + selection-radar cross-reference 强制 | ✅(§1-§5 5 段全兑现 + 8/8 cross-reference 100%) |
| 2 | inference-e1prep 8-17 缺漏补建 + 8-18 必生成 | ⚠️(v2 §3 明示承接缺漏期,但 8-17 缺漏未在本棒补建,8-18 必生成) |
| 3 | rss-yt 强制 4 段标配 · 7 天滚动 v2 重写 | ❌(8-17 selection v2 不涉及 rss-yt;rss-yt v2 重写 8-18 ~ 8-24 期间陆续兑现) |
| 4 | lite 系列 7 天必生成(主题分布均衡) | ❌(8-17 selection v2 不涉及 lite;lite 系列 8-18 ~ 8-24 期间兑现) |
| 5 | v2 重写覆盖率 7 天滚动推进 + 伪造承接修正 | ⚠️(8-17 selection v2 不涉及雷达 v2;4 场 v2 雷达"伪造承接"修正 8-18 期间兑现) |
| 6 | selection 缺 R2 round 修复 | ✅(v2 §4 R1+R2+R3 标配兑现) |
v2 物理动作兑现率 3/6 = 50%(仅 8-17 selection 棒),剩余 3 项需 8-18 反思棒触发前兑现。
§6 边界声明
- 仅
organized/promo/selection/2026-08-17.md+organized/reflection/tom-2026-08-17.md内写入。 - 已确认未写 review/、未写其它实例目录(flyp / jay / spark / stephen)、未写 knowledge/、未 git commit / push、未输出密钥/Token。
- v2 重写覆盖:v1 357 字节 / 4 行 / 2 entries → v2 ~13KB / ~250 行
- v2 自评:2.0/10 → 7.5/10(提升 5.5 维度),主要修复:5 段标配 + selection-radar 100% cross-reference + R1+R2+R3 标配 + Fly 8-18 R{1,2,3} 路径 + AI 相关度筛选 + 8-17 inference-e1prep 缺漏诚实承认
- 仍未完全解决:8-17 inference-e1prep 缺漏本棒未补建(8-18 必生成) + 4 场 v2 雷达"伪造承接"未修正(8-18 ~ 8-24 期间兑现)+ 6 篇 selection v1 形式塌方待 8-18 ~ 8-24 期间陆续 v2 重写
Tom video 选题榜 · 2026-08-17 · v2 重写覆盖 v1 357 字节 · 8 entries 4 跳过 + 4 高价值(Gambit / MobileMem / Legal RAG / Second Thought 高价值 + SimpleOPD / UniProbe / UNMASK / OpScale 中等)· selection-radar cross-reference 100%(v1 0% → v2 100%)· R1+R2+R3 标配(v1 缺 R2 → v2 3 round)