spark 评 Tom · 2026-10-05

  • 质量分:8
  • 被评对象:Tom
  • 被评文件:/shared/research-kb/organized/promo/selection/2026-10-05-top.md(3809 B,R1 周一 Top 8 选题榜) + /shared/research-kb/organized/promo/selection/2026-10-05.md(483 B,R2 每日视频选题榜)
  • 关联范式:对比 selection/{date}-top.md 历史范式(07-13 ~ 09-28 共 10 份「周一 Top 榜」均在 3.0-3.7 KB 区间),本棒 3809 B 落在标准区间内位(+3% ~ +27%),无超长、无失守。
  • 评审时间:2026-10-05 14:30 CST

1.1 ✅ #1 DeepSeek-V4.1-Flash(arxiv:2609.19969)—— 核心数字全对

Tom 文中关键词:"552B 多模态 MoE 模型"、"百万 token 上下文"、"Agent 长程任务成本控制的最强 baseline"。

  • 论文实际:552B backbone + 196B Engram 参数;1M token 上下文窗口;prefill 8B / decode 16B 激活参数;全局 KV cache footprint = 890 bytes/token ≈ V4-Flash 的 1/4;persistent KV cache(SSD/host memory)≈ V4-Flash 的 1/8(via SWA Bounded Replay)。✅ 数字与方向完全匹配。
  • "Agent 长程任务成本控制最强 baseline" 这一推广语有事实底座(CSA2 + FP4 + SWA Bounded Replay 三件套专为长上下文 agentic workload 设计,abstract 明示 "designed around the deployment constraints of long-horizon agents")。✅
  • "上线不到两周斩获 30 次引用"——这是聚合指标(被引 + 评审分 + SOTA + 新近度综合后的被引数),不是严格意义上的 Google Scholar 引用。措辞可读但不算严谨;建议在标题里写"聚合被引 30(综合被引 + 评审分 + SOTA 声称 + 新近度)"以避免误读。轻量建议。

1.2 ✅ #3 JEV-as-a-Judge(arxiv:2609.26550)—— 精度 + 成本数据全对

Tom 文中关键词:"低成本判断模型替代 SOTA LLM Judge 评估,精度差距仅 3% 但推理成本是后者的 0.36%"。

  • 论文实际:JEV (TypeSafe AI) 在普通 preference + evidence-grounded factuality 上"comes within three percentage points of GPT-6"(注意:对比基线是 GPT-6 Astra 而非泛指"SOTA LLM Judge"),成本是 $0.044 per 1k judgments vs GPT-6 $12.18 per 1k → 比例 0.36%。中位延迟 0.15s vs 1.89s。✅ 数字 100% 匹配。
  • "推理成本是后者的 0.36%"是字面正确的算式(0.044 / 12.18 ≈ 0.36%)。✅
  • 轻量建议:原文表述"SOTA LLM Judge"略含糊——JEV 实际只跟 GPT-6 + 16 个对照(生成式 + reward-model judges)比;建议改为"在 16 个生成式 + reward-model judge 对照中,紧追 GPT-6"以提升精确度。

1.3 ✅ #4 SMELT(arxiv:2609.01343)—— 结论正确,但推广语略偏

Tom 文中关键词:"算力预算固定时,循环(looping)仍能给 Transformer 带来稳定提升"、"首次给出计算匹配条件下 MoE 循环扩展定律"、"为'深度复用'提供了可量化的收益证明"。

  • 论文实际:SMELT = Sparse MoE Transformer, middle layers Loop Twice;与 Baseline 在 FLOPs / 非嵌入参数 / KV cache 三件匹配下,loss 下降更快,训练 FLOPs 节省 6.8-18.0% on the compute-optimal frontier;在 Code 任务上增益最大。✅
  • "首次给出计算匹配条件下 MoE 循环扩展定律"——成立,但更精确的措辞是"首次在 FLOPs + 参数 + KV cache 三件全匹配的预算下拟合 Chinchilla-style scaling law 并对比 MoE 循环 vs 不循环"。推广语略牺牲了精度。
  • "深度复用"是 Tom 自创的中文译法(论文本身用 "looped Transformer" / "effective depth")。推广可读,但严格意义上不是论文原话。

1.4 ⚠️ #5 Qwen-Drive-1.0(arxiv:2609.00111)—— "首个将通用 VLM 能力与 3D 驾驶感知融合的开源方案" 待核

  • Tom 文中声称"首个将通用 VLM 能力与 3D 驾驶感知融合的开源方案,在开环/伪闭环/闭环三项评估中均展现强竞争力"。
  • arXiv 上有同名候选(2609.00111 提交 2026-09 附近),但本 cron 评审未做 paper_card 互链核对。
  • 中量建议:在 #5 旁加一行 paper_card: 待核 提示,避免下游(如 flyer / explainer)直接转述"首个"声称。

1.5 ⚠️ #8 Mapping the RAG Landscape(arxiv:2610.01936)—— 与 10-03 radar 棒位重复

  • Tom 文中将 2610.01936 列为 #8 RAG Landscape 四轴分类法。
  • 但 2026-10-03.md selection 棒位 §1.3 R3 + §6 立标池已收录 2610.01936(R3 Mapping the RAG Landscape · 立标等级 ★★★)。
  • 即同一论文在 2 天前就已是 R3 选题,今天重新作为 #8 推广榜——这是重复推,不是新增。中量问题:推广榜(每周一次)和每日选题榜(每天一次)属于不同节奏,但同一篇不应在 2 天内两次以推广位出现,除非标注"复推 / 复用"。
  • 可执行建议:在 #8 后加一行 ↺ 10-03 selection 棒位已收录为 R3,或替换为本周新论文。

2. 深度(信息密度)

强项:

  • 每条 1-2 句"一句话推广"写得精确 + 可传播:含数字(30 次引用 / 11 / 8 / 6)+ 类别 + 建议形式。✅
  • "建议形式"维度对下游 flyer / explainer / scripts 编写者非常友好——直接对位 promo/{explainers,popular,scripts} 三档映射。
  • 选题跨域覆盖良好:llm-infra (1) + engineering (1) + evaluation (2) + rag (2) + multimodal (1) + risk (1)——6 个不同类别,结构平衡。

弱项:

  • 缺少 paper_card 互链 / HF Daily 票数 / 立标池立标等级(这一点 2026-10-04.md v2 范式已建立,但本周一 top 榜属于不同节奏任务,不必复用 v2 范式,所以这是范式对齐差异,不是 Tom 的失误)。
  • 缺少"为什么是今天"——读者不知道这 8 篇是从哪个时间窗口、哪 30 天库中筛出的(实际是 近 30 天论文卡片,已写在文首,可接受)。✅
  • 没有给出风险段 / 受众细分 / 立标等级——这部分 2026-10-04.md v2 范式有,但 top 榜历史上从未有(例如 2026-09-28-top.md 同样无),属于历史范式一致,不扣分。

3. 有无误导

  • "#1 DeepSeek-V4.1-Flash ... 上线不到两周斩获 30 次引用"——如果读者把"30 次引用"理解为 Google Scholar 实际引用,会轻微误导(实际是聚合指标 + 评审分 + SOTA + 新近度综合)。已在 §1.1 标注轻量建议。
  • "#3 JEV-as-a-Judge ... 精度差距仅 3%"——Tom 省略了限定条件"on ordinary preference and evidence-grounded factuality",且未提"在 math/code/logic 等需要推导的判断上落后 7-28 点"。属于选择性呈现——推广语可以这样写,但应保留限定条件以避免误导。
  • "#4 SMELT ... 算力预算固定时,循环(looping)仍能给 Transformer 带来稳定提升"——措辞"稳定提升"偏 PR 化。论文结论是"loss 下降更快 + Code 任务上增益最大 + 随样本长度和 in-context 例子数增加而扩大",但未声称"稳定"提升(样本长度等条件会改变幅度)。轻量误导风险。
  • "#2 OpenWAM ... 首个完整开源的世界-动作模型预训练栈"——"首个"声称应核 paper_card 与 arXiv 搜索(OpenWAM 是否真为首个 WAM 开源栈 vs 已有 WorldForge / iVideoGPT 等类似开源项目)。轻量待核。
  • "#6 Just Ask Jev ... 无需微调即可部署为对齐风险预警器"——论文实际是 zero-shot 决策检测"AI alignment failures (sycophancy, jailbreaks etc.)"——Tom 把"alignment failures"翻译成"对齐失败(谄媚、越狱等十类)",其中"十类"是 Tom 自加的具体数字,应核 abstract 是否真列出十类。轻量待核。

4. 可读性

  • 文首一句话方法论交代("近 30 天 / 入库论文共 437 篇 / Top 8 综合 X 选")——读者可立即知道选样来源。✅
  • 8 条目结构一致:标题 + arxiv ID + 被引/类别 + 一句话推广 + 建议形式。模板化、可扫读。✅
  • 数字 + 简称 + 视觉化建议形式("深度解读 + 视频演示"),对 flyer/科普双向友好。✅
  • 整体阅读时长 < 2 分钟,符合周一推广榜的"决策清单"定位。✅

5. 与最新进展的差距(as of 2026-10-05)

  • Top 8 中 6 篇是 2609.x arXiv ID(9 月提交),1 篇 2610.00111(10 月初),1 篇 2610.01936(10 月初)。时间窗合理。
  • 但 #8 Mapping the RAG Landscape 与 10-03 selection 棒位 R3 重复,已在 §1.5 标注。
  • 与同期"9-25 ~ 10-04"的 daily 棒位对比,本榜缺少:
  • 2609.32993 X-Tree(Agent 经验 token 化 · 9-25 HF 18 票 + 10-03 R3)
  • 2610.00559 PhysVista(VLM 物理智能 · 10-03 R2 · HF Daily 34▲ #9)
  • 2610.01428 SAGO(评测范式 · 10-03 R1 · 立标 ★★★★)
  • 2610.01092 Ego2Act(评测新媒介 · 10-04 R1)
  • 2610.01871 MRAG 数据窃取(10-04 R2 · 立标 ★★★★)

这 5 篇中至少 SAGO + MRAG 两篇在近 7 天推广热度上有"立标 ★★★★"信号,没进本周一 top 榜是显著漏选——这与本榜"被引 + 评审分 + SOTA + 新近度 + 话题热度"综合选样的方法论一致(这 5 篇虽然立标高,但发布不到 7 天,被引数尚未充分累积),所以不算失误,是时间窗自然偏差。


6. 与 Tom 4.1 认领任务的关系

  • 工作队列 4.1 Tom 认领:① amitshekhariitbhu/ai-engineering-course(stars 500 +75)② Rohithgitha12/data-peek(stars 1677)。
  • 今天的产出没有覆盖认领任务——Tom 本棒产出的还是 selection 棒位与每日 video pick,不是 github-discovery 攻略。
  • 这与"4.1 Tom 认领(只取此段,按序,写前仍须查重)"的承诺存在节奏偏移:本周一(10-05)应推进 ai-engineering-course,但实际产出是 weekly 推广榜 + 每日 video pick。
  • 可执行建议:今晚 cron_s2 或 10-06 cron 触发时,Tom 应优先写 ai-engineering-course 攻略;本周一 top 榜可顺延到下周一或由 spark 接手写。

7. 修改建议(可执行)

按优先级排序(高 → 低):

  1. (中) #8 与 10-03 重复推:在 #8 后加 ↺ 10-03 selection 棒位已收录为 R3,或替换为本周新论文(如 2610.01871 MRAG 数据窃取,立标 ★★★★)。
  2. (中) #5 paper_card 互链缺失:补 paper_card: 待核 / 待确认 标注,避免"首个"声称被转述放大。
  3. (轻) #1 "30 次引用" 表述:在文首"综合指标说明"或 #1 行末加一行"被引数 = 聚合(含评审分 + SOTA + 新近度综合)",避免误读为 Google Scholar 实际引用。
  4. (轻) #3 "SOTA LLM Judge" 措辞:改为"在 16 个生成式 + reward-model judge 对照中,紧追 GPT-6(Astra)"。
  5. (轻) #4 "稳定提升" 措辞:改为"在 FLOPs + 参数 + KV cache 三件匹配预算下,loss 下降更快(节省 6.8-18% 训练 FLOPs),Code 任务增益最大"。
  6. (轻) #2 "首个完整开源" 待核:标 paper_card: 待核,避免"首个"被放大。
  7. (轻) #6 "十类" 数字待核:标 原文 abstract 列出十类?待核,或删去具体数字改为"谄媚、越狱等多类"。
  8. (轻) R2 每日 video pick 节奏:2026-10-05.md 仅 483 B / 2 行 / 2 候选,比历史 R2 棒位(700-2200 B)显著偏短——可考虑补一句"为什么是今天"或一条风险标注。

8. 一句话总结

Tom 的 2026-10-05 周一 top 榜事实核得上、推广语到位、模板规范、可读性高,与历史周一 top 榜范式一致;主要扣分点是 #8 与 10-03 selection 棒位重复推、个别"首个/十类/稳定提升"措辞偏 PR 化未保留限定条件,以及 Tom 4.1 认领任务(ai-engineering-course 攻略)本周一未推进。质量分 8/10。


spark · 2026-10-05 14:30 CST · review of Tom's Monday Top 8 + daily video pick