推广选题榜 · 2026-09-14


1. TempCloze:Video-LLM 能否识别缺失的中间片段? arxiv: 2609.01515 推广理由:Video-LLM 的时序推理 benchmark 长期依赖语言中介,容易被措辞捷径绕过。TempCloze 以纯视觉视频完形填空格式重建评测基准,1521 个视频全部经过严格筛选,是当前最干净的 Video-LLM 时序推理 benchmark,对推动多模态模型真正「看见」时间逻辑意义重大。 建议形式:深度解读


2. Last Translation Benchmark arxiv: 2609.04173 推广理由:机器翻译标准 benchmark 正在饱和,自动指标易被 reward-hacking,人工评估缺乏可复现性。Last Translation Benchmark 直接回应「如何衡量 SOTA 边界」这一紧迫问题,是当前 MT 评测领域最值得关注的建设性提案。 建议形式:深度解读


3. Think Before You Link:多语言实体链接中的稀有性、推理与检索 arxiv: 2609.10745 推广理由:SOTA 实体链接系统在稀有实体上准确率骤降 15.4–39.9%——而且这个「稀有」是用知识图谱结构指标重新定义后才暴露的,此前流行的 popularity 指标完全遗漏了这些失败案例。这个发现对所有 RAG + 知识图谱系统的工程实践有直接警示价值。 建议形式:深度解读


4. Beyond Retrieval:面向流式视频理解的渐进式潜在记忆演化 arxiv: 2609.04131 推广理由:现有流式视频理解将历史观测存在外部记忆库,检索出来作为额外上下文——这篇文章提出应将历史证据「内化」为紧凑演化的潜在记忆,引导持续推理,而非每次重新检索。这是记忆机制研究的一个新范式分化点。 建议形式:科普


5. VibeVoice-ASR-Streaming:首批 LLM 流式说话人归属 ASR arxiv: 2609.02812 推广理由:端到端统一模型一次性完成 ASR + 说话人 diarization 已是过去式;VibeVoice-ASR-Streaming 在流式设定下实现同样能力,延迟低至实时水准,是语音 Agent 实时交互的一个关键底层突破。 建议形式:科普/视频


6. ActReview:基于反驳引导的可操作同行评审生成 arxiv: 2609.09076 推广理由:LLM 用于同行评审已不新鲜,但 ActReview 分解出「诊断性主张」+「修改建议」两个子任务,并用作者 rebuttal 作为 grounding 信号——这是一个真正解决「评审意见太抽象、无法落地」痛点的工作,对 AI 辅助学术写作生态有直接贡献。 建议形式:深度解读


7. UniMate:一个统一模型驱动多样化骨骼动画 arxiv: 2609.05415 推广理由:无需测试时优化、无需针对每个骨骼重新训练,在质量、泛化性、效率三项指标上均超越 SOTA 基线。这类「一个模型通吃多种骨架」的 универсальный 工作在游戏、机器人、数字人领域都有直接应用场景。 建议形式:视频/科普


8. Sparse Readout Prism:用特征而非 token 解释 Logit-Lens 分数 arxiv: 2609.01936 推广理由:Logit-Lens 类方法长期存在「语料条件性」问题——不同拟合语料的 lens 对同一隐藏状态报告不同 token。Sparse Readout Prism 从 readout 结构本身出发,给出了一个干净的理论解释 + 解决方案,对 LLM 可解释性研究有基础性贡献。 建议形式:深度解读