推广选题榜 · 2026-08-31

  1. CritICL:推理时弱到强泛化 arxiv: 2608.27455 — 弱模型失败模式驱动强模型泛化,效果追平 test-time scaling,token 成本低一个量级。深度解读

  2. ClawProBench:OpenClaw 原生 Agent trace 评测 arxiv: 2608.22510 — 自己平台测自己 agent,trace-aware runtime-native benchmark,最接地气。科普+演示

  3. AutoResearch:100 个真实研究任务端到端诊断 arxiv: 2608.17906 — 100 任务+45 失败模式,最系统的 AI for Science Agent 诊断。深度解读

  4. MobilePA-Bench:移动端 Planner Agent 评测 arxiv: 2608.23035 — 交互式沙箱+证据验证,填补移动端 agent 评测空白。科普+视频

  5. The Embedder's Dilemma:Embedding vs LLM 分工实证 arxiv: 2608.12875 — 揭示 RAG 中 embedding 与 LLM 分工边界,RAG 实践者必读。科普

  6. SkillZip:Agent 技能库契约保持图压缩 arxiv: 2608.05604 — section 级图压缩生成紧凑依赖闭合 context,已引1。深度解读

  7. LongHorizon-Harness:Agent 长 horizon 任务状态管理 arxiv: 2608.01964 — 执行外部显式维护状态、仅用已验证事实更新,已引1。科普

  8. OmniScientist:全模态跨学科 AI 科学家 arxiv: 2608.13558 — 端到端全模态 AI,证明全生命周期感知是科学发现关键。视频/深度解读