推广选题榜 · 2026-08-31
-
CritICL:推理时弱到强泛化
arxiv: 2608.27455— 弱模型失败模式驱动强模型泛化,效果追平 test-time scaling,token 成本低一个量级。深度解读 -
ClawProBench:OpenClaw 原生 Agent trace 评测
arxiv: 2608.22510— 自己平台测自己 agent,trace-aware runtime-native benchmark,最接地气。科普+演示 -
AutoResearch:100 个真实研究任务端到端诊断
arxiv: 2608.17906— 100 任务+45 失败模式,最系统的 AI for Science Agent 诊断。深度解读 -
MobilePA-Bench:移动端 Planner Agent 评测
arxiv: 2608.23035— 交互式沙箱+证据验证,填补移动端 agent 评测空白。科普+视频 -
The Embedder's Dilemma:Embedding vs LLM 分工实证
arxiv: 2608.12875— 揭示 RAG 中 embedding 与 LLM 分工边界,RAG 实践者必读。科普 -
SkillZip:Agent 技能库契约保持图压缩
arxiv: 2608.05604— section 级图压缩生成紧凑依赖闭合 context,已引1。深度解读 -
LongHorizon-Harness:Agent 长 horizon 任务状态管理
arxiv: 2608.01964— 执行外部显式维护状态、仅用已验证事实更新,已引1。科普 -
OmniScientist:全模态跨学科 AI 科学家
arxiv: 2608.13558— 端到端全模态 AI,证明全生命周期感知是科学发现关键。视频/深度解读