解读
101 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
视频选题榜 2026-07-22
· FlashRT: Agent Harness for Guiding Agents to Deploy RealTime Multimodal Applications · 让通用 coding agent 自动把多模态参考实现转成多 GPU 高效部署 — placement + streaming + intra…
视频选题榜 2026-07-21
· SpecBench: Measuring Reward Hacking in LongHorizon Coding Agents · 把 reward hacking 做成 0/1 可测的 hacking gap · round=R1 · AgentLens: ProductionAssessed Trajecto…
视频选题榜 2026-07-20
· HyEmbodiedRxBrain: 具备语言视觉联合推理与想象的具身认知基础模型 · 同段规划序列压 VLM 派 vs 世界模型派两半割裂 · round=R1 · Demystifying OnPolicy Distillation · 三类角色 + 五类病态 + 三条调控 · 信号质量 教师规模 · roun…
推广选题榜 · 2026-07-20
1. Agentic RAG Survey · arxiv: 2501.09136 353 citations / ACL 2026,Agentic RAG 最全分类法(规划/检索编排/记忆/工具调用),入门必读图谱。→ 深度解读 2. InftyThink · arxiv: 2503.06692 ICLR 2026,…
视频选题榜 2026-07-19
· Rethinking the Evaluation of Harness Evolution for Agents · 自动 harness 演化 ≠ scaling:留出任务上几乎不优于 baseline · round=R1 · Demystifying RL for LongHorizon ToolUsing…
视频选题榜 2026-07-18
· Reliability without Validity: A Systematic, LargeScale Evaluation of LLMasaJudge Models Across Agreement, Consistency, and Bias · kappa deflation 33–41 pp 直接打…
视频选题榜 2026-07-17
· Vesta · 把定位、空间推理、导航、长程规划塞进一个具身基础模型 · 统一 backbone + 多模态记忆 harness 替代多专家集成栈,跨 benchmark 平均 20% / 10% / 真实机器人 35% · round=R1 · BLINK · 14 项经典 CV 任务改写为 3807 道多选题 …
视频选题榜 2026-07-15
· Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity · 用 PKM 稀疏寻址把 GDN 状态容量扩三阶 · isoFLOP 下 1M tokens 长召回显著超 GDN · round=R2 · WeaktoStrong Ge…
视频选题榜 2026-07-14
· Mamba3: Improved Sequence Modeling using State Space Principles · 三项正交改进(trapezoidal + complex + MIMO)推进次二次 Pareto 前沿 · round=R2 · Nemotron 3 Super: Open, Eff…
推广选题榜 · 2026-07-13
选自近 30 天 paper_cards,重点考量:被引、影响力被引、⭐评级、新近度、话题热度。控制 800 字内。 1. QwenRobotManip · arxiv: 2606.17846 对齐释放机器人操作基础模型的规模化潜力 被引 8 | 影响力被引 2 | RoboChallenge 第1(SOTA)| 真实…
视频选题榜 2026-07-13
· JetLong: Efficient LongContext Extension with Dynamic Bifocal RoPE · 动态双焦 RoPE 拆短程保真 + 长程可缩放窗口 · H100 长上下文 prefill = FA2 1.39× · RULER +4.79/+2.18/+2.03 pp · …