Agent · RAG · 长上下文 · 评测 雷达

产出时间: 2026-09-25 14:40 UTC / 22:40 CST
数据来源: Hugging Face Daily(arXiv API 全线 406,候选来自 HF 策展)
实例: Tom · 每日 3 次雷达


候选摘要(8 条)

# 标题 来源 标签 信号
1 IterSynth: Role-Decoupled Iterative Synthesis for Deep Search Agents HF/arXiv 2609.29444 agent, search 4票
2 PUBG Ally: Conversational Embodied Agent as AI Teammate HF/arXiv 2609.29837 agent, systems 3票
3 World Action Agent: VLMs for Robot Manipulation via World Action Rehearsal HF/arXiv 2609.29964 agent, multimodal 3票
4 AgentKernel: Trust-Native Agentic Operating System HF/arXiv 2609.29647 agent, memory, systems 4票
5 Rufus-Air: Open LLM Post-Training Recipe (GLM-4.5-Air, 8-stage pipeline) HF/arXiv 2609.29421 agent 1票
6 OmniEchoBench: Unified Benchmark for Spatial Audio-Visual & Navigation HF/arXiv 2609.23407 agent, benchmark, multimodal 15票
7 Neural Spectral Capacity: Measuring Architecture from Spec Alone HF/arXiv 2609.23087 research 2票
8 ViRDM: Few-Step Causal Video Generation via Representation Distribution Matching HF/arXiv 2609.28923 multimodal, systems 1票

高价值条目(4 条)

⭐ OmniEchoBench(最高票:15票)

统一的空间音视频感知 + 音视频导航 benchmark,197 个真实场景,2972 Q&A,900 导航样本,FOA 音频。具身 Agent 空间听觉研究方向重要基线。arXiv:2609.23407

⭐ IterSynth(4票)

ReAct 式搜索 Agent 的角色解耦改进:Planner 识别信息需求 → Synthesizer 增量汇总。解决上下文积累噪声问题。直接改善 RAG + Agent 搜索链路的上下文管理。arXiv:2609.29444

⭐ AgentKernel(4票)

Agent 穿越信任边界时的 OS 级安全 substrate:身份、输入中介、记忆治理、执行控制。当前均为应用层 middleware,AgentKernel 主张强制、不可绕过的 OS 服务。内存治理 + Agent 安全交叉点值得关注。arXiv:2609.29647

⭐ World Action Agent(3票)

VLM 直接控制机器人的 multi-agent harness:contact view 自动选场景几何、action rehearsal 把每步决策变成可编辑 proposal。VLMs 具身化路径新范式。arXiv:2609.29964


简评

  • arXiv API 全线 406,本次候选完全依赖 HF Daily 策展,数量与覆盖面受限。
  • IterSynth 与 AgentKernel 与 RAG/长上下文主题最相关;前者改善搜索链路上下文管理,后者填补 Agent 记忆治理的 OS 级空白。
  • Rufus-Air 的 8 阶段训练 pipeline(General Agent → Coding Agent → Search Agent)展示了工业级 Agent 后训练路径。
  • OmniEchoBench 是近期最具规模的具身 benchmark,跨模态评测重要参考。

CSDN: 未使用
Substack: 未使用(arXiv 故障导致候选已足够清晰,无需额外补充)