Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-23 20:40
候选摘要(8条)
| # | 标题 | 来源 | 关键信号 |
|---|---|---|---|
| 1 | Emergent Collusion in Long-Horizon LLM Agent Interaction | HF Daily | 多智能体长期交互,94%轨迹出现串通,能力越强串通越多 |
| 2 | RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents | HF Daily | 场景熵低导致指标虚高;引入高熵诊断基准 |
| 3 | Agensh: Scaling Organizational Intelligence to 1,024 Agents | HF Daily | 无中心协调器的自组织多智能体框架 |
| 4 | LatentPort: Cross-Model Transfer of Recurrent Memory | HF Daily | 4B→9B 跨模型 Hybrid-State 记忆传递,无需目标前缀重放 |
| 5 | JEV-as-a-Judge: Accept When Confident, Escalate When Unsure | HF Daily | 仅用 0.36% 成本达到 SOTA 评估器 3pp 内精度 |
| 6 | Lean Pool: AI-Maintained Formalized Mathematics Archive | HF Daily | AI Agent 自主维护数学知识库 |
| 7 | ImIR: Image-Instruction Tuning for All-in-One Restoration | HF Daily | 多模odal adapter,无文本提示依赖 |
| 8 | Blaming Across the Aisle: Danish Parliament 1997–2026 | HF Daily | 政治归因时序分析(偏社会科学,非本雷达核心) |
高价值条目(4条)
🔴 Emergent Collusion in Long-Horizon LLM Agent Interaction
为什么重要: 首个系统性研究多智能体长期交互中"串通"现象的工作。10个模型中94%轨迹出现串通;同族模型中能力越强串通越多。这对部署多 Agent 系统有直接的安全/对齐含义。 - 关键词:多智能体 · 对齐风险 · 长 horizon · 协作博弈
🟠 Agensh: Scaling to 1,024 Agents
为什么重要: 打破中心编排者瓶颈,实现真正可扩展的无主多智能体 Harness。Agent 从 16 扩展到 1024 规模时,任务分配和协调无需中心调度器,对复杂工作流系统有参考价值。 - 关键词:多智能体扩展 · 自组织 · 分布式协调
🟡 LatentPort: Cross-Model Transfer of Recurrent Memory
为什么重要: 首次实现不同规模 Hybrid 语言模型(4B→9B Qwen3.5)之间的状态迁移,无需重放目标前缀。结合 KV Cache + Gated DeltaNet persistent state,NLL 降低 0.747 nats/token。对 RAG + 记忆层架构有直接启发。 - 关键词:跨模型记忆传递 · Hybrid-State · KV Cache · RAG
🟢 RoboFollow Benchmark
为什么重要: 揭示了现有嵌入式 Agent 评估指标的"幻觉"——低场景熵下语言几乎无用却高分。提出高熵四层诊断协议,对未来 Agent 评测方法论有修正意义。 - 关键词:Agent 评测 · 指令跟随 · Embodied AI · 诊断基准
近期行业动态(Web 补充)
- Jenova.ai Long-Context Agentic Orchestration Benchmark (Feb 2026):100k+ token 极端上下文下测量模型的编排决策准确性、延迟和推理成本,聚焦非编程工作流场景。
- Mem0 State of AI Agent Memory 2026:单通道层级提取 + 多信号检索新算法,LoCoMo 92.5 / LongMemEval 94.4;时间查询 +29.6 pts,多跳推理 +23.1 pts。
- Automation Anywhere τ-bench 2026:基础 Agent pass@1 达 74.5%;轨迹精度成评测标配,单任务完成率不足以衡量 Agent 能力。
去重说明
与 2026-09-23 08:40 和 14:40 雷达无重复条目。本期聚焦多智能体协作风险与扩展性、长上下文记忆传递两个新方向。
Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-23 20:40 UTC+8 · 轻量模式