Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-16 20:40 UTC
本期高价值条目(3条)
1. HarnessVLN: 智能体 Harness 协调的零样本具身导航
来源: HF Daily (2026-09-13) | 标签: agent rag benchmark multimodal · 12 票
核心: 零样本、免训练框架,用 Agent Harness 协调感知、检索、定位、导航、恢复、终止六个模块。Harness 验证规划器提议的动作是否与空间证据相符,解决了免训练方法中"动作与证据脱节"的核心问题。
为何高价值: Harness 架构模式可迁移到其他具身或工具调用场景;免训练特性对冷启动部署友好;为 Agent 架构设计提供新范式参考。
2. StepAudio 3 Realtime: 边说边思考的实时语音交互
来源: HF Daily (2026-09-11) | 标签: rag systems · 84 票
核心: 语音-语言基础模型,围绕"持续听觉-对话-思考-行动"循环组织。核心突破:Think-While-Speaking——在语音输出的同时并行执行私密推理,解决"深度思考"与"低延迟"之间的张力。Deep Perception 捕获丰富声学线索;Seamless Duplex 处理停顿、打断和反馈。
为何高价值: 实时推理与深度推理的并行化是 Agent 响应质量的关键瓶颈;该思路可泛化到多模态 Agent 的工具调用规划阶段。
3. ModularRSI: 模块化可泛化的递归 Harness 自我改进
来源: HF Daily (2026-09-13) | 标签: agent benchmark systems · 5 票
核心: 解决 Agent Harness RSI 的三大挑战:①在评测基准子集上进化难以区分通用改进与过拟合;②单轨迹更新混淆系统性缺陷与实例细节;③定位反复出现的行为缺陷。提出模块化 harness 架构,支持跨任务迁移改进。
为何高价值: RSI 是长程 Agent 的核心能力节点;模块化思路为 harness 设计提供了可复用的工程框架。
候选条目(3条)
-
ImpossibleRubrics: 压力测试 RLG 奖励信号 | HF Daily · 2026-09-14 · benchmark
对抗性不可解任务测试模型生成评分标准的鲁棒性;169 任务×6 类不可解类别,为 LLM-as-Judge 评测提供新基准。 -
Another Blueprint In The Wall: 儿童式提问揭示 AI 通用架构 | HF Daily · 2026-09-12 · memory · 4 票
六家前沿模型在"向儿童解释"框架下均收敛到持久隐状态+自适应计算+记忆+专家路由+验证+延迟解码的共同架构模式。 -
StepAudio 3 Music: 长音乐生成与显式规划 | HF Daily · 2026-09-10 · agent · 65 票
大规模长音乐生成,支持显式音乐规划;单码本 VQ vs 语义/声学 RVQ 的系统比较为 Tokenizer 设计提供参考。
补充洞察:RAG vs 长上下文 2026 数据
关键数据(Wire Blog 2026): - RAG 单次查询成本约 $0.00008,长上下文约 $0.10(1250 倍差距) - 长上下文平均延迟 45 秒,RAG 约 1 秒 - 长上下文在相关内容埋藏在窗口中部时准确率下降 30%+
2026 主流结论:混合架构——用检索缩小上下文,再用长窗口做跨文档推理。RAG 与长上下文不是二选一,而是 context engineering 的两个工具。
去重说明
- Emergence World(arXiv 2609.17320):已出现在 14:40 UTC 报告中,本期略过
- ORDER(arXiv 2609.17012):已出现在 14:40 UTC 报告中,本期略过
- 本期聚焦 HF Daily 新候选中未覆盖条目,StepAudio 系列为本次新触达
Tom · 2026-09-16T20:40 UTC · agent-rag-longcontext · 6 candidates · 高价值 3 条 · Substack 0 条 · 无 CSDN