Tom 文献雷达 · Agent + RAG + Long-Context · 2026-08-13

本期高价值候选(3 条)

⭐⭐⭐ CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG

标签: rag long-context benchmark systems 来源: HF Daily · votes:4 · 2026-08-06

Chunk 级 KV cache 复用已是 RAG 优化常见思路,但粗粒度 chunk 仍存在信息冗余和噪声。CoinRAG 将 chunks 进一步切分为 "Information Nuggets",离线预计算其 KV cache,在线推理时只组合相关 nugget,在低 prefill 延迟约束下优化精度-效率 Pareto 前沿。名称隐喻:用小额"硬币"累积大价值。对长上下文 RAG 系统工程优化有直接参考价值。


⭐⭐⭐ Decoding-Level Taboo: LLM Robustness 诊断压力测试

标签: benchmark systems 来源: HF Daily · votes:12 · 2026-08-09

现有 LLM 评测聚焦标准条件,掩盖了真实部署中 system prompt、guardrails、structural constraints 强制模型偏离"舒适生成走廊"导致的性能分化。Decoding-Level Taboo 在 logit 空间动态 mask primary token,强制模型离开 nominal path,实现零 prompt 诊断。对评估 Agent 系统鲁棒性(决策稳定性、安全边界)有方法论参考。


⭐⭐ 360CityArena: 具身 Agent 城市导航基准

标签: agent benchmark multimodal 来源: HF Daily · votes:9 · 2026-08-08

基于东京秋叶原 602 段 360° 视频重建的 photorealistic 虚拟城市环境,含 175 个精心设计任务,覆盖 Environment Understanding / Path Reasoning / Spatial Reasoning 三类。现有户外基准缺乏足够真实感或复杂度,360CityArena 填补了这一具身 Agent 评测缺口。适合评估多模态 Agent 在真实城市场景的空间推理能力。


其他候选(5 条)

标题 标签 备注
InSight-doc · Agentic 视觉长文档理解 agent systems 自适应分辨率 zoom-in,SFT+RL 训练;已在 2026-08-12 雷达覆盖
DistilVDR · 524M 端到端视觉文档检索 rag multimodal 双侧蒸馏 8B→524M;已在 2026-08-12 雷达覆盖
Articulated Object Reconstruction from Rest-State research 单帧重建关节物体几何+运动先验;非核心主题
UniMoMo · MoE 专家合并加速推荐模型 research 功能相似性而非参数距离合并专家;推荐系统专用
Power Law Graph Attention systems 幂律注意力的精确泛化理论;高门槛理论工作

Substack 线索

  • LongRAG (MLnotes/Angelina Yang): 长上下文 LLM + RAG 组合框架,NQ EM 62.7%、HotpotQA EM 64.3%,corpus 缩小 30 倍、召回提升约 20%。来源较旧(2026-03),属成熟方向整合,非新进展。
  • AIxFunda March Week 4 2026 周报含 GLM-5.1(Z.ai)、SkillRouter(RAG+Agent 技能路由)、Adaptive Chunking 等条目,时间偏差较大,仅作方向参考。

去重备注

  • InSight-doc、DistilVDR 已由 2026-08-12T2040 雷达覆盖,本期不再重复高价值标注。
  • CoinRAG 为本期待选中最直接关联长上下文 RAG 工程优化的新工作。

Tom 文献雷达 · 轻量模式 · 2026-08-13T00:40 UTC