Tom 文献雷达 · Agent + RAG + Long-Context · 2026-08-13
本期高价值候选(3 条)
⭐⭐⭐ CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG
标签: rag long-context benchmark systems
来源: HF Daily · votes:4 · 2026-08-06
Chunk 级 KV cache 复用已是 RAG 优化常见思路,但粗粒度 chunk 仍存在信息冗余和噪声。CoinRAG 将 chunks 进一步切分为 "Information Nuggets",离线预计算其 KV cache,在线推理时只组合相关 nugget,在低 prefill 延迟约束下优化精度-效率 Pareto 前沿。名称隐喻:用小额"硬币"累积大价值。对长上下文 RAG 系统工程优化有直接参考价值。
⭐⭐⭐ Decoding-Level Taboo: LLM Robustness 诊断压力测试
标签: benchmark systems
来源: HF Daily · votes:12 · 2026-08-09
现有 LLM 评测聚焦标准条件,掩盖了真实部署中 system prompt、guardrails、structural constraints 强制模型偏离"舒适生成走廊"导致的性能分化。Decoding-Level Taboo 在 logit 空间动态 mask primary token,强制模型离开 nominal path,实现零 prompt 诊断。对评估 Agent 系统鲁棒性(决策稳定性、安全边界)有方法论参考。
⭐⭐ 360CityArena: 具身 Agent 城市导航基准
标签: agent benchmark multimodal
来源: HF Daily · votes:9 · 2026-08-08
基于东京秋叶原 602 段 360° 视频重建的 photorealistic 虚拟城市环境,含 175 个精心设计任务,覆盖 Environment Understanding / Path Reasoning / Spatial Reasoning 三类。现有户外基准缺乏足够真实感或复杂度,360CityArena 填补了这一具身 Agent 评测缺口。适合评估多模态 Agent 在真实城市场景的空间推理能力。
其他候选(5 条)
| 标题 | 标签 | 备注 |
|---|---|---|
| InSight-doc · Agentic 视觉长文档理解 | agent systems |
自适应分辨率 zoom-in,SFT+RL 训练;已在 2026-08-12 雷达覆盖 |
| DistilVDR · 524M 端到端视觉文档检索 | rag multimodal |
双侧蒸馏 8B→524M;已在 2026-08-12 雷达覆盖 |
| Articulated Object Reconstruction from Rest-State | research |
单帧重建关节物体几何+运动先验;非核心主题 |
| UniMoMo · MoE 专家合并加速推荐模型 | research |
功能相似性而非参数距离合并专家;推荐系统专用 |
| Power Law Graph Attention | systems |
幂律注意力的精确泛化理论;高门槛理论工作 |
Substack 线索
- LongRAG (MLnotes/Angelina Yang): 长上下文 LLM + RAG 组合框架,NQ EM 62.7%、HotpotQA EM 64.3%,corpus 缩小 30 倍、召回提升约 20%。来源较旧(2026-03),属成熟方向整合,非新进展。
- AIxFunda March Week 4 2026 周报含 GLM-5.1(Z.ai)、SkillRouter(RAG+Agent 技能路由)、Adaptive Chunking 等条目,时间偏差较大,仅作方向参考。
去重备注
- InSight-doc、DistilVDR 已由 2026-08-12T2040 雷达覆盖,本期不再重复高价值标注。
- CoinRAG 为本期待选中最直接关联长上下文 RAG 工程优化的新工作。
Tom 文献雷达 · 轻量模式 · 2026-08-13T00:40 UTC