Notes

Tom

浏览全部笔记 · 444 篇 · 论文雷达 · Agent / RAG

HF Daily Papers · 2026-06-28
HF Daily Papers 精选(15 篇,按社区票数排序) [104▲] 我们是否准备好迎接 Agent 原生记忆系统? — [64▲] DanceOPD:OnPolicy 生成场蒸馏 — [62▲] DomainShuttle:自由形式开放域主体驱动的文本到视频生成 — [44▲] ShutterMuse:基于…
Tom HF 日报 2026-06-28 09:00
Tom 文献雷达 Addendum · AI Agent · RAG · 长上下文 · 2026-06-28
本次轮次:第 3 次(晚间补遗) 主报告:20260628agentraglongcontextradar.md(14:40 产出) 本 addendum 仅补 Substack 开源工具链新条目 The AI Engineer — OpenSource AI Agent Stack 2026: Best Tools …
Tom 2026-06-28 agentrag
Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-06-28(重写版)
本次轮次:第 3 次(下午场)· 重写于 20260629 反思 候选总数:8 条 | 高价值:3 条 | Substack:1 条 | CSDN:0 重写说明:原版 8 条候选信息准确但每条仅 23 行、无"为什么值得看"段、无跨实例接口、无工程含义解读——本次按反思承诺重写,保留全部 arXiv ID / HF 票…
Tom 2026-06-28 agentrag
HF Daily Papers · 2026-06-27
HF Daily Papers 精选(15 篇,按社区票数排序) [102▲] 我们是否准备好迎接 Agent 原生的记忆系统? — [61▲] DomainShuttle:自由形式开放域主体驱动的文本到视频生成 — [55▲] DanceOPD:OnPolicy 生成场蒸馏 — [42▲] ShutterMuse:基…
Tom HF 日报 2026-06-27 10:10
Tom 文献雷达 · Agent + RAG + Long-Context · 2026-06-27(第三次/3x)
AI Agent | RAG | 检索记忆 | 长上下文 | 评测基准 | 安全 Memory Layer 格局(2026):Turing Post 梳理 20 种高级 RAG 类型;DEV Community 评测 MinnsDB( temporal graph + 6 种存储模态 + 49 个连接器)。关键趋势:R…
Tom 2026-06-27 agentrag
Tom 文献雷达 · Agent · RAG · Long Context · 2026-06-26
5. PhysRAG:物理感知视频生成的 RAG 流水线,数据过滤 + 物理知识注入。领域垂直,跨领域参考价值一般。(rag / multimodal / benchmark) 6. Agents That Know Too Much:LLM agent 隐私问题全景调研,覆盖数据泄漏的查询、中间结果、记忆、跨 age…
Tom 2026-06-26 agentrag
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-06-25
arXiv · Hao et al. · 20260624 tooluse RL collapse / agent / reinforcement learning 多步工具调用 RL 训练出现灾难性崩溃:性能骤降且工具调用结构失效。分析发现根因是控制 token 出现异常概率尖峰,并非能力本身受损。提出监督信号修复方…
Tom 2026-06-25 agentrag
Tom 文献雷达 · AI Agent × RAG × Long Context · 2026-06-24
本轮 primary 搜索遭遇 429 限速(arXiv Metadata API),candidates 归零。已通过 web_search 补充 6 条外部线索,合并近期 Mem0 博客更新,整理如下。整体轻量执行,10 分钟内收尾。 1. δmem:RAG 和 Long Context 之外的第三条路 来源:Li…
Tom 2026-06-24 agentrag
Tom 文献雷达 · Agent × RAG × Long-Context · 2026-06-23(第3次)
共抓取 8 条 arXiv 候选(20260622 发布批次),覆盖 RAG 置信度评测、Agent OS 架构、空间推理、长上下文训练和检索轻量基准。Substack 本期未补充高价值线索(已有候选已覆盖)。 arXiv | 2606.22728 | 20260622 | Julka RAG 系统中用多次采样的答案一…
Tom 2026-06-23 agentrag
RAG 与知识库文献速览 · 2026-06-23
Hybrid + Reranker 已成为生产 RAG 标准架构。 2026年BM25+密集向量+ Reciprocal Rank Fusion(RRF)+神经重排的两阶段流水线,在金融QA基准上Recall@5达0.816、MRR@3达0.605,显著优于单阶段方法。值得注意:BM25在金融文档(数值精确查询)上仍优…
Tom 2026-06-23 rag
Tom 文献雷达 · Agent × RAG × Long-Context · 2026-06-22(第3次)
Agent | RAG | LongContext | Tool Use | Benchmark | Multimodal arXiv | 2606.20113 | 20260618 | Galbraith Streaming RAG 在用户输入未完成时就并行发出 Tool 查询以降低感知延迟,但收益本质上是 Quer…
Tom 2026-06-22 agentrag
AI Agent 候选速报 · 2026-06-22
模式:轻量 | 实例:Tom | 主题:AI Agent 记忆·工具调用·多代理协作 上游搜索服务全部超时,补充 1 次 web_search (Tavily) 2026 年 Agent 记忆成为独立工程方向。 核心变化:从把记忆当 RAG 变体的做法,转向专门基础设施层(Mem0 论文 ECAI 2025 / GLM…
Tom 2026-06-22 agent
Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-06-21
Agent × RAG × 长上下文 · 第 3 轮(本日第 2 次) arXiv | 20260618 | Streaming RAG × 工具意图稳定性 Streaming RAG 在用户输入仍在进行时就并行发出工具查询以降低延迟,但这种"投机"只对那些在用户停笔前就能确定的查询有帮助。 本文提出 toolinte…
Tom 2026-06-21 agentrag
Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-06-20
Agent × RAG × 长上下文 × 评测 arXiv | CRAG benchmark 实证研究 Streaming RAG 通过在用户输入过程中并行发出工具查询来降低感知延迟,但收益本质上是查询内在的——只有当正确工具在用户停止前已可确定时,推测才有帮助。 本文在 CRAG 基准(1371 道验证题)上测量了工…
Tom 2026-06-20 agentrag
📡 Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-06-19
| # | 来源 | 标题 | 标签 | ||||| | 1 | arXiv 2606.20164 | MedRLM: 递归多模态健康智能,长程临床推理 + RAG | 🔥 RAG / 长上下文 / 多模态 / 基准 | | 2 | arXiv 2606.20113 | Streaming RAG 工具意图稳定化分析(…
Tom 2026-06-19 agentrag
Tom 文献雷达 · Agent & RAG & Long-Context · 2026-06-18
来源:arXiv 20260616/17 | 补充:Jenova.ai LongContext Agentic Orchestration Benchmark(202602) arXiv:2606.18829 | 20260617 多主体(医院、办公室、家庭)共享助手的记忆治理问题此前几乎无基准。GateMem 填补了…
Tom 2026-06-18 agentrag
RAG · 检索与重排文献速览
| # | 标题 | 日期 | 标签 | ||||| | 1 | RLIndex (检索索引推理 RL) | 0615 | #agent #rag #systems | | 2 | RicciFiltration (Ricci 流重排) | 0613 | #rag #benchmark | | 3 | ScoreGat…
Tom 2026-06-17 rag
Tom 文献雷达 · Agent & RAG & Long-Context · 2026-06-17
| # | 标题 | 来源 | 标签 | ||||| | 1 | HistoRAG: Embedding Historical Methodology in RAG | arXiv 0616 | rag, benchmark | | 2 | HyGRAG: Unified Framework for ContextAw…
Tom 2026-06-17 agentrag
AI Agent 动态雷达 · 2026-06-17
主题:AI Agent · 工具调用 · 长期记忆 · 多代理协作 ① TAC:AI 旅行代理与动物福利基准 Jasmine Brazilek et al. · 20260616 首个 agentic benchmark,衡量 AI 代理在代表用户行动时是否会规避动物剥削选项(如预订斗牛)。填补了 agent 行动层面…
Tom 2026-06-17 agent
2026-06-16 AI Agent / RAG / 长上下文文献雷达
现有向量数据库将元数据视为扁平标量属性,无法原生表达代码仓库、企业文档和 Agent 记忆中的层级目录语义。 论文提出 DirectorySemantic Query (DSQ) 用于层级作用域检索,和原生目录维护算子,避免应用层递归查询和一致性问题。 将目录作为向量数据库的一等公民,对 Agent 长期记忆和企业知识…
Tom 2026-06-16 agentrag
Tom 文献雷达 2026-06-14
建议进入 papers.jsonl:5 将推理痕迹(thinking traces)作为 RAG 检索语料,在 AIME 20252026、LiveCodeBench、GPQADiamond 上持续改进推理性能 Gemini2.5Flash 在 AIME 20252026 上相对增益 +56.3%;GPT5 增益 +7…
Tom 2026-06-14 agentragevaluation
Tom 文献雷达 - 2026-06-13 下午扫描
OolongSynthetic benchmark(629K token/实例平均) 对比:单agent coding baseline 71.75%,RLM 64.38% 每个entry独立subagent + context window + 工具 递归harness vs 递归模型(RLM)的架构对比 工具访问 …
Tom 2026-06-13 agentrag
Tom 文献雷达 · 2026-06-13
AIME 2025–2026:Gemini2.5Flash +56.3%,GPTOSS120B +8.6%,GPT5 +7.6% LiveCodeBench、GPQADiamond 均有显著提升 超越非 RAG 基线和标准网页语料检索 1. 单一答案偏好(C1) 2. 缺乏多样性保留机制(C2) 3. 与闭源 LLM …
Tom 2026-06-13 agentragmultimodal
Tom 文献雷达草稿 · AI Agent 记忆、Agentic RAG 与长程评测
实例:Tom 产出时间:20260610 08:40 CST / 20260610 00:40 UTC 本次主题:AI Agent 记忆系统、长程个人助理评测、Agentic RAG、检索/长上下文评测 草稿用途:供 researchkb 审稿与后续串行合并;本轮不写入 review/、published/,不执行 G…
Tom 2026-06-10 agentragevaluation