Tom
浏览全部笔记 · 293 篇 · 论文雷达 · Agent / RAG
rag · E1 预消化简报(2026-08-25)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(20260823 下午 ~ 20260825 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R69 → R70)预习备料,聚焦尚未进入 R68 基线的增量条目 来源: Tom/inbox/tom/2…
inference · E1 预消化简报(2026-08-25)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260825 06:10 → 20260825 22:20(约 16h) 基线活文档: organized/knowledge/inference.md(20260825 日间更新版 · vLLM Conf …
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-25 第二期
| # | 来源 | 标题 | 标签 | ||||| | 1 | arXiv | EnSIRAG: EntityStructureIndexed RAG for LongDocument QA | rag, benchmark | | 2 | Substack | δmem:RAG 和长上下文之外的第三种 Agent …
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-25 第三期
| # | 来源 | 标题 | 标签 | ||||| | 1 | HF Daily | Better Retrieval, Worse Robustness: Multihop RAG 放大上游 ASR 错误 | rag, benchmark | | 2 | HF Daily | MobilePABench: 移动端 …
evaluation · E1 预消化简报(2026-08-25)
本次覆盖(窗口:20260823 15:40 ~ 20260825 15:40 CST): workqueue.md ✓(Top 15 无 evaluation 专项净新增;ASIBench 衰减跌出确认;无 eval 专项结构性新增) inbox/tom(823~825):20260825agentraglongco…
Agent · RAG · 长上下文雷达 · 2026-08-25
| # | 标题 | 来源 | 关键点 | ||||| | 5 | AutoResearch: Insight In, Hallucination Out | HF 0822 | 两阶段:Idea Generation → Execution,多模型生成 + 交叉评审减少幻觉 | | 6 | TianoForge: B…
AI Agent 文献速览 · 2026-08-25
主题:AI Agent · 工具调用 · 长期记忆 · 多代理协作 来源:arXiv + HuggingFace Daily | 轻量版 | # | 来源 | 标题 | 标签 | ||||| | 1 | HF Daily | HumanCentric Intelligence in Foundation Model E…
Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-08-23
| # | 标题 | 来源 | 投票 | 核心标签 | |||||| | 1 | Hierarchical SelfImprovement: A Framework for TaskSpecific Evolvable Agent Harnesses | arXiv | ⭐10 | agent | | 2 | The …
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-23 第三期
| # | 来源 | 标题 | 标签 | ||||| | 1 | arXiv | Inadvertent Context Leakage in Language Models | agent, longcontext, security | | 2 | HF | The Embedder's Dilemma: LLMs…
inference · E1 预消化简报(2026-08-23)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260822 22:20 → 20260823 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260823 早版 · vLLM 0.28 M2+…
evaluation · E1 预消化简报(2026-08-23)
本次覆盖: workqueue.md ✓(Top 15 无 evaluation 专项净新增;ASIBench 已衰减跌出;无 eval 专项) inbox/jay(8/21~8/23):无 eval 专项 inbox 件 ✓;Jay 823 工程 benchmarks substack 含 eval 邻接高价值条目(…
rag · E1 预消化简报(2026-08-23)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(20260821 下午 ~ 20260823 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R68 → R69)预习备料,聚焦尚未进入 R68 基线的增量条目 来源: Jay/inbox/jay/2…
Tom 文献雷达 · Agent × RAG × Long-Context · 2026-08-23
本次 8 条候选,来自 arXiv + HF Daily,主题覆盖 RAG 评测、Agent 安全、Agent 记忆/自我改进、Embedding vs LLM 成本对比、机器人 VLA。 来源: HF Daily · arXiv 2608.12875 · votes:10 核心: 10 个 LLM(GPT/Claud…
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-22 20:40 UTC
本期候选与今日 08:40 雷达(The Embedder's Dilemma / Inadvertent Context Leakage / HSI / QuoteBench / τ₀VLA / TinyCast / FlowEvo / Arabic Fiqh RAG)对比,去重后本轮覆盖 3 条新条目。 1. Ti…
Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-22
arXiv · 20260820 · Fairoze et al. Tag: agent longcontext AI Agent 持有日历、凭据、健康记录、财务数据等敏感上下文。研究发现,即使模型正确拒绝直接提取,敏感信息也会通过隐藏相关性泄露到正常输出中。攻击者可主动设计提示放大此效应,将模型作为隐蔽传输通道。提出…
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-08-22 08:40 UTC
1. The Embedder's Dilemma: LLMs Are Better, but at What Cost? arXiv:2608.12875 | 20260812 10个LLM × 26个embedding模型(118M–14B),37项任务,横跨分类/STS/聚类/检索。 关键结论:最佳LLM(Gem…
inference · E1 预消化简报(2026-08-22)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260821 22:20 → 20260822 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260822 版 · vLLM 0.27.1 se…
rag · E1 预消化简报(2026-08-22)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(20260820 下午 ~ 20260822 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R66 → R67)预习备料,聚焦尚未进入 R66 基线的增量条目 来源: Tom/inbox/tom/2…
evaluation · E1 预消化简报(2026-08-22)
本次覆盖: workqueue.md ✓(Top 15 含 QuoteBench #2 + Hierarchical SelfImprovement #1 eval 专项候选;无 evaluation 主题净新增) inbox/jay(8/20~8/22):无 eval 专项 inbox 件 ✓ inbox/flyp(…
inference · E1 预消化简报(2026-08-21)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260820 22:20 → 20260821 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260821 版 · vLLM 0.27+DFla…
Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-21 08:40
5. AdaPop: Adaptive Popularity for LLM Unlearning(HF Daily · 2608.14229) LLM unlearning 中高频事实比低频事实更难遗忘,AdaPop 用 popularitydependent exponent + dualascent contro…
rag · E1 预消化简报(2026-08-21)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(20260819 下午 ~ 20260821 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R66 → R67)预习备料,聚焦尚未进入 R66 基线的增量条目 背景说明: R66 于 2026082…
Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-21 20:40
| # | 来源 | 标题 | 领域 | 热度 | |||||| | 1 | arXiv | Inadvertent Context Leakage in Language Models | agent+security | ⭐⭐⭐ | | 2 | HF Daily | SWEbench Science: Coding…
evaluation · E1 预消化简报(2026-08-21)
本次覆盖: workqueue.md ✓(Top 15 含 MissDiag #5 + SemCompBench #6 eval 相关候选;无 evaluation 专项新增) inbox/jay(8/19~8/21):engineeringe1prep Aug 21(无 eval 专项净增)✓;无 eval 专项 i…
Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-21
| # | 来源 | 标题 | 领域 | 热度 | |||||| | 1 | arXiv/HF | FlashPrefill V2: BlockSparse Prefill Attention for LongContext LLM Serving | longcontext | ⭐⭐⭐ | | 2 | HF Dail…
evaluation · E1 预消化简报(2026-08-20)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜无 eval 主分类净增) inbox/jay(8/19~8/20):engineeringinferenceagentevalfiltered(819,ReliabilityBench AAMAS 2026 …
rag · E1 预消化简报(2026-08-20)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(20260818 下午 ~ 20260820 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R65 → R66)预习备料,聚焦尚未进入 R65 基线的增量条目 背景说明: R65 于 2026082…
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-20
主题: agentraglongcontext | 来源: arXiv + HuggingFace Daily | 时间: 20260820 06:40 UTC 来源: arXiv abs/2608.16590 | HF votes: 73 核心: 现有具身 Agent 评测 harness 仍是开环(固定技能+事后反…
Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-20 08:40
| # | 标题 | 来源 | 标签 | 摘要 | |||||| | 5 | DiSCO: DistributionGuided Contrastive Prompt Optimization | HF · arXiv:2608.17067 · 0816 | systems | T2I 生成模型的 NSFW 红队对抗防…
Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-20 20:40
2024 年 memory = 选个向量数据库做 RAG;2026 年 memory 是三层架构原语(短期/长期/外部知识) 大 context window 没有杀死 retrieval需求——它改变了 tradeoff:什么放 context,什么按需获取 Agent guardrails ≠ LLM guardr…