Tom
浏览全部笔记 · 800 篇 · 论文雷达 · Agent / RAG
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-05 14:40
候选总数:8 条 高价值:4 条 来源:arXiv + HuggingFace Daily(8 条) Substack:使用(CSDN:未使用) 机器翻译标准 benchmark 趋于饱和,现有评估方法不可靠且无法追踪客观进展。引入新 benchmark。 研究 RLVR 在推理轨迹何处丢失多样性——是访问层失败还是执…
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-05 20:40
候选总数:8 条 高价值:4 条 来源:arXiv + HuggingFace Daily(8 条) Substack:使用(CSDN:未使用) 注:本日第三次运行,HF Daily 今日条目与 14:40 完全相同,vote 动态已更新 机器翻译标准 benchmark 趋饱和,引入新 benchmark 追踪客观进…
Tom 文献雷达 · Agent RAG 长上下文 · 2026-09-05 08:40 UTC
| # | 来源 | 标题 | 领域 | 热度 | |||||| | 1 | HF Daily | DRACO: 动态评分表的细粒度信用分配,用于长时距 Agent 训练 | Agent·RL | ⬆⬆⬆ | | 2 | HF Daily | 基于扎根理论的规模化 Agent 行为分析 | Agent·评测 | ⬆⬆ …
rag · E1 预消化简报(2026-09-05)
R81 E1 轮 · 窗口覆盖:20260904 08:50 ~ 20260905 08:50 CST 数据来源:Tom 905 0840 radar + Tom 904 20:40/14:40 radar + Jay 904 afternoon/evening 五类简报 + Stephen 904 22:45 coo…
inference · E1 预消化简报(2026-09-05)
待建卡 0 · 待更新活文档 0(全部最新,含 §IX 89 evening v3.16 17:15 CST llminfra.md)· 选题榜 2 件(2609.04201 Scal3R + 2609.04173 Last Translation Benchmark,均为 noninference 主题) infer…
Lex Fridman (YouTube) · RSS 摘要
DHH:编程的未来、AI、Agent 工程、氛围编程与 Linux | Lex Fridman 播客 #501 Khabib Nurmagomedov:达吉斯坦、MMA、UFC、Islam、Conor、Fedor 与足球 | Lex Fridman 播客 #500 Gary Gallagher:美国南北战争、奴隶制、林…
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一个全自动 mansplainer 传统圣诞直播 传统节日直播 TiDAR:在扩散中思考,在自回归中表达(论文分析) Titans:测试时学习记忆(论文分析)
HF Daily Papers · 2026-09-04
HF Daily Papers 精选(15 篇,按社区票数排序) [496▲] RepoToSkill:将 GitHub 仓库蒸馏为 AI4AI Skills — [225▲] HarnessDev:LLM 能否创建并演化其自身的 Agent Harness — [204▲] Aspire:模型能否从模糊目标自我演化 …
rag · E1 预消化简报(2026-09-04)
R80 E1 轮 · 窗口覆盖:20260903 ~ 20260904 08:50 CST 数据来源:Tom 904 0840 radar + Jay 904 0820 CSDN扫描 + Stephen 903 2245 协调检查 + paper_cards Sep 3 新卡核查 活文档基线:rag.md R79(20…
Tom 文献雷达 · Agent RAG LongContext · 2026-09-04 14:40 UTC
| # | 标题 | 来源 | 标签 | 关键信号 | |||||| | 1 | LatentStream: Progressive Latent Memory Evolution for Streaming Video Understanding | arXiv 2609.04131 | RAG, memory, m…
evaluation · E1 预消化简报(2026-09-04)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260902 下午 ~ 20260904 15:40 CST)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R66 → R67)预习备料,聚焦尚未进入 R65 基线的增量条目 本次覆盖(窗口…
Tom 文献雷达 · Agent RAG LongContext · 2026-09-04 08:40
Paper: | HF 22票 | 20260830 Agent 性能由模型参数和执行 harness 代码共同决定,但现有联合优化方法只调权重和文本提示,把 harness 固定了。WHALE 的思路是交替两阶段:先在当前 harness 下更新模型权重,再搜索更好的 harness(harness 搜索空间不限于文…
Tom 文献雷达 · Agent RAG LongContext · 2026-09-04 20:40 UTC
| # | 标题 | 来源 | 标签 | 关键信号 | |||||| | 1 | Scal3R: Learning Efficient MultiRelative Pose Query for Scalable Online 3D Reconstruction | arXiv 2609.04201 | multimod…
inference · E1 预消化简报(2026-09-04)
待建卡 5(无 inference 主轴)· 待更新活文档 0(全部最新)· 选题榜 2 件(2609.02366 / 2609.02367,均为 noninference 主题) inference 主轴未触发"高价值待深度解读"或"攻略待写"信号 20260904T1050jayengineeringfilter.…
HF Daily Papers · 2026-09-03
HF Daily Papers 精选(15 篇,按社区票数排序) [464▲] StudentSim:训练基于 LLM 的学生模拟器 — [340▲] QwenDrive1.0:迈向自动驾驶视觉语言基础模型的初步尝试 — [93▲] DreamXCreator:让 2K 分辨率原生音视频生成走向大众 — [75▲] S…
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-03 下午
轻量版 · 检索:HuggingFace Daily(8 条候选,2 次 web_search 补充) 去重依据:早间版(20260903 08:40)已覆盖 AgentJudgeBench、EAL 记忆安全、TokenEfficient 推理 Agents;早间版 14:40 雷达无重复。 来源: arXiv(260…
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-03 晚
轻量版 · 检索:HuggingFace Daily + arXiv(8 条候选,0 次 web 补充) 去重依据:早间版(08:40)已覆盖 AgentJudgeBench、EALBench、TokenEfficient Data Reasoning;下午版(14:40)已覆盖 HarnessDev、S³Gym、CR…
rag · E1 预消化简报(2026-09-03)
本窗口净增量为 3 件 RAG netnew(paper_card 主分类 rag 入库,1159/1184 确认,1177 存疑)。 与 R78 的区别:R78 是"R77 候选邻接入库确认轮";本窗口(R79)出现 3 件 paper_card 主分类 rag 的新归档: 1159(2608.31139,Aug 3…
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-03 早
轻量版 · 检索:HuggingFace Daily(8 条候选,arXiv 超时) 去重依据:20260902 08:40/14:40/20:40 三轮已覆盖 Safin1、Agents in the Large、HarnessofHarness、Adaptive Critical Token、From Produc…
inference · E1 预消化简报(2026-09-03)
待建卡 8(无 inference 主轴)· 待更新活文档 0(全部最新)· 选题榜 12 件,均为 noninference 主题 inference 主轴未触发"高价值待深度解读"或"攻略待写"信号;高价值候选 arXiv:2609.02812 VibeVoiceASRStreaming 属 multimodal …
evaluation · E1 预消化简报(2026-09-03)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260901 下午 ~ 20260903 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R65 → R66)预习备料,聚焦尚未进入 R65 基线的增量条目 本次覆盖(窗口:202609…
Lex Fridman (YouTube) · RSS 摘要
DHH:编程、AI、Agentic 工程、Vibe Coding 与 Linux 的未来 | Lex Fridman 播客 #501 Khabib Nurmagomedov:达吉斯坦、MMA、UFC、Islam、Conor、Fedor 与足球 | Lex Fridman 播客 #500 Gary Gallagher:美…
HF Daily Papers · 2026-09-02
HF Daily Papers 精选(15 篇,按社区票数排序) [100▲] OnPolicy Distillation 真的能蒸馏吗?从噪声教师到自我提升 — [99▲] LoopArena:面向回路工程的模型作为运行时控制器基准评测 — [91▲] DreamXCreator:民主化的原生音视频 2K 分辨率生成…
rag · E1 预消化简报(2026-09-02)
本窗口净增量为 4 件 RAG netnew(均 paper_card 主分类 rag 已入库)。 与 R77 的区别:R77 prep 基于 20260901 早间数据,将 CamoDocs/LINE/SymbolLKG/Private Dense Retrieval 记录为"候选邻接(paper_cards 未入库…
inference · E1 预消化简报(2026-09-02)
待建卡 3(无 inference 主轴)· 待更新活文档 0(全部最新)· 选题榜 2 件(2608.31022 + 2609.01481,均为 noninference 主题) inference 主轴未触发"高价值待深度解读"或"攻略待写"信号 20:40(轻量版):8 件候选(Adaptive Critical…
Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-02 晚
轻量版 · 检索:arXiv + HuggingFace Daily(8 条候选) 去重依据:当日 08:40、14:40 雷达已覆盖 Safin1、Agents in the Large、HarnessofHarness、SMELT、DiagEvo、UIVenus2、ZimaBlue、QwenDrive1.0 来源:…
evaluation · E1 预消化简报(2026-09-02)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260901 下午 ~ 20260902 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R64 → R65)预习备料,聚焦尚未进入 R64 基线的增量条目 本次覆盖(窗口:202609…
Tom 文献雷达 · Agent / RAG / Long-Context · 2026-09-02 14:40 UTC
1. Safin1: Safety from Within through MemoryNative State Evolution 链接: 来源: arXiv | 20260831 | votes: 13 摘要: 提出 "Safety from Within" 范式,通过 MemoryAnchor Routing 让…
📋 Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-09-02
| # | 来源 | 标题 | 标签 | ||||| | 1 | arXiv | ContextBias: Bias Persistence Under Context Shift in T2I | benchmark | | 2 | HF Daily | EvoGenUIBench: MultiTurn Genera…
Lex Fridman (YouTube) · RSS 摘要
DHH:编程的未来、AI、Agentic 工程、Vibe Coding 与 Linux | Lex Fridman Podcast #501 Khabib Nurmagomedov:达吉斯坦、MMA、UFC、伊斯兰、Conor、Fedor 与足球 | Lex Fridman Podcast #500 Gary Gall…