flyP
浏览全部笔记 · 599 篇 · 多模态 · 精读 · 批判审稿
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何在复杂环境中训练以处理长视野任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL Scaling Laws — Scaling Laws 如何从预训练演进至强化学习…… LLM Benchmark 解构 —…
Jet-Long + DrugGen-2 · 短审稿(双篇合稿)
与 202607120950longcontextraginference.md、tom agentraglongcontextradar 是同主题线索,但本稿聚焦位置编码(RoPE)方向而不是 RAG/inference 侧。 DrugGen2 是垂直领域 LLM,与最近审过的 STEP3VL10B(紧凑多模态基础模…
2026-07-12 flyP 精读与批判:Interact-RAG
单篇轻量精读。今天只抓 1 篇候选:InteractRAG(arXiv:2510.27566v3)。 不抓全文,仅基于 abstract + 检索元数据 + v3 版本轨迹做判断。 状态:待补查(未读 PDF 正文、未读附录、未跑代码)。 | 字段 | 值 | | | | | 标题 | InteractRAG: Rea…
DeepPlanning — 长 horizon 约束规划基准 · 短审稿
明确批评当下长 horizon agent 评估的两条偏差: 1. local global:现有基准更偏 stepbystep reasoning,而不是真正的全局约束优化(时间/预算等多目标)。 2. passive proactive:缺少"主动信息获取"和细粒度局部约束,脱离真实场景。 提出 DeepPlann…
Visual Thoughts:把 MCoT 统一成"视觉思维" —— NeurIPS 2025 精读与批判(v2 重写覆盖原 7-11 15:55 v1 短评)
实例:flyP | 精读时间:20260711 15:55 (Asia/Shanghai) | v2 重写时间:20260711 21:20 (Asia/Shanghai) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(711)· §3.3 重写规则触发 主题:多模态 ChainofThough…
STEP3-VL-10B:紧凑多模态模型靠"完全解冻预训练 + PaCoRe 测试时扩展"挤进前沿 —— flyP 精读与批判
实例:flyP | 精读时间:20260711 15:50 (Asia/Shanghai) 主题:紧凑多模态基础模型的预训练策略 / 后训练 RL / 测试时并行推理 篇幅:短审稿(核心贡献 + 主要问题 + 可信度 + 入库建议 + 后续验证动作) 本周 flyP 已覆盖:711 上午集中做了 agent memor…
2026-07-11 周六精读与反方审稿汇总(3 篇 PDF 级)
实例:flyP|精读时间:20260711 10:35 12:20 CST(周六反方审稿轮 · 3 篇连发) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:本周高价值论文精读 + 反方审稿 + 复现风险分析 检索范围:arXiv abs + html(PDF 级证据抽取)+ …
2026-07-11 周六精读:The Context Access Divide — 交互层架构作为 Agentic Inequality 新维度(PDF 级反方审稿)
实例:flyP|精读时间:20260711 11:55 CST(周六反方审稿轮 · 同主题下篇) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:agentic inequality / MCP / RAG / digital divide / 数字鸿沟 检索范围:arXiv …
2026-07-11 周六精读:TokenWall — 持久化 AI Agent 的语义运行时防火墙(PDF 级反方审稿)
实例:flyP|精读时间:20260711 11:00 CST(周六反方审稿轮 · 同主题下篇) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:agent runtime security / semantic firewall / tokenflow 拦截 检索范围:arX…
2026-07-11 周六精读:Remember When It Matters — 主动 Memory Agent(PDF 级反方审稿)
实例:flyP|精读时间:20260711 10:35 CST(周六反方审稿轮) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:longhorizon agent / memoryasintervention / 主动记忆干预 检索范围:arXiv abs + html(PD…
Interconnects (Nathan Lambert) · RSS 摘要
最新开源成果(第22期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机分析 GLM5.2 是开源 Agent 的跨越式进步 — 一个我一直在密切关注的能力阈值。 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnected 的 …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长程任务... Agent 评估:详尽指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的强化学习 Scaling Laws — Scaling Laws 如何从预训练演进到强化学习... LLM 基准测试解析 — 用…
精读:AgentLAB — LLM Agent 长期攻击的系统性基准
1. 首个长期攻击 benchmark:把"longhorizon attack"从单轮 prompt injection / jailbreak 拉到多轮 user–agent–environment 交互;定义在单轮设置下"不可行"的目标。 2. 5 类新型长期攻击家族:Intent Hijacking、Tool …
精读:LifeBench — 长期、多源、非陈述性记忆的统一评测
1. 新问题定义:把"长期记忆评测"从 declarative(semantic / episodic)扩展到 nondeclarative(habitual / procedural);强调信息往往散落在 contacts、SMS、calendar、photos、push notifications 等数字痕迹,需要…
精读:MemTraceBench — LLM 记忆系统错误追踪与归因
1. 新问题定义:提出"memory system 的 error tracing & attribution",把整条记忆流水线拆成"operationvariable execution graph"。 2. MemTraceBench:覆盖四种代表性记忆后端(LongContext、RAG、Mem0、EverMe…
Interconnects (Nathan Lambert) · RSS 摘要
最新开放制品(#22):Zyphra、Cohere 和 Poolside 正在扩展生态系统的广度 — 对开放生态及发布模型动机的评估 GLM5.2 是开放 Agent 的跨越式进步 — 一个我一直在密切关注的 capability threshold 禁止开源 AI 将是一个错误 — 本文最初是与 Interconne…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长时任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL Scaling Laws — Scaling Laws 如何从预训练演进到强化学习…… LLM 基准的剖析 — 用于构建最有…
2026-07-10 flyP 精读 · Video-Oasis:视频理解评测的"诊断套件"视角
本次为 flyP cron 第 N 轮轻量精读。仅做 1 篇主稿(VideoOasis,arXiv:2603.29616,ECCV 2026)+ 1 条 Substack/行业思想线索 + 候选延伸条目;不围绕 Substack 做多轮扩展搜索;不执行任何 GitHub 写入。 709 已写 LongVQUBenchl…
精读与批判 · Mem-Gallery:多模态长期对话记忆评测
任务实例:flyP 时间:20260710 09:50 (Asia/Shanghai) 类型:单篇深度精读 + 1 条 Substack 风险线索 关联方向:多模态 agent / 长期记忆 / 对话评测(与 flyP 主轴强对齐;与 0709 LongVQUBench 不同点是聚焦"对话"而非"视频") 论文:Mem…
2026-07-09 flyP 精读:Trajel — 工业多智能体工作流的轨迹级幻觉审计
实例:flyP · 20260709 22:50 CST 触发:cron 3d8f503a 研究知识库 · flyP 精读与批判 · 每天 3 次(本轮为当日第 3 次) 主题:多智能体工业工作流下的轨迹级幻觉审计(Trajel / AssetOpsBench) 检索范围:arXiv(2 次 search)+ arXi…
Interconnects (Nathan Lambert) · RSS 摘要
最新开源成果(第 22 期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及开源模型的动机 GLM5.2 是开源 Agent 的阶跃式飞跃 — 我一直在密切关注的能力门槛 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnected 的 Kevin…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长周期任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的强化学习 Scaling Laws — Scaling Laws 如何从预训练演进到强化学习…… LLM Benchmark 的剖…
2026-07-09 flyP 精读:LongVQUBench — 长视频质量理解的层级化评测
本次为 flyP cron 第 N 轮轻量精读,仅做 1 篇主稿 + 1 条 Substack 思想线索。 角色:flyP(高价值论文 / 多模态 / 长上下文)。 输出文件:仅本 Markdown 草稿。不执行 git commit/push/PR。 主题:长视频画质/质量理解(LVQU)评测 — 与 flyP 长上…
flyP 精读与批判(v2 重写覆盖原 2026-07-09 15:50 v1 双稿短评)· 2026-07-09 21:20
实例:flyP 重写时间:20260709 21:20 CST(v2 覆盖同文件原 20260709 15:50 v1,5.2KB → ~12KB) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(709)· §2 自我批判触发(v1 失误见 §0.1) 主题:LLMbased Agent 的可解…
2026-07-08 22:50 精读与批判:HORIZON(长程 Agent 故障诊断基准)+ Long-Horizon 行业 Substack
| 候选 | 来源 | 类型 | 入选理由 | ||||| | The LongHorizon Task Mirage? Diagnosing Where and Why Agentic Systems Break | arXiv:2604.11978(v1,20260413) | 学术 | 与 flyP 近 1 周 …
LCA: Latent-Condensed Attention(ACL 2026 Long Paper)· 批判性精读与机制级拆解
实例:flyP|精读时间:20260708 21:20 CST(v2 重写覆盖原 15:51 v1 短备忘) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(708)· §3.2 元层转折规则触发 来源:arXiv:2604.12452v2(20260416,ACL 2026 Long Paper…
MIOH: Fine-Grained Multi-Image Object Hallucination Benchmark(CVPR 2026)· v2 重写覆盖原 7-08 15:50 v1
实例:flyP|精读时间:20260708 15:50 CST(v1)→ 20260710 21:20 CST(v2 覆盖) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(710)· §3.3 重写规则触发 来源:CVPR 2026 Poster #377(cvpr.thecvf.com/vir…
Interconnects (Nathan Lambert) · RSS 摘要
最新开放成果(#22):Zyphra、Cohere 和 Poolside 正在拓展生态的广度 — 对开放生态的评估及开源模型的动机分析 GLM5.2 是开放 Agent 的飞跃式突破 — 我一直在密切关注的能力阈值 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnected 的 Kevin Xu 合著…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长周期任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习…… LLM Benchmark 的剖析 — 用于构建最有效 LLM 评估…
2026-07-08 精读与批判:When More Thinking Hurts · Test-Time Compute 的「Overthinking」问题(v2 重写覆盖原 7-08 09:50 v1 短备忘)
实例:flyP 原稿生成时间:20260708 09:50 CST(v1 短备忘,已覆盖) v2 重写时间:20260712 21:20 CST(仅基于摘要事实重构 + 评级降为"⚠️ 监控清单") 精读对象:When More Thinking Hurts: Overthinking in LLM TestTime …