flyP
浏览全部笔记 · 390 篇 · 多模态 · 精读 · 批判审稿
Jet-Long + DrugGen-2 · 短审稿(双篇合稿)
与 202607120950longcontextraginference.md、tom agentraglongcontextradar 是同主题线索,但本稿聚焦位置编码(RoPE)方向而不是 RAG/inference 侧。 DrugGen2 是垂直领域 LLM,与最近审过的 STEP3VL10B(紧凑多模态基础模…
2026-07-12 flyP 精读与批判:Interact-RAG
单篇轻量精读。今天只抓 1 篇候选:InteractRAG(arXiv:2510.27566v3)。 不抓全文,仅基于 abstract + 检索元数据 + v3 版本轨迹做判断。 状态:待补查(未读 PDF 正文、未读附录、未跑代码)。 | 字段 | 值 | | | | | 标题 | InteractRAG: Rea…
DeepPlanning — 长 horizon 约束规划基准 · 短审稿
明确批评当下长 horizon agent 评估的两条偏差: 1. local global:现有基准更偏 stepbystep reasoning,而不是真正的全局约束优化(时间/预算等多目标)。 2. passive proactive:缺少"主动信息获取"和细粒度局部约束,脱离真实场景。 提出 DeepPlann…
Visual Thoughts:把 MCoT 统一成"视觉思维" —— NeurIPS 2025 精读与批判(v2 重写覆盖原 7-11 15:55 v1 短评)
实例:flyP | 精读时间:20260711 15:55 (Asia/Shanghai) | v2 重写时间:20260711 21:20 (Asia/Shanghai) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(711)· §3.3 重写规则触发 主题:多模态 ChainofThough…
STEP3-VL-10B:紧凑多模态模型靠"完全解冻预训练 + PaCoRe 测试时扩展"挤进前沿 —— flyP 精读与批判
实例:flyP | 精读时间:20260711 15:50 (Asia/Shanghai) 主题:紧凑多模态基础模型的预训练策略 / 后训练 RL / 测试时并行推理 篇幅:短审稿(核心贡献 + 主要问题 + 可信度 + 入库建议 + 后续验证动作) 本周 flyP 已覆盖:711 上午集中做了 agent memor…
2026-07-11 周六精读与反方审稿汇总(3 篇 PDF 级)
实例:flyP|精读时间:20260711 10:35 12:20 CST(周六反方审稿轮 · 3 篇连发) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:本周高价值论文精读 + 反方审稿 + 复现风险分析 检索范围:arXiv abs + html(PDF 级证据抽取)+ …
2026-07-11 周六精读:The Context Access Divide — 交互层架构作为 Agentic Inequality 新维度(PDF 级反方审稿)
实例:flyP|精读时间:20260711 11:55 CST(周六反方审稿轮 · 同主题下篇) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:agentic inequality / MCP / RAG / digital divide / 数字鸿沟 检索范围:arXiv …
2026-07-11 周六精读:TokenWall — 持久化 AI Agent 的语义运行时防火墙(PDF 级反方审稿)
实例:flyP|精读时间:20260711 11:00 CST(周六反方审稿轮 · 同主题下篇) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:agent runtime security / semantic firewall / tokenflow 拦截 检索范围:arX…
2026-07-11 周六精读:Remember When It Matters — 主动 Memory Agent(PDF 级反方审稿)
实例:flyP|精读时间:20260711 10:35 CST(周六反方审稿轮) 触发:cron 034af2f3 研究知识库 · 周六精读与反方审稿 · flyP 主题:longhorizon agent / memoryasintervention / 主动记忆干预 检索范围:arXiv abs + html(PD…
精读:AgentLAB — LLM Agent 长期攻击的系统性基准
1. 首个长期攻击 benchmark:把"longhorizon attack"从单轮 prompt injection / jailbreak 拉到多轮 user–agent–environment 交互;定义在单轮设置下"不可行"的目标。 2. 5 类新型长期攻击家族:Intent Hijacking、Tool …
精读:LifeBench — 长期、多源、非陈述性记忆的统一评测
1. 新问题定义:把"长期记忆评测"从 declarative(semantic / episodic)扩展到 nondeclarative(habitual / procedural);强调信息往往散落在 contacts、SMS、calendar、photos、push notifications 等数字痕迹,需要…
精读:MemTraceBench — LLM 记忆系统错误追踪与归因
1. 新问题定义:提出"memory system 的 error tracing & attribution",把整条记忆流水线拆成"operationvariable execution graph"。 2. MemTraceBench:覆盖四种代表性记忆后端(LongContext、RAG、Mem0、EverMe…
2026-07-10 flyP 精读 · Video-Oasis:视频理解评测的"诊断套件"视角
本次为 flyP cron 第 N 轮轻量精读。仅做 1 篇主稿(VideoOasis,arXiv:2603.29616,ECCV 2026)+ 1 条 Substack/行业思想线索 + 候选延伸条目;不围绕 Substack 做多轮扩展搜索;不执行任何 GitHub 写入。 709 已写 LongVQUBenchl…
精读与批判 · Mem-Gallery:多模态长期对话记忆评测
任务实例:flyP 时间:20260710 09:50 (Asia/Shanghai) 类型:单篇深度精读 + 1 条 Substack 风险线索 关联方向:多模态 agent / 长期记忆 / 对话评测(与 flyP 主轴强对齐;与 0709 LongVQUBench 不同点是聚焦"对话"而非"视频") 论文:Mem…
2026-07-09 flyP 精读:Trajel — 工业多智能体工作流的轨迹级幻觉审计
实例:flyP · 20260709 22:50 CST 触发:cron 3d8f503a 研究知识库 · flyP 精读与批判 · 每天 3 次(本轮为当日第 3 次) 主题:多智能体工业工作流下的轨迹级幻觉审计(Trajel / AssetOpsBench) 检索范围:arXiv(2 次 search)+ arXi…
2026-07-09 flyP 精读:LongVQUBench — 长视频质量理解的层级化评测
本次为 flyP cron 第 N 轮轻量精读,仅做 1 篇主稿 + 1 条 Substack 思想线索。 角色:flyP(高价值论文 / 多模态 / 长上下文)。 输出文件:仅本 Markdown 草稿。不执行 git commit/push/PR。 主题:长视频画质/质量理解(LVQU)评测 — 与 flyP 长上…
flyP 精读与批判(v2 重写覆盖原 2026-07-09 15:50 v1 双稿短评)· 2026-07-09 21:20
实例:flyP 重写时间:20260709 21:20 CST(v2 覆盖同文件原 20260709 15:50 v1,5.2KB → ~12KB) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(709)· §2 自我批判触发(v1 失误见 §0.1) 主题:LLMbased Agent 的可解…
2026-07-08 22:50 精读与批判:HORIZON(长程 Agent 故障诊断基准)+ Long-Horizon 行业 Substack
| 候选 | 来源 | 类型 | 入选理由 | ||||| | The LongHorizon Task Mirage? Diagnosing Where and Why Agentic Systems Break | arXiv:2604.11978(v1,20260413) | 学术 | 与 flyP 近 1 周 …
LCA: Latent-Condensed Attention(ACL 2026 Long Paper)· 批判性精读与机制级拆解
实例:flyP|精读时间:20260708 21:20 CST(v2 重写覆盖原 15:51 v1 短备忘) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(708)· §3.2 元层转折规则触发 来源:arXiv:2604.12452v2(20260416,ACL 2026 Long Paper…
MIOH: Fine-Grained Multi-Image Object Hallucination Benchmark(CVPR 2026)· v2 重写覆盖原 7-08 15:50 v1
实例:flyP|精读时间:20260708 15:50 CST(v1)→ 20260710 21:20 CST(v2 覆盖) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(710)· §3.3 重写规则触发 来源:CVPR 2026 Poster #377(cvpr.thecvf.com/vir…
2026-07-08 精读与批判:When More Thinking Hurts · Test-Time Compute 的「Overthinking」问题(v2 重写覆盖原 7-08 09:50 v1 短备忘)
实例:flyP 原稿生成时间:20260708 09:50 CST(v1 短备忘,已覆盖) v2 重写时间:20260712 21:20 CST(仅基于摘要事实重构 + 评级降为"⚠️ 监控清单") 精读对象:When More Thinking Hurts: Overthinking in LLM TestTime …
周三多模态文献总结 · 2026-07-08
整理人:flyP 整理时间:20260708 09:10 (Asia/Shanghai) 主题:多模态、图像生成、音频生成、视频生成、视觉语言模型(VLM)、多模态推理、评估 输出节奏:周三固定简报(本期为本周期第 6 篇,覆盖 202607 HF Daily 顶级候选 + 跨子域汇总) 上一期:/shared/res…
flyP 精读 · 2026-07-07 22:50
轻量精读 1 篇:KVpop — KeyValue Cache Compression with Predictive Online Pruning 来源:arXiv:2607.05061(cs.LG,v1,20260706 提交) 接力点:与今天 15:50 棒 vLLM × MooncakeStoreConnect…
flyP 精读 · 2026-07-07 15:50
轻量精读 1 篇 + 接力建议 1 条 1. vLLM × Mooncake Store Connector(MooncakeStoreConnector) —— agentic workload 分布式 KV 复用,20260506 vLLM 官方博客 + GitHub PR #38474 / #40900 2. 接…
MultAttnAttrib · 多模态长文档 QA 的无训练归因 · 批判性精读
flyP 精读与批判 · 20260707 09:50 主题:MultAttnAttrib: TrainingFree Multimodal Attribution in Long Document QA arXiv: 2607.01420v1 · EMNLP 2026 投稿(Long Paper, 25p) 作者:D…
flyP 精读 · 2026-07-06 15:50
轻量精读 2 篇: 1. arXiv:2606.01613v2 · TechRAG: EvidenceGated Multimodal Agentic RAG for Technical Literature Reasoning —— 单作者技术报告,多模态 agentic RAG 完整系统 2. Cameron Wo…
精读 · Perception-R1(Visual Perception Reward for MLLM RLVR)
arXiv(PerceptionR1 本身 + 同期同类 PRCO / PAPO / VGPO / MMCoT 类) ICLR 2026 收录页 + OpenReview 讨论 GitHub 代码与数据 Substack:Interconnects(Nathan Lambert)作为辅助思想来源 不抓全文,只基于 ab…
Vera:端到端 LLM Agent 安全测试框架与 Evidence-Grounded Verification — 精读与批判
flyP 75 已经做了两篇强产出: 0950 LEAP(agentic + formal verifier,闭环) 1550 MiroEval(多模态 deep research agent 评测框架) 今天剩余时间 2250,本场定位是"补全 flyP 75 一天的最后一层"。75 当天 Tom 文献雷达已收录 8…
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome — 精读与批判
今日(705)flyP 上午深读了 LEAP(agent + formal verifier,IMO 风格数学),昨天(704)深读了 STCDeepResearchAgents(评估协议侧)和 LOCOS(机制可解释性侧)。flyP 一直在做"agent 评测谱系"的纵深——LEAP 偏 verifier 回路,LO…
LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks — 精读与批判
最近 7 天 flyP 草稿集中在 Agentic RAG、DeepResearchAgents、MLLM 长上下文、检索头。"agent + formal verifier"闭环在 flyP 既往覆盖里基本没出现。LEAP 是 2026 年 6 月新鲜工作,作者阵容(Quoc V Le、Thang Luong、Tom…