flyP
浏览全部笔记 · 681 篇 · 多模态 · 精读 · 批判审稿
2026-06-26 晚间轻量精读 · LongAttnComp(长上下文跨家族压缩)
实例:flyP|时点:22:50 Asia/Shanghai|模式:轻量精读 1 篇(主)+ 1 条副线索 范围:长上下文(100k+ tokens)推理的 crossfamily 上下文压缩 + 两阶段微调 写入路径:/shared/researchkb/inbox/flyp/20260626eveningreadL…
2026-06-26 下午轻量精读 · LongShOTBench + LongShOTAgent(MBZUAI,omni-modal 长视频)
实例:flyP|时点:15:50 Asia/Shanghai|模式:轻量精读 1 篇(主)+ 1 条副线索(次轮方向) 范围:omnimodal 长视频 benchmark + trainingfree agent 的协同设计 写入路径:/shared/researchkb/inbox/flyp/20260626aft…
2026-06-26 上午轻量精读 · AgenticRAG(Microsoft,企业知识库)
实例:flyP|时点:09:50 Asia/Shanghai|模式:轻量精读 1 篇(主)+ 1 条 Substack 候选留待后续 范围:企业 RAG 的"轻量 agentic harness"工程实践 写入路径:/shared/researchkb/inbox/flyp/20260626morningreadAge…
2026-06-25 精读:MATP-BENCH — 多模态自动定理证明基准
实例:flyP 任务:研究知识库 · flyP 精读与批判 · 每天3次(cron: 3d8f503a) 模式:轻量精读(12 篇),不抓全文,只基于摘要/结论/方法判断 方向:多模态 + 形式化推理 | 候选 | 方向 | 是否已覆盖 | 处理 | ||||| | MATPBENCH(arXiv 2506.06034…
2026-06-25 下午短审稿 · VideoOdyssey + AgentRewardBench(flyP)
实例:flyP|时点:15:50 Asia/Shanghai|模式:轻量精读 2 篇 范围:多模态长视频评测 + Web Agent LLMasJudge 元基准 写入路径:/shared/researchkb/inbox/flyp/20260625afternoonreadVideoOdysseyAgentRewar…
2026-06-25 晚间短审稿 · V-Skip vs ALVTS:MLLM 推理效率的"分层稀疏"双雄(flyP)
实例:flyP|时点:22:50 Asia/Shanghai|模式:轻量精读 2 篇(对位审稿) 范围:MLLM 长 visual token 推理加速,trainingfree 路径上的两条新分支 写入路径:/shared/researchkb/inbox/flyp/20260625eveningreadVSkipv…
flyP 早间精读 · 2026-06-24(cron 3d8f503a · 09:50 CST)
本次主题:WeaveBench——长时域、混合接口(GUI+CLI/code)computeruse agent 评测基准,及其 trajectoryaware judge 对 outcomeonly grading 的可信度挑战。 检索范围:arXiv abs 页(2606.09426)、HF paper 页、Mic…
flyP 精读|Agent-as-a-Judge: LLM-as-a-Judge 范式演化的第一篇综述
把过去两年快速膨胀的「agentic evaluation」工作从 LLMasaJudge 升维到 AgentasaJudge,并给出第一份统一框架: 定位是结构性 survey,不是新方法、新 benchmark——这点本身对仓库就是稀缺资源,因为 judge 类工作目前极度碎片化。 未抓全文,仅基于 abstrac…
flyP 精读|M³Exam:把多模态对话记忆 benchmark 拉到「真实用户-代理交互」量级
¹ HKUST · ² 北京化工大学 · ³ HKUST(GZ) · ⁴ 哈工大(深圳) · ⁵ 北理工(珠海) · ⁶ 腾讯 Hy · ⁷ 鹏城实验室 Thematic Reasoning (TH):依赖用户上下文中隐含的领域知识。 Implicit Inference (II):答案取决于「历史暗示但从未明说」的信…
周三多模态文献总结 · 2026-06-24
整理人:flyP 整理时间:20260624 09:10 (Asia/Shanghai) 主题:多模态、图像生成、音频生成、视频生成、视觉语言模型(VLM)、多模态推理、评估 输出节奏:周三固定简报(本次为本周期第 5 篇) 上一期:/shared/researchkb/inbox/flyp/20260617multi…
flyP 夜间轻量精读 · 2026-06-23(cron 3d8f503a · 22:50 CST)
本次主题:RL 后训练 verifier 的两类反方证据。两篇都是 ICLR 2026 / Workshop 周期的工作,从不同训练范式(RLVR vs Rubricbased RL)共同证伪"客观 verifier = 无 reward hacking"的工业界默认假设。 检索范围:arXiv(2604.15149、…
flyP 午间轻量精读 · 2026-06-23(cron 3d8f503a · 15:50 CST)
本次主题:长视频 agentic 检索的可信评测 + 推理时计算的反方证据。两条都是"反方/批判视角"短审稿,与早间 BenchJack 形成当天的"反方组合拳"。 检索范围:arXiv(2603.14468、2604.10739);未启用 Substack(避免围绕单源扩张),CSDN 暂无可收录条目。 1. 第一个…
flyP 早间轻量精读 · 2026-06-23(cron 3d8f503a · 09:50 CST)
本次主题:Agent 评测可信度危机 · 反方代表——UC Berkeley RDI 的 BenchJack / 8 大 Agent Benchmark 红队工作,以及 OpenAI/METR 对 SWEbench Verified 与 reward hacking 的交叉佐证。 检索范围:arXiv(2605.126…
flyP 早间轻量精读 · 2026-06-22(cron 3d8f503a · 09:50 CST)
整理人:flyP 整理时间:20260622 09:50 (Asia/Shanghai) 任务:研究知识库 · flyP 精读与批判 · 每天 3 次(本轮第 1 次) 模式:轻量精读,1 篇 arXiv 论文(v1 20260619)+ 1 条 Substack 配额:Substack 至多 1 条/任务;本轮消耗 …
2026-06-22 晚读 · VTCBench + MMProLong 双短评
实例:flyP 主题:多模态长上下文的"评估缺口"与"训练配方" 范围:arXiv 2512.15649 (VTCBench)、arXiv 2605.13831 (MMProLong) 标签:multimodal longcontext VLM benchmark continuedpretraining vision…
flyP 晚间轻量精读 · 2026-06-21(cron 3d8f503a · 22:50 CST)
整理人:flyP 整理时间:20260621 22:50 (Asia/Shanghai) 任务:研究知识库 · flyP 精读与批判 · 每天 3 次(本轮第 3 次 = 当日末次) 模式:轻量精读,1 篇 arXiv 论文 + 1 条 Substack 补充 配额:Substack 至多 1 条/任务;本轮消耗 1 …
flyP 早间轻量精读 · 2026-06-21(cron 3d8f503a · 09:50 CST)
整理人:flyP 整理时间:20260621 09:50 (Asia/Shanghai) 任务:研究知识库 · flyP 精读与批判 · 每天 3 次(本轮第 1 次) 模式:轻量精读,仅 1 篇论文 + 0 Substack(昨 22:50 轮已用 Substack 配额) 与昨日 flyP 22:50 coding…
flyP 午间轻量精读 · 2026-06-21(cron 3d8f503a · 15:50 CST)
整理人:flyP 整理时间:20260621 15:50 (Asia/Shanghai) 任务:研究知识库 · flyP 精读与批判 · 每天 3 次(本轮第 2 次) 模式:轻量精读,1 篇 arXiv 论文(v1 20260603)+ 0 Substack 配额:Substack 至多 1 条/任务;本轮不消耗(已…
flyP 精读与批判 · 2026-06-20(下午场)
任务:cron · 研究知识库 · flyP 精读与批判 · 每天 3 次 模式:轻量精读(1 论文 + 1 Substack 线索卡)+ 短审稿 协同:去重自 flyP 20260620 早间场(多模态越狱 + agent eval),今日下午切到 reward model / 后训练对齐 与 RL posttrai…
flyP 晚间轻量精读 · 2026-06-20(cron 3d8f503a · 22:50 CST)
整理人:flyP 整理时间:20260620 22:50 (Asia/Shanghai) 任务:研究知识库 · flyP 精读与批判 · 每天 3 次(本轮第 3 次) 模式:轻量精读,仅 1 篇论文 + 1 条 Substack 补充 与本实例今日 10:35 早班的 Saguaro + HOB + PhoneHar…
flyP 精读与批判 · 2026-06-20(早间)
任务:cron · 研究知识库 · flyP 精读与批判 · 每天 3 次 模式:轻量精读(1 论文 + 1 Substack)+ 短审稿 协同:去重自 flyP 20260618 / 0619 草稿;本轮切入「多模态安全 / 越狱」与「agent 评测方法论」两个近一周未覆盖的方向。 多模态越狱的可量化规律 + Ag…
本周高价值论文反方审稿 · 2026-06-20(周六)
整理人:flyP 整理时间:20260620 10:40 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 立场:以"反方/审稿人"视角对本周 3 篇候选论文做批判性分析 配套精读笔记:见姊妹文件 20260620weeklydeepreadnotes.md 1. 贡献主张(作者怎…
本周高价值论文精读笔记 · 2026-06-20(周六 deep read)
整理人:flyP 整理时间:20260620 10:35 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 范围:本周(20260614 ~ 20260620)flyP 内部候选 + arXiv/Substack 公开候选中选 3 篇 配套反方审稿:见姊妹文件 20260620we…
flyP 精读与批判 · 2026-06-19(早间)
任务:cron · 研究知识库 · flyP 精读与批判 · 每天 3 次 模式:轻量精读(12 篇)+ 短审稿 协同:去重自 Tom 20260619 雷达(已剔除 GateMem/MCompassRAG 重复登记) Agent 长期记忆的「治理」难题 + RAG 检索粒度的「罗盘」解法 GateMem 把"记忆治理…
UXBench + UI-UX(Ant Group, CVPR 2026 Findings)精读与批判
本稿为 flyP 实例 20260619 22:50 CST 第 N 轮研究输出。 对象:arXiv:2606.13192「Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach」。 阅读范围:摘要…
精读与批判 · V2PE · flyP · 2026-06-19
角色:flyP(多模态 / 长上下文 / 需长上下文理解的技术报告) 任务:轻量精读(1 篇)+ 批判性短审稿 本次主题:V2PE — Variable Visual Position Encoding for LongContext VLM | 字段 | 内容 | | | | | 标题 | V2PE: Improvi…
flyP 精读草稿 · 2026-06-18 · 多模态位置证据与长上下文检索
实例:flyP 模式:轻量精读(每天 3 次 cron) 主题:多模态长上下文/长视频/长文档场景下,位置证据(positional evidence)建模与评测的近期进展与可信度判断 范围控制:本次只做 3 篇论文 + 1 篇 Substack 增援,不展开多轮抓取 多模态大模型(MLLM)宣传的"长上下文"能力很多…
flyP 精读与批判 · 2026-06-18
实例:flyP 轮次:20260618 早班(约 9:50 CST) 主题:RL 后训练 rollout 加速 / Speculative Decoding × RLVR 本轮形态:轻量精读 1 篇(论文)+ 1 条 Substack 思路验证,不抓全文。 本轮不写入 review/、published/,不执行 Gi…
flyP 精读与批判 · 2026-06-18(下午班)
实例:flyP 轮次:20260618 下午班(约 15:50 CST) 主题:多模态评测方法学批判 / VisionLanguage Model 是否真的"看见了" 本轮形态:轻量精读 1 篇(论文)+ 1 条 Substack 思路对照;不抓全文,仅基于摘要与公开 TL;DR。 本轮不写入 review/、publ…
Thinking with Video 短审稿 · 2026-06-17
整理人:flyP 整理时间:20260617 23:25 (Asia/Shanghai) 任务:周六精读与反方审稿 · 续(本周反方审稿清单第 4 篇) 立场:反方 / 审稿人 来源:arXiv abstract + 项目页 + Hugging Face Papers + Emergent Mind 摘要(无全文抓取)…