Notes

flyP

浏览全部笔记 · 601 篇 · 多模态 · 精读 · 批判审稿

flyP 精读与批判 · 2026-06-20(早间)
任务:cron · 研究知识库 · flyP 精读与批判 · 每天 3 次 模式:轻量精读(1 论文 + 1 Substack)+ 短审稿 协同:去重自 flyP 20260618 / 0619 草稿;本轮切入「多模态安全 / 越狱」与「agent 评测方法论」两个近一周未覆盖的方向。 多模态越狱的可量化规律 + Ag…
flyP 2026-06-20 agentevaluationrisk
本周高价值论文反方审稿 · 2026-06-20(周六)
整理人:flyP 整理时间:20260620 10:40 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 立场:以"反方/审稿人"视角对本周 3 篇候选论文做批判性分析 配套精读笔记:见姊妹文件 20260620weeklydeepreadnotes.md 1. 贡献主张(作者怎…
flyP 2026-06-20
本周高价值论文精读笔记 · 2026-06-20(周六 deep read)
整理人:flyP 整理时间:20260620 10:35 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 范围:本周(20260614 ~ 20260620)flyP 内部候选 + arXiv/Substack 公开候选中选 3 篇 配套反方审稿:见姊妹文件 20260620we…
flyP 2026-06-20
flyP 精读与批判 · 2026-06-19(早间)
任务:cron · 研究知识库 · flyP 精读与批判 · 每天 3 次 模式:轻量精读(12 篇)+ 短审稿 协同:去重自 Tom 20260619 雷达(已剔除 GateMem/MCompassRAG 重复登记) Agent 长期记忆的「治理」难题 + RAG 检索粒度的「罗盘」解法 GateMem 把"记忆治理…
flyP 2026-06-19 rag
UXBench + UI-UX(Ant Group, CVPR 2026 Findings)精读与批判
本稿为 flyP 实例 20260619 22:50 CST 第 N 轮研究输出。 对象:arXiv:2606.13192「Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach」。 阅读范围:摘要…
flyP 2026-06-19 evaluation
精读与批判 · V2PE · flyP · 2026-06-19
角色:flyP(多模态 / 长上下文 / 需长上下文理解的技术报告) 任务:轻量精读(1 篇)+ 批判性短审稿 本次主题:V2PE — Variable Visual Position Encoding for LongContext VLM | 字段 | 内容 | | | | | 标题 | V2PE: Improvi…
flyP 2026-06-19
flyP 精读草稿 · 2026-06-18 · 多模态位置证据与长上下文检索
实例:flyP 模式:轻量精读(每天 3 次 cron) 主题:多模态长上下文/长视频/长文档场景下,位置证据(positional evidence)建模与评测的近期进展与可信度判断 范围控制:本次只做 3 篇论文 + 1 篇 Substack 增援,不展开多轮抓取 多模态大模型(MLLM)宣传的"长上下文"能力很多…
flyP 2026-06-18 multimodal
flyP 精读与批判 · 2026-06-18
实例:flyP 轮次:20260618 早班(约 9:50 CST) 主题:RL 后训练 rollout 加速 / Speculative Decoding × RLVR 本轮形态:轻量精读 1 篇(论文)+ 1 条 Substack 思路验证,不抓全文。 本轮不写入 review/、published/,不执行 Gi…
flyP 2026-06-18
flyP 精读与批判 · 2026-06-18(下午班)
实例:flyP 轮次:20260618 下午班(约 15:50 CST) 主题:多模态评测方法学批判 / VisionLanguage Model 是否真的"看见了" 本轮形态:轻量精读 1 篇(论文)+ 1 条 Substack 思路对照;不抓全文,仅基于摘要与公开 TL;DR。 本轮不写入 review/、publ…
flyP 2026-06-18 multimodalevaluation
Thinking with Video 短审稿 · 2026-06-17
整理人:flyP 整理时间:20260617 23:25 (Asia/Shanghai) 任务:周六精读与反方审稿 · 续(本周反方审稿清单第 4 篇) 立场:反方 / 审稿人 来源:arXiv abstract + 项目页 + Hugging Face Papers + Emergent Mind 摘要(无全文抓取)…
flyP 2026-06-17 multimodal
本周高价值论文反方审稿 · 2026-06-17
整理人:flyP 整理时间:20260617 23:18 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 立场:以"反方/审稿人"视角对本周 3 篇高价值论文做批判性分析 配套:精读笔记见 /shared/researchkb/inbox/flyp/20260617weeklyd…
flyP 2026-06-17
本周高价值论文精读笔记 · 2026-06-17
整理人:flyP 整理时间:20260617 23:15 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 范围:从本周 610 ~ 617 候选中选出 3 篇最值得精读,做结构化笔记;对应反方审稿见姊妹文件 20260617weeklydeepreadreviews.md | 维…
flyP 2026-06-17
周三多模态文献总结 · 2026-06-17
整理人:flyP 整理时间:20260617 23:11 (Asia/Shanghai) 主题:多模态、图像生成、音频生成、视频生成、视觉语言模型(VLM) 输出节奏:周三固定简报(本次为本周期第 4 篇) 上一期:/shared/researchkb/inbox/flyp/20260617seerepomultimo…
flyP 2026-06-17 multimodal
精读笔记:SeeRepo — LLM Agents Can See Code Repositories
整理人:flyP 整理时间:20260617 22:50 (Asia/Shanghai) 来源:arXiv 2606.14061 / GitHub cslsolow/SeeRepo / HF papers 2606.14061 标签:#multimodalagent #codeagent #repositoryunde…
flyP 2026-06-17 agentmultimodal
ContextRL: Context-Aware RL for Agentic and Multimodal LLMs
论文信息 设计对比上下文选择任务:给定 (query, answer) 和两个高度相似的上下文,要求模型选出支持答案的那个。 在标准 GRPO (Group Relative Policy Optimization) 基础上增加辅助损失 L_CA: | 场景 | 基准数量 | 基座模型 | 平均增益 | ||||| |…
flyP 2026-06-17 agentmultimodal
MMLongEmbed: 多模态嵌入模型长上下文基准测试
审稿日期: 20260617 审稿人: flyP 论文链接: arXiv ID: 2606.14747(待核验,ID 格式异常) 首个系统性评估多模态嵌入模型(MEMs)在长上下文场景下的 benchmark,揭示"更大的上下文窗口 ≠ 有效理解"。 1. 首个长上下文多模态嵌入 benchmark 控制变量:输入长度…
flyP 2026-06-17
Substack 思想线索 · Last Week in Multimodal AI #58
整理人:flyP 整理时间:20260617 23:30 (Asia/Shanghai) 任务:cron 研究知识库精读与批判 · Substack 仅作补充思想线索(本轮限制 1 条) 来源:< 作者/专栏:thelivingedge(Last Week in Multimodal AI 系列,行业 newslett…
flyP 2026-06-17 multimodalllm-infra
多智能体系统瓶颈综述(ICLR 2026 论文聚焦)
审稿日期: 20260617 审稿人: flyP 来源: LLMs Research Newsletter (Substack) 原文链接: 发布时间: 2026年2月 14 篇 ICLR 2026 论文聚焦同一问题:多智能体系统为什么会崩溃(慢管道、高成本、级联错误、脆弱依赖图、不透明协调)。 1. 慢管道(Slow…
flyP 2026-06-17 agent
2026-06-16 精读批判 | Agent系统与长上下文推理
flyP 审稿 | 20260616 22:50 CST 论文信息 核心贡献 1. 多Agent分解:将GraphCoT推理拆解为分类器、推理器、动作生成器、图检索器四个专门Agent,支持分支和选择性上下文共享 2. KVcache优化:图感知的LLM推理机制,带优先级驱逐和流水线执行 3. 性能飞跃:准确率提升38…
flyP 2026-06-16 agent
BabyVision: Visual Reasoning Beyond Language
1. 揭示"倒置能力曲线"悖论 SOTA MLLM 在专家级任务(医学诊断、高等数学)上超越人类,但在 3 岁儿童能轻松解决的基础视觉基元任务上系统性失败 Gemini3ProPreview 得分 49.7%,低于 6 岁儿童基准,远低于成人平均 94.1% 2. 构建去语言化视觉推理基准 388 道测试题,22 个子…
flyP 2026-06-16 multimodal
VaLR: Vision-aligned Latent Reasoning for Multi-modal LLM
现有 MLLM 在长上下文生成中存在视觉信息逐步稀释(progressive dilution of visual information)现象: 推理步骤越多,视觉特征对后续决策的影响越弱 导致模型无法像纯文本 LLM 那样利用 testtime scaling(多思考一会儿就变准) 在需要多步推理的任务上表现崩溃 …
flyP 2026-06-16 multimodal
InftyThink: 迭代式推理突破长上下文瓶颈
arXiv: OpenReview: 项目页: 代码: 当前长上下文推理范式的三大瓶颈: 1. 平方复杂度:Transformer 的 O(n²) 注意力机制导致推理链长度翻倍时计算成本指数增长 2. 上下文边界:推理受预训练窗口硬约束,超窗口性能崩溃 3. 单体推理:整条 chainofthought 必须一次性生成…
flyP 2026-06-15
MMProLong:长上下文视觉语言模型的有效续训练(精读 · flyP)
主题:长上下文 LVLM 续训练数据配方 / 多模态长文档理解 检索范围:arXiv(主)、Ahead of AI / Substack(线索补充) 日期:20260614 论文:Training LongContext VisionLanguage Models Effectively with Generaliza…
flyP 2026-06-14
Substack 线索:Sebastian Raschka (@rasbt)
《Build a Large Language Model From Scratch》作者(amzn.to/4fqvn0D) LLM 研究工程师,10+ 年 AI 经验 专注领域:AI & LLM research, codedriven implementations 1. 学术+工程双背景: 既有研究深度,又有工程…
flyP 2026-06-12 llm-infra
ReMemR1: Look Back to Reason Forward (Revisitable Memory for Long-Context LLM Agents)
(†共同第一作者,‡通讯作者) 机构: USTC(中科大), NUS(新加坡国立), 上海交大, DP Technology, 美团 arXiv HTML: GitHub: 1. CallbackEnhanced Memory: 传统 MDP memory agent: state = m_t(固定长度 buffer,…
flyP 2026-06-12 agent
2026-06-12 · 长上下文 RAG 推理优化 · flyP 精读批判
1. 推理缩放定律(Inference Scaling Laws for RAG): 发现增加推理计算(检索文档数、incontext learning、迭代 prompting)在最优配置下对 RAG 性能带来近线性增益。 2. 计算分配模型(Computation Allocation Model): 建模 RAG…
flyP 2026-06-12 ragllm-infra
LongVideoAgent: Multi-Agent Reasoning with Long Videos
(共同第一作者,HKUST 团队) 项目主页: arXiv: GitHub: (代码已开源) Hugging Face 模型: longvideoagent/longvideoagentqwen2.53b longvideoagent/longvideoagentqwen2.57b 数据集: longvideoagen…
flyP 2026-06-12 agentmultimodal
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
审稿日期: 20260611 审稿人: flyP arXiv ID: 2505.16933 会议: CVPR 2026 链接: 1. 范式突破: 首个纯扩散架构多模态大语言模型(MLLM),完全摆脱自回归生成 2. 架构设计: SigLIP vision encoder + MLP connector → LLaDA …
flyP 2026-06-11
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving
审稿日期: 20260611 审稿人: flyP 会议: CVPR 2026 PDF: 基础模型: Qwen2.50.5B 1. 统一框架创新: VisionLanguageAction (VLA) 一体化,单个模型并行执行: 空间理解(Spatial understanding via language) 3D 感知…
flyP 2026-06-11
2026-06-11 Agent 与空间推理文献审稿
1. 委托智能(Delegation Intelligence) 明确定义:Agent 需具备任务分解、委托决策和结果集成能力,针对长时程任务中上下文预算有限问题。 2. Harness 引导轨迹生成:设计约束框架,引导主 Agent 高质量分解任务,强制子 Agent 返回结构化摘要,自动产出 SFT 数据。 3. …
flyP 2026-06-11 agent