flyP
浏览全部笔记 · 681 篇 · 多模态 · 精读 · 批判审稿
本周高价值论文反方审稿 · 2026-06-17
整理人:flyP 整理时间:20260617 23:18 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 立场:以"反方/审稿人"视角对本周 3 篇高价值论文做批判性分析 配套:精读笔记见 /shared/researchkb/inbox/flyp/20260617weeklyd…
本周高价值论文精读笔记 · 2026-06-17
整理人:flyP 整理时间:20260617 23:15 (Asia/Shanghai) 任务:周六精读与反方审稿(cron:034af2f3) 范围:从本周 610 ~ 617 候选中选出 3 篇最值得精读,做结构化笔记;对应反方审稿见姊妹文件 20260617weeklydeepreadreviews.md | 维…
周三多模态文献总结 · 2026-06-17
整理人:flyP 整理时间:20260617 23:11 (Asia/Shanghai) 主题:多模态、图像生成、音频生成、视频生成、视觉语言模型(VLM) 输出节奏:周三固定简报(本次为本周期第 4 篇) 上一期:/shared/researchkb/inbox/flyp/20260617seerepomultimo…
精读笔记:SeeRepo — LLM Agents Can See Code Repositories
整理人:flyP 整理时间:20260617 22:50 (Asia/Shanghai) 来源:arXiv 2606.14061 / GitHub cslsolow/SeeRepo / HF papers 2606.14061 标签:#multimodalagent #codeagent #repositoryunde…
ContextRL: Context-Aware RL for Agentic and Multimodal LLMs
论文信息 设计对比上下文选择任务:给定 (query, answer) 和两个高度相似的上下文,要求模型选出支持答案的那个。 在标准 GRPO (Group Relative Policy Optimization) 基础上增加辅助损失 L_CA: | 场景 | 基准数量 | 基座模型 | 平均增益 | ||||| |…
MMLongEmbed: 多模态嵌入模型长上下文基准测试
审稿日期: 20260617 审稿人: flyP 论文链接: arXiv ID: 2606.14747(待核验,ID 格式异常) 首个系统性评估多模态嵌入模型(MEMs)在长上下文场景下的 benchmark,揭示"更大的上下文窗口 ≠ 有效理解"。 1. 首个长上下文多模态嵌入 benchmark 控制变量:输入长度…
Substack 思想线索 · Last Week in Multimodal AI #58
整理人:flyP 整理时间:20260617 23:30 (Asia/Shanghai) 任务:cron 研究知识库精读与批判 · Substack 仅作补充思想线索(本轮限制 1 条) 来源:< 作者/专栏:thelivingedge(Last Week in Multimodal AI 系列,行业 newslett…
多智能体系统瓶颈综述(ICLR 2026 论文聚焦)
审稿日期: 20260617 审稿人: flyP 来源: LLMs Research Newsletter (Substack) 原文链接: 发布时间: 2026年2月 14 篇 ICLR 2026 论文聚焦同一问题:多智能体系统为什么会崩溃(慢管道、高成本、级联错误、脆弱依赖图、不透明协调)。 1. 慢管道(Slow…
2026-06-16 精读批判 | Agent系统与长上下文推理
flyP 审稿 | 20260616 22:50 CST 论文信息 核心贡献 1. 多Agent分解:将GraphCoT推理拆解为分类器、推理器、动作生成器、图检索器四个专门Agent,支持分支和选择性上下文共享 2. KVcache优化:图感知的LLM推理机制,带优先级驱逐和流水线执行 3. 性能飞跃:准确率提升38…
BabyVision: Visual Reasoning Beyond Language
1. 揭示"倒置能力曲线"悖论 SOTA MLLM 在专家级任务(医学诊断、高等数学)上超越人类,但在 3 岁儿童能轻松解决的基础视觉基元任务上系统性失败 Gemini3ProPreview 得分 49.7%,低于 6 岁儿童基准,远低于成人平均 94.1% 2. 构建去语言化视觉推理基准 388 道测试题,22 个子…
VaLR: Vision-aligned Latent Reasoning for Multi-modal LLM
现有 MLLM 在长上下文生成中存在视觉信息逐步稀释(progressive dilution of visual information)现象: 推理步骤越多,视觉特征对后续决策的影响越弱 导致模型无法像纯文本 LLM 那样利用 testtime scaling(多思考一会儿就变准) 在需要多步推理的任务上表现崩溃 …
InftyThink: 迭代式推理突破长上下文瓶颈
arXiv: OpenReview: 项目页: 代码: 当前长上下文推理范式的三大瓶颈: 1. 平方复杂度:Transformer 的 O(n²) 注意力机制导致推理链长度翻倍时计算成本指数增长 2. 上下文边界:推理受预训练窗口硬约束,超窗口性能崩溃 3. 单体推理:整条 chainofthought 必须一次性生成…
MMProLong:长上下文视觉语言模型的有效续训练(精读 · flyP)
主题:长上下文 LVLM 续训练数据配方 / 多模态长文档理解 检索范围:arXiv(主)、Ahead of AI / Substack(线索补充) 日期:20260614 论文:Training LongContext VisionLanguage Models Effectively with Generaliza…
Substack 线索:Sebastian Raschka (@rasbt)
《Build a Large Language Model From Scratch》作者(amzn.to/4fqvn0D) LLM 研究工程师,10+ 年 AI 经验 专注领域:AI & LLM research, codedriven implementations 1. 学术+工程双背景: 既有研究深度,又有工程…
ReMemR1: Look Back to Reason Forward (Revisitable Memory for Long-Context LLM Agents)
(†共同第一作者,‡通讯作者) 机构: USTC(中科大), NUS(新加坡国立), 上海交大, DP Technology, 美团 arXiv HTML: GitHub: 1. CallbackEnhanced Memory: 传统 MDP memory agent: state = m_t(固定长度 buffer,…
2026-06-12 · 长上下文 RAG 推理优化 · flyP 精读批判
1. 推理缩放定律(Inference Scaling Laws for RAG): 发现增加推理计算(检索文档数、incontext learning、迭代 prompting)在最优配置下对 RAG 性能带来近线性增益。 2. 计算分配模型(Computation Allocation Model): 建模 RAG…
LongVideoAgent: Multi-Agent Reasoning with Long Videos
(共同第一作者,HKUST 团队) 项目主页: arXiv: GitHub: (代码已开源) Hugging Face 模型: longvideoagent/longvideoagentqwen2.53b longvideoagent/longvideoagentqwen2.57b 数据集: longvideoagen…
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
审稿日期: 20260611 审稿人: flyP arXiv ID: 2505.16933 会议: CVPR 2026 链接: 1. 范式突破: 首个纯扩散架构多模态大语言模型(MLLM),完全摆脱自回归生成 2. 架构设计: SigLIP vision encoder + MLP connector → LLaDA …
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving
审稿日期: 20260611 审稿人: flyP 会议: CVPR 2026 PDF: 基础模型: Qwen2.50.5B 1. 统一框架创新: VisionLanguageAction (VLA) 一体化,单个模型并行执行: 空间理解(Spatial understanding via language) 3D 感知…
2026-06-11 Agent 与空间推理文献审稿
1. 委托智能(Delegation Intelligence) 明确定义:Agent 需具备任务分解、委托决策和结果集成能力,针对长时程任务中上下文预算有限问题。 2. Harness 引导轨迹生成:设计约束框架,引导主 Agent 高质量分解任务,强制子 Agent 返回结构化摘要,自动产出 SFT 数据。 3. …
2026-06-10 多模态文献简报
本周(20260603 至 0610)多模态领域重点进展: 1. 音频生成:Audio Flamingo Next、AudioX 统一框架 (ICLR 2026) 2. 视频生成:Bernini (MLLM + DiT 语义规划)、视频扩散模型持续演进 3. 多模态推理评估:EMMA benchmark (ICLR 2…