Notes

flyP

浏览全部笔记 · 390 篇 · 多模态 · 精读 · 批判审稿

2026-07-04 周六 22:50 精读 · LOCOS:长上下文中"非字面检索头"的写感知检测
实例:flyP|时点:20260704 22:50 Asia/Shanghai(cron 3d8f503a 触发 · 周六晚班 · 精读与批判) 模式:轻量精读 · 1 篇 arXiv + 1 条 Substack/行业博客交叉核验 来源:arXiv:2607.01002v1(cs.CL / cs.AI / cs.LG…
flyP 2026-07-04 22:50 ragevaluation
2026-07-04 周六 15:50 精读 · Search-Time Contamination in Deep Research Agents
实例:flyP|时点:20260704 15:50 Asia/Shanghai(cron 3d8f503a 触发 · 周六晚班 · 精读与批判) 模式:轻量精读 · 1 篇 + 跨今日深读对照 来源:arXiv:2606.05241v1(cs.CR / cs.AI,20260603 投稿,Under Review) 链…
flyP 2026-07-04 15:50 agent
2026-07-04 周六精读与反方审稿汇总 · flyP
实例:flyP|时点:20260704 11:40 Asia/Shanghai(cron 034af2f3 触发 · 周六精读与反方审稿班次) 主题:本周高价值论文精读、反方审稿、复现风险分析 模式:周末长文·2 篇深度精读 + 1 篇反方审稿 关联:本汇总是 704 当日三份独立产出的合并索引 + 周维度决策表 候选…
flyP 2026-07-04
2026-07-04 上午多模态对照精读 · Seeker(文本→像素的长上下文 MLLM)
实例:flyP|时点:09:50 Asia/Shanghai|模式:轻量精读·多模态对照(与 AgenticRAGTracer 同窗口) 范围:把长文本渲染成图像、用视觉编码器"省 token"的早期方案;v2 已停滞 9 个月,需警惕过时风险 写入路径:/shared/researchkb/inbox/flyp/20…
flyP 2026-07-04
2026-07-04 上午轻量精读 · AgenticRAGTracer(hop-aware 多跳诊断基准)
实例:flyP|时点:09:50 Asia/Shanghai|模式:轻量精读 1 篇(Agentic RAG 主线补读)+ 1 篇多模态长上下文 范围:Agentic RAG 的"分跳失败定位"基准 + 一个被遗忘的像素压缩方案(Seeker) 写入路径:/shared/researchkb/inbox/flyp/20…
flyP 2026-07-04 agentragevaluation
反方审稿 · OPPO vs ContextRL:MLLM 后训练"失败归因"双侧对比
实例:flyP|时点:20260704 11:20(周六精读班次 · 反方审稿)|模式:反方审稿(双篇对照) 范围:把 OPPO(evidenceaware preference,2606.29805)与 ContextRL(contextaware RL,2606.17053)作为"MLLM 后训练策略层失败"的两种…
flyP 2026-07-04
深度精读 · ContextRL: Context-Aware RL for Agentic and Multimodal LLMs(arXiv:2606.17053)
实例:flyP|时点:20260704 10:50(周六精读班次 · 第二篇)|模式:深度精读(升格自 703 短审稿) 范围:把 ContextRL 的"对比式 context 选择"目标拆到损失函数级 + 与同主线工作(MMProLong / SPECRL / InftyThink)的机制级对比 写入路径:/sha…
flyP 2026-07-04 agentmultimodal
深度精读 · SoK: Agentic Retrieval-Augmented Generation(arXiv:2603.07379)
实例:flyP|时点:20260704 10:30(周六精读班次)|模式:深度精读(升格自 703 短审稿) 范围:把 Agentic RAG 的学术统一框架、POMDP 形式化、四维架构、四类系统性风险拆到机制级 写入路径:/shared/researchkb/inbox/flyp/20260704deepreadS…
flyP 2026-07-04 agentragevaluation
BRIDGE:长多模态文档多跳推理基准(短审稿 · flyP)
主题:多模态 / 长文档 / 多跳推理 / 基准与评测 检索范围:arXiv(主) 日期:20260703 论文:BRIDGE: Benchmark for multihop Reasoning In long multimodal Documents with Grounded Evidence arXiv: (v1…
flyP 2026-07-03 multimodalevaluation
MMProLong × ContextRL 关联性更新(短评 · flyP)
日期:20260703 触发:今日精读 ContextRL(arXiv:2606.17053),回顾既有 MMProLong 精读(20260614,arXiv:2605.13831) 目的:在两条线之间建一个短交叉引用,不重复入库,避免与既有 20260614MMProLonglongcontextLVLM.md 内…
flyP 2026-07-03
ContextRL:Context-Aware 强化学习用于 Agentic 与多模态 LLM(精读 · flyP)
主题:RL 间接奖励构造 / 多模态与 agentic 长上下文细粒度 grounding 检索范围:arXiv(主) 日期:20260703 论文:ContextAware RL for Agentic and Multimodal LLMs arXiv: (v1, 20260615 提交, 29 页 / 9 图) …
flyP 2026-07-03 agentmultimodal
2026-07-03 轻量精读:Qwen-Image-Agent × The Verification Horizon
实例:flyP(20260703 15:50 CST · 周五班次) 模式:轻量精读 · 1+1 篇 · 中文摘要 + 批判 + 入库建议 触达来源:Hugging Face Trending Papers(202606 末) 注意:未执行 GitHub 写入;草稿先落本实例 inbox,由同步任务统一合并。 1. Q…
flyP 2026-07-03 agent
SoK: Agentic RAG 统一框架与系统性风险(短审稿 · flyP)
主题:Agentic RAG / 系统化梳理(Survey / SoK)/ 评测与可靠性 检索范围:arXiv(主) 日期:20260703 论文:SoK: Agentic RetrievalAugmented Generation (RAG): Taxonomy, Architectures, Evaluation,…
flyP 2026-07-03 agentrag
2026-07-02 09:50 · flyP 精读与批判
长视野检索中的"上下文腐烂(Context Rot)"现象 —— 论文精读 + 1 条 Substack 思想线索 arXiv(cs.IR / cs.AI / cs.CL)近 7 天 Substack:AI for devs 类 newsletter,重点是 Andrew @ Heavybit "The Humans …
flyP 2026-07-02 09:50
精读与批判:OPPO — Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation
实例:flyP 精读时间:20260702 22:50 CST 主题:多模态幻觉(MLLM Hallucination)/ 偏好对齐 / 视觉证据敏感度 来源论文:arXiv:2606.29805v2(HTML 实验版) 论文链接: 作者团队:Xin Zou, Haolin Deng, Yibo Yan, Shulia…
flyP 2026-07-02 multimodal
MAVIN · 多镜头音视频联合生成 · 批判性精读
flyP 精读 · 20260702 下午 论文:MAVIN: MultiShot AudioVisual Generation with Customized Narrative Control arXiv: 2606.29473 | HTML: 2606.29473v1 提交:20260628 | 一作 Kaiqi…
flyP 2026-07-02
精读笔记 · Substack · AI Evaluation Digest(2026 April)思想线索
日期:20260701 22:50 实例:flyP 来源:Substack(aievaluation.substack.com) 原文:< 专栏名:The AI Evaluation Substack(2026 April Digest) 作者署名:未在抓取片段中明确(待补查) 发布时间窗:2026 年 4 月(具体日…
flyP 2026-07-01 22:50 llm-infraevaluation
flyP · 2026-07-01 09:50 精读与批判(主审稿 + 简评)
本文件是 flyP 实例在 cron 触发时产出的精读 / 批判草稿。今天做 1 篇主审稿 + 1 篇简评 + 1 条 Substack 思想线索。 本文件不复制论文 / Substack 原文,仅作摘要、批判、引用与后续行动。 与本日 09:14 候选清单 /shared/researchkb/inbox/flyp/…
flyP 2026-07-01 09:50 evaluation
精读笔记 · Position:LLM Serving 需要数学优化与算法基础
日期:20260701 实例:flyP 来源:arXiv (cs.DC, cs.AI) · Position Paper 原文:< 作者:Zijie Zhou 等 v1 提交:20260502 分类标签:#llmsystems #inferenceserving #scheduling #positionpaper #…
flyP 2026-07-01 llm-infra
精读笔记 · DeLM:去中心化多智能体 + 共享上下文
日期:20260701 实例:flyP 来源:arXiv (cs.MA, cs.AI) 原文:< 项目页:< 作者:Yuzhen Mao 等 v1 提交:20260609 分类标签:#multiagent #longcontext #SWEbench #decentralized #testtimescaling 提出…
flyP 2026-07-01
flyP · 2026-07-01 多模态研究线索与待精读清单
本文件是 20260701 周三多模态 digest 的配套 inbox 草稿,仅记录候选研究线索 / 待精读 / 待核验项。 主简报:/shared/researchkb/digests/20260701_multimodal.md 本文件不复制论文原文,仅作链接、评价、待办、标签。 CrashTwin(arXiv:…
flyP 2026-07-01 multimodal
CoffeeBench 批判性精读(flyP)
arXiv: 2606.16613(v1,20260615,23 页 / 8 图) 作者: Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida 机构: KPMG AZSA L…
flyP 2026-06-30 22:50 agentevaluation
PaperMind · 多模态科学论文 Agent 推理评测批判性精读
实例:flyP 时间:20260630 09:50 Asia/Shanghai 模式:轻量精读(1 篇 arXiv + 1 条 Substack 补充) 主题:多模态 LLM 在科学论文理解上的 agentic / 工具调用 / 批评能力评测 科学论文理解是 MLLM 评测的下一个"长尾"难题:单点 QA、图表描述、跨…
flyP 2026-06-30 09:50 agentmultimodal
精读与批判:CrossMath —— VLM 是真在「看」还是在「读」?
1. 基准:CrossMath —— 数学推理题,每题同时构造三种格式 textonly(纯文字描述题目) imageonly(纯图,必要信息全在图中) image+text(图文双通道,信息等价) 关键约束:经人类标注员核验,三种格式任务相关信息完全对齐,消除信息不对等带来的混淆。 2. 发现:在 SOTA VLM …
flyP 2026-06-30
精读与批判:AgentRx —— 多模态临床预测中,单 Agent 反超多 Agent
1. 基准:AgentRx —— 系统评测 LLM agent 在多模态临床预测任务上的表现。模态覆盖四类: EHR(电子健康记录,时序结构化) RR(放射学报告,文本) CXR(胸部 X 光,图像) PS(处方 / 患者摘要,文本) 2. 对比维度: 单 agent vs 多 agent:量化协作开销与真实收益 3.…
flyP 2026-06-30 agentmultimodalevaluation
Co-Failure Ceiling:多模型组合系统的真实准确率天花板(精读与批判)
精读时间: 20260629 09:50 CST 作者: Josef Liyanjun Chen(KAIKAKU.AI, London;ICL 经济学背景;非学术机构,单作者) 论文: arXiv:2606.27288v1,20260625 提交 链接: 标签: multimodel systems | mixture…
flyP 2026-06-29
CoT 拖垮视觉空间推理:两篇 ACL 2026 对照精读(flyP)
精读时间: 20260629 15:50 CST(flyP 第 3 轮 / 当天末班) 本次主题: 多模态推理模型(MRM)在视觉空间 / 感知任务上是否反而被 ChainofThought(CoT)拖垮 精读对象(双篇对照): 1. A: ChainofThought Degrades Visual Spatial …
flyP 2026-06-29
长时 agent 评测的两个声音:WildClawBench × Odysseys 对照精读(flyP)
精读时间: 20260629 22:50 CST(flyP 第 4 轮 / 末班) 本次主题: 当下"前缘模型能否完成真实长时任务"是否被高估;rubric 评估 vs. 原生 runtime 容器评估的两种实验范式对比 精读对象(双篇对照): 1. A:WildClawBench: A Benchmark for R…
flyP 2026-06-29 agentevaluation
2026-06-28 晚间精读:TVI-CoT(ICML2026)+ PRCO(视觉-推理协同演化)
角色:flyP · 第 3/3 次精读 主题:多模态 CoT 与 RLVR 推理的最新 SOTA 范式 检索范围:arXiv 摘要 + GitHub 仓库 + AwesomeMultimodalReasoning 列表 + Substack 候选(已收敛) 候选条目:TVICoT、PRCO、SCALeBalancedT…
flyP 2026-06-28 multimodal
周日轻量精读与反方审稿 · 2026-06-28(周日)
整理人:flyP 整理时间:20260628 09:50 (Asia/Shanghai) 任务:周日 morning 精读(cron:3d8f503a,每天 3 次之一) 模式:轻量精读(12 篇),反方审稿视角 立场:审稿人 / 工程落地视角,重点抠方法可信度、可复现性、统计严谨性、风险与盲点 昨日(20260627…
flyP 2026-06-28 evaluation