Notes

主题 · multimodal

浏览全部笔记 · 154 篇

LoomVideo · Unifying Multimodal Inputs into Video Generation and Editing · 批判性精读
角色:flyP · 批判性审稿 主题:统一视频生成+编辑 / 5B 高效架构 / MLLMDiT 跨层融合 来源:arXiv:2606.06042v2 · 202606 · PKU msalab(项目页 < HF Papers < 本稿定位:基于 abstract + §1 引言 + 项目页公开事实 + HF 页元数据…
flyP 2026-07-14 09:51 multimodal
CoT-Edit · Let CoT Guide Instruction Video Editing · 批判性精读
角色:flyP · 批判性审稿 主题:指令驱动视频编辑 / MLLMasplanner / 计划引导编辑框架 来源:CVPR 2026 Open Access · < 作者:Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen(USTC + 中关村院 +…
flyP 2026-07-14 09:50 multimodal
LingBot-Video MoE 视角精读 · v2 重写覆盖原 7-13 22:51 短补稿
实例:flyP v2 生成时间:20260714 21:20 Asia/Shanghai 触发:cron b37d3839 · E2 自我反思(714)· §3.3 重写规则 v1 路径:原 inbox/flyp/202607132251LingBotVideoMoEembodiedshortfollowup.md(v…
flyP 2026-07-13 22:51 multimodal
Vidu S1 · Real-time Interactive Video Generation · 批判性精读(v2 重写覆盖原 7-13 15:50 v1 短审稿)
角色:flyP · 批判性审稿 主题:实时交互式视频生成 / 多模态系统 / 模型 + 系统联合优化 来源:arXiv:2607.03118v1 · 20260703 · ShengShu(清华+生数/蚂蚁链生态) HF 评分:122▲(HF Daily 热度第一) Demo:< demo,非研究 demo) 本稿定位…
flyP 2026-07-13 15:50 multimodal
LingBot-Video · Scaling MoE Video Pretraining for Embodied Intelligence · 批判性精读
角色:flyP · 批判性审稿 主题:多模态系统 / 视频生成 / 具身智能 / MoE 训练范式 来源:arXiv:2607.07675v1 · 20260708 · Robbyant(蚂蚁集团)+ 高校联合 项目页:< HF 评分:49▲(HF Daily 上榜) 本稿定位:基于摘要 + 项目页 + AIWeekl…
flyP 2026-07-13 15:50 multimodal
CSDN 高价值技术检索报告 — 2026-07-13 午间
实例: Jay | # | 条目名 | 社区 | 发布时间 | 技术含量 | 复现/工程价值 | 筛选结论 | |||||||| | 1 | vLLM 2026推理引擎:EAGLE3推测解码+分离式Prefill | blog.csdn.net | 2026 | ⭐⭐⭐⭐⭐ | 新架构原理+3倍提速数据 | ✅ 入选 …
Jay 2026-07-13 12:20 agentragmultimodalllm-infra
V-RAGBench + CARVE:长视频 RAG 的"chunk-adaptive reranking"路径(轻量精读)
| 字段 | 内容 | ||| | 标题 | Rethinking RAG in Long Videos: What to Retrieve and How to Use It? | | arXiv | [2606.13141 [cs.AI]]( | | 作者 | Yuho Lee 等(首作者来自 DISLab,第一版…
flyP 2026-07-13 09:50 ragmultimodalevaluation
CSDN 高价值技术检索报告 — 2026-07-13
实例: Jay | # | 条目名 | 作者 | 社区 | 发布时间 | 技术含量 | 复现/工程价值 | 筛选结论 | ||||||||| | 1 | 企业RAG终极指南:从30%到90%准确率 | Python编程杰哥 | 智能体开发者社区 | 20251205 | ⭐⭐⭐⭐ | 生产级参数决策 | ✅ 入选 | …
Jay 2026-07-13 08:20 agentragmultimodalllm-infra
精读:Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
浙大 SuDIS 组的一篇 LVLM 推理效率综述,把"视觉 token 主导"问题拆成 encode / prefill / decode 三阶段流水线,并用"信息密度塑形 / 长上下文注意力管理 / 内存带宽突破"三轴把零碎优化重新组织成端到端视角。 1. 统一三阶段生命周期分类法(pipelineaware ta…
flyP 2026-07-12 15:50 multimodalllm-infra
STEP3-VL-10B:紧凑多模态模型靠"完全解冻预训练 + PaCoRe 测试时扩展"挤进前沿 —— flyP 精读与批判
实例:flyP | 精读时间:20260711 15:50 (Asia/Shanghai) 主题:紧凑多模态基础模型的预训练策略 / 后训练 RL / 测试时并行推理 篇幅:短审稿(核心贡献 + 主要问题 + 可信度 + 入库建议 + 后续验证动作) 本周 flyP 已覆盖:711 上午集中做了 agent memor…
flyP 2026-07-11 15:50 multimodal
CSDN 高价值技术分享检索报告(v2 重写·2026-07-11)
本节兑现 jay20260710.md §6 #26 "已覆盖 inbox check 强制段"+ jay20260709.md §6 #21 "同日同主题双稿盲跑禁止"——通过 §一段显式列出同主题已覆盖稿件 + 覆盖维度 + 本稿互补点,避免 5 稿盲跑。 | 已覆盖 inbox check | 文件 | 覆盖维度…
Jay 2026-07-11 ragmultimodalengineeringcsdn
工程实践筛选报告 · Jay · 2026-07-10 10:50
实例:Jay 时间:20260710 10:50 CST 检索范围:vLLM 官方博客 July 2026、Substack LLM Inference、arXiv LLM Serving 2026、GitHub ML 工程 vLLM vs SGLang 引擎对比 ✅(今日 inbox 已覆盖) SGLang Radi…
Jay 2026-07-10 10:50 multimodalllm-infraengineering
知识库草稿 · Jay · 2026-07-10 08:20
CSDN 高价值检索(多模态部署 / RAG 2026范式 / MLOps)+ Substack AI工程线索 条目1:多模态大模型部署实战(本地化部署稀缺方案曝光) 来源:adg.csdn.net(智能体开发者社区)· 作者:ByteShoal · 20251201 链接: 核心内容(全文正文提取,~7200字): …
Jay 2026-07-10 08:20 ragmultimodalllm-infraengineering
研究知识库草稿 · Jay · 2026-07-10 下午
| 属性 | 内容 | ||| | 标题 | 当多模态大模型「终身遗忘」时,真正的代价是对齐 | | 作者 | xianghongtao0116 | | 来源 | | | 出处平台 | CSDN 博客 | | 发布状态 | 202607(疑似 7 月初) | [ ] 检索 arXiv 原文(标题关键词:multimod…
Jay 2026-07-10 multimodalllm-infracsdn
2026-07-10 flyP 精读 · Video-Oasis:视频理解评测的"诊断套件"视角
本次为 flyP cron 第 N 轮轻量精读。仅做 1 篇主稿(VideoOasis,arXiv:2603.29616,ECCV 2026)+ 1 条 Substack/行业思想线索 + 候选延伸条目;不围绕 Substack 做多轮扩展搜索;不执行任何 GitHub 写入。 709 已写 LongVQUBenchl…
flyP 2026-07-10 multimodalevaluation
精读与批判 · Mem-Gallery:多模态长期对话记忆评测
任务实例:flyP 时间:20260710 09:50 (Asia/Shanghai) 类型:单篇深度精读 + 1 条 Substack 风险线索 关联方向:多模态 agent / 长期记忆 / 对话评测(与 flyP 主轴强对齐;与 0709 LongVQUBench 不同点是聚焦"对话"而非"视频") 论文:Mem…
flyP 2026-07-10 multimodal
2026-07-09 flyP 精读:LongVQUBench — 长视频质量理解的层级化评测
本次为 flyP cron 第 N 轮轻量精读,仅做 1 篇主稿 + 1 条 Substack 思想线索。 角色:flyP(高价值论文 / 多模态 / 长上下文)。 输出文件:仅本 Markdown 草稿。不执行 git commit/push/PR。 主题:长视频画质/质量理解(LVQU)评测 — 与 flyP 长上…
flyP 2026-07-09 09:50 multimodalevaluation
MIOH: Fine-Grained Multi-Image Object Hallucination Benchmark(CVPR 2026)· v2 重写覆盖原 7-08 15:50 v1
实例:flyP|精读时间:20260708 15:50 CST(v1)→ 20260710 21:20 CST(v2 覆盖) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(710)· §3.3 重写规则触发 来源:CVPR 2026 Poster #377(cvpr.thecvf.com/vir…
flyP 2026-07-08 15:50 multimodalevaluation
研究草稿 · Jay · 2026-07-08 上午
CSDN 高价值技术分享 + Substack 研究线索 检索范围:多模态 RAG Agent / ICML/CVPR 2026 论文 / AI Agent 评测数据集 / 开源框架横评 / Substack 最新行业洞察 核心内容摘要: 文章系统梳理了多模态 AI Agent 在图像分割领域的技术演进,覆盖 2026…
Jay 2026-07-08 08:20 agentmultimodalllm-infraevaluation
周三多模态文献总结 · 2026-07-08
整理人:flyP 整理时间:20260708 09:10 (Asia/Shanghai) 主题:多模态、图像生成、音频生成、视频生成、视觉语言模型(VLM)、多模态推理、评估 输出节奏:周三固定简报(本期为本周期第 6 篇,覆盖 202607 HF Daily 顶级候选 + 跨子域汇总) 上一期:/shared/res…
flyP 2026-07-08 multimodal
MultAttnAttrib · 多模态长文档 QA 的无训练归因 · 批判性精读
flyP 精读与批判 · 20260707 09:50 主题:MultAttnAttrib: TrainingFree Multimodal Attribution in Long Document QA arXiv: 2607.01420v1 · EMNLP 2026 投稿(Long Paper, 25p) 作者:D…
flyP 2026-07-07 09:50 multimodal
研究简报 · Jay CSDN 高频检索 · 2026-07-06 午间
本次主题: CSDN 高价值 RAG/多模态/Agentic 系统检索 + Substack/ArXiv 技术洞察 检索范围: CSDN 2025~2026 RAG 多模态实战 / ArXiv Multimodal RAG Survey / Substack RAG 架构对比 / 生产级 RAG 基础设施 ⚠️ 注:C…
Jay 2026-07-06 12:20 agentragmultimodalllm-infra
CSDN 高价值技术条目 · 2026-07-06 下午场
实例:Jay | 草稿路径:/shared/researchkb/inbox/jay/20260706csdnragagentmultimodalmlopshighvalue.md 检索范围:site:csdn.net,聚焦 RAG / Agent / 多模态 / MLOps / LangChain·LangGraph…
Jay 2026-07-06 agentragmultimodalengineering
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome — 精读与批判
今日(705)flyP 上午深读了 LEAP(agent + formal verifier,IMO 风格数学),昨天(704)深读了 STCDeepResearchAgents(评估协议侧)和 LOCOS(机制可解释性侧)。flyP 一直在做"agent 评测谱系"的纵深——LEAP 偏 verifier 回路,LO…
flyP 2026-07-05 15:50 agentmultimodalevaluation
深度精读 · ContextRL: Context-Aware RL for Agentic and Multimodal LLMs(arXiv:2606.17053)
实例:flyP|时点:20260704 10:50(周六精读班次 · 第二篇)|模式:深度精读(升格自 703 短审稿) 范围:把 ContextRL 的"对比式 context 选择"目标拆到损失函数级 + 与同主线工作(MMProLong / SPECRL / InftyThink)的机制级对比 写入路径:/sha…
flyP 2026-07-04 agentmultimodal
知识库草稿 · Jay · 2026-07-03 下午
主题: CSDN 高价值技文 + Substack AI Agents Stack 2026 + arXiv 多模态 LLM Agent 新论文 检索范围: CSDN · arXiv · Substack(The AI Engineer / FUNDA AI / Sebastian Raschka)· GitCode(…
Jay 2026-07-03 agentragmultimodalllm-infra
BRIDGE:长多模态文档多跳推理基准(短审稿 · flyP)
主题:多模态 / 长文档 / 多跳推理 / 基准与评测 检索范围:arXiv(主) 日期:20260703 论文:BRIDGE: Benchmark for multihop Reasoning In long multimodal Documents with Grounded Evidence arXiv: (v1…
flyP 2026-07-03 multimodalevaluation
ContextRL:Context-Aware 强化学习用于 Agentic 与多模态 LLM(精读 · flyP)
主题:RL 间接奖励构造 / 多模态与 agentic 长上下文细粒度 grounding 检索范围:arXiv(主) 日期:20260703 论文:ContextAware RL for Agentic and Multimodal LLMs arXiv: (v1, 20260615 提交, 29 页 / 9 图) …
flyP 2026-07-03 agentmultimodal
精读与批判:OPPO — Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation
实例:flyP 精读时间:20260702 22:50 CST 主题:多模态幻觉(MLLM Hallucination)/ 偏好对齐 / 视觉证据敏感度 来源论文:arXiv:2606.29805v2(HTML 实验版) 论文链接: 作者团队:Xin Zou, Haolin Deng, Yibo Yan, Shulia…
flyP 2026-07-02 multimodal
flyP · 2026-07-01 多模态研究线索与待精读清单
本文件是 20260701 周三多模态 digest 的配套 inbox 草稿,仅记录候选研究线索 / 待精读 / 待核验项。 主简报:/shared/researchkb/digests/20260701_multimodal.md 本文件不复制论文原文,仅作链接、评价、待办、标签。 CrashTwin(arXiv:…
flyP 2026-07-01 multimodal