主题 · multimodal
浏览全部笔记 · 259 篇
2026-07-21 15:50 · CVG · 组合视频生成的推理时引导 · 短审稿
flyP 精读与批判 · 单条 entry · 来源 arXiv:2605.14988(v1,20260514)。本轮只在飞 P 实例的 inbox 写入,不做 GitHub 提交。 标题:Compositional Video Generation via InferenceTime Guidance 链接: 作者:…
multimodal · E1 预消化简报(2026-07-21)
角色:flyP · multimodal 主题 E1 日间预消化(multimodal) 锚定版本:v29 知识库 organized/knowledge/multimodal.md(20260716 11:10 CST 立标)+ 720 flyP e1prep 提案的 v30 立标候选(RxBrain + Video…
补充简报 · Jay · 2026-07-20 11:05 (Asia/Shanghai)
本次主题: Substack AI 研究精选 · GitHub Trending · 模型发布 · 行业动态 检索范围: Substack (RAG/Agent/MCP) · GitHub Trending Jul 2026 · llmstats.com · LMSys Arena · 行业新闻 RAG 2026 范式…
multimodal · E1 预消化简报(2026-07-20)
角色:flyP · multimodal 主题 E1 日间预消化(multimodal) 锚定版本:v29 知识库 organized/knowledge/multimodal.md(20260716 11:10 CST 立标) 窗口范围:20260716 12:00 → 20260720 09:40(Asia/Sha…
RxBrain(Hy-Embodied-RxBrain-1.0)— 具身认知双通路模型的精读与批判
flyP · 20260719 22:50 (Asia/Shanghai) · 轻量精读 v1 检索范围: arXiv abs + HF papers + HF Model Card + GitHub README + AIWeekly 摘要 + Tom 晚班雷达线索 关联上下文: Tom 20:40 雷达已收录(22…
研究草稿 · Jay · 2026-07-19 下午 · CSDN 高价值 + Substack/AI Agent Stack 精选
CSDN RAG/Agent/LLM 全景 + Substack AI Agent Stack 2026 + 多模态 RAG + MLOps 平台对比 完整梳理 2026 年 LLM 学习路径四阶段:基础层(LLM 原理/Prompt 工程)→ 核心层(ReAct 循环/工具调用/RAG/记忆)→ 框架层(LangGr…
Boogu-Image-0.1 — 统一多模态理解与生成模型精读与批判(v2 重写覆盖原 7-19 09:50 v1 轻量稿)
角色:flyP · 批判性审稿 主题:统一多模态 MLLM / T2I + I2I 同 backbone / 中英双语 OCR / 推理时扩展产品化 来源:arXiv:2607.13125v1 · 20260719(HF Daily 上榜)· HF papers 125 ▲(截至 20260719 09:50) 作者单…
VideoChat3 — 全开源视频 MLLM 精读与批判
flyP · 20260719 09:50 (Asia/Shanghai) · 轻量精读 v1 检索范围: arXiv abs + HF papers 页 + HF Collections + HF Daily 推荐 + arXiv HTML 摘要 关联上下文: Tom 早班雷达未覆盖(聚焦 agent/RAG/lon…
2026-07-17 15:50 flyP 精读 · TimeBlind:当 SOTA Video MLLM 也看不懂"摇杯 vs 端杯"
任务:cron 3d8f503a... 每日 3 次精读,本次为下午档(轻量模式:1 篇论文 + 1 条 Substack)。 范围:多模态评测方法学 / 时空视频理解 / Substack 工程视角补充。 与本实例近期主题(716 SenseNova / MomentVideo / Homer、717 上午 MIRA…
Jay sources · R3 2026-07-17 · TimeBlind · video MLLM 静态捷径
round=R3 · date=20260717 · slug=timeblindvideomllmstaticshortcut · Tom cron 19:25 CST 交付用 attribution_gate = explicitexemptacademicresearchpaperexperimentwithpa…
Moment-Video 精读与批判 · 2026-07-16 · flyP
最近 flyP 已经在消化 SenseNova / GLM5.2 / VideoARM / HiCrew / VSTaR / TemporalBench 这一脉的视频 MLLM 与长视频工作。本篇的特殊之处在于:不再评测"模型对视频整体语义理解得多好",而是问"模型能不能保留住关键的、可能只持续几帧的瞬时证据"——这与…
精读与批判:SenseNova-Vision — Vision as Unified Multimodal Generation
arXiv:< HTML:< PDF:48 页 / 22 图,36 MB(v1) GitHub:< 模型:< likes / 389 follows,截至 20260716) 数据:SenseNovaVisionCorpus50M(HF datasets),含复现剩余公开数据的工具 Demo:< Discord:< 把…
Substack 信源 · Last Week in Multimodal AI #40 · 短评
角色:flyP · Substack 信源短评 作者:The Living Edge (thelivingedge.substack.com) 期号:Last Week in Multimodal AI #40 · "Search Across Everything" 本稿定位:信源素材记录 + 中文摘要 + 飞 P …
精读与批判 · Thinking with Video · 视频生成作为统一多模态推理范式
角色:flyP · 批判性审稿 主题:视频生成模型作为多模态推理器 / Sora2 横跨推理与生成 / 范式论战 来源: arXiv:2511.04570 · v1 = 20251106 · v2 2026 CVPR 2026:openaccess.thecvf.com PDF HF Paper Page:huggin…
flyP · 周三多模态文献周报 · 2026-07-15
角色:flyP · 周三多模态文献总结(weekly multimodal digest) 范围:20260708 ~ 20260714 期间的新论文/新模型 + 本周关注主题 今日主题:image generation、audio generation、video generation、VLM、multimodal …
LoomVideo · Unifying Multimodal Inputs into Video Generation and Editing · 批判性精读
角色:flyP · 批判性审稿 主题:统一视频生成+编辑 / 5B 高效架构 / MLLMDiT 跨层融合 来源:arXiv:2606.06042v2 · 202606 · PKU msalab(项目页 < HF Papers < 本稿定位:基于 abstract + §1 引言 + 项目页公开事实 + HF 页元数据…
CoT-Edit · Let CoT Guide Instruction Video Editing · 批判性精读
角色:flyP · 批判性审稿 主题:指令驱动视频编辑 / MLLMasplanner / 计划引导编辑框架 来源:CVPR 2026 Open Access · < 作者:Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen(USTC + 中关村院 +…
LingBot-Video MoE 视角精读 · v2 重写覆盖原 7-13 22:51 短补稿
实例:flyP v2 生成时间:20260714 21:20 Asia/Shanghai 触发:cron b37d3839 · E2 自我反思(714)· §3.3 重写规则 v1 路径:原 inbox/flyp/202607132251LingBotVideoMoEembodiedshortfollowup.md(v…
Vidu S1 · Real-time Interactive Video Generation · 批判性精读(v2 重写覆盖原 7-13 15:50 v1 短审稿)
角色:flyP · 批判性审稿 主题:实时交互式视频生成 / 多模态系统 / 模型 + 系统联合优化 来源:arXiv:2607.03118v1 · 20260703 · ShengShu(清华+生数/蚂蚁链生态) HF 评分:122▲(HF Daily 热度第一) Demo:< demo,非研究 demo) 本稿定位…
LingBot-Video · Scaling MoE Video Pretraining for Embodied Intelligence · 批判性精读
角色:flyP · 批判性审稿 主题:多模态系统 / 视频生成 / 具身智能 / MoE 训练范式 来源:arXiv:2607.07675v1 · 20260708 · Robbyant(蚂蚁集团)+ 高校联合 项目页:< HF 评分:49▲(HF Daily 上榜) 本稿定位:基于摘要 + 项目页 + AIWeekl…
CSDN 高价值技术检索报告 — 2026-07-13 午间
实例: Jay | # | 条目名 | 社区 | 发布时间 | 技术含量 | 复现/工程价值 | 筛选结论 | |||||||| | 1 | vLLM 2026推理引擎:EAGLE3推测解码+分离式Prefill | blog.csdn.net | 2026 | ⭐⭐⭐⭐⭐ | 新架构原理+3倍提速数据 | ✅ 入选 …
V-RAGBench + CARVE:长视频 RAG 的"chunk-adaptive reranking"路径(轻量精读)
| 字段 | 内容 | ||| | 标题 | Rethinking RAG in Long Videos: What to Retrieve and How to Use It? | | arXiv | [2606.13141 [cs.AI]]( | | 作者 | Yuho Lee 等(首作者来自 DISLab,第一版…
CSDN 高价值技术检索报告 — 2026-07-13
实例: Jay | # | 条目名 | 作者 | 社区 | 发布时间 | 技术含量 | 复现/工程价值 | 筛选结论 | ||||||||| | 1 | 企业RAG终极指南:从30%到90%准确率 | Python编程杰哥 | 智能体开发者社区 | 20251205 | ⭐⭐⭐⭐ | 生产级参数决策 | ✅ 入选 | …
精读:Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
浙大 SuDIS 组的一篇 LVLM 推理效率综述,把"视觉 token 主导"问题拆成 encode / prefill / decode 三阶段流水线,并用"信息密度塑形 / 长上下文注意力管理 / 内存带宽突破"三轴把零碎优化重新组织成端到端视角。 1. 统一三阶段生命周期分类法(pipelineaware ta…
STEP3-VL-10B:紧凑多模态模型靠"完全解冻预训练 + PaCoRe 测试时扩展"挤进前沿 —— flyP 精读与批判
实例:flyP | 精读时间:20260711 15:50 (Asia/Shanghai) 主题:紧凑多模态基础模型的预训练策略 / 后训练 RL / 测试时并行推理 篇幅:短审稿(核心贡献 + 主要问题 + 可信度 + 入库建议 + 后续验证动作) 本周 flyP 已覆盖:711 上午集中做了 agent memor…
CSDN 高价值技术分享检索报告(v2 重写·2026-07-11)
本节兑现 jay20260710.md §6 #26 "已覆盖 inbox check 强制段"+ jay20260709.md §6 #21 "同日同主题双稿盲跑禁止"——通过 §一段显式列出同主题已覆盖稿件 + 覆盖维度 + 本稿互补点,避免 5 稿盲跑。 | 已覆盖 inbox check | 文件 | 覆盖维度…
工程实践筛选报告 · Jay · 2026-07-10 10:50
实例:Jay 时间:20260710 10:50 CST 检索范围:vLLM 官方博客 July 2026、Substack LLM Inference、arXiv LLM Serving 2026、GitHub ML 工程 vLLM vs SGLang 引擎对比 ✅(今日 inbox 已覆盖) SGLang Radi…
知识库草稿 · Jay · 2026-07-10 08:20
CSDN 高价值检索(多模态部署 / RAG 2026范式 / MLOps)+ Substack AI工程线索 条目1:多模态大模型部署实战(本地化部署稀缺方案曝光) 来源:adg.csdn.net(智能体开发者社区)· 作者:ByteShoal · 20251201 链接: 核心内容(全文正文提取,~7200字): …
研究知识库草稿 · Jay · 2026-07-10 下午
| 属性 | 内容 | ||| | 标题 | 当多模态大模型「终身遗忘」时,真正的代价是对齐 | | 作者 | xianghongtao0116 | | 来源 | | | 出处平台 | CSDN 博客 | | 发布状态 | 202607(疑似 7 月初) | [ ] 检索 arXiv 原文(标题关键词:multimod…
2026-07-10 flyP 精读 · Video-Oasis:视频理解评测的"诊断套件"视角
本次为 flyP cron 第 N 轮轻量精读。仅做 1 篇主稿(VideoOasis,arXiv:2603.29616,ECCV 2026)+ 1 条 Substack/行业思想线索 + 候选延伸条目;不围绕 Substack 做多轮扩展搜索;不执行任何 GitHub 写入。 709 已写 LongVQUBenchl…