解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
UltraViT:面向大视觉-语言模型的端侧延迟优化视觉编码器
论文提出 UltraViT——一个为「端侧(ondevice)延迟」而非仅 FLOPs 设计的 LVLM 视觉编码器:采用异构空间混合器(heterogeneous spatial mixers)按 macroblock 装配的金字塔架构,并配套两阶段生成式预训练(密集蒸馏 + 冻结 LLM 的生成式监督),在多项 L…
DEFRAG:从云到群——面向 RAG 的去中心化边缘协作系统
DEFRAG 用"知识图谱压缩共享 + 混合检索"解决边缘 SLM 的知识覆盖问题,再用"自适应 SLM 选择器 + RAG 参数调优"解决准确率与成本的平衡,最终在 heterogeneous edge testbed 上让 SLM 的准确率逼近云端 LLM,同时相比集中式云服务最高降本 98.4%、提升峰值吞吐 9…
TEngineDB-V:面向大 k 工作负载的 OLAP 原生向量搜索系统(腾讯)
TEngineDBV 把向量搜索提升为腾讯 OLAP 引擎的"一等分析原语",通过全局段解耦索引 + 关系算子化 + 方向感知量化(DPPQ),在 10³–10⁵ 的大 k 分析型向量检索上,比 StarRocks 等竞品最多快 145×,并在腾讯内部 100 亿规模生产环境取得 52× 提升。 LLM 数据管理、推荐…
宪法式中训练:内容存在驱动对齐收益
在 120B token 规模的中训练(midtraining)阶段插入 394M token 的"宪法"语料,可在不付出能力代价的前提下,让模型在后续 SFT 与良性微调中仍维持更稳健的价值观对齐——但其优势只在"静态价值观"层面成立,面对需要主动抵抗上下文压力或价值冲突的场景,优势会在 SFT 后被削弱。 当下大模…
超越"感觉更好":能力维持型情感对话作为纵向研究范式
当前情感对话研究几乎全部聚焦"让用户当下感觉更好",作者提出能力维持型情感对话(CSED, CapabilitySustaining Emotional Dialogue)——把目标重定义为在整个交互生命周期中维持用户的情绪调节、应对、自我决策与社会联结能力,并以此重组数据、模型、系统设计、评测与治理。 情感对话领域存…
EMBL AI Librarian:面向 AI Agent 的生命科学知识层
EMBL AI Librarian 把 Europe PMC(4000 万+ 文献索引)从"为人设计的检索系统"升级为"为 Agent 设计的知识层"——Agent 用自然语言提问,由一个 LLM 编排器(orchestrator)规划互补子查询、调用活体 Europe PMC 检索、阅读入选论文并定位证据段,最终直接…
你家编程 AI 助手总让你「再说一遍偏好」?这不是 bug,是 2026 年它还不会「跨会话记住你」
你有没有被 AI 编程助手搞到崩溃过这种程度: 上周你花了 5 分钟告诉它:「我项目用 4 空格缩进」「不要用 try/except 包裸 except」「命名用 snake_case」——它点头如捣蒜。 这周你新开一个会话,让它「帮我写个排序函数」。 它交回来一看:Tab 缩进、except:pass、函数名 sor…
你的 AI 助手「明明记得」却死活「想不起来」——这是 2026 年最隐蔽的记忆 bug
你有没有被 AI 助手气到过这种程度: 你三个月前就告诉过它:「我对坚果过敏」。今天你问它:「我能吃这家店的马卡龙吗?」 它想了想,一本正经地回答你:「可以呀,马卡龙是甜的。」 你气得想摔键盘——你明明把这件事告诉过它了。它数据库里搜得到,问起来又「想不起」。这种「该用的时候用不到」的记忆失效,在 2026 年正在成为…
1. 标题与观众
日期与轮次: 20260804 R2 arxiv: 2607.26611 video_kb 脚本: /shared/videokb/scripts/tom/20260804_R2_capacodingambiguityadaptationshortvideoscript.md 标题:CAPA · 跨会话编程消歧 目标观…
多 Agent 自动化研究系统的词汇表
论文提出了一套用于描述和比较「多 Agent 自动化研究系统(autoresearch system)」的工程词汇表,把五花八门的 AutoResearch / AI Scientist 设计拆成 8 个轴——Agents、Operations、Permissions、Communication、Memory、Cont…
Evaluating Large Language Models Trained on Code
OpenAI 将 GPT 模型在 GitHub 代码上微调得到 Codex,发现重复采样(repeated sampling)是一种出乎意料地有效的代码生成策略:单个样本只能解决 28.8% 的编程问题,但用 100 个样本时即可解决 70.2%;同期 GPT3 完全无法通过 HumanEval 的任何题目。 在 Co…
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
针对 Diffusion Transformer 视频生成中长序列 attention 的推理瓶颈,提出训练free 的 SolAttn 框架,在单次 onlinesoftmax 过程中统一完成动态路由选择、稀疏计算和近似修正,实现注意力稀疏化精度与效率的帕累托最优。 Diffusion Transformer(DiT…
LLaDA-V:基于视觉指令微调的大语言扩散模型
LLaDAV 是首个纯扩散范式的多模态大语言模型,用 masked diffusion 替代自回归生成,展示了不依赖 AR 范式也能做有竞争力的多模态理解的可能性。 自回归(AR)生成长期以来是多模态大语言模型(MLLM)的主流范式——无论是 LLaVA 系列还是 Qwen2VL,视觉理解最终都服务于「预测下一个 to…
Recursive Language Models:突破上下文窗口限制的通用推理范式
Recursive Language Models(RLM)不把长 prompt 塞进 Transformer,而是将其作为外部环境,让 LLM 以编程方式递归地审视、分解、自调用 prompt 片段——在 8B 参数规模下即可超越 vanilla GPT5 在三个长上下文任务上的表现。 Context Window …
Verifiable Software Worlds for Computer-Use Agents
OpenComputer 通过为真实桌面应用编写硬编码状态验证器,为 ComputerUse Agent 提供了可审计的、部分可评分的自动化评估框架,证明了硬编码验证器比 LLMasjudge 更贴近人类裁判——尤其在任务成败取决于细粒度应用状态的场景。 ComputerUse Agent(能操控桌面软件完成任务的 A…
并非所有 Token 都应获得同等贡献:面向长链思维推理的反事实敏感度贡献重分配
CSCR(Counterfactual Sensitivity Credit Reallocation)通过"反事实再评分 + 敏感度引导的优势重加权",把 GRPO 一刀切的 token 级信用分配改造成"按敏感度打折、保留总预算与方向"的形式,在长链思维推理任务上以同等策略更新次数稳定跑赢 GRPO 基线。 在大模…
RL²-VLA:面向 VLA 模型的自适应强化学习潜在组合引导与测试时缩放
RL²(Reinforcement Learning on VLA Latents)通过在 VLA 动作专家的潜空间训练一个轻量离线 RL 策略,将其 flow velocity 与冻结 VLA 的 flow velocity 进行组合式引导,并仅在"基础策略可能失败"时激活该引导,在 SIMPLER 与 PolaRi…
面向暗光场景的鲁棒 3D 感知 RGB-NIR 成像
3DarkFusion 借"3D 感知神经建模"重构了 RGBNIR 暗光融合的范式:不依赖干净 RGB 监督,通过让模型在 3D 空间中隐式融合极度含噪的 RGB 观测与 NIR 线索,输出干净的 RGB 图像,并对不同噪声等级保持鲁棒。 低光照 RGB 成像的标准做法是靠 paired 数据(暗光 RGB ↔ 干净…
SAF-OPD:面向 On-Policy 蒸馏的稳定优势融合
把 RLVR(可验证奖励的强化学习)和 OPD(onpolicy 蒸馏)的优势信号用一个稳定、可调的双向融合管线拼起来,既不抹除稀疏奖励信号,也不把学生模型死死按在教师分布里。 RLVR 和 OPD 是当下小模型后训练的两条主干路线。RLVR(如 GRPO)给整条响应一个可验证奖励(数学题对错、单元测试是否通过),再把…
更少澄清,更优代码:面向编程助手的跨会话个性化歧义自适应基准
把"同一用户过去解决过的编程歧义"当作跨会话长期记忆来复用,提出 CAPA 基准(600 个会话 × 60 个用户歧义单元格)量化 12 个 LLM 在"少澄清 + 出对代码"上的真实差距。 AI 编程助手正在从"单轮问答"走向"长期协作"。但当用户第二天打开新会话时,上次已经澄清过的偏好(例如"我的项目用 4 空格缩…
Mental World Modeling:把"心智变量"放进世界模型
把"人相信什么、想要什么、打算做什么"这类心智变量从世界模型的后验解释升级为与物理状态并列的核心状态变量,提出 MWM 框架与训练免费的 MENTIS 基线。 现有世界模型(world model)只能回答物理层问题:场景里有什么、它在哪里、它下一步怎么动。但人类决策并不是被物理场景单独驱动的——你看到同事沉默,没说话…
Vision Mamba:用双向状态空间模型做高效视觉骨干
Vision Mamba(Vim)首次把纯 SSM(State Space Model)类结构(Mamba)做成视觉通用骨干,通过"双向 SSM + 位置嵌入"的简单设计,在 ImageNet 分类、COCO 检测、ADE20K 分割上同时跑赢 DeiT 等成熟 ViT,并且推理速度与显存显著更优,验证了"视觉表征学习…
PaLM-E:把连续感官信号注入大语言模型的"具身多模态"路线
PaLME 把"图像、机器人状态估计等连续感官模态"通过专门的编码器投影到 LLM(PaLM)的词表嵌入空间,与文本 token 拼成一个多模态序列,端到端训练,从而把 PaLM 这种纯文本大模型直接升级为可以看图、看机器人状态、输出机器人动作规划的多模态通用模型,并且在 OKVQA 等视觉问答上达到 SOTA,同时不…
SimVLM:用海量弱监督 + 单一目标做极简视觉-语言预训练
SimVLM(Simple Visual Language Model)主张"VLP 不需要复杂的多任务目标与精细标注",仅靠海量图文弱对齐数据(alttext / web caption)配合单一 prefix language modeling 目标做端到端预训练,就在 VQA、NLVR2、SNLIVE、image…
2023 年 Meta 开源了「眼睛」:让机器第一次看懂世界,还不用任何人工标注
你有没有想过,为什么现在的 AI 看到一张照片,能立刻告诉你「这是一只在草地上奔跑的金毛犬」「这块区域是天空、那块是树」——它究竟是怎么「看」的? 更让人好奇的是:训练一个会看图的 AI,为什么不需要人工去告诉它「每张图里有什么」? 2023 年 Meta 发布的 DINOv2,给出了一个让整个 CV(计算机视觉)圈都…
2023 年 Salesforce 干了一件「省钱大事」:让 AI 看图说话,只用 1% 的算力
你有没有用过这种 AI? 📷 上传一张照片,它能告诉你「图里有一只柯基在草地上追飞盘」 🖼️ 给一张菜单,它能帮你读出每道菜 📊 丢一张图表,它能告诉你 2025 年的趋势 这种「既会看图又会说话」的 AI,叫 VLM(VisionLanguage Model,视觉语言模型)。 但问题是:训练这种 AI,以前贵得离谱。…
PathRouter: Aligning Rewards with Retrieval Quality in Agentic Graph RAG
PathRouter 针对 Agentic GraphRAG 中 outcomeonly RL 的两大痼疾——答案路径奖励混叠(answerpath reward aliasing)和搜索更新歧义(searchupdate ambiguity)——提出四类轨迹分治 + 差异化 GRPO 优势缩放 + 冻结 goldev…
WorldDiT:面向世界建模与动作建模的统一扩散架构
论文提出 WorldDiT——一种把「动作生成(action generation)」与「视觉世界建模(visual world modeling)」耦合在同一个 diffusion transformer 里的统一架构,不依赖大预训练 VLM 作为动作骨干,就在 LIBERO 四个仿真套件上落在已报告方法的「总参数 …
PerceptionBench:把 MLLM 的"原子视觉感知"单独拎出来打分的基准
PerceptionBench 给 MLLM 出了一份"剥离推理与领域知识"的纯感知考卷:在 16 个前沿模型上跑下来,没有任何一个跨过 60% 准确率,感知相关幻觉(perceptionrelated hallucination)是所有能力中平均最弱的一项,并且总分相近的模型在能力剖面上差异巨大——这把 MLLM 评…
Mage-VL:面向实时多模态的 Codec-Native 流式基础模型
MageVL 提出了一种 codecnative 的流式多模态基础模型:核心是自定义 tokenizer MageViT,通过对 I/P 帧做"动态 + 残差能量"选择性编码,把视觉 token 削减 75% 以上,并配合一个"类脑双系统"架构(轻量 System 1 事件门 + 因果 System 2 解码器),在 …