解读
1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
MAGIC:基于 LLM 的转换感知可导航多场景游戏世界生成
MAGIC 是一个四阶段 prompttoproject pipeline,能把"一句话"自然语言需求变成一个可运行的多场景 3D 游戏工程;在 100 例新建 benchmark 上端到端 transition 识别 F1 达 0.96,且全部产出可执行项目,显著优于 LLM baseline 与 Holodeck。…
Vinci2:从连续第一人称视频中提供主动式协助
Vinci2 把端侧第一人称助手从"被动响应"推进到"主动介入":把"什么时候该主动说话"建模为依赖上下文的决策问题,并同时发布了一个新的基准 EgoServe(3000 个服务实例、4 个时间记忆视野、10 个服务类别)和一个免训练、记忆增强的 agent EgoMemo(多尺度时间摘要 + 语义知识图谱 + 视觉嵌…
SynthDocBench:面向长上下文视觉文档理解的受控基准
SynthDocBench 是一个全合成的长上下文视觉文档理解基准,通过组合式设计(combinatorial design)独立控制文档长度、布局结构、模态构成与问题类型,并在 7 个前沿 VLM 上揭示出现有 benchmark 看不见的三类失败模式:长度剧退化、中段位置敏感、图表理解崩溃。 Vision Lang…
Multi-Agent LLMs 未能互相探索
现代 LLM Agent 在互相交互时表现出短视(myopic)和极化(polarized)的行为模式,无法有效探索彼此的能力边界;MACE(MultiAgent Contextual Exploration)通过结构化的对等体选择机制显式促进探索,显著提升多 Agent 协作任务中的探索行为和下游表现,并从理论上证明…
无标签策略下,准确率与顺序敏感性并不一致
在多选题评测中,遮挡选项标签并不能可靠地提升 LLM 准确率——位置偏置与知识是两个独立维度,去偏并不能换来准确率提升,但循环置换打分却常常能。 大模型评测长期依赖多选题基准(MMLU、CEval、ARC 等),但 MCQ 评分混淆了两件不同的事:模型"知不知道"和模型"对选项顺序敏不敏感"。当一个模型把答案从 B 改…
IVT:把"视觉思考"内化进权重,主动视频推理无需在推理时再画图
IVT(Internalized Visual Thinking)是一种后训练框架,在无标签视频上同时优化文本预测与下一 embedding 预测,让模型在训练阶段就把"对未来帧的运动、对象迁移、交互、潜在意图"的预测能力内化进权重——推理时直接输出文本答案,无需生成或重编码中间图像,端到端延迟降低超过 5×。 多模态…
xHC:把残差流扩到 N=16 的可扩展超连接
xHC(Expanded HyperConnections)首次把 Transformer 的残差流真正扩到 N=16:通过「时间特征增强 + 稀疏残差更新 + xHCFlash 内存加速」三件套,在 18B/28B MoE 上比 mHC 平均下游涨 4.0 分、训练 FLOPs 反而低于 vanilla 与 mHC,…
VIABench:面向视障辅助任务的盲人第一人称视频综合基准
VIABench 是一个由视障人士(VIIs)自行录制或分享的第一人称视频构成的综合视频基准,专门用于评估多模态大语言模型(MLLMs)在「视障辅助(Visually Impaired Assistance, VIA)」场景下的实际能力。它定义了三个互补的核心任务——Proactive Reminder(主动提醒)、V…
AI Prototyper:基于分解的 LLM GUI 原型设计 Figma 插件
本文提出 AI Prototyper——一个开源 Figma 插件,把「自然语言描述」经分解(decomposition)+ RAG(retrievalaugmented generation)流水线自动转成可编辑的 Figma 图层;并在渲染前加入人在回路编辑步骤,让用户审阅、修改或扩展生成的功能列表。相较已有分解式…
Agent 在 AutoResearch 上如何失败:100 个真实前沿研究任务的端到端诊断评估
机制 3 段:任务结构(生命周期×领域) + 失败分类法 ARFT(45 类) + 根因诊断(元认知闭环缺失) 工程 2 段:800 条轨迹采集与标注流水线 + humancalibrated agentasajudge 自动归因 ⚠️ 数字核验 3 处:100 任务 / 8 框架模型组合 / 800 轨迹;45 类失…
MOSS-VL 技术报告:把"边说边看"做成一流能力的开源多模态模型
机制 3 段:门控交叉注意力的解码器 / 交互语料监督何时说话何时沉默何时修正 / 离线强基座 + 轻量末端实时阶段 工程 2 段:合成实时交互语料构建 / 五个 checkpoint + 课程 + 推理代码全部开源 ⚠️ 数字核验 3 处:11.3B 参数 / TTFT 优势 2.8×→5.1× / OmniMMI …
TRACE-Bench:把多参考图像生成拆成"原子算子"再打分
多参考图像生成的现有 benchmark 都按"主体组合、属性绑定、风格迁移"这种表面任务分类,但其实所有任务都能拆成 Anchor / Disentangle / Apply / Compose 四个原子算子的组合;TRACEBench 用这套算子重写评测,跑 9 个 SOTA 模型后告诉业界:真正卡脖子的不是整体构…
GRNEdit:基于"二元证据"的高效通用视频编辑
把视频编辑重新刻画为"对每一比特的"保留 / 翻转"决策",用生成式 Refinement Network(GRN)作为 backbone,仅需 0.6M 训练对、不到 3% 条件参数,2B 模型就能在 OpenVEBench 上跑到 4.03,超过多个 14B 开源编辑器,8B 模型拿到 4.18,与最强开源编辑器打…
面向真实场景 Motion Language Model 的即插即用 2D Motion 接口
把"3D 预训练 → 单目视频不可用"这条死结,用一个即插即用的 2D Motion Interface 拆开:不动 MoLM 权重,就能让 3D 训练过的 Motion Language Model 直接吃 2D 关键点。 Motion Language Model(MoLM)这一波路线想用 LLM 的 token …
WorldRover:面向世界探索任务的、可扩展的、富含标注的合成视频数据引擎
WorldRover 把"长程世界探索"重做为一个可扩展的数据生成问题——基于 Unreal Engine 的离线渲染管线 WorldRoverEngine 能在同一条轨迹上同时输出 firstperson / thirdperson / 360° 三种视角下的 RGB + metric depth + 相机轨迹 + …
Large Discovery Models:基于经验、依托模型驱动的开放式搜索
Large Discovery Models (LDM)把"开放式科学发现"重构为一个生成式模型 + 贝叶斯非参数奖励代理的循环架构:生成器负责提议和精炼候选,代理负责预测性能并量化认知不确定性,二者随每一条新实验观测持续更新;在神经网络训练、抗体设计、分子优化三个场景上,LDM 比 LLM 反思与传统统计搜索分别取得…
ABot-AgentOS:具备终身多模态记忆的通用机器人 Agent 操作系统
论文提出 ABotAgentOS:一个位于底层控制器之上的「deliberative agent 层」,为长程(长期、跨时段)具身 Agent(embodied agent)提供场景条件规划、上下文隔离的技能(skill)执行、多阶段验证、多模态记忆、边云协同这五大运行时能力;同时发布配套评测基准 EmbodiedWo…
LLMs 是否准备好做科学发现?SDABench:面向 AI 科学家的能力导向基准
论文提出 SDABench,把对 LLM 的科学数据分析(SDA)评测从「能否跑通代码/完成 workflow」拆解为六类科学能力(描述、探索、推断、预测、因果、机制)在五个领域(生物、化学、环境、地理、物理)上的细粒度评估;在 527 条真实数据 + 6000 条合成数据上对 15 个代表性 LLM 测试后,得到的核…
读回:预训练 MLLM 是 T2I 生成的零样本奖励模型
论文提出 SpectraReward:一种无需训练的训练无关奖励函数,通过把预训练 MLLM(多模态大模型)直接当成零样本奖励模型来打分文本到图像(T2I)生成结果——做法不是让 MLLM 判断图像「好不好」,也不是回答分解后的验证问题,而是测量「图像能多好地把原始 prompt 读回来」,即用图像条件下的 promp…
Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents
ConvFill 通过"对话填充"(Conversational Infill)机制,让小模型在外部大模型推理完成前先行生成可信回复,填补了语音助手"低延迟"与"强能力"之间的鸿沟——在 Apple M2 芯片上实现毫秒级首响,精度仅比前沿模型低 6.3%。 语音 Agent 当前面临一个根本矛盾:基础模型的推理、检索…
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
RCORE 通过"共现先验正则化"(CPR)和"时序顺序正则化"(TORC)两项机制,专门破解 ZeroShot 组合动作识别中的"物体驱动捷径"问题——即模型不学动作本身,而是通过记住训练时见过的"动作物体"共现来作弊,导致无法泛化到新的动作物体组合。 ZeroShot 组合动作识别(ZSCAR)的目标是让模型能识别…
How are MLOps Frameworks Used in Open Source Projects? An Empirical Characterization
通过对 969 个依赖 GitHub 项目的实证分析,这篇 MSR 2026 论文揭示了一个反直觉的真相:MLOps 框架几乎没有人"开箱即用"——开发者真正使用的是它们的 API 来构建自定义功能,而非直接用 CLI 或 GitHub Workflows 集成。这对 MLOps 工具的设计者和选型者有重要启示。 ML…
LLM 中的元认知:基础、进展与机遇
本文是首篇系统综述 LLM 元认知(metacognition)的论文,把"模型能不能知道自己知道什么、不知道自己不知道什么"这件事拆成定义、评测、激发、应用四个抽屉,给研究者一份统一坐标。 LLM 在很多任务上能力惊人,但常常表现出两种典型失败:一是"不知道自己不会",在超出能力范围的问题上自信胡答;二是"不知道自己…
迈向自主且可审计的医学影像模型开发
本文提出 AMID——一个面向医学影像模型开发的自主多 Agent 框架,用"数据条件化方法规划 + 验证引导的两阶段优化"把原本依赖专家手工设计的影像建模 pipeline 变成可审计、可重放的 agentic workflow,并在 20 个异构医学影像挑战任务上接近甚至追平人工方案。 通用 LLM agent 在…
Blind-Spots-Bench:评估多模态模型中的盲点
本文提出 BlindSpotsBench——一份以"对人简单、对 AI 难"为筛选标准的多模态 benchmark,用 235 道来自 AI 课程学生的真实问题,揭示前沿模型(包括闭源 LLM、VLM、图像生成模型)在某些人类认为轻而易举的任务上仍有顽固盲点,且没有任何单一模型能覆盖全部盲点。 过去几年 benchma…
Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution
ACQUIRE 提出在 LLM coding agent 真正开始修复代码之前,先用"问答对"方式系统地获取仓库知识,将知识获取与 patch 生成解耦,在 SWEbench Verified 上将 Pass@1 提升最高 4.4 个百分点,同时大幅降低无效探索成本。 LLMbased coding agents 在 …
Xiaomi-Robotics-U0:用 World Foundation Model 做统一具身合成
小米 robotics 团队发布的 XiaomiRoboticsU0 是一个 38B 参数的多模态自回归模型,把「具身生成」视为基础图像 / 视频生成的延伸,统一优化文本到图像、图像编辑、具身场景生成、具身迁移与具身视频生成五类任务,在多视角一致性、跨机器人本体可迁移性与下游策略学习(pi_0.5 OOD 成功率 36…
温度如何塑造 RAG 中的意识形态话语?一项基于 COVID-19 语料的可控实验
RAG 框架并非「价值中立」的检索增强器:检索到的语料中包含的意识形态立场会被 LLM 系统性地传递到生成答案中,并且传递强度受 sampling temperature 显著调节——中等温度下话语对齐最强,过低的温度反而抑制了这种传递。 RAG 一直被定位为「事实性 / 反幻觉」工具,但学界与工业界对检索源的意识形态…
面向 LLM 推理服务的 Cloud Native 系统
本文系统性地论证了把容器化、微服务、动态调度等 Cloud Native 范式套到 LLM 推理栈上的可行性与收益,并在 Kubernetes + Istio + gRPC 集群上以把每个 Transformer 层解耦为独立 microservice 的方式做了一组端到端实验,证明对瓶颈层做 HPA autoscal…
A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT
AIGC(AI 生成内容)经历了从 GAN 时代到 Diffusion Model 再到 GPT 系列/LLM 的技术范式迁移,核心驱动力是「大模型 + 大数据」带来的意图理解能力和生成质量的质的飞跃;本文是第一篇系统性梳理这一完整脉络的综述,覆盖单模态(文本/图像)和多模态两条主线。 AIGC 要解决的是内容生产效率…