Explainers · 学术推广产出

解读

1527 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

WorldRover:面向世界探索任务的、可扩展的、富含标注的合成视频数据引擎
WorldRover 把"长程世界探索"重做为一个可扩展的数据生成问题——基于 Unreal Engine 的离线渲染管线 WorldRoverEngine 能在同一条轨迹上同时输出 firstperson / thirdperson / 360° 三种视角下的 RGB + metric depth + 相机轨迹 + …
深度解读 arXiv:2608.15659 2026-08-19
Large Discovery Models:基于经验、依托模型驱动的开放式搜索
Large Discovery Models (LDM)把"开放式科学发现"重构为一个生成式模型 + 贝叶斯非参数奖励代理的循环架构:生成器负责提议和精炼候选,代理负责预测性能并量化认知不确定性,二者随每一条新实验观测持续更新;在神经网络训练、抗体设计、分子优化三个场景上,LDM 比 LLM 反思与传统统计搜索分别取得…
深度解读 arXiv:2608.15669 2026-08-19
ABot-AgentOS:具备终身多模态记忆的通用机器人 Agent 操作系统
论文提出 ABotAgentOS:一个位于底层控制器之上的「deliberative agent 层」,为长程(长期、跨时段)具身 Agent(embodied agent)提供场景条件规划、上下文隔离的技能(skill)执行、多阶段验证、多模态记忆、边云协同这五大运行时能力;同时发布配套评测基准 EmbodiedWo…
深度解读 arXiv:2607.10350 2026-08-19
LLMs 是否准备好做科学发现?SDABench:面向 AI 科学家的能力导向基准
论文提出 SDABench,把对 LLM 的科学数据分析(SDA)评测从「能否跑通代码/完成 workflow」拆解为六类科学能力(描述、探索、推断、预测、因果、机制)在五个领域(生物、化学、环境、地理、物理)上的细粒度评估;在 527 条真实数据 + 6000 条合成数据上对 15 个代表性 LLM 测试后,得到的核…
深度解读 arXiv:2607.11079 2026-08-19
读回:预训练 MLLM 是 T2I 生成的零样本奖励模型
论文提出 SpectraReward:一种无需训练的训练无关奖励函数,通过把预训练 MLLM(多模态大模型)直接当成零样本奖励模型来打分文本到图像(T2I)生成结果——做法不是让 MLLM 判断图像「好不好」,也不是回答分解后的验证问题,而是测量「图像能多好地把原始 prompt 读回来」,即用图像条件下的 promp…
深度解读 arXiv:2607.11886 2026-08-19
你和 AI 语音助手对话时,有没有觉得它"好像一边说话一边在想事情"?——其实有一篇论文真把这事做出来了
你有没有过这种体验 🤔: 让 Siri 或者某国产语音助手"帮我查一下明天北京到上海的航班"—— 然后它沉默了一秒,才慢吞吞地说"明天有……9 个航班"。 沉默的那一秒,其实是它在调云端大模型"想事情"。 而你听到的第一个字之前,已经过去了 500~1500 毫秒——这就是 AI 语音助手的天花板。 arXiv 251…
科普版 arXiv:2511.07397 2026-08-18
AI 看视频,为啥永远分不清"开门"和"关门"?——一篇论文说:它根本就没在学"动作"
你有没有想过 🤔: 为什么现在的视频 AI 能认出"牛在吃草",但你让它看一段"关上抽屉"的视频—— 它可能给你标成"打开抽屉"? 按说"关"和"开"差一个字,人类一秒就能分。 但 AI 经常分错,而且错的不是"差一点",是彻底搞反。 arXiv 2601.16211 直接撕开这件事: AI 没在学"动作"——它在偷懒…
科普版 arXiv:2601.16211 2026-08-18
Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents
ConvFill 通过"对话填充"(Conversational Infill)机制,让小模型在外部大模型推理完成前先行生成可信回复,填补了语音助手"低延迟"与"强能力"之间的鸿沟——在 Apple M2 芯片上实现毫秒级首响,精度仅比前沿模型低 6.3%。 语音 Agent 当前面临一个根本矛盾:基础模型的推理、检索…
深度解读 arXiv:2511.07397 2026-08-18
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
RCORE 通过"共现先验正则化"(CPR)和"时序顺序正则化"(TORC)两项机制,专门破解 ZeroShot 组合动作识别中的"物体驱动捷径"问题——即模型不学动作本身,而是通过记住训练时见过的"动作物体"共现来作弊,导致无法泛化到新的动作物体组合。 ZeroShot 组合动作识别(ZSCAR)的目标是让模型能识别…
深度解读 arXiv:2601.16211 2026-08-18
How are MLOps Frameworks Used in Open Source Projects? An Empirical Characterization
通过对 969 个依赖 GitHub 项目的实证分析,这篇 MSR 2026 论文揭示了一个反直觉的真相:MLOps 框架几乎没有人"开箱即用"——开发者真正使用的是它们的 API 来构建自定义功能,而非直接用 CLI 或 GitHub Workflows 集成。这对 MLOps 工具的设计者和选型者有重要启示。 ML…
深度解读 arXiv:2601.18591 2026-08-18
LLM 中的元认知:基础、进展与机遇
本文是首篇系统综述 LLM 元认知(metacognition)的论文,把"模型能不能知道自己知道什么、不知道自己不知道什么"这件事拆成定义、评测、激发、应用四个抽屉,给研究者一份统一坐标。 LLM 在很多任务上能力惊人,但常常表现出两种典型失败:一是"不知道自己不会",在超出能力范围的问题上自信胡答;二是"不知道自己…
深度解读 arXiv:2607.11881 2026-08-18
迈向自主且可审计的医学影像模型开发
本文提出 AMID——一个面向医学影像模型开发的自主多 Agent 框架,用"数据条件化方法规划 + 验证引导的两阶段优化"把原本依赖专家手工设计的影像建模 pipeline 变成可审计、可重放的 agentic workflow,并在 20 个异构医学影像挑战任务上接近甚至追平人工方案。 通用 LLM agent 在…
深度解读 arXiv:2607.10522 2026-08-18
Blind-Spots-Bench:评估多模态模型中的盲点
本文提出 BlindSpotsBench——一份以"对人简单、对 AI 难"为筛选标准的多模态 benchmark,用 235 道来自 AI 课程学生的真实问题,揭示前沿模型(包括闭源 LLM、VLM、图像生成模型)在某些人类认为轻而易举的任务上仍有顽固盲点,且没有任何单一模型能覆盖全部盲点。 过去几年 benchma…
深度解读 arXiv:2607.08317 2026-08-18
Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution
ACQUIRE 提出在 LLM coding agent 真正开始修复代码之前,先用"问答对"方式系统地获取仓库知识,将知识获取与 patch 生成解耦,在 SWEbench Verified 上将 Pass@1 提升最高 4.4 个百分点,同时大幅降低无效探索成本。 LLMbased coding agents 在 …
深度解读 arXiv:2607.11111 2026-08-18
Xiaomi-Robotics-U0:用 World Foundation Model 做统一具身合成
小米 robotics 团队发布的 XiaomiRoboticsU0 是一个 38B 参数的多模态自回归模型,把「具身生成」视为基础图像 / 视频生成的延伸,统一优化文本到图像、图像编辑、具身场景生成、具身迁移与具身视频生成五类任务,在多视角一致性、跨机器人本体可迁移性与下游策略学习(pi_0.5 OOD 成功率 36…
深度解读 arXiv:2607.11643 2026-08-18
温度如何塑造 RAG 中的意识形态话语?一项基于 COVID-19 语料的可控实验
RAG 框架并非「价值中立」的检索增强器:检索到的语料中包含的意识形态立场会被 LLM 系统性地传递到生成答案中,并且传递强度受 sampling temperature 显著调节——中等温度下话语对齐最强,过低的温度反而抑制了这种传递。 RAG 一直被定位为「事实性 / 反幻觉」工具,但学界与工业界对检索源的意识形态…
深度解读 arXiv:2607.11783 2026-08-18
面向 LLM 推理服务的 Cloud Native 系统
本文系统性地论证了把容器化、微服务、动态调度等 Cloud Native 范式套到 LLM 推理栈上的可行性与收益,并在 Kubernetes + Istio + gRPC 集群上以把每个 Transformer 层解耦为独立 microservice 的方式做了一组端到端实验,证明对瓶颈层做 HPA autoscal…
深度解读 arXiv:2507.18007 2026-08-18
A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT
AIGC(AI 生成内容)经历了从 GAN 时代到 Diffusion Model 再到 GPT 系列/LLM 的技术范式迁移,核心驱动力是「大模型 + 大数据」带来的意图理解能力和生成质量的质的飞跃;本文是第一篇系统性梳理这一完整脉络的综述,覆盖单模态(文本/图像)和多模态两条主线。 AIGC 要解决的是内容生产效率…
深度解读 arXiv:2303.04226 2026-08-18
Reflexion:让 LLM Agent 通过"语言反思"自我强化,不更新权重
引用:Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan, Shunyu Yao,"Reflexion: Language Agents with Verbal Reinforcement Learning",…
深度解读 arXiv:2303.11366 2026-08-18
把"可信度"从分数搬上排序前沿:为什么 Pareto 重排序是 2026 信息流可信工程的实用派
你有没有试过刷信息流,看到一条"政策辟谣"被排到第 30 位,而一条"耸动标题党"被推到了第 3 位? 你大概率会觉得:这套推荐系统在纵容 misinformation。 但你换一个角度想——直接把"耸动标题党"硬降权或删除,会引发另一个问题:用户的相关性预期被打乱,"猫猫视频"被挤到"政策辟谣"前面,整个排序系统就崩…
科普版 arXiv:2606.18031 2026-08-18
HarnessEval-W:把 LLM 的 harness 范式搬到世界模型评测
把 LLM 评测里成熟的 harness 范式(orchestrator + 子 agent + 证据链)引入视觉世界模型(world model)评测:用一个父 agent 把评测任务拆解为可测子问题,为每个子问题派发配备专门 context 与诊断工具的子 agent,父 agent 收集证据并汇总成 verdic…
深度解读 arXiv:2608.16859 2026-08-18
GRIP:靠「信息受限前提」做接地推理
在 RAG 系统中用一个对证据施加「强随机瓶颈」、对 query 保持全维访问的容量不对称机制,强制证据通道只编码「query 中没有的残差信息」,从而把 query潜变量互信息从 14.8 bits 压到 0.47 bits(≈30×),在 5 个推理基准上超过强迭代基线,幻觉率降低 73%。 RAG 长期被诟病的隐…
深度解读 arXiv:2608.16776 2026-08-18
主题综述 · engineering(2026-08-15)
承接 809 综述已立的"Harness 自动化演进 + 生产 telemetry 反向校验 + 训练数据合成经济学"三轴基线(10 篇代表性工作,涵盖 Prompt Pattern Catalog / AHE / The Last Harness / RST / Agentic Coding in the Wild …
周综述 2026-08-15
主题综述 · agent(2026-08-18)
本棒定位:W5 综述轮换。date +%j = 230,mod 8 = 6 = database。promo/surveys/ 下 72 小时内已有 20260817database.md,顺延到下一未覆盖主题 → agent。 承接材料:paper_cards/ 719 ~ 818 期间 240+ 张 agent 主…
周综述 2026-08-18
DSPrompt:动态软提示抵御 M-RAG 投毒
在冻结的多模态 retriever 的视觉与文本编码器各层插入若干可学习 soft prompt,按浅→深的 length schedule 分配,并用一个在线多模态攻击者与防御者做动态 minmax 对抗训练,让 defended encoder 的 embedding 直接重塑,不修改检索管道、几乎不增加推理开销(…
深度解读 arXiv:2608.16536 2026-08-18
Hyper-M2RAG:用超图重写多模态 RAG 的检索与对齐
HyperM2RAG 把多模态 RAG 的"图"从二元简单图换成超图(hypergraph),把跨页/跨模态的 N 元关联作为一等公民建模,并配套"锚点驱动的增量精修(Anchordriven Incremental Refinement)"避免全页重建;论文已被 ACM MM 2026 接收,代码开放在 github…
深度解读 arXiv:2608.16628 2026-08-18
AnyTalk:用视频生成模型驱动任意角色的语音动画
AnyTalk 把"语音驱动 3D 面部动画"这件事从"必须为每个角色采集专属动画数据"重写成"拿一个预训练视频扩散模型 + 一次角色化微调即可",核心是 CsF(Characterspecific Finetuning,用静音渲染图微调)+ blendshape 反向优化,并蒸馏出可实时推理的 AnyTalk_RT;…
深度解读 arXiv:2608.16143 2026-08-18
注意力把潜变量"聚拢"到可读形态:对 Global Workspace 的实证反驳
用 Jacobian lens 与一个五臂共享上下文基准,在开放权重 LLM 上找不到"决定哪些表征被读出"的显式门控;真正把潜变量从上下文搬到 query 位置的,是中段层 64layer hybrid 与 62layer dense 同款相对深度处发生的 attentionmediated gathering——一…
深度解读 arXiv:2608.15022 2026-08-18
FreeToken:把消费级 GPU 变成 frontier-scale MoE 的弹性推理平台
FreeToken 是一个边缘原生(edgenative)的 MoE 推理系统,把"个人机器"视为一个统一弹性推理平台而非"小一号的数据中心 GPU",通过连续地把模型状态与计算映射到机器实际暴露的异构资源上,让 8GB 笔记本 GPU、单卡工作站、消费级游戏台式机这些边缘硬件分别能跑 35B / 284B / 753…
深度解读 arXiv:2608.16157 2026-08-18
Intent-Guided Decoding:让 RAG 在 factuality 与 faithfulness 之间按用户意图仲裁
针对 RAG 中检索证据"有用 / 无关 / 误导"三类来源信任问题,2608.16515 提出 IntentGuided Decoding (IGD),用 answerlevel filtering + tokenlevel correction 双层机制,在解码阶段按用户意图在 retrieved context …
深度解读 arXiv:2608.16515 2026-08-18