Explainers · 学术推广产出

解读

1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents
ConvFill 通过"对话填充"(Conversational Infill)机制,让小模型在外部大模型推理完成前先行生成可信回复,填补了语音助手"低延迟"与"强能力"之间的鸿沟——在 Apple M2 芯片上实现毫秒级首响,精度仅比前沿模型低 6.3%。 语音 Agent 当前面临一个根本矛盾:基础模型的推理、检索…
深度解读 arXiv:2511.07397 2026-08-18
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
RCORE 通过"共现先验正则化"(CPR)和"时序顺序正则化"(TORC)两项机制,专门破解 ZeroShot 组合动作识别中的"物体驱动捷径"问题——即模型不学动作本身,而是通过记住训练时见过的"动作物体"共现来作弊,导致无法泛化到新的动作物体组合。 ZeroShot 组合动作识别(ZSCAR)的目标是让模型能识别…
深度解读 arXiv:2601.16211 2026-08-18
How are MLOps Frameworks Used in Open Source Projects? An Empirical Characterization
通过对 969 个依赖 GitHub 项目的实证分析,这篇 MSR 2026 论文揭示了一个反直觉的真相:MLOps 框架几乎没有人"开箱即用"——开发者真正使用的是它们的 API 来构建自定义功能,而非直接用 CLI 或 GitHub Workflows 集成。这对 MLOps 工具的设计者和选型者有重要启示。 ML…
深度解读 arXiv:2601.18591 2026-08-18
LLM 中的元认知:基础、进展与机遇
本文是首篇系统综述 LLM 元认知(metacognition)的论文,把"模型能不能知道自己知道什么、不知道自己不知道什么"这件事拆成定义、评测、激发、应用四个抽屉,给研究者一份统一坐标。 LLM 在很多任务上能力惊人,但常常表现出两种典型失败:一是"不知道自己不会",在超出能力范围的问题上自信胡答;二是"不知道自己…
深度解读 arXiv:2607.11881 2026-08-18
迈向自主且可审计的医学影像模型开发
本文提出 AMID——一个面向医学影像模型开发的自主多 Agent 框架,用"数据条件化方法规划 + 验证引导的两阶段优化"把原本依赖专家手工设计的影像建模 pipeline 变成可审计、可重放的 agentic workflow,并在 20 个异构医学影像挑战任务上接近甚至追平人工方案。 通用 LLM agent 在…
深度解读 arXiv:2607.10522 2026-08-18
Blind-Spots-Bench:评估多模态模型中的盲点
本文提出 BlindSpotsBench——一份以"对人简单、对 AI 难"为筛选标准的多模态 benchmark,用 235 道来自 AI 课程学生的真实问题,揭示前沿模型(包括闭源 LLM、VLM、图像生成模型)在某些人类认为轻而易举的任务上仍有顽固盲点,且没有任何单一模型能覆盖全部盲点。 过去几年 benchma…
深度解读 arXiv:2607.08317 2026-08-18
Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution
ACQUIRE 提出在 LLM coding agent 真正开始修复代码之前,先用"问答对"方式系统地获取仓库知识,将知识获取与 patch 生成解耦,在 SWEbench Verified 上将 Pass@1 提升最高 4.4 个百分点,同时大幅降低无效探索成本。 LLMbased coding agents 在 …
深度解读 arXiv:2607.11111 2026-08-18
Xiaomi-Robotics-U0:用 World Foundation Model 做统一具身合成
小米 robotics 团队发布的 XiaomiRoboticsU0 是一个 38B 参数的多模态自回归模型,把「具身生成」视为基础图像 / 视频生成的延伸,统一优化文本到图像、图像编辑、具身场景生成、具身迁移与具身视频生成五类任务,在多视角一致性、跨机器人本体可迁移性与下游策略学习(pi_0.5 OOD 成功率 36…
深度解读 arXiv:2607.11643 2026-08-18
温度如何塑造 RAG 中的意识形态话语?一项基于 COVID-19 语料的可控实验
RAG 框架并非「价值中立」的检索增强器:检索到的语料中包含的意识形态立场会被 LLM 系统性地传递到生成答案中,并且传递强度受 sampling temperature 显著调节——中等温度下话语对齐最强,过低的温度反而抑制了这种传递。 RAG 一直被定位为「事实性 / 反幻觉」工具,但学界与工业界对检索源的意识形态…
深度解读 arXiv:2607.11783 2026-08-18
面向 LLM 推理服务的 Cloud Native 系统
本文系统性地论证了把容器化、微服务、动态调度等 Cloud Native 范式套到 LLM 推理栈上的可行性与收益,并在 Kubernetes + Istio + gRPC 集群上以把每个 Transformer 层解耦为独立 microservice 的方式做了一组端到端实验,证明对瓶颈层做 HPA autoscal…
深度解读 arXiv:2507.18007 2026-08-18
A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT
AIGC(AI 生成内容)经历了从 GAN 时代到 Diffusion Model 再到 GPT 系列/LLM 的技术范式迁移,核心驱动力是「大模型 + 大数据」带来的意图理解能力和生成质量的质的飞跃;本文是第一篇系统性梳理这一完整脉络的综述,覆盖单模态(文本/图像)和多模态两条主线。 AIGC 要解决的是内容生产效率…
深度解读 arXiv:2303.04226 2026-08-18
Reflexion:让 LLM Agent 通过"语言反思"自我强化,不更新权重
引用:Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan, Shunyu Yao,"Reflexion: Language Agents with Verbal Reinforcement Learning",…
深度解读 arXiv:2303.11366 2026-08-18
HarnessEval-W:把 LLM 的 harness 范式搬到世界模型评测
把 LLM 评测里成熟的 harness 范式(orchestrator + 子 agent + 证据链)引入视觉世界模型(world model)评测:用一个父 agent 把评测任务拆解为可测子问题,为每个子问题派发配备专门 context 与诊断工具的子 agent,父 agent 收集证据并汇总成 verdic…
深度解读 arXiv:2608.16859 2026-08-18
GRIP:靠「信息受限前提」做接地推理
在 RAG 系统中用一个对证据施加「强随机瓶颈」、对 query 保持全维访问的容量不对称机制,强制证据通道只编码「query 中没有的残差信息」,从而把 query潜变量互信息从 14.8 bits 压到 0.47 bits(≈30×),在 5 个推理基准上超过强迭代基线,幻觉率降低 73%。 RAG 长期被诟病的隐…
深度解读 arXiv:2608.16776 2026-08-18
DSPrompt:动态软提示抵御 M-RAG 投毒
在冻结的多模态 retriever 的视觉与文本编码器各层插入若干可学习 soft prompt,按浅→深的 length schedule 分配,并用一个在线多模态攻击者与防御者做动态 minmax 对抗训练,让 defended encoder 的 embedding 直接重塑,不修改检索管道、几乎不增加推理开销(…
深度解读 arXiv:2608.16536 2026-08-18
Hyper-M2RAG:用超图重写多模态 RAG 的检索与对齐
HyperM2RAG 把多模态 RAG 的"图"从二元简单图换成超图(hypergraph),把跨页/跨模态的 N 元关联作为一等公民建模,并配套"锚点驱动的增量精修(Anchordriven Incremental Refinement)"避免全页重建;论文已被 ACM MM 2026 接收,代码开放在 github…
深度解读 arXiv:2608.16628 2026-08-18
AnyTalk:用视频生成模型驱动任意角色的语音动画
AnyTalk 把"语音驱动 3D 面部动画"这件事从"必须为每个角色采集专属动画数据"重写成"拿一个预训练视频扩散模型 + 一次角色化微调即可",核心是 CsF(Characterspecific Finetuning,用静音渲染图微调)+ blendshape 反向优化,并蒸馏出可实时推理的 AnyTalk_RT;…
深度解读 arXiv:2608.16143 2026-08-18
注意力把潜变量"聚拢"到可读形态:对 Global Workspace 的实证反驳
用 Jacobian lens 与一个五臂共享上下文基准,在开放权重 LLM 上找不到"决定哪些表征被读出"的显式门控;真正把潜变量从上下文搬到 query 位置的,是中段层 64layer hybrid 与 62layer dense 同款相对深度处发生的 attentionmediated gathering——一…
深度解读 arXiv:2608.15022 2026-08-18
FreeToken:把消费级 GPU 变成 frontier-scale MoE 的弹性推理平台
FreeToken 是一个边缘原生(edgenative)的 MoE 推理系统,把"个人机器"视为一个统一弹性推理平台而非"小一号的数据中心 GPU",通过连续地把模型状态与计算映射到机器实际暴露的异构资源上,让 8GB 笔记本 GPU、单卡工作站、消费级游戏台式机这些边缘硬件分别能跑 35B / 284B / 753…
深度解读 arXiv:2608.16157 2026-08-18
Intent-Guided Decoding:让 RAG 在 factuality 与 faithfulness 之间按用户意图仲裁
针对 RAG 中检索证据"有用 / 无关 / 误导"三类来源信任问题,2608.16515 提出 IntentGuided Decoding (IGD),用 answerlevel filtering + tokenlevel correction 双层机制,在解码阶段按用户意图在 retrieved context …
深度解读 arXiv:2608.16515 2026-08-18
问答中面向自适应检索与推理的可解释不确定性
这篇工作从 LLM 的内部 hidden states 里直接估出两类可解释的不确定性信号——知识不足(knowledge insufficiency)和知识歧义/冲突(knowledge ambiguity/conflict),并在单次前向传播内据此决定要不要触发 RAG、要不要多走一步推理。 RAG 自从 2023…
深度解读 arXiv:2607.07380 2026-08-18
Latent-Identity Tuning:在冻结个性化模型的潜空间里做身份编辑
本文提出 LatentIdentity Tuning——在「冻结的、预训练好的」TexttoImage 个性化模型的潜空间里,找出一组有语义意义的方向向量,沿这些方向平移就能对人脸身份做局部化、细粒度、语义一致的编辑,完全不需要额外训练。 个性化 T2I(TexttoImage)模型(如 Textual Inversi…
深度解读 arXiv:2607.11885 2026-08-18
KVpop——基于预测性在线剪枝的键值缓存压缩
KVpop 用"未来注意力"作为监督信号,直接训练一个 fixedbudget 的 KV 淘汰打分器,并通过延迟记忆机制让打分器在"看完后续若干步"之后再决定保留还是丢弃,从而在 75% 和 88% 的 KV 压缩率下分别保留 Qwen34B 全注意力 98% 和 97% 的推理质量。 自回归解码阶段的 KV cach…
深度解读 arXiv:2607.05061 2026-08-18
RAEF:把 RAG 搬进单变量时间序列预测,省下微调又胜过 RAF
RAEF(RetrievalAugmented Extended Forecasting)是一种模型无关的单变量时间序列预测增强方法:把 RAG 范式从 LLM 文本场景搬到 Time Series Foundation Model(TSFM)场景,沿 RAF 路线把"输入空间检索 + 拼接聚合"两处机制替换掉 RAF…
深度解读 arXiv:2608.14054 2026-08-18
模块化认知架构在 Large Language Models 中涌现
通过对 N=46 个跨四个认知领域任务的电路级(circuitlevel)分析,本文证明 LLM 会像人脑一样涌现出功能模块化架构——同一领域任务调用重叠神经元,不同领域任务调用相互分离的神经元,提示模块化可能是智能系统的收敛性(convergent)属性,而非生物进化偶然。 神经科学的经典观察是:大脑皮层存在显著的功…
深度解读 arXiv:2608.13567 2026-08-18
Nanbeige4.2-3B 在 Apple Silicon 上的工程修复:Looped Transformer 的部署陷阱与显存压缩
一个号称能在边缘设备跑的 3B Agentic 模型,开箱即用跑不起来——5 个独立 bug 把 HuggingFace transformers 部署路径堵死;修完后又遇到 Looped Transformer 的层复用策略让 attention 显存翻倍,作者用 chunkedprefill 把 32 GiB 共享…
深度解读 arXiv:2608.13987 2026-08-18
增强并不意味着可预测:思维模型中"看起来在推理"与"真的能答对"的裂缝
面向推理的训练让模型的 trace 看起来更审慎(自我修正、假设检验、不确定性表达被放大 3–7×),但与"答对"最相关的几项行为——confidence calibration、knowledge alignment、selfawareness——反而没有被同步放大,作者把这道裂缝命名为 AmplificationL…
深度解读 arXiv:2608.13760 2026-08-18
这条引用是否切中要点?——命题级法律引用核验的失败模式
把"虚假引用"与"不切中命题的引用"拆开看,现有 LLM 在前者上几乎满分(93–100%),在后者上却只对一半多一点(37–83%),而且规模与推理努力都填不平这条裂缝。 2023 年 Mata v. Avianca 案让全行业第一次意识到"LLM 编造虚假引用"的危害——两位律师向纽约联邦法院递交了一份含六个虚假判…
深度解读 arXiv:2608.12571 2026-08-18
Apodex Discovery:用于评估与构建探索型 AI 的现实基准与环境
本文提出 Apodex Discovery 框架,把"探索型 AI"(discoverative AI)从 benchmark 走向真实工程级验证:在 561 个行业 / 16 个领域里筛出 423 个真实高价值问题、首发 20 个,再用统一的 environmenttaskepisode 抽象 + TRACES 固定…
深度解读 arXiv:2608.11341 2026-08-18
Agent 抓 Agent:临床多 Agent 系统中的捷径级联与 Benchmark 作弊
在六个公开临床数据集(文本/影像/表格三类)上的七个 cohort 中,作者系统证明:Gemini 多 Agent 委员会能单独抵御浅层提示(flip 5–16%)但无法抵御"社交合理"的捷径——当两位同伴坚持同一错误答案时,待测 holdout 在 38% 的情况下会跟随错误,而这种作弊在 benchmark 上几乎…
深度解读 arXiv:2608.03744 2026-08-18