Explainers · 学术推广产出

解读

1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

预训练基础模型综述:从 BERT 到 ChatGPT 的发展历程
Pretrained Foundation Models(PFM)是 AI 基础设施范式的根本转变:一份跨模态(文本/图像/图)的全景式综述,梳理了从 BERT/GPT 到 ChatGPT 的技术演进脉络,并指出 scalability、security、reasoning、crossdomain 是通向 AGI 的四…
深度解读 arXiv:2302.09419 2026-07-26
MahNMF:曼哈顿距离下的非负矩阵分解
把非负矩阵分解(NMF)目标函数从 KL 散度 / 欧氏距离换成 ℓ1 范数(曼哈顿距离),从而能稳健建模重尾拉普拉斯噪声与离群点,并配套两类快速优化算法(RRI 与 Nesterov 平滑法)和一族带约束的扩展(Box、流形正则、组稀疏、弹性网、对称)。 经典 NMF 把非负矩阵 X ≈ WᵀH 的目标函数建在两种噪…
深度解读 arXiv:1207.3438 2026-07-26
LLMs Get Lost in Evolving User Intent:当用户意图在对话中演变,LLM 全面失效
当前 LLMs 在单轮 FullySpecified 任务上表现优异,但用户的真实意图在多轮对话中是动态演变的(逐步披露、修正、转向),而主流 Benchmarks 仍基于单轮静态设定;论文构建了一个将静态任务转化为动态多轮对话的框架,揭示了一个一致现象:强单轮性能无法迁移到意图演变场景,各模型家族均出现显著性能下降。…
深度解读 arXiv:2607.20734 2026-07-25
SANA-Video 2.0:用"混合线性注意力"把视频生成打到单 GPU
SANAVideo 2.0 把视频扩散 Transformer 中"二次复杂度的 softmax 注意力"替换成"门控线性注意力 + 周期性 softmax 锚点 + 块级注意力残差"的混合架构,让 5B / 14B 模型在单块 H100 上以 13 秒生成 720p 5 秒视频,比 Wan 2.2A14B 快 120…
深度解读 arXiv:2607.21553 2026-07-25
从视频中自监督学习结构化动态(SDM)
Structured Dynamics Model(SDM)提出将视频帧间变化显式分解为相机运动和物体运动两部分,通过未来特征预测 + 弱监督合成数据的混合训练策略,从冻结的预训练图像 ViT 特征中蒸馏出结构化运动表征,在含相机运动、物体运动及二者混合的 ProbeMotion 评测集上显著超越全局特征基线。 视频理…
深度解读 arXiv:2607.21576 2026-07-25
Agentic Context Management:把 Agent 记忆与成本当作生命周期与架构问题来解
Production AI Agent 失败的主要原因不是推理能力不足,而是上下文管理失控——对话历史、巨大 Prompt、工具定义与工具输出不断膨胀,导致 token 成本呈二次增长,同时跨会话记忆衰退;该论文提出 Agentic Context Management(ACM)学科,将其分解为五个原语,并证明只有经过…
深度解读 arXiv:2607.21503 2026-07-24
Experience Distillation:让 Agent 从自身交互历史中高效学习,无需额外环境交互
Realworld Agent Learning 受限于昂贵环境交互(如运行耗时的实验或获取人类反馈),InContext Learning 能从交互历史中高效率学习,但历史一出 Context 增益就消失;论文提出 Experience Distillation,将 Agent 的交互历史(无需额外环境交互)蒸馏进模…
深度解读 arXiv:2607.21051 2026-07-24
Robostral Navigate:单目 RGB、8B 参数、把视觉导航推到 SOTA 的纯图像空间策略
一个 8B 参数的视觉语言模型(VLM)只用单目 RGB 视频流做输入,直接在当前画面上"指出下一个目标点"作为航点预测,不依赖深度相机、不依赖多相机、不依赖预建地图,在 R2RCE / RxRCE 两个连续环境视觉语言导航基准上同时刷新 SOTA。 视觉语言导航(VisionandLanguage Navigatio…
深度解读 arXiv:2607.20785 2026-07-24
ReferTrack:先指认、再跟踪——把具身视觉跟踪做成"看图说话"加"看图指路"
提出一个 referringthentracking 的具身视觉跟踪(EVT)范式:用一台前向相机,先在带索引的候选框里选中语言所描述的目标,再以这次"图像级选中的目标"为条件解码航点;并用一个滑窗队列 + TVBI token 注入历史几何特征,让跟踪在时间维度上保持稳定——单视角 SOTA,且能在腿足与人形机器人上…
深度解读 arXiv:2607.20061 2026-07-24
Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation
用「共享正弦块反复迭代」取代「堆叠独立参数层」,在固定参数量下通过递归展开(recurrent unrolling)持续提升 INR 的高频重建质量,且可迁移到超分、NeRF 和 SDF 任务。 Implicit Neural Representation(INR)用坐标 MLP 把信号表示为连续函数,在图像、3D 重…
深度解读 arXiv:2607.21485 2026-07-24
Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
提出 ProVisE 框架,让图像生成模型可以在像素空间中直接「画」出空间判断答案,并被解析为结构化预测与 textoutput VLM 在统一 benchmark 下公平比较;发现在像素可外部化的空间任务上生成模型有竞争力,但在组合推理上弱于 VLM。 Spatial intelligence(空间智能)是 AI A…
深度解读 arXiv:2607.21072 2026-07-24
VLA-Corrector:面向自适应动作时域的轻量级检测-修正推理框架
VLACorrector 在不修改 VLA 主干模型的前提下,通过轻量级潜空间视觉监控器(LVM)实时检测视觉动态偏离,触发截断事件并调用在线梯度引导(OGG)进行修正规划,使动作分块策略实现事件驱动的自适应动作时域,同时兼顾执行鲁棒性与策略调用频率。 VisionLanguageAction(VLA)基础模型在具身智…
深度解读 arXiv:2607.01804 2026-07-23
面向大学利益相关者的多模态聊天助手:基于 RAG 的工程实践
本文构建了一个基于 RAG 的多模态大学聊天助手,整合 LLM 与语义检索,用 VLM 处理图文查询,配合量化推理和 FastAPI/Next.js 全栈工程化部署,将幻觉率从 31.7% 降至 6.6%,已上线 chat.kuet.ac.bd。 在发展中国家,大学利益相关者(学生、教职员工、申请者、管理人员)获取学校…
深度解读 arXiv:2607.01115 2026-07-23
TRACE:面向会话数据的时序证据图状态感知查询处理框架
TRACE 将长会话历史建模为带时间、因果、更新、矛盾关系的层次化时序证据图,在查询时将词汇召回与证据重建解耦,使得过时信息对历史查询仍然可访问,但对当前状态答案被正确折扣,从而在长会话 QA 场景中显著提升时序推理和多跳推理能力。 当前 AI Agent、个人助手、企业 copilot 等长时运行系统产生大量演化型会…
深度解读 arXiv:2607.00339 2026-07-23
Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
训练一个 Hypernetwork 生成固定 LoRA 适配器,可靠地将海量知识注入 LLM,且其扩展行为符合可预测的幂律(Power Law),在分布外泛化上优于标准的 LoRA 微调和全量微调。 将结构化知识(事实、关系)大规模注入 LLM 一直是难题。现有方法各有缺陷: 全量微调(Full FineTuning)…
深度解读 arXiv:2607.19604 2026-07-23
Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
Trace 是一个多域视觉推理任务构建框架,通过将场景语法(Scene Grammar)与可执行任务程序(Task Program)分离,自动化生成 1,000 个可验证、可复现的视觉推理任务,为 RLVR 训练 VLM 提供高质量数据。 RLVR(Reinforcement Learning with Verifia…
深度解读 arXiv:2607.19790 2026-07-23
Self Gradient Forcing: Native Long Video Extrapolation
Self Gradient Forcing(SGF)通过双遍(TwoPass)训练策略修复了 Self Forcing 中的"历史上下文梯度鸿沟"(Historical ContextGradient Gap),让 AR 视频扩散模型仅用 5 秒训练窗口就能外推到数分钟长视频,同时保持主体身份、背景一致性和时序稳定性。…
深度解读 arXiv:2607.20368 2026-07-23
Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes
LangGraph 不是什么场景都适用——它是解决复杂、长时、带状态、有审计需求的业务流程的专用工具,简单 ReAct 循环或纯 SDK 调用解决不了的问题才值得用它。 当前 Agent 框架(ReAct、LangChain Runnable 封装)只能处理短程、线性、单轮工具调用。但真实企业场景往往是:多步骤、有分支…
深度解读 arXiv:2607.19297 2026-07-22
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
一张桌面级 RTX 5090 GPU(~19 GiB VRAM)就能跑起一个 ActionConditioned Video World Model,实现 720P / 16 FPS 的实时闭环交互——数据来自 AAA 游戏、仿真引擎和互联网视频的混合管道,训练通过 WorldExplorer 反馈驱动采集,质量经 1…
深度解读 arXiv:2607.19191 2026-07-22
长上下文推理中的「重复抄写」病灶:用证据感知 RL 让模型真正「读懂」而不是「抄下来」
前沿长上下文 LLM 在做带 CoT 的复杂推理时普遍出现「重复抄写(repetitive copying)」病灶——把输入里的原话大段抄进思维链,而不是真正围绕关键证据推理。作者把这个病灶归因于「grounding 不足」,并提出 GEAR(Grounding EvidenceAware Reward):在标准 ac…
深度解读 arXiv:2607.19345 2026-07-22
仓库指导的探测-微调:让 AGENTS.md 自己学会指导编码 Agent
作者把"AGENTS.md 这类仓库指导文件究竟该不该让 LLM 生成"这个长期争论的问题,拆成"指导是怎样被生成的"这一可控变量,提出 probeandrefine tuning(探测微调)——用合成的 bug 修复探针、单次 LLM 调用、无 Agent 循环地对指导文件做迭代诊断与修补;在 SWEbench Ve…
深度解读 arXiv:2606.20512 2026-07-22
流式工具使用何时有效?tool-intent stabilization 与一个模型无关的延迟隐藏界
流式 RAG(RetrievalAugmented Generation)的"投机检索"是否真能把工具延迟藏在用户输入背后,取决于一个查询本身的属性——speculative query 的检索结果在输入流中多早就能稳定到"含答案"那份文档。本文把这个时刻命名为 toolintent stabilization,在 C…
深度解读 arXiv:2606.20113 2026-07-22
PACMS:用次模选择替换 recency 截断,把 LLM Agent 的上下文工程从"丢东西"升级成"选东西"
长会话 LLM Agent 的上下文窗口被对话轮次、持久 memory、工具输出同时填满,主流的 recency 截断(即按时间顺序只保留最近的 N 条)"topicblind",会丢老但相关的关键事实、留新但无关的冗余。PACMS 把上下文装配从"丢东西"重新定义为"在统一候选池上做 budgetaware 次模选择…
深度解读 arXiv:2606.20047 2026-07-22
基于 Token 的双视图融合与适配:冻结 ViT 上的乳腺癌分类新框架
把"CC/MLO 双视图的乳腺 X 光融合"重新定义为一组可学习的 fusion token 在冻结 Vision Transformer(ViT)内部进行的层级化跨视图通信,绕开了传统"特征级拼接/单层 crossattention"的两大痛点。 乳腺癌筛查中每侧乳房通常拍两张互补视图:craniocaudal(CC…
深度解读 arXiv:2607.06309 2026-07-21
OmniTacTune:让"只会看"的视觉策略补上触觉感知
OmniTacTune 是一种策略无关(policyagnostic)的真实世界 RL 流程:它不重训已有的视觉策略,而是训练一个轻量的"触觉残差策略",在接触密集任务里把视觉策略的成功率从 5–40% 拉到 85–100%,且只需 40–80 分钟的在线交互。 过去两年,从人类视频、遥操作、机器人演示中学习到的"视觉…
深度解读 arXiv:2607.03723 2026-07-21
为触觉而醒:MLLM 中的掩码隔离触觉对齐学习(Splash)
Splash 提出一种"掩码隔离"的参数子空间划分方法,把 MLLM 的预训练参数拆成"关键子空间"(冻结保护)和"休眠子空间"(用于学习触觉对齐),从而在不破坏原有视觉语言能力的前提下,让紧凑型 MLLM 内化触觉模态,在 SSVTP/TVL/TacQuad 等视触觉基准上达到 SOTA。 触觉是人类感知材料属性(摩…
深度解读 arXiv:2607.00302 2026-07-21
CineMobile:把电影级图像到视频生成塞进手机的三重优化
CineMobile 是一套针对 Diffusion Transformer(DiT)图像到视频模型的蒸馏+剪枝+量化三重优化方案,最终在端侧(MediaTek Dimensity 8400)以 1.8 GB 显存生成 49 帧 480p 视频,相对 Wan 2.1 教师模型实现 40× 加速,同时保住电影级相机运动效…
深度解读 arXiv:2607.03803 2026-07-21
用「跨查询一致性」筛掉噪声幻觉:CQC-RAG 评注
本文提出 CQCRAG:把原问题改写成多个同义不同形的查询、分别检索后看答案的「置信度稳定性」,不依赖外部监督、不要求扩大检索覆盖面,就能把检索噪声诱发的幻觉过滤掉,在 TriviaQA 和 MuSiQue 上相对最强多查询基线分别 +4.76 pp 和 +9.12 pp EM。 RAG 系统在落地时普遍栽在两件事上:…
深度解读 arXiv:2606.13438 2026-07-21
多文件变更定位的探索结构:把仓库探索改成「领域并行」能赢多少?
这篇来自 IBM Research 的工作用 SWEBench Pro 作底座,直接挑战「线性挨个目录探索」这一被广泛沿用的 LLM Agent 默认行为——把探索拆成「按子领域并行」的多 agent 后,Haiku 这类小模型在文件定位 F1 上能反超单 agent 大模型,但强制多 agent 协商不会带来额外收益…
深度解读 arXiv:2606.11976 2026-07-21
VaseMuseum:古希腊陶器的数字智能博物馆
VaseMuseum 是一个面向古希腊陶器的轻量化、模块化多模态智能体框架 VaseAgent,它把 2D/3D 视觉证据、权威知识检索与「源级 + 响应级」两层可靠性控制串起来,在不更新 VLM backbone 的前提下显著提升引用有效性与回答中立性。 把视觉语言模型(VLM)直接接入文化遗产数字博物馆是当下热点,…
深度解读 arXiv:2607.06374 2026-07-20