Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

FVAttn:带运行时负载均衡的自适应稀疏注意力,专治视频生成
FVAttn 是一个面向视频 DiT(Video Diffusion Transformer)的训练free 自适应稀疏注意力系统。它把「Topp 路由 + Topk 安全底 + 视频块结构」作为稀疏前端的策略,同时在多卡序列并行(sequence parallelism)下做运行时 P2P 负载均衡与 slack 填…
深度解读 arXiv:2607.16190 2026-08-09
为「主动观察者」准备的考试:ActiveVision 基准如何暴露 MLLM 的视觉死穴
ActiveVision 是一个用来「量化 MLLM 是否像人一样主动观察图像」的评测基准。它用 17 个任务 3 类题型,强制模型反复做视觉感知,而非一次性静态描述。结果在最强模型 GPT5.5(最高 reasoning effort 档)上也只拿到 10.6%,Claude Fable 5 仅 3.5%,远低于三位…
深度解读 arXiv:2607.16165 2026-08-09
MANCE:流形感知的概念擦除
MANCE 提出流形约束假设(Manifold Constraint Hypothesis),认为自然表征集中于低维流形上,干预应被投影到该流形内执行——在这一假设指导下,MANCE++ 在非线性概念擦除任务上达到 SOTA,在移除目标概念信息的同时更好地保留其他语义属性。 概念擦除(Concept Erasure)的…
深度解读 arXiv:2607.03973 2026-08-09
ChatGPT 为什么突然"听话"了?——InstructGPT 用 13k 标注数据,让 1.3B 模型击败 175B 的 GPT-3
你有没有过这种体验 🤔: 你问 GPT3(2020)一个稍微复杂的问题—— 它写了一段语法完美的英文,但里面 30% 的事实是错的; 你让它"用一句话解释 Transformer"—— 它洋洋洒洒写了 500 字,全是堆术语,你一句没看懂; 你让它"列三个优点,不要超过 20 字"—— 它列了 8 个,每个都超过 50…
科普版 arXiv:2203.02155 2026-08-08
1750 亿参数的"大力出奇迹"——GPT-3 是怎么把 LLM 推进"用对话就能干活"的时代?
你有没有过这种体验 🤔: 你打开 ChatGPT,说一句"帮我写封道歉信,语气要真诚,但别太卑微"—— 它几乎立刻写完,而且几乎不用你再写示例。 5 年前这事儿根本做不到。 5 年前你要让 AI 翻译一句话,得先给它 10 个翻译对当示范; 5 年前你要让 AI 做情感分析,得训一个新模型; 5 年前你要让 AI 写代…
科普版 arXiv:2005.14165 2026-08-08
CheckRLM:检索增强推理中的知识-思维一致性校验
CheckRLM 在推理过程中实时提取关键事实主张并检索外部知识库比对,发现错误后以最小改动精确修正,从而有效阻断错误在长推理链中的累积传播,在长程推理上以更低成本达到 SOTA 性能。 以 DeepSeekR1、OpenAIo1 为代表的推理语言模型(Reasoning Language Model, RLM)通过扩…
深度解读 arXiv:2607.02262 2026-08-08
Know Your Source:面向媒体事实核查的公共知识库 MEDIAREF
提出 MEDIAREF——一个覆盖 200 家媒体来源、可公开下载、可复现更新的网络文档知识库,作为 RAG 时代"sourcecritical reasoning / Media Background Check (MBC)"任务的低成本公共评测底座,并系统评测了主流 LLM 在 MBC 生成上的表现。 基于 LLM…
深度解读 arXiv:2607.02383 2026-08-08
WARP:从权重空间反推训练数据混合比例
WARP(Weightspace Analysis for Recovering training data Portfolios) 是一个从已发布模型权重反向推断其微调阶段训练数据"领域混合比例"的框架:在 base 与 finetuned 模型之间做 model merging,生成伪检查点,从权重空间的几何特征映…
深度解读 arXiv:2607.01686 2026-08-08
AgenticSTS:长周期 LLM Agent 的"有界记忆"测试平台
提出一种 boundedmemory contract(有界记忆契约):每次决策都基于一条由"类型化检索"组装出的"新鲜"用户消息,不再追加跨决策的原始历史,从而在 Slay the Spire 2(杀戮尖塔 2)这一长周期决策游戏中对 LLM Agent 的各记忆层做可隔离消融(A0 固定对照),并开源 298 条带…
深度解读 arXiv:2607.02255 2026-08-08
MultAttnAttrib:长文档问答中免训练的多模态归因生成
MultAttnAttrib 是一种免训练的归因(attribution)生成方法,通过利用模型自身 prefill 阶段的注意力头与校准阈值,在长文档问答里精准定位答案所对应的源证据,在多模态(图表+文本)归因上一致优于多种强 promptbased 方法,推理延迟仅为同等 base model 直接 prompti…
深度解读 arXiv:2607.01420 2026-08-08
OrbitQuant:面向图像与视频扩散 Transformer 的数据无关量化
OrbitQuant 是一种数据无关(dataagnostic)的 PTQ 方案,通过在归一化的旋转基空间中量化,绕过传统 PTQ 必须的 range estimation,让单个 LloydMax codebook 同时适配所有 timestep、prompt 与 layer——首次把图像 DiT 的 PTQ 推到 …
深度解读 arXiv:2607.02461 2026-08-08
AGVBench:面向静脉识别数据增强的可靠性基准
AGVBench 在 5 个公开掌/指静脉数据集、7 个骨干网络上系统评测了 30 种数据增强策略,首次明确指出「准确率最高的增强(多图混合类)反而最脆弱、校准最差」,为静脉识别这一安全敏感领域建立了一个兼顾干净准确率、对抗鲁棒性与概率校准的标准化评测协议。 静脉识别(掌静脉、指静脉)被认为是一种「活体、难伪造」的生物…
深度解读 arXiv:2607.02271 2026-08-08
EvoPolicyGym:在交互式环境中评估 Agent 的自主策略演化能力
EvoPolicyGym 把"Agent 能否通过反馈迭代改写可执行策略"这件事做成了一个有固定交互预算的受控评测——16 个紧凑的 RL 环境、24 页论文,把"会改代码"和"能持续调优"分开来看,并跑出 GPT5.5 是当前最强。 Agent 评测里有个长期被绕开的痛点:最终分数高,不等于 Agent 真会"演化"…
深度解读 arXiv:2607.02440 2026-08-08
京东 Oxygen AI 商品中心(Oxygen AIIC)V1:工业级 LLM/VLM 商品知识生产与服务
这是一篇来自京东的工业级 LLM/VLM 系统论文:在 7 亿用户、几百亿 SKU 的电商平台上,用 LLM/VLM 搭了一个商品知识生产与服务的"中枢",覆盖搜索/推荐/运营/类目规划四大场景,把搜索流量覆盖率推到 80.4%、商品信息质量问题下降 37%、上架自动填核心属性超过 80%。 电商平台的"商品知识"是搜…
深度解读 arXiv:2606.28070 2026-08-08
Physics Informed Deep Learning (Part I): Data-driven Solutions of Nonlinear Partial Differential Equations
Physics Informed Neural Networks(PINN)将物理定律(由非线性偏微分方程 PDE 描述)编码为神经网络的损失函数约束,使网络在数据稀缺甚至无标签数据的情况下也能学习到符合物理规律的真解,且输出对所有输入坐标和自由参数天然可导。 传统科学计算依赖数值方法(有限元、有限差分、有限体积法)求…
深度解读 arXiv:1711.10561 2026-08-08
面向纵向胸部 X 光报告的过渡感知 Best-of-N 采样
本文是论文 TransitionAware bestofN sampling for Longitudinal Chest Xray Reports(Gulluk et al., 2026, arXiv:2606.28393, cs.CV)的深度解读。 针对"纵向胸部 X 光报告生成"任务,作者提出了首个面向预训练报告…
深度解读 arXiv:2606.28393 2026-08-08
Data Flow Control(DFC):AI Agent 数据安全策略的内核级执行框架
Data Flow Control(DFC)将 AI Agent 生成查询时的数据安全合规问题从「Prompt 层的后验检查」下沉为「数据库内核级的前摄执行」——通过声明式的 provenance monomials 聚合谓词策略语言,配合 Passant 查询重写引擎,在不物化 provenance 的前提下实现跨五…
深度解读 arXiv:2606.05679 2026-08-08
多模态 LLM 的计算幽默:方法、数据集、评估与挑战
这是一篇关于「MLLM 如何理解视觉幽默」的综述:以「能力层级(识别 → 解释/推理 → 生成)」为骨架,把梗图、漫画、连环画里的多模态幽默任务、基准、评估与建模范式系统梳理一遍,核心论点是 MLLM 在幽默任务上仍受困于捷径学习式评测、文化与叙事覆盖不足、证据接地弱、安全与版权四道坎。 幽默理解长期被视为 NLP 与…
深度解读 arXiv:2607.19011 2026-08-08
AutoIndex:为检索学习表征程序
AutoIndex 把"文档表示"从一次性的预处理选择提升为一类可学习的程序(representation program):由 agent 在验证集信号引导下,自动搜索对文档"切分 / 增强 / 归一化 / 重加权 / 重组"的执行程序,不改检索器本身,就能在固定 BM25 上把 8 个任务 Recall@100 平…
深度解读 arXiv:2607.18603 2026-08-08
Flow-Controlled Scheduling:LLM 推理的稳态流控调度
这篇论文把 LLM 推理服务的"系统不稳、KV cache 爆、延迟抖动"归因到了一个被忽视的核心变量——prompt 加入活跃集的速率——然后用一套简洁的"流控调度(flowcontrol scheduling)"把 admission control 从经验调参升级为有 provable stability 的算法…
深度解读 arXiv:2604.11001 2026-08-08
系统性测量偏差:LLM 推理基准测得根本不是你以为的那些数
这篇论文指出当下几乎所有"LLM 推理性能基准"测出来的 TTFT / TPOT 数字都被严重高估,因为主流 benchmark 客户端(locust、benchmark.py、GenAIPerf 等)都是 singleprocess asyncio 架构——而这个架构在几百~几千 QPS 下就被 Python GIL…
深度解读 arXiv:2605.24217 2026-08-08
SparseX:交错 LLM 服务中的段级 KV cache 共享
SparseX 把 LLM 在线服务里的 KV cache 复用从 prefixonly 推到任意段级:以连续 token 段作为复用单元,利用复用场景下天然产生的 SparseQ 索引识别需要修正的"关键 token",然后在单次前向里完成 SparseKV Recomputation,从而在多轮对话、RAG、Age…
深度解读 arXiv:2606.01751 2026-08-08
Deep Learning on Point Sets for 3D Classification and Segmentation(PointNet)
PointNet 提出了一种直接消费原始 3D 点云(无需体素化或渲染成图像)的深度神经网络,通过对称函数(Symmetry Function) 保证置换不变性,在 3D 物体分类、部件分割、场景语义解析三项任务上达到或超越 SOTA,同时提供严谨的理论分析解释其对点云扰动和缺失的鲁棒性来源。 3D 数据有多种表达方式…
深度解读 arXiv:1612.00593 2026-08-08
Llama 2: Open Foundation and Fine-Tuned Chat Models
Meta 发布 Llama 2 系列(7B/13B/70B 参数),在 2 万亿 tokens 公开数据上预训练后,通过监督微调(SFT)+ 基于人类反馈的强化学习(RLHF)两阶段 finetuning,推出 Llama 2Chat;其在开源基准上全面超越此前开源模型,在helpfulness上接近闭源的 ChatG…
深度解读 arXiv:2307.09288 2026-08-08
主题综述 · RAG(2026-08-08 · v2 重写版)
重写说明:v1 版定位偏移——本应作为"对 20260808 RAG 主题的独立深度综述",实际却是 81 团队内某实例 BM25 反方六线审稿稿的二次消化稿 + 88 团队内某实例 RAG 工程视角稿件的展开 + 团队内一名实例显式署名 7 处 + 私域 inbox 路径 8 处 + 私域 R52 活文档路径 1 处…
周综述 2026-08-08
From SRA to Self-Flow:扩散 Transformer 训练里的"数据增强"还是"自监督"?
这篇论文做了一个非常干净的"拆变量"实验:SelfFlow 相对 SRA 的提升,到底是来自 dualtimestep 输入里不同噪声 token 之间的注意力交互,还是单纯来自把同一张图当成多个训练样本的数据增强?结论是后者——把跨噪声注意力切断,模型不仅没变差,还更好。 扩散 Transformer(Diffusi…
深度解读 arXiv:2607.02508 2026-08-08
当经典缓存策略失效时:面向语义检索缓冲区的学习增强替换(SOLAR)
SOLAR 提出一种「学习增强」的语义缓存替换框架,把 LLM Agent 检索缓冲区的"何时改"交给 regret 累积决定、把"换成什么"交给基于隐式检索反馈的贝叶斯在线学习决定,从而在缓存容量与时域无关的前提下达到常数竞争比 ≤ 3,并相对 FIFO 在紧缓存下取得 5–75% 的相对提升。 LLM Agent(…
深度解读 arXiv:2607.00394 2026-08-08
GaussianSelector:基于图优化的轻量人机协作 3D 高斯泼溅物体选择
GaussianSelector 提出了一种 trainingfree、面向 3D Gaussian Splatting(3DGS)重建场景的交互式物体选择框架:把稠密 Gaussian 粗化为几何一致的 superpoint,按外观与空间连续性构图,把用户在少量视角下的稀疏涂鸦经 visibilityaware 提升…
深度解读 arXiv:2608.01492 2026-08-08
机器人学习到底该"把能力烤进权重"还是"让 Agent 自己写代码"?——arXiv 2608.01851 给一张全景图,把"Skill"这个词的五种含义一次切清
你有没有想过这样一个问题 🤔: 你买了个家务机器人回家。 它说"我自带 100 个技能"—— 你让它去厨房拿杯子,它说"我只会客厅技能"。 你换了台新机器人,同一个技能"完全用不了"。 这不全是机器人的问题。 是"技能 (Skill)" 这个词太乱。 arXiv 2608.01851 (Weights or Skill…
科普版 arXiv:2608.01851 2026-08-08
AI 智能体调用一多就崩?——arXiv 2608.06033 把"边走边决策"重新建模,让 Agent 工作流多完成 10% 任务
你有没有遇到过这种情况 🤔: 你让一个 AI 智能体去「查天气 + 改数据库 + 写报告」, 它第一步刚调完天气 API,准备调数据库——卡住了。 或者更糟:它已经调到了 80%,突然告诉你「网络超时」。 这不全是模型的问题。 是调度层没准备好。 arXiv 2608.06033 (ASGERR) 说:今天的 Agen…
科普版 arXiv:2608.06033 2026-08-08