Explainers · 学术推广产出

解读

1096 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

AI Wizards 参加 EXIST 2026:分层软标签学习用于迷因中的多模态性别歧视识别
本文是 CLEF 2026 EXIST Lab 挑战赛的一个参赛系统笔记:用 Gemini Embedding 2 提取固定 768 维多模态表征,套一个仅 3.5M 参数的 SwiGLU Gated MLP 头,以 KL 散度 + 同方差不确定性加权联合训练三个层级子任务(性别歧视识别 / 来源意图 / 五类细分),…
深度解读 arXiv:2607.04410 2026-08-09
实时 RAG 系统提升历史档案的可访问性
本文把"LLM 改 OCR"与"语义检索 + 跨编码器重排 + 流式生成"组合成一条端到端历史档案管道,在 50 万段 1762–2001 年的瑞士报纸语料上,OCR 字符错误率降 44.52%、词错误率降 60.95%,NDCG@10 从 65.99% 提到 87.05%(+31.9%),并把响应延迟压到秒级,证明把…
深度解读 arXiv:2607.03440 2026-08-09
OpenRCA 2.0:从结果标签到因果过程监督
LLM Agent 在跨系统根因分析(RCA)中能以 76% 的准确率定位到正确服务,但真正把该服务锚定在经验证因果传播路径上的仅有 61.5%;现有数据集只标注根因、不标传播路径,是这个 gap 的根本原因。 SRE 场景中,LLM Agent 被用于自动根因分析——给定一段告警和系统遥测数据,让模型找出哪个组件导致…
深度解读 arXiv:2606.27154 2026-08-09
知道太多的智能体:面向 LLM 智能体隐私的数据中心化综述
LLM Agent 接触的数据源越多、保留的状态越久、跨系统协作越深,隐私泄露的维度就越广;但现有防护机制只覆盖部分泄露路径,且没有基准能完整衡量 Agent 在单一隐私策略下跨所有数据面的风险。 传统隐私研究按攻击类型组织(Prompt Injection、DPA 等),割裂了 Agent 与数据交互的整体视图。本文…
深度解读 arXiv:2606.26627 2026-08-09
运行与否:分析基于 LLM 的程序修复中代码执行的成本效益
LLM Agent 在 SWEbench 上禁用代码执行后,修复成功率几乎不变(仅差 1.25pp),但仍平均消耗 8.8 次测试运行;当前 Agent 对执行的使用是「不加区分」的,执行应该被当作有明确成本收益权衡的资源,而非默认能力。 基于 LLM 的程序修复 Agent 普遍采用「generaterunrevis…
深度解读 arXiv:2606.26978 2026-08-09
通过表征锚定与语言-动作对齐实现可泛化的 VLA 微调
在 VLA(VisionLanguageAction)策略的标准行为克隆(BC)微调流程上叠加「视觉语言表征锚定」与「语言动作对齐」两个辅助目标,能让模型既保留预训练 VLM 的视觉/语义泛化能力,又把动作预测和语言语义真正绑在同一观测上,在 xArm7 真实机器人与 LIBEROPRO / LIBEROPlus / …
深度解读 arXiv:2607.13429 2026-08-09
联邦学习中的非独立同分布数据:用 Earth Mover's Distance 量化权重发散,并以 5% 全局共享数据恢复 30% 精度
联邦学习在非独立同分布(NonIID)数据下精度最高下降 55%,其根因是各客户端模型权重相对于全局最优的发散,这种发散可以用 Earth Mover's Distance(EMD,推土机距离) 在类分布层度量;作者证明,只要在所有边缘设备之间共享 5% 的全局数据,即可在 CIFAR10 上把精度恢复约 30 个百分…
深度解读 arXiv:1806.00582 2026-08-09
用对比预测编码(CPC)学表征:高维信号到紧凑潜空间的通用无监督路径
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:实验数字以 abstract 范围内可核验项为限,未引未在公开 abstract 中给出的精确指标。 CPC(Contrastive Predictive Coding)提出一种与模态无关的无监督表征学习方法:通过一个编码器把高维信号压成紧凑潜空间 z,再用一个…
深度解读 arXiv:1807.03748 2026-08-09
T5:用统一的 Text-to-Text 框架探索 NLP 迁移学习的极限
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:C4(Colossal Clean Crawled Corpus)命名、texttotext 范式、覆盖任务类型(summarization / QA / text classification)来自 abstract 直接陈述;具体 GLUE/SuperGLU…
深度解读 arXiv:1910.10683 2026-08-09
两时间尺度更新规则(TTUR)与 Fréchet Inception Distance(FID):让 GAN 训练首次有了收敛保证与可靠评估
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:CelebA/CIFAR10/SVHN/LSUN/One Billion Word 等数据集名与 TTUR/FID 命名来自 abstract 直接陈述;具体 FID 数值与 baseline 对比表未在 abstract 给出,标注「需 PDF 验证」。 He…
深度解读 arXiv:1706.08500 2026-08-09
FedAvg:把通信效率抬到中心化 SGD 的 10-100 倍,联邦学习的奠基算法
McMahan 等人提出的 Federated Averaging(FedAvg)用「客户端本地多步 SGD + 周期性参数平均」的极简范式,在非 IID、不平衡、跨设备的真实数据上,把达成目标精度所需的通信轮数压到同步 SGD 的 1/10 至 1/100,从而把「数据不出端」的联邦学习从概念推向可工程化的算法。 2…
深度解读 arXiv:1602.05629 2026-08-09
mixup:用凸组合造数据,把泛化、对抗鲁棒性、GAN 稳定性一并拉满
Zhang 等人提出的 mixup 用「把两张图(及其标签)按 λ 凸组合,送进网络训练」的极简数据增强,在 ImageNet、CIFAR、Google commands、UCI 五个数据集上一致抬高 SOTA 模型的泛化精度,同时减少对损坏标签的过拟合、提升对对抗样本的鲁棒性、并显著稳定 GAN 训练——以不到十行代…
深度解读 arXiv:1710.09412 2026-08-09
FVAttn:带运行时负载均衡的自适应稀疏注意力,专治视频生成
FVAttn 是一个面向视频 DiT(Video Diffusion Transformer)的训练free 自适应稀疏注意力系统。它把「Topp 路由 + Topk 安全底 + 视频块结构」作为稀疏前端的策略,同时在多卡序列并行(sequence parallelism)下做运行时 P2P 负载均衡与 slack 填…
深度解读 arXiv:2607.16190 2026-08-09
为「主动观察者」准备的考试:ActiveVision 基准如何暴露 MLLM 的视觉死穴
ActiveVision 是一个用来「量化 MLLM 是否像人一样主动观察图像」的评测基准。它用 17 个任务 3 类题型,强制模型反复做视觉感知,而非一次性静态描述。结果在最强模型 GPT5.5(最高 reasoning effort 档)上也只拿到 10.6%,Claude Fable 5 仅 3.5%,远低于三位…
深度解读 arXiv:2607.16165 2026-08-09
MANCE:流形感知的概念擦除
MANCE 提出流形约束假设(Manifold Constraint Hypothesis),认为自然表征集中于低维流形上,干预应被投影到该流形内执行——在这一假设指导下,MANCE++ 在非线性概念擦除任务上达到 SOTA,在移除目标概念信息的同时更好地保留其他语义属性。 概念擦除(Concept Erasure)的…
深度解读 arXiv:2607.03973 2026-08-09
CheckRLM:检索增强推理中的知识-思维一致性校验
CheckRLM 在推理过程中实时提取关键事实主张并检索外部知识库比对,发现错误后以最小改动精确修正,从而有效阻断错误在长推理链中的累积传播,在长程推理上以更低成本达到 SOTA 性能。 以 DeepSeekR1、OpenAIo1 为代表的推理语言模型(Reasoning Language Model, RLM)通过扩…
深度解读 arXiv:2607.02262 2026-08-08
Know Your Source:面向媒体事实核查的公共知识库 MEDIAREF
提出 MEDIAREF——一个覆盖 200 家媒体来源、可公开下载、可复现更新的网络文档知识库,作为 RAG 时代"sourcecritical reasoning / Media Background Check (MBC)"任务的低成本公共评测底座,并系统评测了主流 LLM 在 MBC 生成上的表现。 基于 LLM…
深度解读 arXiv:2607.02383 2026-08-08
WARP:从权重空间反推训练数据混合比例
WARP(Weightspace Analysis for Recovering training data Portfolios) 是一个从已发布模型权重反向推断其微调阶段训练数据"领域混合比例"的框架:在 base 与 finetuned 模型之间做 model merging,生成伪检查点,从权重空间的几何特征映…
深度解读 arXiv:2607.01686 2026-08-08
AgenticSTS:长周期 LLM Agent 的"有界记忆"测试平台
提出一种 boundedmemory contract(有界记忆契约):每次决策都基于一条由"类型化检索"组装出的"新鲜"用户消息,不再追加跨决策的原始历史,从而在 Slay the Spire 2(杀戮尖塔 2)这一长周期决策游戏中对 LLM Agent 的各记忆层做可隔离消融(A0 固定对照),并开源 298 条带…
深度解读 arXiv:2607.02255 2026-08-08
MultAttnAttrib:长文档问答中免训练的多模态归因生成
MultAttnAttrib 是一种免训练的归因(attribution)生成方法,通过利用模型自身 prefill 阶段的注意力头与校准阈值,在长文档问答里精准定位答案所对应的源证据,在多模态(图表+文本)归因上一致优于多种强 promptbased 方法,推理延迟仅为同等 base model 直接 prompti…
深度解读 arXiv:2607.01420 2026-08-08
OrbitQuant:面向图像与视频扩散 Transformer 的数据无关量化
OrbitQuant 是一种数据无关(dataagnostic)的 PTQ 方案,通过在归一化的旋转基空间中量化,绕过传统 PTQ 必须的 range estimation,让单个 LloydMax codebook 同时适配所有 timestep、prompt 与 layer——首次把图像 DiT 的 PTQ 推到 …
深度解读 arXiv:2607.02461 2026-08-08
AGVBench:面向静脉识别数据增强的可靠性基准
AGVBench 在 5 个公开掌/指静脉数据集、7 个骨干网络上系统评测了 30 种数据增强策略,首次明确指出「准确率最高的增强(多图混合类)反而最脆弱、校准最差」,为静脉识别这一安全敏感领域建立了一个兼顾干净准确率、对抗鲁棒性与概率校准的标准化评测协议。 静脉识别(掌静脉、指静脉)被认为是一种「活体、难伪造」的生物…
深度解读 arXiv:2607.02271 2026-08-08
EvoPolicyGym:在交互式环境中评估 Agent 的自主策略演化能力
EvoPolicyGym 把"Agent 能否通过反馈迭代改写可执行策略"这件事做成了一个有固定交互预算的受控评测——16 个紧凑的 RL 环境、24 页论文,把"会改代码"和"能持续调优"分开来看,并跑出 GPT5.5 是当前最强。 Agent 评测里有个长期被绕开的痛点:最终分数高,不等于 Agent 真会"演化"…
深度解读 arXiv:2607.02440 2026-08-08
京东 Oxygen AI 商品中心(Oxygen AIIC)V1:工业级 LLM/VLM 商品知识生产与服务
这是一篇来自京东的工业级 LLM/VLM 系统论文:在 7 亿用户、几百亿 SKU 的电商平台上,用 LLM/VLM 搭了一个商品知识生产与服务的"中枢",覆盖搜索/推荐/运营/类目规划四大场景,把搜索流量覆盖率推到 80.4%、商品信息质量问题下降 37%、上架自动填核心属性超过 80%。 电商平台的"商品知识"是搜…
深度解读 arXiv:2606.28070 2026-08-08
Physics Informed Deep Learning (Part I): Data-driven Solutions of Nonlinear Partial Differential Equations
Physics Informed Neural Networks(PINN)将物理定律(由非线性偏微分方程 PDE 描述)编码为神经网络的损失函数约束,使网络在数据稀缺甚至无标签数据的情况下也能学习到符合物理规律的真解,且输出对所有输入坐标和自由参数天然可导。 传统科学计算依赖数值方法(有限元、有限差分、有限体积法)求…
深度解读 arXiv:1711.10561 2026-08-08
面向纵向胸部 X 光报告的过渡感知 Best-of-N 采样
本文是论文 TransitionAware bestofN sampling for Longitudinal Chest Xray Reports(Gulluk et al., 2026, arXiv:2606.28393, cs.CV)的深度解读。 针对"纵向胸部 X 光报告生成"任务,作者提出了首个面向预训练报告…
深度解读 arXiv:2606.28393 2026-08-08
Data Flow Control(DFC):AI Agent 数据安全策略的内核级执行框架
Data Flow Control(DFC)将 AI Agent 生成查询时的数据安全合规问题从「Prompt 层的后验检查」下沉为「数据库内核级的前摄执行」——通过声明式的 provenance monomials 聚合谓词策略语言,配合 Passant 查询重写引擎,在不物化 provenance 的前提下实现跨五…
深度解读 arXiv:2606.05679 2026-08-08
多模态 LLM 的计算幽默:方法、数据集、评估与挑战
这是一篇关于「MLLM 如何理解视觉幽默」的综述:以「能力层级(识别 → 解释/推理 → 生成)」为骨架,把梗图、漫画、连环画里的多模态幽默任务、基准、评估与建模范式系统梳理一遍,核心论点是 MLLM 在幽默任务上仍受困于捷径学习式评测、文化与叙事覆盖不足、证据接地弱、安全与版权四道坎。 幽默理解长期被视为 NLP 与…
深度解读 arXiv:2607.19011 2026-08-08
AutoIndex:为检索学习表征程序
AutoIndex 把"文档表示"从一次性的预处理选择提升为一类可学习的程序(representation program):由 agent 在验证集信号引导下,自动搜索对文档"切分 / 增强 / 归一化 / 重加权 / 重组"的执行程序,不改检索器本身,就能在固定 BM25 上把 8 个任务 Recall@100 平…
深度解读 arXiv:2607.18603 2026-08-08
Flow-Controlled Scheduling:LLM 推理的稳态流控调度
这篇论文把 LLM 推理服务的"系统不稳、KV cache 爆、延迟抖动"归因到了一个被忽视的核心变量——prompt 加入活跃集的速率——然后用一套简洁的"流控调度(flowcontrol scheduling)"把 admission control 从经验调参升级为有 provable stability 的算法…
深度解读 arXiv:2604.11001 2026-08-08