Explainers · 学术推广产出

解读

1532 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

用深度强化学习做交通信号控制:DTSE 与 SUMO 上的里程碑式工作
这篇 2016 年的工作把深度 Q 网络(DQN)+ 经验回放搬进交通信号控制场景,提出一种新的离散交通状态编码(Discrete Traffic State Encoding, DTSE)作为卷积网络的输入,并在 SUMO 仿真器上把平均累计延误降低 82%、平均队列长度降低 66%、平均行程时间降低 20%。它是把…
深度解读 arXiv:1611.01142 2026-08-16
RAG 系统安全与隐私:构建可信知识增强系统的全面综述
RAG 将外部知识检索与 LLM 生成结合,已成为企业知识管理、医疗、金融、法律等隐私敏感领域的核心架构。然而,RAG 的引入同时也扩展了攻击面:检索索引、查询日志、上下文构建过程、联邦更新等多个环节都可能泄露敏感信息;对抗性知识库污染则可直接操纵生成结果。 RAG 将外部知识检索与 LLM 生成结合,已成为企业知识管…
深度解读 arXiv:2606.25533 2026-08-16
Post-training 被遗忘的免费午餐:Progress Advantage 让 LLM Agent 无需专门奖励模型即可实现过程级评估
RL 后训练本身就是过程级奖励信号的现成来源——通过推导 RL 策略与参考策略的对数概率比(Progress Advantage),无需人工标注、无需专门奖励模型训练,就能在 Agent 场景中实现 SOTA 级别的 steplevel 评分。 Process Reward Model(PRM) 能对 LLM Agen…
深度解读 arXiv:2606.26080 2026-08-16
超越函数调用:ToolBench-X 揭示工具不可靠环境下 Agent 的严重可靠性鸿沟
现有工具使用基准都假设工具稳定可信,但真实环境中工具随时可能故障、降级或返回错误数据;ToolBenchX 通过5类结构化可靠性 hazard 测试证明:能在可靠环境下工作的 Agent,遇到可恢复的可靠性危害时大量失败——诊断能力和恢复策略比调用量更重要。 工具调用(Tooluse)是 LLM Agent 完成真实世…
深度解读 arXiv:2606.25819 2026-08-16
解开 GraphRAG 的「结」:VectorRAG 几乎够用 — 评 UnWeaver 框架
这篇论文主张:GraphRAG 那种繁重的图索引在多数实际问答场景里并不划算——用 LLM 把文档里的实体先解耦、再据此回收原文块,单凭 entity 这一中间表示就能把 VectorRAG 的端到端 QA 精度顶到接近 SOTA 图方法,但索引成本大幅压低。 RAG 系统有两个老毛病: 1. 块级检索把信息「混编」进…
深度解读 arXiv:2603.29875 2026-08-16
LoopCoder-v2:仅循环一次以实现高效测试时计算扩展
LoopCoderv2 通过 GainCost 分析框架证明:Parallel Loop Transformer(PLT)在两次循环时达到最优平衡——第二轮循环带来表示精炼,但超过两轮后 CLP 位置错配成本将超过收益,导致性能回落。 Looped Transformer 通过反复堆叠同一组 Shared Blocks…
深度解读 arXiv:2606.18023 2026-08-16
集成商优势:面向中小型企业的受控 Agentic AI
本文认为 Agentic AI 的近期价值不在于「替代人类」或「完全自主」,而在于为中小企业(SMC)的简单与中等复杂度业务流程提供「受控的部分自主」能力——以人为中心,责任与问责由人承担,AI 作为生产力杠杆。 Agentic AI 正在引发企业自动化的新一轮范式转变。与传统 RPA( Robotic Process…
深度解读 arXiv:2606.16649 2026-08-16
Ricci-Filtration:通过离散 Ricci Flow 将 RAG 重排序器提升至 Query-Answer 任务
RicciFiltration 将 RAG 检索出的 Chunk 集合建模为加权图,利用归一化离散 Ricci Flow 的几何性质——正曲率区域收缩、负曲率区域扩张——在图上识别并过滤「噪声 Chunk」(相对于 Query 节点具有大权重与负 Ricci 曲率),再将过滤后的 Chunk 送入 Reranker,显…
深度解读 arXiv:2606.15482 2026-08-16
WGAN-GP:用梯度惩罚替代权重裁剪,稳定训练 Wasserstein GANs
把 WGAN 中用来强行施加 1Lipschitz 约束的权重裁剪(weight clipping)替换成对 critic 输入梯度的 L2 范数惩罚(gradient penalty),从而在几乎不调超参的情况下稳定训练包括 101 层 ResNet 与离散语言模型在内的多种 GAN 架构,并在 CIFAR10 / …
深度解读 arXiv:1704.00028 2026-08-16
Whisper:用 68 万小时弱监督多任务数据训练一个零样本语音识别/翻译基础模型
把"在网上能爬到的大量带弱字幕的音频"当成天然监督信号,用 encoderdecoder Transformer 在 68 万小时多语种多任务数据上做大规模弱监督训练,得到的 Whisper 在标准 ASR 基准(LibriSpeech、FLEURS、TEDLIUM 等)上无需任何任务专属微调即可达到与有监督 SOTA…
深度解读 arXiv:2212.04356 2026-08-16
LMCache:面向企业级 LLM 推理的高效 KV Cache 层级
LMCache 是首个开源、生产级的 LLM KV Cache offloading 方案,把 KV Cache 从 GPU 显存中提取出来,跨 CPU / 存储 / 网络层级存储和共享,同时支持 prefix 复用与 prefilldecode(PD)disaggregation,在多轮 QA、文档分析等场景下,与 …
深度解读 arXiv:2510.09665 2026-08-16
LLM 多智能体系统:挑战与开放问题
这是一篇偏定位 + 展望的综述论文,聚焦 LLM MultiAgent System(MAS)在 任务分配 / 协作推理 / 上下文管理 / 记忆机制 四个核心机制上的开放问题,并把多智能体范式推到 区块链与分布式系统 这一相对少见的应用场景,借此为 LLM MAS 在真实分布式环境中的落地提供思路。 LLM 单 ag…
深度解读 arXiv:2402.03578 2026-08-16
GLM-5: 从 Vibe Coding 到 Agentic Engineering
引用:GLM5Team (Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng 等), "GLM5: From Vibe Coding to Agentic Engineering", arXiv:2602.15763v2, 20260217 v1, 20…
深度解读 arXiv:2602.15763 2026-08-16
「问 AI 一张图,AI 给答案」这件事的祖师爷:VQA 这篇论文给了 9 年多模态比赛的标准答案
你有没有想过 🤔: 当你给 ChatGPT 发一张图、问「这张图里的猫在做什么」,它能秒回「趴在窗台上晒太阳」——这个「看图 + 理解问题 + 自然语言回答」的能力是怎么来的? 当 GPT4V、QwenVL、LLaVA 在各种「视觉问答」榜单上刷分时,它们究竟在和什么样的基准做对比? 答案是:2015 年由 21 位作…
科普版 arXiv:1505.00468 2026-08-15
让 AI「看图写一句话」这件事的祖师爷:Karpathy 这篇论文打开了图像描述的整条血脉
你有没有想过 🤔: 当你手机相册自动生成「一只狗在草地上追飞盘」这样的标题时,微信扫一扫能识别图里的菜单,淘宝拍立淘能从一张照片里找出同款商品——它们背后其实都是同一个核心问题:机器怎么把一张图变成一句自然语言? 今天这事听起来理所当然,但在 2014 年之前,AI 看到一张图能做的只有两件事: 而真正能让 AI 「理…
科普版 arXiv:1412.2306 2026-08-15
HDR:面向多步视觉推理的分层去噪框架
提出 HDR(Hierarchical Denoising for Visual Reasoning),把因果视频生成的潜变量组织成树状层级,先粗后细地做多步视觉推理;用稀疏层级注意力(SHAP)压低时序注意力成本,0.70 秒 / latent 的流式速度下,多步任务成功率从 34.22 提到 60.29,相对提升 …
深度解读 arXiv:2607.15278 2026-08-15
超越成功率:攻击性与防御性安全 Agent 的成本感知评估
现有安全 Agent 评估只问"能不能成功",而这篇论文认为真正重要的是"花多少钱能成功"——提出成本成功率联合评估框架,对攻击(CTF)和防御(SOC 调查)两种场景分别发现截然不同的 scaling 规律:攻击任务靠加大推理预算就能显著提升,防御任务的成功率更多取决于工具使用的纪律性,而非砸更多算力。 当前安全 A…
深度解读 arXiv:2607.15263 2026-08-15
分区、提示、聚合:语言模型中的统计自一致性
本文提出一种「参考无关」的 LLM 评估新准则——统计自一致性(statistical selfconsistency):用二叉树把总体递归切成越来越细的子群体,让模型分别估计每个子群体,再聚合回总体估计;只要结果对树的切分粒度敏感、且与人类基线有显著差距,就说明模型存在「宏观谬误(macro fallacy)」——子…
深度解读 arXiv:2607.15277 2026-08-15
HowTo100M:让互联网叙事字幕自动变成 1 亿级视频-文本对训练语料
Miech、Zhukov、Alayrac 等人用 YouTube 上 1.22M 个「howto / instructional」视频的自动 ASR 字幕切割出 1.36 亿个 clipcap pairs,从此把「视频文本」对齐学习从昂贵的人工标注(30K–100K 级别)一举推到亿级训练数据规模;他们用 MILNCE…
深度解读 arXiv:1906.03327 2026-08-15
ALBEF(Align Before Fuse):先对齐再融合 + 动量蒸馏,让视觉-语言预训练进入「对噪声鲁棒」的实用时代
Li、Selvareanu、Gotmare 等 Salesforce 研究者提出 ALign BEfore Fuse(ALBEF):先用对比损失 (ITC) 在单模态编码器上把图像和文本编码到共享空间,再用跨模态 Transformer 融合;同时为应对网络爬来的图文对天然带噪声,引入 momentum distill…
深度解读 arXiv:2107.07651 2026-08-15
GPTs are GPTs:LLM 对美国劳动力市场的冲击全景评估
OpenAI、OpenResearch 与宾夕法尼亚大学的研究团队合作,首次系统评估了 GPT 类大语言模型对美国劳动力市场的潜在影响:约 80% 的劳动者至少有 10% 的工作任务可被 LLM 影响,约 19% 的人面临至少 50% 的工作任务被颠覆;LLM 驱动的软件工具可将任务自动化比例从 15% 提升至 47–…
深度解读 arXiv:2303.10130 2026-08-15
CoCa:用对比损失 + 描述损失,把图像-文本基础模型做「一锅端」
CoCa(Contrastive Captioner)把 CLIP 的对比学习(contrastive loss)和 SimVLM 的描述生成(captioning loss)塞进同一个 encoderdecoder Transformer,用「前半段 decoder 不做 crossattention / 后半段做」…
深度解读 arXiv:2205.01917 2026-08-15
MiniGPT-4:当「视觉 + Vicuna + 投影层」组合被简化到极致
MiniGPT4 把 LLaVA 的「CLIP + Vicuna + 投影层」配方再简化:把 QFormer 之类的中间件全砍掉,只用一个投影层对齐冻结的 ViT + 冻结的 Vicuna,再用少量 detailed caption 数据做二次微调,就复现了 GPT4 那种「看图写诗、看图生成网页、看图讲笑话」的能力。…
深度解读 arXiv:2304.10592 2026-08-15
ViLT:让视觉-语言预训练摆脱「重检测器」
ViLT(VisionandLanguage Transformer)第一次把 vision encoder 砍到「纯 ViT patch embedding」级别:不再依赖 Faster RCNN 抽 region feature,整张图直接当 32×32 个 patch 喂进 Transformer,与文本 tok…
深度解读 arXiv:2102.03334 2026-08-15
VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training
VideoMAE 证明视频 masked autoencoder 可以在极小数据集(3k–4k 视频)上高效自监督预训练,极高 masking ratio(90%–95%)不仅无害,反而提升了表征质量。 视频自监督预训练长期依赖超大规模预训练数据集(如 Kinetics700),对小样本场景(如 SomethingSo…
深度解读 arXiv:2203.12602 2026-08-15
InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning
InstructBLIP 在 BLIP2 预训练模型基础上,对 26 个公开数据集做系统性的 visionlanguage instruction tuning,首次实现零样本泛化到 13 个 heldout 数据集上全面超越 Flamingo 等更大模型,并在 ScienceQA 上达到 90.7% 准确率。 GPT…
深度解读 arXiv:2305.06500 2026-08-15
From Foundation to Application: Improving VLA Models in Practice
LingBotVLA 2.0 通过扩展预训练数据覆盖机器人全身自由度,显著提升了跨具身(crossembodiment)长时程移动操作能力,在 GM100 基准的通用设置下验证有效,有效弥合了 VLA 基础模型在实验室环境与真实落地之间的差距。 VLA(VisionLanguageAction)基础模型在论文实验中表现…
深度解读 arXiv:2607.06403 2026-08-15
TSseek:面向分布式时序数据集的正则表达式相似性搜索
TSseek 是一套面向大规模分布式时序数据的正则表达式驱动相似性搜索框架:把时序片段抽象为「保留斜率方向 + 值域」的线段序列,把正则查询转译成有界矩形,再在自研的分布式空间索引 TSseekX 上做全匹配与子序列匹配两种查询,论证并实证了 PAA/SAX 等传统近似索引在「正则模式查询」上根本不适用。 时序相似性搜…
深度解读 arXiv:2606.09824 2026-08-15
Bespoke-Card:用代码生成替代手工调优的基数估计器合成系统
BespokeCard 是一个由 Agent 驱动的基数估计(cardinality estimation)系统——它针对一个具体的工作负载(schema + 真实查询),让规划 Agent 决定估计策略、让编码 Agent 直接生成可执行的 Python 估计器、用结构化 qerror 反馈 + 回归分析 + 课程式…
深度解读 arXiv:2606.09361 2026-08-15
MAGMaR 2026 共享任务综述:以多模态检索驱动文章生成
ACL 2026 第二届 MAGMaR(Multimodal Augmented Generation via Multimodal Retrieval)共享任务概述了当年参赛系统在两个赛道的整体表现——视频检索(2 队 17 系统,全部超越上届冠军基线)与基于检索视频的接地文章生成(4 队 16 系统,所有参赛队都有…
深度解读 arXiv:2606.12295 2026-08-15