Explainers · 学术推广产出

解读

1547 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

HACO:对冲式 Agent Computing——面向长流程 LLM 系统的运行时可靠性调度
HACO(Hedged Agent Computing)把「roletoinstance 绑定」当成一个带可靠性约束的候选选择问题——每次 role 请求到来时,它先按乐观排序挑出最优候选,再用保守的可靠性累加规则挑出 hedge 集,直至集合的成功概率满足目标阈值才下发执行;执行完的所有 candidate trac…
深度解读 arXiv:2607.19215 2026-08-09
主题综述 · database(2026-08-09)
把 2026 年 8 月这一周的 database 主线画在同一张图上,它不是一张分类树,而是三条相互正交但彼此合流的演化轴。第一条轴是部署形态:从 HNSW 经典(arXiv:1603.09320,paper_cards 590,S2 被引 2531 / OpenAlex 188 / 影响力被引 379,2016)代…
周综述 2026-08-09
当所有人都在问「GPT 和 Claude 哪个强」时,2019 年这篇论文早就回答了真正的问题——T5 如何用「一句话前缀」让一个模型干所有 NLP 任务
你有没有过这种崩溃 🌀: 你想做一个系统,同时干「评论分类 + 摘要生成 + 翻译 + 问答」四件事。你打开 HuggingFace——BERT 用来分类、GPT2 用来摘要、BART 用来翻译、还要再接一个 SpanBERT 做抽取—— 四个模型,四套 tokenizer,四套 finetune 流程,你要维护的是四…
科普版 arXiv:1910.10683 2026-08-09
七年了,我们还在用 2019 年这篇论文搭的「地基」训练每个大模型——PyTorch 为什么成了深度学习的唯一语言
你有没有想过这件事 🎯: 你在 MacBook 上跑的那段 loss.backward(),在你手机里的「语音助手」训练时也跑过同一份代码,马斯克训练 Grok 时也是这一行,Meta 最新 Llama 4 的预训练脚本还是这一行。 在 2019 年之前,这种事根本不存在——研究者在 TensorFlow 上写代码,工…
科普版 arXiv:1912.01703 2026-08-09
视频选题榜 2026-08-09
· KVAE: Family of Tokenizers for Multimodal Generative Models · Kandinsky Lab 把音频/3D/2D 三件套 tokenizer 升级为可独立评测、跨模态统一比较的一等组件 · round=R2 · HarnessOptBench: Evalua…
选题榜 2026-08-09
终身心智:Transformer 需要参数化注意力才能实现终身上下文学习
论文论证了一个核心命题:在固定硬件预算下,用 Transformer 实现真正的终身学习(lifelong learning),必须用参数化注意力(parametric attention)替代标准 softmax attention——后者因 keyvalue cache 随序列长度二次增长而不可扩展;前者通过在线可…
深度解读 arXiv:2606.25342 2026-08-09
基于 FLISP 的大规模隧道空地协同:Fast LiDAR-IMU Synchronized Path Planner
FLISP 用一套 UGV 搭载的 LiDARIMU 同步驱动 UGV 与 UAV 路径,在 1.2 km 真实水工隧道里实现 100% 成功率、7 ms 规划延迟,比栅格基线快 7 倍,比采样基线快三个数量级,首次在特征退化的线性基础设施里把"无地图规划"做成可落地的工程方案。 水电站引水隧洞、排沙洞、压力管道一类长…
深度解读 arXiv:2606.25393 2026-08-09
Running the Gauntlet:重新评估 Agent 在熟悉环境之外的能力
针对当前 Web Agent 评测被简单、热门、单一能力的基准"刷分式饱和"的问题,提出 GauntletBench——一套聚焦"时间感知 / 图形理解 / 3D 推理"三类被忽视能力的 Web 基准,覆盖 5 个冷门但实用的专业场景,共 100 个视觉密集型任务;结果显示 SOTA Agent 仅 19.1% 成功率…
深度解读 arXiv:2606.14397 2026-08-09
CanvasAgent:通过视觉工具编排实现复杂图像创建与编辑
针对复杂图像创建与编辑需要多步多工具协作,而现有多模态 tooluse 数据集与 Agent 多以感知/检索为中心、缺乏大规模"可执行图像创作轨迹"监督的痛点,提出 CanvasCraft 大规模数据集(140K 全标注可执行轨迹 + 10K RL 任务规范),并在 SFT+GRPO(混合 outcome+proces…
深度解读 arXiv:2607.05465 2026-08-09
基于 RAG 增强 LLM 的空域图像隐写术代码级代价函数生成
针对空域图像隐写中"代价函数手工调参繁琐、深度学习方案又缺乏可解释性"的老问题,提出一个以 SelfEvolving RAG (SERAG) 为核心的进化式代码生成系统:先用 Code Semantic Signature (CSS) 把过程式代码转成对齐查询,从静态文献知识库与动态经验知识库中检索显式领域知识来约束 …
深度解读 arXiv:2607.05868 2026-08-09
PluraMath:将数学推理评估拓展至低资源语言
PluraMath 通过将 PolyMath 扩展至 18 种低资源语言,证实了数学推理能力在高低资源语言之间的系统性差距,且该差距与模型指令遵循能力高度相关。 当前主流数学推理 Benchmark(如 GSM8K、MATH)几乎全部被英语和中文垄断——这些语言在 LLM 预训练语料中占绝对主导地位。这意味着:即便同一…
深度解读 arXiv:2607.05992 2026-08-09
HETERQA:跨异构来源记录检索的基准测试与现状分析
HETERQA 构建了一个包含 857 个 QA 对、覆盖 5 种异构数据源(关系表、文本文档、图像库、空间数据库,知识图谱)的综合基准,证实当前主流检索方法在该场景下仍有巨大提升空间——Hybrid Retrieval 最高 Recall@10,SelfRAG 最高 MRR@10,但均远未饱和基准。 真实世界的信息系…
深度解读 arXiv:2607.03028 2026-08-09
MV-Forcing:通过 4D 几何约束实现任意长度多视角视频生成
MVForcing 在单一扩散模型中融合时间与视角双重自回归,通过 3D 重建模型构建相邻视角间的 4D 几何桥梁,并用时空自强迫(SelfForcing)弥合训练推理的曝光偏差,实现任意长度、任意视角数的动态场景多视角视频生成。 视频生成领域有两个独立进展良好的方向: 但两者的交集——长+多视角——是未解问题。具体痛…
深度解读 arXiv:2607.05376 2026-08-09
CONFLUX:面向胸部 CT 的可控 3D 潜在扩散模型 + GRPO 后训练
CONFLUX 把 3D 变分自编码器 + 整流流 Transformer(rectifiedflow transformer)拼成一套原生 3D 的胸部 CT 潜在扩散生成器,再以组相对策略优化(GRPO)作为后训练阶段,用一个独立分类器对"请求病征的恢复可靠性"打分当作奖励,把整体 FID 压到 32.3(vs. …
深度解读 arXiv:2607.02998 2026-08-09
AI Wizards 参加 EXIST 2026:分层软标签学习用于迷因中的多模态性别歧视识别
本文是 CLEF 2026 EXIST Lab 挑战赛的一个参赛系统笔记:用 Gemini Embedding 2 提取固定 768 维多模态表征,套一个仅 3.5M 参数的 SwiGLU Gated MLP 头,以 KL 散度 + 同方差不确定性加权联合训练三个层级子任务(性别歧视识别 / 来源意图 / 五类细分),…
深度解读 arXiv:2607.04410 2026-08-09
实时 RAG 系统提升历史档案的可访问性
本文把"LLM 改 OCR"与"语义检索 + 跨编码器重排 + 流式生成"组合成一条端到端历史档案管道,在 50 万段 1762–2001 年的瑞士报纸语料上,OCR 字符错误率降 44.52%、词错误率降 60.95%,NDCG@10 从 65.99% 提到 87.05%(+31.9%),并把响应延迟压到秒级,证明把…
深度解读 arXiv:2607.03440 2026-08-09
OpenRCA 2.0:从结果标签到因果过程监督
LLM Agent 在跨系统根因分析(RCA)中能以 76% 的准确率定位到正确服务,但真正把该服务锚定在经验证因果传播路径上的仅有 61.5%;现有数据集只标注根因、不标传播路径,是这个 gap 的根本原因。 SRE 场景中,LLM Agent 被用于自动根因分析——给定一段告警和系统遥测数据,让模型找出哪个组件导致…
深度解读 arXiv:2606.27154 2026-08-09
AI 写代码不一定要"跑测试"——arXiv 2606.26978 一篇论文让 SOTA 编程 Agent 禁用执行后,成功率只掉了 1.25%,但还能省下 8.8 次测试运行
你有没有想过这种可能 🤔: 你用 AI 帮你改 bug, 它"跑测试"这件事,不是必需的。 禁掉它, 修复成功率几乎不变(只差 1.25pp), 但每次任务少跑 8.8 次测试。 听起来反直觉? 2026 年 ISSTA 一篇论文 arXiv 2606.26978 告诉你: 当前所有 SOTA 编程 Agent,对"代…
科普版 arXiv:2606.26978 2026-08-09
AI 助手知道的太多了,谁来管?——arXiv 2606.26627 把"隐私"这事儿从「攻击类型」换成「数据触点」,挖出 Agent 时代最被忽视的 5 条泄露暗道
你有没有过这种体验 🤔: 你让 AI 帮你订机票, 它顺手就读了你的公司财报、老板邮件、上周看过的病历; 你问"我去年体检报告里血脂高吗?", 它秒回——但你从没授权它读那份报告。 你以为"AI 助手不会越权"? 错了。 arXiv 2606.26627 这篇综述把这件事拆开给你看: "LLM Agent 越能干,隐私…
科普版 arXiv:2606.26627 2026-08-09
2608-05798
date: 20260809 round: R2 arxiv: videokb: /shared/videokb/scripts/tom/20260809_R2_kvaetokenizerfamilymultimodalshortvideoscript.md 标题:KVAE 多模态 tokenizer 升一档 目标观众…
视频脚本 arXiv:2608.05798 2026-08-09
知道太多的智能体:面向 LLM 智能体隐私的数据中心化综述
LLM Agent 接触的数据源越多、保留的状态越久、跨系统协作越深,隐私泄露的维度就越广;但现有防护机制只覆盖部分泄露路径,且没有基准能完整衡量 Agent 在单一隐私策略下跨所有数据面的风险。 传统隐私研究按攻击类型组织(Prompt Injection、DPA 等),割裂了 Agent 与数据交互的整体视图。本文…
深度解读 arXiv:2606.26627 2026-08-09
运行与否:分析基于 LLM 的程序修复中代码执行的成本效益
LLM Agent 在 SWEbench 上禁用代码执行后,修复成功率几乎不变(仅差 1.25pp),但仍平均消耗 8.8 次测试运行;当前 Agent 对执行的使用是「不加区分」的,执行应该被当作有明确成本收益权衡的资源,而非默认能力。 基于 LLM 的程序修复 Agent 普遍采用「generaterunrevis…
深度解读 arXiv:2606.26978 2026-08-09
通过表征锚定与语言-动作对齐实现可泛化的 VLA 微调
在 VLA(VisionLanguageAction)策略的标准行为克隆(BC)微调流程上叠加「视觉语言表征锚定」与「语言动作对齐」两个辅助目标,能让模型既保留预训练 VLM 的视觉/语义泛化能力,又把动作预测和语言语义真正绑在同一观测上,在 xArm7 真实机器人与 LIBEROPRO / LIBEROPlus / …
深度解读 arXiv:2607.13429 2026-08-09
联邦学习中的非独立同分布数据:用 Earth Mover's Distance 量化权重发散,并以 5% 全局共享数据恢复 30% 精度
联邦学习在非独立同分布(NonIID)数据下精度最高下降 55%,其根因是各客户端模型权重相对于全局最优的发散,这种发散可以用 Earth Mover's Distance(EMD,推土机距离) 在类分布层度量;作者证明,只要在所有边缘设备之间共享 5% 的全局数据,即可在 CIFAR10 上把精度恢复约 30 个百分…
深度解读 arXiv:1806.00582 2026-08-09
用对比预测编码(CPC)学表征:高维信号到紧凑潜空间的通用无监督路径
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:实验数字以 abstract 范围内可核验项为限,未引未在公开 abstract 中给出的精确指标。 CPC(Contrastive Predictive Coding)提出一种与模态无关的无监督表征学习方法:通过一个编码器把高维信号压成紧凑潜空间 z,再用一个…
深度解读 arXiv:1807.03748 2026-08-09
T5:用统一的 Text-to-Text 框架探索 NLP 迁移学习的极限
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:C4(Colossal Clean Crawled Corpus)命名、texttotext 范式、覆盖任务类型(summarization / QA / text classification)来自 abstract 直接陈述;具体 GLUE/SuperGLU…
深度解读 arXiv:1910.10683 2026-08-09
两时间尺度更新规则(TTUR)与 Fréchet Inception Distance(FID):让 GAN 训练首次有了收敛保证与可靠评估
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:CelebA/CIFAR10/SVHN/LSUN/One Billion Word 等数据集名与 TTUR/FID 命名来自 abstract 直接陈述;具体 FID 数值与 baseline 对比表未在 abstract 给出,标注「需 PDF 验证」。 He…
深度解读 arXiv:1706.08500 2026-08-09
FedAvg:把通信效率抬到中心化 SGD 的 10-100 倍,联邦学习的奠基算法
McMahan 等人提出的 Federated Averaging(FedAvg)用「客户端本地多步 SGD + 周期性参数平均」的极简范式,在非 IID、不平衡、跨设备的真实数据上,把达成目标精度所需的通信轮数压到同步 SGD 的 1/10 至 1/100,从而把「数据不出端」的联邦学习从概念推向可工程化的算法。 2…
深度解读 arXiv:1602.05629 2026-08-09
mixup:用凸组合造数据,把泛化、对抗鲁棒性、GAN 稳定性一并拉满
Zhang 等人提出的 mixup 用「把两张图(及其标签)按 λ 凸组合,送进网络训练」的极简数据增强,在 ImageNet、CIFAR、Google commands、UCI 五个数据集上一致抬高 SOTA 模型的泛化精度,同时减少对损坏标签的过拟合、提升对对抗样本的鲁棒性、并显著稳定 GAN 训练——以不到十行代…
深度解读 arXiv:1710.09412 2026-08-09
FVAttn:带运行时负载均衡的自适应稀疏注意力,专治视频生成
FVAttn 是一个面向视频 DiT(Video Diffusion Transformer)的训练free 自适应稀疏注意力系统。它把「Topp 路由 + Topk 安全底 + 视频块结构」作为稀疏前端的策略,同时在多卡序列并行(sequence parallelism)下做运行时 P2P 负载均衡与 slack 填…
深度解读 arXiv:2607.16190 2026-08-09