Explainers · 学术推广产出

解读

1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

DINOv2:无监督学习鲁棒的视觉特征
DINOv2 证明了一个核心命题:只要在足够大、足够优质的精选数据上训练,自监督方法完全可以学习出通用的视觉表征,在图像级和像素级任务上均达到甚至超越专门训练的 SOTA 模型,且无需任何微调即可直接使用。 在 DINOv2 之前,NLP 领域的 Foundation Model 范式已经成熟——大规模无监督预训练产生…
深度解读 arXiv:2304.07193 2026-08-03
BLIP-2:用冻结图像编码器与大型语言模型自举语言-图像预训练
BLIP2 提出轻量级 QFormer,通过两阶段预训练策略桥接 frozen image encoder 与 frozen LLM,在参数量减少 54 倍的前提下于多项 VLM 任务取得 SOTA,并首次展示了 zeroshot imagetotext generation 遵循自然语言指令的潜力。 VisionLa…
深度解读 arXiv:2301.12597 2026-08-03
ReDesign:用 Agentic 分解从光栅图中"长出"可编辑设计稿
ReDesign 提出一个 LLM Agent 驱动的"自顶向下逐层扩张"框架:把一张位图反向拆成 Figma 可编辑的分层结构(typography / vector / color / grouping / layer order),并在每一次扩张后用"graceful verification"做局部接受/剪枝/…
深度解读 arXiv:2607.25565 2026-08-03
Temporal-Distance JEPA:从离线轨迹中挖出「时间进度代价」,让 JEPA 规划器学会排序未来
TemporalDistanceJEPA(TDJEPA)保留 LeWM 的 encoderpredictor 主干,但额外从无奖励的离线演示轨迹中挖出一个「directed temporal cost」(同轨迹 step order 作正样本、跨轨迹作启发负样本、辅以 rolloutconsistency 正则),同时…
深度解读 arXiv:2607.25337 2026-08-03
具备网络攻击能力的 AI Agent:漏洞、评估遏制与防御响应
这篇综述把"具备网络攻击能力的 AI agent"——即将 LLM、工具、记忆、执行环境缝合起来跑多步攻击性安全任务的系统——当成一个安全系统而非一个模型来研究:综合五类边界漏洞(多步攻击链、与沙箱边界冲突的目标、供应链与凭据暴露、持续 C2、自动化速度),并以 2026 年 7 月的 Hugging Face / O…
深度解读 arXiv:2607.25379 2026-08-03
HANDBOOK.md:面向长上下文 Agent 的"政策遵循"基准
HANDBOOK.md 用 65 个企业级多步骤任务、5 个领域、20–124 页的"标准操作程序 (SOP)",把"系统提示/SOP 文档是否真能在长工具使用视野中约束住 Agent 行为"这件事量化成可重复实验,并暴露出当前最强模型在严格评分下也只能通过 36.2% 试次的系统性缺陷。 部署 LLM Agent 时…
深度解读 arXiv:2607.25398 2026-08-03
Bridging the Question-Answer Gap in Retrieval-Augmented Generation: Hypothetical Prompt Embeddings(HyPE)
HyPE 把"生成假设文档再做检索对齐"这件事从查询时搬到索引时,预先为每个文档块生成多条"假设提问"并以这些提问的嵌入替换原块嵌入,从而把检索变成"问题—问题"匹配,消除了 HyDE 的运行时开销并稳定提升检索质量。 RAG 系统长期存在 query–document 的"风格鸿沟":用户问的是短问句或口语化表达,而…
深度解读 arXiv:2607.29402 2026-08-03
Multivariate Time Series Forecasting via Time-Frequency Graph Learning and Covariate Fusion(CrossRAG / TFGformer 题名分歧已标注)
作者提出 CrossRAG——把 RAG 思路第一次系统性地搬到多变量时间序列长期预测上:通过 ShapeAware Memory(SAM)+ RevIN 归一化解决跨源量纲不一致、用 FutureConsistent Contrastive(FCC)学习把"历史相似但未来不一致"的难负样本区分开、再用 CrossAt…
深度解读 arXiv:2607.29459 2026-08-03
文生图的「文本条件」标度律:结构化语言越多,扩散损失越低
本文首次系统地测量了文生图扩散模型中文本条件的标度性质:收敛后的扩散损失随提示词中结构化语言量的增加近似线性下降(白盒 GPG 度量)并服从幂律(黑盒 ED 度量);据此同时提升 diffusability(给模型喂结构化提示)与 promptability(让模型自己生成结构化提示),最终在绝大多数组合 / 推理 /…
深度解读 arXiv:2607.29679 2026-08-03
多参考图像编辑的一致性奖励:Evaluation-Verification Reward (EVR)
本文提出 EVR(EvaluationVerification Reward)——一种把多模态大模型拆成「评估器 + 验证器」两阶段、产出细粒度可靠奖励信号的方案,用于对多参考图像编辑模型做强化学习微调;在 QwenImageEdit 上即插即用,一致性与和谐度追平或超过 NanoBanana。 近一年的图像编辑模型(…
深度解读 arXiv:2607.29025 2026-08-03
ExtractBench:第一份同时打分「准确性 + 完整性 + 引用 + 成本」的企业抽取基准
本文提出 ExtractBench——第一份在企业级 schema 引导文档抽取任务上同时度量「值准确率 + 记录完整度 + 引用接地 + 实测成本」的基准,含 4,869 页 / 370 份文档 / 8 个业务域 / 67 种文档类型;评测显示商业 VLM 在短文档上强但常截断长列表,coding agent 准但贵…
深度解读 arXiv:2607.29677 2026-08-03
通过自蒸馏增强基于评分标准的强化学习:CriPO
CriPO(CriterionDistilled Policy Optimization)针对基于评分标准的强化学习中两类长期被忽视的失败模式——未探索评分项(Unexplored Criteria, UC) 和 被抑制评分项(Suppressed Criteria, SC)——通过 onpolicy 自蒸馏同时求解,…
深度解读 arXiv:2607.18082 2026-08-03
Meshy T2:用 Flow Matching 实现快速原生网格生成
Meshy T2 提出一个用 flow matching 直接生成多边形 mesh 的统一框架:通过 vertexset mesh VAE 把整张 mesh 编码为每顶点一个连续 latent token,再用粗到细两级 flow(体素流勾勒体素占据骨架 + mesh 流补顶点与连接),实现 endtoend 6 秒生…
深度解读 arXiv:2607.28675 2026-08-03
QQWorld:用分位数匹配重塑潜在世界模型正则化
QQWorld 把 LeWM 的 EppsPulley(EP)潜在分布正则换成分位数分位数(QQ)匹配目标,让"远离高斯"的孤立尾部样本也能获得有效梯度;并通过跨批 QQ 利用前一批 detach 样本扩大秩池,同时刻画其偏差方差权衡,在四个控制环境上一致提升规划成功率、改善高斯对齐并削薄潜在尾部。 潜在世界模型(la…
深度解读 arXiv:2607.28415 2026-08-03
CodeNib:面向编码 Agent 的多视图仓库上下文服务数据系统
CodeNib 将 Coding Agent 的仓库上下文问题重新定义为数据系统问题:针对每个仓库提交(commit)一次性构建词法、稠密向量和结构三类视图并维护各自的增量更新路径,以单一运行时同时提供排序搜索、符号导航和有界上下文服务,相比重复重建索引提速 8.7×~25.4×,同时将 Agent 的轨迹 token…
深度解读 arXiv:2607.25431 2026-08-03
跨文本、表格与知识图谱的知识不一致检测
Kontrast 把"同一事实散落在 Wikipedia 文本、表格和 Wikidata 知识图谱中、相互打架"这一长期积弊,第一次正式定义为"模态级不一致检测"任务,并给出一套基于 TexttoSPARQL + LLM 推理的自动化框架;同时贡献了一套可公开复现的表问答基准,证明跨模态冲突既真实可测,也能反过来用作"…
深度解读 arXiv:2607.25959 2026-08-03
超越自我认知:在 LLM 推理与检索间传播不确定性
BeyondUncertainty 用黑盒 LLM 自报的言语化置信度(verbalized confidence)做"是否需要检索"的门控路由:在 27,000 个策略实例(6 个 QA 基准 × 3 个模型族 × 3 种检索策略)上,把平均 token 级 F1 从"总是检索"的 0.467 抬到 0.483,同时…
深度解读 arXiv:2607.25600 2026-08-03
Agent Retrieval Bench:把"代码 Agent 仓库检索"从直觉变成可测基准
Agent Retrieval Bench 把"代码 Agent 在动手前能不能先把仓库里需要的文件找出来"这件事单独抽出来做 filelevel 评测:427 条样本 / 25 个仓库 / 5 类子任务 / 308 个 basecommit 快照 / 7.9M 个 chunk,结论是没有一类检索方法能压倒其他方法,且…
深度解读 arXiv:2607.24882 2026-08-03
RLHF Reward Model 推理能跑多快?ONNX Runtime + C++ vs PyTorch 的系统研究
作者用基于 ONNX Runtime 的原生 C++ reward model 推理引擎跟 PyTorch eager、torch.compile、FastAPI 三类基线做对照,发现在 CPU 上 C++/ONNX 大幅领先,在 GPU 上 C++/ONNX 击败 PyTorch 与 FastAPI 但输给 torc…
深度解读 arXiv:2607.19712 2026-08-03
UAV 高光谱 PFM-1 地雷检测中的人在回路签名引导
PFM1 地雷的 UAV 高光谱检测不是「识别一个光谱匹配」,而是一场关于核查成本的博弈:算法必须把「多少个候选点需要人去现场复查」压到两位数以内;本文证明 ACE(自适应相干估计器)+ 全量人工签名引导 只需两轮共 9 次候选复查即可确认全部 7 个目标区,而 SAM 即使配合人机协同也要上千次候选复查。 高光谱成像…
深度解读 arXiv:2607.25310 2026-08-03
Grading the Narrators:把伊斯兰圣训学的溯源方法搬进多 Agent 知识系统
本文把「伊斯兰圣训学(hadith science)千年沉淀的 isnad(传述链)+ rijal(传述者评级)」方法论形式化迁移到多 agent 知识系统,给出声明级(claimlevel)溯源的关系型 schema、最弱链评估、独立链互证、内容批评与链路评级解耦等机制,并在 20,000 条真实物理教材声明上做了实…
深度解读 arXiv:2607.24117 2026-08-03
培养 Agentic 工程师:AI 时代的课程、协作与持续学习
这是一篇概念综合(integrative conceptual synthesis)型文章,主张随着生成式与 agentic AI 重构软件工程,培养重心必须从「人类亲手写工件」转向「指导、验证、治理自主系统」,,并以 ACCEL 框架(Agentic Competencies through Curricula, C…
深度解读 arXiv:2607.29610 2026-08-03
记忆来源漂白:面向 LLM Agent 持久记忆的「非放大」防火墙
本文命名并形式化了「memory provenance laundering(记忆来源漂白)」这一新型 LLM Agent 安全威胁,并实现了一个轻量级中间件 PPMF(ProvenancePreserving Memory Firewall),通过保留平台维护的来源标签 + 按行动风险匹配记忆权威性,把经过有损记忆整…
深度解读 arXiv:2607.29167 2026-08-03
EasyBCI Agent:迈向脑机接口的通用神经数据预处理
本文提出 EasyBCI,一种两阶段 LLM agent:先用 Plan Agent 把每条神经记录画像为纯文本"数据指纹(Data Fingerprint)"(绝不暴露原始数据给模型),再交给 Execution Agent 自动生成、运行并自校正预处理代码;通过质量门控的经验库积累可复用的策略,并由领域专家在两个决…
深度解读 arXiv:2607.29007 2026-08-03
DecoEvo:让 Solver 与 Rubric-Generator 在文本空间解耦共进化
DecoEvo 提出「ScoreDecoupled CoEvolution」:在文本空间(不修改模型权重)里同时进化一个 solver skill 和一个 rubricgenerator skill,二者用互相解耦的目标函数驱动更新——solver 按「按条目的细粒度反馈」优化,rubricgenerator 按「覆盖…
深度解读 arXiv:2607.25675 2026-08-03
CLBench-V:面向多模态上下文学习的评测基准
CLBenchV 把「多模态上下文学习」拆成 grounding / 应用新信息 / 学习新知识 三维坐标轴,在 3,443 个实例上证明当前最强的多模态大模型也只拿到 0.2847 分,多模态 incontext 能力远未饱和。 过去一年,「context learning」成为 RAG 之外另一条补足模型能力的路线…
深度解读 arXiv:2607.25294 2026-08-03
CoRT:用反事实回放做 Token 级 Rubric 引导的策略优化
CoRT 提出一种「不训打分模型」就能给 rubricbased GRPO 加 token 级信用分配的技巧——通过在带 rubric 与去 rubric 两个 prompt 上对同一条样本做对数似然对比,把对比值映射成 token 级权重,去重分配 GRPO 的 advantage,在指令微调模型上平均比纯 resp…
深度解读 arXiv:2607.25659 2026-08-03
Neural Approaches to Conversational AI:把问答、任务型、闲聊三类对话系统收口到一套深度学习框架的 95 页综述
Gao、Galley、Li 三人把 20132018 年间碎片化的「神经网络对话 AI」梳理成三块(QA agents、Taskoriented dialogue agents、Chatbots),给出一个统一的「自然语言 → 自然语言」端到端视角,并显式把当下每一类系统的 SOTA 训练范式、数据集与失败模式摆到同一…
深度解读 arXiv:1809.08267 2026-08-03
RepoReasoner:长上下文语言模型仓库级代码推理能力评估
RepoReasoner(FSE'26)是首个专门评估 LLM 在跨多文件、复杂依赖结构场景下仓库级代码推理能力的 benchmark,通过动态 tracing 生成调用链真值、LLM 重写 I/O 减少记忆化效应,在 7 个 SOTA 模型上揭示了一个核心结论:即使提供 oracle 上下文,最强模型在跨文件执行推理…
深度解读 arXiv:2607.25996 2026-08-03
并行解码蒸馏:面向快速图像与视频生成
PDD(Parallel Decoding Distillation)通过在单次网络评估中预测多个去噪步骤,将扩散/流匹配模型的生成步数从数十步压缩至 48 步,同时在视频多样性上显著优于所有竞争方法,且全程无需对抗损失或交替训练。 视频扩散模型和流匹配模型的生成成本极高:一次高质量视频需要数十甚至上百次网络评估(高 …
深度解读 arXiv:2607.26004 2026-08-03