Explainers · 学术推广产出

解读

1096 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

BERTScore:用 BERT 上下文嵌入评估文本生成
BERTScore 利用 BERT 的上下文嵌入计算候选句与参考句之间的 token 级余弦相似度,并通过加权的 precision/recall 调和得到 F1,与人类判断的相关性显著高于 BLEU、ROUGE、METEOR 等 ngram 重叠指标,并在对抗性释义任务上展示了更强的鲁棒性。 文本生成评估(机器翻译、…
深度解读 arXiv:1904.09675 2026-08-08
Synthetic Data + 整体词识别:用合成数据训练神经网络识别自然场景文字
Jaderberg 等人 2014 年提出一个里程碑方案:用合成引擎生成的海量、免费的文字图像训练深度神经网络,对自然场景图片中的英文单词做整体识别。它在 ICDAR 2003、ICDAR 2013、SVT 等标准 benchmark 上大幅刷 SOTA,并确立了「合成数据 + 整体词级 CNN」作为场景文字识别(ST…
深度解读 arXiv:1406.2227 2026-08-08
Gemini 家族:原生多模态、超大规模、首批在 MMLU 上达到人类专家水平的大模型
Google DeepMind 在 2023 年 12 月发布的 Gemini 家族技术报告介绍了 Ultra / Pro / Nano 三档规模、文本+图像+音频+视频+代码原生多模态的密集 Decoderonly Transformer。其旗舰模型 Gemini Ultra 在 32 项公开基准中的 30 项刷新 …
深度解读 arXiv:2312.11805 2026-08-08
Gemini:Google 的原生多模态大模型家族技术报告
Google DeepMind 团队在 2023 年底发布的 Gemini 技术报告(arXiv:2312.11805)介绍了 Gemini 这一原生多模态(natively multimodal)模型家族,覆盖 Ultra / Pro / Nano 三个规模,跨图像、音频、视频、文本四种模态。最大规模 Gemini …
深度解读 arXiv:2312.11805 2026-08-08
DataComp-VLM:面向视觉-语言模型的开源数据策划基准
DataCompVLM(DCVLM)是一个系统性 VLM 训练数据策划基准,包含 160 个数据集、6T 多模态 token,揭示了一个反直觉但稳健的结论:数据混合策略(而非数据过滤)是打造高性能 VLM 的关键,其中指令密集型混合比描述密集型混合更具扩展性优势。 VLM 的训练数据策划长期依赖经验性直觉:用什么数据、…
深度解读 arXiv:2606.28551 2026-08-07
教导 LLM 在欠发达地区癫痫诊疗中进行推荐与转诊:MANANA 框架解读
在资源受限的乌干达儿科癫痫诊疗场景中,MANANA 通过非参数化 promptlearning 将观察到的处方错误转化为可审计的 prompt memories,结合 Bayesian prompt averaging 实现基于不确定度的自动转诊信号,在独立收集的两个乌干达验证队列上将就诊级别 top3 处方准确率提升…
深度解读 arXiv:2606.31036 2026-08-07
A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT
将软件工程中"设计模式"的思想系统化引入 Prompt Engineering,首次为 LLM 对话总结出一套可复用、可组合、可跨域迁移的 16 种 Prompt Pattern 模板。 ChatGPT 等 LLM 在实际使用时,用户往往靠"试错"或"玄学调参"来获得好输出——没有统一术语,没有结构化方法论,不同场景的…
深度解读 arXiv:2302.11382 2026-08-07
EnvACE:用「世界排演」把环境动力学内化到策略里的智能体强化学习方法
EnvACE 提出一种"世界排演(world rehearsal)"机制:让 LLM 智能体在训练时同时扮演「策略者」与「环境」两个角色,由同一份权重端到端优化,绕开对真实或合成可执行环境的依赖;测试时还能在真正执行前做"私有预演",相当于把环境模型折进了策略里。 LLM 智能体训练长程工具调用时,对可执行环境的依赖很…
深度解读 arXiv:2608.06197 2026-08-07
CalibForge:用对抗式 Solver 校准来规模化生成「可学」的终端智能体任务
CalibForge 是一个自主合成"终端型 agent 任务"的系统:先用「多 solver 不一致」或「强弱 solver 对照」两种对抗信号,把候选任务校准到"强 solver 能过、弱 solver 卡住"的难度区间,从而产出 5,431 条对训练真正有信号的任务;在 TerminalBench 2.0 / S…
深度解读 arXiv:2608.06352 2026-08-07
W2-VLA:以任务条件化的「未来腕部」潜空间增强细粒度机器人操作
W2VLA(WorldtoWrist VLA)把腕部相机从「第二个视角」重定义为「未来交互的预测对象」:先用一组任务条件化的潜建模 token 在 VLM 与腕部预测器之间建立紧凑接口,再让腕部预测器在动作决策前先在潜空间里「预演」腕部局部交互如何演变,从而在 LIBERO、RoboTwin 2.0 与真机上同时提升单…
深度解读 arXiv:2608.05369 2026-08-07
EffectLearner:用「世界感知的对象-效应推理」重做视频物体擦除
EffectLearner 把视频物体擦除(Video Object Removal, VOR)的难点从「遮住目标」升级到「显式推理并抹除目标引发的所有因果效应」:VLMbased Reasoner 先对高亮目标视频做跨模态推理,输出紧凑的 effectaware context,DiTbased Eraser 在 m…
深度解读 arXiv:2608.05565 2026-08-07
PaDoc:把版面预测当成「分支树」的并行文档解析器
PaDoc(Parallel Decoding Document Parser)把端到端文档解析器里的版面预测当作「共享页面表征之上的分支结构」:版面流与各区域内容流在 MLLM 内部以 packed variablelength ancestor attention 并发推进,推理时借助 vLLM 把版面 / 区域当…
深度解读 arXiv:2608.06146 2026-08-07
Invisible Shortcuts:为什么你的视觉编码器"看见"了你的相机
视觉编码器不只在利用你看得见的偏置(物体背景、纹理),还在利用一种像素级、肉眼不可见的"元数据痕迹"——这些痕迹会编码图像处理、相机采集参数;在大规模语义监督下,模型会自发把它们转成预测特征,构成一种新的 shortcut。论文系统性制造"受控的元数据语义相关性",证明相关性越强、模型对元数据越敏感、且在分布漂移下掉点…
深度解读 arXiv:2608.05424 2026-08-07
SmartMage:让 3D 场景理解的"模态组合"按问题动态变化
SmartMage 把 3D 场景理解里的"模态组合"从"固定套餐"改成"按问动态配菜"——通过一个 SMART 模块决定"这次该用哪几个模态"、再通过一个 MAGE 模块决定"专家该按哪种模态偏好激活",在 5 个 3D 场景理解 benchmark 上达到 SOTA,并且在只给 RGB 视频时也能在视频理解任务上保…
深度解读 arXiv:2608.05137 2026-08-07
OSReward:给跨平台计算机使用 Agent 的轨迹奖励模型立一套「真」的标尺
OSReward 把"让 VLM 当 CUA 轨迹法官"这件事从"大家都凭印象打分"变成"有标准化 benchmark + 公开可复现的判官模型":它用一个跨平台、多阶段人工标注的真实轨迹基准,去量度现有 VLM judge 的可靠性,并据此训出 9B / 35B 的 OSShepherd 开放奖励模型,在成本比商业闭…
深度解读 arXiv:2607.28609 2026-08-07
SegFormer:把 Transformer 编码器与轻量 MLP 解码器拧成一根绳的语义分割框架
SegFormer 用一个分层无位置编码的 Transformer 编码器配纯 MLP 的 allMLP 解码器,在 ADE20K、Cityscapes 上同时拿到比 Swin / SETR 更小的参数量和更高的 mIoU,并展示了对 CityscapesC 的零样本鲁棒性。它回答的核心问题是:Transformer …
深度解读 arXiv:2105.15203 2026-08-07
PIMiner:用"Agent 对 Agent"智能体系统自动做提示注入红队测试
PIMiner 把"提示注入红队测试"从 RL 训练的端到端攻击器改成"在多个 (数据集, 目标 LLM) 上迭代积累策略库"的智能体系统,最终用每个样本仅 ~10 次查询就拿下 GPT5.1 / Gemini2.5Pro / ClaudeSonnet4.5 三类目标上的高 ASR,并且策略库对新目标 LLM 可直接迁…
深度解读 arXiv:2608.05108 2026-08-07
FinanceHarness:面向金融领域的自主深度研究框架与可验证基准
FinanceHarness 提出"分层 harness + pointintime 基准"双件套:前者把金融研究 Agent 的环境/数据/执行/奖励四层工程化拼齐,后者用"前置 + 后置 cutoff"双时间窗的命题与 rubric 阻塞未来信息泄露,从而让"金融深度研究"这一通用 Agent 跑不好的任务具备可评…
深度解读 arXiv:2607.27853 2026-08-07
Brevis:把无损张量压缩重写成程序合成
Brevis 把"无损压缩一个神经网络 checkpoint"这件事,从传统启发式编码的暗箱,重写为在可逆 DSL 上做带类型偏置的 A\ 程序搜索:先学一个"针对 checkpoint 这一类样本"的产程先验(production prior),再用它指导有界 A\ 搜出能 bitexact 重建张量的最短程序;同一…
深度解读 arXiv:2608.02162 2026-08-07
Resume Means Resume:Agent 工作流持久化层的可机器验证一致性契约
论文把"agent 框架里到底什么算 resume?"这个长期被各框架以模糊文档糊弄过去的语义问题,形式化成 6 条核心性质 + 2 条附带义务的 RESUME CONTRACT,再用 TLA+ 对参考语义在 740 万状态空间上做穷尽模型检测(结果不变),并用一个 39cell 的故障矩阵和并发场景证伪:5 个主流框…
深度解读 arXiv:2608.03836 2026-08-07
FocusMem:把潜在 GUI 记忆拆成"内容 / 读出 / 信任"三件套
FocusMem 把 GUI 智能体的潜在记忆 (latent memory) 拆成"该存什么 / 在不同决策阶段读出哪一份 / 这块记忆值不值得信"三个独立模块,全部用 GUI 策略冻结下的损失训练,在 5 个 GUIagent 基准上一致超越"单固定记忆块 + 下一动作监督"基线。 GUI agent 需要两段记忆…
深度解读 arXiv:2608.04530 2026-08-07
ABSeeker:用"答案回溯"给长程搜索 Agent 做细粒度信用分配
ABSeeker 提出 AnswerBacktracked Credit Assignment (ABC):从 groundtruth 答案反推得到"中间线索集",再用线索集对轨迹里的每一步打分,把"轨迹级稀疏奖励"翻成"步骤级稠密监督",配合 ABCSFT 和 ABCGRPO,只用 8.5k 样本就能在 4B 模型上…
深度解读 arXiv:2608.05102 2026-08-07
SIGNPOST-Bench:面向多模态大语言模型的文本-视觉冲突消解基准
SIGNPOSTBench 用"同一图像的反事实五元组"控制变量,把 MLLM 在文本与视觉证据冲突时"听谁的"这件事从猜测变成可量化诊断:在 25,555 张变体图上对 7 家厂商的 20 个 MLLM 横评后,对抗性文本注入让地理定位中位误差从 282 km 抬到 1,347 km(4.8 倍),且每个被评测模型都…
深度解读 arXiv:2608.04244 2026-08-07
自我进化的编程 Agent:综述一个新的研究方向
《SelfEvolving Coding Agents》是一篇综述论文,第一次把"部署后会随经验自我更新"的编程 Agent 从零散实践中抽出概念骨架:用"演化什么"的对象中心分类法 + "何时演化 / 由什么证据驱动演化"两条正交坐标,把近年关于 Agent 更新框架、记忆、技能、工具、模型与协作结构的文献组织成一棵…
深度解读 arXiv:2608.03392 2026-08-07
帮助音乐共创 Agent "听懂":分层自监督世界模型用于理解与生成
论文提出一个面向符号音乐的 分层自监督世界模型:用 2.55M 参数的 Swin V2 编码器在 MIDI pianoroll 图像上以 JEPA 风格目标(音高/时间平移等变性 + 掩码嵌入预测 + 分布正则化)训练,无需标签与乐理词汇;表征按"音乐属性的可解码层"自然对齐其时间尺度(小节边界出自最粗层、音符密度/和…
深度解读 arXiv:2608.04378 2026-08-07
BLIP:用 Captioner+Filter 自举清洗噪声图文对,统一理解与生成的视觉-语言预训练
BLIP 提出 Bootstrapping LanguageImage Pretraining(CapFilt) 框架:在 VLP 阶段引入一个统一的 编码器解码器(MED),用同一个模型的 captioner 子模块给噪声 web 图文对合成新描述、再用 filter 子模块把不匹配的对踢出训练集;同时提出 ITC …
深度解读 arXiv:2201.12086 2026-08-07
TransUNet:把 Transformer 当 Encoder、U-Net 当 Decoder 的医学图像分割范式
TransUNet 是第一个把 Transformer Encoder + UNet 风格的跳跃连接 Decoder 完整端到端应用到医学图像分割的工作。它回答的真问题是:在医学图像这种「局部结构极其关键」的场景下,纯 Transformer 失去低层细节,纯 CNN 抓不到长程依赖,怎么办——把 ViT 当作全局编码…
深度解读 arXiv:2102.04306 2026-08-07
距离度量学习综述:从马氏距离到结构化数据的 10 年脉络
这篇由 Bellet、Habrard、Sebban 撰写的综述系统梳理了 20032013 十年间距离度量学习(Metric Learning)领域的方法谱系:以马氏距离学习(Mahalanobis Metric Learning)为主线,扩展到非线性度量、相似度学习、局部度量、半监督/弱监督、稀疏/正则化变体以及面向…
深度解读 arXiv:1306.6709 2026-08-07
VisualBERT:用 BERT 风格的 Transformer 隐式对齐视觉与语言
VisualBERT 把 BERT 的 Transformer 栈直接搬到"图像区域 + 文本 token"组成的联合输入上,靠自注意力(selfattention)隐式学到图文对齐,无需显式的边界框监督就达到 VQA / VCR / NLVR2 / Flickr30K 上的 SOTA 或接近 SOTA,并为后续 Vi…
深度解读 arXiv:1908.03557 2026-08-07
CoCoEvolve:图表、表格、代码跨表征自监督一致性协同进化
CoCoEvolve 把"图表表格代码"之间天然存在的一对多映射,先折叠成有明确对应的一对一关系,再用表征间"一致性"作为无标注的自监督信号,训练时做循环协同进化、测试时继续沿用同一目标做即时一致性优化,并在四个跨表征基准上稳定涨点。 数据可视化领域有一类很硬的跨模态任务:同一份数据可以画成图表(图像)、写成表格(结构…
深度解读 arXiv:2608.04926 2026-08-07