解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
BLIP:用 Captioner+Filter 自举清洗噪声图文对,统一理解与生成的视觉-语言预训练
BLIP 提出 Bootstrapping LanguageImage Pretraining(CapFilt) 框架:在 VLP 阶段引入一个统一的 编码器解码器(MED),用同一个模型的 captioner 子模块给噪声 web 图文对合成新描述、再用 filter 子模块把不匹配的对踢出训练集;同时提出 ITC …
TransUNet:把 Transformer 当 Encoder、U-Net 当 Decoder 的医学图像分割范式
TransUNet 是第一个把 Transformer Encoder + UNet 风格的跳跃连接 Decoder 完整端到端应用到医学图像分割的工作。它回答的真问题是:在医学图像这种「局部结构极其关键」的场景下,纯 Transformer 失去低层细节,纯 CNN 抓不到长程依赖,怎么办——把 ViT 当作全局编码…
当 AI 还在为"看图说话"发明复杂融合时,2019 年的这篇论文只做了一件事:把视觉当 token
你有没有注意到,2018 年之前的视觉问答(VQA)系统都很"重"?图像和文本分别用两个网络编码,顶层再加一个 coattention 融合层,每个新任务都要重新设计融合架构——改一次任务,改一堆代码。 arXiv 1908.03557(VisualBERT,Li 等,2019)做了一件朴素到近乎挑衅的事:把图像区域特…
2608-05102
date: 20260807 round: R2 arxiv: 2608.05102 arxiv_url: video_kb_script: /shared/videokb/scripts/tom/20260807_R2_shortvideoscript.md 标题: ABSeeker · 步骤级信用 目标观众: AI…
距离度量学习综述:从马氏距离到结构化数据的 10 年脉络
这篇由 Bellet、Habrard、Sebban 撰写的综述系统梳理了 20032013 十年间距离度量学习(Metric Learning)领域的方法谱系:以马氏距离学习(Mahalanobis Metric Learning)为主线,扩展到非线性度量、相似度学习、局部度量、半监督/弱监督、稀疏/正则化变体以及面向…
VisualBERT:用 BERT 风格的 Transformer 隐式对齐视觉与语言
VisualBERT 把 BERT 的 Transformer 栈直接搬到"图像区域 + 文本 token"组成的联合输入上,靠自注意力(selfattention)隐式学到图文对齐,无需显式的边界框监督就达到 VQA / VCR / NLVR2 / Flickr30K 上的 SOTA 或接近 SOTA,并为后续 Vi…
CoCoEvolve:图表、表格、代码跨表征自监督一致性协同进化
CoCoEvolve 把"图表表格代码"之间天然存在的一对多映射,先折叠成有明确对应的一对一关系,再用表征间"一致性"作为无标注的自监督信号,训练时做循环协同进化、测试时继续沿用同一目标做即时一致性优化,并在四个跨表征基准上稳定涨点。 数据可视化领域有一类很硬的跨模态任务:同一份数据可以画成图表(图像)、写成表格(结构…
Chambon 2017:端到端多模态睡眠分期网络的奠基之作
Chambon 等人 2017 年在 arXiv 公开的"端到端多通道多模态睡眠分期网络"是 PSG(多导睡眠图)信号分类领域的第一篇"不抽频谱图、不手工特征、端到端训练、用全 PSG 模态"深度学习方案——它把"空间时间双卷积 + 30 秒窗口的时序上下文"封装为统一网络,在 61 个公开 PSG 记录上达到 SOT…
DRIFT:用对抗 patch 偏转流匹配 VLA 的去噪轨迹
贴在机械臂夹爪上的一个通用对抗 patch 就能让流匹配 VLA(pi0 / pi0.5)在 LIBERO 四个套件上几乎 100% 失效,且只攻击第一个去噪步反而比攻击更宽步窗口更有效——这件事直接戳破了"流匹配 VLA 对对抗扰动天然鲁棒"的错觉。 视觉语言动作模型(VLA)正大量部署到机器人上,pi0 这类基于流…
GDPevo:评估 agent 自进化能力的真实业务基准
GDPevo 把企业工作流拆成原子业务规则,按"训练任务用规则子集、测试任务重组未见规则子集"的方式构造基准,从而可归因地度量 agent 自进化能力;在四类 agent × 四类监督设置下,自进化在测试集上稳定提升最多 16.44 个百分点,但与全知 oracle 91.6% 的天花板仍有巨大差距。 "agent 自…
BEiT:把 BERT 的掩码预训练范式搬进 Vision Transformer
BEiT(Bidirectional Encoder representation from Image Transformers)通过掩码图像建模(MIM)+ 离散视觉 tokenizer(DALLE 风格的 dVAE) 的两路视图,在 ImageNet1K 上让 ViTBase 达到 83.2%、ViTLarge …
用任务同方差不确定性为多任务损失自动加权(Kendall et al., CVPR 2018)
这篇论文提出把多任务学习中各任务的损失权重重参数化为一个可学习的"同方差不确定性(homoscedastic uncertainty)"标量,完全不需要手调权重,在 monocular 深度、语义分割、实例分割三个回归+分类任务的联合训练中超过了各任务单独训练模型的水平。 多任务学习(MTL)听上去很美:一个网络同时输…
Swin-Unet:纯 Transformer 的 U 形医学图像分割网络
SwinUnet 把 Swin Transformer 的层次化窗口注意力搬进对称的 U 形 Encoder–Decoder,并用 patch expanding 替代反卷积做上采样,首次给出了不依赖任何卷积的、端到端的纯 Transformer 医学图像分割架构,在多器官 CT 与心脏 MRI 数据集上验证可行。 医…
基于工作流归纳的多轮智能体科学文献搜索(PaperPilot)
PaperPilot 把科学文献搜索建模成「工作流归纳」——给定一篇锚定论文与用户查询,Agent 自动构造一个由 keyword search、citation expansion、filtering、scoring、reranking、evidence extraction 等算子组成的有向无环图(DAG),通过监…
A-TMA:解耦长时 Agent 记忆中的状态感知失效
ATMA 提出"幽灵记忆(ghost memory)"这一长时记忆失效现象——旧事实、当前事实与过渡事实共存于记忆库、检索时混在一起、误导最终答案——并设计 ATMA 这一状态感知叠加层(stateaware overlay),把当前 / 历史 / 过渡三类标签显式暴露给 QA 模块,配套发布了高冲突基准 LTP(Lo…
DocOps:面向复杂文档操作的自主 Agent 可验证基准
DocOps 是首个对 AI Agent 文档操作能力进行确定性验证的层次化基准,揭示即使最先进的 frontier 模型在高度耦合、长范围的文档任务中仍存在系统性缺陷——长程状态追踪崩溃、语义验证浅表化、结构元数据被破坏性编辑。 大语言模型驱动的自主 Agent(LLMbased autonomous agents)…
Mathematical Capabilities of ChatGPT
通过新数据集 GHOSTS/miniGHOSTS 对 ChatGPT 和 GPT4 的数学能力做了至今最细致的评估:两者均无法达到研究生水平,ChatGPT 适合作为数学搜索引擎,GPT4 可胜任本科数学但会在研究生级别题目上失败。 2023 年初,媒体大量报道 ChatGPT/GPT4 "通过医学考试""通过司法考试…
StarCoder: may the source be with you!
BigCode 社区开源了 15.5B 参数的 StarCoder/StarCoderBase——首个在 80+ 编程语言上达到 SOTA 匹配 OpenAI codecushman001 的完全开源 Code LLM,并配套完整的数据治理框架 The Stack。 Code LLM 领域长期存在"开源不如闭源"的问题…
LLM 写的代码到底对不对?一篇把代码 benchmark 打回原形的解读:EvalPlus / HumanEval+
通过大规模自动补充测试用例,把 HumanEval 的 164 道题从「每个题 710 个测试用例」扩成「每个题平均 764+ 个测试用例(80× 增幅)」,得到 HumanEval+ —— 结果令业界大跌眼镜:所有主流 LLM 的真实代码正确率比原榜单平均下降 19.328.9 个百分点,甚至部分模型的相对排名都发生…
ENTRAP-VL:面向视觉-语言模型的双重上下文诱导探测基准
ENTRAPVL 不是一份"又一组 VQA 题",而是一套为研究 VLM 中"上下文诱导"现象而手工构建的分类学化探测工具:1500 条样本,沿"上下文与目标项的关联性 × 与事实真值的耦合"两条轴组织成 8 类,划分为文本诱导流(8 种上下文条件)与视觉诱导流(3 种上下文条件),目的不是给某个模型打分,而是给社区一…
可微分逻辑门网络用于边缘设备低延迟 EEG 分类
这篇论文把可微分逻辑门网络(DiffLogic)——一种训练时模拟、推理时编译成纯布尔电路、按位 CPU 操作执行的"硬件原生"网络——首次系统地用于边缘设备上的实时 EEG 分类。在四个 EEG 数据集、两类任务(痴呆症二分类、3 类情绪识别)、50k–500k 四档参数规模上做严格 isoparameter 实验,…
Color Pass-Through:用相机-显示耦合把"所见即所得"做到端到端
把相机和屏幕作为一个端到端可学习的耦合系统直接优化,跳过"分别标定 + 低维颜色变换"这条传统瓶颈链路,显著缩小"相机拍到的世界"和"屏幕上看到的画面"之间的颜色、亮度与对比度差距。 拍一张照片,再把照片传到屏幕上回放——这件事看起来平淡无奇,实际却是一个隐形的体验裂缝:原场景的色温、明暗、对比度、肤色还原,到屏幕上往…
任务未定型时代:Kaddour 等《Challenges and Applications of Large Language Models》综述解读
本文是一篇面向机器学习研究者的 LLM 路线图——把 2022 年末到 2023 年中期混乱的 LLM 文献,整理成 1)通用能力与改进方向的开放问题清单,2)真实工程应用领域版图,3)落地时的实战踩坑提醒,让一个"懂 ML 但不熟 LLM"的人能少走半年弯路。 2023 年 Q2 前后,所有 ML 团队都在赶着上 L…
对齐 LLM 也能被「通用对抗后缀」撬开:解读 GCG 越狱攻击
注:本文档按 arxiv ID 2307.15043 解读。该 ID 真实指向 Andy Zou 等人《Universal and Transferable Adversarial Attacks on Aligned Language Models》(即业内常称的 GCG 攻击 / Greedy Coordinate…
ReOPD:多轮 Agent 蒸馏的前缀回放新范式
ReOPD(前缀回放在策略蒸馏)解决了多轮 Agent 训练中「在线蒸馏」成本过高的问题——通过复用预采集的教师轨迹作为「回放前缀」,让学生在无需调用工具、无需真实环境交互的情况下完成蒸馏训练,速度提升 4 倍以上,同时保持甚至超越在线 OPD 的精度。 在 LLM Agent 训练中,一个常见范式是 OnPolicy…
当 LLM 的"投票选举"把错答案送上了王位——arXiv 2608.03506:30% 投票奇高反低,零训练的因果验证器跨过了 42.1%
你有没有抓狂过这种瞬间 🤔: 你问 AI 一个因果问题:"如果我发优惠券,销量会涨还是会跌?" 它给你一个答案。 你不放心,又问了一遍——答案变了。 你用 selfconsistency 跑了 8 次,准备投票选举"正确答案"—— 结果 8 个回答里 5 个是同一个明显错误。 "多数票"反而把错误答案送上王位。 你以为…
当 AI 在私聊里学会"你的说话方式"——arXiv 2608.03700:把"你"打包成 Skill 喂给别人有多大风险?
你有没有想过这种瞬间 😱: 你跟 ChatGPT 聊了一年工作、感情、健康、吐槽老板—— 然后某个 AI Agent 平台推出新功能:"把你的对话历史蒸馏成一个 Skill 包,喂给任意下游 Agent"。 听起来很美好对吧? 让 AI 替你跟所有应用互动,它"懂你",不用每次从零教。 arXiv 2608.03700…
AutoGen:用"会说话的智能体"搭下一代 LLM 应用
注:本卡 arXiv ID 在工作队列中曾被错误标注为 "AIKernel Semantic DSL Compiler and Deterministic Agent Execution Architecture"。经核实 arXiv 2308.08155 实际收录的论文为 Microsoft Research / P…
K12-KGraph:面向教育 LLM 的课程对齐知识图谱基准
K12KGraph 首次将中国 K12 教材中的知识点结构(先修链、概念分类、实验关联、教学排序、视觉定位)显式建模为知识图谱,并由此导出 23,640 道选择题的评测基准 K12Bench——当前最强模型 Gemini3Flash 仅得 57%,Gemma431BIT 仅 46%,Prereq 和 Neighbor …
PaLM 2 技术报告:Google 的"性价比路线"路线图
PaLM 2 不是"更大的 PaLM",而是用混合训练目标 + 更多非英语数据 + 更小但更聪明的尺寸三个维度同时压缩成本、提升多语言能力与推理能力,最终在多个 benchmark 上与 GPT4 正面竞争、并在推理效率上反超前代 PaLM 的 Transformer 语言模型家族。 2023 年 4 月,PaLM(5…