解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
你今天用的每一张 AI 生成图片,背后都站着一个 2014 年的「以假乱真」博弈实验
你有没有过这种体验: 让 AI 画一张「猫在沙发上看书」——它 0.5 秒就给你一张构图、配色、光影都挑不出毛病的图。你盯着那张图,觉得「生成式 AI 早就成熟了」。 可你不知道的是: 2014 年之前,让 AI「凭空画一张图」是整个学术圈的硬骨头——要么算到天荒地老,要么画出来像一团马赛克。 2014 年 6 月,一…
视频选题榜 2026-08-05
· LongHorizonHarness: Advancing LongHorizon Agents for RealWorld Tasks · LongHorizonHarness 把任务执行+状态追踪+完成评估三件混一个 context 重新建模为「外部任务状态管理问题」· MEA(ManagerExecuteAu…
Med-PaLM 2:用大语言模型冲击医师级医学问答
MedPaLM 2 通过「更强基座 PaLM 2 + 医学领域微调 + 新提出的 ensemble refinement 提示策略」,在 MedQA (USMLE 风格) 上拿到 86.5%,比初代 MedPaLM 提升 19 个百分点以上,并在多项临床相关评测中达到或逼近 SOTA;更重要的是,在 1066 道消费者…
Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints
WAIT 与 Nested WAIT 调度策略将 LLM 推理的 KVcache 内存约束建模为在线调度问题,通过流体力学模型推导稳定区域边界,在接近过载和过载区间显著降低延迟并扩大安全运行范围。 LLM 推理服务每日成本高达百万美元级别,GPU 调度是延迟、吞吐量与成本的核心瓶颈。问题的本质困难在于内生性内存增长:每…
Gemma:用 Gemini 的研究技术做出来的开源小模型家族
Gemma 是 Google DeepMind 在 2024 年 3 月发布的开源小模型家族(2B / 7B 两档,预训练 + 指令微调 checkpoint),把 Gemini 同源的架构、数据和训练流程按「轻量级」参数尺度重做一遍——在 18 个文本基准里 11 个超过同尺寸开源模型,并配套发了详尽的安全 / 责任…
RAG over Thinking Traces:用思维痕迹检索革新推理任务
RAG(检索增强生成)长期被认为对推理任务(数学、代码)帮助有限,这篇论文证明:限制不在 RAG 本身,而在于检索语料的选择——将思维痕迹(thinking traces,即推理过程中的中间步骤)作为检索语料,配合结构化转换方法 T³,可在不同 SOTA 模型和基准上实现持续提升,在 AIME 20252026 上相对…
卷积神经网络近期进展综述
这是 2015 年底挂出的 CNN 综述,把"现代卷积网络是怎么搭、怎么训、怎么用"拆成六个维度一次性讲清楚;它的真正价值不在某个新模型,而在把此后十年的工程经验固化成可索引的"CNN 设计手册"。 2015 年前后,CNN 已经从 AlexNet/VGG 一路狂奔到 ResNet、GoogLeNet,论文数量爆炸,新…
ChatGPT 多任务、多语言、多模态评估:推理、幻觉、交互性
这是一篇 2023 年初用 23 个公开数据集 + 自建多模态集,对 ChatGPT 做"全方位体检"的实证论文。它得出了一个让整个社区冷静下来的结论:ChatGPT 在大多数零样本任务上击败同代开源 LLM,但作为推理器不可靠——它既是后来 LLMasJudge、agent 评估体系的早期模板,也是一份警示录。 20…
Model or Harness?:给 Agent 失败打标签的"交互中心分类法"
这篇提出一个以组件之间的交互边为骨架的 Agent 失败分类法:把 41 种失败模式分别归到"模型、Harness、用户、工具、记忆、环境"六类组件两两之间的边上,并标出"故障归属在哪一侧"——归到模型侧就去后训练,归到 Harness 侧就去改 scaffolding,归到环境/打分器侧就去重做基准;4 个前沿模型作…
Wnuan:面向专有企业知识问答的三阶段后训练流水线
来源:arXiv v1(20260803,22 页 + 10 figures + Appendix A–L)+ paper card 260801862。本解读仅基于公开 abstract 与 HTML 全文,未下载 PDF、未跑代码。 Wnuan 把"让基座模型吃下企业私有知识、又尽量不丢通用能力"这件老问题,拆成了…
GradCuit:让测试时潜在推理既鲁棒又可解释的"信用分配梯度流"
GradCuit 在 Transformer 某一层中间、prompt 与生成续写之间插入可优化的潜在状态,借助 causal selfattention 让每个续写 token 的 logprob 对前面每个潜在状态都可微,从而把整段续写的 reward 加权和直接反传到潜在状态本身——既比 CoT 高 6.6 个百…
全局计算,本地落盘:稀疏 Event-KV 的记忆契约
长程 Agent 把 KV cache 当记忆用,这件事有个常被忽略的前提:被保留的事件在产生它的观测消失之后,仍然信息充足。这篇论文用"在相同历史中只少给一个早先观测"的对照实验,把这件事钉死:模型答案会跟着被省略的值走,即使没有 served span 给出该值,作者称之为 semantic materializa…
Zero-Mem:面向 LLM Agent 的零 token 记忆操作
ZeroMem 把 LLM Agent 的「结构化记忆访问」做成完全无需 LLM 调用、无 LLM 输入/输出 token 消耗的离线计算:用「实体—上下文图 + 时间层级」双视图索引原始交互痕迹,仅在最终问答时才让 LLM 上场;相比同 budget 的最强基线,记忆操作耗时再降 57.6%,同时在长记忆 / 长上下…
响亮还是沉默?面向多模态临床 AI 的可复用逐模态失效分析框架
论文提出一个与模型无关的多模态失效分析框架:在 N 个模态嵌入、maskaware 探针与标签已知的前提下,对每个样本输出一份「逐样本失效分类 + 逐模态互补性矩阵 + 响亮/沉默 dropout 画像」三件套;论文在 EchoJEPA + HuBERTECG 上做 LVEF 与 HFrEF(EF ≤ 40%)二分类,…
看见还是知道?多模态大语言模型的视觉上下文敏感性
MLLM 在视觉与语言先验冲突时翻车,不是因为没"看见"视觉证据,而是看见了却压不住语言先验。作者用图像重建 + WhatIfVis 基准 + activation patching 三件套,把瓶颈从"perception"挪到"postperceptual utilization",并给出一条可学习的视觉先验 ste…
MemSFT:用外部参数化记忆缓解对齐税
领域适配总会带来对齐税(领域任务涨分、通用任务因灾难性遗忘而暴跌)。MemSFT 把领域专业化从主干参数更新中解耦出来,用一个即插即用的参数化记忆(小模型,模仿领域检索器)承接领域知识,主干在 SFT 过程中完全不动;生成时由一个学到的 router 在每一步动态融合记忆与主干的输出分布。 把通用 LLM 适配到生物、…
增是机器,删是人工:LLM 代码编辑中「删除回避」的度量与缓解
前沿 LLM 修代码时系统性偏向「保留旧代码 + 新增补偿」,SWEbench Verified 上删除召回最高仅 71.7%,四款前沿模型在新加的「删除校验测试」上从 63.2% 暴跌到 41.9%;论文把这种「不删就加 if/fallback」的失败模式命名为 GuardandGo,并用「在 posttrainin…
机器人「先想清楚怎么动」,原来根本不用真把视频拍出来——arXiv 2608.00486 直接「读」视频模型的脑子
你有没有看过这种画面 🎬: 你给机器人展示一张杯子的照片,说「把这个杯子往左挪 5 厘米」。 现在的 SOTA 思路是——让 AI「想象」一段杯子移动的视频,然后再从视频里抠出运动轨迹,交给机械臂。 听起来很合理?但慢得让人想哭:一个视频生成 12 秒,再外挂一个 perception 模块抠运动,前后加起来2 秒——…
现在的 AI 看图搜索,总在「开头和结尾」偷看——arXiv 2608.01827 把视觉证据塞进了「推理中间」
你有没有抓狂过这种瞬间 🔍: 你问 AI "2024 年巴黎奥运开幕式上,中国队第几个入场?" 它很快甩给你一个答案——"第 40 位"。 但你不知道它是怎么知道的。 它是真的找到了开幕式画面的截图、对比了入场顺序视频、查了新华社报道,还是早就把答案"记住"在肚子里,再假装去网上走了一圈? 这就是今天所有「AI 搜索产…
DeepVoyager-VL · 视觉证据前移
date: 20260805 round: R2 arxiv: source: /shared/videokb/scripts/tom/20260805_R2_deepvoyagervlvisioninloopsearchshortvideoscript.md title: DeepVoyagerVL · 视觉证据前移…
冻结像素扩散模型的自我引导:合成自引导 SSG
冻结的预训练像素扩散 Transformer 可以用自身采样做"中间层 vs 末端层"差异的自我引导(Synthetic SelfGuidance, SSG),无需再训主干、无 classifierfree guidance 即可让 FID 减半,再叠 CFG 还能继续掉 0.1~0.2。 像素空间扩散(pixel d…
RecHarness:用 Bandit 路由让推荐系统自我演化
RecHarness 把 LLMAgent 自动优化推荐模型这件事拆成"Bandit 路由选方向 + LLM 生成具体修改代码"两步,配合 jumpbasin 跳出局部停滞机制,在线上短视频广告 7 天 A/B 测试中把 ADVV 提 2.084%、Revenue 提 0.534%、Exposure 提 0.559%。…
ReBA:视觉-语言 MoE 的几何引导负载均衡
标准 Switch 辅助损失(StdAux)在视觉语言 MoE 中只平衡"混合负载",导致大图像/文本负载误差会在某些 token 混合点相互抵消。ReBA(Relax Within, Balance Across)通过模态分项 + 单图等权路由,把负载不均衡压到所有评测输入上更低,且不牺牲任务精度。 VLMoE 的一…
DreamTraj:通过读取未渲染的视频扩散潜在生成 6-DoF 物体轨迹
DreamTraj 提出了"读潜在(readlatent)"新范式:给定单张 RGB 图与一条任务指令,不生成视频、不调用深度/CAD,而是从冻结的 imagetovideo 扩散模型早期去噪步的内部表征里,由一个轻量 flowmatching Reader 直接解出物体 6DoF 相对轨迹;在翻译与旋转两项上都刷新 …
DeepVoyager-VL:激励视觉在环的搜索以应对长程多模态 Agent
DeepVoyagerVL 把"视觉证据"从多模态搜索 Agent 的输入/输出端位置前移到中间推理环节,构造了一个面向长程、多轮、视觉驱动的 deepsearch 框架:用多模态事件图合成数据、用专门的 agent 框架做主动视觉获取与按需图像加载、无需 RL 即可在 10 个多模态搜索基准上拿到稳定提升。 多模态大…
GPTQ-2D:把双侧自适应舍入从 O(n⁴) 砸到 O(n³) 的同解算法
GPTQ2D 是对 GPTQ / Babai 最近平面算法的"双侧推广版",输出与朴素 Kronecker 还原法完全相同的舍入矩阵,但把时间复杂度从矩阵维度的四次方降到三次方——核心做法是不再"沿某一固定坐标轴逐元素 round",而是"沿反对角线逐线 round",同一反对角线上的元素彼此独立,可并行。 LLM 权…
基于影响匹配的数据集蒸馏
InfMatch 提出一种结果对齐视角的数据集蒸馏方法:不再对齐训练轨迹或逐步梯度,而是直接学习一个合成集合,使其对模型收敛后参数的影响与全量真实数据一致;用一个线性时间、可微、样本级的影响估计器避免逆 Hessian 与凸性假设,在分类与视觉语言蒸馏任务上同时刷新 SOTA。 数据集蒸馏(Dataset Distil…
Scaling Native Multimodal Pre-Training From Scratch:给原生多模态预训练画一张「算力地图」
这是一篇把「原生多模态预训练」(Native Multimodal Pretraining) 当作一门可以系统研究 scaling law 的工程学科,并第一次给出可直接用于「模型规模 / Token 数量 / 数据配比」联合决策的「效率前沿」(efficiency frontier) 的实证工作。它回答的不是「要不要…
Teachy Mini:面向高等教育的知识驱动生成式社交机器人开发与初步评估
把"知识驱动设计(KnowledgeBased Design, KBD)"这一组信息先决条件,通过 system prompting、检索增强生成(RAG)和有状态的 prompt 编排落地到 Reachy Mini 机器人平台上,做出 Teachy Mini 这一生成式社交机器人(GSR)辅导系统;与不遵循 KBD …
用于生成建模的三体散射(Three-Body Scattering for Generative Modeling)
TBSM 将物理「三体散射」思想引入生成建模,用一个真实样本吸引、一个生成样本排斥的恒定规模交互替代传统 GAN 的对抗 Critic 或扩散的完整噪声路径,在单步生成(NFE=1)下实现 SOTA FID。 现代生成模型有三条主流技术路线,各有瓶颈: TBSM 提出的核心问题是:能否找到一种监督信号,既能给出样本级(…