解读
1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
高效鲁棒的近似最近邻搜索:层次可导航小世界图(HNSW)
HNSW 通过多层可导航小世界图实现对数级查询复杂度,在高召回率场景下大幅超越纯向量索引 SOTA,是现代向量数据库(Milvus、Pinecone、FAISS 等)的底层核心算法。 近似最近邻搜索(Approximate KNearest Neighbor,AKNN)是向量检索的核心问题:在 d 维向量空间中,给定查…
机器学习数据收集综述:从大数据与 AI 集成视角
这篇综述第一次把"机器学习中的数据收集"放在数据管理(database / data management)视角下系统化,把它拆成数据获取(Data Acquisition)、数据标注(Data Labeling)、已有数据/模型的改进(Data/Model Improvement)三大阶段,给出了每个阶段的 rese…
计算机视觉中的 GAN 综述与分类学
这篇 2019 年的综述以「高质量生成、多样性、稳定训练」三大约束为视角,把 2019 年之前 GAN 在视觉方向上的架构变体与损失变体系统归类,并给出可执行的开源代码索引,后续被广引为「GAN in CV」事实基线。即便 Diffusion、Transformer 等新生成范式成为主流,这篇综述依然是理解 GAN 思…
用 AI 与言语/语言处理监测阿尔茨海默病:一项系统综述
本综述以 PROSPERO 注册的系统综述方法,从 3654 篇初筛文献里筛出 51 项原创研究,系统性地把过去 20 年间「用 AI 处理语音和语言来预测和监测阿尔茨海默病 (AD) 认知衰退」的研究方法、数据、可复现性与临床可应用性整理成四张对照表;其核心结论不是某项算法胜出,而是指出该领域三大系统性短板——研究标…
AntiSkillBench:Persona Skill 把"你"打包给下游 Agent 时的隐私与冒充风险
AntiSkillBench 是第一个端到端评测"persona skill 流水线"(把个人交互历史提炼成可执行 skill 包、再喂给下游 Agent)隐私与冒充风险的基准:含 7500 条 personagrounded 对话、覆盖 50 个行为丰富的人物 profile、3 种 skill 蒸馏策略、4 类防御…
Quo Vadis, World Modeling? — 把世界建模从「物理状态预测」重构为「以 Agent 为中心的交互式世界代理」
这篇工作把"世界模型(World Model)"从以"预测未来物理状态"为主的狭义范式,扩展为"以 Agent 为中心的交互式世界代理(AgentCentric Interactive World Proxies)":世界建模不再只回答"下一步像素/状态长什么样",而是回答"我现在这个动作,能不能产生对 Agent 有…
PAST-Bench — 给"个人 AI Agent 的递归自我改进"做严格基准与诊断
PASTBench(Personal Agent Selfimprovement TestBench)是一个专门用来回答「保留经验是否真的让 personal AI agent 变好」的基准:它把"经验开启/关闭"做对照实验,用 26 个场景、204 个 episode,横跨 memory、procedural reu…
Video-DeepResearch — 把多模态深度研究 Agent 从静态图像推到连续视频流
VideoDeepResearch(VideoDR)把 multimodal agent 从"对单张静态图像做检索增强推理"推到"对连续视频流做稠密时空 grounding + 开放网络探索"的设置;通过解耦的 perception–exploration pipeline + 阶段性工具解锁强制 agent 先把视觉…
Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
通过将行为知识与任务几何解耦为独立参数集,KGD 让预训练推荐模型在流式更新时无需从头重训,即可将可迁移知识持续刷新,兼顾行为分布漂移下的知识保鲜与下游任务适配。 工业级推荐系统越来越多采用 pretrainthentransfer 范式:先在大规模行为序列上预训练,再将预训练模型迁移到下游任务(如 CTR 预估、排序…
ExplainBench:把"代码解释的可信度"也变成可量化指标
ExplainBench 提出"用 LLM 答多选题"来反推解释的可信度,首次把"软件工程 agent 写出来的解释到底可不可信"变成可量化、可对比、可迭代优化的指标;并基于此引入 ExplanationAuditAgent,对任意 agent 的解释做差分测试审计,实验显示它能普遍提升所有被测 agent 的解释质量…
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
STWAM 通过 DINOv3 语义表征替代传统 VAE 潜在空间进行未来预测,并引入 DualSpace Future Experts 同时保留细粒度 VAE 动态,诊断并解决了 World Action Model 在视觉分布漂移下的"训练分布幻觉"(TrainingDistribution Hallucinati…
Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories
PushWiper 将高粘度污渍清洁重新定义为"聚合分离"问题,用海绵通过分段推动轨迹逐步聚集污渍,再统一分离回收,Cleaning Score(CS)最高达 baseline 的 230%(提升 130%),并可在零样本条件下迁移到未见过的污渍和曲面。 机器人表面清洁长期面临两大流派的选择困境: Stage 1: 分…
Med-PaLM 2:用大语言模型冲击医师级医学问答
MedPaLM 2 通过「更强基座 PaLM 2 + 医学领域微调 + 新提出的 ensemble refinement 提示策略」,在 MedQA (USMLE 风格) 上拿到 86.5%,比初代 MedPaLM 提升 19 个百分点以上,并在多项临床相关评测中达到或逼近 SOTA;更重要的是,在 1066 道消费者…
Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints
WAIT 与 Nested WAIT 调度策略将 LLM 推理的 KVcache 内存约束建模为在线调度问题,通过流体力学模型推导稳定区域边界,在接近过载和过载区间显著降低延迟并扩大安全运行范围。 LLM 推理服务每日成本高达百万美元级别,GPU 调度是延迟、吞吐量与成本的核心瓶颈。问题的本质困难在于内生性内存增长:每…
Gemma:用 Gemini 的研究技术做出来的开源小模型家族
Gemma 是 Google DeepMind 在 2024 年 3 月发布的开源小模型家族(2B / 7B 两档,预训练 + 指令微调 checkpoint),把 Gemini 同源的架构、数据和训练流程按「轻量级」参数尺度重做一遍——在 18 个文本基准里 11 个超过同尺寸开源模型,并配套发了详尽的安全 / 责任…
RAG over Thinking Traces:用思维痕迹检索革新推理任务
RAG(检索增强生成)长期被认为对推理任务(数学、代码)帮助有限,这篇论文证明:限制不在 RAG 本身,而在于检索语料的选择——将思维痕迹(thinking traces,即推理过程中的中间步骤)作为检索语料,配合结构化转换方法 T³,可在不同 SOTA 模型和基准上实现持续提升,在 AIME 20252026 上相对…
卷积神经网络近期进展综述
这是 2015 年底挂出的 CNN 综述,把"现代卷积网络是怎么搭、怎么训、怎么用"拆成六个维度一次性讲清楚;它的真正价值不在某个新模型,而在把此后十年的工程经验固化成可索引的"CNN 设计手册"。 2015 年前后,CNN 已经从 AlexNet/VGG 一路狂奔到 ResNet、GoogLeNet,论文数量爆炸,新…
ChatGPT 多任务、多语言、多模态评估:推理、幻觉、交互性
这是一篇 2023 年初用 23 个公开数据集 + 自建多模态集,对 ChatGPT 做"全方位体检"的实证论文。它得出了一个让整个社区冷静下来的结论:ChatGPT 在大多数零样本任务上击败同代开源 LLM,但作为推理器不可靠——它既是后来 LLMasJudge、agent 评估体系的早期模板,也是一份警示录。 20…
Model or Harness?:给 Agent 失败打标签的"交互中心分类法"
这篇提出一个以组件之间的交互边为骨架的 Agent 失败分类法:把 41 种失败模式分别归到"模型、Harness、用户、工具、记忆、环境"六类组件两两之间的边上,并标出"故障归属在哪一侧"——归到模型侧就去后训练,归到 Harness 侧就去改 scaffolding,归到环境/打分器侧就去重做基准;4 个前沿模型作…
Wnuan:面向专有企业知识问答的三阶段后训练流水线
来源:arXiv v1(20260803,22 页 + 10 figures + Appendix A–L)+ paper card 260801862。本解读仅基于公开 abstract 与 HTML 全文,未下载 PDF、未跑代码。 Wnuan 把"让基座模型吃下企业私有知识、又尽量不丢通用能力"这件老问题,拆成了…
GradCuit:让测试时潜在推理既鲁棒又可解释的"信用分配梯度流"
GradCuit 在 Transformer 某一层中间、prompt 与生成续写之间插入可优化的潜在状态,借助 causal selfattention 让每个续写 token 的 logprob 对前面每个潜在状态都可微,从而把整段续写的 reward 加权和直接反传到潜在状态本身——既比 CoT 高 6.6 个百…
全局计算,本地落盘:稀疏 Event-KV 的记忆契约
长程 Agent 把 KV cache 当记忆用,这件事有个常被忽略的前提:被保留的事件在产生它的观测消失之后,仍然信息充足。这篇论文用"在相同历史中只少给一个早先观测"的对照实验,把这件事钉死:模型答案会跟着被省略的值走,即使没有 served span 给出该值,作者称之为 semantic materializa…
Zero-Mem:面向 LLM Agent 的零 token 记忆操作
ZeroMem 把 LLM Agent 的「结构化记忆访问」做成完全无需 LLM 调用、无 LLM 输入/输出 token 消耗的离线计算:用「实体—上下文图 + 时间层级」双视图索引原始交互痕迹,仅在最终问答时才让 LLM 上场;相比同 budget 的最强基线,记忆操作耗时再降 57.6%,同时在长记忆 / 长上下…
响亮还是沉默?面向多模态临床 AI 的可复用逐模态失效分析框架
论文提出一个与模型无关的多模态失效分析框架:在 N 个模态嵌入、maskaware 探针与标签已知的前提下,对每个样本输出一份「逐样本失效分类 + 逐模态互补性矩阵 + 响亮/沉默 dropout 画像」三件套;论文在 EchoJEPA + HuBERTECG 上做 LVEF 与 HFrEF(EF ≤ 40%)二分类,…
看见还是知道?多模态大语言模型的视觉上下文敏感性
MLLM 在视觉与语言先验冲突时翻车,不是因为没"看见"视觉证据,而是看见了却压不住语言先验。作者用图像重建 + WhatIfVis 基准 + activation patching 三件套,把瓶颈从"perception"挪到"postperceptual utilization",并给出一条可学习的视觉先验 ste…
MemSFT:用外部参数化记忆缓解对齐税
领域适配总会带来对齐税(领域任务涨分、通用任务因灾难性遗忘而暴跌)。MemSFT 把领域专业化从主干参数更新中解耦出来,用一个即插即用的参数化记忆(小模型,模仿领域检索器)承接领域知识,主干在 SFT 过程中完全不动;生成时由一个学到的 router 在每一步动态融合记忆与主干的输出分布。 把通用 LLM 适配到生物、…
增是机器,删是人工:LLM 代码编辑中「删除回避」的度量与缓解
前沿 LLM 修代码时系统性偏向「保留旧代码 + 新增补偿」,SWEbench Verified 上删除召回最高仅 71.7%,四款前沿模型在新加的「删除校验测试」上从 63.2% 暴跌到 41.9%;论文把这种「不删就加 if/fallback」的失败模式命名为 GuardandGo,并用「在 posttrainin…
冻结像素扩散模型的自我引导:合成自引导 SSG
冻结的预训练像素扩散 Transformer 可以用自身采样做"中间层 vs 末端层"差异的自我引导(Synthetic SelfGuidance, SSG),无需再训主干、无 classifierfree guidance 即可让 FID 减半,再叠 CFG 还能继续掉 0.1~0.2。 像素空间扩散(pixel d…
RecHarness:用 Bandit 路由让推荐系统自我演化
RecHarness 把 LLMAgent 自动优化推荐模型这件事拆成"Bandit 路由选方向 + LLM 生成具体修改代码"两步,配合 jumpbasin 跳出局部停滞机制,在线上短视频广告 7 天 A/B 测试中把 ADVV 提 2.084%、Revenue 提 0.534%、Exposure 提 0.559%。…
ReBA:视觉-语言 MoE 的几何引导负载均衡
标准 Switch 辅助损失(StdAux)在视觉语言 MoE 中只平衡"混合负载",导致大图像/文本负载误差会在某些 token 混合点相互抵消。ReBA(Relax Within, Balance Across)通过模态分项 + 单图等权路由,把负载不均衡压到所有评测输入上更低,且不牺牲任务精度。 VLMoE 的一…