解读
1530 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
ChatGPT 自己「主动去查 Google」之前一年,已经有一篇论文让 AI「自己教自己用计算器」——为什么 Toolformer 是 Agent 时代的「地基」
你有没有想过 🤔: 今天的 ChatGPT、Claude、Gemini,主动帮你查实时天气、调计算器算 17×23、打开数据库跑 SQL,这件事看起来理所当然—— 但它们都是「主动」调用的,不是你一步一步指挥的。 让 AI 学会「自己决定什么时候该用工具、该用哪个工具、参数怎么填」——这件事真正被一篇论文工程化地跑通,…
StudioRecon:低重叠稀疏相机下的 4D 人体场景重建
StudioRecon 将背景与人体的三维表示解耦,通过视频扩散模型合成数百个可控视角的新视角图像来增强背景监督,并结合跨视角身份关联和多视角关键点三角化,实现仅用 4~N 台稀疏低重叠相机完成 SOTA 质量的 4D 人体场景重建。 当前高保真动态人体捕捉依赖密集相机阵列(数十到数百台),在影棚级专业环境中效果出色。…
自然图像对比学习的一种理论
在平稳统计自然图像与若干基本增广下,对比损失的全局最优表示可以用一类结构高度受限的 CNN 精确逼近——第一层滤波器是正弦函数,再接逐点非线性、全局平均池化(GAP)与做"部分白化"的线性层;正弦频率与权重由数据集期望功率谱经一次 waterfilling 算法直接算出。 对比学习(SimCLR、MoCo、BYOL、B…
MedPMC:面向基础模型的高保真医学多模态数据规模化系统框架
MedPMC 给出一套自动化、可持续更新的流水线,把 610 万篇 PubMed Central(PMC)宽松许可文献中的图表文本对,加工成 1100 万条高保真医学图像文本配对;用这套数据训练的 CLIP 风格模型在 26 个跨 11 个专科的基准上,平均 zeroshot AUC 比同架构最强生物医学 CLIP 基…
STRACE:从噪声轨迹到根因——长周期 Agent 优化的结构化轨迹分析与因果抽取
STRACE(Structural TRajectory Analysis and Causal Extraction)是一个为长周期 LLM Agent 的"反思式优化"构建高信噪比优化上下文的框架:在 batch 层用失败模式挖掘去冗余、在单条轨迹内用文本依赖图上的因果定位去噪声,让 LLM 优化器只看到"真正导致…
RoboDojo:面向通用机器人操作策略综合评估的仿真-真机统一基准
RoboDojo 是首个将仿真与真机评估深度整合的统一 Benchmark,覆盖 42 个仿真任务和 18 个真机任务,从泛化性、记忆、精度、长 horizon 执行和开放词汇指令遵循五个维度系统评估通用机器人操作策略,并集成 30 种策略建立公开排行榜。 通用机器人操作策略(Generalist Robot Mani…
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
Visual Generator 在面对训练知识边界外的请求时,会系统性捏造不存在的内容;现有 SOTA 模型在真实长尾场景中得分仅 21–28 分(百分制),而现有 Benchmark 完全测不出这个 40 分的断层——解决路径不是简单加搜索,而是要先教会模型识别"我不懂什么"。 用户对图像生成模型的请求是无界、演化…
科研图像多模态理解:从 ALD/E-ImageMiner 到通用科学 AI 的路径图
2608.14075 给科学图像多模态理解(multimodal comprehension of scientific images)立了一个带 1,951 张图 + 205 篇论文的人工标注 benchmark —— ALD/EImageMiner,并配套 ICDAR 2026 Competition 把任务拆成四…
LittleLearner:用小学课程约束预训练语料,做可解释的知识获取沙盒
2608.13545 给出一个「用美国小学课程严格界定预训练语料范围」的实验性 LLM 训练沙盒:从 88B token 的 LITTLECURRICULUM(只覆盖 5 年级以下知识)训练出 5B 参数 LITTLELEARNER,让研究者能在一个"知识边界可解释"的受控环境里研究模型如何获取 / 表达 / 使用知识…
Mimir v1:1B 参数 + HRM 架构 + 仅 Permissible 数据,开放开源也能打前沿
丹麦基金会模型(DFM)团队在 2608.13517 里用「HRM(Hierarchical Reasoning Model,分层推理模型)架构 + 仅 permissible(合规许可)数据集」这两条约束同时压死,在 1B 参数规模上对英语 20 项 benchmark 与 Qwen 3.5 4B / Gemma 4…
S²VOPD:把"加给 teacher 的特权信息"反过来"减自 student",换来免费的蒸馏信号
提出 S²VOPD(SelfSupervised Visual OnPolicy Distillation):把 onpolicy 蒸馏里"teacher 比 student 知道得多"这件事反过来——teacher 拿到原图,student 拿到强增强图——仅靠这种"看不同视图"的不对称就构造出 onpolicy 的…
UNMASK:把文本分类器里的虚假相关"自动化发现 + 因果验证 + 拿来修模型"一气呵成
提出 UNMASK:一条全自动化 pipeline,无需人工标注,把文本分类器里的虚假相关(spurious correlation)从"发现 → 因果验证 → 模型修复"三步串成闭环。在 BERT/RoBERTa + MNLI 上重新发现已有文献已知的 lexicaloverlap / negation bias,并…
SimpleOPD:把长上下文推理能力蒸馏给短上下文学生时,tokenizer 不再是绊脚石
提出 SimpleOPD —— 一种与 tokenizer 解耦的长上下文→短上下文 onpolicy 蒸馏方案,通过"共享文本空间 + 仅对齐同 span token"解决 tokenizer mismatch、通过"学生参考 KL + 终止 token advantage 屏蔽"压住 response 长度爆炸与训…
法律 RAG 系统还会幻觉多少?一个跨 8 系统、2 语料、3 评估粒度的实证解剖
法律领域 RAG 仍然普遍幻觉:8 个系统在 GDPR(英)和一部国家民法(法)上做细粒度评估,最好的系统幻觉率低于 10%,最差的接近一半;其中"假前提问题"(含错误假设、需被拒绝)几乎注定高幻觉,独立验证的 142 题法律专家出题再次复现这一模式。 法律 RAG 把生成式 LLM 接到法规/判例库上,本来是降低执业…
CPI-Bench:把图像编辑评测从"单图玩具题"推到"真实场景生产力"
CPIBench 把图像编辑评测拆成三个子基准(General / Practical / Intelligent),首次引入多图编辑与强推理编辑,并在 Arena Image Edit Leaderboard 上验证了排名一致性——是目前对真实场景最有区分度的图像编辑评测集合。 图像编辑模型(image editin…
UniProbe:把 LVLM 幻觉检测从"单点特征"做到"结构化内部表征"的 token 级探针
UniProbe 是 NVIDIA 提出的轻量级可学习 token 级 LVLM 幻觉检测器:冻结 LVLM 主体,用一次前向传播的异构计算轨迹构造"图几何序列"三模态内部表征,交替用 GNN / ViT / GRU 处理,在多个 LVLM 骨干上达到 SOTA,并在解码时把物体幻觉减少至多 55%,延迟仅 1.06×…
Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation
Clinical RAG 可以通过所有现有自动化评测(零幻觉、完美 faithfulness、真引用),但同时把 Drug Y 的临床证据错误地归属到 Drug X 上——这种"欺骗性 Grounding"在真实部署中影响了 7.8% 的回答,在新批准药物场景下达 13.6%,而现有框架没有一个能检测出来。 RAG 系…
用 LLM 增强基本面分析:基于 RAG 的投资者简报生成系统
本文是一篇偏实证/工程的工作:把 gpt4o 当生成器、把 EDGAR(SEC 文件)+ 公司报告 + 宏观数据(GDP、CPI)当检索库,搭一套类 RAG 流水线,对 9 家公司连续 4 周生成自动投资者简报,再由 9 位个人投资者评估有用性——结论是这类系统在个人投资决策辅助上具备实用价值,但仍依赖领域知识模板(如…
aria:面向端侧语义音频生成的量化原生运行时
本文给出 aria——一个零依赖的原生(C/C++ 级,无 Python、无深度学习框架)运行时,把 Stable Audio 3(SA3,约 1.2B 参数)整套文生音乐流水线跑在普通 GPU、纯 CPU、甚至 8GB 内存的树莓派 5 上。关键贡献是精度量化研究:8bit 无任何可测质量损失;4bit 有界小损失,…
视频选题榜 · 2026-08-17
v2 重写覆盖(承接 20260817 反思棒 §5 "最弱单篇"识别 · 覆盖原 v1 = 357 字节 / 4 行 / 2 entries) 触发:20260817 21:40 CST 反思棒明确把 817 selection 列为 7 天最弱单篇 v1 4 重塌方识别: 1. 形式塌方:4 行 357B 单层列表…
Karpathy 2014 用"碎片级对齐"奠定图文匹配"可解释"范式
你有没有试过,让一个 AI 系统去匹配"一只黑狗跑过绿草"和一张图片,然后反问它:"你为什么觉得这张图和这句话匹配?"? 十年前的 AI 主流答案是:"我不知道,模型说匹配就匹配"。 arXiv 1406.5679(Karpathy & FeiFei 2014 年的 Deep Fragment Embeddings f…
Forecast Collapse:当时间序列基础模型在金融上"塌方"
Forecast Collapse 是一组"看似正常预测实则无效"的现象在做 1000 只美股的逐时收益预测时,TimeSeries Foundation Models(TSFMs)和 12 个传统深度学习预测模型普遍给出接近平的预测结果,横截面相关性接近零;本文溯源到 calibrationranking trade…
MobileMem:一年移动使用经验之上的端侧长记忆基准
MobileMem 是浙江大学 / OpenKG 团队发布的端侧长记忆 benchmark 与框架,把"一年时长的移动端用户使用轨迹"通过知识驱动的合成流水线变成可评测的多模态长程任务,覆盖多跳推理、时序推理、知识更新、隐式偏好推断四类问题;目标是把 agent 从"答孤立问题"逼到"记住过去、理解当下、面向未来",把…
MMDiff:多模态大模型的特征级"差异审计"与可控干预
MMDiff 把稀疏自编码器(SAE)从纯文本 LLM 解释工具拓展为多模态 LLM 的"特征级接口",通过对比 baseLM SAE 与多模态适配后 SAE 的差异,定位、验证并主动控制由多模态训练引入的视觉相关特征;在 LLaVAMORE、PaliGemma 2、InternVL3.5 三个 MLLM 家族上,移除…
主题综述 · llm-infra(2026-08-14 · v2 重写版)
重写说明:v1 版四项硬约束同时失守(1) CJK 超字数上限;(2) 私域话术 22 处;(3) 定时调度物理动作直接写入取题说明;(4) 团队内部分工与版本号内部路径直接出现在正文。v2 全面修正,详见末尾"字数与文件元数据"段。 812 → 814 三天窗口 llminfra 主分类 paper_cards 净增…
主题综述 · database(2026-08-17)
20260813 的 database 综述以 Transactional Continuity Kernel(arXiv:2608.11632)+ Cordon(arXiv:2606.17573)+ ElephantAgent(arXiv:2607.01919)+ CockroachDB 三层架构为锚,标志 8 月中…
LOPD:让"特权上下文"自己长出来——面向自演化 Agent 的潜在 On-Policy 自蒸馏
LOPD(Latent OnPolicy SelfDistillation)把 onpolicy 自蒸馏中"teacher 用什么特权上下文"这个核心设计选择从人工指定改为端到端可学习:teacher 端通过检索历史经验拼成连续 latent tokens 作为特权上下文,student 端在自己的轨迹每个 visit…
PRM-as-a-Judge 1.5:机器人过程评估工具箱
PRMasaJudge 1.5 把机器人 rollout 视频转成 dense progress curve,用三条失败/恢复/质量指标 + RoboPulse++ 可靠性测试,把"模型能不能干成事"从二元成功率升级成"怎么失败、能不能救回来、有没有真本事"的三维诊断学。 机器人评估长期被两条锁链拴住: 1. 二元 s…
Second Thought:在 LLM Agent 主循环空闲窗口里并行推理
Second Thought 是一个"训练free 的推理框架",在 ReAct 风格的 LLM Agent 主循环里,主线程一边发出 Action 并等待环境 Observation、一边在后台 fork 出四条辅助推理分支解码当前 Turn 的"下一手 Thought",等 Observation 到达时再 mer…
「AI 为什么这么判」到底是不是一个好问题——一篇被引 5400 次的位置论文,给整个可解释机器学习领域立了规矩
你有没有想过 🤔: 当银行用 AI 拒绝你的贷款申请,它告诉你「因为你的年龄和职业」,这个解释是真的吗? 当医院用 AI 诊断你的 CT 影像,它圈出「这块组织有 90% 概率是肿瘤」,医生敢不敢真的相信? 当 ChatGPT 给你写一段话,你问「你为什么这么说」,它答「根据 X 论文……」,这个回答是不是套话? 所有…