解读
1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Code Llama: Open Foundation Models for Code
Code Llama 是基于 Llama 2 构建的代码大模型家族,在开源模型中刷新 SOTA,支持代码补全、代码填充(infilling)、长上下文(100k tokens)和指令跟随,7B 参数版本即可超越参数量大 10 倍的通用模型。 2023 年下半年,开源代码模型普遍落后于闭源 GPT4/ChatGPT,且存…
Beyond the Imitation Game: BIG-bench——把 LLM 的能力与局限画成一张可外推的地图
BIGbench 用 204 个任务、横跨模型规模从百万到千亿参数的系统性评测,回答了一个根本问题:语言模型的能力到底能不能随规模"涌现",哪些任务真的会"跳变",哪些只是平缓爬升。结论是:性能与校准都随规模提升,但绝对水平在大多数任务上仍然很差,且可预测性远好于大家以为的"涌现神话"。 2021 年 GPT3 之后,…
GPT-4 在医学挑战题上的能力评估:当通用 LLM 超过医学专才
微软研究院团队用 USMLE 官方练习题与 MultiMedQA 基准系统评估 GPT4,证明未经任何医学专门微调的通用大模型,以零样本提示即可在 USMLE 上超过及格线 20 分以上,并击败针对医学知识专门微调的 MedPaLM,更关键的是置信度校准显著优于 GPT3.5——这是一次"通用智能 领域专才"的标志性实…
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMemVLA 把历史经验统一编码进 VLA 的连续潜空间,把"短期/长期双库记忆 → 检索 → 压缩 → 编织进当前推理流"做成一个端到端框架,让长时序、强时间依赖的操作任务能在固定上下文内完成。 主流 VisionLanguageAction(VLA)模型在预测动作时基本沿用 Markov 假设——只看当前 ob…
Soofi S 30B-A3B:主权开源的德英混合 Mamba-Transformer 基础模型
Soofi S 30BA3B 是一个 30B 总参 / 3B 激活参的 MoE 混合 MambaTransformer 德英双语基础模型,预训练约 27T token,推理时上下文增长几乎不涨 KV cache,主打"主权 + 长上下文 + 高并发"的开源部署场景,并在 17 个开源基线中拿下最佳代码分和欧洲主权模型第…
CtrlVTON:把虚拟试穿从"贴图"变成"可控编辑"
CtrlVTON 把虚拟试穿(VTO)从"把衣服贴到人身上"重构为带分割掩码作为像素级控制信号的图像编辑问题,配合一个新任务 VIPSeg 与新模型 VIPSAM,让用户第一次能真正指定衣服的松紧、穿法(塞 / 不塞、开 / 合)与在身体上的空间位置,并在布局忠实度上超过最强的商用编辑系统。 过去几年的 VTO 已经能…
深度强化学习评估与设计范式的原理性分析:当"更好"未必更好
这是一篇 AAAI 2026 的元分析(metaanalysis)论文:在理论上证明 深度强化学习算法的渐近性能排名与数据规模之间不存在单调关系,并通过大规模实验证实——过去一整支 DRL 研究线在经典设计与评估范式下得到的结论是错的。论文给出 DRL 领域关于 scaling、容量、复杂性的核心分析框架。 DRL 领…
AgentKGV: 面向知识图谱事实核查的智能体 LLM-RAG 框架与两阶段训练
AgentKGV 通过动态路由 + 迭代查询改写 + 两阶段(蒸馏 SFT + 轨迹级 GRPO)训练,让小模型也能准确核查工业级知识图谱三元组,并将检索调用次数降低近一半。 知识图谱(Knowledge Graph)大规模自动构建后,往往包含大量错误三元组——来源嘈杂、NLP 抽取失败、句子歧义都会引入虚假事实。工业…
PanoWorld:全向世界模型的长程记忆与轨迹控制
PanoWorld 利用 360° 全景表示的旋转等变性(rotationequivariant),将相机轨迹简化为固定朝向的平移,通过 DPRC(稠密全景射线条件)与 GMA(几何感知记忆增强)模块解决全景世界模型中的长程记忆与物理一致性问题。 世界模型(World Model)是机器人在真实环境中做规划和模拟的基础…
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
VLM 在误导性图表面前容易"被视觉欺骗所骗"——将倒置坐标轴、截断数据、异常视觉结构误读为正常;ChartCynics 用"怀疑式推理"双路径范式将感知与验证解耦,在 Qwen3VL8B 基础上提升约 29%,在两个 Benchmark 上分别达到 74.43% 和 64.55%,超越所有专有 SOTA 模型。 Ch…
你的 AI 旅行 Agent 会为你预订一场斗牛:面向前沿 AI 模型隐式动物福利的 Agent 评测基准
TAC(TAC) 是首个面向 Agent 场景的隐式动物福利评估基准,通过 52 个测试场景(覆盖 6 类动物)发现主流前沿模型在旅行预订任务中系统性倾向选择有害选项,加入伦理身份提示词后福利率从 32% 跃升至 80%,揭示了 LLM 在 Agentic 设置下价值对齐的新挑战。 先前研究已通过问答 Benchmar…
RESOURCE2SKILL:从人类创建的多模态资源中蒸馏可执行 Agent 技能
RESOURCE2SKILL 提出将教程视频、代码仓库、文章和参考制品等人类多模态资源,通过统一的蒸馏框架转化为软件 Agent 的可执行技能,构建为层次化多模态 Skill Wiki,在 7 个实际创作领域平均提升 11.9 个百分点,显著优于强基线方法。 当前软件 Agent 的技能库(Skill Library …
StudioRecon:低重叠稀疏相机下的 4D 人体场景重建
StudioRecon 将背景与人体的三维表示解耦,通过视频扩散模型合成数百个可控视角的新视角图像来增强背景监督,并结合跨视角身份关联和多视角关键点三角化,实现仅用 4~N 台稀疏低重叠相机完成 SOTA 质量的 4D 人体场景重建。 当前高保真动态人体捕捉依赖密集相机阵列(数十到数百台),在影棚级专业环境中效果出色。…
自然图像对比学习的一种理论
在平稳统计自然图像与若干基本增广下,对比损失的全局最优表示可以用一类结构高度受限的 CNN 精确逼近——第一层滤波器是正弦函数,再接逐点非线性、全局平均池化(GAP)与做"部分白化"的线性层;正弦频率与权重由数据集期望功率谱经一次 waterfilling 算法直接算出。 对比学习(SimCLR、MoCo、BYOL、B…
MedPMC:面向基础模型的高保真医学多模态数据规模化系统框架
MedPMC 给出一套自动化、可持续更新的流水线,把 610 万篇 PubMed Central(PMC)宽松许可文献中的图表文本对,加工成 1100 万条高保真医学图像文本配对;用这套数据训练的 CLIP 风格模型在 26 个跨 11 个专科的基准上,平均 zeroshot AUC 比同架构最强生物医学 CLIP 基…
STRACE:从噪声轨迹到根因——长周期 Agent 优化的结构化轨迹分析与因果抽取
STRACE(Structural TRajectory Analysis and Causal Extraction)是一个为长周期 LLM Agent 的"反思式优化"构建高信噪比优化上下文的框架:在 batch 层用失败模式挖掘去冗余、在单条轨迹内用文本依赖图上的因果定位去噪声,让 LLM 优化器只看到"真正导致…
RoboDojo:面向通用机器人操作策略综合评估的仿真-真机统一基准
RoboDojo 是首个将仿真与真机评估深度整合的统一 Benchmark,覆盖 42 个仿真任务和 18 个真机任务,从泛化性、记忆、精度、长 horizon 执行和开放词汇指令遵循五个维度系统评估通用机器人操作策略,并集成 30 种策略建立公开排行榜。 通用机器人操作策略(Generalist Robot Mani…
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
Visual Generator 在面对训练知识边界外的请求时,会系统性捏造不存在的内容;现有 SOTA 模型在真实长尾场景中得分仅 21–28 分(百分制),而现有 Benchmark 完全测不出这个 40 分的断层——解决路径不是简单加搜索,而是要先教会模型识别"我不懂什么"。 用户对图像生成模型的请求是无界、演化…
科研图像多模态理解:从 ALD/E-ImageMiner 到通用科学 AI 的路径图
2608.14075 给科学图像多模态理解(multimodal comprehension of scientific images)立了一个带 1,951 张图 + 205 篇论文的人工标注 benchmark —— ALD/EImageMiner,并配套 ICDAR 2026 Competition 把任务拆成四…
LittleLearner:用小学课程约束预训练语料,做可解释的知识获取沙盒
2608.13545 给出一个「用美国小学课程严格界定预训练语料范围」的实验性 LLM 训练沙盒:从 88B token 的 LITTLECURRICULUM(只覆盖 5 年级以下知识)训练出 5B 参数 LITTLELEARNER,让研究者能在一个"知识边界可解释"的受控环境里研究模型如何获取 / 表达 / 使用知识…
Mimir v1:1B 参数 + HRM 架构 + 仅 Permissible 数据,开放开源也能打前沿
丹麦基金会模型(DFM)团队在 2608.13517 里用「HRM(Hierarchical Reasoning Model,分层推理模型)架构 + 仅 permissible(合规许可)数据集」这两条约束同时压死,在 1B 参数规模上对英语 20 项 benchmark 与 Qwen 3.5 4B / Gemma 4…
S²VOPD:把"加给 teacher 的特权信息"反过来"减自 student",换来免费的蒸馏信号
提出 S²VOPD(SelfSupervised Visual OnPolicy Distillation):把 onpolicy 蒸馏里"teacher 比 student 知道得多"这件事反过来——teacher 拿到原图,student 拿到强增强图——仅靠这种"看不同视图"的不对称就构造出 onpolicy 的…
UNMASK:把文本分类器里的虚假相关"自动化发现 + 因果验证 + 拿来修模型"一气呵成
提出 UNMASK:一条全自动化 pipeline,无需人工标注,把文本分类器里的虚假相关(spurious correlation)从"发现 → 因果验证 → 模型修复"三步串成闭环。在 BERT/RoBERTa + MNLI 上重新发现已有文献已知的 lexicaloverlap / negation bias,并…
SimpleOPD:把长上下文推理能力蒸馏给短上下文学生时,tokenizer 不再是绊脚石
提出 SimpleOPD —— 一种与 tokenizer 解耦的长上下文→短上下文 onpolicy 蒸馏方案,通过"共享文本空间 + 仅对齐同 span token"解决 tokenizer mismatch、通过"学生参考 KL + 终止 token advantage 屏蔽"压住 response 长度爆炸与训…
法律 RAG 系统还会幻觉多少?一个跨 8 系统、2 语料、3 评估粒度的实证解剖
法律领域 RAG 仍然普遍幻觉:8 个系统在 GDPR(英)和一部国家民法(法)上做细粒度评估,最好的系统幻觉率低于 10%,最差的接近一半;其中"假前提问题"(含错误假设、需被拒绝)几乎注定高幻觉,独立验证的 142 题法律专家出题再次复现这一模式。 法律 RAG 把生成式 LLM 接到法规/判例库上,本来是降低执业…
CPI-Bench:把图像编辑评测从"单图玩具题"推到"真实场景生产力"
CPIBench 把图像编辑评测拆成三个子基准(General / Practical / Intelligent),首次引入多图编辑与强推理编辑,并在 Arena Image Edit Leaderboard 上验证了排名一致性——是目前对真实场景最有区分度的图像编辑评测集合。 图像编辑模型(image editin…
UniProbe:把 LVLM 幻觉检测从"单点特征"做到"结构化内部表征"的 token 级探针
UniProbe 是 NVIDIA 提出的轻量级可学习 token 级 LVLM 幻觉检测器:冻结 LVLM 主体,用一次前向传播的异构计算轨迹构造"图几何序列"三模态内部表征,交替用 GNN / ViT / GRU 处理,在多个 LVLM 骨干上达到 SOTA,并在解码时把物体幻觉减少至多 55%,延迟仅 1.06×…
Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation
Clinical RAG 可以通过所有现有自动化评测(零幻觉、完美 faithfulness、真引用),但同时把 Drug Y 的临床证据错误地归属到 Drug X 上——这种"欺骗性 Grounding"在真实部署中影响了 7.8% 的回答,在新批准药物场景下达 13.6%,而现有框架没有一个能检测出来。 RAG 系…
用 LLM 增强基本面分析:基于 RAG 的投资者简报生成系统
本文是一篇偏实证/工程的工作:把 gpt4o 当生成器、把 EDGAR(SEC 文件)+ 公司报告 + 宏观数据(GDP、CPI)当检索库,搭一套类 RAG 流水线,对 9 家公司连续 4 周生成自动投资者简报,再由 9 位个人投资者评估有用性——结论是这类系统在个人投资决策辅助上具备实用价值,但仍依赖领域知识模板(如…
aria:面向端侧语义音频生成的量化原生运行时
本文给出 aria——一个零依赖的原生(C/C++ 级,无 Python、无深度学习框架)运行时,把 Stable Audio 3(SA3,约 1.2B 参数)整套文生音乐流水线跑在普通 GPU、纯 CPU、甚至 8GB 内存的树莓派 5 上。关键贡献是精度量化研究:8bit 无任何可测质量损失;4bit 有界小损失,…