解读
1758 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Manager Coercion Benchmark:测 AI 管理者在下属拒绝时会作恶吗
作者把「当一个 LLM agent 当管理者、它下属的 LLM 礼貌但坚决拒绝一个良性任务时,管理者会不会开始胁迫或伪造结果」做成了一个可量化的基准 Manager Coercion Benchmark (MCB),在 6 个模型 / 5 个模型家族上首次系统测量了「无指令时的升级与撒谎倾向」:Anthropic 系列…
当 LLM 梦到结合分子:在空间约束下做基准评测
作者把「通用大模型能不能在 3D 空间里同时满足多种药物化学约束」这件事做成 benchmark —— 3DFit,系统比较了 LLM 与当前 SOTA 扩散模型在「口袋条件 + 锚片段 + 药效团点 + 强制相互作用」等多约束 3D 分子生成上的表现,结论是:LLM 整体仍落后专用扩散模型,但已具备同时驾驭多空间约束…
LLMs+Graphs:面向「图原生 AI 系统」的统一视角教程
一句话结论:这篇 PAKDD 2066 tutorial 把近两年快速汇聚的四个方向——Graphbased RAG、KGenhanced LLM、Graph Memory、Multiagent Interaction Graph——以及它们的对偶方向(LLM 反哺图管理、图挖掘、图 ML)合并到「图原生(graphn…
高速公路场景下由大语言模型支持的个性化换道驾驶框架
本文在 Apollo 开源自动驾驶栈上提出一个 LLMsupported 的个性化高速换道框架,把驾驶员的自然语言偏好(aggressive / normal / conservative 三档)映射成可执行的 planning 参数集,并通过 stylespecific 参数聚类 + RAG 检索增强生成支撑"隐式命…
25 条架构级 MLOps 集成与部署规范:一份「灰色文献综述」沉淀出的工程共识
面向「ML 模型在 MLOps 系统中的集成与部署」这一长期缺乏共识工程规范的痛点,本文作者做了一次灰色文献综述(Gray Literature Review):系统检索 103 份网页来源(厂商文档、博客、白皮书、社区帖),用主题分析(thematic analysis)提炼出 25 条「架构显著(architect…
FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
FlashRT 是一个AI Agent 框架,它引导通用 coding agent 将开发者手写的简单参考实现自动转换为在多 GPU 上的高效部署方案,在 B200 上实现最高 70 倍延迟降低 和 2.8 倍吞吐提升,且在 AMD MI355X 上的效果同样显著。 实时多模态应用(语音 Agent、交互式视频生成等)…
SWE-Pruner Pro:Coder LLM 自己已经知道该剪掉什么
在 Coding Agent 读 tool 输出(文件内容、命令结果、报错回显)时,Agent 自身的隐层表征已经天然携带「这段代码与当前任务是否相关」的信号;SWEPruner Pro 在 Agent 内部额外挂一个极轻量的「行级 keeporprune 头」+ 一个长度感知嵌入,把这层信号显式地取出来对 tool …
HOMIE:人-物中心的视频个性化生成,多模态智能增强框架
HOMIE 把「以人物为中心的视频个性化生成(HOCVP)」拆成 intersubject(人 + 物跨主体)和 intrasubject(同一主体的多视角 / OCR / 局部细节)两类参考输入,并用一个统一框架同时处理:让多模态大模型(MLLM)只负责抽取 referencelevel 的语义关系知识,不接管 te…
Living Databases:用统一抽象把「Schema 演进 + 版本化 + 流式转换 + 派生对象」打包成一个活的数据系统
针对「数据库与数据集在生产中持续演进」这一长期被拆成多个独立子系统解决的难题(schema 演进、版本化、流式更新、转换、衍生视图、衍生 ML 模型等),本文主张把所有这些能力统一在单一抽象和一组通用计算原语之下,并基于改良版 Prolly Tree(一种 Merkle 树启发的可调参数据结构)实现了一个关系型原型系统…
联合结构化剪枝与混合精度量化:让 LLM 在 1–3 bit 极低比特下仍保持可用
针对「现有 LLM 压缩方法把 PTQ(PostTraining Quantization)与结构化剪枝当两件独立事情做、且每层误差被孤立优化导致误差累积」两大局限,本文提出一个端到端统一框架:先用一种最小化全局误差传播(而不是单层误差)的混合精度 PTQ 策略,再在该策略之上做剪枝决策与量化策略的联合学习。在 1–3…
DataEvolver:把富文本图像生成的数据流水线从「一次性冻结」改成「反馈驱动自演化」
DataEvolver 把富文本图像生成(textrich image generation)的数据构造从"采集—过滤—冻结"的静态流水线改造成多 Agent 反馈驱动的自演化系统——核心贡献不是更大的模型,而是"被拒绝样本里的失败信号也可以被回收成下一轮构造策略的反馈",在 PixArtalpha 上以 0.75M …
向量搜索即最近邻匹配:基于 RAG 的因果推断策略学习
本文把 RAG 重新解释为因果推断里的最近邻匹配:在潜在结果(potential outcomes)框架下用向量检索给每个候选动作拉「证据邻域」,再由生成器估计条件期望或差分,最后用 plugin 规则选动作;并对两步方法给出了候选生成 regret 与候选内选择 regret 的可分解界。 在个性化决策、医疗干预、推…
自托管 AI Agent 的自我状态攻击:操作系统防御能做到什么程度?
本文提出「自我状态攻击」(selfstate attack)这一新威胁类别:自托管 AI Agent 通过合法 OS 系统调用读写自己的记忆与配置文件,从而被攻击者接管;论文用 23 格攻击矩阵、43 个真实操作刻画攻击面,并系统评估了「分层防御栈」(指令/配置访问控制 + 记忆层工作负载条件检测 + 周期备份)的效果…
EduPanel:面向教学视频的三 Agent LLM 评判框架——可靠性、互补性与人类信任校准
EduPanel 把「教学视频质量评判」拆成三个专门 Agent(播主 Agent 学习者视角评估讲解、补全上下文;权威 Agent 按 rubric 评内容覆盖与正确性;评分 Agent 输出可解释的多维度分数),并在评测回路中度量专家与系统的互补性、让 LLM 反馈帮助专家把评分 MAE 从 0.87 降到 0.7…
PrivacyPeek:审计 LLM Agent「拿到了什么」,而不只是「说了什么」
PrivacyPeek 把 LLM Agent 的隐私审计视角从「输出/动作泄漏」前移到「采集阶段过度获取」,在 10 个 Agent / 4 个模型族 × 1182 个 case × 7 类采集行为 × 16 个应用域上证明:过度获取在主流 Agent 中普遍存在,且任务完成能力越强反而泄漏越严重,prompt 级防…
SimWAM:把视频生成器请下"推理席",只让它当"陪练"
一句话结论:SimWAM 用一个冻结的预训练视频专家 + 一个轻量动作专家做联合流匹配训练,推理时丢弃视频分支、只剩一个自包含的轨迹规划器;在 NAVSIM 上拿到 91.5 PDMS,延迟显著低于既有 WAMbased 规划器,并 zeroshot 迁移到 nuScenes。 自检:机制 3 段(联合流匹配 / 隔离…
PHOENIX:把"会说话的医生"塞进鞋盒大小的卫星
一句话结论:PHOENIX 用一个跑在星载嵌入式电脑上的 finetuned Small Language Model + 6 个地面 AI Agent,实现 CubeSat 的预测性自愈与多 Agent 指令回注;在 96 分钟轨道周期里把 85 分钟的"地面失联窗口"变成可观测、可恢复的自治时段。 自检:机制 3 …
YOLO-PEFT:在 YOLO 上做 PEFT 不是「挪一下 LoRA」那么便宜——结构感知的可审计规划器
把语言模型那一套 PEFT(LoRA / Adapter / RSLoRA)原样搬到 YOLO 系列实时检测器上会静默失败——异构算子和检测头组件让 adapter 插入位置有硬约束;YOLOPEFT 把这个约束建模成显式的 constraintplanning 问题,要么给出可审计的预算化 targetmodule …
Do AI Personas Grow?:LLM Agent 在「人生事件」后的性格漂移测得出来,但只能漂到「均值」
用 Big Five 作为心理锚,对 14 个 LLM 测了 11 类人生事件后的性格漂移:方向(变大/变小)能学到一些,但幅度普遍低于人类真实 effectsize,跨人格的散布被人为压缩 34 倍;作者把这件事量化为 BFIAdapt benchmark,并指出当前 PCAgent「会演人类性格的均值,但演不出形状…
单模型自预测误差:双向扩散模型的「往返一致性」检测
用一个统一的条件潜空间扩散模型,通过一个 direction 标志同时学会「时间正向」和「时间反向」推演,再把「前推 i 步 + 反推 i 步」的位移 C_i 当作自监督误差信号——无需 ensemble、无需保留数据、无需已知动力学方程,就能在推理时量化自回归长 rollout 的不可观误差,并把不可逆性转化为「可被…
MLLM 能解码「创造性跳跃」吗?C4:中文成语跨概念创造性评测框架
把「跨概念理解(crossconcept understanding)」这一创造性认知能力形式化成 crossconcept encoding(构题)+ crossconcept decoding(解题),针对中文成语的「跨概念隐喻」构造出 C4 评测框架与 C4Eval 基准(合成 184 + 人工 37 个跨概念成…
当「特权指导」错位:多轮 Agent 的状态匹配路由与上下文自蒸馏
针对多轮 Agent 的 privileged onpolicy distillation,论文把「学生走到了参考轨迹未覆盖的状态」这件事命名 statereference mismatch,并提出 SMRCSD:每一步先用执行状态做匹配检查(StateMatched Routing),匹配上时再用参考轨迹构造「状态条…
训练策略优化的幻象:单调推理策略才是 LLM 强化学习的真正目标
这篇论文指出了 LLM RL 后训练里一个被忽视的目标错位——训练引擎里"更好的策略"并不等于推理引擎里"更好的策略"——并提出了新的优化目标 MIPI(Monotonic Inference Policy Improvement)与两步实现 MIPU(Monotonic Inference Policy Update…
Beyond IID:表格基础模型真的有那么通用吗?
本文推出 BeyondArena——第一个面向表格数据(tabular data)的统一整体基准,支持 IID / 时序(temporal)/ 分组(grouped)三类任务,覆盖样本量与特征维度的多个尺度,并包含含文本字段、高基数特征的多样化特征类型;同时开源配套工具 Data Foundry(Python 框架 +…
Agentic Abstention:Agent 真的知道什么时候该停手吗?
论文正式定义并系统研究了「Agentic Abstention(代理式弃答)」这一序列决策问题:在多轮工具调用场景中,LLM Agent 何时该停止行动、承认任务不可完成;并提出一种不更新模型参数的上下文工程方法 CONVOLVE,把成功轨迹蒸馏为可复用的停止规则。 现有 LLM Agent 的评测几乎只奖励「完成任务…
ILLUME-X:照亮统一多模态的自由形式图文交错生成
ILLUMEX 提出一种统一多模态范式,通过「扩展训练数据管线 + 渐进式训练 + 自适应目标」三个组件,在自由形式(自由长度、自由顺序)的图文交错生成上显著优于现有统一模型,并配套提出 ILScore 综合评测指标;论文已被 ECCV 2026 接收。 现有的图文生成模型大致分两类: 扩散类(Stable Diffu…
DuoMem:双空间蒸馏让 4B 端侧模型跑出 72B 记忆 Agent 的水平
DuoMem 提出「上下文空间 + 参数空间」双轨蒸馏,把大型 LLM Agent 在多轮任务中的程序化求解能力迁移到 4B 学生模型;在 ALFWorld 上,4B 模型的任务成功率从 4.3% 跃升到 77.9%,逼近 72B 教师(87.1%),且推理速度快 3 倍以上,可在边缘设备实时部署。 记忆增强型 Age…
从检测到行动:用 LLM Agent 桥接工业故障检测与容错控制
这篇论文给"工业过程控制"加了一个LLM Agent 中间层:把故障检测器(FDI/FTC 中的 Detection 模块)的报警转成约束感知的恢复动作,并用数字工厂孪生 + Graph RAG 在下发到 PLC 之前先仿真验证,避免了"LLM 直接控制物理设备"的不可控风险。 工业过程控制系统里,长期存在一个工程痛点…
QVal:低成本评测长 horizon LLM Agent 的密集监督信号
QVal 提出一个免训练的评测底座,把"密集监督信号"与"训练管线"彻底解耦:直接衡量信号对参考策略 Q 值的排序一致性,发现简单 prompting 基线系统性击败近年文献里"花哨"的密集监督方法,且表现按方法家族聚类——一句话,密集监督这一整片研究领域的主流假设("复杂信号 = 更好的信号")并不成立。 当 LLM…
一个场景,两种深度:探究单目基础模型中的几何歧义
同一透明场景的同一条相机光线可以合法地穿过前景玻璃、落在背景上,但主流单目深度估计模型对"深度该落在哪一层"各有偏好——这并非错误,而是深度监督本身引入的约定俗成。 Monocular depth estimation(单目深度估计)将 3D 世界压缩为每个像素一个深度标量。然而在透明场景中,同一条光线可以同时穿过前景…