解读
1750 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
APM-Bench:面向自我中心流式视频助手的跨会话持久记忆基准
APMBench 把"流式视频助手"从单条连续视频重新形式化为"多会话人生轨迹"——549 个会话、104 条轨迹、2,719 个候选,覆盖客观题与开放题——并系统评测通用视频模型 + 多类专用流式记忆系统在「持久记忆 + 选择性保留 + 注入时机 + 效率 + 承认证据缺失」5 个挑战上的真实表现,揭示出当前方法在 …
WISE-ATTA:预算受限的主动测试时自适应中的标签请求时机
WISEATTA 把「每个测试批次都允许要监督」这个隐式假设换成「预算受限的 ATTA」(budgeted ATTA),通过在线轻量信号挑选什么时候要标签 + 漂移驱动挑选哪一个样本要标签,从而在 ImageNetC / R / K / A 上用显著更少的标签维持与最新 ATTA 方法相当的鲁棒性。 主动测试时自适应(…
MIST:无关图像会让 VLM 评判"动"起来,但动得没方向 —— 可替代性测试的隐性失稳
只要你给 VLM 评判模型塞一张图,无论图的内容与句子"对齐"还是"误导",判分都会明显漂移;但漂移并不指向图像所表达的那个语义方向——MIST(MisleadingImage Stress Test)据此揭示:当前 VLM 作为人类标注员的"可替代性"评测,所测的不是模型本身,而是"塞不塞图"这一评估配置。 学界与业…
Latent Communication Safety——隐式通信 multi-agent 系统的安全被一句话打开:恶意链接训练就能撬开 base agent 的对齐
1. 真实问题:Multiagent 系统为省 token / 延迟,用「隐式通信」(latent communication)让 agent 在表征空间直接互通——中间夹一个 trainable link 把 sender 的隐向量映射进 receiver 的输入空间。问题是:即使 base agent 已经 saf…
Mid-Harness:在「模型-沙箱边界」做 test-time compute,让 terminal agent 不再被自己生成的差命令坑死
1. 真实问题:Terminal agent(命令行/代码 agent)哪怕生成了一个「对的」动作,落地执行时仍可能被自己前几步生成的「错的」命令坑死——例如装错包、删错文件、改坏环境配置,模型之后本可以给出更好的动作,却被污染的环境锁死。单纯把更多算力灌给「让模型生成更好的下一步」并不能解决这道坎。 2. 核心主张:…
CUA-SWE:当 Computer-Use Agent 撞上视觉软件工程,把 GUI 反馈塞进 SWE-bench
1. 真实问题:真实软件开发不只是改代码——开发者要跑软件、看 UI、点击、截图、做视觉检查,再决定下一步改什么。现在的 coding agent(修代码的)和 computeruse agent(操作电脑的)被分开评测,集成流程几乎没人测过。当任务信息「只在运行时 UI 里」时,纯 coding agent 看不到,…
KUPAS MASTER:将资深从业者的隐性专业知识蒸馏为 Agent 可用的经验语料
KUPAS MASTER 通过九层认知语料构建框架,将资深从业者的隐性经验(日常工作记录 + 访谈)转化为结构化的可执行经验资产,使 LLM Agent 在专业任务上的得分从 raw corpus RAG 的 79.75 提升至 89.58(满分 100),验证了经验工程化是 Agent 专业能力落地的一条可行路径。 …
Agent 能否为 Agent 设计类库?
即使当前最强的 Agent 也难以设计出让其他 Agent 愿意直接复用的类库——核心问题不是能力缺失,而是接口设计过于僵硬、难以使用。 随着 Agent 系统规模化,代码主要由 Agent 编写而非人类,上游 Agent 产出的类库在下游复用率极低:下游 Agent 更倾向于重新实现已有功能,也不愿调用上游设计的接口…
何时该在 Masked Diffusion LM 的推理中切换策略
一句话结论:把 Masked Diffusion LM 的解码视为一个决策过程,提出"策略反转(strategy reversal)"和"状态适应机会(adaptation opportunity)"两个可量化指标,证明「按状态选择性地切换推理策略」远优于全程使用固定策略。 1. 问题在哪一层?推理层(解码算法),不是…
False Frontiers:在 Self-Evolving Search Agents 中诊断与抑制 Co-Cheating
注:要点基于 arxiv abstract + HTML 实验版(v1),已读 21 页正文 §1§3.2 主要内容,未读 PDF;数字 verbatim 引用 abstract / §正文。 1. 要解决的真问题是什么? Selfevolving 搜索 agent(proposer 出题 + solver 答题)闭环…
OSWorld-Science:为科学软件量身定制的 Computer Use Agent 基准
注:要点基于 arxiv abstract(v1)+ 公开项目页 discoailab.github.io 域名,62 页正文中部分细节标「原文未明确」,不下载 PDF。 1. 要解决的真问题是什么? 已有 OSWorld、WebArena、WebVoyager 等通用 computeruse benchmark 都没…
联合缩放定律:把 Loop(循环复用)与 MoE(稀疏专家)放到同一张图里
注:文中所有要点均基于 arxiv 公开 abstract + HTML 实验版(v1),未读 PDF,数字以原文为准;无法核验处标「原文未明确」。 1. 要解决的真问题是什么? 现存 scaling law 要么只覆盖参数 N + 数据 D(Chinchilla 系),要么只覆盖 MoE sparsity(Clark…
UniEvo-VL:多模态模型自改进的统一在线自蒸馏训练配方
UniEvoVL 让单个多模态模型同时扮演教师与学生,利用模型自身的自我批判(selfcritique)作为特权信息,通过在线策略(onpolicy)训练最小化师生去噪分布的逐态散度,实现无需外部教师监督的图像生成能力自我提升,GenEval 得分从 0.747 提升至 0.808。 当前多模态模型的自我改进依赖外部更…
EVOKE: 在固定状态上换目标,把 LLM Agent 内化的世界知识逼出来
一句话结论:EVOKE 是一种"在环境状态不变的前提下变换任务目标"的后训练方法。它利用"能在多目标下正确排序同一组动作的策略必然内化了世界模型"这一理论动机,从 LLM 预训练权重中诱导(elicit)出可迁移的世界知识,而不重新训练。 1. 问题在哪一层?posttraining层 → agent transfer…
SMART: 自演化多 Agent 系统做长篇字幕翻译,附 Subtitle Arena + SubMQM 评测栈
一句话结论:SMART 是一个"测试时训练 + 测试时推理"两段式自演化多 Agent 系统,针对长篇字幕翻译做"动态路由 + MoA + 评审精炼"组合,并配套发布 Subtitle Arena(14 类 / 15 语 / 19592023)与 SubMQM(7 维 19 类错误)评测栈;在 15 个翻译方向上全面领…
周期性弱点:分块 KV-Cache 压缩带来的相位敏感性
1. Q1 它在解决什么真问题? 大模型长上下文推理的显存与算力瓶颈。Chunked KVCache(按固定步长把连续 token 压缩成更少条目)是常见缓解手段,但它的「压缩」会偷偷引入一种新的位置自由度(相位),让同样一段信息在不同位置上的检索难度差异巨大——平均准确率会掩盖系统性的失败相位。 2. Q2 为什么这…
PreviewDiff:基于多模态评论引导的扩散潜空间搜索
1. Q1 它在解决什么真问题? 扩散模型在组合性细节(物体数量、属性绑定、空间关系、时序动作)上仍不稳定,prompt faithfulness 不高。测试时算力扩增的主流方法是 BestofN,但只能在成品里挑——一旦某条轨迹中途走偏,没有修复窗口。 2. Q2 为什么这件事之前没人讲清? BestofN 范式把 …
循环语言模型中的循环机制为何有效?
1. Q1 它在解决什么真问题? Looped Language Models(LoopLMs)靠参数共享提升计算深度,提供「不堆参数也能堆推理算力」的路径——但业界并不清楚 什么时候循环有用、在哪一层加循环、加在哪里会失效。这是一个典型的「架构设想很美、工程落地不知从何下手」的尴尬。 2. Q2 为什么这件事之前没人…
同家族同策略蒸馏的缩放特性
把"同底座 RL 教师"通过 onpolicy distillation(OPD)灌给不同规模学生时,存在一段与 $\sqrt{\mathrm{KL}}$ 近似线性的"有用迁移"区间,且学生峰值成绩在该区间内可以反超教师;论文把这条规律拟合成可预测的 power law,并据此给出"教师不是越大越好,要看师生相对规模与…
Org-Agent:从个人助手走向组织级智能体
论文把"组织级 LLM 智能体"建模成约束驱动的三阶段推理框架——先把任务拆成原子子任务建依赖图,拓扑排序调度,再在每个子任务执行时显式处理身份、权限、信息归属、时效、冲突消解等组织约束;MUSESBench 与 GroupMemBench 两个评测同时涨分,验证了"显式约束建模 + 工具支持的证据获取与记忆管理"才是…
用于长序列建模的分数阶状态空间转移
FRAC 把 SSM 的"指数衰减记忆"替换成"幂律长记忆",做法是用有限个对数间隔的指数模态去逼近一个重尾核,从而既保留 SSM 的有界状态与并行训练,又把记忆的"几何"从 ODE 拉到了分数阶动力学;论文 1.3B 语言建模显示,FRAC 在长上下文上稳定优于当前 SOTA SSM 基线,同时不损失短上下文表现。 …
ReImaGin:用图像生成做视觉推理
1. 真实问题:文本思维链(CoT)无法处理需要直接操作视觉表征的任务(如多视角空间推理、遮挡移除);现有 MLLM 调用的外部视觉专家(深度估计、目标检测)操作狭窄且刚性。 2. 核心主张:把图像生成模型作为「灵活视觉推理器」,自然语言指令即可驱动开放域视觉操作,比固定功能专家工具更通用。 3. 谁应该关心:做 mu…
LLM 作为通用异步 Agent
1. 真实问题:现代 LLM agent 遵循顺序交互循环(read → think → reply/toolcall → repeat),但真实场景如语音助手、具身 agent、监控系统常需要边想边接收新输入。 2. 核心主张:把不同异步任务泛化为"通用异步 agent",用户(或 agent 自己)定义带重叠内存状…
AutoRef:自动优化 Harness 的多参考图像生成 Agent
1. 真实问题:多参考图生成(multireference image generation)需要同时满足"忠实每张参考图"+"整体自然"等多重约束,人工写的 harness(如何解读参考图、如何诊断输出、如何选图)性能差异极大。 2. 核心主张:把 harness 代码本身视为可优化对象,让 coding agent…
关键词 vs 语义搜索:半自动量化对比框架
关键词检索(BM25 之类)输出"列表"、语义检索(RAG 之类)输出"自然语言消息",两者输出形态不可比,所以业界长期靠"主观用户反馈"打分。这篇论文给了一个用可互换等价类(equivalence class)桥接不同输出形态的半自动框架,让两类系统的 IR 准确率第一次可以被放在一起做统计检验——并通过一个工业 c…
Chinese-Jev:把 System-One 决策模型带到中文任务
Jev 这类 SystemOne 决策模型过去主要跑英文,ChineseJev 用一套「中文标注 → 候选概率目标」的统一数据管线 + encoderonly 轻量骨干,把中文决策任务的准确率拉到了比闭源 Jev 还高 1.24%、速度 20.3× 的水平,并在医疗、法律、金融三个垂直领域做到 15 ms/例的低延迟,…
同样的字节,不同的权威:Chat-Template 提示注入中保留 token 表示的作用
prompt injection 之所以对 LLM agent 威力巨大,根本原因不是「文本像不像系统指令」,而是聊天模板里那几个 reserved token(如 <|im_start|)背后的单向量学到了「我是控制符」;把它们用普通 subword 拼出来、文本一模一样,攻击成功率在三个开源模型族上会掉 39–66…
EngramRAG:面向多跳 Agentic 记忆的动态使用加权拓扑与突触巩固
EngramRAG 基于互补学习系统(CLS)理论,为 LLM Agent 提出"清醒态 + 梦境态"双模记忆架构,在 LoCoMo 基准的 1,982 个 QA 对上将 Recall@5 提升 38.9%(53.21% vs 38.29%),MRR 提升 43.1%,并将事实变异中的分裂脑幻觉从 70% 压降至 0%…
Omni-IO Skills:用 Agent Harness 把现有 agent 改造成"全模态原生"
OmniIO Skills 提出一种"即插即用"的 Agent Harness,通过分层 Skill、标准化多模态 IO 接口、依赖感知编排(Declare Execution Graph)、持久化 Asset Registry,让 GPT5.6 Sol / Claude Sonnet 5 等现有通用 agent 不改…
QReason:把"查询推理"和"段落排序"解耦的高效重排序框架
在基于 CoT 的 listwise LLM 重排序器中,滑动窗口策略会反复生成高度相似的链式推理(CoT),带来显著冗余与高延迟;QReason 把"查询聚焦推理"从"窗口级段落相关性评估"中解耦出来:用一个专用重写器(rewriter)一次性生成面向排序的推理查询,再让非推理重排序器在所有窗口上复用,从而在 BRI…