解读
1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Flow-ERD:面向多样化交通仿真的 Agent 类型感知 Flow Matching 与熵正则蒸馏
FlowERD 通过「Agent 类型感知 Flow Matching (AFM) + 熵正则蒸馏 (ERD)」两阶段设计,让多智能体交通仿真同时跑出真实运动和多样化轨迹,在 WOSAC 基准上排名第一并主导真实性多样性的 Pareto 前沿。 自动驾驶仿真需要海量「既真实又多样」的交通流。真实的轨迹能让规划算法学到符…
PolicyShiftGuard:可适配策略的图像护栏及其评测
PolicyShiftGuard 提出「PolicyShiftBench 基准 + 紧凑策略条件护栏 PolicyShiftGuard 模型 + RPSFT/BPAdapt 两阶段训练」组合,把图像护栏从「图像固有安全」范式转向「策略条件决策」,在 7B 规模上达到 76.9 Avg.F1 / 72.1 Avg.PSS…
基于音韵激活映射的音素切分与识别
作者提出 SPAM(S3Mbased Phonological Activation Mapping)框架,主张自监督语音模型(S3M)的表征里已经隐含了音素结构,只需用一个轻量、无梯度的"音韵激活向量"把它显式引出,再叠两个超轻的预测头就能同时做音素切分(segmentation)和识别(recognition),且…
长上下文 LLM 的自引导测试时训练
针对长上下文 LLM 直接做 testtime training(TTT)容易引入噪声、退化基础能力的问题,本文提出 SelfGuided TTT(STTT):在正式做 instancespecific 参数更新之前,先让模型自己挑出"和当前问题最相关的 span",然后只对这部分 span 做语言建模目标训练,从而在…
LongMedBench:面向长程临床决策的医疗 Agent 基准
LongMedBench 是一个基于真实电子健康记录(EHR)的长程临床决策基准。它面向"agent 在多院次、长时间窗口下做临床决策"这一被现有医疗 NLP 评测严重低估的场景,提出三套评测(事实型问答、时序推理、长程决策),并通过实验揭示了当前 LLM agent 在隐性时间推理与决策任务上的关键短板——RAG 和…
视觉推理的「局部性」与「长度泛化」:全局卷积是组合泛化的隐性瓶颈
在视觉状态跟踪(visual state tracking)类任务上,全局一次性输入的 vision model 会像 LLM 一样「学会走捷径」,无法随任务长度(序列/对象数)外推;只有严格 local perception 的循环视觉策略才能在长度维度上保持泛化——这提示 local attention 可能不是工…
重新审视「Agent Harness 自动演化」:它赢得还是 test-time scaling 赢了?
在 TerminalBench 2.1 上,用 GPT5.4 与 Claude Opus 4.6 做后端的实验显示,自动 harness evolution 并不一致地胜过简单的 testtime scaling 基线,且演化得到的 harness 在「未见过的任务」上泛化有限——也就是说,过去报告的 harness …
Chat2Scenic:用迭代 RAG 把法规文本「写」成自动驾驶仿真场景脚本
Chat2Scenic 是第一个把「法规文本 → 自动驾驶仿真场景 DSL 脚本」做成 迭代式 RAG + 交互式 chatbot 的端到端框架,并配套发布一个 123 个场景的开源 benchmark——它把 RetrievalAssemble 与 Retrieval 全脚本生成两类前辈方法的成功率双双显著提升(CS…
LongStraw:固定 GPU 预算下,把 RL 后训练上下文推到 2M+ token 的执行栈
LongStraw 是一个面向百万 token 量级 RL 后训练的架构感知执行栈,用「共享 prompt 无 autograd + 短响应分支逐条回放」的方式,把激活显存压到训练图级别,代价是多花一些重放时间;它在 8 张 H20 上把 Qwen3.627B 的 GRPO 训练推到 2.1M positions,并在…
RAG 里的隐私保护不该是静态的:PA-HDP 用 Prompt-Aware 差分隐私重写外库
这篇论文指出 RAG 的隐私风险本质上由 prompt 驱动、随 query 动态变化,但现有方法都默认外库文档的隐私风险是「documentlevel static」的;它提出 PAHDP(PromptAware Dynamic Hierarchical Differential Privacy)框架,先做 prom…
SUFLECA:把 CAD-to-image 对齐从外观匹配拉到几何一致匹配
SUFLECA(Scaling Up Feature Learning for CAD Alignment)是面向 zeroshot 6D 位姿估计的弱监督框架,通过「在 674K 图像 / 12 个真实与合成数据集上以 Normalized Object Coordinates (NOCS) 做几何监督规模化训练」+…
AgentOdyssey:面向测试时持续学习智能体的开放式长视野文本游戏生成
AgentOdyssey 是一个程序化生成的开放式文本游戏评测框架,把"测试时持续学习(testtime continual learning)"这件事从口号变成了可度量的实验场:在长视野游戏中同时考察世界知识获取、情景记忆、探索多样性、规划深度与推理代价,并发现短期记忆是多种 Agent 范式在测试时训练中的关键组件…
面向 LLM 游戏 Agent 的环境接地自动化提示优化
针对 LLM 游戏 Agent「换 prompt 像换模型」却只能靠人手调的问题,本文提出一套自动提示优化(APO)流水线:把「观测→动作」拆成 Descriptor + Actor 两段,用 LLM 驱动的进化循环在外挂环境回报的引导下迭代改写 prompt,不动模型权重,在 BALROG/BabyAI 五任务上稳定…
Long-Horizon-Terminal-Bench:基于密集奖励评分的 Agent 长程终端任务极限测试
LongHorizonTerminalBench 是一个包含 46 条长程终端任务、覆盖 9 大类别、采用密集奖励(dense reward)+ 子任务细粒度评分的 Agent 评测基准:每条任务需要数百 episode、分钟到小时级执行时间,平均 9.9M tokens / 231 episodes / 85.3 分…
AutoMem:将记忆作为可学习的认知技能,让 32B 开源模型逼近前沿闭源系统
AutoMem 把 LLM Agent 的"记忆管理"从一段 prompt 提示词升级成一项可被自动学习与训练的可分离技能,仅优化记忆机制、不改动任务动作,便能在长视野游戏里把 32B 开源权重 Agent 的成绩提升 2–4 倍,达到与 Claude Opus 4.5、Gemini 3.1 Pro Thinking …
在 Kubernetes 上跑 GenAI 推理:Kueue + DAS + GAIE 三件套打通 ASR→LLM 流水线
论文完整标题:Evaluating Kubernetes Performance for GenAI Inference: From Automatic Speech Recognition to LLM Summarization(arXiv:2602.04900v3,已被 ICPE 2026 第 17 届性能工程会…
EO-WM:面向概率性地球观测预报的物理信息世界模型
EOWM 是一个把"气象强迫"拆成气候基线、天气异常、累积物理应力三路条件信号的多光谱视频扩散 Transformer,专门解决卫星地球观测(EO)预报中"未来地表长什么样、要按天气变化给出概率性回答"这件事。 地球观测预报(EO forecasting)要回答的实际问题是:给定过去一段时间的多光谱卫星影像序列,以及同…
编码 Agent 能"看见"代码仓库吗?——视觉化代码仓库表示的首次系统实证
这是第一篇系统性地把"代码仓库的视觉表示"喂给多模态大模型(MLLM)驱动的编码 Agent,在仓库级 issue 修复任务上做大规模对照实验的工作;结论是纯视觉不灵,但视觉+文本的混合设计能省 token 且不损准确率,最高可减少 26% 输入 token。 编码 Agent(coding agent)目前主流范式是…
SPEAR:面向真实感具身 AI 研究的可编程仿真器
SPEAR 是一个 Python 库 + Unreal Engine 插件组合,把任意 UE 应用变成可被 Python 编程控制的"具身 AI 仿真后端",并能在同一帧内确定性调度任意数据依赖的工作图,是当前面向真实感(photorealistic)具身研究的最通用、可编程性最强的 UE 桥接方案,由 Intel L…
TOKI:LLM-Agent 持久记忆中矛盾解析的双时态算子代数
TOKI 把 LLMAgent 持久记忆里司空见惯的「矛盾解析」等价改写成「写时并发控制」,给生产环境常用的四种启发式(lastwriterwins、evidenceweighted merge、awaitconfirmation、perrule policy)补上一套写在纸面上的契约:双时态算子 + 隔离前置条件 +…
Larch:面向 AI SQL 语义谓词的习得式查询优化
Larch 把 AI SQL 里高开销的语义过滤器当作可学习对象,给出 LarchA2C(Gated GNN + MDP 排序)与 LarchSel(监督学习预测选择率 + 动态规划)两种变体,在多个真实与合成负载下,比 Palimpzest、Quest 等基线 降低 3×–19× 的 token 总开销。 现代分析型…
PROJECTMEM:面向 AI 编程 Agent 的本地优先、事件溯源记忆与判断层
PROJECTMEM 是一个开源、纯本地(localfirst)的 Python 包,把"AI 编程 Agent 的项目级记忆"建模为追加式(appendonly)的明文事件日志,并通过 MCP(Model Context Protocol)向 Agent 暴露"读 + 判断"两类能力,使记忆不仅被动回答 Agent …
多步工具调用 RL 为何会崩?监督信号如何救场
一句话结论:tooluse 场景下纯 RL 训练容易"突然崩盘",不是能力没了,而是少数控制 token 的概率出现尖峰把生成结构打坏。把 SFT 与 RL 交错训练能稳住训练,但 OOD(分布外)评测会掉点;要在交错基础上叠加多样化监督信号(offpolicy 示范、错误示范、提示性 hint 等),同步与异步方案各…
CoffeeBench:长视野 LLM Agent 在异构多 Agent 经济中的基准测试
CoffeeBench 把 LLM Agent 放进一个由咖啡产业链上的农户、烘焙商、零售商组成的 90 天多 Agent 经济模拟里,检验它们在长视野、异构对手、真实现金流和库存压力下能否持续做出有利可图的决策——结论是当前主流模型虽然都能跑赢"什么都不做"的被动基线,但在沟通频率、长程规划与"行动瘫痪"(idled…
Cordon:面向工具调用 LLM Agent 的语义事务运行时
工具调用型 LLM Agent 的"工具接口"目前仍被当成一次性的 RPC 暴露,缺少跨多步、跨工具的任务级事务边界。本文提出 Cordon——一个事务性 Agent 运行时,把一次任务的工具意图、执行轨迹、外部副作用都绑进一个可回滚、可审计、可审批的语义事务,在提交前做整体验证;在对抗与良性工作流上都暴露了既有"逐调…
DataEvolver:基于多层级自演化的 LLM 自动化数据准备
DataEvolver 是第一个自演化的数据准备系统:在 operator / pipeline / 实例化三层做闭环,把"原始数据 → 高质量训练数据"这件事从"人工写 pipeline"变成"LLM 自己搜索、构造并迭代优化 pipeline",在 7 个 benchmark 上让下游 LLM 平均提升约 10%。…
Vesta:把定位、空间推理、导航、长程规划塞进一个具身基础模型
Vesta 是一个统一的具身通用模型(generalist embodied foundation model),用一份大规模精挑细选的数据集 + 一个简单的多模态记忆 harness,把定位、空间推理、导航、长程规划这些原本各管一摊的能力合并到同一个模型里,并在多项基准上平均比单任务 SOTA 高出 20% 以上,比…
当 Agent 不需要被攻击也在泄露数据:现实场景下工具调用型 LLM 的操作性数据泄露评估
新加坡 AI Safety Institute(AISI Singapore)与韩国 AI Safety Institute(AISI Korea)联合做了一份针对工具调用型 LLM Agent 的现实场景评估:在 12 个非对抗性任务里,没有任何一个 Agent 能在所有场景下既把任务做对又保证数据安全,表明操作性数…
InSemRAG:面向意图感知检索与语义保持切分的高效 RAG
InSemRAG 是一个基于"迭代检索—校验"机制的 RAG 框架,通过意图感知检索器(IAR)动态混合多路召回通道、通过语义保持切分(SPC)修复被破坏的证据块,并借助小模型(SLM)吸收迭代带来的延迟成本;在 HotPotQA、FEVER 等多跳与证据敏感任务上对近期 SOTA 形成稳定优势,达到与 MultiHo…
RTP-LLM:阿里巴巴工业级 LLM 推理引擎
RTPLLM 是阿里巴巴集团自研、已服务超过 1 亿用户的工业级 LLM 推理引擎,通过对模型加载、PrefillDecode 解耦、KV Cache 管理、投机解码、多模态处理五个层面的端到端集成设计,在 8B–235B 多种模型上同时获得远超 vLLM / SGLang 的吞吐与延迟指标,并以开源形式提供给社区复用…