解读
1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
HarnessRisk:面向 Agent Harness 全生命周期的安全基准
HarnessRisk 是首个覆盖 Agent Harness 从配置、扩展、运行、状态持久化、动作控制到事件恢复全生命周期六阶段的安全基准;在 128 个沙箱测试用例上,攻击成功率从 12.6% 到 80.9%,Utility 维持在 75.0%–97.6% 之间,揭示了现有安全评估只看单点攻击、忽视多阶段协同失效的…
Agent Lightning v1.0:把 Agent Harness 拉进 RL,把训练和部署解耦
Agent Lightning v1.0 提出并实现「harnessed agentic RL」——把任意已经部署的 Agent Harness 当成「环境」,让 RL 训练器只观察 LLM 请求响应对,由此把训练和部署彻底解耦;并以约 3,500 行代码实现完整框架,在 6K 样本上把 Qwen3.59B 在 SWE…
Embodied-Navigator(TAMP-Nav):把 VLM 拉回 2D 视觉舒适区,用稀疏推理 + 两层对齐做高效具身导航
TAMPNav(EmbodiedNavigator)把具身导航拆成四个动作——Point(2D 像素 → 3D 坐标)、Think(按需触发 ChainofThought)、Memorize(关键节点保留 + 其余压缩为时空指示)、Align(GRPO 上叠加过程奖励做两层对齐),让 VLM 在自己的 2D 视觉先验里…
大语言模型是否在玩「六度分隔」?长上下文流形的拓扑压缩测量
这篇论文把 transformer 隐状态的相似度矩阵稀疏化成无向图,发现深层推理层在 long context 上天然构成 SmallWorld 网络——任意两个语义锚点之间最多 6 跳可达,并把这个拓扑度量当作 RAG 幻觉的零样本检测器:事实正确的生成与源上下文保持 ≈3 跳的结构连通,幻觉则表现为严重的拓扑塌缩…
Registers 对像素空间 Diffusion Transformer 至关重要
在像素空间(pixelspace)训练的 Diffusion Transformer(DiT)虽然不像 ViT 那样出现 patchtoken 高范数异常值,但额外引入 register tokens 仍能显著改善生成质量,并且在像素空间 DiT 中的收益明显大于潜空间 DiT,由此本文还提出一种新推理技巧——Regi…
从受控环境到真实世界:面向实际场景的渗透测试 Agent 评估
针对 AI 渗透测试 Agent 现有基准过度依赖 CTF/RCE 等"任务完成"指标、难以反映真实目标的复杂性这一问题,本文提出 ethiBench 评估协议——把评估重心从"是否完成子任务"转到"是否真正发现并验证漏洞",并配套结构化真值 + LLM 语义匹配、连续真值维护、累积评估、效率指标与精简子集等机制,目标…
When Bots Join the Team:Bot 采纳与开源软件项目的制度性结构
通过对 2,991 个 GitHub 项目在引入第一个 bot 前后两年的事件级数据进行因果识别风格的差分分析,本文发现 bot 采纳与"重复协作增加、特定 bot 在讨论中被点名增多、冲突级联减少、产出更具区分度"四种社区级变化在时间上精准共变,并据此论证:可预测、规则驱动的 bot 完全可以成为开源社区"制度性基础…
代理探索与可复用引导:一种通过代理引导更新信号实现的模块化 LLM 后训练范式
PUST 通过引入轻量级代理模型将「探索高奖励行为」与「策略对齐」解耦,让更新信号可以异步生成、缓存并跨模型复用,把 LLM 后训练从昂贵的在线优化变成模块化的离线工程。 Posttraining(后训练)是 LLM 落地绕不开的环节——无论是数学推理、代码生成还是领域适配,都需要对基础模型做微调。但现有方法存在根本性…
AdvancedMathBench:面向高等数学证明生成与验证的基准套件
本文提出 AdvancedMathBench,一个聚焦"高等数学"(本科高年级到博士资格考难度)的双轨基准:一轨 ProverBench 测"证得出",另一轨 VerifierBench 测"判得对",并配套一个与人类专家高一致性的自动验证 pipeline。实验显示前沿模型 GPT5.5xhigh 在证明生成上 UG…
MAGIC:基于 LLM 的转换感知可导航多场景游戏世界生成
MAGIC 是一个四阶段 prompttoproject pipeline,能把"一句话"自然语言需求变成一个可运行的多场景 3D 游戏工程;在 100 例新建 benchmark 上端到端 transition 识别 F1 达 0.96,且全部产出可执行项目,显著优于 LLM baseline 与 Holodeck。…
Vinci2:从连续第一人称视频中提供主动式协助
Vinci2 把端侧第一人称助手从"被动响应"推进到"主动介入":把"什么时候该主动说话"建模为依赖上下文的决策问题,并同时发布了一个新的基准 EgoServe(3000 个服务实例、4 个时间记忆视野、10 个服务类别)和一个免训练、记忆增强的 agent EgoMemo(多尺度时间摘要 + 语义知识图谱 + 视觉嵌…
SynthDocBench:面向长上下文视觉文档理解的受控基准
SynthDocBench 是一个全合成的长上下文视觉文档理解基准,通过组合式设计(combinatorial design)独立控制文档长度、布局结构、模态构成与问题类型,并在 7 个前沿 VLM 上揭示出现有 benchmark 看不见的三类失败模式:长度剧退化、中段位置敏感、图表理解崩溃。 Vision Lang…
Multi-Agent LLMs 未能互相探索
现代 LLM Agent 在互相交互时表现出短视(myopic)和极化(polarized)的行为模式,无法有效探索彼此的能力边界;MACE(MultiAgent Contextual Exploration)通过结构化的对等体选择机制显式促进探索,显著提升多 Agent 协作任务中的探索行为和下游表现,并从理论上证明…
无标签策略下,准确率与顺序敏感性并不一致
在多选题评测中,遮挡选项标签并不能可靠地提升 LLM 准确率——位置偏置与知识是两个独立维度,去偏并不能换来准确率提升,但循环置换打分却常常能。 大模型评测长期依赖多选题基准(MMLU、CEval、ARC 等),但 MCQ 评分混淆了两件不同的事:模型"知不知道"和模型"对选项顺序敏不敏感"。当一个模型把答案从 B 改…
StateM:用 Harness Scaling 在不改模型权重的前提下,把 GPT-5.6 推到 Terminal-Bench 2.1 的 95.3%
StateM 是一个围绕"持久化 state + phaselocal 上下文 + 受检 transition + 可恢复 runbook + 版本化流程实践"组织的 agentnative runtime,仅靠"围绕 agent 的执行系统"的工程改造(harness scaling),就在 TerminalBenc…
IVT:把"视觉思考"内化进权重,主动视频推理无需在推理时再画图
IVT(Internalized Visual Thinking)是一种后训练框架,在无标签视频上同时优化文本预测与下一 embedding 预测,让模型在训练阶段就把"对未来帧的运动、对象迁移、交互、潜在意图"的预测能力内化进权重——推理时直接输出文本答案,无需生成或重编码中间图像,端到端延迟降低超过 5×。 多模态…
xHC:把残差流扩到 N=16 的可扩展超连接
xHC(Expanded HyperConnections)首次把 Transformer 的残差流真正扩到 N=16:通过「时间特征增强 + 稀疏残差更新 + xHCFlash 内存加速」三件套,在 18B/28B MoE 上比 mHC 平均下游涨 4.0 分、训练 FLOPs 反而低于 vanilla 与 mHC,…
VIABench:面向视障辅助任务的盲人第一人称视频综合基准
VIABench 是一个由视障人士(VIIs)自行录制或分享的第一人称视频构成的综合视频基准,专门用于评估多模态大语言模型(MLLMs)在「视障辅助(Visually Impaired Assistance, VIA)」场景下的实际能力。它定义了三个互补的核心任务——Proactive Reminder(主动提醒)、V…
AI Prototyper:基于分解的 LLM GUI 原型设计 Figma 插件
本文提出 AI Prototyper——一个开源 Figma 插件,把「自然语言描述」经分解(decomposition)+ RAG(retrievalaugmented generation)流水线自动转成可编辑的 Figma 图层;并在渲染前加入人在回路编辑步骤,让用户审阅、修改或扩展生成的功能列表。相较已有分解式…
Agent 在 AutoResearch 上如何失败:100 个真实前沿研究任务的端到端诊断评估
机制 3 段:任务结构(生命周期×领域) + 失败分类法 ARFT(45 类) + 根因诊断(元认知闭环缺失) 工程 2 段:800 条轨迹采集与标注流水线 + humancalibrated agentasajudge 自动归因 ⚠️ 数字核验 3 处:100 任务 / 8 框架模型组合 / 800 轨迹;45 类失…
MOSS-VL 技术报告:把"边说边看"做成一流能力的开源多模态模型
机制 3 段:门控交叉注意力的解码器 / 交互语料监督何时说话何时沉默何时修正 / 离线强基座 + 轻量末端实时阶段 工程 2 段:合成实时交互语料构建 / 五个 checkpoint + 课程 + 推理代码全部开源 ⚠️ 数字核验 3 处:11.3B 参数 / TTFT 优势 2.8×→5.1× / OmniMMI …
DeepSentiBank:基于深度卷积神经网络的视觉情感概念分类
DeepSentiBank(即 SentiBank 2.0)把情感视觉概念建模从"二分类 SVM 检索"推进到"深度 CNN 多标签分类",在 2089 个 ANP(形容词名词对)概念上显著提升标注精度与检索性能,成为视觉情感分析领域第一个被广泛引用的深度学习基线。 视觉情感(visual sentiment)研究的核…
TRACE-Bench:把多参考图像生成拆成"原子算子"再打分
多参考图像生成的现有 benchmark 都按"主体组合、属性绑定、风格迁移"这种表面任务分类,但其实所有任务都能拆成 Anchor / Disentangle / Apply / Compose 四个原子算子的组合;TRACEBench 用这套算子重写评测,跑 9 个 SOTA 模型后告诉业界:真正卡脖子的不是整体构…
GRNEdit:基于"二元证据"的高效通用视频编辑
把视频编辑重新刻画为"对每一比特的"保留 / 翻转"决策",用生成式 Refinement Network(GRN)作为 backbone,仅需 0.6M 训练对、不到 3% 条件参数,2B 模型就能在 OpenVEBench 上跑到 4.03,超过多个 14B 开源编辑器,8B 模型拿到 4.18,与最强开源编辑器打…
面向真实场景 Motion Language Model 的即插即用 2D Motion 接口
把"3D 预训练 → 单目视频不可用"这条死结,用一个即插即用的 2D Motion Interface 拆开:不动 MoLM 权重,就能让 3D 训练过的 Motion Language Model 直接吃 2D 关键点。 Motion Language Model(MoLM)这一波路线想用 LLM 的 token …
WorldRover:面向世界探索任务的、可扩展的、富含标注的合成视频数据引擎
WorldRover 把"长程世界探索"重做为一个可扩展的数据生成问题——基于 Unreal Engine 的离线渲染管线 WorldRoverEngine 能在同一条轨迹上同时输出 firstperson / thirdperson / 360° 三种视角下的 RGB + metric depth + 相机轨迹 + …
Large Discovery Models:基于经验、依托模型驱动的开放式搜索
Large Discovery Models (LDM)把"开放式科学发现"重构为一个生成式模型 + 贝叶斯非参数奖励代理的循环架构:生成器负责提议和精炼候选,代理负责预测性能并量化认知不确定性,二者随每一条新实验观测持续更新;在神经网络训练、抗体设计、分子优化三个场景上,LDM 比 LLM 反思与传统统计搜索分别取得…
ABot-AgentOS:具备终身多模态记忆的通用机器人 Agent 操作系统
论文提出 ABotAgentOS:一个位于底层控制器之上的「deliberative agent 层」,为长程(长期、跨时段)具身 Agent(embodied agent)提供场景条件规划、上下文隔离的技能(skill)执行、多阶段验证、多模态记忆、边云协同这五大运行时能力;同时发布配套评测基准 EmbodiedWo…
LLMs 是否准备好做科学发现?SDABench:面向 AI 科学家的能力导向基准
论文提出 SDABench,把对 LLM 的科学数据分析(SDA)评测从「能否跑通代码/完成 workflow」拆解为六类科学能力(描述、探索、推断、预测、因果、机制)在五个领域(生物、化学、环境、地理、物理)上的细粒度评估;在 527 条真实数据 + 6000 条合成数据上对 15 个代表性 LLM 测试后,得到的核…
读回:预训练 MLLM 是 T2I 生成的零样本奖励模型
论文提出 SpectraReward:一种无需训练的训练无关奖励函数,通过把预训练 MLLM(多模态大模型)直接当成零样本奖励模型来打分文本到图像(T2I)生成结果——做法不是让 MLLM 判断图像「好不好」,也不是回答分解后的验证问题,而是测量「图像能多好地把原始 prompt 读回来」,即用图像条件下的 promp…