解读
1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Chat-Edit-3D++:基于大语言模型的交互式 3D 与 4D 场景编辑
CE3D++ 用 HashAtlas 网络把 3D 编辑变成"2D atlas 图像编辑" + 用 LLM 作为多轮对话调度器自动调用 30 种视觉工具 + 通过轨迹数据集微调扩展到单目 4D 场景,构建了一个支持任意自然语言输入的开源 3D/4D 交互编辑系统。 文本驱动 3D 场景编辑在 20242026 年期间经…
SafeAtlas-VL:超越二元判断的大规模多模态安全数据与防护模型
SafeAtlasVL = 1.5M 训练实例 + 15 类 / 55 亚类危害 + 三目标五级有序量表(图像 / 请求 / 回答)的多模态安全数据集 + SafeAtlasBench(5000 实例 heldout 评测)+ guard models,把多模态安全从二元判断升级到有序评估,并实现跨三目标统一空间。 现…
Super Library Agent:跨单一代码库的多个应用联合生成与维护
LLM 编程 Agent 逐应用生成时会在多个相关代码库间重复共享逻辑,导致代码冗余、废弃代码累积和结构侵蚀。本文定义了 Super Library Agent 问题——让 Agent 顺序生成 N 个相关应用并维护一个跨应用共享组件库——并提出候选引导提取、前置代码库整合和上下文感知迁移三项技术,在 WebGenBe…
评估大语言模型个性化中的隐性代价
个性化信号(用户画像、会话历史、检索记忆)让 LLM 回答更贴合用户,但同时系统性地引入了三类隐性风险——不相关个性化、偏好窄化和谄媚偏差——且这些风险在主流 LLM 中普遍存在,平均恶化幅度达 41.7%~61.7%。 LLM 驱动的 AI 助手正在大规模引入个性化机制:记录用户偏好、维护长期记忆、构建用户画像,以提…
基于 LINE 对话历史的个人记忆 RAG 检索:搜索表示与混合检索评估
机制段:3(搜索表示构建 / 单检索器对比 / 混合权重搜索) 工程段:2(LINE 数据切分 / 评估配对与置信区间构造) ⚠️ 数字核验:4(chunk 数 22,329 / 评估题 100 / Recall@5 0.697 / CI [0.048, 0.184]) 内部代号命中:0 CJK 字数:约 2,950 …
投机解码的"验证感知"训练:把验证机制变成监督信号
机制段:3(投机解码基本流程 / VAT 框架 / 验证自适应加权) 工程段:2(EAGLE3 + DFlash 集成 / Qwen34B/8B + LLaMA3.18B 评估管线) ⚠️ 数字核验:3(acceptance length +11.4% / wallclock +8.7% / 代码 github.com…
大规模智能体:以感知为中心的持久化智能体架构(Pera)
机制段:3(感知控制组件 / 生命周期任务 / Pera 框架结构) 工程段:2(回溯性组织近期工作 / 案例研究结构) ⚠️ 数字核验:2(41 页 / 5 图 / 与软件工程"programming in the large"类比) 内部代号命中:0 CJK 字数:约 3,200 针对现有认知语言智能体框架只服务"…
Configurable Semantic Chunking for Biomedical Information Extraction in Retrieval-Augmented Generation
在 BioMedRAG 的 RAG Pipeline 中,将固定长度 chunk 替换为可配置的语义分块策略(entitypreserving windows + triggercentered chunking 等),在 GMCIHT 关系抽取任务上 F1 从 74.2% 提升至 82.6%,且 chunking 逻…
MNIST-PRO: MNIST as a Partially Observable World for AI Agents
MNISTPRO 将 MNIST 手写数字识别重构为部分可观测环境下的顺序 glimpse 搜索任务,隔离出 AI Agent 的"感知状态构建"能力;测试 10 个多模态模型后发现:全观测下模型性能优秀,部分可观测下暴露三个系统性瓶颈——感知状态整合困难、探索提前终止、错误信念无法修正。 当前 AI Agent 在部…
Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching
Image Bundle Composition(IBC)将图像检索从"逐图打分"重新定义为"动态构图"问题;BundleWeaver 框架以 LLM 为检索规划器(incremental hyperedge discovery)、VLM 为全局验证器,在包含 109,467 张图像和 667 个验证查询的 IBCBe…
PaperBanana-Interact:多轮反馈驱动的科学图表自动精修
PaperBananaInteract 用一套「内循环 critiqueandrefine 多智能体」工作流,把科学图表从一次性生成升级到多轮精修,并在新建的 MTPaperBananaBench(292 图 / 3,518 条用户需求)上相对基线把质量分拉高 11.9–18.6 分、把多轮遗忘率压低 3.7–6.2 …
DreamX-Creator:原生 2K 音视频联合生成的「7B 紧凑民主化」方案
DreamXCreator 1.0 是一个以 7B 参数 DiT 为中心的原生联合音视频生成系统,用「前期独立 + 后期 Gated CrossModal Attention」的双阶段耦合、专用的音视频数据管线(AVDS)、渐进式联合训练和模态感知 RL 后训练,配合一条 自回归 1 步 2K 精修(Autoregre…
OntoAligner-Ensemble:异构本体对齐器之间的投票融合
OntoAlignerEnsemble 是一个对齐器无关的模块化框架,把本体对齐(Ontology Alignment, OA)领域从「挑一个对齐器」升级为「先融合候选对应、再做后筛选」的两阶段决策流程,并在 OAEI 五个赛道的 8 个基准任务上证明了 ensemble fusion 能持续改善 precision–…
滑动窗口注意力(SWA)配 sinks 比 post-training 线性注意力更划算
针对"二次注意力 KV cache 越长越费"的推理成本痛点,Microsoft(ASG)这条工作用纯训练免费的 SWA(w=64, s=4)(只 attend 前 64 个 token + 4 个 attention sink)直接替换 LLaMA 系列推理时的注意力掩码,就在 MMLU/ARC/Hellaswag/…
SymbolLKG:用逻辑知识图谱与符号求解器做可验证逻辑推理
SymbolLKG 提出一种 神经符号(NeuroSymbolic)架构,用本体驱动的逻辑知识图谱(LKG)把"逻辑规则"和"事实约束"建模为图上的一等公民节点,再由 Logic Router 动态分派任务给最适合的符号求解器(Z3 / Prolog / SAT / Datalog 等),同时配合 topologyaw…
CamoDocs:利用伪装文档针对 RAG 系统的投毒攻击
CamoDocs(EMNLP 2026 录用)提出一种针对 RAG 系统的新型数据投毒攻击:把对抗性文档"伪装"在良性内容中,规避现有投毒防御普遍依赖的"query inclusion 检测"。在 7 种 RAG 防御 / 3 个开源 LLM / 3 个 benchmark 上的实验里,CamoDocs 拿到强平均 A…
指路而隐目的地:面向大规模场景的实用化私有稠密检索
把"学到的深度哈希"当作私有过滤器——随机化二进制码只暴露"去看哪一小撮",加密重排 + oblivious key transfer 守住"具体问的是什么、最终拿走哪篇"——在 2.68M 文档的 NQ 全量上,仅为一条 128 token 的 Qwen332B RAG 链路增加 0.73 秒(约 10%),同时显著…
获取、修复、保留:面向小模型对话游戏 Agent 的诊断驱动后训练方案
2B 开源小模型(Qwen3.52B 变体)在 LM Playschool Challenge 的对话游戏里,失败常常不是知识不够,而是"反复猜测、动作格式错、当下反馈刚说就忘"这类局部决策失误——基于这个诊断,作者提出"Acquire / Repair / Preserve"三步后训练方案:先用 SFT 铺游戏参与能…
EvoUndo:面向 LLM Agent 运行环境的可恢复性约束自演化
LLM Agent 越来越会在运行时改自己的 prompt、工具、中间件、资源与执行环境("selfevolution"),但一次成功的变更可能在反事实状态下无法安全回滚——EvoUndo 提出一个用于"表示 / 合成 / 诊断 / 独立验证"自修改可恢复性的框架,在 600 个未见过的单轮自演化任务中识别出 197 …
Fast Weight Attention:用于持续学习的快速权重注意力
Fast Weight Attention(FWA)将循环快速权重记忆(fastweight memory)与选择性状态空间模型的状态转移重新阐释为一种"在线学习规则",并在 readafterwrite 自回归语义下推导出 6 个变体(Falcon1/2/3 回归族 + Falcon1A/2A/3A 内积族),分别针…
CrabOS:用自然语言对象打破人机壁垒——操作系统视角下的人机协同新范式
CrabOS 将工作状态建模为自然语言可读的文本对象,让人类和 AI 共享同一套可审计的接口,实现无需桥接代码的任务交接,使 HumanAI 协同从"应用层 hack"升级为操作系统原生能力。 当前 AI Agent 系统与人类使用着相互隔离的工作环境。当 AI 需要在某个应用(如 IDE、浏览器、数据库)中完成任务时…
LayerRecall: 视频 DiT 分层记忆路由器——让视频生成记住远期角色与场景
LayerRecall 通过对 video DiT 各层"上下文偏好"的差异建模,用一个轻量级路由机制决定从长期记忆中检索什么、注入到哪一层,在不牺牲局部流畅度的情况下显著提升长视频生成中物体身份一致性。 当前长视频生成主要采用分块自回归(chunklevel autoregressive)方案:模型在有限的近期上下文…
LoopArena:将模型作为 Loop 工程运行时控制器的基准评测
LoopArena 提出一个 ControllerWorker 双层 Agent 架构评测基准,测量模型作为「外部 Loop 控制器」引导编码 Agent 完成长程开发任务的能力;最佳 Controller 的 Strict Success Rate 仅为 24.69%,但 Controller 引导相比无控制基线平均…
Agentic Artifact Creation:系统、评估、原则与机遇
本文将「AI 系统实质性构建或修改可交付物」这一行为正式定义为 Agentic Artifact Creation,系统综述了截至 2026 年 8 月 20 日的 259 篇相关工作(230 个系统 + 29 个基准),提出以「操作化表示 + 构建策略 + 运行时验证」三联控制结构为核心的评估框架,并给出保持责任显式…
Locate Anything in Videos:高效生成式时空视频定位的并行管解码
本文提出 Parallel Tube Decoding(PTD):把时空视频定位(STVG)拆为时间块 + 时序条件并行空间块,使顺序解码深度收敛到与管长(tube length)无关的 $1 + 1$ 轮;配套 Decoupled Block Attention 解除框间依赖 + localizationaware …
CritICL:把小模型的失败模式变成大模型的推理时指南针
CritICL 是一个推理时( inferencetime )框架,通过把"同族弱模型的失败模式"转化为"incontext 批判示例",让强模型在不重训、不依赖外部验证器、不做重复采样的前提下提升推理能力,token 成本显著低于 testtime scaling。 推理时扩展( inferencetime scal…
Ring Forcing:让自回归视频扩散模型具备分钟级长期记忆
Ring Forcing 是一套自回归视频扩散框架,通过环形训练 + 时步压缩 + 稀疏 RoPE 三件套,把视频生成模型的有效历史从几十帧拉到"分钟级",在长视频对象永久性( object permanence )与上下文容量( memory capacity )两项指标上同时做到 SOTA。 把扩散模型从 4–16…
J-Zero:无需人工标注的三方博弈自我进化框架,突破不可验证领域的进步瓶颈
JZero 通过 Challenger–Solver–Judge 三方协同进化,用"生成过程已知"(而非"最终得分已知")作为监督信号,使 LLM 在不可验证领域(没有客观参考答案的任务)也能持续自我改进,在可验证和不可验证两类任务上分别比基线提升 4.2 和 8.0 分,且能稳定进化至少十轮。 LLM 自我进化(se…
StepGuard:基于可扩展监督与安全-效用平衡的步骤级 Guardrail
1. 本稿要解决的真问题:LLM Agent 在调用工具时存在三类风险(文件修改 / 信息泄漏 / 未授权操作),但现有 guardrail 主要在"整条轨迹跑完后"做后置评估,对步骤级、preexecution的拦截研究严重不足;同时后置评估常常过防御(false reject 任务)或欠防御(漏放高风险动作)。 2…
Paint What You See:多模态 Agent 的"灵巧视觉工具使用"基准 EASEL
1. 本稿要解决的真问题:多模态 Agent 评测正在从静态 QA 转向"通过外部工具行动"的 agentic 评测,但现有基准(web navigation / GUI 操作 / 软件工程)几乎都不覆盖"视觉证据 → 工具参数 → 最终结果"这种紧耦合的灵巧视觉工具使用能力——一个模型能否从图里读出"在哪里、画多大、…