解读
1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
AgentCompass:把 Agent 评测拆成 Benchmark / Harness / Environment 三层的统一基础设施
本文提出 AgentCompass——一个开源、轻量、可扩展的 LLMAgent 评测基础设施。它把整个评估流程拆成 Benchmark / Harness / Environment 三个独立组件,配上容错异步 runtime 与轨迹分析工具,原生支持 20+ 个 benchmark、五大能力维度,让团队不必再为"换…
RxBrain:具备语言-视觉联合推理与想象的具身认知基础模型
提出 HyEmbodiedRxBrain,用一套多模态 MixtureofTransformers 架构把"语言视觉联合推理与想象"塞进同一段规划序列,并以视频自动化流水线构造"文本规划+视觉状态对齐"的训练监督,使模型在无需大规模动作数据预训练的前提下具备真机操作能力。 具身智能长期存在两种割裂的范式: 1. VLM…
把秘密写在上下文里,模型替你悄悄泄露——Inadvertent Context Leakage
论文揭示了一种系统性的"非对抗性"上下文泄露:把 2 位/4 位秘密(密码片段、SSN 段、卡号段等)放进模型上下文,模型即便在直接询问时拒绝输出,也会把秘密信息以"统计相关性"的形式泄露到日常无害输出里;8 个商用模型在受控实验中,2 位秘密几乎可被完美重建,4 位秘密 82% 精确匹配,且更强的指令遵循能力反而放大…
Repo0:从自然语言一路生成整库的"设计驱动"代码 Agent
Repo0 把"从需求建一个完整软件仓库"这件事从单轮 LLM 直生成,升级为先维护一张显式架构状态(DualDAG),再用模块化指标驱动的结构演化收敛到一个稳定架构,最后才进入 TDD 代码生成;在 RepoCraft 6 个真实仓库上比最强基线 RPG 的 Functionality Coverage 提升最多 2…
FlashPrefill V2:把 block-sparse 预填充推到生产的注意力后端
FlashPrefill V2 用"均值修正 + PackGQA/warp specialization/pingpong 流水线 + paged KV/continuous batching"三件套,把 blocksparse 预填充从算法原型推到生产可用的 attention 后端,在 H20 GPU、128K 上…
让 LLM 用低资源语言思考:SFT 搭骨架、RL 修缺陷、准确率却看不到的变化
把三个前沿 MoE 模型(Alibaba / OpenAI / NVIDIA 各家,激活参数 3.64.0B)微调到用希腊语这种低资源语言推理,准确率 benchmark 几乎不动——因为 benchmark 本身在该尺度上噪声太大(仅换随机种子就能移动 7.7 分,比所有数据/配方效应都大);真正的变化藏在"准确率看…
4DAnyone:单目视频生成"可重建级"多视角,再提升到 4DGS
4DAnyone 把"单目视频 → 4D 人体重建"拆成两步——先用相机可控视频扩散模型生成"可重建级"的多视角一致视频,再把这些视频提升到 4D Gaussian Splatting(4DGS);针对 DiT 单次前向注意力容量有限导致的"分组建模"瓶颈,分别用 Reference Context Packing(把…
NARU:面向日语超长视频的叙事演进与文化微妙理解基准
NARU 是一个针对日语长视频的「叙事演进 + 文化微妙」双轨评测基准:1481 道题、155 段视频、共 146.8 小时,横跨 4 个叙事维度与 5 个文化维度,揭示现有 MLLM 在长程叙事整合与文化语境推理上同时存在显著短板。 长视频理解评测长期被两类任务统治:孤立事件检索(谁在第几分钟推开门)和显式动作问答。…
NAPE:用「下一段嵌入预测」做极简自监督音频学习
NAPE(NextAudioPatchEmbedding prediction)把 LLM 时代「下一 token / 下一 embedding 预测」的因果范式搬到 logmel 频谱上:只用一个因果 Transformer + causal mask + stopgradient,无重建解码器、无声学 tokeni…
超越记忆:面向长寿 AI Agent 的事务性连续性内核
Continuity Kernel(CK)将 AI Agent 的长期状态管理从"存储保留"升级为"带权限验证的正式激活协议",以分支头谱系代替版本号、以原子事务代替直接覆写,为跨越多年运行的 Agent 提供 Persistent Cognitive Identity(PCI)基础设施。 当一个 AI Agent 持…
基于 Skill-Harness 演化的自演化具身智能体
SHAPER 提出免训练(trainfree)的具身智能体自适应框架:冻结 VLA 模型的权重参数,通过目标环境 rollouts 演化可复用的文本 skill 与 contextcode harness,让同一个冻结模型既能做规划器(planner)又能做优化器(optimizer)。 将基础模型部署到具身智能体时,…
利用检索增强 LLM 构建用于复杂系统诊断的动态主逻辑知识图谱
KGDML 框架将 RAG 与 LLM 结合,实现从技术文档自动构建动态主逻辑(Dynamic Master Logic)知识图谱,使 LLM 能对核电站级复杂系统进行可追溯的诊断推理——包括故障传播方向推断、安全性评估和依赖追溯。 Complex engineered systems(核电站、飞机引擎、工业控制系统)…
量化 ASR 模型对公开基准的"过拟合":从行为探针到因果干预
自检:机制 1 段 + 工程 2 段(行为探针 + 因果干预)+ ⚠️ 数字核验 3 处 + 反方 1 段 + 跨主线合流节点 1(v33 评测治理)。 公开 ASR(Automatic Speech Recognition,自动语音识别)基准(LibriSpeech / CommonVoice / GigaSpeec…
Chain-of-Experience:让 LLM 在推理时持续从经验中改进
ChainofExperience(CoE)把"LLM 在测试时通过多轮交互累积经验、形成超越 zeroshot 的持续改进回路"作为一类正式问题建模,并用 8 个主流 LLM(含 GPT5 / Gemini2.5 Pro / Claude4.5 Sonnet)在数学、编程、知识三类任务上验证:仅靠自反馈就能稳定超越无…
SWE-bench Science:科学软件工程是否仍是 Coding Agents 的硬骨头
SWEbench Science 用 119 个真实科学软件工程任务(来自 98 个 GitHub 仓库、跨 20 个科学领域)建立仓库级评测基准,结果显示最强编码 Agent(Claude Code + Opus5 max)pass@1 也低于 50%;同时通过配对消融证明:科学知识并不总是正面增益——对齐良好的领域…
Self-Improvements in Modern Agentic Systems: A Survey
这篇 97 页综述将现代具备自我改进能力的 Agent 建模为"基础模型 + 运行支撑层"(prompt / memory / tools / 控制逻辑)的耦合配置,把 selfimprovement 形式化为一个自我驱动的更新算子,可作用于模型权重或 scaffold 组件,为理解、设计和评测 Agent 自我改进系…
KeyFrame-Compass:迈向关键帧条件视频生成的综合评估
KeyFrameCompass 是首个面向"关键帧条件视频生成(keyframeconditioned video generation)"的综合评测基准与自动化打分框架,将关键帧执行拆成 6 个互补指标,并用证据驱动的 MLLM 判定整体视频质量,揭示了当前 9 个主流系统在"忠实执行关键帧"与"自然视频合成"之间存…
DeepLoop:循环 Transformer 的深度扩展
DeepLoop 给"循环 Transformer(Looped Transformer)"提供了一套与参数访问次数对齐的残差缩放规则(residual scaling rule),通过一个一阶扰动上界与"访问对齐系数 κ_R"推导得到:当循环次数 N 增加时,PostLN DeepNorm 的指数必须从 1/4 上升…
Function-Aware Fill-in-the-Middle:面向 Coding Agent 基础模型的中期训练
本文提出 FunctionAware FillintheMiddle(FIM) 作为 Coding Agent 基础模型的中期训练(midtraining) 自监督目标:通过程序依赖图分析与"复杂度可推断性"双重标准筛选可遮蔽函数,让 Qwen2.5CoderInstruct(7B/14B)与 Qwen38B 在 SW…
SCAR:面向高效上下文扩展的语义连续性感知检索
SCAR(Semantic ContinuityAware Retrieval)是一种自适应相邻分块扩展策略:它把"是否把邻居分块并入上下文"这一问题,转化为一个相对查询相关性的决策——只有当邻居与查询的相关性接近当前最相关分块时才扩展,从而在边界碎片化场景下用更少的分块恢复更高的召回率,并且同一条规则无需重训就能在不…
Islamic LLMs:从知识获取到可信、抗幻觉 AI
这是一篇针对 Islamic LLM 与可信 Islamic AI 的综述论文,核心论点是:阿拉伯语流利度 ≠ Islamic AI 能力——构建可靠的伊斯兰领域 LLM 需要权威语料、检索与验证模块、引用感知生成、madhhabaware 推理、专家评估和面向忠实度/源有效性的基准,并据此提出抗幻觉 Islamic …
SwiftCache:面向多轮对话的高效 LLM Serving(异构 KV Cache 共享)
SwiftCache 是一个协同推理系统:在同一台服务器内,让 KV cache 需求不同的异构 LLM 通过 NVLink 共享彼此闲置的 GPU 显存与带宽,高需求模型把前缀 KV cache 卸载到低需求模型"捐赠"的显存中,避免慢速 PCIe 传输;同时只把"当前活跃层"的 KV cache 留在本地显存,进一…
MuseCPEval:音乐编辑系统的"上下文保留"多面评估框架
首次系统提出"音乐上下文保留(MuseCP)"概念与 MuseCPEval 评估框架,把"编辑过程中哪些音乐面应保持不变"拆为四大类并配以细粒度指标,再通过客观验证 + 人为研究 + 案例研究三路证明其有效性,从而把音乐编辑系统的评估从"改得好不好"推进到"该留的有没有留住"。 音乐编辑系统近年能力飙升:音色迁移、乐器…
MissDiag:KGQA 与 KG-RAG 中不完整知识鲁棒性的诊断式评估
MissDiag 是一个面向 KGQA / KGRAG 的"诊断式"鲁棒性评估框架:它把"删证据后系统表现下降多少"这一聚合指标拆解为"缺失证据的类型 × 被评估系统的响应 × 答案匹配协议的敏感度"三个轴上的归因分析,用结构化缺损算子(typed missingness interventions)对同一 bench…
VA-Judger:从人类偏好反馈学习联合音视频生成的奖励模型
VAJudger 是首个面向联合音视频生成(Joint VideoAudio Generation)的"思维链 + 维度分解"奖励模型:通过 VAPref10K(9K 提示 / 10.3K 细粒度对比)和 VAJudgerBench 两套数据,配合三阶段训练(清晰偏好对 → 近质量对的拒采解释蒸馏 → 维度分解 RL)…
Bounded Agents:多 Agent 系统的委派安全架构
把 Agent 的每一次工具调用放进一条"代理主链(Agentic Principal Chain, APC)"中做六项授权检查,并用组合闭包阻止跨调用的危险组合,让提示注入风险从"模型问题"被重写为"授权架构问题"。 LLM Agent 在一次会话中通常被授予一组静态权限,每个请求被独立放行。然而真实攻击并非单次请求…
When More Cores Hurts: HPC环境中向量数据库扩展悖论
在 HPC 超算集群上对 Qdrant、Milvus、Weaviate 三种 SOTA 向量数据库的规模化评估揭示了一个反直觉的"扩展悖论":增加核心反而可能降低查询吞吐,从 16 worker 扩展到 256 worker 仅获得 5.46 倍的性能提升,远低于理想的 16 倍线性扩展。 向量数据库(Vector D…
Stratum: Agent 生成流水线的 Rust 高性能运行时
Stratum 是一个统一系统基础设施,将 Agent 生成流水线的执行与规划和推理解耦,通过编译批量流水线为优化执行图并由新型 Rustbased runtime 高效执行,在大规模 MLE Agent 场景下实现最高 16.6 倍加速。 LLM 驱动的机器学习工程(MLE)Agent 已经能够自动生成、验证和优化完…
FROAV: RAG 观察与 Agent 验证的统一框架
FROAV(Framework for RAG Observation and Agent Verification)是一个开源研究平台,通过将可视化工作流编排、多阶段 RAG 流水线、"LLMasaJudge"评估体系与可扩展 Python 集成结合,降低 LLM Agent 研究的门槛——让研究者专注于假设验证和算…
Tangram:为多轮 LLM Serving 解锁非均匀 KV Cache 压缩
Tangram 是一套面向多轮对话场景的 LLM serving 框架,将原本在运行时动态处理的「非均匀 KV Cache 预算」全部提前到调度期静态解析,在不损失精度的前提下端到端吞吐量较全 KV 基线最高提升 2.6×,首次让非均匀 KV Cache 压缩在生产 vLLM 栈中真正可用。 多轮 LLM servin…