解读
1758 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
TRAP:把「任务完成 vs 隐私泄露」的不可调和 trade-off 钉死,并给出唯一出路
论文提出 TRAP(Taskcompletion and Resistance to Active Privacyextraction) 这一基准,并给出一个有点反直觉的硬结论:只要模型还用 softmax 输出 token,任何「软约束」防御(prompt / 系统提示 / 拒绝规则)都不可能同时做到「高任务成功 +…
Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement
仅在仿真中训练、以物体位姿(object pose)为条件学习修正策略,无需任何真实机器人数据或额外演示,即可将 VLA 零样本从 42% 成功率提升至 76%。 VisionLanguageAction(VLA)模型通过海量互联网数据预训练,已具备一定的跨任务泛化能力,但其底层策略依赖 Imitation Learn…
ScanNet:为 RGB-D 室内场景理解打造的"工业化数据集"
ScanNet 用一套易扩展的 RGBD 采集 + 自动重建 + 众包语义标注流水线,构建了 1513 个室内场景、2.5M 视角、含 3D 相机位姿、表面重建与逐体素语义标签的数据集,把"小作坊式 3D 场景数据"升级为可驱动 SOTA 的工业级基准,并在 3D 物体分类、语义体素标注、CAD 模型检索三个任务上一举…
Toolformer: Language Models Can Teach Themselves to Use Tools
Toolformer 证明 LLM 可以在完全自监督的方式下自主学会调用外部工具(如计算器、搜索引擎、翻译系统),零样本性能大幅提升,且不损失原有语言建模能力——这标志着 Tool Use 从"人类手工设计"走向"模型自主习得"的转折点。 LLM 的一个根本性悖论:规模化能带来强大的泛化推理能力,却在精确算术和实时 f…
VQA (Visual Question Answering):把「图像 + 自然语言问答」变成可评测的视觉推理任务
Antol、Agrawal、Yang、Batra 等 21 位作者集合 CV、NLP、ML 三方力量,构建并系统化定义了 VQA 任务:给定图像 + 自然语言问题,输出自然语言答案;公开了一个约 26.4 万图 / 76 万问 / 1000 万答的视觉问答基准(VQA v1.0),并配套了视觉语义推理可量化评测的协议和…
SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History
SkillHone 通过持久化 Agent 决策历史,将 skill 进化从"单次优化"升级为"跨会话积累",无需预置搜索栈即可在 GAIA 基准上领先商业 Deep Research Agent 15.8 分,并实现平均 18.8 分的内部工具分析场景提升。 大模型 Agent 的 skill(任务特定程序、脚本、参…
在共享工作空间的人机协作中寻找协同效应
把「协作结构」而不是「成员能力」摆到变量表的第一位——同样的总能力,搭出三种协调模式,团队产出天差地别:没有协调结构的扩员甚至会拉低性能,而加入共享记忆 + 人在环审核的双层支架后,三人会提升最显著。 近两年 Agent 在 benchmark 上突飞猛进,但只要进入真实组织环境,多人 + 多 Agent 协同时经常出…
AI Agent 的运行时合规验证(C-Trace)
CTrace 是一个把 GDPR 的若干关键要求(同意、目的限制、数据最小化、被遗忘权)编码成针对 Agent 执行轨迹的正式策略谓词,并在运行时拦截每一次工具调用、模型输出的验证框架;用 DSPy 生成 + 红队语料拼接的攻击对话去测,4 个 GDPR 重构的 case study 中:在每类别 ≤10% 的抽取噪声…
The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
多模态 LLM 的「图文思考」范式(如 cropandzoom)在准确率上取得了边际提升,但通过因果图审计发现:大多数情况下返回的视觉证据对最终答案没有因果效应——这本质上是一种「视觉工具使用的幻象」。 「thinkingwithimages」(以图推理)已成为多模态 Agent 的标配范式:模型主动执行 crop、z…
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
OpenART 通过环境演化与 EMHA 攻击策略,在 50 个领域、超过 10,000 个有状态场景中对 AI Agent 安全进行了系统性红队评估,揭示了 Agent 运行时实现方式对安全性的影响远超底层模型本身——_pooled ASR 达 85.0%_。 现有 Agent 安全基准聚焦于短时、静态任务,无法捕捉…
AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
AtlasVLA 通过双记忆架构(4D 持久化世界状态记忆 + 自我工作状态记忆)解决了 VLA 模型在单目摄像机下的「感知遗忘」与「任务进度遗忘」问题,在 LIBEROLong 和真实世界长时序任务中分别提升 9.4% 和 17.5% 的成功率。 VLA(VisionLanguageAction)模型是当前 Embo…
当 LLM 玩起剧本杀:长程一致性基准 NCP-Bench 撕开"语言流畅 = 逻辑一致"的幻觉
自检:机制 2 段 + 工程 2 段 + ⚠️ 数字核验 3 处(survival rate 42% / fact conflict 4068% / 100 叙事 / ICML 2026 accepted)。全文基于 arXiv abstract 公开内容,未下载 PDF。 NCPBench 把"叙事一致性"从感觉层面…
手部关键点可见性检测器:把"被遮挡"这件事从辅助信号升级成独立任务
自检:机制 2 段 + 工程 2 段 + ⚠️ 数字核验 2 处(GitHub 链接 / 数据集未在 abstract 量化)。全文基于 arXiv abstract 公开内容,未下载 PDF。 Hand Visibility Detector 把"手部每个关键点是否被遮挡"从 HPE(Hand Pose Estima…
Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer QA — v2 精修覆盖
自检:机制 4 段(任务形式化 / 评测方法学 / 12 支系统技术路径 / leaderboard 状态)+ 工程 3 段(多语言切块 / 跨语言检索 / 答案生成)+ ⚠️ 数字核验 6 处(256 题 / 32 公司 / 5 语言 / 12 系统 / ROUGE1 macro / 前 4 名 1pp 差距)+ 反…
EvoX Genesis:让"软件项目"长寿,让"Agent"短命
自检:机制 3 段 + 工程 3 段 + ⚠️ 数字核验 5 处(250k tracked lines / 120h / 1000+ episodes / $44 / 1.55–6.87× speedup / ICML 投稿状态)。全文基于 arXiv abstract v2 公开内容,未下载 PDF。 EvoX Ge…
GateMem:多主体共享内存 Agent 的内存治理基准
GateMem 把「多主体共享内存 LLM Agent」这件事从单用户回忆场景拉回到真实的医院、办公室、校园、家庭场景,提出一个同时考察「长程任务效用 + 跨授权边界访问控制 + 显式删除后的主动遗忘」三项联合能力的基准,并据此证明:当前没有任何一种记忆方案能在三者上同时过关。 过去两年大量 LLM Agent 记忆基…
HistoRAG:把史学方法论塞进 RAG 架构
HistoRAG 把史学方法论(信源批判、时段代表性、诠释与发现的区分)翻译成 RAG 架构层面的具体干预——分离检索与生成、强制时间窗均衡、用 LLMasjudge 做可质询的相关性评估——并用 Der Spiegel 19501979 共 ~102,189 篇语料做了实证:默认 RAG 在史学场景下三条都坏。 RA…
IsabeLLM:将自动定理证明应用于共识协议的形式化验证
IsabeLLM 把 LLM 当作 Isabelle / Sledgehammer 自动定理证明器(ATP)的「前级助手」——通过 RAG 提供相关 lemma、用错误追踪 + 反例生成补全失败上下文、并升级到最新版 Isabelle 与 Sledgehammer——最终在「比特币工作量证明共识的形式化验证」这一具体目…
面向上下文感知与关系感知图 RAG 的统一框架
HyGRAG 通过分层图索引 + LLM 生成摘要 + 社区级检索三大设计,在多跳推理任务上平均准确率提升 9.7%,同时保持合理的推理效率,已被 WWW 2026 接收。 传统 Graph RAG 存在两个根本性缺陷:entitycentric(实体中心) 方法以实体为节点组织图,保留了逻辑关系但丢失了原始上下文;c…
Stanford EDGAR Filings Dataset:将美国企业及金融披露重建为版面保真且 token 高效的预训练数据
本文发布 Stanford EDGAR Filings Dataset(SEFD),将 SEC filings 重建为版面保真的 MultiMarkdown,既可作为金融 LLM 的长上下文预训练数据,又衍生出两个评测基准——EDGARForecast(面向模型知识截止后的数值预测)和 EDGAROCR(复杂金融表格转…
ProvenanceGuard:面向 MCP-Based LLM Agent 的来源感知事实性验证
ProvenanceGuard 提出"crosssource conflation"这一新的失败模式——答案在证据池中能被支撑,但被错误归属到了另一个来源;它通过把答案拆成原子声明、按 stable tool/source ID 路由到对应证据、用 NLI + tokenalignment 做支撑判定、再比对"声明的来…
UniMoMo:基于专家合并的大规模推荐模型 MoE 加速
UniMoMo 把"训练好的稀疏 MoE 推荐模型如何压缩到更小的标准 MoE"这件事重新建模为一个带专家预算约束的图粗化问题,围绕"按功能相似度而非参数距离"做专家合并,并配合"高流量专家保护"避免合并塌方;最终在 Amazon Beauty / KuaiRec / TenRec 三个推荐基准、2/4/6 个 MoE…
Decoding-Level Taboo:面向 LLM 鲁棒性的解码级诊断压力测试
DecodingLevel Taboo 提出一种零提示(zeroprompt)的运行时干预式压力测试:在解码阶段直接在 logit 空间把首要候选 token 屏蔽掉,强制模型"绕开"被禁词,从而衡量模型在偏离训练时高度优化路径之后的鲁棒性;论文发现这种鲁棒性与"参数规模 + 后训练指令对齐"呈强相关——模型越大、指令…
InSight-doc:面向长文档理解的 Agent 视觉感知
InSightdoc 把"长文档里的视觉分辨率"建模为自适应的推理时资源:从一个低分辨率整页视图起步,借助一个工具(zoomin tool)选择性放大高分辨率区域抓证据,不依赖任何外部检索器;为训练该 agent 作者团队构建了一个 17.9K 高质量 SFT 语料(带区域级放大轨迹)+ 19.2K 困难 RL 样本的…
Self-Knowledge RAG:让 LLM 自抽专利实体 / 自构本体再做检索匹配
⚠️ paper_card 来源提示:paper_cards/907260811030.md 的 TLDR 字段仅截到 "external knowledge" 一句即被截断;下文所有事实与方法细节均来自 的 abstract 与 IEEE CSCWD 2026 接收信息( PDF、未跑代码、未复现实验。涉及具体数据集…
幂律图注意力:缩放点积注意力的精确泛化,推理时出现经验性坍缩
把 Transformer 中固定的缩放点积注意力(SDPA)替换为输入生成、可学习的"幂律图注意力(PLGA)",并给出 PLDRLLM 全架构;当 G=I 时 PLGA 严格等于 SDPA,且在推理时被证明会因"输入不变性"坍缩回广义 SDPA。 自检:机制段 4 / 工程段 2 / ⚠️ 数字核验 1(Lean …
Nature-Inspired 元启发式算法综述:群智 / 生物 / 物理 / 化学四条启发源
这篇 2013 年的短综述把"自然启发的元启发式算法"按灵感来源(swarm intelligence / bioinspired / physicsbased / chemistrybased)切成四大类,用一张相对完整的清单把当时散落在各处的算法收编进同一框架——它本身不发明新算法,而是一张地图,后续二十多年优化领…
Attention-Sensitive Alerting:用效用推理权衡"延迟通知"与"中断打扰"
Horvitz 这篇 1999 年 UAI 论文(2013 年上 arXiv)把"通知该不该打断用户"从 UX 工程问题重构为一个期望效用最大化决策问题——在 defer 成本(错过重要信息) 与 interruption 成本(打断心流) 之间做贝叶斯推理;它落地的产物就是微软 Outlook 里的 Prioriti…
GigaChat Audio:时间感知的大音频语言模型
作者提出了一个能处理最长 120 分钟音频、并在回答中显式带时间戳的音频 LLM。关键做法是把"周期性时间标记"与"连续音频 token"交错排布,并用一条级联 pipeline 做大规模合成监督。模型在短、长时间定位 benchmark 上都拿到强准确率,并支持时间锚定的片段描述与摘要。 音频条件 LLM(Audio…
Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination
GraphPRefLexOR 通过在 LLM 推理中引入图结构(知识图谱)和分阶段显式推理(<brainstorm → <graph → <patterns → <synthesis),用 GRPO 微调实现科学假设的可追溯生成,在材料科学和力学问题上比基线模型提升 4065%,语义多样性扩大 23 倍。 大模型在开放…