解读
1091 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
GateMem:多主体共享内存 Agent 的内存治理基准
GateMem 把「多主体共享内存 LLM Agent」这件事从单用户回忆场景拉回到真实的医院、办公室、校园、家庭场景,提出一个同时考察「长程任务效用 + 跨授权边界访问控制 + 显式删除后的主动遗忘」三项联合能力的基准,并据此证明:当前没有任何一种记忆方案能在三者上同时过关。 过去两年大量 LLM Agent 记忆基…
HistoRAG:把史学方法论塞进 RAG 架构
HistoRAG 把史学方法论(信源批判、时段代表性、诠释与发现的区分)翻译成 RAG 架构层面的具体干预——分离检索与生成、强制时间窗均衡、用 LLMasjudge 做可质询的相关性评估——并用 Der Spiegel 19501979 共 ~102,189 篇语料做了实证:默认 RAG 在史学场景下三条都坏。 RA…
IsabeLLM:将自动定理证明应用于共识协议的形式化验证
IsabeLLM 把 LLM 当作 Isabelle / Sledgehammer 自动定理证明器(ATP)的「前级助手」——通过 RAG 提供相关 lemma、用错误追踪 + 反例生成补全失败上下文、并升级到最新版 Isabelle 与 Sledgehammer——最终在「比特币工作量证明共识的形式化验证」这一具体目…
面向上下文感知与关系感知图 RAG 的统一框架
HyGRAG 通过分层图索引 + LLM 生成摘要 + 社区级检索三大设计,在多跳推理任务上平均准确率提升 9.7%,同时保持合理的推理效率,已被 WWW 2026 接收。 传统 Graph RAG 存在两个根本性缺陷:entitycentric(实体中心) 方法以实体为节点组织图,保留了逻辑关系但丢失了原始上下文;c…
Stanford EDGAR Filings Dataset:将美国企业及金融披露重建为版面保真且 token 高效的预训练数据
本文发布 Stanford EDGAR Filings Dataset(SEFD),将 SEC filings 重建为版面保真的 MultiMarkdown,既可作为金融 LLM 的长上下文预训练数据,又衍生出两个评测基准——EDGARForecast(面向模型知识截止后的数值预测)和 EDGAROCR(复杂金融表格转…
ProvenanceGuard:面向 MCP-Based LLM Agent 的来源感知事实性验证
ProvenanceGuard 提出"crosssource conflation"这一新的失败模式——答案在证据池中能被支撑,但被错误归属到了另一个来源;它通过把答案拆成原子声明、按 stable tool/source ID 路由到对应证据、用 NLI + tokenalignment 做支撑判定、再比对"声明的来…
UniMoMo:基于专家合并的大规模推荐模型 MoE 加速
UniMoMo 把"训练好的稀疏 MoE 推荐模型如何压缩到更小的标准 MoE"这件事重新建模为一个带专家预算约束的图粗化问题,围绕"按功能相似度而非参数距离"做专家合并,并配合"高流量专家保护"避免合并塌方;最终在 Amazon Beauty / KuaiRec / TenRec 三个推荐基准、2/4/6 个 MoE…
Decoding-Level Taboo:面向 LLM 鲁棒性的解码级诊断压力测试
DecodingLevel Taboo 提出一种零提示(zeroprompt)的运行时干预式压力测试:在解码阶段直接在 logit 空间把首要候选 token 屏蔽掉,强制模型"绕开"被禁词,从而衡量模型在偏离训练时高度优化路径之后的鲁棒性;论文发现这种鲁棒性与"参数规模 + 后训练指令对齐"呈强相关——模型越大、指令…
InSight-doc:面向长文档理解的 Agent 视觉感知
InSightdoc 把"长文档里的视觉分辨率"建模为自适应的推理时资源:从一个低分辨率整页视图起步,借助一个工具(zoomin tool)选择性放大高分辨率区域抓证据,不依赖任何外部检索器;为训练该 agent 作者团队构建了一个 17.9K 高质量 SFT 语料(带区域级放大轨迹)+ 19.2K 困难 RL 样本的…
Self-Knowledge RAG:让 LLM 自抽专利实体 / 自构本体再做检索匹配
⚠️ paper_card 来源提示:paper_cards/907260811030.md 的 TLDR 字段仅截到 "external knowledge" 一句即被截断;下文所有事实与方法细节均来自 的 abstract 与 IEEE CSCWD 2026 接收信息( PDF、未跑代码、未复现实验。涉及具体数据集…
幂律图注意力:缩放点积注意力的精确泛化,推理时出现经验性坍缩
把 Transformer 中固定的缩放点积注意力(SDPA)替换为输入生成、可学习的"幂律图注意力(PLGA)",并给出 PLDRLLM 全架构;当 G=I 时 PLGA 严格等于 SDPA,且在推理时被证明会因"输入不变性"坍缩回广义 SDPA。 自检:机制段 4 / 工程段 2 / ⚠️ 数字核验 1(Lean …
Nature-Inspired 元启发式算法综述:群智 / 生物 / 物理 / 化学四条启发源
这篇 2013 年的短综述把"自然启发的元启发式算法"按灵感来源(swarm intelligence / bioinspired / physicsbased / chemistrybased)切成四大类,用一张相对完整的清单把当时散落在各处的算法收编进同一框架——它本身不发明新算法,而是一张地图,后续二十多年优化领…
Attention-Sensitive Alerting:用效用推理权衡"延迟通知"与"中断打扰"
Horvitz 这篇 1999 年 UAI 论文(2013 年上 arXiv)把"通知该不该打断用户"从 UX 工程问题重构为一个期望效用最大化决策问题——在 defer 成本(错过重要信息) 与 interruption 成本(打断心流) 之间做贝叶斯推理;它落地的产物就是微软 Outlook 里的 Prioriti…
GigaChat Audio:时间感知的大音频语言模型
作者提出了一个能处理最长 120 分钟音频、并在回答中显式带时间戳的音频 LLM。关键做法是把"周期性时间标记"与"连续音频 token"交错排布,并用一条级联 pipeline 做大规模合成监督。模型在短、长时间定位 benchmark 上都拿到强准确率,并支持时间锚定的片段描述与摘要。 音频条件 LLM(Audio…
Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination
GraphPRefLexOR 通过在 LLM 推理中引入图结构(知识图谱)和分阶段显式推理(<brainstorm → <graph → <patterns → <synthesis),用 GRPO 微调实现科学假设的可追溯生成,在材料科学和力学问题上比基线模型提升 4065%,语义多样性扩大 23 倍。 大模型在开放…
360CityArena:在 360° 重建的秋叶原街区上考 LMM 具身导航
ECCV 2026 投稿 360CityArena 把"具身智能体在真实城市街区中的导航与推理"做成了一个以 360° 视频重建的高真实感基准:秋叶原 85 条街、602 段全景视频、175 道人工任务,覆盖环境理解 / 路径推理 / 空间推理三类;结果给整个 LMMagent 圈泼了一盆冷水——最强 Gemini 2…
Decision Transformer:通过序列建模做强化学习
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 1 处("matches or exceeds SOTA" 的具体分数未在 abstract 中给出)。 Decision Transformer 把离线强化学习(offline RL)改写成一个条件序列建模问题:用 GPT 风格的 causal Transfo…
Minerva:用语言模型解决定量推理问题
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 1 处(论文未给具体百分比 / 题量 / 推理时延,abstract 只说"nearly a third")。 Minerva 是 Google 用 8B / 62B / 540B 参数规模的 PaLM 变体,在自然语言 + arXiv 风格的「技术语料」上继续…
系统化报告机器学习能耗与碳足迹
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 1 处(论文 abstract 未给能耗 / 碳排放的具体数字指标)。 Henderson 等(Stanford / MILA 等)提出了一个 ML 碳排放与能耗记账框架,配套一个实时追踪库(后来成为 codecarbon)和标准化在线附录格式,并以「强化学习」…
PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 2 处(被引数 / 12 数据集 SOTA 边界)。 PEGASUS 提出"GapSentence Generation(GSG)"自监督预训练目标——把文档里"最重要"的句子整体 mask 掉,让 Transformer 编码器解码器从剩余句子中把它们生成出来…
A Survey on Multi-Task Learning
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 2 处(被引数 / 期刊状态)。 这篇 IEEE TKDE 综述按"算法建模 + 应用 + 理论"三轴对 MultiTask Learning(MTL)做了系统分类,把 MTL 算法归入五大族(feature learning / lowrank / task …
Towards A Rigorous Science of Interpretable Machine Learning
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 2 处(被引数 / 历史版本)。 这是一篇给「可解释机器学习」立学科规范的位置论文(position paper):先定义 interpretability、再回答"何时需要 / 何时不需要",最后给出可复现的评估 taxonomy,是 2017 年之后几乎所有…
基于半自动化内容可信度检测的帕累托最优重排序
本文把"信息流可信度"建模成对原排序的双目标优化:用 Spearman's footrule distance 保住原排序形态,再叠加一条"期望可信度"的线性目标,从而在 Pareto 前沿上找到改动最小、却能显著提升内容可信度的重排序方案;并配套一条"检索增强打分 + 人工事实核查"的半自动化可信度标注流水线,让该方…
Scaling Instruction-Finetuned Language Models
FlanPaLM 通过在大规模任务集上做 Instruction Finetuning,将 LLM 的零样本/少样本泛化能力推至 SOTA 水平,540B 模型在 MMLU 上达到 75.2%(5shot),并开源了 FlanT5 全系列(80M~11B)供社区使用。 GPT3 以来,LLM 已经展现出强大的 InCo…
Momentum Contrast for Unsupervised Visual Representation Learning
MoCo 将无监督视觉表征学习建模为「动态字典查询」,通过动量更新的查询编码器和队列机制,在不需要任何人工标签的情况下学习到可迁移到下游检测/分割任务的强大视觉特征,在 7 项任务上超越了同期 ImageNet 有监督预训练的表现。 在 NLP 领域,无监督预训练(GPT、BERT)已经取得了巨大成功,但 Comput…
EvolvingWorld:让角色与世界共同演化的开放式文学世界框架
EvolvingWorld 把"交互式文学世界模拟"重新定义为长视野的角色世界共同演化过程:不再做静态人格扮演,也不再做孤立的场景生成。它用一个 openschema 框架 容纳任意世界观,内部由「Character Agent(多角色扮演 + 人设持续演化)」与「LLM 驱动的 World Model(全局/地点/实…
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
TimeLens2 通过将时序证据建模为区间集合(interval set)并用 temporal Wasserstein 奖励提供密集反馈,让一个多模态 LLM 在任意长度、领域、查询形式和视角的视频中精准定位多段支持性证据片段,在多项基准上超越参数量高达 397B 的开源模型。 Video MLLM 已经能描述视频…
Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
TOPL(TokenLevel OffPolicy Labeling)将 posttraining 重构为逐 token 正确性预测任务,通过训练模型区分"好 token"和"坏 token"来引导模型生成优质回答,在 11 个 summarization 数据集上实现强跨分布泛化,并证明 token 级学习信号是成功…
PixelEyes:解耦感知与推理以实现精准视觉证据定位
PixelEyes 针对多轮视觉推理中 MLLM 反复定位失败、推理轨迹冗长的问题,首次提出将 reasoner(推理器) 与 perception tool(感知工具) 显式解耦:reasoner 决定"要找什么",specialized perception tool 回答"在哪里",通过 maskguided v…
基于非对称互变分学习的多模态连续推理
AMVL 提出 Asymmetric Mutual Variational Learning,通过双向 KL 散度校准目标——前向 KL 让 prior 去匹配 posterior(获得推理方向),反向 KL 约束 posterior 不 collapse(防止答案泄漏),在 BLINK 复杂推理基准上平均得分提升 +…