解读
1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Forecast Collapse:当时间序列基础模型在金融上"塌方"
Forecast Collapse 是一组"看似正常预测实则无效"的现象在做 1000 只美股的逐时收益预测时,TimeSeries Foundation Models(TSFMs)和 12 个传统深度学习预测模型普遍给出接近平的预测结果,横截面相关性接近零;本文溯源到 calibrationranking trade…
MobileMem:一年移动使用经验之上的端侧长记忆基准
MobileMem 是浙江大学 / OpenKG 团队发布的端侧长记忆 benchmark 与框架,把"一年时长的移动端用户使用轨迹"通过知识驱动的合成流水线变成可评测的多模态长程任务,覆盖多跳推理、时序推理、知识更新、隐式偏好推断四类问题;目标是把 agent 从"答孤立问题"逼到"记住过去、理解当下、面向未来",把…
MMDiff:多模态大模型的特征级"差异审计"与可控干预
MMDiff 把稀疏自编码器(SAE)从纯文本 LLM 解释工具拓展为多模态 LLM 的"特征级接口",通过对比 baseLM SAE 与多模态适配后 SAE 的差异,定位、验证并主动控制由多模态训练引入的视觉相关特征;在 LLaVAMORE、PaliGemma 2、InternVL3.5 三个 MLLM 家族上,移除…
LOPD:让"特权上下文"自己长出来——面向自演化 Agent 的潜在 On-Policy 自蒸馏
LOPD(Latent OnPolicy SelfDistillation)把 onpolicy 自蒸馏中"teacher 用什么特权上下文"这个核心设计选择从人工指定改为端到端可学习:teacher 端通过检索历史经验拼成连续 latent tokens 作为特权上下文,student 端在自己的轨迹每个 visit…
PRM-as-a-Judge 1.5:机器人过程评估工具箱
PRMasaJudge 1.5 把机器人 rollout 视频转成 dense progress curve,用三条失败/恢复/质量指标 + RoboPulse++ 可靠性测试,把"模型能不能干成事"从二元成功率升级成"怎么失败、能不能救回来、有没有真本事"的三维诊断学。 机器人评估长期被两条锁链拴住: 1. 二元 s…
Second Thought:在 LLM Agent 主循环空闲窗口里并行推理
Second Thought 是一个"训练free 的推理框架",在 ReAct 风格的 LLM Agent 主循环里,主线程一边发出 Action 并等待环境 Observation、一边在后台 fork 出四条辅助推理分支解码当前 Turn 的"下一手 Thought",等 Observation 到达时再 mer…
上下文访问鸿沟:交互级架构作为 Agent 不平等的一个补充维度
Sharp 等人 2025 年的"agentic inequality"框架从人/组织层(可用性、质量、数量)分析 AI Agent 不平等。本文补充一个更细颗粒度的维度——Contextuality(上下文性):AI 系统自主访问用户累积知识库的程度。两个用户即便名义上"都能用 Agent",如果一个走 Dynami…
Canvas360:基于几何感知预训练增强上下文全景生成
Canvas360 通过"两阶段 + 几何感知预训练"框架,把全景图生成(panorama generation)从单一 texttopanorama 任务,扩展为一个支持 incontext 学习的多任务统一系统,并通过自建的 1M 高质量配对数据集 Canvas360Dataset 解决了全景 incontext …
TokenWall:面向持久化 AI Agents 的 Token-Flow 语义运行时防火墙
TokenWall 提出"持久化 AI Agent 的不安全行为本质上是 token 流(自然语言)的语义污染"这一观察,并据此设计了一个在执行前对 agent 全量 token 流做边界感知语义审计的运行时防火墙,在 CIKBench 上把攻击成功率压到 12.5%、良性任务通过率保留 97.4%,平均仅增加 0.6…
DrugGen-2:融合疾病本体的药物发现语言模型
DrugGen2 把"疾病靶点药物"三元组作为生成条件,在 GPT2 之上用 SFT + GRPO 两阶段训练出疾病感知的分子生成器,在 5 个糖尿病肾病相关靶点上同时超越 DrugGPT 与 DrugGen(v1),分子对接出现对接力(9.917 等)超过参考药 enalapril(8.283)的候选化合物。 现有计…
线性注意力架构:机制、权衡与跨层路由
这是一篇系统化的"线性注意力架构横评 + 跨层路由改进"工作:作者把 softmax attention 与 DeltaNet、Gated DeltaNet、Kimi Delta Attention(KDA)、Gated DeltaNet2 四种近期循环线性注意力架构放进同一套循环记忆符号下比较,在 350M 参数 /…
SAM-MT:实时交互式多目标视频分割
SAMMT 把 SAM2 从"单目标视频分割"扩展为"实时多目标交互式视频分割",通过 显式 target queries + 共享全局表示 + 解耦 masked attention + 稀疏 memory,把分割延迟从"随目标数线性增长"解耦为常数级,在 10 个目标时仍保持 36 FPS,同时不牺牲 SAM2 原…
Agentic 谈判中的行为隐私泄露:用随机化策略形式化并缓解推理攻击
针对自主谈判 Agent 在多轮交互中暴露出的「行为隐私泄露」——即攻击者能从让步轨迹、时机、收敛模式反推出对手私有约束——本文设计了一种自适应随机谈判策略,在不依赖密码学的前提下,同时给出 $(\varepsilon, \delta)$行为差分隐私保证、报价序列的几乎处处收敛和较高的谈判效用,并在 3,000 次合成…
REBASE:用「参考背景子空间消除」做无训练的上下文分割
面向一次性参考图像驱动的无训练上下文分割(InContext Segmentation, ICS),REBASE 在闭式(训练零、参数零更新)条件下显式识别并消除参考图像中的低秩背景子空间,把参考与查询特征投影到其正交补上,再用相似度加权最远点采样生成正点提示,喂给 SAM 类可提示分割网络,在 PACOPart、FS…
沉默失败:当 LLM Agent 出错时,它在对你撒谎——一项来自生产 runtime 的纵向研究
这篇论文对一个自 2026 年 3 月起在生产中连续运行的"个人助理 Agent 运行时"做了八周的纵向研究,记录了 22 起完整 rootcause 复盘的事故,其中"错误信号从未以可行动形式到达人"的元模式至少出现 28 次;论文由此提炼出一个五类机制导向的静默失败分类法(环境怪癖、设计假设错位、错误吞咽、链式幻觉…
EvoGraph-R1:面向 Agentic 检索的自演化多模态知识超图
EvoGraphR1 将知识图谱从静态数据结构重新定义为由 Agent 交互驱动动态演化的「环境」,用 MDP 框架统一了检索、搜索、编辑三类操作,让知识图谱在推理过程中实时自我修正。 GraphRAG 已成 MLLM(Multimodal Large Language Model)知识增强的主流范式,但现有方法存在三…
UniClawBench:面向真实世界任务的主动 agent 能力驱动基准
港大 MMLab 提出的 UniClawBench 是首个能力驱动(capabilitydriven)的主动 agent 真实世界基准,围绕五项基础模型能力(技能使用、探索、长上下文推理、多模态理解、跨平台协同)设计了 400 个中英双语任务,采用活体 Docker 容器 + 闭环多智能体评估,第一次把「基模型能力 v…
Tree of Thoughts:让 LLM 学会"深思熟虑"的搜索式推理
Tree of Thoughts(ToT)把 ChainofThought 的一次性"线性思考"扩展成显式树结构搜索——把推理拆成"思想"(thoughts)作为中间节点、用 LM 自己评估(selfevaluation)来打分、必要时回溯或前瞻——在 Game of 24、创意写作、迷你填字三个需要非平凡规划的难题上…
A Survey on Evaluation of Large Language Models:把"如何评 LLM"做成一个独立学科
Chang 等人 2023 年 7 月发表、被 ACM TIST 接收的 LLM 评估综述(S2 引用 3500+,影响力引用 130+),提出 "评什么 / 在哪里评 / 怎么评" 三维框架,系统覆盖通用 NLP、推理、医疗、伦理、教育、Agent 等 8 大评估任务族,并维护持续更新的开源材料库,是把"LLM 评估…
A Comprehensive Overview of Large Language Models
本文是 20232024 年 LLM 领域最系统的全景综述之一,覆盖从 Transformer 架构原理、预训练方法到多模态扩展、效率优化和 Benchmark 评估的完整知识图谱,帮助研究者和工程师在 LLM 知识过载的时代快速建立全局视野。 LLM 领域在 20232024 年呈现爆发式增长:每周都有数十篇新论文面…
历史监狱压迫记录的对话式检索与即时知识建模
本文提出一种面向历史数字图书馆的文档分析系统,把 RAG 的检索对象从「单文档」扩展为「文档 + 即时构建的知识图谱」,让档案专家在对话中持续往图谱里沉淀事实,使 LLM 在跨文档的复杂查询上能够调用专家知识与文档证据两个来源。 历史档案数字化有两个固有难题: 1. 跨文档关联:一份监狱压迫记录可能援引同一个人在不同时…
LongE2V:基于视频扩散模型的长时间跨度事件驱动视频重建、预测与帧插值
LongE2V 通过微调预训练视频扩散模型,用 Autoregressive Unrolling、Adaptive Context Switching、Reencoding Alignment 和 Event Voxel Density Augmentation 四项技术创新,在事件相机(Event Camera)视频…
Remember When It Matters:面向长视野 Agent 的主动记忆 Agent
REMEMBER WHEN IT MATTERS 将 Agent 的记忆问题重新定义为"主动干预控制"而非"被动检索",通过一个独立运行的 Memory Agent 并行于 Action Agent,根据结构化记忆库决定何时主动向主 Agent 注入提醒、何时保持沉默,在 TerminalBench 2.0 和 τ²B…
SVR-R1:在强化学习中通过自验证自举多模态推理
SVRR1 让 VLM 在 GRPO 训练过程中自己判断答案对错——"No"就再想一次,"Yes"或达到轮次上限才定稿——由此将自我验证本身变成学习信号,在无需外部监督的情况下自举多模态推理能力。 多模态推理(看图说话、图表问答等)长期落后于纯语言推理,核心瓶颈在于:如何让视觉语言模型(VLM)具备自我纠错能力,而无需…
像机器人一样看:面向 VLA 的机器人中心点图方法
面对大规模机器人演示数据中视角多样性不断增长的挑战,机器人中心点图(RobotCentric Pointmaps)将每个像素的 3D 坐标以机器人坐标系为基准编码为稠密图像,使 VLA 可以在不改变架构的前提下获得一致的 3D 几何感知,在仿真和真机实验中均显著优于纯 RGB 策略,且未见视角下的优势最为明显。 视场框…
用知识蒸馏把 LLM 变成高效的 RAG 重排序 Cross-Encoder
针对 RAG(RetrievalAugmented Generation)流水线中的重排序(reranker)环节,作者用两阶段流水线把 LLaMA 3 8B 改造成 dropin reranker:先用 Unsloth + LoRA 监督微调、相关任务上做知识蒸馏,再用 4bit 量化压轻推理。接进「BM25 + 稠…
VideoChat3:4B 参数打平更大视频 MLLM 的完全开源新基线
本文推出 VideoChat3——一个"完全开源、以视频为中心、4B 参数级别"的多模态大模型。它通过 I3DViT(Inflated 3D Vision Transformer)+ Adaptive Frame Resolution for Streaming Video Perception 解决效率问题,通过 V…
Digital Pantheon:用 LLM 智能体模拟与审计政治联盟形成
提出 Digital Pantheon,一个把 SFT + DPO + RAG 三件套组合起来的多智能体框架,让 LLM 党派代理在事实性与意识形态之间保持平衡;并配套 MILT(多层信息谱系拓扑)+ CIS(联盟影响分数)做可解释审计,结果在 2019 年佛兰德大选中复现出 NVA 胜出、稳定排名,且"宣言锚定的谱系…
On-Policy Delta Distillation:用「差量」而非「分布」蒸馏推理能力
OPD²(OnPolicy Delta Distillation)把 onpolicy distillation 的监督信号从「模仿 teacher 的输出分布」换成「teacher 与 base 之间的 delta 分布」,让 token 级监督直接对应「推理能力增量」,在数学、科学、代码推理 benchmark 上…
稀疏截断态向量模拟器:面向 Peaked Circuits 的高效量子电路经典模拟
本文针对"peaked circuits"这一类特殊量子电路,提出了用稀疏表示存储仅非零振幅的截断态向量(truncated state vector)实现高效经典模拟,放弃了传统量子模拟器使用的密集表示,并用向量化操作和硬件加速最大化计算效率,在开源实现中验证了该方法的实用可行性。 经典计算机模拟量子电路面临指数级内…