解读
1531 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
「AI 为什么这么判」到底是不是一个好问题——一篇被引 5400 次的位置论文,给整个可解释机器学习领域立了规矩
你有没有想过 🤔: 当银行用 AI 拒绝你的贷款申请,它告诉你「因为你的年龄和职业」,这个解释是真的吗? 当医院用 AI 诊断你的 CT 影像,它圈出「这块组织有 90% 概率是肿瘤」,医生敢不敢真的相信? 当 ChatGPT 给你写一段话,你问「你为什么这么说」,它答「根据 X 论文……」,这个回答是不是套话? 所有…
让机器人「看懂室内」这件事,2017 年之前为什么没人能跑通——一篇被引近 6000 次的论文,靠 iPad + 流水线把它从「实验室小作坊」变成「基础设施」
你有没有想过 🤔: 当你让家里的扫地机器人「把客厅里的玩具都收进柜子里」,它是怎么知道「客厅是什么」「柜子在哪里」「玩具长什么样」的? 当 AR 眼镜把虚拟家具「摆到你的真实客厅」里,它怎么知道墙壁在哪里、桌子有多大、沙发是什么形状? 当你想训练一个机器人去「医院查房、在走廊里穿梭、帮人拿药」,它怎么知道走廊是走廊、病…
主题综述 · risk(2026-08-17)
范围:近 3 周(20260727 → 20260817)AI Agent 风险主轴;与 813 综述"五层栈横向"做差异化,本次走"协议层 + 工程实现层双联实证 + 评测方法学 + 多模态新盲点"深切路径。 主轴:协议层(Stealing Reasoning Traces / MCP Ecosystem) → 工程…
上下文访问鸿沟:交互级架构作为 Agent 不平等的一个补充维度
Sharp 等人 2025 年的"agentic inequality"框架从人/组织层(可用性、质量、数量)分析 AI Agent 不平等。本文补充一个更细颗粒度的维度——Contextuality(上下文性):AI 系统自主访问用户累积知识库的程度。两个用户即便名义上"都能用 Agent",如果一个走 Dynami…
Canvas360:基于几何感知预训练增强上下文全景生成
Canvas360 通过"两阶段 + 几何感知预训练"框架,把全景图生成(panorama generation)从单一 texttopanorama 任务,扩展为一个支持 incontext 学习的多任务统一系统,并通过自建的 1M 高质量配对数据集 Canvas360Dataset 解决了全景 incontext …
TokenWall:面向持久化 AI Agents 的 Token-Flow 语义运行时防火墙
TokenWall 提出"持久化 AI Agent 的不安全行为本质上是 token 流(自然语言)的语义污染"这一观察,并据此设计了一个在执行前对 agent 全量 token 流做边界感知语义审计的运行时防火墙,在 CIKBench 上把攻击成功率压到 12.5%、良性任务通过率保留 97.4%,平均仅增加 0.6…
DrugGen-2:融合疾病本体的药物发现语言模型
DrugGen2 把"疾病靶点药物"三元组作为生成条件,在 GPT2 之上用 SFT + GRPO 两阶段训练出疾病感知的分子生成器,在 5 个糖尿病肾病相关靶点上同时超越 DrugGPT 与 DrugGen(v1),分子对接出现对接力(9.917 等)超过参考药 enalapril(8.283)的候选化合物。 现有计…
线性注意力架构:机制、权衡与跨层路由
这是一篇系统化的"线性注意力架构横评 + 跨层路由改进"工作:作者把 softmax attention 与 DeltaNet、Gated DeltaNet、Kimi Delta Attention(KDA)、Gated DeltaNet2 四种近期循环线性注意力架构放进同一套循环记忆符号下比较,在 350M 参数 /…
SAM-MT:实时交互式多目标视频分割
SAMMT 把 SAM2 从"单目标视频分割"扩展为"实时多目标交互式视频分割",通过 显式 target queries + 共享全局表示 + 解耦 masked attention + 稀疏 memory,把分割延迟从"随目标数线性增长"解耦为常数级,在 10 个目标时仍保持 36 FPS,同时不牺牲 SAM2 原…
Agentic 谈判中的行为隐私泄露:用随机化策略形式化并缓解推理攻击
针对自主谈判 Agent 在多轮交互中暴露出的「行为隐私泄露」——即攻击者能从让步轨迹、时机、收敛模式反推出对手私有约束——本文设计了一种自适应随机谈判策略,在不依赖密码学的前提下,同时给出 $(\varepsilon, \delta)$行为差分隐私保证、报价序列的几乎处处收敛和较高的谈判效用,并在 3,000 次合成…
REBASE:用「参考背景子空间消除」做无训练的上下文分割
面向一次性参考图像驱动的无训练上下文分割(InContext Segmentation, ICS),REBASE 在闭式(训练零、参数零更新)条件下显式识别并消除参考图像中的低秩背景子空间,把参考与查询特征投影到其正交补上,再用相似度加权最远点采样生成正点提示,喂给 SAM 类可提示分割网络,在 PACOPart、FS…
沉默失败:当 LLM Agent 出错时,它在对你撒谎——一项来自生产 runtime 的纵向研究
这篇论文对一个自 2026 年 3 月起在生产中连续运行的"个人助理 Agent 运行时"做了八周的纵向研究,记录了 22 起完整 rootcause 复盘的事故,其中"错误信号从未以可行动形式到达人"的元模式至少出现 28 次;论文由此提炼出一个五类机制导向的静默失败分类法(环境怪癖、设计假设错位、错误吞咽、链式幻觉…
EvoGraph-R1:面向 Agentic 检索的自演化多模态知识超图
EvoGraphR1 将知识图谱从静态数据结构重新定义为由 Agent 交互驱动动态演化的「环境」,用 MDP 框架统一了检索、搜索、编辑三类操作,让知识图谱在推理过程中实时自我修正。 GraphRAG 已成 MLLM(Multimodal Large Language Model)知识增强的主流范式,但现有方法存在三…
UniClawBench:面向真实世界任务的主动 agent 能力驱动基准
港大 MMLab 提出的 UniClawBench 是首个能力驱动(capabilitydriven)的主动 agent 真实世界基准,围绕五项基础模型能力(技能使用、探索、长上下文推理、多模态理解、跨平台协同)设计了 400 个中英双语任务,采用活体 Docker 容器 + 闭环多智能体评估,第一次把「基模型能力 v…
长上下文推理的"显存爆"终于有解了:Maglev 把固定大小记忆做到可并行训练
你有没有想过 🤔: 当你和 AI 聊到第 200 轮,或者让它读完一整个代码库再回答问题——它背后那块 GPU 的显存正在线性爆炸。 因为标准的 Transformer 会把整段对话的"中间状态"都存下来。上下文越长,显存占用越大。百万级 token 的会话,没有一张消费级显卡能扛得住。 arXiv 2608.0287…
当机器人学会"全身"思考:为什么 LingBot-VLA 2.0 把 20 种构型的数据都喂给了一个模型?
你有没有想过 🤔: 一个会走会抓的家用机器人,背后那个 AI 其实只"看见"过机械臂末端的那一小段动作—— 它的躯干怎么转、腰怎么扭、基座怎么挪,几乎从来没学过。 这就是为什么同一套 VLA 模型,今天在你家桌面上抓杯子很顺,明天换一台工业机械臂就完全抓瞎。 arXiv 2607.06403(LingBotVLA 2.…
Tree of Thoughts:让 LLM 学会"深思熟虑"的搜索式推理
Tree of Thoughts(ToT)把 ChainofThought 的一次性"线性思考"扩展成显式树结构搜索——把推理拆成"思想"(thoughts)作为中间节点、用 LM 自己评估(selfevaluation)来打分、必要时回溯或前瞻——在 Game of 24、创意写作、迷你填字三个需要非平凡规划的难题上…
A Survey on Evaluation of Large Language Models:把"如何评 LLM"做成一个独立学科
Chang 等人 2023 年 7 月发表、被 ACM TIST 接收的 LLM 评估综述(S2 引用 3500+,影响力引用 130+),提出 "评什么 / 在哪里评 / 怎么评" 三维框架,系统覆盖通用 NLP、推理、医疗、伦理、教育、Agent 等 8 大评估任务族,并维护持续更新的开源材料库,是把"LLM 评估…
A Comprehensive Overview of Large Language Models
本文是 20232024 年 LLM 领域最系统的全景综述之一,覆盖从 Transformer 架构原理、预训练方法到多模态扩展、效率优化和 Benchmark 评估的完整知识图谱,帮助研究者和工程师在 LLM 知识过载的时代快速建立全局视野。 LLM 领域在 20232024 年呈现爆发式增长:每周都有数十篇新论文面…
推广选题榜 · 2026-08-17
本周从近 30 天入库论文中综合「被引 + 影响力被引 + 新近度 + 话题热度」精选,涵盖 Agent、AI Infra、机器人、视频多模态四大方向。 ① Gemma 4 Technical Report arxiv: 2607.02770 Google 推出的新一代开源权重原生多模态模型系列,在 STEM、多模态与…
历史监狱压迫记录的对话式检索与即时知识建模
本文提出一种面向历史数字图书馆的文档分析系统,把 RAG 的检索对象从「单文档」扩展为「文档 + 即时构建的知识图谱」,让档案专家在对话中持续往图谱里沉淀事实,使 LLM 在跨文档的复杂查询上能够调用专家知识与文档证据两个来源。 历史档案数字化有两个固有难题: 1. 跨文档关联:一份监狱压迫记录可能援引同一个人在不同时…
LongE2V:基于视频扩散模型的长时间跨度事件驱动视频重建、预测与帧插值
LongE2V 通过微调预训练视频扩散模型,用 Autoregressive Unrolling、Adaptive Context Switching、Reencoding Alignment 和 Event Voxel Density Augmentation 四项技术创新,在事件相机(Event Camera)视频…
Remember When It Matters:面向长视野 Agent 的主动记忆 Agent
REMEMBER WHEN IT MATTERS 将 Agent 的记忆问题重新定义为"主动干预控制"而非"被动检索",通过一个独立运行的 Memory Agent 并行于 Action Agent,根据结构化记忆库决定何时主动向主 Agent 注入提醒、何时保持沉默,在 TerminalBench 2.0 和 τ²B…
SVR-R1:在强化学习中通过自验证自举多模态推理
SVRR1 让 VLM 在 GRPO 训练过程中自己判断答案对错——"No"就再想一次,"Yes"或达到轮次上限才定稿——由此将自我验证本身变成学习信号,在无需外部监督的情况下自举多模态推理能力。 多模态推理(看图说话、图表问答等)长期落后于纯语言推理,核心瓶颈在于:如何让视觉语言模型(VLM)具备自我纠错能力,而无需…
像机器人一样看:面向 VLA 的机器人中心点图方法
面对大规模机器人演示数据中视角多样性不断增长的挑战,机器人中心点图(RobotCentric Pointmaps)将每个像素的 3D 坐标以机器人坐标系为基准编码为稠密图像,使 VLA 可以在不改变架构的前提下获得一致的 3D 几何感知,在仿真和真机实验中均显著优于纯 RGB 策略,且未见视角下的优势最为明显。 视场框…
用知识蒸馏把 LLM 变成高效的 RAG 重排序 Cross-Encoder
针对 RAG(RetrievalAugmented Generation)流水线中的重排序(reranker)环节,作者用两阶段流水线把 LLaMA 3 8B 改造成 dropin reranker:先用 Unsloth + LoRA 监督微调、相关任务上做知识蒸馏,再用 4bit 量化压轻推理。接进「BM25 + 稠…
VideoChat3:4B 参数打平更大视频 MLLM 的完全开源新基线
本文推出 VideoChat3——一个"完全开源、以视频为中心、4B 参数级别"的多模态大模型。它通过 I3DViT(Inflated 3D Vision Transformer)+ Adaptive Frame Resolution for Streaming Video Perception 解决效率问题,通过 V…
Digital Pantheon:用 LLM 智能体模拟与审计政治联盟形成
提出 Digital Pantheon,一个把 SFT + DPO + RAG 三件套组合起来的多智能体框架,让 LLM 党派代理在事实性与意识形态之间保持平衡;并配套 MILT(多层信息谱系拓扑)+ CIS(联盟影响分数)做可解释审计,结果在 2019 年佛兰德大选中复现出 NVA 胜出、稳定排名,且"宣言锚定的谱系…
On-Policy Delta Distillation:用「差量」而非「分布」蒸馏推理能力
OPD²(OnPolicy Delta Distillation)把 onpolicy distillation 的监督信号从「模仿 teacher 的输出分布」换成「teacher 与 base 之间的 delta 分布」,让 token 级监督直接对应「推理能力增量」,在数学、科学、代码推理 benchmark 上…
稀疏截断态向量模拟器:面向 Peaked Circuits 的高效量子电路经典模拟
本文针对"peaked circuits"这一类特殊量子电路,提出了用稀疏表示存储仅非零振幅的截断态向量(truncated state vector)实现高效经典模拟,放弃了传统量子模拟器使用的密集表示,并用向量化操作和硬件加速最大化计算效率,在开源实现中验证了该方法的实用可行性。 经典计算机模拟量子电路面临指数级内…