研究库 深度解读
Explainers · 学术推广产出

解读

2626 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Agentic-ZTA:用多智能体流水线把零信任落地为可执行的访问决策
本文提出 AgenticZTA,把 NIST SP 800207 定义的零信任架构(ZTA)控制环用多智能体决策流水线实现——策略知识走 RAG、访问上下文走多智能体接力、可信度评分聚合——在测试床上达到 95.0% 准确率 / 93.9% 精确率 / 96.3% 召回率,证明"用 AI 代理做零信任强制执行"在访问控…
深度解读 arXiv:2610.05782 2026-10-07
给持续吸入文档的 RAG 向量库加一道"暂态可见"闸门:定时验证 + 谱系隔离
本文针对持续摄入型 RAG 向量库的"数据进入可检索之前还没完成验证"这一时间攻击面,提出 bounded provisional visibility 协议——新内容以有截止时间的暂态可见方式准入,超时未验证则自动隐藏,并支持谱系隔离;在五个自然语言文档工作负载上,把中毒检索中位数从 34 降到 7(同等降低被挤掉的…
深度解读 arXiv:2610.05826 2026-10-07
弥合上下文鸿沟:表格上下文学习的激活对齐
TabPFN、TabFM 这类"表格基础模型"做 incontext learning(ICL)时必须把全部训练样本塞进每次前向——推理贵到爆炸。少塞样本能省钱,但性能掉得厉害。本文提出 Activation Alignment:在完整上下文(teacher)与裁剪上下文(student)之间训练一个轻量级线性变换器,…
深度解读 arXiv:2610.06679 2026-10-07
从蒸馏后的私有健康记录中以 Agent 方式发现血液生物标志物
医疗数据"看得见但用不了"是 Agent 落地的最大拦路虎之一。本文把以色列 Clalit 医疗集团 540 万患者的全血细胞计数(CBC)蒸馏成一个可发布的"评分器"权重——图注意力网络 + 病例对照 AUC 预测器——让前沿 LLM Agent 能在不接触任何原始病历的前提下,通过"提出—评分—迭代"循环挖掘 13…
深度解读 arXiv:2610.04749 2026-10-07
选择何时取代抽取?基于类型化决策模型的 Agent 记忆预注册测试
Agent 长对话记忆到底该"抽取事实"还是"挑选原始轮次"?这篇预注册研究给出一个干净回答:在紧预算下,单次调用一个轻量级类型化决策模型(Jev)选出的原始轮次,与 LLM 抽取式记忆呈非劣效,且写入成本低 3,061 倍;而抽取式系统只在"慷慨预算"下才反超——这把"抽取 vs 选择"这场口水仗变成了一个随预算变化…
深度解读 arXiv:2609.34227 2026-10-07
你以为"上下文窗口不够大"是 LLM 的死穴——2025 这篇论文把 prompt 编程成外部环境,8B 模型直接打平 GPT-5
如果你是 LLM 应用工程师、AI 基础设施负责人、或者正在做长文档分析 / 代码库理解 / Agent 记忆系统的开发者——这篇文章写给你。 你可能已经默认一件事:LLM 处理不了超出窗口的输入,要么压缩,要么 RAG 检索,要么放弃。 你可能还默认一件事:要做长上下文任务,只能上 GPT5、Claude 这类带 2…
科普版 arXiv:2512.24601 2026-10-07
你公司每年花几十万做"网络安全意识培训",其实在心理学上注定无效——30 年前就被这篇论文说透了
如果你是 CISO、合规负责人、HR 学习发展负责人,或者只是公司里被强制要求看钓鱼测试邮件的普通员工——这篇文章写给你。 你公司每年发海报、推月度邮件、搞钓鱼模拟、做入职培训……你以为这是在"提高安全意识"。 现实是:同一批员工在反复培训后,依然点击钓鱼链接、依然把密码写在便签上、依然在客户名旁标"123456"。 …
科普版 arXiv:1901.02672 2026-10-07
2026-10-07 · R2 · arXiv 2610.03430 · JIL 脚本镜像
日期:20261007 轮次:R2(中午棒) arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20261007_R2_jilschedulerlengthexploit_shortvideoscript.md (开场 04 秒)LLM 调度器靠预测长度排优先级。今…
视频脚本 arXiv:2610.03430 2026-10-07
网络安全意识运动:为何它们没能改变行为?
意识运动之所以反复失败,不是因为"宣传不够",而是因为它们几乎只做了"告知风险"这一半——而行为改变真正需要的前半段是"人能理解并执行建议",后半段是"人有动机与意愿去做",这两个前置条件在大多数运动的设计里被彻底遗漏。 企业和监管机构每年在网络安全意识活动上投入巨大——海报、月度邮件、钓鱼模拟、入职培训。但实证数据显…
深度解读 arXiv:1901.02672 2026-10-07
HLA:通过分块动态混合提升表达性的混合线性注意力
线性注意力通过把历史压缩成循环状态来实现长上下文的高效解码,但这种压缩让"选择性访问稀疏且遥远的信息"变得困难;HLA 把"分块混合系数"从固定改为查询相关(querydependent),用每个 chunk 的紧凑自注意摘要动态决定"该 chunk 的历史记忆按多大比例混合进当前查询",从而在保持线性复杂度与每 ch…
深度解读 arXiv:2610.05842 2026-10-07
UndoBench:把"任务能力"和"恢复能力"从工具调用 Agent 评测中拆开
现在的 Agent 评测普遍只看"任务完成率",把"规划能力"和"故障恢复能力"混在一起计分——UndoBench 用反事实配对试验(同一随机种子下,完整工作流 vs 中途插入故障)把两者拆开,并在冻结的"丢确认(lostacknowledgment)"场景中测出:标称任务完成率 83.54%,而条件恢复成功率(CRS…
深度解读 arXiv:2610.05622 2026-10-07
双臂机器人终于学会"换手"了——2026 这篇论文把组合泛化从 5% 拉到 21%
你有没有想过——为什么家里的双臂机器人(比如宇树的 G1、Figure 02 这类)从来不会真的"两只手一起做事"?要么让左臂干一下、右臂干一下,要么干脆每只手臂独立跑一套策略——完全没有"组合"的概念。2026 年 10 月这篇论文(arXiv 2610.06184)正面解决了这件事:它把"组合泛化"拆成"按臂"和"…
科普版 arXiv:2610.06184 2026-10-06
你手机里那个 100K 上下文的 AI——为什么聊到第 80 轮开始"变傻"?一篇 2026 顶会论文终于说清楚了
你有没有过这种体验——和 AI 聊天聊到第 50、80 轮,它开始"忘记"你开头说过的话,开始答非所问?这是因为 AI 每说一句话都要"把所有上下文装进脑子才能接话",上下文越长脑子越重。2026 年 EMNLP 顶会有一篇论文(arXiv 2610.06479)正面解决了这件事:它换掉了过去 4 年大家一直在用的"哪…
科普版 arXiv:2610.06479 2026-10-06
保留行为一致性的 KV Cache 压缩:一种 training-free 的 logits-KL 淘汰策略
把 KV cache 压缩的目标函数从"注意力分数高就保留"换成"移除后对 nexttoken 分布的 KL 散度增加得少才保留",用 preeviction forward 阶段收集到的统计量近似估算"压缩后 logits",无需为每个候选 token 跑独立 masked forward——实现了一种 traini…
深度解读 arXiv:2610.06479 2026-10-06
双臂 VLA 的"按臂组合泛化"——ACG-Bench 与 AE-VLA 解读
把"组合泛化"显式拆成"原子技能 × 跨臂重新组合"两维度,构建 ACGBench 基准(含 23 组任务条件、8 类任务、6 组域内 + 17 组未见的"重排序/同步/组合/跨任务"),并据此叠出 AEVLA = SkillLoRA × Armwise Attention 的组合策略,在仿真与真机(SO101)上把未…
深度解读 arXiv:2610.06184 2026-10-06
Nexus:把 AI Agent 跑成"长生命周期服务"的云-边执行底座
Nexus 提出一套把单次 agent 调用升级为持久任务(persistent task)的云边执行底座,用 OpenWrt 改造的分布式 runtime + runscoped 委托 + 持久化账本三件套,把 LLM Agent 从"短对话推理"变成"长生命周期、可跨 Computer 与 Mobile、被故障和撤…
深度解读 arXiv:2610.05709 2026-10-06
非结构化知识编辑中通过聚焦视图提升原子事实回忆
FOVEATED 通过在编辑时对上下文中非目标句子的 RoPE 位置编码(Key 侧)施加随机扰动,人为拉平段落级编辑目标中「后文事实因上下文更丰富而被低估学习难度」的问题,显著提升非结构化知识编辑(UKE)中原子事实的无上下文回忆能力,在 5 个 KE 编辑器、2 个 LLM 主干、3 个基准上取得一致改进。 大语言…
深度解读 arXiv:2610.02772 2026-10-06
4DCodeBench:动态场景逆向图形中的 Agent 基准测试
4DCodeBench 通过让 Agent 将动态视频重建为可执行图形程序,首次系统性地评估了模型在 4D 逆向图形(空间 + 时间)上的代码生成能力,揭示了当前顶级模型「静态重建强、动态建模弱」的关键短板。 让 AI Agent 理解并程序化地重建真实世界的动态场景——这件事本质上横跨了 Computer Visio…
深度解读 arXiv:2610.03715 2026-10-06
CUAWright:面向数字 Agent 的极简统一接口
CUAWright 用约 3000 行代码构建了一个极简终端 harness,以 bash 为唯一动作接口,以文件系统为可演化工具空间,在 OSWorld 2.0、OnlineMind2Web、Odysseys 等多个数字 Agent 基准上显著超越 GUIharness 方案,同时将成本降低 37.5%。 当前主流 …
深度解读 arXiv:2610.04116 2026-10-06
当 AI 工具调用"看起来变好"——SAKIKO 揭示:净指标涨了 50 个百分点,却悄悄损害了一半原本正确的事(v2 重写覆盖 v1)
v2 主要改进(7+ 条 · 详见 §七工程核查 + 修正说明):① 修正标题数字:从 v1 "+55 分" → v2 "+50 个百分点"——明示是绝对百分点变化,避免与"分"混淆(v1 戏剧化失真违反 abstract verbatim 提取硬约束);② 修正小红书卡开头:从 v1 "平均分涨了 5%" → v2 …
科普版 arXiv:2609.36138 2026-10-06
视频选题榜 2026-10-06(v2 重写覆盖 · 反思棒 #69 触发)
v1 → v2 修复:v1 文件 429B / 4 行 stub,仅 2 条单行 bullet(R1 = 2610.03020 DyadMem + R3 = 2610.04116 CUAWright · R2 缺失 · 立标池缺失 · §0 关键判断速览 0 行 · §1 三档选题段落式解读 0 段 · §2 pape…
选题榜 2026-10-06
PerturBot:用扰动式训练打破 VLA 模型的捷径先验
提示:本文遵循 W37–W40 lessons 蒸馏的 flyP v2 模板(§0 元层五问 + R 命名反方 + A 命名触发 + 评级四子项 + 撞名 ≥3 主线 + 边界声明 12/12),并满足 W40 的「§八 ≥5 坑 + 每坑三段式 + 诚实标注 ≥1 处 + P0 事实三轮核实」四项硬约束。 | 维 |…
深度解读 arXiv:2610.04616 2026-10-06
Code2Games:用 Coding Agent 从自然语言意图生成可玩游戏世界
提示:本文遵循 W37–W40 lessons 蒸馏的 flyP v2 模板(§0 元层五问 + R 命名反方 + A 命名触发 + 评级四子项 + 撞名 ≥3 主线 + 边界声明 12/12),并满足 W40 的「§八 ≥5 坑 + 每坑三段式 + 诚实标注 ≥1 处 + P0 事实三轮核实」四项硬约束。 | 维 |…
深度解读 arXiv:2610.05033 2026-10-06
MemAdapter:用反事实适配抵抗"记忆诱发的谄媚"
提示:本文遵循 W37–W40 lessons 蒸馏的 flyP v2 模板(§0 元层五问 + R 命名反方 + A 命名触发 + 评级四子项 + 撞名 ≥3 主线 + 边界声明 12/12),并满足 W40 的「§八 ≥5 坑 + 每坑三段式 + 诚实标注 ≥1 处 + P0 事实三轮核实」四项硬约束。 | 维 |…
深度解读 arXiv:2610.05162 2026-10-06
主题综述 · rag(2026-10-06)
本棒 netnew = 2 件:CLIMB(arXiv:2610.03421, Oct 2 提交 · Oct 5 建卡)+ ReasoningLanguage Alignment in Monolingual RAG(arXiv:2610.03136, Oct 2 提交 · Oct 5 建卡)。承接棒 R111 已锚的…
周综述 2026-10-06
你让 AI 记住你爱喝冰美式——可它两个月后还在推荐你热拿铁?2026 这篇论文告诉你:你以为的"长期记忆"根本就是测错了
如果你是做 AI 陪伴 / AI 助手 / AI 客服的产品经理,你大概率被老板问过这种问题: "用户都用了三个月了,怎么 AI 还是记不住他上次说过的忌口?" 你打开评测看板:长期记忆准确率 91%。你把成绩贴到周报里。可用户投诉还在涨——他们说"我三个月前跟 AI 说过我猫死了,它今天还问我'你家猫叫什么名字'"。…
科普版 arXiv:2610.03020 2026-10-06
QuantCode Model:把通用代码 LLM 变成「可执行」的交易策略生成器
论文系统比较了「继续预训练 + 监督微调(SFT)」两条互补路径,用于把通用代码 LLM 变成能在 Backtrader 框架上生成语义忠实、可回测通过的可执行交易策略代码的模型,并用 400 题 QuantCodeBench 量化两条路径单独/合并使用时的能力跃迁与能力流失现象。 把自然语言策略描述翻译成能在专业交易…
深度解读 arXiv:2609.39420 2026-10-06
The Missing Primitive:诊断并修复 LLM 的结构化数学理解
论文提出「数学原语(Mathematical Primitive)」概念,用以探测 LLM 的结构性数学理解,并构建沿"发现 / 生成 / 消化 / 执行"四维评测的新基准;同时识别出"发现"是当前 LLM 数学推理的主导瓶颈,并提出"原语导向的自蒸馏框架"做针对性修复。 LLM 在前沿数学问题(AIME / Olym…
深度解读 arXiv:2610.02191 2026-10-06
SourceLearn:从「知识访问」到「源学习」,让 Agent 真正"认识"信息源
论文提出「Source Learning」新范式,把 LLM agent 与持久权威信息源的关系从「每次重新访问」升级为「可累积的源专属能力(sourcespecific competence)」,并以 SourceLearn 双机制框架(SelfDirected + TaskGuided)在 5 个 benchmar…
深度解读 arXiv:2610.02150 2026-10-06
主题综述 · risk(2026-10-06)
差异化定位:1001 综述锚定"frontier model cyberoffense capability 栖位预备第 12 例 + 立标饱和度信号独立主线";1003~1004 综述间期 risk 主分类入库空窗延续、警示级承接稳态;本棒聚焦 promptinjection 攻防方法学四联+评测范式跃迁 + 评测方…
周综述 2026-10-06