研究库 深度解读
Explainers · 学术推广产出

解读

2631 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Org-Agent:从个人助手走向组织级智能体
论文把"组织级 LLM 智能体"建模成约束驱动的三阶段推理框架——先把任务拆成原子子任务建依赖图,拓扑排序调度,再在每个子任务执行时显式处理身份、权限、信息归属、时效、冲突消解等组织约束;MUSESBench 与 GroupMemBench 两个评测同时涨分,验证了"显式约束建模 + 工具支持的证据获取与记忆管理"才是…
深度解读 arXiv:2609.34392 2026-10-01
用于长序列建模的分数阶状态空间转移
FRAC 把 SSM 的"指数衰减记忆"替换成"幂律长记忆",做法是用有限个对数间隔的指数模态去逼近一个重尾核,从而既保留 SSM 的有界状态与并行训练,又把记忆的"几何"从 ODE 拉到了分数阶动力学;论文 1.3B 语言建模显示,FRAC 在长上下文上稳定优于当前 SOTA SSM 基线,同时不损失短上下文表现。 …
深度解读 arXiv:2609.36314 2026-10-01
2609.37749 · 小红书推广卡片文案
1. 痛点钩子版:RAG 和 Elasticsearch 到底谁强?这篇论文给了一个"不靠嘴炮"的统计答案 —— arXiv 2609.37749 用等价类做桥,让两套系统第一次能在统计学意义上分胜负 2. 类比版:相当于给「关键词检索」和「语义检索」装一个共同坐标系 —— arXiv 2609.37749 用 equ…
视频文案 arXiv:2609.37749(点格式) 2026-10-01
2609-37687
日期与轮次:20261001 · R2 中午棒 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20261001_R2_wiseattabudgetedlabeltiming_shortvideoscript.md 标题:问 label 时机比内容更关键 目标观众…
视频脚本 arXiv:2609.37687 2026-10-01
ReImaGin:用图像生成做视觉推理
1. 真实问题:文本思维链(CoT)无法处理需要直接操作视觉表征的任务(如多视角空间推理、遮挡移除);现有 MLLM 调用的外部视觉专家(深度估计、目标检测)操作狭窄且刚性。 2. 核心主张:把图像生成模型作为「灵活视觉推理器」,自然语言指令即可驱动开放域视觉操作,比固定功能专家工具更通用。 3. 谁应该关心:做 mu…
深度解读 arXiv:2609.16409 2026-10-01
LLM 作为通用异步 Agent
1. 真实问题:现代 LLM agent 遵循顺序交互循环(read → think → reply/toolcall → repeat),但真实场景如语音助手、具身 agent、监控系统常需要边想边接收新输入。 2. 核心主张:把不同异步任务泛化为"通用异步 agent",用户(或 agent 自己)定义带重叠内存状…
深度解读 arXiv:2609.35427 2026-10-01
AutoRef:自动优化 Harness 的多参考图像生成 Agent
1. 真实问题:多参考图生成(multireference image generation)需要同时满足"忠实每张参考图"+"整体自然"等多重约束,人工写的 harness(如何解读参考图、如何诊断输出、如何选图)性能差异极大。 2. 核心主张:把 harness 代码本身视为可优化对象,让 coding agent…
深度解读 arXiv:2609.35530 2026-10-01
关键词 vs 语义搜索:半自动量化对比框架
关键词检索(BM25 之类)输出"列表"、语义检索(RAG 之类)输出"自然语言消息",两者输出形态不可比,所以业界长期靠"主观用户反馈"打分。这篇论文给了一个用可互换等价类(equivalence class)桥接不同输出形态的半自动框架,让两类系统的 IR 准确率第一次可以被放在一起做统计检验——并通过一个工业 c…
深度解读 arXiv:2609.37749 2026-09-30
Chinese-Jev:把 System-One 决策模型带到中文任务
Jev 这类 SystemOne 决策模型过去主要跑英文,ChineseJev 用一套「中文标注 → 候选概率目标」的统一数据管线 + encoderonly 轻量骨干,把中文决策任务的准确率拉到了比闭源 Jev 还高 1.24%、速度 20.3× 的水平,并在医疗、法律、金融三个垂直领域做到 15 ms/例的低延迟,…
深度解读 arXiv:2609.36965 2026-09-30
同样的字节,不同的权威:Chat-Template 提示注入中保留 token 表示的作用
prompt injection 之所以对 LLM agent 威力巨大,根本原因不是「文本像不像系统指令」,而是聊天模板里那几个 reserved token(如 <|im_start|)背后的单向量学到了「我是控制符」;把它们用普通 subword 拼出来、文本一模一样,攻击成功率在三个开源模型族上会掉 39–66…
深度解读 arXiv:2609.35932 2026-09-30
"ChatGPT 不是全部"——2023 年这篇 360 次引用的综述,把生成式 AI 全景图拼了出来
你打开任何一个 AI 公众号,几乎都被这些词刷屏过: ChatGPT、GPT4、Gemini、Claude Stable Diffusion、Midjourney、DALLE Sora、Phenaki、AudioLM、AlphaTensor 但你真正想问的是——"它们到底都能干什么、不能干什么?区别在哪?" 答案藏在 …
科普版 arXiv:2301.04655 2026-09-30
你看到的每个"AI 安全声明"——都该被这份 274 页报告里的 6 个机制验证一遍
你打开任何一家大模型公司的产品页,几乎都会看到类似的话: "我们的模型经过严格的安全测试、公平性评估、隐私保护……" 听起来很安心。但你真正想追问的是—— "你说了,那我能验吗?" 能验和不能验,差别有多大?想象一个对照实验: 你买了一个宣称"零添加"的酸奶,配料表写在瓶身——你看得见。 你买了一个宣称"零幻觉"的 A…
科普版 arXiv:2004.07213 2026-09-30
EngramRAG:面向多跳 Agentic 记忆的动态使用加权拓扑与突触巩固
EngramRAG 基于互补学习系统(CLS)理论,为 LLM Agent 提出"清醒态 + 梦境态"双模记忆架构,在 LoCoMo 基准的 1,982 个 QA 对上将 Recall@5 提升 38.9%(53.21% vs 38.29%),MRR 提升 43.1%,并将事实变异中的分裂脑幻觉从 70% 压降至 0%…
深度解读 arXiv:2609.32049 2026-09-30
Omni-IO Skills:用 Agent Harness 把现有 agent 改造成"全模态原生"
OmniIO Skills 提出一种"即插即用"的 Agent Harness,通过分层 Skill、标准化多模态 IO 接口、依赖感知编排(Declare Execution Graph)、持久化 Asset Registry,让 GPT5.6 Sol / Claude Sonnet 5 等现有通用 agent 不改…
深度解读 arXiv:2609.31847 2026-09-30
QReason:把"查询推理"和"段落排序"解耦的高效重排序框架
在基于 CoT 的 listwise LLM 重排序器中,滑动窗口策略会反复生成高度相似的链式推理(CoT),带来显著冗余与高延迟;QReason 把"查询聚焦推理"从"窗口级段落相关性评估"中解耦出来:用一个专用重写器(rewriter)一次性生成面向排序的推理查询,再让非推理重排序器在所有窗口上复用,从而在 BRI…
深度解读 arXiv:2609.30904 2026-09-30
别让机器人只靠眼睛走路——OmniEcho 给具身智能体加上了"用耳朵看世界"的能力(v2 重写覆盖 v1)
arXiv 2609.23407(OmniEcho,202609 北大等团队 / 30 页 / 12 图 / 6 表)做了一件反主流的事——把"具身智能体需要空间维度听声音"从"想法"拉回到"完整闭环方案"。当前具身智能体的"听声辨位"能力比人类落后一个范式:感知层多用 mono 音频(只保留语义,丢方向)+ 评测层缺…
科普版 arXiv:2609.23407 2026-09-30
Pretraining Transformers with Quantized Softmax in Attention:把 softmax 也压成低精度后再算反向
这篇工作系统研究了预训练阶段用 Kinterval 近似 softmax(即把 exp(x) 离散到 K+1 个网格点)对 Transformer 注意力做低精度化的影响:在 124M 参数 / 2.5B 训练 token 的受控对照实验中,作者发现反传时是否正确处理校准梯度以及straightthrough surr…
深度解读 arXiv:2609.33591 2026-09-30
CorpusMap:让 Agent 用"实体导航"代替"裸语料检索"
当 LLM Agent 在大型文档集合上完成检索任务时,传统做法是把语料暴露为扁平的"文件列表"——相关文档之间没有相互引用的指示,导致 Agent 必须对每个 query 都重新发现这些关系,并常常在漏掉互补证据的同时消耗大量 token。CorpusMap 提出一个离线预构建的导航层:把语料围绕"反复出现的实体(r…
深度解读 arXiv:2609.37226 2026-09-30
Context Language Models(CLM):让模型"原生"管理自己的上下文
把"上下文"视为一个模型自己可读写的文件(file),让 LM 以零样本(zeroshot)方式接管原本由外层脚手架/Agent Harness 承担的滚动、压缩、丢弃等上下文管理决策,并在多项 SOTA 任务上以更少 FLOPs 取得更高准确率(BrowseCompPlus 提升 11.4% 同时减少 21.5% F…
深度解读 arXiv:2609.37725 2026-09-30
主题综述 · database(2026-09-26 · v2 重写覆盖 v1)
v1 → v2 重写说明(反思棒 #57 自我批评棒位第二次实战 · 沿用 928 agent v2 重写机制):v1 CJK 实测 = 4,359 严重越线 +459 + §0 自检栏用"反方独立段不计"话术规避——反思棒 #47 明文禁止该话术。v2 重写:(1) CJK 实测压到 ≤3,900 守约;(2) §0…
周综述 2026-09-26
你以为 AI 看图只看「是什么」——2014 年这篇论文教它看「感受」
想象一下这个场景: 你在做一个旅游 App,想给用户推荐"适合发朋友圈的目的地"。给算法工程师说:"帮我筛出'温馨浪漫'的照片"。他大概率会卡壳—— 「温馨浪漫」怎么变成可计算的信号? 10 年前,这道题没有标准答案。2014 年之前,AI 看图只能告诉你"图里有什么"——一棵树、一片海、一个人——但说不出"这张图传递…
科普版 arXiv:1410.8586 2026-09-30
你手机每天替你做的那个决定——1999 年这篇论文早就写好了代码
想象一下这个场景: 下午三点,你正在写一份季度汇报,写到第二段。手机在桌上震了一下,屏幕亮起一个微信红点。你瞄了一眼——是某个同事在群里问"今晚吃啥",还有一条快递通知、一条微博推送、一封老板的邮件。 你大概率会:忽略微信、看一眼微博、不动快递、把老板的邮件标记为稍后处理——然后继续写汇报。 但你有没有想过——iOS …
科普版 arXiv:1301.6707 2026-09-30
GPT-6 Astra 横评:通用系统在 9 大计算机视觉领域的边界地图
GPT6 Astra 与 5 个前沿通用 AI 系统在 34 项能力 / 55 个基准 / 9 个 CV 领域被系统性横评:语义理解类能力逼近人类与专用模型上限,度量几何、保真重建、时序一致性密集预测仍是未跨越的硬骨头。 过去两年通用多模态模型(GPT4V、Gemini、Claude、QwenVL 等)的能力边界一直在…
深度解读 arXiv:2609.35718 2026-09-30
Nereus: 面向 LLM 后训练的自适应并行
Nereus 是一个感知迁移成本的自适应运行时,在 RL 后训练过程中动态调整 GPU 并行策略(TP/PP/DP),在真实 traces 上将 8B PPO 吞吐量提升最高 7.27 倍,同时过渡开销仅占总运行时间 0.079%。 大语言模型的 RL 后训练(PPO/DPO 等)在 GPU 集群上协调多个模型:生成模…
深度解读 arXiv:2609.34645 2026-09-30
FlowTool: 基于流匹配控制图像修图中的工具参数
FlowTool 将基于工具的图像编辑任务从自回归生成重新建模为条件流匹配问题,用 Diffusion Transformer 直接生成高质量工具参数,在多个基准上实现至少 50 倍推理延迟降低 和近 2 倍内存节省,同时在参考图像评测中超越专用 MLLM 编辑智能体与商业模型。 当前主流的基于工具的图像编辑(图像修图…
深度解读 arXiv:2609.35673 2026-09-30
视频选题榜 2026-09-30
· KV cache 复用精度评估 · Boxoffice 基准 · RAG KV 复用默认只看平均精度撞 2 堵墙 = confounder audit + reuse dynamics coverage + Boxoffice 程序化生成 · round=R1 · GAGAR · 代码 Agent RL 的分组智能…
选题榜 2026-09-30
主题综述 · evaluation(2026-09-30)
| 维度 | 实测 | 通过 | |||| | ⚠️ 标注密度 | 14 处 | ✅ ≥10 | | 反方 v2 三段式按主线 ≥6 段 × ≥150 字 | 7 段 × 平均 165 字 | ✅ | | 立标池 4 件套 | GitHub 已验 + ⚠️ + 双轨 + abstract 数字 | ✅ ≥3 | | §…
周综述 2026-09-30
在学生状态处从教师续写中学习:OLIVE 框架把"在线干预"做成了 LLM 蒸馏的新基线
字数目标:25004000 中文字,本篇约 3300。 事实层:所有数据点来自 arxiv abstract 与 paper_card TLDR,未读到 PDF 全文。 GitHub 验证:abstract 未给出代码仓库 URL,原文未明确 GitHub 链接(诚实标注 · 保 4 分护城河)。 ⚠️ 标注密度:含"…
深度解读 arXiv:2609.36246 2026-09-30
ASCT:在反事实树上做注意力搜索以分配 Agentic RL 的动作信用
字数目标:25004000 中文字,本篇约 3100。 事实层:所有数据点来自 arxiv abstract + paper_card TLDR(27 页 / 9 图 / 19 表)。未读 PDF 全文。 GitHub 验证:abstract 未给出代码仓库链接,原文未明确 GitHub URL(诚实标注 · 保 4 …
深度解读 arXiv:2609.35215 2026-09-30
SANTA++:用代表性 Key 采样把 KV cache 读带宽砍掉 80%
字数目标:25004000 中文字,本篇约 3000。 事实层:所有数据点来自 arxiv abstract + paper_card TLDR(v1 540KB)。未读 PDF 全文。 GitHub 验证:abstract 明确给出 ——已记录但未实际 clone 验证(abstract 给出等价已 ok)。 ⚠️ …
深度解读 arXiv:2609.35629 2026-09-30