解读
1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Chinese-Jev:把 System-One 决策模型带到中文任务
Jev 这类 SystemOne 决策模型过去主要跑英文,ChineseJev 用一套「中文标注 → 候选概率目标」的统一数据管线 + encoderonly 轻量骨干,把中文决策任务的准确率拉到了比闭源 Jev 还高 1.24%、速度 20.3× 的水平,并在医疗、法律、金融三个垂直领域做到 15 ms/例的低延迟,…
同样的字节,不同的权威:Chat-Template 提示注入中保留 token 表示的作用
prompt injection 之所以对 LLM agent 威力巨大,根本原因不是「文本像不像系统指令」,而是聊天模板里那几个 reserved token(如 <|im_start|)背后的单向量学到了「我是控制符」;把它们用普通 subword 拼出来、文本一模一样,攻击成功率在三个开源模型族上会掉 39–66…
EngramRAG:面向多跳 Agentic 记忆的动态使用加权拓扑与突触巩固
EngramRAG 基于互补学习系统(CLS)理论,为 LLM Agent 提出"清醒态 + 梦境态"双模记忆架构,在 LoCoMo 基准的 1,982 个 QA 对上将 Recall@5 提升 38.9%(53.21% vs 38.29%),MRR 提升 43.1%,并将事实变异中的分裂脑幻觉从 70% 压降至 0%…
Omni-IO Skills:用 Agent Harness 把现有 agent 改造成"全模态原生"
OmniIO Skills 提出一种"即插即用"的 Agent Harness,通过分层 Skill、标准化多模态 IO 接口、依赖感知编排(Declare Execution Graph)、持久化 Asset Registry,让 GPT5.6 Sol / Claude Sonnet 5 等现有通用 agent 不改…
QReason:把"查询推理"和"段落排序"解耦的高效重排序框架
在基于 CoT 的 listwise LLM 重排序器中,滑动窗口策略会反复生成高度相似的链式推理(CoT),带来显著冗余与高延迟;QReason 把"查询聚焦推理"从"窗口级段落相关性评估"中解耦出来:用一个专用重写器(rewriter)一次性生成面向排序的推理查询,再让非推理重排序器在所有窗口上复用,从而在 BRI…
Pretraining Transformers with Quantized Softmax in Attention:把 softmax 也压成低精度后再算反向
这篇工作系统研究了预训练阶段用 Kinterval 近似 softmax(即把 exp(x) 离散到 K+1 个网格点)对 Transformer 注意力做低精度化的影响:在 124M 参数 / 2.5B 训练 token 的受控对照实验中,作者发现反传时是否正确处理校准梯度以及straightthrough surr…
CorpusMap:让 Agent 用"实体导航"代替"裸语料检索"
当 LLM Agent 在大型文档集合上完成检索任务时,传统做法是把语料暴露为扁平的"文件列表"——相关文档之间没有相互引用的指示,导致 Agent 必须对每个 query 都重新发现这些关系,并常常在漏掉互补证据的同时消耗大量 token。CorpusMap 提出一个离线预构建的导航层:把语料围绕"反复出现的实体(r…
Context Language Models(CLM):让模型"原生"管理自己的上下文
把"上下文"视为一个模型自己可读写的文件(file),让 LM 以零样本(zeroshot)方式接管原本由外层脚手架/Agent Harness 承担的滚动、压缩、丢弃等上下文管理决策,并在多项 SOTA 任务上以更少 FLOPs 取得更高准确率(BrowseCompPlus 提升 11.4% 同时减少 21.5% F…
GPT-6 Astra 横评:通用系统在 9 大计算机视觉领域的边界地图
GPT6 Astra 与 5 个前沿通用 AI 系统在 34 项能力 / 55 个基准 / 9 个 CV 领域被系统性横评:语义理解类能力逼近人类与专用模型上限,度量几何、保真重建、时序一致性密集预测仍是未跨越的硬骨头。 过去两年通用多模态模型(GPT4V、Gemini、Claude、QwenVL 等)的能力边界一直在…
Nereus: 面向 LLM 后训练的自适应并行
Nereus 是一个感知迁移成本的自适应运行时,在 RL 后训练过程中动态调整 GPU 并行策略(TP/PP/DP),在真实 traces 上将 8B PPO 吞吐量提升最高 7.27 倍,同时过渡开销仅占总运行时间 0.079%。 大语言模型的 RL 后训练(PPO/DPO 等)在 GPU 集群上协调多个模型:生成模…
FlowTool: 基于流匹配控制图像修图中的工具参数
FlowTool 将基于工具的图像编辑任务从自回归生成重新建模为条件流匹配问题,用 Diffusion Transformer 直接生成高质量工具参数,在多个基准上实现至少 50 倍推理延迟降低 和近 2 倍内存节省,同时在参考图像评测中超越专用 MLLM 编辑智能体与商业模型。 当前主流的基于工具的图像编辑(图像修图…
在学生状态处从教师续写中学习:OLIVE 框架把"在线干预"做成了 LLM 蒸馏的新基线
字数目标:25004000 中文字,本篇约 3300。 事实层:所有数据点来自 arxiv abstract 与 paper_card TLDR,未读到 PDF 全文。 GitHub 验证:abstract 未给出代码仓库 URL,原文未明确 GitHub 链接(诚实标注 · 保 4 分护城河)。 ⚠️ 标注密度:含"…
ASCT:在反事实树上做注意力搜索以分配 Agentic RL 的动作信用
字数目标:25004000 中文字,本篇约 3100。 事实层:所有数据点来自 arxiv abstract + paper_card TLDR(27 页 / 9 图 / 19 表)。未读 PDF 全文。 GitHub 验证:abstract 未给出代码仓库链接,原文未明确 GitHub URL(诚实标注 · 保 4 …
SANTA++:用代表性 Key 采样把 KV cache 读带宽砍掉 80%
字数目标:25004000 中文字,本篇约 3000。 事实层:所有数据点来自 arxiv abstract + paper_card TLDR(v1 540KB)。未读 PDF 全文。 GitHub 验证:abstract 明确给出 ——已记录但未实际 clone 验证(abstract 给出等价已 ok)。 ⚠️ …
我们能信任教师吗?面向自蒸馏的解耦信用方向-幅度(DCSD)
本文只解读公开论文事实,所有数字与结论均来自 arxiv 摘要、TLDR 与作者主页索引;不下载 PDF,不跑代码;不确定之处显式标注「原文未明确」。 针对 RLVR(结果级 RL)与 OPSD(教师 token 级稠密监督) 在「步骤级信用」上耦合失败这一根本性难题,论文提出 DCSD(Decoupled Credi…
选多样化的 SFT 轨迹可提升 RL 后的泛化能力
本文只解读公开论文事实,所有数字与结论均来自 arxiv 摘要、TLDR 与作者主页索引;不下载 PDF、不跑代码;不确定之处显式标注「原文未明确」。 针对「为何有些经验证的解题数据 SFT 完反而 RL 不涨」这一推理训练里的老问题,论文提出一个轻量级、CPU 即可跑的规则化路线指纹作为 SFT 数据筛选器,并在大规…
NVAlign:面向连续自回归流匹配 TTS 的非言语控制直接梯度优化
本文只解读公开论文事实,所有数字与公式均来自 arxiv 摘要、TLDR 与作者主页索引;不下载 PDF,不跑代码;不确定之处显式标注「原文未明确」。 NVAlign 是首个面向连续自回归 + 流匹配 TTS 架构的非言语发声(NonVerbal Vocalization, NVV)标签可控生成的后训练框架,核心思路是…
通往可信 AI 的开发之道:支持可验证主张的机制
一篇 42 人联署的 274 页 arXiv 长报告,系统梳理了 AI 开发过程中"声称可信"与"声称可验"之间的差距,提出十类机制(涵盖机构、软件、硬件三层)来让外部利益相关方真正能审查 AI 系统的安全性、公平性、隐私等主张。 2020 年前后,AI 模型发布越来越频繁,但产业界与学术界已形成的规范(论文评审、安全…
G^2PTQ:通过广义梯度补偿改进 LLM 训练后量化
把 GPTQ 类训练后量化(PTQ)的两类既有局限——"局部逐层目标缺全局监督"与"全局目标 Hessian 估计陈旧"——用一套广义梯度补偿机制统一掉,逐 Transformer block 重算 Hessian + 一阶梯度,并加 trustregion 缩放防止权重大爆炸。论文公开 GitHub 代码(G2PTQ…
DISCO:用接地-推理解耦的分布式长上下文扩展
把长上下文推理拆成"分布式接地 + 中心化推理"双层:Worker LLM 池并行负责在长文本里检索证据,Driver LLM 用 GRPO 强化学习训练来调度任务并综合证据。RULERQA 1M token 上 78.4% 准确率,LongBench v2 上比全上下文模型高 9.8 分,推理成本比前沿模型省 80%…
JAM:带运行时 Agentic Research 的"准时制" Agent 记忆
JAM(JustInTime Agent Memory)把"记忆构建时机"从请求到达前的 AOT(aheadoftime)搬到请求到达后的运行时,由一个 Memorizer 保留全量原始历史、一个 Researcher 在每次请求时检索/检视/整合证据,配合 MemoryGym 合成数据 + verifiedtraje…
Stashbird:面向会话 Agent 的高效说话人索引记忆系统
Stashbird 是一个把"源 episode"和"派生记忆状态"用显式 provenance 链接起来的会话 Agent 记忆系统,靠 episode records / semantic relations / community summaries / 持久化图状态四层结构,把长期对话记忆的写入和检索都做出数量…
KV cache 复用技术的精度评估:方法学反思与 Boxoffice 基准
Positionindependent KV cache 复用(在 RAG 中跨 prompt 复用 chunk 级 KV cache 以降延迟)这件事看起来很美,但现有评测普遍高估了其收益:度量方法无法忠实捕捉复用带来的精度损失,现有数据集也不具备充分评估所需的"复用动态"。本文提出无歧义的精度损失评估方法学,并发布…
LastOPD:驯服潜在 On-Policy 蒸馏中的坍缩问题
LastOPD 发现潜在监督在 OnPolicy 蒸馏中存在「早期提升、晚期坍缩」和「对齐越好、行为越差」两个致命陷阱——其根源是跨层对齐中 teacher 与 student 的隐状态并非同类接口——并通过仅在最后一层施加潜在信号、逐步交棒给 token 级 OPD 的方案,在 MATH500 上用 4B/8B 教师…
BoundaryMORPH:通过主动集合选择实现预算化重排序的扩散检索
BoundaryMORPH 发现 RAG 中扩散查询(diffuse query)的核心矛盾是交叉编码器预算 B 小于 LLM 上下文窗口容量 k,导致标准重排序在结构上存在缺陷——它浪费算力验证明显靠前的候选文档,却忽略排名靠后但同样相关的文档——并用 Gaussian Process 将 CE 调用聚焦于「topk…
面向输出头量化的 Softmax 重参数化
大词表使输出头成为小型语言模型推理成本的重要组成部分,而量化输出头会显著扭曲 softmax 分布。Softmax 重参数化通过在量化前在输出头的加性等价类中搜索最优代表——对每个输出行减去词表行均值的标量倍数,以验证集 KL 为准则选取系数——在 W4 量化下实现 test KL 下降 73~93%,Phi 模型首批…
原生反思统一多模态模型:用交错强化学习让"反思文本"与"图像修订"同步进化
针对统一多模态模型(Unified Multimodal Model, UMM)"既能看图又能画图"的特性,本文提出 UMMReflection:把多轮"诊断→修订→再诊断→再修订"的整条轨迹作为一次强化学习(Reinforcement Learning, RL)序列,让反思文本与流式修订(flowbased revi…
InfiniHand:从第一视角视频流式估计世界空间手部动作
InfiniHand 是一个端到端(endtoend)的流式前馈框架,直接从未标定的第一视角视频(egocentric video)联合估计 MANO 手部参数、相机轨迹与世界空间手部位置;在 ARCTIC 数据集上 PAp(位置误差)较 ViDiHand 降低 21.4%,推理速度 11.19 FPS(是 HaWoR…
GeoVerse:在几何潜空间里做世界一致的新视角合成
针对稀疏输入下的新视角合成(Novel View Synthesis, NVS),本文提出 GeoVerse:把生成过程搬到预训练 3D 基础模型的几何潜空间(geometric latent space)里,再通过 ControlNet 风格的适配器注入 Wan2.2 VACE 视频生成器的外观先验(appearan…
神经图像水印的"残差可迁移性":一种新的伪造脆弱性度量与 CoverLock 防御
本文(cs.CR / cs.CV)把神经图像水印被"残差迁移"伪造这一已知漏洞形式化为 Residual Transferability (RT) 度量,并通过对照实验与受控干预证明:架构设计而非训练侧变体是决定水印能否被"抠出来贴到别图"的关键;据此提出即插即用的 CoverLock 策略,能在不动架构的前提下压低 …