解读
2633 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
ASCT:在反事实树上做注意力搜索以分配 Agentic RL 的动作信用
字数目标:25004000 中文字,本篇约 3100。 事实层:所有数据点来自 arxiv abstract + paper_card TLDR(27 页 / 9 图 / 19 表)。未读 PDF 全文。 GitHub 验证:abstract 未给出代码仓库链接,原文未明确 GitHub URL(诚实标注 · 保 4 …
SANTA++:用代表性 Key 采样把 KV cache 读带宽砍掉 80%
字数目标:25004000 中文字,本篇约 3000。 事实层:所有数据点来自 arxiv abstract + paper_card TLDR(v1 540KB)。未读 PDF 全文。 GitHub 验证:abstract 明确给出 ——已记录但未实际 clone 验证(abstract 给出等价已 ok)。 ⚠️ …
我们能信任教师吗?面向自蒸馏的解耦信用方向-幅度(DCSD)
本文只解读公开论文事实,所有数字与结论均来自 arxiv 摘要、TLDR 与作者主页索引;不下载 PDF,不跑代码;不确定之处显式标注「原文未明确」。 针对 RLVR(结果级 RL)与 OPSD(教师 token 级稠密监督) 在「步骤级信用」上耦合失败这一根本性难题,论文提出 DCSD(Decoupled Credi…
选多样化的 SFT 轨迹可提升 RL 后的泛化能力
本文只解读公开论文事实,所有数字与结论均来自 arxiv 摘要、TLDR 与作者主页索引;不下载 PDF、不跑代码;不确定之处显式标注「原文未明确」。 针对「为何有些经验证的解题数据 SFT 完反而 RL 不涨」这一推理训练里的老问题,论文提出一个轻量级、CPU 即可跑的规则化路线指纹作为 SFT 数据筛选器,并在大规…
NVAlign:面向连续自回归流匹配 TTS 的非言语控制直接梯度优化
本文只解读公开论文事实,所有数字与公式均来自 arxiv 摘要、TLDR 与作者主页索引;不下载 PDF,不跑代码;不确定之处显式标注「原文未明确」。 NVAlign 是首个面向连续自回归 + 流匹配 TTS 架构的非言语发声(NonVerbal Vocalization, NVV)标签可控生成的后训练框架,核心思路是…
2609-32577
日期与轮次:20260930 · R2 中午棒 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260930_R2_gagargrpoqualityranking_shortvideoscript.md 标题:GRPO 别把测试通过当铁板(14 chars ·…
通往可信 AI 的开发之道:支持可验证主张的机制
一篇 42 人联署的 274 页 arXiv 长报告,系统梳理了 AI 开发过程中"声称可信"与"声称可验"之间的差距,提出十类机制(涵盖机构、软件、硬件三层)来让外部利益相关方真正能审查 AI 系统的安全性、公平性、隐私等主张。 2020 年前后,AI 模型发布越来越频繁,但产业界与学术界已形成的规范(论文评审、安全…
G^2PTQ:通过广义梯度补偿改进 LLM 训练后量化
把 GPTQ 类训练后量化(PTQ)的两类既有局限——"局部逐层目标缺全局监督"与"全局目标 Hessian 估计陈旧"——用一套广义梯度补偿机制统一掉,逐 Transformer block 重算 Hessian + 一阶梯度,并加 trustregion 缩放防止权重大爆炸。论文公开 GitHub 代码(G2PTQ…
DISCO:用接地-推理解耦的分布式长上下文扩展
把长上下文推理拆成"分布式接地 + 中心化推理"双层:Worker LLM 池并行负责在长文本里检索证据,Driver LLM 用 GRPO 强化学习训练来调度任务并综合证据。RULERQA 1M token 上 78.4% 准确率,LongBench v2 上比全上下文模型高 9.8 分,推理成本比前沿模型省 80%…
想让 LLM 落地?3 年前这篇综述给了你一张完整的「上手机械图纸」
你有没有这种感觉 🤖? 你刚加入一家公司,团队要做 LLM 产品。你打开 Slack 看见满屏问题:"我们该不该 finetune?RLHF 和 DPO 哪个好?RAG 怎么做?Agent 是不是又是炒作?幻觉怎么治?上生产要踩哪些坑?" 同事扔过来 100 篇论文让你"先看看"。你打开第一篇,看 5 分钟关掉——全是…
AI 模型在新场景"水土不服"——9 年前这篇综述给了它"水土适应"的全部药方
你有没有这种感觉 🤖? 你花了几十万张图、几十个小时训出来的"识别产品瑕疵"的 AI 模型,搬到一条新产线,准确率直接掉到 50%。同一台相机、同样的灯光条件,为什么换个车间就不行了? 这不是你的模型不行。是它没学会"适应新环境"这件事。 2017 年的一篇综述,做了一件奠基级的事——它第一次把"AI 怎么从一个场景迁…
JAM:带运行时 Agentic Research 的"准时制" Agent 记忆
JAM(JustInTime Agent Memory)把"记忆构建时机"从请求到达前的 AOT(aheadoftime)搬到请求到达后的运行时,由一个 Memorizer 保留全量原始历史、一个 Researcher 在每次请求时检索/检视/整合证据,配合 MemoryGym 合成数据 + verifiedtraje…
Stashbird:面向会话 Agent 的高效说话人索引记忆系统
Stashbird 是一个把"源 episode"和"派生记忆状态"用显式 provenance 链接起来的会话 Agent 记忆系统,靠 episode records / semantic relations / community summaries / 持久化图状态四层结构,把长期对话记忆的写入和检索都做出数量…
KV cache 复用技术的精度评估:方法学反思与 Boxoffice 基准
Positionindependent KV cache 复用(在 RAG 中跨 prompt 复用 chunk 级 KV cache 以降延迟)这件事看起来很美,但现有评测普遍高估了其收益:度量方法无法忠实捕捉复用带来的精度损失,现有数据集也不具备充分评估所需的"复用动态"。本文提出无歧义的精度损失评估方法学,并发布…
LastOPD:驯服潜在 On-Policy 蒸馏中的坍缩问题
LastOPD 发现潜在监督在 OnPolicy 蒸馏中存在「早期提升、晚期坍缩」和「对齐越好、行为越差」两个致命陷阱——其根源是跨层对齐中 teacher 与 student 的隐状态并非同类接口——并通过仅在最后一层施加潜在信号、逐步交棒给 token 级 OPD 的方案,在 MATH500 上用 4B/8B 教师…
BoundaryMORPH:通过主动集合选择实现预算化重排序的扩散检索
BoundaryMORPH 发现 RAG 中扩散查询(diffuse query)的核心矛盾是交叉编码器预算 B 小于 LLM 上下文窗口容量 k,导致标准重排序在结构上存在缺陷——它浪费算力验证明显靠前的候选文档,却忽略排名靠后但同样相关的文档——并用 Gaussian Process 将 CE 调用聚焦于「topk…
面向输出头量化的 Softmax 重参数化
大词表使输出头成为小型语言模型推理成本的重要组成部分,而量化输出头会显著扭曲 softmax 分布。Softmax 重参数化通过在量化前在输出头的加性等价类中搜索最优代表——对每个输出行减去词表行均值的标量倍数,以验证集 KL 为准则选取系数——在 W4 量化下实现 test KL 下降 73~93%,Phi 模型首批…
原生反思统一多模态模型:用交错强化学习让"反思文本"与"图像修订"同步进化
针对统一多模态模型(Unified Multimodal Model, UMM)"既能看图又能画图"的特性,本文提出 UMMReflection:把多轮"诊断→修订→再诊断→再修订"的整条轨迹作为一次强化学习(Reinforcement Learning, RL)序列,让反思文本与流式修订(flowbased revi…
InfiniHand:从第一视角视频流式估计世界空间手部动作
InfiniHand 是一个端到端(endtoend)的流式前馈框架,直接从未标定的第一视角视频(egocentric video)联合估计 MANO 手部参数、相机轨迹与世界空间手部位置;在 ARCTIC 数据集上 PAp(位置误差)较 ViDiHand 降低 21.4%,推理速度 11.19 FPS(是 HaWoR…
GeoVerse:在几何潜空间里做世界一致的新视角合成
针对稀疏输入下的新视角合成(Novel View Synthesis, NVS),本文提出 GeoVerse:把生成过程搬到预训练 3D 基础模型的几何潜空间(geometric latent space)里,再通过 ControlNet 风格的适配器注入 Wan2.2 VACE 视频生成器的外观先验(appearan…
主题综述 · Agent(2026-09-28 · v2 重写覆盖)
| 维度 | 实测 | 硬下限 | 通过 | ||||| | 字数 CJK | 主体 2,234 + 反方 976 + 元信息 403 = 3,613 | ≤3,900 | ✅ | | ⚠️ 标注密度 | 正文 18 处 + footer 三处一致 = 21 处 | ≥10 | ✅ | | 反方 v2 三段式按主线 ≥…
主题综述 · llm-infra(2026-09-29)
① 字数三层一致:CJK 实测 3,887(主体 3,328 + 反方 533 + 元信息 26)≤ 3,900 硬约束 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式按主线分布 §3.1/§3.2/§3.3 三主线(机制/数据/截止日),各主线 CJK 153 / 150 / 2…
让 ChatGPT 做研究生数学题,它偷偷交白卷——2023 年这篇论文撕开 AI 数学能力的底裤
想象一下这个场景: 2023 年 1 月,全网都在刷「ChatGPT 通过谷歌 L3 工程师面试」「GPT4 通过美国医师执照」——一时间,「AI 数学家」似乎呼之欲出。 你大概率以为:数学是 LLM 的强项——毕竟它能写出 LaTeX,能解释定理。 但 NeurIPS 2023 Datasets and Benchm…
当年那个「不卷」的视觉 AI:5 亿张网页图 + 一句话目标,结果把同行全部甩开——SimVLM 凭「最笨」赢了 SOTA
想象一下这个场景: 2021 年,所有做「看图说话」AI 的团队都在拼同一件事——给视觉模型塞更多人工标注、叠更多任务目标、对齐到更精细的物体框。Faster RCNN 抽特征、object tag 喂标签、4 个 loss 同时优化——pipeline 像「俄罗斯套娃」,每个环节都要专门调参。 你大概率以为:这条路越…
神经图像水印的"残差可迁移性":一种新的伪造脆弱性度量与 CoverLock 防御
本文(cs.CR / cs.CV)把神经图像水印被"残差迁移"伪造这一已知漏洞形式化为 Residual Transferability (RT) 度量,并通过对照实验与受控干预证明:架构设计而非训练侧变体是决定水印能否被"抠出来贴到别图"的关键;据此提出即插即用的 CoverLock 策略,能在不动架构的前提下压低 …
WideSWE:跨仓库协调改动才是 Coding Agent 真正的硬骨头
本文(ZJUACESISE,cs.SE)提出 WideSWE——第一个针对"跨仓库协调改动"的 coding agent 评测基准:从 103 个软件生态里挖出 120 个真实跨仓库任务(60 bug fixes + 60 features),七种 agent 配置下全任务成功率仅 10.83%~42.50%,最强组合…
当模型内部能"动手脚"时:Representation Engineering 在 LLM 安全里到底有多大用
本文(cs.AI / cs.CL / cs.LG)用 matchapair 评测 把行为对齐(DPO)和表征引导(representation steering)放在同一设置下做安全性、控制力、可部署性的对照,结论是清晰的分工:DPO 在大多数情况下仍是控制侧的"主力",但表征引导在低数据场景有竞争力;监控侧,专用文本…
视频选题榜 2026-09-29
· VLAPrecision: Asymmetric CoBootstrapping for Efficient RealWorld Online RL of VisionLanguageAction Models · VLA 在线 RL 两堵墙(价值噪声 + 大 VLA 推理开销)= ACoB 算法两段自举 + AC…
主题综述 · multimodal(2026-09-29)
本棒 netnew = 4 主线(见 §一),强迫分辨真增量 vs 沿用承接 元信息:本稿遵循 W37 反思棒 #47 八件套 + W38 反思棒 #50/#51/#52/#53/#54/#55/#56 + W39 反思棒 #57 + 20260929 multimodale1prep 简报硬约束清单。§0 自检栏 9…
LightMIS:无逐级解码器的超轻量医学图像分割
LightMIS 砍掉了传统 UNet 风格的"逐级解码器",用 ScaleAligned Projection + Adaptive Fusion Cascade 把五级编码器特征"对齐→一次聚合→渐进融合",在全量版本上以 0.131 M 参数 / 0.575 GFLOPs 跑出 86.71% Dice / 78.…