研究库 深度解读
Explainers · 学术推广产出

解读

2626 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

后训练 LLM 别再"瞎卷"——2026 这篇论文教 RL 工程师用 verifier 当"教练",让小模型也能"刷难题"
如果你们团队正在做 LLM 后训练(posttraining / RLHF / RLAIF / 蒸馏 / GRPO 变体)——让 Qwen30.6B、Qwen31.7B 这种小模型去刷 code / math 任务——你大概率会遇到一个让人抓狂的现象:模型在前几次训练时 pass@k 涨得很好,但到了训练中后期就开始左…
科普版 arXiv:2610.04596 2026-10-08
调 RAG 别再盲搜 · Agentic AutoRAG · 2610-08452 · 短视频脚本镜像
(开场 04 秒)调 RAG 是组合优化。今天拆一个把它从盲搜换成对话式调优的论文。 (第一段 416 秒)Agentic AutoRAG,论文全名 RAG Pipeline Optimization through ReasoningDriven Agents。作者 Lasse B. Strand,10 月 6 日 …
视频脚本 arXiv:2610.08452 2026-10-08
视频选题榜 2026-10-08
· Bootstrapping Agent Memory from SelfGenerated Tasks · Agent 靠自博弈生成任务并自验证规则,冷启动记忆不必从人写指南开始 · round=R1 · Agentic AutoRAG: RAG Pipeline Optimization through Reas…
选题榜 2026-10-08
DiffGate:按难度门控的教师引导,离策略蒸馏与可验证奖励的混合
在 Qwen30.6B 与 Qwen31.7B 上,DiffGate 让 GRPO 在 code 与 math 两个领域的 pass@8 全面提升,code 上 avg@8 与 pass@8 较 matched GRPO 分别 +1.7/+1.8 与 +1.6/+5.7,math 上 pass@8 提升 +1.1/+3…
深度解读 arXiv:2610.04596 2026-10-08
Agentic AutoRAG:用推理驱动 Agent 优化 RAG 流水线,并区分检索失败与生成失败
Agentic AutoRAG 在三个 multihop QA 基准上用 LLMjudge 准确率超过所有对比 baseline,且前 10 次 trial 就能追平统计 baseline 跑满 30 次的 LLMjudge 准确率;在真实医疗语料 costaware 模式下达到中位 77% 准确率(vs 最强 bas…
深度解读 arXiv:2610.08452 2026-10-08
WildMatch:仅靠身份标签的弱监督关键点匹配器,自适应野生动物重识别
WildMatch 用身份标签当隐式正/负信号去对比式 finetune 一个现成的关键点匹配器,在多个开源野生动物 reID 数据集上超过 offtheshelf 匹配器与一个 SOTA 局部全局融合方法,并且在 openworld(heldout 个体)设定下学到的是"可迁移对应先验"而非记忆训练身份。 野生动物相…
深度解读 arXiv:2610.07384 2026-10-08
2609.30216 · 小红书推广卡片文案
1. 数字钩子版:7 天 43,750 stars、2,170 个项目 —— arXiv 2609.30216 第一次给「决策模型爆款」做可量化切片 2. 类比版:相当于 AI 模型界的「用户调研报告」 —— arXiv 2609.30216 用 GPT6 双盲标注揭穿 43,750 stars 的真相 3. 反直觉版…
视频文案 arXiv:2609.30216(点格式) 2026-10-07
2510.16558 · 小红书推广卡片文案
1. 数字钩子版:扫了 67,057 个 AI 工具插件 —— arXiv 2510.16558 发现 833 个有代码漏洞、18 个「描述本身就带毒」 2. 类比版:相当于 AI 工具界的「USBC 接口」被安插了间谍 —— arXiv 2510.16558 第一次给 MCP 生态做横切面体检 3. 反直觉版:LLM…
视频文案 arXiv:2510.16558(点格式) 2026-10-07
一款 AI 模型发布 7 天后,GitHub 上发生了什么?——一篇 2026 论文用 2,170 个项目告诉你答案
2026 年 9 月 15 日,一家叫 TypeSafe AI 的公司发布了一个叫 Jev 的快速决策模型(走"零样本能力 + 一次前向决策"路线,定位介于传统监督分类器和 LLM 之间)。7 天后,GitHub 上多了 1,865 个新仓库、305 个已有项目集成、43,750 stars。听起来是个"爆款叙事"对吧…
科普版 arXiv:2609.30216 2026-10-07
你公司刚装上的「AI 工具插件」,可能是别人安插的「间谍」——一篇 DSN 2026 论文,第一次把这件事的全貌摆到桌面上
MCP(全称 Model Context Protocol,你可以把它想成"AI 世界的 USBC 接口")这两年被吹成"Agent 时代的统一标准",Claude Desktop、Cursor、Cline、OpenAI 工具链全都接进来了。但 2026 年 DSN 顶会这篇论文(arXiv 2510.16558)做了…
科普版 arXiv:2510.16558 2026-10-07
DAEDALUS:用「自生成任务」给 LLM Agent 冷启动一份可复用记忆
DAEDALUS 是一个不需要预置环境知识、不需要 oracle 验证器的 Agent 记忆构建框架。它让一对 Agent(一个 explorer、一个 solver)在环境里互相对弈:explorer 出题,solver 做题,只有当 solver 在「带启发式」情况下反复成功,才把启发式写进记忆库。在 AppWor…
深度解读 arXiv:2610.08048 2026-10-07
EMHO:用「经验轨迹」自我进化的具身 Agent Harness
EMHO(EMbodied Agent Harness Optimization)是一个保持底座模型冻结、用「执行轨迹 + 历史 harness」迭代改写 harness 自身的具身 Agent 自进化框架。它不优化技能 / 恢复 prompt 这一层,而是修改 agent 如何观察、如何用视觉工具、如何把观察落到动作…
深度解读 arXiv:2610.08432 2026-10-07
EC-RAG:把长视频问答搬到「事件链」上的免训练检索增强框架
ECRAG(Event Chain RetrievalAugmented Generation)是一个完全免训练的长视频理解框架,它先把视频切成「语义事件段」并链接成结构化的事件链,再用事件级而不是帧级/片段级的检索去回答问题。在 VideoMME、MLVU、LongVideoBench 三个长视频基准上一致优于 fr…
深度解读 arXiv:2610.08674 2026-10-07
从证据到行动:工具调用 Agent 在哪里出错
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;v1 提交作者已从 arXiv submission history 拿到,但未独立验证机构归属;未触 PDF 全文精读;项目页 已找到,但 GitHub 仓库许可证与数据集商业可用性未核实;"静态评估 ≥90% → 交互执行 …
深度解读 arXiv:2610.07753 2026-10-07
UNREAL:用单一模型统一检索与长上下文证据选择
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;v1 提交作者已从 arXiv submission history 拿到,但未独立验证机构归属;未触 PDF 全文精读;未找 GitHub 仓库;abstract 中 HotpotQA 49.1→73.2%、NoLiMa 1.…
深度解读 arXiv:2610.08463 2026-10-07
RAG-PIBench:可识别泄漏的 RAG 提示注入检测基准
⚠️ 诚实标注(局限性):本解读仅基于 arxiv abstract + 论文卡 TLDR;v1 提交作者已从 arXiv submission history 拿到,但未独立验证机构归属;未触 PDF 全文精读;未找 GitHub 仓库;abstract 中"DistilBERT F1 = 0.896 / PRAUC…
深度解读 arXiv:2610.08571 → 2610.08571 2026-10-07
你以为 AI 数学竞赛拿了金牌就是"真懂数学"——2026 这篇论文告诉你:它可能只是"算得准"而已
如果你是做 AI 数学 / AI 推理 / AI 教育的产品经理,你大概率在朋友圈看过这种标题: "DeepSeekMath 拿下 AIME 84.3%!国产数学 AI 又一次吊打 GPT4!" 你点开模型 demo,看到模型一步一步写出漂亮的解题路径,最后得出正确答案。你截图发到团队群里,老板转给你一句:"咱们能不能…
科普版 arXiv:2610.02191 2026-10-07
LLM 即已经是 Jev 风格决策模型——何时以及如何微调
Qwen3.54B 无需任何训练即可作为 Jev 风格决策模型使用,性能与社区专用 Jev 模型相当;微调只在特定场景(弱 backbone、高意图路由基数)带来实质提升,而 KL 散度锚定机制是防止对话能力退化的关键工程护栏。 软件系统每天都在做结构化决策:路由工单、识别用户意图、验证规则满足情况。传统方案让 LLM…
深度解读 arXiv:2610.02076 2026-10-07
大语言模型的数值线性代数:一座连接两个世界的双向桥
这是 NLA 领域泰斗 Yousef Saad(明尼苏达大学)与卡塔尔计算研究所 Abdelkader Baggag 合著的综述,系统以数值线性代数视角解读 LLM 的底层矩阵机制——让 NLA 专家看懂 Transformer 在做什么,也让 ML 社区看到 NLA 能为 LLM 带来什么。 NLA 与深度学习两个社…
深度解读 arXiv:2610.04631 2026-10-07
潜在推理应当满足什么:用流匹配做 LLM 隐式 CoT 的五维清单与 FLaRe 配方
本文为"LLM 在连续潜空间里思考、只外化最终答案"的隐式推理路线提出五项硬性要求(有用 / 多样 / 可解释 / 可加计算 / 高效),论证基于流匹配(flow matching)的参数化是当前最有望同时满足它们的家族,并给出一份端到端训练配方 FLaRe,在算术基准上以 1/4 的延迟达到显式 CoT 97% 的准…
深度解读 arXiv:2610.06666 2026-10-07
主题综述 · llm-infra(2026-10-05 · v3 重写覆盖 v2)
v1 → v2 → v3 重写说明: v1(1005 21:09 CST)5 项严重违规:verifiability 沿用 102 v1 / 立标池 6 件 ★★~★★★★★ 误立 / 4 件商业事件进立标池 / §四 凑数 / §1 事件堆叠。v1 已备份为 20261005llminfra.md.v1bak2026…
周综述 2026-10-05
主题综述 · evaluation(2026-10-07)
本棒 netnew = 4 件(AgencyBench 1Mtoken 真实世界 Agent 评测 + JIL Attack 调度安全形式化 + Selection vs Extraction 预注册负面 + LMBuild 邻接预备 · 主分类 NETnew = 1、邻接/副 NETnew = 3 · 沿用 R96 …
周综述 2026-10-07
AI 自主运营一家公司,靠"刷题数据"是不够的——2026 这篇论文给"enterprise AGI 训练数据"装了个新发动机
如果未来真的会出现「一家能自我运营的公司(a company that runs itself)」——由多个 AI Agent 当 CEO、当运营、当营销、当财务——这些 Agent 是怎么被训练出来的? 2026 年 10 月这篇论文(arXiv 2610.05912,MiniCorp)正面回答了一个被工程圈长期回避…
科普版 arXiv:2610.05912 2026-10-07
把 AI 塞进业务流程,不是给它"加一节选修课"——2026 斯德哥尔摩大学这篇论文,给所有公司上了一节反常识课
如果你们公司想让 AI 进业务流程——比如让 AI 处理银行的客户入职、医疗的病历摘要、电商的售后分流——大多数团队的做法是"在现有流程末尾加一节 AI 选修课"或者"在流程图里零散插入几个 AI 节点"。斯德哥尔摩大学 Amin Jalali 团队 2026 年 10 月这篇论文(arXiv 2610.06207)直…
科普版 arXiv:2610.06207 2026-10-07
AI-Decision Checkpoints:为 AI 增强的业务流程管理构建决策框架
斯德哥尔摩大学 Amin Jalali 团队提出用"AI 决策检查点"(AIDecision Checkpoints)替代 BPM 课程中 AI 作为附加技术的落后定位——在业务流程开发生命周期的每个阶段强制学生做 AI 采纳的结构化推理,而非简单地在课后加一节 AI 选修课。该框架通过一个虚构银行客户入职案例(Ban…
深度解读 arXiv:2610.06207 2026-10-07
MiniCorp:AI 自主运营公司的"最后一公里"模拟器
提出 MiniCorp:一个面向电商公司的"双世界"办公模拟器,让多个 AI Agent 在外部市场(客户/对手/价格机制)与内部公司(事件观察→讨论→决策)的闭环中持续协作并被记录,由此为 AI 公司运营研究规模化地生成纵向(longitudinal)+反事实(counterfactual)的企业数据。 "enter…
深度解读 arXiv:2610.05912 2026-10-07
把记忆装进参数:面向 LLM 的 In-Parameter Memory 综述
这是一篇综述:把"在 LLM 推理时把可复用的记忆信息以参数对象(adapter / 嵌入 / attention / FFN 等)形式插入前向通路"的方法统一命名为 inparameter memory,并用两条正交轴——参数放置位置(Parameter Placement) 与 参数获取时间(Parameter A…
深度解读 arXiv:2610.08630 2026-10-07
视频选题榜 2026-10-07
· UndoBench · Agent 完成率 ≠ 上线资格 · CRSR 46.72% 拆穿 83.54% 完成率假象 · round=R1 · JIL · 长度预测调度器被后缀劫持 · 让请求完成快 1.53 倍 · round=R2 · Towards InParameter Memory Augmentatio…
选题榜 2026-10-07
VLA 在机器人执行误差下的自补偿与压力测试
提出 selfcompensating VLA(自补偿视觉语言动作策略):在部署阶段用「策略输出的指令动作」与「机器人实际执行的运动」之间的残差做在线微调,让 VLA 在生成指令时就预先抵消机械磨损、负载变化等执行误差,并在配套的 RoboStress 仿真基准上把仿真真机一致性往前推了一步。 VLA(VisionLa…
深度解读 arXiv:2609.37334 2026-10-07
主题综述 · Agent(2026-10-07)
1. 字数 CJK:实际 3,995 ≤ 4,000 任务上限(反思棒硬上限 3,900 标注不达标 ⚠)✅ 2. ⚠️ 密度:13 + 4 = 17 处 ≥ 10 ✅ 3. 反方 v2 三段式:§3.1–§3.4 = 4/4 ✅ 4. 立标池 4 件套:4/4 ✅ 5. §五 合流密度:7/7 ✅ 6. §3.4 法…
周综述 2026-10-07