解读
1535 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
TSseek:面向分布式时序数据集的正则表达式相似性搜索
TSseek 是一套面向大规模分布式时序数据的正则表达式驱动相似性搜索框架:把时序片段抽象为「保留斜率方向 + 值域」的线段序列,把正则查询转译成有界矩形,再在自研的分布式空间索引 TSseekX 上做全匹配与子序列匹配两种查询,论证并实证了 PAA/SAX 等传统近似索引在「正则模式查询」上根本不适用。 时序相似性搜…
Bespoke-Card:用代码生成替代手工调优的基数估计器合成系统
BespokeCard 是一个由 Agent 驱动的基数估计(cardinality estimation)系统——它针对一个具体的工作负载(schema + 真实查询),让规划 Agent 决定估计策略、让编码 Agent 直接生成可执行的 Python 估计器、用结构化 qerror 反馈 + 回归分析 + 课程式…
MAGMaR 2026 共享任务综述:以多模态检索驱动文章生成
ACL 2026 第二届 MAGMaR(Multimodal Augmented Generation via Multimodal Retrieval)共享任务概述了当年参赛系统在两个赛道的整体表现——视频检索(2 队 17 系统,全部超越上届冠军基线)与基于检索视频的接地文章生成(4 队 16 系统,所有参赛队都有…
CoRe:面向 Web 规模视频搜索的多阶段上下文感知查询改写器(连续奖励微调 LLM)
在大型短视频搜索引擎里,CoRe 把一个 LLM 查询改写器做成"用部署中的多模态相关性模型做奖励、乘性比值形式对齐生产融合代数、半在线 Mixed Preference Optimization 周更重训"的工业流水线,五个月内每周重新部署一次,线上 A/B 在 recall/rawrank/finerank 三段同…
ScoreGate:基于双分数统计融合的 RAG 自适应 Chunk 选择
ScoreGate 用"双编码器相似度 s_i + 交叉编码器 reranker 分 r_i"两条已经存在于标准 RAG 管线里的分数做 scorespace 决策,在不增加任何模型推理的前提下动态决定每个 query 要保留几个 chunk,在 MS MARCO 与真实生产流量上同时实现了"少 35% chunk、M…
多教师在策略蒸馏里工具调用边界漂移的诊断与校准
在多教师 onpolicy 蒸馏(OPD)训练 agentic LLM 时,聚合 KL/JS 散度会把"过度调用工具"这类行为漂移藏起来;论文给出"行为杠杆不均"(behavior leverage imbalance)的诊断视角,并用逐 token 的 Soft Clamp 把极端的 token 级 JS 散度压下去…
开源权重 LLM 中的"约束税":结构化输出约束下工具调用被抑制的实证研究
当 Tool Calling 与 JSON Schema 结构化输出约束同时启用时,多个开源权重(openweight)LLM 会出现 Tool Suppression——尽管工具执行与 schema 合规各自独立都能工作,联合部署下模型干脆不再调用工具;论文把原因归到"JSON Schema 被编译成 grammar…
DeepSearch-World:可验证环境中深度搜索 Agent 的自蒸馏
作者把"深度搜索 Agent"训练里 SFT 轨迹死板、RL 奖励稀疏两大痛点,合并成一个方案:先造一个确定性可验证的环境(DeepSearchWorld),再让 Agent 在里面自己跑、自己筛、自己蒸馏(DeepSearchEvolve)。结果 9B 模型没靠更强教师蒸馏,就在 BrowseComp 上拿到 31.…
Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)
mRNN(Baidu Research / UCLA, Mao et al., 2014)提出一种端到端的多模态循环神经网络,直接建模「给定图像和前文词序列条件下生成下一个词」的概率分布,在四个基准数据集上超越当时 SOTA,同时在图文双向检索任务上也取得了显著提升。 在 2014 年,image captioning…
当 AI 自己当"质检员"——BLIP 凭什么成了多模态时代的奠基工作?
你训练 AI 看图说话,数据是从网上抓的——结果 caption 乱七八糟,一半是错的。 你有两个选择:雇人重新标注(贵到天际),或者把数据全部丢掉(心疼)。 2022 年 Salesforce 的一篇论文,给出了第三个选项:让 AI 自己给自己当裁判,把错的踢出去。它就是 arXiv 2201.12086 的 BLI…
让 AI 一边"想"一边"动手查"——ReAct 凭什么成了 Agent 时代的开山祖师?
你用过 ChatGPT 的"联网搜索"吗?或者让 AI 帮你订外卖、比价下单、查航班?你有没有想过——它是怎么做到"想一句、查一句、再想一句"的? 这个看似理所当然的能力,背后其实有一篇 2022 年的论文,几乎凭一己之力奠定了整个 Agent 时代的玩法。它就是 arXiv 2210.03629 的 ReAct,被 …
主题综述 · agent(2026-08-15)
本棒定位:W5 综述轮换。date +%j = 227,mod 8 = 3 = multimodal。但 814 已有 multimodal 综述,顺延到下一未覆盖主题 = agent。 承接材料:paper_cards/ 中 719 ~ 815 期间 200+ 张 agent 主分类论文卡 + 两次 web_sear…
RL-Index:把推理前移到索引阶段的检索增强生成
本文提出 RLIndex——一个把「检索索引推理」建模为强化学习问题的 agentic indexing 框架:在索引阶段用 LLM 生成显式编码「查询知识潜在关系」的 rationale,再用 GRPO(Group Relative Policy Optimization) 配合「检索相似度」作为可验证 reward…
GigaAM Multilingual:面向代表性不足语言的基础模型
针对中亚三种长尾语言(Kazakh、Kyrgyz、Uzbek),作者用 2M 小时音频训了一个 Conformer 编码器,在预训练阶段做聚类级数据平衡、在微调阶段做域感知采样,让"小语种 ASR"在自发语音上明显超过 Whisper Large v3 和 Omnilingual1B 等开源强基线,同时算力开销可控。 …
MAGE-RAG:面向长文档问答中 Agentic 多模态 RAG 的多粒度自适应图证据框架
MAGERAG 通过"离线建图 + 查询时动态子图构建"的混合架构,在长文档多模态问答中首次实现了证据覆盖率与噪声控制的动态平衡:在 LongDocURL 达到 52.75% 准确率,在 MMLongBenchDoc 达到 53.26% 准确率(51.19 F1),显著优于固定 Topk Text RAG 和 Page…
Xiaomi-Robotics-1:基于 10 万小时真实轨迹的 VLA 基础模型
小米机器人团队用 10 万小时真实操作轨迹 + UMI 采集装置 + 自动语言标注流水线 训练了一个通用 VisionLanguageAction(VLA)基础模型,在未见环境中可零样本执行移动操控指令,并用极少数据就能微调到新任务。 通用机器人目前有三个长期痛点: 1. 数据规模:互联网级数据对机器人不适用,真实轨迹…
Lucid:当 Agent 开始「做梦」——多模态长期记忆的黑盒视觉攻击
提出 Lucid —— 一种严格 imagebounded(不接触目标 MLLM、不接触检索编码器、不接触文本通道)的黑盒对抗框架,可对多模态 Agent 的长期视觉记忆管道实现 61.6% 的"记忆投毒"成功率与 58.4% 的"记忆注入"成功率,揭示当前主流多模态记忆管线存在结构性漏洞。 2026 上半年 Agen…
S1-Omni:把 200 个科学任务塞进一个统一多模态推理模型
S1Omni 是面向 AI4Science 的统一多模态推理模型,把 CIF(晶体)、SMILES(分子)、蛋白序列、谱图、科学图像等异构数据统一表征为单一共享空间,在 200 个科学任务 / 60+ benchmark 上训练与评估,大多数任务上超越 GPT5.5 与 Gemini3.1Pro,并在多项任务上打平或超…
Maglev:滑动循环记忆——固定大小记忆的并行可训练循环 Transformer
首段自检:机制 3 段(双模型耦合 / 记忆一致性损失 / 滑动窗口 K/V 循环注入)+ 工程 2 段(共享参数 + 与滑动窗口基线对比)+ ⚠️ 数字核验 2 处("validation loss 与 pretraining benchmark 提升"未给具体数值;"参数共享保留大部分增益"未给比例,abstrac…
从不可听到不可信:LALM 的低频安全风险与 DRG 防御
首段自检:机制 2 段(ILL 攻击管线 / DRG 检测重录防御)+ 工程 2 段(跨 6 个 LALM / 通用波形黑盒设定)+ ⚠️ 数字核验 3 处(67pp / 1.33 / 28.5%→46.1% 均来自 abstract 原文但需 PDF 复核任务清单;6 个 LALM 模型名单 abstract 未给;…
Gambit:把测试时计算从"撒网"变成"投资"的思维级束搜索
首段自检:机制 2 段(思维级束搜索算法 / 隐藏状态轻量打分器)+ 工程 2 段(硬件利用率 vs 并行采样 / 端到端 vs 减法剪枝)+ ⚠️ 数字核验 4 处(HMMT24 +6.7pp / AIME25 +3.3pp / 2× 吞吐 / 68.5% token 均来自 abstract 但属"up to"上限…
规范优先收敛与 AI 编码 Agent:拆除 717k 行代码库核心不变量的案例研究
首段自检:机制 4 段(规范→精炼→原子实现→验证循环)+ 工程 3 段(717k 行/189 文件/三天/$2430)+ ⚠️ 数字核验 3 处(提交统计 / 审计缺陷 / 成本)均来自 abstract 单源,单案例无横向对照。 在没有人工代码审查、也没有现成测试预言机的条件下,一个 AI 编码 Agent 通过"…
上下文匹配蒸馏(CMD):自回归视频蒸馏里的教师因果性
首段自检:机制 5 段(causal teacher / prefix scoring / prefix corruption / 同构 formulation / 因果边界对齐)+ 工程 3 段(帧级/块级/长视频/相机条件四场景外推)+ ⚠️ 数字核验 3 处(SOTA aggregate 表述、benchmark…
用于可组合非结构化知识编辑的混合策略自编辑(HPSE)
首段自检:机制 4 段(composability / selfdistillation / hybrid rollout / 理论保证)+ 工程 3 段(4 backbone × 2 editor + plugandplay)+ ⚠️ 数字核验 2 处(数字均未在 abstract 给出,标注原文未明确)。 HPSE…
让机器人"先在脑子里演练一遍再动手":DreamX-Phi 拿下世界大赛双榜头部
你有没有想过 🤔: 机器人想抓一个杯子,AI 不是直接控制它动手,而是先"在脑子里"把整个动作跑一遍视频——看看如果按这个角度伸手,会不会碰倒旁边的水壶、会不会抓空、杯子会不会翻。 然后挑一个最稳的方案去执行。 这听起来像科幻,但其实是一个被工程界严肃追求的方向:视频世界模型。 最近在 WorldArena 2.0 C…
当 AI 替你查"议员们说过啥",你拿到的是不是真相?一篇被 ISWC 2026 接收的论文说:不一定是
你有没有想过 🤔: 你想搞清楚"意大利议员们对 AI 监管到底怎么看的",于是打开一个 AI 助手问了一句—— 它给你列了一堆引用,看上去挺像那么回事。但这些引用真的平衡吗?那些话真的是那位议员说的吗?那位议员真的有资格谈这个话题吗? 听起来像哲学问题,但它是一个真实的政治风险——arXiv 2608.13410(Pa…
Recursive Agent Harnesses:将代码优先的 Agent 递归推向长上下文推理
RAH 将递归 LLM(RLM)中"模型调用递归"拓展为"完整 Agent harness 递归"——父 Agent 生成并运行可执行脚本,脚本内并行 spawn 子 Agent harness,在 OolongSynthetic 上以 GPT5 为 backbone 将基线从 71.75% 提升至 81.36%,用更…
TRACE:通过 Token 影响归因追踪投毒检索语料中的目标答案
TRACE 是一种无需辅助分类器、无需额外 LLM 调用的轻量级 RAG 投毒攻击检测框架,通过 Token 影响归因(Token Influence Attribution)追踪答案相关 Token 在检索文档中的高影响关键词,在 3 个 QA 基准和 6 个 LLM 上验证了检测能力,并能同步揭示攻击者指定的目标答…
Tatoxa:面向低资源语言鞑靼语的文本去毒系统
Tatoxa 是一个面向鞑靼语(Tatar)文本去毒(Text Detoxification)的 SOTA 系统,在关键质量指标上同时超越开源和商用闭源 LLM,并发布了一个新的鞑靼语去毒数据集;其跨语言迁移实验揭示了一个重要结论:从文化相近语言(如俄语)迁移的效果,显著差于使用原生鞑靼语数据训练的模型,这一发现对低资…
BigBird:把 Transformer 的注意力从二次方压到线性,且不丢「通用逼近」性质
Google Research 提出的 BigBird(Zaheer et al., 2020, NeurIPS 2020)通过「全局 + 局部 + 随机」三种稀疏注意力模式叠加,把 Transformer 的注意力复杂度从 O(n²) 降到 O(n),同时在理论上证明:稀疏注意力机制仍是序列函数的通用逼近器且具备图灵…