解读
1750 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Reasoning-Language Alignment in Monolingual RAG:强制德语推理告诉了我们什么
在德语单语 RAG 场景下,强制 LLM 用德语而非英语进行推理,能带来明显提升——前提是推理语言与查询及检索文档语言一致。但英语推理仍是上界,强制德语无法超越它。这说明 native multilingual reasoning 能力才是关键,forced alignment 只是桥梁。 大模型推理能力(Chaino…
World Embedding Benchmark:视频表征的物理信息编码评测
World Embedding Benchmark 构建了 8,000 个跨流体力学/固体力学/动力学/光电物理的仿真案例,首次系统揭示预训练视频表征在「跨模态物理对齐」与「定量物理信息可恢复性」之间存在 tradeoff:强化 alignment 会损害 property regression,反之亦然。 World…
HyperBrowseComp:面向 Web-Browsing Agent 的多语多模态压力测试
HyperBrowseComp 是一个由人工撰写、覆盖 13 种语言、刻意"上调难度"的多模态网页浏览基准(423 题),用来检验 Browsing Agent 是否真的能跨语种、跨模态(视频、扫描件、图片、地图)地"挖掘+拼图"式检索,而不是吃老本回答。 过去一年,GAIA、HLE、WebArena、Mind2Web…
ProAR:让自回归视频模型学会"前瞻性推理"
ProAR(Prospective Reasoning with Autoregressive Video Models)是一个把"自回归视频生成"从"短视的被动逐块预测"改造为"目标导向的前瞻性推理"框架,仅用25% 的训练步数就能超过同架构完全训练的标准 AR 基线,并在多个视觉推理 benchmark 上稳定提升…
LexReward:把法律回答分成 Style / Element / Chain 三档,再做 rubric 奖励
原文未明确开源仓库与训练数据规模(arXiv 页面仅给出 PDF/HTML),下文涉及"训练集/代码可获取"处统一标注"原文未明确"。⚠️ 提示:本解读基于 arXiv v1 摘要 + 论文卡,PDF 全文未下载。 1. 真问题是什么?——法律 LLM 的奖励信号要么只看对错(丢失专业维度),要么整体性"打一个分"(不…
MotorMind:通用 VLM 套上"中层动作 + 异步监控"就能零样本操控机器人
原文未明确开源仓库(arXiv 页面仅给出 PDF/HTML,未挂 GitHub),下文涉及"代码/数据可获取"处统一标注"原文未明确"。⚠️ 提示:本解读基于 arXiv v1 摘要 + 论文卡,PDF 全文未下载,所有数字与措辞以原文 abstract 为准。 1. 它真解决的问题是什么?——VLA(visionl…
SimuVerity:当"能跑起来的 Simulink 模型"不等于"工程上合格"——一套 101 题六维分级评测
仓库与数据已公开: 提交注释显式给出)。⚠️ 提示:本解读基于 arXiv v1 摘要 + 论文卡 + 注释,PDF 全文未下载,所有具体数字以原文 abstract 为准。 1. 真问题是什么?——现有 Simulink 评测只看"能不能编译 / 能不能跑 / 像不像参考模型",不验证模型是否满足工程规格,导致"看起…
Persona Dosing:分级特性控制的校准激活引导
PersonaDose 把"激活引导系数"升级为"行为量表"——通过特性描述 + 请求强度共同控制的 FLAS 控制器,再以实测特性表达回标流时间,让 LLM 按"几分人设"精确出活,而不是粗暴地"开/关"特性。 激活引导(activation steering)通常给一个乘性系数 α,模型就"多一点这个特性"。但产品…
Transformer 过早停止思考,一个微型 LoRA 即可修复
预训练 Transformer 用极少层数就能完成"在长上下文里精确指代/跟随"任务的事实,意味着只要在一个早期层插一个 rank8 LoRA,就能把 Qwen38B 的 24 行精确指代从 15.5% 抬到 99%,且主模型权重全程冻结。 LLM 在长上下文里做"按编号/按行指代"的链式推理时,表现远不如短上下文。直…
DyadMem:Agent 如何与用户协作的长期记忆基准
DyadMem 提出"用户条件关系型 Agent 记忆"(URAM)概念,把长期 Agent 记忆拆成"用户事实 + 关系专属记忆"两条线,并在 3,065 episodes / 50,961 sessions / 61,210 QA 上证明——只测 GoldMemory QA 会严重高估当前 LLM 的长期记忆能力,…
追踪状态足迹:让 Agent 真正"会事务处理"
把多 Agent 协作视作一个数据管理问题,提出"状态足迹"(state footprint)作为 Agent 的第一类公民元数据,主张下一代 Agent 编排器必须像数据库事务系统一样,为并行 Agent 提供类似 ACID 的执行保证,但又能用 LLM 的语义能力去做冲突解决而非粗暴 abort。 当 Agent …
Twitter 早期 ChatGPT 用户情感研究:10,732 条推文的混合方法分析
对 10,732 条 ChatGPT 早期采用者推文做"主题建模 + 质性情感分析"的混合方法研究,结论是早期采用者整体高度正面,集中于"软件开发被颠覆 / 娱乐与创造力激发",而对教育领域的潜在滥用表达明显担忧。 2022 年 11 月 ChatGPT 上线后,公众认知与情绪在数日之内剧烈分化:媒体把它同时描述成"教…
Harness-of-Harness:让 LLM Coding Agent 持续多日自主开发软件
HarnessofHarness(HoH)是一种"在 Coding Agent Harness 之上再包一层 Harness"的元架构,它把单次任务执行拆成"规划—编码—测试"的迭代闭环,并强制小步可验证、修复与能力增长平衡、版本化项目历史等约束,使 LLM Coding Agent 能在 70+ 轮迭代的多日窗口内持…
协同进化 Harness 与模型:On-Policy 专家修正让弱模型追平模仿失效点
论文研究"Harness 进化 + 弱模型轻量微调"如何协同,发现先用弱模型进化 Harness,再用强专家在已进化 Harness 上跑全轨迹让弱模型模仿,会破坏 modelharness fit(性能在 7 个企业 Agent 任务上回归 430 分);改用 onpolicy 专家修正流水线(只重写弱模型自身 ro…
Towards a Science of AI Agent Reliability:成功率之外,Agent 可靠性的四个维度与十二个指标
现有 Agent 评测只问"成功率",却忽视了"一致性、鲁棒性、可预测性、安全性"这四个决定 Agent 能否真正部署的关键维度——Princeton 团队用 12 个指标对 15 个主流 Agent 模型实测发现:近两年能力大幅提升,可靠性仅小幅改善。 AI Agent 在标准评测基准上准确率越来越高,但一到真实部署…
Memory for Autonomous LLM Agents:把 Agent 记忆形式化为「写—管—读」循环的三维分类体系
记忆是 LLM Agent 从"有状态的文本生成器"进化为"真正自适应智能体"的核心能力——这篇综述将 Agent 记忆形式化为「写—管—读」循环,用三维分类体系(时间范围 × 表示基底 × 控制策略)系统梳理了 2022—2026 年该领域的机制、评测与开放问题。 单个 LLM context window 远不够用…
Vanilla LoRA May Suffice:调好学习率,9 种 LoRA 变体都在 1-2% 以内
PiSSA、DoRA、AdaLoRA 等 LoRA 变体相对于 Vanilla LoRA 的"惊人提升"(有的报告 +10% 到 +37%),很可能只是因为对比时用了固定或过窄的超参数范围——当学习率被认真调优后,所有 9 种 LoRA 方法的峰值性能差距仅剩 1~2%,Vanilla LoRA 完全有竞争力。 LoR…
GAGAR:面向代码 Agent 强化学习的分组智能评分与优势再分配
GAGAR 在代码 Agent RL 训练中引入一个 SFT 训练的「智能评分员」,对通过测试的轨迹按实现质量重排序后做优势再分配,让 GRPO 不再把所有"过了测试"的轨迹一视同仁。 当前代码 Agent 的强化学习几乎都遵循一个套路:用可执行测试当奖励源(binary reward),再用 GRPO 做组内相对策略…
Omni-Decision:把对话历史换成"证据台账"的全模态规划框架
OmniDecision 用"证据台账(evidence ledger)"取代不断膨胀的对话历史,让全模态智能体在多步任务中只读取结构化的证据状态,从而在 OmniGAIA 上以约 43% 的 Gemini3.1Pro 单题成本达到 81.4% 的 SOTA 准确率,并在 WorldSense 长视频理解上追平最强端到…
生成矩匹配网络(GMMN):用 MMD 取代对抗训练的早期尝试
GMMN 用 Maximum Mean Discrepancy(MMD) 这一核统计量直接作为训练损失,把"生成器单次前向采样"的 GAN 范式搬到了一个凸的、单目标的优化框架里,并在 MNIST 与 Toronto Face 上得到超过同期 GAN baseline 的样本质量。 2014 年底 GAN(Goodfe…
多元独立多项式的下界与 Gemini Deep Think 数学研究 Agent 实战
一句话结论:把经典"Sah–Sawhney–Stoner–Zhao 独立集下界"从单变量 λ 推广到每个顶点独立逸度 λᵢ 的多元情形;并且把两色半proper着色配分函数的下界也一并钉死,最关键的工程贡献是:所有关键不等式的证明步骤,是由一个自建于 Gemini Deep Think 之上的"数学研究 Agent"生…
OpenComputer:面向 Computer-Use Agents 的可验证软件世界
OpenComputer 提出以验证器(verifier)为组织原则,从零自动合成可验证的真实桌面软件世界,配套任务生成与评估框架,在 33 个桌面应用、1000 个任务上证明:当前前沿 Agent 仍难以可靠完成端到端桌面操作,且硬编码验证器比 LLMasjudge 更贴近人类裁定。 Computeruse agen…
无尽之试:迈向超智能的数学构造基准
一句话结论:把数学「构造题」做成可自动校验、可参数化扩展、可对比已发表前沿的连续得分基准,让模型在被超越之前先被精确测量。 现有数学 benchmark 普遍只能给二元对错(做对/做错),在两类场景失效: 1. 前沿饱和陷阱:当一道题被最强模型刷到 100%,benchmark 失去区分度,再进步也看不到。 2. 构造…
Architect-Ant:可编辑的建筑平面图自动家具布置
一句话结论:ArchitectAnt 用一个可编辑的坐标系 DSL 表示家具布局,先在 AntPlan 数据集(92 类物体 / 10 类住宅房间 / 505 张真实平面图) 上做监督微学习专业布置模式,再用 GRPO + Layout Rule Score (LRS) 做结果级强化优化,在不依赖高成本迭代式 Agen…
Relic:从多 Agent 协作到持久化的组织能力
Relic 把多 Agent 团队中反复出现的协作失败转化为「组织拥有、可执行、可修订」的协议,让教训不再随成员离开而失效。 多 Agent 系统(尤其是编码 Agent 团队)长期被一个现象折磨:人换了,规范没了。论文给出的典型场景是:一个编码 Agent 修改了仓库里的接口,另一个 Agent 没看到,仍在旧版本上…
改进的分布式扩散模型(Improved Distributional Diffusion Models, iDDM)
iDDM 用延迟粒子扩展(deferring particle expansion to late transformer layers)+ 时变 scoring rule schedule两招,让分布式扩散模型(DDM)首次在 DiTXL/2 上以单阶段、无教师、无自蒸馏、无 JVPs 的方式完成 ImageNet2…
ATLAS:把"潜在结构对齐"显式搬到世界模型规划 latent 上
ATLAS(Aligned Transport of Latent Structure)通过同时约束"关系几何(成对结构)保持"与"全局 marginal 标定",让世界模型(World Model)在 latent 空间中真正保留与动作选择相关的"novelty 结构",在 PushT、TwoRoom、OGBench…
HIDE & SEEK:部分可观测机器人操作中的"技能级记忆"基准与框架
HIDE 提出一个用于评估"部分可观测机器人操作"中记忆能力的 15 任务基准,并发现现有策略在该基准上存在显著不足;配套的 SEEK 框架通过三种互补的记忆机制组合,在仿真与真实实验中均提升了任务成功率,验证了"内部表征隐藏任务状态、按任务信息需求匹配信源"对操作策略的必要性。 机器人操作策略在演示中常常看起来"很溜…
PhysVista:通过感知-推理-评估闭环评测 VLM 的物理智能
PhysVista 是一个评测 VLM 物理智能的闭环基准——同时考察物理状态感知 / 物理动力学推理 / 物理可信度评估三阶段,并区分事件级 vs 尺度级两类推理粒度,使用真实视频 + AI 生成视频两个域——发现主流 VLM 在物理推理与可信度评估上仍存在显著短板,视觉识别 ≠ 真实物理理解(⚠️ 原文未明确具体模…
JevSpawn:通过组合动作空间实现自适应 Agent 推理
JevSpawn 提出一种组合策略,把自然语言任务规范动态映射到有限动作域上的概率分布,使 Jevstyle 有限域推理摆脱"必须预先枚举动作集合"的束缚,在 8 个基准任务上较 7 个 Agent baseline 取得更好的任务性能与导航速度(⚠️ 原文未明确具体百分比数字)。 LLM Agent 的一个核心成本结…