解读
1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
合成数据能把泰语 OCR 带多远?从可控消融到 Wayu-Paxa-OCR-Zero
合成 OCR 数据能否迁移到真实泰语文档,取决于字形多样性、二维版面结构与真实手写字形这三件事是否同时被覆盖,而与"是否使用真实文档上下文背景"几乎无关;据此用 45,723 张合成页面在 0.9B 的 PaddleOCRVL1.6 上做监督适配,得到 WayuPaxaOCRZero,在 5 套评测集上均超过 7B 的…
用大模型"蒸馏"出 82M 边缘泰语 TTS:Wayu-Paxa-TTS-Edge 的第三条路
把大型语音克隆模型当成"可编程数据源",用 15 秒参考音频生成大量合成语音,再训练一个 82M 参数的固定音色学生 TTS,可以同时获得边缘部署的低推理成本与接近 Gemini 3.1 的音质——WayuPaxaTTSEdge 在 ChallengeSet Keyword Accuracy 上达到 Gemini 3.…
SNAP3D:把"看起来对"的零件逼成"装得上"的装配体
§0 元层五问 + v2 模板硬约束版 Q1 一句话:在单图 partaware 3D 生成流程里加入物理仿真反馈,自动修复零件间的穿透、恢复接触关系、并加上参数化连接器,使生成结果真的能稳定装配。 Q2 真问题:现有 partaware 3D 生成(PartGen / 3DPipeline / 分层 diffusio…
SAS:用门控稀疏注意力把"上下文排序"端到端对齐 LM 损失
§0 元层五问 + v2 模板硬约束版 Q1 一句话:把稀疏注意力的 TopK 选择器从「蒸馏 dense attention」改成「用语言模型损失端到端训练排序」,让每一份注意力预算都花在「对最终预测最有用」的 context unit 上。 Q2 真问题:现有 posttraining attention spar…
Benchmark Radar:让"AI 评测"本身可被检索的活数据库
§0 元层五问 + v2 模板硬约束版 Q1 一句话:把分散在 arXiv / GitHub / HuggingFace / leaderboard / model card 里的 AI benchmark 信息聚合为「可检索、可审计、可追溯」的活数据库 + 搜索引擎,供研究者做评测相关决策。 Q2 真问题:AI 评测…
Breaking the Vision-Action Shortcut: LIT 让机器人基座模型真正泛化
LIT(Latent Interface Training)通过两阶段训练策略——先让动作专家在无图像条件下学习空间目标导向动作,再通过姿态监督的隐式接口约束视觉信息流——在 4 种 VLA/WAM 架构上显著提升了分布外泛化能力,在真实机器人实验中取得 13–17 pp 的 OOD 提升。 Robot Foundat…
COBRA-Skills: 基于上下文老虎机引导的 Agent 技能进化优化
COBRASkills 将 Agent 技能优化建模为「带预算约束的序列优化」,用上下文老虎机(Contextual Bandit)引导评估资源向高价值候选技能倾斜,在 6 个异构 benchmark 和 3 个目标模型上均取得最高平均性能,同时将优化成本降低 55–58%。 LLM Agent 在执行任务时可以从可复…
PLC-DPO: 噪声偏好学习的后验标签纠正
PLCDPO 通过「clean / flip / tie」三路路由机制,让 DPO 在噪声偏好数据下仍能可靠训练,在 57 个实验单元中以 60.5% 平均胜率超越所有对比方法(次优为 55.5%)。 DPO(Direct Preference Optimization)将 LLM 对齐建模为配对分类问题,取代了传统 …
Adaptive Bridge:基于代理的解耦层以缓解 ROS 2 中 DDS 反压
在 ROS 2 + DDS 的 RELIABLE 主题上,单个网络受限订阅者会拖垮所有共享同一 publisher 的订阅者(包括安全关键节点);Adaptive Bridge 通过一个 proxy 把 RELIABLE / BEST_EFFORT 路径拆分并按健康度动态限流,把关键订阅者的 p95 延迟从最高 15 …
User as Code:面向个性化 Agent 的可执行记忆
把 Agent 对用户的建模从「bagoffacts」检索式记忆,改为「活的 Python 软件项目」——类型化对象承载状态、普通函数编码规则、appendonly 日志定期 checkpoint 进代码——在标准 longterm conversation 基准(LOCOMO)召回上追平 SOTA(78.8%),并在…
迷失在末尾:多模态检索增强问答中的首因偏差
在 KBVQA(基于知识库增强的视觉问答)的真实部署设置下,已知文本领域的「lostinthemiddle」U 形曲线翻转为「首因偏差(primacy)」:当 gold passage 出现在 prompt 第 0 槽时,三款开源 7B/8B VLM reader 的准确率比 gold 在末尾时高出 16–26 个百分…
超越求解器判定:面向自动形式化的生成式奖励模型
把 Z3 等数学求解器的等价性 oracle 蒸馏进 LLM 的原生词表空间,得到无需参考译文、连续可微、零样本跨翻译器泛化的「参考等价性分数」GenV,在 VPU 漏洞上做到 0.961 AUROC,并把 agentic testtime compute 的下游准确率提高 11.3 个点。 神经符号(neurosym…
在统一多模态模型中将图像 tokenizer 视为视觉语言的研究
围绕「图像 tokenizer 怎么选 / 怎么评」这一被孤立指标和单任务评测长期遮蔽的问题,本文搭建了一个纯自回归统一多模态测试台,按文本、图像、文生图(T2I)、图生文(I2T)四类任务追踪验证损失,得到四条关键发现:损失必须按任务分析(不同任务排序 tokenizer 的结果不一样)、重建质量好不等于下游任务好、…
ActReview:基于反驳引导训练数据与评分量规奖励的可操作同行评审生成
针对「LLM 投稿前自我审稿能不能给出可执行的修改建议」这一缺口,ActReview 把同行评审拆成「诊断性主张」与「修改建议」两个子任务,从 OpenReview 的真实 reviewrebuttal 线程中挖出 4 万条「弱点反驳修改」对齐数据,用多任务 SFT + GRPO(带 candidateaware、we…
IdeaAMBIG:研究构想规范中面向实现的关键缺口基准
IdeaAMBIG 把「论文方法描述能不能被忠实实现」变成可量化评测:构造 660 条基于证据的方法规范缺口实例,揭示当前主流 LLM 在没有缺陷标注的情况下只能定位 9.6% 的真实缺陷,瓶颈在「定位」而非「修复」。 研究论文的方法章节常常存在「新颖且自洽,但实施细节不足」的问题。一个称职的实现者或编码 Agent …
先思后链:多语言实体链接中的稀有性、推理与检索
用「知识图谱结构指标」重新定义稀有实体,让 SOTA 多模态实体链接在稀有切片上暴露出 15.4–39.9% 的准确率下降;再用「推理 + 检索」互补框架,在 MERLIN 多语基准上整体提升 6.9%、稀有切片上最高提升 23.3%(EMNLP 2026 接收)。 多模态实体链接(MEL)要把文本或图像中的实体提及关…
构建多语言桥梁:数据混合作为语言内推理泛化的支柱
要让 3.35B 小模型在 60 种语言的 6 类推理任务上以 ≥93% 概率用「提示语种」本身作答,无需在每种语言都做推理监督——只需三件事:覆盖更广的多语料、易得的多语非推理数据、一个够强的英语推理主干。 推理语言模型在数学、常识、指令跟随等任务上大幅进步,但绝大多数模型即便被提示用中文、阿拉伯语或越南语提问,仍会…
负自蒸馏(NSD):通过主动规避缺陷来训练推理的 LLM
Q1 这是一篇什么性质的论文? 方法(method)+ 实证(empirical)——为 LLM 复杂推理自改进提出新训练范式 NSD,并在多基准上对比 OPSD / 标签无关自举 RL 基线。 Q2 解决了哪个真实痛点? OPSD(策略内自蒸馏)在复杂推理任务上会让模型性能退化——强制学生模仿带特权信息的高置信度推理…
MaP-WAM:把记忆当规划——长视野机器人操作的双阶段世界-动作建模
Q1 这是一篇什么性质的论文? 方法(method)+ 系统(system)+ 实证(empirical)——为长视野机器人操作提出 MaPWAM 框架,含双阶段架构(记忆锚定规划 + 规划条件执行)+ 真实机器人实验。 Q2 解决了哪个真实痛点? 现实中的复杂操作任务(把散乱零件装配 / 多步烹饪 / 长链路折叠)本…
DRG-MAPPO:层次动态角色图多智能体强化学习用于协同空战
Q1 这是一篇什么性质的论文? 方法(method)+ 实证(empirical)——为协同空战 MARL 提出 DRGMAPPO 框架,集图关系建模 + 动态角色分配 + 目标优先级辅助任务。 Q2 解决了哪个真实痛点? 主流 MARL 在空战上仍难做到精细战术协同——根因两条:① 缺乏结构化关系建模,agent 抓…
UniH^3:把「同质性」和「异质性」拆开再统一,做全能医学图像复原
UniH^3 是一个一体化医学图像恢复(AllinOne MedIR)框架,核心思路是把「任务间异质性」和「任务内同质性」拆成两个独立模块分别处理——Hierarchical Homogeneity Memory (H2M) 蒸馏并检索同质先验、Hierarchical Heterogeneity Balancer (…
MetroLLM-Bench:把 LLM 当地铁售票机跑分,结果很反直觉
MetroLLMBench 是一个把语言模型当地铁售票机策略层来打分的 955 用例基准,覆盖 6 个真实地铁系统、11 类任务(含对抗输入),用 14 项确定性 + 8 项语义质量双层评分;评测 26 个模型后,最反直觉的结论是:一个 4B 的 Qwen 3.5 学生模型在 Tier 1 上反超 GPT5.6 两个档…
TempCloze:Video-LLM 真的在「看」时序吗?
TempCloze 是一个不依赖语言捷径的视觉时序推理基准:给一段视频的开头片段和结尾片段,模型必须从四个候选中间片段中选出真正接得上的那一段;通过对 10 个闭源 + 21 个开源 VideoLLM 的系统评测,论文发现当前 VideoLLM 的核心瓶颈是时序对齐(Alignment)而非语义理解。 VideoLLM…
但 AI Agent 能运营一座城镇的经济吗?
在 100 个配备记忆的 LLM Agent 构成的封闭货币经济体中,货币流通在 26 周内完全停滞:货币政策失效,财富分配近冻结——而这一切的根本驱动力不是记忆,而是底层 LLM 本身。 多 Agent 经济模拟(AgentSociety Studies)是研究 LLM 社会化行为的重要范式,但此前研究普遍存在两个局…
SpatialBlock:在合成「积木堆叠」里学空间智能,让 LVLM 重建 3D 结构
1. 谁写给谁看:面向多模态 / LVLM 研究员、空间智能评测 benchmark 建设者、机器人 / 具身智能团队,假设读者熟悉 3D 几何投影、viewpoint transformation。 2. 为什么值得读:把「LVLM 空间智能」从「需要密集人工几何标注的真实场景 QA」范式,升级为「用合成可控的 3D…
从意图到执行授权:面向高风险 AI 动作的执行边界合规画像 EBL-Core
本文提出 EBLCore——一个面向"AI 智能体候选动作被实际执行"这一瞬间的合规画像(conformance profile),用 Execution Release Contract(ERC)把意图对象、根/操作策略、证据义务、上下文、时间与可验证的决策推导串起来,并通过一次单独的 Redemption 时刻校验…
EvoSafeHarness:把 Agent 安全护栏当成「对模型 × 领域」做联合搜索
1. 谁写给谁看:面向做 LLM Agent 安全 / 红队 / 评测的研究员与平台架构师,假设读者熟悉 prompt injection、CaMeL、DecodingTrustAgent。 2. 为什么值得读:把「安全护栏(safety harness)」从「专家写死一次、套所有模型 + 领域」范式,升级为「对单个 …
高扇出智能体沙箱的内存压缩:AgentZip
AgentZip 是首个面向 AI 智能体沙箱设计的内存压缩系统,通过挖掘同一模板衍生出的多个并发沙箱之间的「模板相对冗余」与「跨沙箱冗余」,把 LLM 训练/推理工作负载下的沙箱内存峰值最高削减 8.7 倍(Linux 同行仅 2.1 倍),并把激进压缩带来的执行减速从 3.1 倍压到 1.40 倍。 智能体(Age…
X-AuT:渐进式 Audio-Encoder 压缩,让 Speech LLM 在不掉点的同时砍参数
1. 谁写给谁看:面向语音 LLM / 多模态端到端 ASR / SpeechLLM 部署工程师与研究员,假设读者熟悉 Whisper / QwenASR 类端到端语音架构、LoRA、distillation。 2. 为什么值得读:把「speech LLM 推理加速」从「直接砍 audio encoder 层」升级为「…
生成式晚期交互嵌入:视觉文档检索的存储高效之道
Lateinteraction 检索是视觉文档搜索的 SOTA 方案,但存储代价极高;本文发现其向量具有低内在维度流形几何特性,由此提出 GLIE——用少量可学习向量同时作为轻量索引和生成完整向量的生成基,在极度激进的存储压缩下仍保留近 80% 的原始 nDCG@5。 Lateinteraction 检索(如 ColB…