解读
1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling
FIRMVideo 通过"先核查后评分"原则,将 T2V 奖励模型从不可靠的整体评分,变为可验证的维度级清单核查,在精度与效率之间找到了更稳固的平衡点。 TexttoVideo(T2V)模型的评估长期依赖两种极端路线:一是基于固定评分规则的整体裁判(如 VBench),二是端到端开放推理(如 LLMasJudge)。前…
Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction
RealTurnTurk 填补了土语多模态对话数据集的空白,用遗传算法(GA)优化可解释的 ANDOR 决策规则,在视觉、声学和语言特征融合的基础上实现 turnending 预测。 Turntaking(话轮转换)是人类对话的基本组织机制:在恰当的时机交接话权是自然对话的核心。然而,现有 turntaking 预测研…
Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models
Stream4D 用前馈 4D 重建奖励替代静态 3D GaussianSplatting critic,解决了 AR 扩散视频模型"真运动被误罚为重建误差"的短路问题,让长时程视频生成在几何一致性和运动保真度上同时提升。 Streaming Autoregressive(AR)扩散模型是当前实时、长时程视频生成的主流…
RubSE:用评分量表作视觉修复上下文,实现 UI-to-Code 的自进化
UItoCode 的 VLM 自进化(selfevolution)常常一改就崩——修一处视觉缺陷的同时把别处已经修好的部分拖累回去,作者把这种局部编辑在 layout / 样式 / 组件依赖间传播的现象命名为 visual repair coupling。RubSE(Rubricguided SelfEvolution…
JoyAI-Echo-1.5:长程音视频生成的可组合跨镜头记忆与可校准 6-DoF 世界模型
JoyAIEcho1.5 是一个统一音视频生成系统,在同一双向 backbone 上派生两个变体:longvideo 变体通过 composable crossshot memory + 语音过滤后的 speaker cue 在多镜头叙事里保持人物外观与声纹;worldmodel 变体把异构导航输入转换成校准到度量尺度…
当 "Must" 变成 "Maybe":LLM Agent 工作流中的约束弱化与运行态状态保持
LLM Agent 在多角色、多阶段工作流里,把上游状态改写成中间语言制品(summary / plan / ticket / memory / handoff)时,看似保留了"未解决前置条件"的语义信息,但会把它从"执行前必须解决"偷换成"下一步参考信息"——即所谓"约束弱化"(constraint weakenin…
GigaBrain-0.7:以三系统架构将具身基础模型扩展至涌现能力
GigaBrain0.7 用「三系统架构 + 37,000+ 小时异构具身数据 + 单阶段对齐训练」把通用机器人 VLA 模型推到多本体大规模泛化,在自研 Maker H01 与主流机器人本体上的零样本能力、长程指令跟随与下游任务成功率均显著超越前代 GigaBrain0 系列与 π₀.₅。 通用具身 Agent 长期…
MoTE:面向多任务视频理解的 Task Expert 混合模型
把大语言模型的 FFN 改造为任务专属专家(task expert),同时保留多模态主干共享;每个样本走"样本级单条任务路由",使激活参数量与存储的任务专家数解耦;5 个专家的 VideoLLMMoTE 在五个 COIN 基准上以约 2B 激活 LLM 参数取得高于近期 VideoLLM 基线的平均 top1 精度,并…
AgentRoom:基于 CRDT 共享工作空间的并发多 Agent 编程
把实时协同编辑协议引入并发多 Agent 编程,在 CRDT 合并的共享文件系统上把文件级 claim/status/broadcast 暴露为 MCP 工具,使多 Agent 在不串行接力的前提下协作;在四个后端编码任务上,2 个 Agent 协作模式比 Solo 放弃的任务更少、运行间方差更小,且在匹配算力对比中优…
来自 Agent 轨迹的自动机:失败与下一步预测
把整条 Agent 轨迹语料折叠成一部紧凑有限状态机(FSM),用其作为结构基底同时支撑下一步预测与失败预测;在 12 个公开数据集上 FSM 仅 7–43 个状态、回放保真度 ≥0.997,并能对部分轨迹提前触发早停监控。 LLMbased Agent 在执行多步任务时会留下长且非结构化的轨迹,部署阶段要做的安全审计…
SecOPD:通过 On-Policy Distillation 缓解自适应 Prompt 注入
SecOPD 用「OnPolicy Distillation + token 级反馈」取代 DPO/GRPO 的「序列级均一反馈」,在 Qwen3.627B 上把对 PISmith 自适应 Prompt 注入的攻击成功率(ASR)从 MetaSecAlign 的 94.0% 打到 9.0%,并在训练中未出现的 Agen…
开放世界多 Agent 环境中的自主数学发现
论文构建了一个名为 Station 的开放世界多 Agent 沙盒,让不同模型家族的 AI Agent 在没有中央协调器、也没有预设流水线的情况下自选研究方向、相互协作并共享文献。在 AlphaEvolve 目录的 12 道构造题 + 2 个额外案例上,Station 在 5 个问题上拿到了相对已有文献的新结果,包括一…
CyberFactory:把公开漏洞样本"实例化"成可执行的智能体训练流水线
CyberFactory 是一个把"公开漏洞工件"(CVE、PoC、补丁)转化为"可执行 + 可验证"训练实例的开源框架,并通过统一的"漏洞分析技能"让教师模型沿"源码审查 → 领域先验求解 → 证据验证"路径产出 agentic 轨迹,从而训练出在 PoC 生成、漏洞修补、CyberQA 三个任务上都显著优于通用基座…
加密链思考的"互换性漏洞":用同厂弱模型解码强模型的推理轨迹
主流闭源 LLM 提供商(Anthropic / OpenAI / Google)把 chainofthought(CoT)推理轨迹以"加密文本块"形式返回客户端、并在后续请求中原样回传——本文发现这些加密块在同一提供商的不同会话、不同用户、不同模型之间完全兼容且可互换,攻击者可以借助同厂弱模型(防护较弱)强制解码并明…
DREAM:在工业推荐 pipeline 上叠加一层"代理式"策略控制层
DREAM 是一套面向工业级推荐系统的"代理式"元控制架构——它不替换既有的级联式召回粗排精排 pipeline,而是在其上叠加一层"感知编排审计"策略层,把会话级实时意图转译为可下发到现有排序模型的可控参数,并通过 Reward Dual Loop 持续自优化。 工业推荐普遍跑在「召回 → 粗排 → 精排 → 重排」…
AtlasNav:在直接语料交互里解决「证据失明」——持久多视图语料导航框架
AtlasNav 把大模型 Agent 与外部语料的交互从"动态工作空间"重构为"持久多视图语料导航",用一份一次构建、多次复用的 Corpus Atlas 把语料组织成可导航结构,在 BrowseCompPlus 上达到 92.05% 严格准确率、相对前代 SOTA 节省 30.21% 在线推理成本,并在 Phant…
PinSieve:生产级选择性 VLM 服务与企业内容质量分诊的「治理式记忆飞轮」
PinSieve 把企业内容审核流水线拆成一个"只在灰色地带启动的 VLM Serving Agent + 一个治理式记忆飞轮",在生产灰区切片上比前代多筛 2.05× 不可执行项,评审生产力提升 25.7%、归一化运营成本下降 16.2%、信号交付从次日制变成同日交付,同时用一个 proposalverifier 闭…
HarnessRisk:面向 Agent Harness 全生命周期安全的基准
HarnessRisk 是首个从 Agent Harness 全生命周期视角评估安全性的基准,发现在 6 个运行阶段中,Harness Configuration 是所有被测 harness 最脆弱的攻击面,且高风险识别率并不等同于安全——某些配置在超过 90% 的运行中检测到风险,但仍保留显著攻击成功率。 LLM A…
LEGO-RL:面向 Coding Agent 的 Harness 原生强化学习框架
LEGORL 提出了在不修改 Harness 内部控制流的前提下,将原生 coding agent harness 与可扩展策略梯度优化相连接的方案,通过 inprocess LLM proxying + 沙箱编排 + 可观测训练三大支柱,在 Qwen3.535BA3B 上将 SWEbench Verified 成绩从…
StateM:以持久化状态为中心的 Agent 原生 Runtime
StateM 提出了一个以 durable states、phaselocal 上下文、受检跃迁、可恢复 runbook 和版本化流程实践为核心的 agentnative runtime,使 Agent 与用户能共同检视执行过程、在不改模型权重的前提下通过 harness scaling 改善执行系统——在 Termi…
LAION-BVD:一千万小时的开源视频数据集,把多模态预训练推到 CommonCrawl 级别
LAIONBVD 是 LAION 团队发布的开源视频数据集,从 CommonCrawl 中捞出 1.3B 平台特定 URL,下载 80M 视频共约 1000 万小时音频视频双模态数据;用内容感知场景切分得到 clip 并合成视频 / 音频 caption,训练出的模型在 videotext、audiotext 标准 b…
Entropy-Valley:让 masked diffusion MT 自己挑目标长度
EntropyValley(EV)是一种训练免费的目标长度选择器,对 masked diffusion 机器翻译(masked diffusion MT)先用全 mask 前向对每个候选画布(canvas)跑一次估计,以"全 mask 下的平均预测熵"为分挑出 backbone 最容易填的目标长度;在 En↔Zh、En…
OraRL:把标注当 rollout,让视频 MLLM 的 RL 后训练既便宜又能 scale
OraRL 把视频多模态大模型(Video MLLM)后训练里"被用来打分的标注"重新当一组正样本 oracle rollout 直接塞进策略组,用一个解耦的优势估计器避免"高奖励 oracle 反向抬高 baseline"的问题,从而把 RL 后训练成本压到 SFT 的 2.2×、不到 GRPO+CoT 一半(4.9…
WeMM-Embedding:微信多模态统一嵌入技术报告
腾讯 / 微信开源了一套统一多模态嵌入模型家族 WeMMEmbedding(2B / 4B / 9B),支持文本、图像、视频、视觉文档以及任意交错多模态输入,并支持灵活输出维度;通过两阶段训练(多模态对齐 + 精修),在公开基准 MMEBv2 上2B 模型即超越此前的 8B 开源 SOTA,9B 模型取得整体 80.6…
Game2World Engine:把野生游戏视频变成世界模型训练数据
提出 Game2World Engine (G2WEngine)——一个把带 HUD 的真实游戏录像自动剥离 UI 并重建"干净游戏世界"视频的全栈框架,配套 GameUITaxonomy(21 类 UI 元素分类)与 GameCleaner(无掩码 UI 移除模型),把 96K 合成 + 1,079 段野生视频变成可…
智能眼镜作为第一人称智能平台:从看到行动的统一系统综述
这是一篇系统综述(survey / position paper),首次用"感知—状态—交互—行动"闭环统一框架把智能眼镜从外设升格为第一人称智能平台,并给出 L0–L5 能力分级、八维硬件能力轴、九场景部署矩阵与"声明—证据阶梯",让该领域第一次具备可比、可部署、可复现评估的基础。 智能眼镜在 2024–2026 这…
ClawProBench:基于 trace 感知、运行时覆盖与冻结式工作场景 holdout 的 AI Agent 评测
ClawProBench 把 Agent 评测从"只看最终答案"重构为"看 trace 全程",用 OpenClaw 这套 live agent runtime 实例化 102 个动态场景 + 68 个冻结 holdout,并对 68 / 37 个 modelplusruntime 配置做 safetygated 的 …
Quantization-Aware Healing:恢复压缩 4-bit LLM 的实用配方
论文给出 QuantizationAware Healing(QAH)作为 QAT(quantizationaware training)的替代:用"原始未压缩模型"直接蒸馏"4bit 学生",跳过 bfloat16 中间态;在 GPTOSS 120B → 60B → MXFP4 这条流水线上,QAH 学生 7/9 b…
Kingma 的半监督 VAE:当深度生成模型学会「用极少标注数据做分类」
Kingma 等人 2014 年(NIPS 2014)的这篇工作把 VAE 从「无监督密度估计」拓展为「半监督分类器」:用 M1(无监督生成器)学 latent 特征 z1 → M2(半监督分类器)只在少部分标签数据上做分类 → M2 同时也是判别式预测模型。在 MNIST 上只用 100 个标注样本就把错误率推到 ~…
VGGNet:用极小卷积(3×3)堆深度,把 ImageNet 错误率推到新低位
VGGNet 用「全是 3×3 卷积 + 不断加深」的极简配方,在 ImageNet 2014 把 top5 分类错误率从 AlexNet(2012)的 15.3%、ZFNet(2013)的 11.7% 推到 7.3%(VGG19),并以结构简单、迁移性强的特点成为 2014–2018 视觉特征提取的事实标准 back…