解读
1527 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Agent Lightning v1.0:把 Agent Harness 拉进 RL,把训练和部署解耦
Agent Lightning v1.0 提出并实现「harnessed agentic RL」——把任意已经部署的 Agent Harness 当成「环境」,让 RL 训练器只观察 LLM 请求响应对,由此把训练和部署彻底解耦;并以约 3,500 行代码实现完整框架,在 6K 样本上把 Qwen3.59B 在 SWE…
Embodied-Navigator(TAMP-Nav):把 VLM 拉回 2D 视觉舒适区,用稀疏推理 + 两层对齐做高效具身导航
TAMPNav(EmbodiedNavigator)把具身导航拆成四个动作——Point(2D 像素 → 3D 坐标)、Think(按需触发 ChainofThought)、Memorize(关键节点保留 + 其余压缩为时空指示)、Align(GRPO 上叠加过程奖励做两层对齐),让 VLM 在自己的 2D 视觉先验里…
大语言模型是否在玩「六度分隔」?长上下文流形的拓扑压缩测量
这篇论文把 transformer 隐状态的相似度矩阵稀疏化成无向图,发现深层推理层在 long context 上天然构成 SmallWorld 网络——任意两个语义锚点之间最多 6 跳可达,并把这个拓扑度量当作 RAG 幻觉的零样本检测器:事实正确的生成与源上下文保持 ≈3 跳的结构连通,幻觉则表现为严重的拓扑塌缩…
HH-RLHF:ChatGPT 是怎么"被教成不乱说话"的?——Anthropic 那篇奠基论文
你有没有想过 🤔: ChatGPT 刚出来的时候,比今天的版本"嘴更没把门的"——你问什么它答什么,包括教你做坏事。 但短短几个月后,它就学会了"拒绝回答"——而且不是硬邦邦的规则过滤,是真的学会了判断"该不该说"。 这件事听起来像魔法,但它是 2022 年 Anthropic 那篇 HHRLHF(Training a…
Switch Transformer:Google 用 1.6 万亿参数的"专家团"把大模型训练提速 7 倍
你有没有想过 🤔: 现在的语言模型动不动就上千亿参数。 但每次你问它问题,它真的"动了所有参数"吗?——不是。其实每次只动了其中一小撮。 这件事听起来反直觉,但它是 2021 年 Google 那篇 Switch Transformer(arXiv 2101.03961)证明的——1.6 万亿参数的模型,跑起来却比同等…
主题综述 · risk(2026-08-19)
范围:近 3 周(20260729 → 20260819)LLM / Agent 治理层与法律 / 监管 / 经济维度。 与 813 / 817 两篇 risk 综述的差异化:前者走"模型 / 协议 / 系统 / 评测 / 治理"五层栈,后者走"协议 + 工程实现双联 + 评测 + 多模态 + 治理"。本次走"治理层内…
Registers 对像素空间 Diffusion Transformer 至关重要
在像素空间(pixelspace)训练的 Diffusion Transformer(DiT)虽然不像 ViT 那样出现 patchtoken 高范数异常值,但额外引入 register tokens 仍能显著改善生成质量,并且在像素空间 DiT 中的收益明显大于潜空间 DiT,由此本文还提出一种新推理技巧——Regi…
从受控环境到真实世界:面向实际场景的渗透测试 Agent 评估
针对 AI 渗透测试 Agent 现有基准过度依赖 CTF/RCE 等"任务完成"指标、难以反映真实目标的复杂性这一问题,本文提出 ethiBench 评估协议——把评估重心从"是否完成子任务"转到"是否真正发现并验证漏洞",并配套结构化真值 + LLM 语义匹配、连续真值维护、累积评估、效率指标与精简子集等机制,目标…
When Bots Join the Team:Bot 采纳与开源软件项目的制度性结构
通过对 2,991 个 GitHub 项目在引入第一个 bot 前后两年的事件级数据进行因果识别风格的差分分析,本文发现 bot 采纳与"重复协作增加、特定 bot 在讨论中被点名增多、冲突级联减少、产出更具区分度"四种社区级变化在时间上精准共变,并据此论证:可预测、规则驱动的 bot 完全可以成为开源社区"制度性基础…
代理探索与可复用引导:一种通过代理引导更新信号实现的模块化 LLM 后训练范式
PUST 通过引入轻量级代理模型将「探索高奖励行为」与「策略对齐」解耦,让更新信号可以异步生成、缓存并跨模型复用,把 LLM 后训练从昂贵的在线优化变成模块化的离线工程。 Posttraining(后训练)是 LLM 落地绕不开的环节——无论是数学推理、代码生成还是领域适配,都需要对基础模型做微调。但现有方法存在根本性…
AdvancedMathBench:面向高等数学证明生成与验证的基准套件
本文提出 AdvancedMathBench,一个聚焦"高等数学"(本科高年级到博士资格考难度)的双轨基准:一轨 ProverBench 测"证得出",另一轨 VerifierBench 测"判得对",并配套一个与人类专家高一致性的自动验证 pipeline。实验显示前沿模型 GPT5.5xhigh 在证明生成上 UG…
MAGIC:基于 LLM 的转换感知可导航多场景游戏世界生成
MAGIC 是一个四阶段 prompttoproject pipeline,能把"一句话"自然语言需求变成一个可运行的多场景 3D 游戏工程;在 100 例新建 benchmark 上端到端 transition 识别 F1 达 0.96,且全部产出可执行项目,显著优于 LLM baseline 与 Holodeck。…
Vinci2:从连续第一人称视频中提供主动式协助
Vinci2 把端侧第一人称助手从"被动响应"推进到"主动介入":把"什么时候该主动说话"建模为依赖上下文的决策问题,并同时发布了一个新的基准 EgoServe(3000 个服务实例、4 个时间记忆视野、10 个服务类别)和一个免训练、记忆增强的 agent EgoMemo(多尺度时间摘要 + 语义知识图谱 + 视觉嵌…
SynthDocBench:面向长上下文视觉文档理解的受控基准
SynthDocBench 是一个全合成的长上下文视觉文档理解基准,通过组合式设计(combinatorial design)独立控制文档长度、布局结构、模态构成与问题类型,并在 7 个前沿 VLM 上揭示出现有 benchmark 看不见的三类失败模式:长度剧退化、中段位置敏感、图表理解崩溃。 Vision Lang…
Multi-Agent LLMs 未能互相探索
现代 LLM Agent 在互相交互时表现出短视(myopic)和极化(polarized)的行为模式,无法有效探索彼此的能力边界;MACE(MultiAgent Contextual Exploration)通过结构化的对等体选择机制显式促进探索,显著提升多 Agent 协作任务中的探索行为和下游表现,并从理论上证明…
无标签策略下,准确率与顺序敏感性并不一致
在多选题评测中,遮挡选项标签并不能可靠地提升 LLM 准确率——位置偏置与知识是两个独立维度,去偏并不能换来准确率提升,但循环置换打分却常常能。 大模型评测长期依赖多选题基准(MMLU、CEval、ARC 等),但 MCQ 评分混淆了两件不同的事:模型"知不知道"和模型"对选项顺序敏不敏感"。当一个模型把答案从 B 改…
StateM:用 Harness Scaling 在不改模型权重的前提下,把 GPT-5.6 推到 Terminal-Bench 2.1 的 95.3%
StateM 是一个围绕"持久化 state + phaselocal 上下文 + 受检 transition + 可恢复 runbook + 版本化流程实践"组织的 agentnative runtime,仅靠"围绕 agent 的执行系统"的工程改造(harness scaling),就在 TerminalBenc…
IVT:把"视觉思考"内化进权重,主动视频推理无需在推理时再画图
IVT(Internalized Visual Thinking)是一种后训练框架,在无标签视频上同时优化文本预测与下一 embedding 预测,让模型在训练阶段就把"对未来帧的运动、对象迁移、交互、潜在意图"的预测能力内化进权重——推理时直接输出文本答案,无需生成或重编码中间图像,端到端延迟降低超过 5×。 多模态…
MOSS-VL:让 AI 真正"边说边看"的开源多模态模型——11.3B 参数拿下 3 个第一
你有没有试过 🤔: 让 AI 助手看视频流——它一边讲、一边接住新进来的画面。 但你又不想让它"卡顿"——视频越拉越长,它讲话的"首字延迟"(TTFT)不能跟着炸开。 这件事听起来理所当然,但今天大多数 VLM(视觉语言模型)做不到。 传统 VLM 把视觉 token 拼进 LLM 输入序列——结果是一旦开始生成,新来…
LLM 脑子里到底有没有一扇"门"?——一篇新论文说:没有,但有一道"中段搬运工"
你有没有想过 🤔: 你让 AI 读一段长上下文,然后问"这段话里那个数字是多少"——它答得上来。 但它到底是怎么把这串数字从上下文里搬到"能回答"的当前位置的? 这是认知科学里"全局工作空间理论"(Global Workspace Theory, GWT)一直想回答的问题:人脑里是不是有一个"门",只让被选中的信息进入…
MOSS-VL 技术报告 · 11.3B 开源实时多模态双优 · 视频脚本镜像
标题:MOSSVL 实时多模态开源双优(11 字 · 5/5 关键词命中 MOSSVL + 实时 + 多模态 + 开源 + 双优 · ≤ 22 字 PR hard_gate PASS) 目标观众:多模态 LLM 应用开发者 · 实时多模态 / 流式 VLM 产品工程师 · 推理服务部署工程师 · AI 工程产品经理 一…
xHC:把残差流扩到 N=16 的可扩展超连接
xHC(Expanded HyperConnections)首次把 Transformer 的残差流真正扩到 N=16:通过「时间特征增强 + 稀疏残差更新 + xHCFlash 内存加速」三件套,在 18B/28B MoE 上比 mHC 平均下游涨 4.0 分、训练 FLOPs 反而低于 vanilla 与 mHC,…
VIABench:面向视障辅助任务的盲人第一人称视频综合基准
VIABench 是一个由视障人士(VIIs)自行录制或分享的第一人称视频构成的综合视频基准,专门用于评估多模态大语言模型(MLLMs)在「视障辅助(Visually Impaired Assistance, VIA)」场景下的实际能力。它定义了三个互补的核心任务——Proactive Reminder(主动提醒)、V…
AI Prototyper:基于分解的 LLM GUI 原型设计 Figma 插件
本文提出 AI Prototyper——一个开源 Figma 插件,把「自然语言描述」经分解(decomposition)+ RAG(retrievalaugmented generation)流水线自动转成可编辑的 Figma 图层;并在渲染前加入人在回路编辑步骤,让用户审阅、修改或扩展生成的功能列表。相较已有分解式…
Agent 在 AutoResearch 上如何失败:100 个真实前沿研究任务的端到端诊断评估
机制 3 段:任务结构(生命周期×领域) + 失败分类法 ARFT(45 类) + 根因诊断(元认知闭环缺失) 工程 2 段:800 条轨迹采集与标注流水线 + humancalibrated agentasajudge 自动归因 ⚠️ 数字核验 3 处:100 任务 / 8 框架模型组合 / 800 轨迹;45 类失…
MOSS-VL 技术报告:把"边说边看"做成一流能力的开源多模态模型
机制 3 段:门控交叉注意力的解码器 / 交互语料监督何时说话何时沉默何时修正 / 离线强基座 + 轻量末端实时阶段 工程 2 段:合成实时交互语料构建 / 五个 checkpoint + 课程 + 推理代码全部开源 ⚠️ 数字核验 3 处:11.3B 参数 / TTFT 优势 2.8×→5.1× / OmniMMI …
DeepSentiBank:基于深度卷积神经网络的视觉情感概念分类
DeepSentiBank(即 SentiBank 2.0)把情感视觉概念建模从"二分类 SVM 检索"推进到"深度 CNN 多标签分类",在 2089 个 ANP(形容词名词对)概念上显著提升标注精度与检索性能,成为视觉情感分析领域第一个被广泛引用的深度学习基线。 视觉情感(visual sentiment)研究的核…
TRACE-Bench:把多参考图像生成拆成"原子算子"再打分
多参考图像生成的现有 benchmark 都按"主体组合、属性绑定、风格迁移"这种表面任务分类,但其实所有任务都能拆成 Anchor / Disentangle / Apply / Compose 四个原子算子的组合;TRACEBench 用这套算子重写评测,跑 9 个 SOTA 模型后告诉业界:真正卡脖子的不是整体构…
GRNEdit:基于"二元证据"的高效通用视频编辑
把视频编辑重新刻画为"对每一比特的"保留 / 翻转"决策",用生成式 Refinement Network(GRN)作为 backbone,仅需 0.6M 训练对、不到 3% 条件参数,2B 模型就能在 OpenVEBench 上跑到 4.03,超过多个 14B 开源编辑器,8B 模型拿到 4.18,与最强开源编辑器打…
面向真实场景 Motion Language Model 的即插即用 2D Motion 接口
把"3D 预训练 → 单目视频不可用"这条死结,用一个即插即用的 2D Motion Interface 拆开:不动 MoLM 权重,就能让 3D 训练过的 Motion Language Model 直接吃 2D 关键点。 Motion Language Model(MoLM)这一波路线想用 LLM 的 token …