解读
1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
OptGraph:用 GraphRAG 把自动进化优化做对
OptGraph 是首个把 GraphRAG(图检索增强生成) 引入 LLM 驱动的自动化进化优化(automated evolutionary optimization)的工作流,通过类型化图(typed graph) 沉淀"建模模式—问题形式化—实现细节—错误修正"四类经验,使检索到的上下文由平面文档变为带关系的结…
跳出「借来的历史」:面向交互式角色扮演评估的人物对齐用户模拟
角色扮演智能体(RolePlaying Agents, RPAs)的主流评测都是「喂固定对话历史,看后续回复是否贴脸」,但这种设计既剥离了「真实多轮」里用户历史对 RPA 输出的塑形作用,又用与用户偏好脱钩的统一 rubric 打分。本文提出 PALATE:用 5 个 peruser 模拟器与 300 个角色档案,让候…
StealthBench:测量自主攻击性安全 Agent 的操作隐身能力
StealthBench 把「OPSEC」从人话术语搬进评测台:用 11 个真实漏洞赏金/红队轨迹扩展成 14 个 Docker 化任务,沿六维操作安全维度评估自主攻击 Agent,得出当前最强模型安全成功率不超过 54%——能挖漏洞不等于「挖得不露痕迹」。 最近一年自主攻击 Agent(如开源的 PentestAge…
SkillRise:跨任务技能进化的智能体强化学习
SkillRise 把「任务求解」与「技能文档维护」合并到同一条策略里,用跨任务序列 + 解耦信用分配,让 LLM 智能体在跑一连串相关任务的 rollout 中,自洽地抽取、精炼并复用可迁移技能;在 ALFWorld / WebShop / ScienceWorld 上相对最强 baseline 提升 2.3–8.5…
CAST:把游戏求解器变成 LLM 智能体的回合级教师
CAST 用「classical game solver 在 LLM 行动前后的 costtogo 变化」作为 turnlevel 教师信号,无需求教师 logits,就能获得理论上等价于 onpolicy distillation 的密集监督;在 Sokoban / Minesweeper / Rush Hour 三…
拥抱不完美数据集:医学图像分割中深度学习解决方案综述
这是一篇专门给"数据不够干净"的医学图像分割场景做总账的综述——它把"标注稀缺"和"标注噪声/弱标注"两大现实痛点拆成可操作的解决方案库,并给出推荐组合,至今仍是医学影像从业者的入门地图。 医学影像领域的悖论:SOTA 分割网络(UNet、DeepLab、nnUNet)几乎都假设有"大量、干净、像素级对齐"的标注。但临…
TensorFlow:异构分布式系统上的大规模机器学习
TensorFlow 以数据流图(dataflow graph)为抽象,提出一套可在从手机到数百台机器集群的异构硬件上统一执行 ML 算法的接口与实现,奠定了现代深度学习框架的工程范式基础。 2015 年前后,Google 内部已有 DistBelief 系统用于训练大规模深度神经网络,但它与具体应用紧耦合、代码难以复…
神经文本退化:Nucleus Sampling 如何破解 LLM 输出的"平淡症"
语言模型训练时用 likelihood 目标效果拔群,但用 likelihood 作为解码目标时却产生了平淡、重复的退化文本。论文揭示了人类文本与机器文本在 token 概率分布上的根本差异,并提出 Nucleus Sampling(核采样):动态截取概率分布顶部(nucleus),在保证流畅性的同时大幅提升生成多样性…
Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion
通过在 1,207 条专家标注的 CVEATT&CK 黄金映射上训练多标签分类器,将 CVE 到 ATT&CK 的映射召回率提升约一倍;同时量化证明:LLM 辅助标注在所有扩展规模下均无法可靠提升模型表现,根本原因是评估协议中的噪声,而非 LLM 标注本身的数量不足。 网络安全运营中,将公开漏洞(CVE)与 MITRE…
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
HiFiUMI 通过系统性提升无机器人 UMI(Universal Manipulation Interface)数据采集装置的保真度(头戴式离线立体惯性 SLAM、原生相对位姿、微秒级 GPIO 触发、双广角相机),使纯 UMI 数据即可训练出无需 realrobot「锚定」的 deployable 机械臂操控策略。…
Visual prompt engineering for video models
VIPE(Visual Prompt Engineering)证明:对视频模型的输入图像进行自动视觉修改(如将抽象草图转为照片级真实场景),可以系统性提升视觉推理能力,且效果可以超越经典的文本 prompt 工程和测试时 scaling。 在 LLM 时代,prompt engineering 已是提升语言模型性能的标…
TritonForge:自动化 Triton Kernel 优化的 Profiling 引导框架
TritonForge 通过将运行时 profiling 反馈融入迭代式代码变换流程,实现了对 Triton GPU Kernel 的自动化优化,在多种 Kernel 类型上最高可达基线 5 倍性能提升,成功率达 1.76 倍。 现代 ML workloads 对 GPU kernel 性能的要求越来越高,而 Trit…
SSGM Framework:LLM Agent 记忆治理的风险、机制与稳定性安全治理记忆框架
SSGM(Stability and Safety Governed Memory)通过将记忆演化与执行解耦,在记忆巩固前强制进行一致性验证、时间衰减建模和动态访问控制,同时缓解拓扑引发的知识泄漏和迭代摘要导致的语义漂移,为 LLM Agent 构建安全可靠的长程记忆系统提供治理范式。 LLM Agent 的长期记忆已…
Agents' Last Exam(ALE):弥合基准测试表现与 GDP 影响差距的 Agent 评测基准
Agents' Last Exam(ALE)是一个由 250+ 产业专家共建的评测基准,涵盖 13 个行业集群、55 个子领域、1000+ 任务,专注于评估 AI Agent 在长时序、具有经济价值且结果可验证的真实任务上的表现——当前主流 harness 和 backbone 配置的全流程通过率不足 1%,揭示了现有…
用 RAG 注入外部知识来修旧文档:ARI 框架解读
把检索增强生成(RAG)接到大语言模型(LLM)上做历史文档缺字补全,比纯掩码语言建模(Masked LM)更擅长恢复依赖外部历史知识的命名实体,作者把这套框架命名为 ARI。 历史文档(古书、地方志、族谱、行政档案)由于纸张糟朽、虫蛀、墨迹剥落,经常出现字符残缺。在数字化与"可用化"过程中,"缺字补全"几乎是第一步—…
不画框不标区域也能给视觉文档做证据归因:语言接口 vs 坐标接口
让视觉语言模型(VLM)用"文字直接引用证据"代替"输出 bounding box 坐标"来回答视觉文档问答(Visual Document Understanding),证据召回率从 ≤8 分提到 26–47,幻觉率近乎腰斩,回答质量几乎不变;同时这套"引用检索"流程还能作为 GRPO 训练脚手架,无需任何区域级监督…
多轮长程规划的"物理学":从预训练到后训练的 OPD / MOPD 全景
作者构建了一个可控的多轮长程环境,把"规划能力"拆成三阶段——预训练获得、后训练塑形、后训练集成——并提出单教师 onpolicy distillation(OPD) 与多教师 onpolicy distillation(MOPD),系统论证了规划能力如何被训练数据、训练方法、教师选择这三件事决定性地塑造。 多轮长程规…
重新审视 On-Policy Diffusion Distillation 中的 Classifier-Free Guidance
OnPolicy Distillation(OPD)在 ClassifierFree Guidance(CFG)下沿用「直接对齐 guided velocity」的范式存在 branchlevel underidentification:正向/负向分支的误差可以在 guided prediction 上互相抵消,导致负…
DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding
DeCoRAG 通过「认知解耦」(Cognitive Decoupling)范式,用 Semantic Anchor 锚定视觉语义并驱动 RAPCrop 区域剪裁,从根本上修正了多模态 Graph RAG 中 VisionLanguage Model 在高密度版面下同时处理全局视觉噪声与稀疏语义时引发的灾难性注意力沉降…
APS-RAG: A Corrective Agentic Hybrid RAG and an Operations-Grounded Evaluation for a Scientific Facility
APSRAG 是部署在美国阿贡国家实验室先进光子源(APS)上的企业级 RAG 平台,通过融合 Dense / Sparse / Knowledge Graph 三通道检索、Corrective Agentic 修正环和基于 MCP 协议的工具执行器,使运维人员能够用自然语言直接查询分散在电子日志、技术文档、Wiki、…
IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
将科研 ideation 从"生成+过滤"或"多样性单独优化"的旧范式中解放出来,用 QualityDiversity(QD)联合搜索框架重新建模——IDEAgent 通过多 Agent 世系管理、修复与细化机制,在 32 个 CS 课题上将最优基线的 Yield 指标提升 3.89 倍,并在 8 倍更多的课题上实现了…
LAMAR: An Open Language-Aware Multilingual Alignment Reranker
多语 RAG 场景下,现有 multilingual reranker 不考虑文档语言,导致在语义等价的跨语言文档中出现排序不稳定,直接影响最终答案质量。LAMAR 通过"英文锚定 relevance 蒸馏 + 语言一致性偏好对齐"两阶段训练,让 reranker 同时建模语义相关性和语言同质性,在语言一致性评估和通用…
Closing the Loop:不重训,修掉 AR 视频生成里的「回访一致性」烂摊子
这篇论文提出了一种「零后训练」(trainingfree) 的回访一致性补丁,专门解决自回归视频生成模型在长程生成中「相机回到老地方却画出新外观」的几何—视觉不匹配问题。它直接复用 3D 引擎已经提供的两条对应关系(temporal 与 spatial),把历史 latent 拽回 KV 缓存当 loopclosure…
Molt: An Agentic Reinforcement Learning Training Framework for Scale
NVIDIA NeMo Labs 开源的 Molt 是一个 PyTorchNative 的 Agentic RL 训练框架:代码紧凑精炼、可被 AI Coding Assistant 完整读取推理;通过完全异步的单一训练循环同时训练 multimodal 和 MoE 策略;在 matched fully async 协…
VisCo:把 LLM 自身当作内禀编码器用于视觉 Token 压缩
VisCo 提出了一种参数共享的自编码器式视觉 Token 压缩框架,直接复用预训练 VLM 自身的 Transformer 层作为压缩器与解码器,用少量 memory tokens 承载压缩后的视觉信息,并在编码—解码之间逐层传递多粒度特征;它在所有压缩比下都优于既有方案,且在高压缩、极限单 token 设置下仍稳定…
Multi-Head Latent Control:给 LLM Agent 决策做一条「不伤主干的旁路」
MultiHead Latent Control(MHLC)是一个极轻量的「外挂层」——只读取冻结 LLM/VLM 的隐状态轨迹,就能为 Agent 在部署时输出两类控制信号:「能不能解决 vs 是否该升级到更大模型」与「该澄清、调用工具、放弃,还是直答」。整套机制不需要改动 backbone,可以在 routed e…
移动边缘网络联邦学习综述:挑战、应用与未来方向
Federated Learning(FL)将模型训练推到数据所在边缘侧——设备本地训练,仅上传梯度而非原始数据,从而在保护隐私的同时实现协作式模型构建;本篇综述系统梳理了 FL 在移动边缘网络中的挑战、应用与前沿方向。 传统 Machine Learning 的数据流水线是:数据从边缘设备上传云端 → 云端集中训练 …
图嵌入综述:问题、技术与应用
Graph Embedding 将图结构数据压缩到低维向量空间,同时最大化保留图的拓扑结构信息和图属性,为节点分类、链接预测等下游任务提供高效输入。 真实世界充满图结构数据——社交网络、知识图谱、分子网络、交通路网。这些数据的分析需求巨大(节点分类、节点推荐、链接预测等),但大多数图分析方法面临高计算成本和高存储开销两…
在线学习综述:算法、反馈类型与未来方向
Online Learning 通过逐条处理数据序列,让模型在"边猜边学"的过程中不断调整,目标是让后悔值(Regret)随时间增长尽量缓慢——这篇 100 页、引用约 400 篇的综述系统梳理了这个领域的算法图谱与核心原理。 传统 Batch Learning 要求事先拥有完整数据集,然后一次性训练模型。但现实中有大…
大型语言模型幻觉综述:原则、分类、挑战与开放问题
LLM 幻觉不是 bug,而是开放域生成模型的固有特性:本文系统梳理了幻觉的定义、成因、检测与缓解方法,提出"事实性幻觉 + 忠实性幻觉"二分法,为构建可靠的 LLM 应用提供了完整的知识地图。 LLM 被广泛部署于搜索引擎、聊天机器人、推荐系统等日常信息获取场景,但其"一本正经地胡说八道"(幻觉)会直接导致错误信息传…