解读
1527 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Function-Aware Fill-in-the-Middle:面向 Coding Agent 基础模型的中期训练
本文提出 FunctionAware FillintheMiddle(FIM) 作为 Coding Agent 基础模型的中期训练(midtraining) 自监督目标:通过程序依赖图分析与"复杂度可推断性"双重标准筛选可遮蔽函数,让 Qwen2.5CoderInstruct(7B/14B)与 Qwen38B 在 SW…
SCAR:面向高效上下文扩展的语义连续性感知检索
SCAR(Semantic ContinuityAware Retrieval)是一种自适应相邻分块扩展策略:它把"是否把邻居分块并入上下文"这一问题,转化为一个相对查询相关性的决策——只有当邻居与查询的相关性接近当前最相关分块时才扩展,从而在边界碎片化场景下用更少的分块恢复更高的召回率,并且同一条规则无需重训就能在不…
Islamic LLMs:从知识获取到可信、抗幻觉 AI
这是一篇针对 Islamic LLM 与可信 Islamic AI 的综述论文,核心论点是:阿拉伯语流利度 ≠ Islamic AI 能力——构建可靠的伊斯兰领域 LLM 需要权威语料、检索与验证模块、引用感知生成、madhhabaware 推理、专家评估和面向忠实度/源有效性的基准,并据此提出抗幻觉 Islamic …
SwiftCache:面向多轮对话的高效 LLM Serving(异构 KV Cache 共享)
SwiftCache 是一个协同推理系统:在同一台服务器内,让 KV cache 需求不同的异构 LLM 通过 NVLink 共享彼此闲置的 GPU 显存与带宽,高需求模型把前缀 KV cache 卸载到低需求模型"捐赠"的显存中,避免慢速 PCIe 传输;同时只把"当前活跃层"的 KV cache 留在本地显存,进一…
MuseCPEval:音乐编辑系统的"上下文保留"多面评估框架
首次系统提出"音乐上下文保留(MuseCP)"概念与 MuseCPEval 评估框架,把"编辑过程中哪些音乐面应保持不变"拆为四大类并配以细粒度指标,再通过客观验证 + 人为研究 + 案例研究三路证明其有效性,从而把音乐编辑系统的评估从"改得好不好"推进到"该留的有没有留住"。 音乐编辑系统近年能力飙升:音色迁移、乐器…
MissDiag:KGQA 与 KG-RAG 中不完整知识鲁棒性的诊断式评估
MissDiag 是一个面向 KGQA / KGRAG 的"诊断式"鲁棒性评估框架:它把"删证据后系统表现下降多少"这一聚合指标拆解为"缺失证据的类型 × 被评估系统的响应 × 答案匹配协议的敏感度"三个轴上的归因分析,用结构化缺损算子(typed missingness interventions)对同一 bench…
VA-Judger:从人类偏好反馈学习联合音视频生成的奖励模型
VAJudger 是首个面向联合音视频生成(Joint VideoAudio Generation)的"思维链 + 维度分解"奖励模型:通过 VAPref10K(9K 提示 / 10.3K 细粒度对比)和 VAJudgerBench 两套数据,配合三阶段训练(清晰偏好对 → 近质量对的拒采解释蒸馏 → 维度分解 RL)…
Bounded Agents:多 Agent 系统的委派安全架构
把 Agent 的每一次工具调用放进一条"代理主链(Agentic Principal Chain, APC)"中做六项授权检查,并用组合闭包阻止跨调用的危险组合,让提示注入风险从"模型问题"被重写为"授权架构问题"。 LLM Agent 在一次会话中通常被授予一组静态权限,每个请求被独立放行。然而真实攻击并非单次请求…
2017 年那篇把 GAN 训练从"玄学"变成"数学"的论文,顺便发明了今天所有图像 AI 必用的评估指标
你看过 AI 生成的假脸吗?——那种"乍一看像、仔细看又哪里不对"的诡异图片。 2017 年之前,整个 GAN 圈都被两件事折磨: 直到 2017 年 NeurIPS 一篇论文同时切了这两刀—— arXiv 1706.08500(Heusel et al., NeurIPS 2017, S2 引用 3,831 次, G…
你以为的"加个向量数据库"≠真正的 RAG——2023 年这篇论文,把所有 RAG 团队第一次拉到了同一张白板前
如果你做过大模型应用,大概率踩过这种坑—— 公司里 5 个工程师都在做 RAG,但他们互相听不懂对方在说什么: 有人说"我用的是 Naive RAG,接 BM25" 有人说"我们做了 Advanced RAG,加了 reranker" 有人说"我搞了 Modular RAG,带 routing" 还有人在内部群里争"到…
2608-18613
日期:20260821 R2 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260821_R2_ctifoundryagentnativecorpusctishortvideoscript.md 脚本作者基于 arXiv:2608.18613 abstrac…
When More Cores Hurts: HPC环境中向量数据库扩展悖论
在 HPC 超算集群上对 Qdrant、Milvus、Weaviate 三种 SOTA 向量数据库的规模化评估揭示了一个反直觉的"扩展悖论":增加核心反而可能降低查询吞吐,从 16 worker 扩展到 256 worker 仅获得 5.46 倍的性能提升,远低于理想的 16 倍线性扩展。 向量数据库(Vector D…
Stratum: Agent 生成流水线的 Rust 高性能运行时
Stratum 是一个统一系统基础设施,将 Agent 生成流水线的执行与规划和推理解耦,通过编译批量流水线为优化执行图并由新型 Rustbased runtime 高效执行,在大规模 MLE Agent 场景下实现最高 16.6 倍加速。 LLM 驱动的机器学习工程(MLE)Agent 已经能够自动生成、验证和优化完…
FROAV: RAG 观察与 Agent 验证的统一框架
FROAV(Framework for RAG Observation and Agent Verification)是一个开源研究平台,通过将可视化工作流编排、多阶段 RAG 流水线、"LLMasaJudge"评估体系与可扩展 Python 集成结合,降低 LLM Agent 研究的门槛——让研究者专注于假设验证和算…
Tangram:为多轮 LLM Serving 解锁非均匀 KV Cache 压缩
Tangram 是一套面向多轮对话场景的 LLM serving 框架,将原本在运行时动态处理的「非均匀 KV Cache 预算」全部提前到调度期静态解析,在不损失精度的前提下端到端吞吐量较全 KV 基线最高提升 2.6×,首次让非均匀 KV Cache 压缩在生产 vLLM 栈中真正可用。 多轮 LLM servin…
MatryoshkaLoRA:用单一训练产出可任意切分的层级化 LoRA 适配器
MatryoshkaLoRA 通过在已有 LoRA adapter 之间插入一个固定的对角矩阵 P 来按比例缩放子秩,让单一训练产出即可在任意子秩下保持精度,无需为每个候选 rank 重训或网格搜索,从根本上终结 LoRA 工程中「设多大 rank」的代价。 LoRA(LowRank Adaptation)已是 LLM…
Securing the Agent:用分层隔离架构终结多租户 RAG / Agent 的「相关性冒充授权」漏洞
《Securing the Agent》一文提出面向多租户企业 RAG / Agentic 系统的分层隔离架构,把策略感知 ingestion、retrievaltime gating、服务端 agentic 编排三类执行点协同起来,首次形式化指出「检索按相关性排序而非授权」是 RAG 在企业场景的根性漏洞,并以开源 …
LabVLA:让 Vision-Language-Action 模型真正进入科学实验室
LabVLA 把 VLA(VisionLanguageAction)模型从"家庭 / 桌面演示数据集"挪到了"科学实验室"这个全新场景:先用仿真数据引擎 RoboGenesis 从原子技能组合出可执行的实验室工作流并筛掉无效 rollout,再用两阶段训练——先 FAST 动作 token 预训练让 Qwen3VL4B…
Attention Residuals:用 softmax attention 替换固定残差,让深层 LLM 的信息聚合更聪明
Attention Residuals(AttnRes)把 Transformer 里"每层都用权重 1 累加上一层输出"的固定 PreNorm 残差,改成"用 softmax attention 在前面所有层的输出上做加权聚合",从而让深层模型不再被"残差稀释"问题拖垮;它已经作为 dropin 替换集成进 Kimi…
DCD(Domain-Collection-Document):面向异构语料的层级化 RAG 控制架构
DCD 提出"领域—集合—文档"三层级知识组织 + 多阶段路由:在不修改底层 LLM 的前提下,把异构语料切成可路由的层级结构,先路由到 Domain、再路由到 Collection、最后才落到 Document,让 RAG 的检索和生成范围在每一步都被显式约束,同时配合 smart chunking、hybrid r…
CTIFoundry:面向网络威胁情报的 Agent 原生语料架构
CTIFoundry 把"网络威胁情报(CTI)语料"从「RAG 友好的不透明 chunk 集合」升级为agent 原生语料架构——构建期把 CVE / CWE / CAPEC / ATT&CK 四个权威库的官方交叉引用物化成可遍历的本体图,并对威胁报告做去别名、跨厂商实体对齐;查询期通过 7 个 typed tool…
AsySplat:用「几何-外观非对称」双分支把长序列 3D 高斯泼溅的冗余计算砍到 1/800
AsySplat 把可泛化的 3D Gaussian Splatting(3DGS)长序列新视角合成(NVS)流水线拆成「重几何 / 轻外观」非对称双分支:粗粒度 token 在重参数几何分支里重建几何,少数参数的外观分支在细粒度 token 上抓细节,两者通过双向连接互相引导。结果是在 32view 960P 输入上…
MythraGen:检索 + LoRA 加权融合的「文生艺术图像」两阶段 RAG 框架
MythraGen 是一个面向「文生艺术图像」的检索增强生成(RAG)框架:先用 BLIP2 + FAISS 在 WikiArt 上按 prompt 检索最相似的画作,再用检索结果训练两路 LoRA(流派+风格、艺术家+风格),最后把两路 LoRA 加权融合后注入 Stable Diffusion 进行生成。在 Wik…
越流行越难遗忘:面向 LLM 遗忘的自适应流行度方法 AdaPop
AdaPop 把 LLM 遗忘(unlearning)的梯度强度改成与"事实流行度"挂钩的自适应形式:流行事实(被预训练高频重复的实体)会被分配更大的遗忘指数,同时一个 dualascent 控制器每 epoch 自动调整"保留集"惩罚,使遗忘保留平衡不再依赖人工调参。 LLM 遗忘最近从合规需求(GDPR / CCP…
4K 修图从「不可能」到 61 秒——arXiv 2608.18063 用「桥式扩散」把超分幻觉堵在源头
你有没有被这种工作流折磨过 🎨: 客户丢给你一张 4K 产品图,让你"把背景换成极简白"。 你在 Photoshop 里搞了半小时,用 Stable Diffusion 在 1K 上重画了一张, 然后丢给超分工具放大到 4K—— 产品logo 变形了、桌面的木纹突然换了一种、边角出现诡异的振铃锯齿。 客户回:"看着像 …
你的机械臂「该动」却死活不动——可能不是策略没学会,而是潜空间在「撒谎」
你有没有见过这种诡异现场 🤖: 工程师把一个 9 自由度机械臂训了三周,仿真里抓取成功率 95%;搬到真机,机械臂纹丝不动——镜头里、潜码里、规划里"目标杯子的潜码"明明离"当前杯子"最近,policy 却选择一动不动。 传统 RL 工程会告诉你:要么 reward 没对齐、要么策略欠拟合、要么 sim2real ga…
Token Time Continuous Diffusion for Language Modeling
TTCD(Token Time Continuous Diffusion)将扩散模型从离散 token 空间迁移到连续 token 表征空间,通过"每 token 独立时间进度"机制,在高加速比生成时同时规避并行采样误差与条件生成质量下降两大难题。 主流扩散语言模型(MDLM / LMD)本质上在离散 token 空间…
用 RAG + 约束解码缓解 LLM 生成 Web API 调用中的错误
针对 LLM 生成 Web API 调用代码时常见的 URL / HTTP method / 参数错误,本文系统评估了两种互补的纠错机制:检索增强生成(RAG)——把 OpenAPI 规约中的端点摘要注入 prompt;约束解码(CD)——把 OpenAPI 自动翻译成 regex 约束并在生成时强制执行。结论是:CD…
GRASP:面向 Agentic RAG 的粒度感知搜索策略
GRASP 通过强化学习训练 Agent,使其在多跳推理过程中学会自适应协调语义搜索、关键词搜索、段落精读三种互补工具,同时学会在最恰当的粒度(sentencelevel vs paragraphlevel)上控制上下文摄入,从根本上解决 Agentic RAG 中"什么时候检索、检索什么粒度"的核心难题。 静态 RA…
MultiRef-Compass:迈向多参考音视频生成任务的综合评估
MultiRefCompass 是首个针对 MultiReferencetoAudioVideo (MR2AV) 任务的统一评测基准,包含 350 个精心构造的样本(覆盖多视角主体保持、多实体绑定、人物场景组合),用 4 个维度 14 个子指标 评估模型,并通过自动指标 + 复判增强的 MLLMasaJudge 双轨评…