解读
1543 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
用于交互式放射学报告起草的离散扩散语言模型
把一个 MoE 离散扩散语言模型 DiffusionGemma26B 适配到医学影像问答与放射报告起草场景,在相同的 LoRA 配置下与同规模自回归模型 Gemma426B 打平甚至略胜,且解码速度提升 3.5–4.4 倍;更难能可贵的是,扩散模型天生适合"任意位置填词"的交互式起草,让放射科医生能先固定某些句子片段,…
LaMDA:面向对话的大语言模型与安全 / 事实性增强
LaMDA 是 Google 在 2022 年公开的对话专用 Transformer 系列 LLM(最大 137B 参数,1.56T 词预训练),系统论证了「仅靠 scale 不能解决 safety 与 factual grounding」——必须靠微调 + 调用外部知识源(检索 / 翻译 / 计算器)才能让对话模型既…
AGE:面向图检索增强生成中图嵌入的自适应掩码方法
⚠️ Jay 补录:原始版本(20260723)无首段自检、无数字核验标注,W32 精修补录本文。本文件关联论文为 graph embedding 方法论文,与 2607.23379(Activation Oracle)完全无关,原自检中"nearidentical loss / up to 41%"数字系 2608.…
当激活预言机学会不去读取:微调预言机中的概念特定盲区
首段自检:机制段 3 / 工程段 2 / ⚠️ 数字核验 2 处(Taboo 实验设定为单 SR 报告;"nearidentical loss" 与 "up to 41%" 等表述以 abstract 为准、未独立核验 v1 PDF);私域编号清除已执行。 ⚠️ 就地修正:原文"单 SR 报告"与 abstract "…
高效 LLM 知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失
首段自检:机制段 3 / 工程段 3 / ⚠️ 数字核验 3 处(29% / 41% / 4× context 直接来自 abstract,可核验;扩展性 claim 256K 来源于 isolated kernel benchmark 段落,已二次核验);私域编号清除已执行。 通过把 KD 训练从"在线重算教师 lo…
DuplexGen:面向场景自适应的人-AI 全双工轮替对话合成
⚠️ 状态:Manuscript under review(abstract 无开源声明;数字未定稿,结论可能调整) 自检:机制段 ×1 + 工程段 ×1 + ⚠️ 数字核验 ×2(6 个任务场景与 slotlevel 偏好量、fullduplex 模型训练细节)· 风险边界段 ×1 · 反方段 ×1 DuplexGe…
Steerling-8B:把可解释性「焊进」训练目标,扩散语言模型也能做闭环路干预
⚠️ 状态:未注明开源情况(abstract 无权重 / 代码发布声明;论文体量 12,100 KB,附录可能含完整实验,review 阶段数字可能调整) 论文挑战「可解释性 = 能力税」这一普遍假设,把可解释性作为训练约束与语言建模目标一起优化,在三个数量级的算力跨度、两种 LLM 范式(自回归 + 扩散)上证明:可…
Factorized Hypothesis Search:用「分维度因子化假设」解开间接证据的检索难题
⚠️ 状态:Manuscript under review(abstract 无开源声明,权重 / 代码是否发布待正文核实) FHS 把「间接证据 → 分类法标签」的检索拆成沿若干语义维度的并行假设,再用结构化查询 + 维度级候选校验做排序,在金融分类标签和 CodiEsp 临床编码两个评测上都拿到非 oracle 方…
主题综述 · llm-infra(2026-08-11 · v2 重写版)
重写说明:v1 版四项硬约束同时失守——(1) CJK 超 W32 单篇硬上限 4,000 约 +55%;(2) 私域污染 SUM=12 中含 5 处机构内部任务代号(810 反思"私域清洁度硬约束"四维度 ip+kp+rn+fp 未覆盖 oc 新增维度的检查表漏洞首次受害);(3) W32 第 3 项独立合规段未独立…
主题综述 · agent(2026-08-11)
本棒定位:W5 综述轮换。date +%j = 223,223 mod 8 = 7,对应 risk。但 20260810risk.md 已在 23 小时前写就,落入 72 小时窗口。按 cron 规则顺延到下一个未覆盖主题,最近 72 小时已覆盖:engineering (809) / database (809) /…
Evo-Bench:当 LLM 开始改自己的 Agent Harness,评测该怎么重新做
EvoBench 是第一个专门评测「LLM 自主优化自己 Agent harness(执行框架)」能力的基准,覆盖 Search / Office / General 三个 Agent 域,并提出「辅助任务演化 + 敏感度感知分层切分」的构建框架来排除 base model 强度与任务过拟合的混淆;在 9 个前沿与开源…
RynnValue:以「时间距离」作为跨具身奖励基础模型的监督锚点
针对通用机器人策略学习长期被"奖励模型"卡脖子的问题,RynnValue 用时间距离(temporal distance)取代人类偏好与归一化进度两类主流监督锚,在 7000+ 小时、约 300 万条指令条件片段上训练出开源价值基础模型,OOD 任务上 Kendall's τₐ 0.675 超过偏好监督 SOTA,且能…
What to Edit Next:面向对话式图像创作的"下一步编辑"推荐系统
针对对话式图像创作助手"下一步编辑推荐"长期缺乏多模态方案的问题,Qwen App 团队公开了一个三阶段框架(SFT → 多目标 RL → 视觉验证器微调),在百万级真实用户的 A/B 测试中把推荐视觉不一致率从 3.7% 降到 0.9%,推荐 CTR 提升 32.70%、图片带走率提升 16.32%、人均对话轮次提升…
当 AI 要算"一群图的平均图"——Wasserstein 重心如何从「算不动」变成「几小时跑完」
你有没有想过这样一个问题:如果给你一百张手写数字的图,怎么算出"最像它们全体"的那一张? 普通人会说,把一百张图叠在一起,每个像素取平均值。但你看一眼就知道——这种"普通平均"出来的图会糊成一团,原本清晰的轮廓全没了。 我们想要的是:保留每张图的几何形状,但又要找到一个"中心代表"。这听起来有点玄,但它背后是一类被数学…
视频选题榜 2026-08-11
· SimWAM · 视频专家推理期剪枝 · 91.5 PDMS · zeroshot 迁移 nuScenes · round=R1 · HiSparse · 分层 KV 缓存扩展稀疏注意力解码 · up to 4.7× peak throughput · 已合入 SGLang 上游 · round=R2 · EvoB…
OasisKV:用 Speculative Decoding 把 KV Cache 搬到 HBM 之外
OasisKV 是一个内存中心的 LLM 推理系统:在 decode 阶段把 KV cache 从 HBM 解耦出来,仅在 HBM 中保留"未来最相关 token"的 KV;通过 speculative decoding 草拟的 lookahead token 提前预测重要 KV 块,再从 host/remote me…
Ouroboros:自演化、可审核的代码 Agent Harness
Ouroboros 提出一种"自演化 Agent 框架"——Agent 的工具、prompt、上下文组装乃至核心代码,都通过可审核的 commit 演进,新版本直接成为下一轮工作的运行时,并在 TerminalBench 2.1、OSWorldVerified、CLBench 三个代码/桌面 Agent 基准上同时刷新…
Agent Memory Distillation:把大模型 Agent 的"三段记忆"蒸馏给小模型
AMD(Agent Memory Distillation)是一个免训练框架:让小语言模型(4B8B)通过"工作流—子任务—函数调用"三层结构化记忆,蒸馏大教师 Agent(GPT5mini 作为示例教师)的成功轨迹,在 AppWorld / BFCL V3 / ToolSandbox 三个工具调用基准上分别取得 +2…
HiSparse:分层 KV 缓存管理扩展稀疏注意力解码
首段自检:机制段 3 / 工程段 3 / ⚠️ 数字核验 4 处(4.7× peak throughput / H200/B200/GH200 三平台 / 三种 sparseattention 家族 / 已合入上游 SGLang 均来自 abstract,已二次核验 v1);私域编号清除已执行。 HiSparse 把稀…
LitTraceQA:科学问答中的多阶段定位与验证基准(论文检索 → 证据定位 → 答案生成 三段评测)
首段自检:机制 3 段(三段输出契约:paper ID + evidence location + answer · 五类证据:表格 / 图形 / 文本段 / 公式或算法 / 引用上下文 · 三段评测:检索 / grounding / 答案准确率独立打分)+ 工程 2 段(公开 55 例 dev split 含 26 …
基于分类法的开源 AI 风险缓解工具分析(21 工具 × MIT AI Risk Taxonomy 32 子类映射)
首段自检:机制 3 段(LLM 辅助 RAG 抽取能力 · 21 工具 × 32 子类二值映射矩阵 · Fleiss Kappa 0.509 多人独立复核 + 多数投票 F1=75.5%)+ 工程 2 段(21 个开源工具枚举 · 映射协议可直接套用到任何工具集)+ ⚠️ 数字核验 3 处("21 tools / 32…
Enfold:将世界模型的"想象计算"折叠进预测表征以实现超高效具身控制
首段自检:机制 3 段(生成器中间状态蒸馏 · 当前编码器与任务头梯度隔离 · 多层级 future supervision)+ 工程 2 段(LIBERO/RoboTwin2.0/真机三类任务 + FastWAM 3.7×/EnfoldFlash 10.1× 延迟实测)+ ⚠️ 数字核验 3 处("3.7× / 10…
DCAS:解耦 CLI Agent 脚手架以实现跨脚手架的规划内化
首段自检:机制 3 段(DCAS 拦截层 · 显式规划 vs 隐式规划二分 · 计划源受控干预实验)+ 工程 2 段(backendsubstitution 拦截层 + 单脚手架采集的轨迹让模型跨脚手架泛化)+ ⚠️ 数字核验 3 处("gains exceeding crossscaffold drops"为定性 ·…
多智能体取证推理实现可泛化的深度伪造视频检测(ARGUS / FaceVid-Forensics-100K)
首段自检:机制 3 段(多模型聚合冲突解决管线生成 100K 标注 · 4 专家 Agent 取证分视角 · Judge Agent 报告调和)+ 工程 2 段(100K / 33 种合成方法的 FaceVidForensics100K 数据集 · 全小开源 MLLM 击败 GPT/Gemini)+ ⚠️ 数字核验 3…
EAHR:去掉固定 Top-L,让 RAG 的混合检索第一次做到「精确 + 自适应」
EAHR(Exact Adaptive Hybrid Retrieval)把现代 RAG 系统里「dense + sparse 融合时取固定 TopL」这个隐性工程假设直接拆掉:把「完整列表加权 RRF 的有序 TopK」固定为检索目标,把通道深度当成请求级别的执行状态,通过 PVS(PerVector Scalar …
Referential Dangling:硬提示压缩中被忽视的范式级失效模式
自检:机制段 ×1 + 工程段 ×1 + ⚠️ 数字核验 ×5(0.30 压缩率、3454% dangling、6 compressors ≤60%、2934 pp 提升 / p<0.0001、88% gap 恢复、GPT5.5 8.8 pp、classifier 4.7 pp / 0.30→0.31)· 风险边界段 …
CLIP-CC-Bench:评估视频-语言模型的段落级视频描述能力
CLIPCCBench 是一个面向长篇视频描述的评测套件:基于 5 小时电影内容切成 90 秒片段,每段配专家撰写的段落式参考,采用 5 个 SOTA 嵌入模型集成 + 粗细两套语义匹配方法,对 17 个 SOTA 视频语言模型做了 Borda 排序,并量化了评估协议本身的内部一致性(interjudge agreem…
CoinRAG:用上下文信息要点 KV 缓存复用换长上下文 RAG 的 Pareto 前沿
自检:机制段 ×1 + 工程段 ×1 + ⚠️ 数字核验 ×2(5.3% 平均 F1 相对提升、新 Pareto 前沿、标准 fast prefill latency budget)· 风险边界段 ×1 · 反方段 ×1 CoinRAG 把 RAG 长上下文处理里的 chunk 级 KV 缓存复用再下推到「nugget…
用于量子动力学预测的互补矩阵门控 QKAN 快权重编程器
用一对互补的 sigmoid 矩阵门(retain 旧状态 + write 新提案)替代 QKAN 快权重编程器里的标量门,实现坐标级(coordinatewise)的记忆时间尺度控制,并在 JaynesCummings 与 transmonresonator 多步预测上把 MSE 维持在 ≤ 0.001,相比标量门版…
MatrAIx:用 83 亿 Persona Agent 模拟世界
MatrAIx 是一个面向 AI 系统与数字产品的大规模模拟用户评估基础设施,由 83 亿 persona 记录(1290 个类别维度)+ 4 个交互环境(Survey / Chatbot / Web / App)+ 1010 个应用任务组成;在 8 个代表性任务上跑了 18,189 次评估试验,对照 400trial…