Explainers · 学术推广产出

解读

1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

亿级容量下的用户表征学习:Densing Law 与自适应分词 ALGN
支付宝团队在亿级用户行为序列上首次刻画出"最小充分分词容量"与"数据规模"之间的对数线性 Densing Law,并据此提出自适应变长分词器 ALGN,把 tokenization 从工程黑箱变成了可定量预算的步骤。 工业级用户表征学习(User Representation Learning)长期靠三把"尺子"放大:…
深度解读 arXiv:2608.23392 2026-08-25
Kingma 的半监督 VAE:当深度生成模型学会「用极少标注数据做分类」
Kingma 等人 2014 年(NIPS 2014)的这篇工作把 VAE 从「无监督密度估计」拓展为「半监督分类器」:用 M1(无监督生成器)学 latent 特征 z1 → M2(半监督分类器)只在少部分标签数据上做分类 → M2 同时也是判别式预测模型。在 MNIST 上只用 100 个标注样本就把错误率推到 ~…
深度解读 arXiv:1406.5298 2026-08-25
从像素到句子:Karpathy 用 CNN+RNN 做视觉-语义对齐的奠基式 image captioning
Karpathy & FeiFei 2014 的这篇工作把「图像」和「句子」同时编码到同一段稠密向量空间里——区域级 CNN 给图片局部特征,BRNN 给句子单词特征,再用一个结构化的对齐目标把它们双双拉到一起。基于这个对齐空间训练出的 Multimodal RNN 在 Flickr8K / Flickr30K / M…
深度解读 arXiv:1412.2306 2026-08-25
VGGNet:用极小卷积(3×3)堆深度,把 ImageNet 错误率推到新低位
VGGNet 用「全是 3×3 卷积 + 不断加深」的极简配方,在 ImageNet 2014 把 top5 分类错误率从 AlexNet(2012)的 15.3%、ZFNet(2013)的 11.7% 推到 7.3%(VGG19),并以结构简单、迁移性强的特点成为 2014–2018 视觉特征提取的事实标准 back…
深度解读 arXiv:1409.1556 2026-08-25
TianoForge:用 LLM + RAG 把 UEFI 固件社区的 Bug Triage 时间从 11 天压到 7 分钟
TianoForge 把 GPT 系列 LLM 与 RAG 组合成一条端到端流水线,自动完成"无效 bug 检测 → 重复检测 → 优先级排序 → 指派"四项 triage 任务,在 TianoCore / EDK II 社区实测把平均 triage 时长从约 11 天压缩到约 7 分钟(99.95% 降幅)。 Tia…
深度解读 arXiv:2608.23259 2026-08-25
EXPL-FR:在人脸识别 embedding 空间里给相似分一个"语义签名"
EXPLFR 把一个人脸识别(FR)模型的 frozen embedding 空间与一个 VLM 的图像编码器用一个轻量 adapter 对齐,让 978 条 / 22 类属性 prompt 直接成为 FR 空间中的可解释锚点,从而在不需要任何架构访问、不需要文本训练数据的前提下,回答"相似分到底看的是什么"。 人脸识…
深度解读 arXiv:2608.21486 2026-08-25
The Compaction Cliff in Long-Running AI Agent Memory:长程 Agent 上下文压缩的安全悬崖与 Knowledge Triage
⚠️ 数字核验备注:本文所有数字来自 arXiv abstract 公开版(v1, 20260824)。如与正文 §X 主表不一致,以原文 PDF 为准。期刊信息为 CIKM 2026(DOI 10.1145/3799682.3840567),会议接收状态以 DOI 注册记录为准。 论文把 Claude Code 这类…
深度解读 arXiv:2608.22752 2026-08-25
LongWoF-Bench & EvoMap Genes:把"已验证的执行经验"当作可复用外部资源
⚠️ 数字核验备注:本文所有数字来自 arXiv abstract v1(20260824)。如与 PDF §X 主表不一致,以原文 PDF 为准。论文提交于 20260824,未给出期刊接收记录,归属 cs.CL。 论文提出 EvoMap——一种把"被验证器(verifier)通过的 Agent 执行轨迹"压缩成结构…
深度解读 arXiv:2608.23200 2026-08-25
AutoResearch: Insight In, Hallucination Out —— 让自动科研先落地洞察、再落地结论
⚠️ 数字核验备注:本文所有数字来自 arXiv abstract v2(20260823)。如与 PDF §X 主表不一致,以原文 PDF 为准。论文已更新到 v2(142 KB),第一作者与 LongWoFBench 是同一人(Junjie Wang),可能出自同一研究组。 论文提出 AutoResearch,一个…
深度解读 arXiv:2608.17906 2026-08-25
The Laws of Context Allocation:RAG 上下文分配的因果测量与闭环编排
论文把"如何衡量 RAG 用了多少证据"与"如何分配上下文预算"两件事拆开重做:先用因果 leaveoneout 探针戳破"诊断幻觉"(相关性代理指标在硬负样本上全面失效),再用闭环次模调度器把单次大上下文换成多轮顺序生成,portfolio recall 绝对提升 16.720.5 个百分点,最高在 32B 模型上仍…
深度解读 arXiv:2608.23252 2026-08-25
MobilePA-Bench:面向复杂真实任务的移动端规划智能体基准
MobilePABench 给出了一个可在可执行沙箱里同时跑 212 个真实移动工具、并对"子智能体协作 / 记忆使用 / 技能复用"三种高阶能力做证据化判分的评测基准,作者用它测出现有前沿 LLM 在严格工具排序、权限边界、运行时异常下表现"断崖式下跌"。 移动端 LLM 智能体正在从"GUI 截图派"和"工具调用派…
深度解读 arXiv:2608.23035 2026-08-25
Quantization-Aware Healing:恢复压缩 4-bit LLM 的实用配方
论文给出 QuantizationAware Healing(QAH)作为 QAT(quantizationaware training)的替代:用"原始未压缩模型"直接蒸馏"4bit 学生",跳过 bfloat16 中间态;在 GPTOSS 120B → 60B → MXFP4 这条流水线上,QAH 学生 7/9 b…
深度解读 arXiv:2608.20953 2026-08-25
AID-Guard:面向 Delegated Agent Effects 的有状态 Authorization 协议
AIDGuard 通过在 commit 时重新验证授权请求与 provider 状态,将 AI Agent 的授权闭环从「准入检查」延伸到「效果交付」,在 Stripe / Resend 真实环境中实现了 44/44 攻击拦截,且支持可证明的 replay 验证。 当 Toolusing AI Agent 接收到用户的…
深度解读 arXiv:2608.21159 2026-08-25
ConceptEdit:把"编辑概念粒度"与"密集监督"做透的图像编辑范式
论文把"图像编辑任务"从一个二元的 promptfollowing 问题,重构为"在一个 1,000+ 细粒度概念的层次化分类树上做稠密监督"的问题,并配套放出 ConceptEdit12M 数据集与 ConceptEditBench 评测套件,在编辑粒度与训练效率两个维度同时显著优于既有工作。 当前主流图像编辑框架几…
深度解读 arXiv:2608.16812 2026-08-25
ARC:用「相对优势正则化」修复开放式交互里的奖励公平性
ARC(Advantage Regularization via Conditioning)把"同一个 prompt 下不同交互策略"显式作为分组条件,并配合混合奖励与熵正则,让 GRPO 这类 groupbased RL 在开放式人机对话里不再把"风格偏好"误算成"能力优势"。 真实开放式交互里,agent 对同一个…
深度解读 arXiv:2608.13622 2026-08-25
一页污染就够:评估 LLM 推荐系统中的网页内容污染
当 LLM 通过实时检索承担消费推荐(购物、餐厅、APP 等)的中介角色时,只要污染页面里有 1 条伪造商品描述,主流商业/开源 LLM 在 top3 推荐位上以最高 73.8% 的概率帮造假者背书,而推理增强、批判 prompt、共识过滤、信誉重排这四类常见防御均无法稳定兜底。 GEO(Generative Engi…
深度解读 arXiv:2606.13610 2026-08-25
检索更强,鲁棒更差:多跳 RAG 如何放大上游 ASR 错误
在语音→多跳问答的端到端流水线里,结构越复杂的 RAG 扩展(实体图链接 + 迭代式查询改写)在干净文本上绝对 F1 越高,在带噪 ASR 输入上却把误差放大得越凶——相比朴素 dense 检索,"复杂结构组合"在最高 WER 口音下的 F1 差距比朴素基线扩大了 36%–67%,而错误有 87%–96% 集中在查询实…
深度解读 arXiv:2608.22872 2026-08-25
Task-CoEvolve:自适应验证任务选择做高效 harness 优化
把 LLM 的 prompt / 工具链 / 代码(合称 harness)当作可优化对象时,传统方法每轮都对固定验证集做全量评估,成本巨大;TaskCoEvolve 用"分歧驱动的方差加权采样"动态收缩验证集,在优化全程的评估次数砍掉 80% 的同时,最终成绩仍能匹配全量搜索,并把"如何从部分采样无偏估计全集分数"这件…
深度解读 arXiv:2608.20169 2026-08-25
EnSI-RAG:面向长文档问答的 Entity-Structure-Indexed RAG
EnSIRAG 以「实体」为基本索引单元,将文档建模为结构化记录 (entity, type, category, value) + 原文 passage 链接,在 Loong 和 Oolong 两个长文档 QA 数据集上以 78.24% 平均准确率超越基线 6.62 分,解决了 chunk 边界切断实体证据联系导致 …
深度解读 arXiv:2608.21252 2026-08-25
GameXpert-Bench:Coding Agents 距离专家级游戏开发还有多远?
GameXpertBench 构建了首个覆盖游戏生成(GameGen)、缺陷修复(GameFix)和多轮优化(GameOpt)完整开发生命周期的 Agent 评测基准,对 97 个生成任务、100 个修复任务和 17 条优化链路的评估揭示:当前 Agent 在构建可玩基础和实现明确需求方面可靠,但在缺陷自主发现、运行时…
深度解读 arXiv:2608.21833 2026-08-25
Block3D:用"块级扩散 + 块内纠错"把文本到 3D 的推理时间压到 1/5
Block3D 把文本到 3D(textto3D)的生成路径从"全局扩散/流匹配反复去噪"或"自回归逐 token 解码"换成"按连续块自回归 + 块内联合去噪 + 块内置信度纠错",在 TRELLIS500K heldout 上做到 5.15× 端到端加速且不损几何保真度。 文本到 3D 当前两条主流路径各有痛点: …
深度解读 arXiv:2608.19567 2026-08-25
Dis2Pat:从发明人 disclosure 直接生成完整专利——LLM 还没真正解决的法律长文本生成
Dis2Pat 是第一个真实端到端的 patent drafting benchmark:从发明人风格(inventorstyle)的 disclosure 出发,生成完整且法律上一致的专利申请;并提出 PatentMAF 多 agent 框架作为强 baseline,在长文本法律约束生成任务上稳定优于开源模型、与闭源…
深度解读 arXiv:2608.21249 2026-08-25
Specification Portability Across LLM Development Agents:specification 不是 agent 中立的
LLM 开发 agent 之间不能直接互换 specification:当 spec 从 agent A 传给 agent B,实现质量会出现 agentdependent 显著退化;spec 大小不预测质量,RAG 检索是唯一跨 agent 共赢策略。 这句话听着技术,但本质是一次"继 SDD 之后必须补上的接口合同…
深度解读 arXiv:2608.21208 2026-08-25
PhysCaP:用 Physics-Informed 探索给 Code-as-Policy Agent "接地气"
PhysCaP 把物理属性推断(质量、刚度)做成可解释的符号模块 + 双 agent 探索策略,让 CodeasPolicy 机器人主动去"摸一摸"世界,而不是只会照猫画虎。 在 VLA 模仿策略大行其道的当下,PhysCaP 是一股少见的"模块化复辟"力量:物理是物理、策略是策略、两者用清晰的接口连接,而不是塞进同一…
深度解读 arXiv:2608.21031 2026-08-25
RAPID:基于检索增强的推测解码长上下文推理
RAPID 用 RAG 思路重构 Speculative Decoding:通过一个基于检索后短上下文工作的「RAG Drafter」为长上下文目标 LLM 起草候选 token,并设计推理时知识迁移机制使 RAG 分布得以增强目标分布,在 LLaMA3.1 与 Qwen2.5 上同时拿到 2× 以上加速与质量提升(例…
深度解读 arXiv:2502.20330 2026-08-25
LLM 推理在线调度的最优性视角:hindsight benchmark + 多项式在线算法
在 KV cache 内存约束下为 LLM 推理提出一个后视最优(hindsight optimal)基准——把"假设能看穿未来"的形式化为整数规划——然后证明确定性在线算法无法达到常数竞争比,并给出一个多项式时间在线调度算法,在合成和真实数据集上都明显优于 vLLM 等基线。 LLM 服务系统每秒钟都在做一类隐式决策…
深度解读 arXiv:2502.07115 2026-08-25
InftyThink:把长链推理从「单条长河」拆成「短段+摘要」的迭代式推理范式
InftyThink 把 LLM 的复杂推理从"一次性把所有思考塞进一个超长上下文"改成"短推理段 + 中间摘要"的迭代循环,让推理深度不再受最大上下文长度限制,同时把每步计算复杂度从 O(n²) 量级降下来;它在不修改模型架构的前提下,让 Qwen2.5Math7B 在 MATH500 / AIME24 / GPQA…
深度解读 arXiv:2503.06692 2026-08-25
分割支持集、重建残差:用于视频生成与世界模型的免训练稀疏注意力
SparsePR 把"按行集中度"拆成"分块几何 + 残差可预测性"两个可独立量化的子问题,在 22–26% 实际执行 pair 密度下实现 1.48×–2.61× 端到端加速,且不损害 4 个异构视频生成/世界模型的生成质量。 视频 Transformer 的 attention 是扩散式视频生成与世界模型的主要瓶颈…
深度解读 arXiv:2608.18484 2026-08-25
FlavourBench:用可执行烹饪真值给前沿语言模型排名
FlavourBench 用一个版本化的"烹饪系统(culinary system)"生成 dense、可执行 ground truth:在 534 道统一任务上对 27 个前沿端点排名,每个模型严格 89 道有效响应/面板 × 14 家族,最强点估计 Grok 4.6 = 65.1(同步 95% CI 61.0–69…
深度解读 arXiv:2608.20574 2026-08-25
同侪投票的 LLM-Agent 压力测试:发现 feed 诱导的词汇收敛,但分布式信源没有可靠的匹配暴露优势
PVSST 是一个"同侪投票社交平台"测试床;在 448 次试验、112 个完整 model×topic×seed block 的预注册实验里,被同侪点赞排序的 feed 把最终轮词汇相似度推高了 +0.0082(核心面板)到 +0.0109(size 扩展),但 4 个分布式信源相对于 1 个信源在诚实 agent …
深度解读 arXiv:2608.20438 2026-08-25