解读
1524 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
亿级容量下的用户表征学习:Densing Law 与自适应分词 ALGN
支付宝团队在亿级用户行为序列上首次刻画出"最小充分分词容量"与"数据规模"之间的对数线性 Densing Law,并据此提出自适应变长分词器 ALGN,把 tokenization 从工程黑箱变成了可定量预算的步骤。 工业级用户表征学习(User Representation Learning)长期靠三把"尺子"放大:…
Kingma 的半监督 VAE:当深度生成模型学会「用极少标注数据做分类」
Kingma 等人 2014 年(NIPS 2014)的这篇工作把 VAE 从「无监督密度估计」拓展为「半监督分类器」:用 M1(无监督生成器)学 latent 特征 z1 → M2(半监督分类器)只在少部分标签数据上做分类 → M2 同时也是判别式预测模型。在 MNIST 上只用 100 个标注样本就把错误率推到 ~…
从像素到句子:Karpathy 用 CNN+RNN 做视觉-语义对齐的奠基式 image captioning
Karpathy & FeiFei 2014 的这篇工作把「图像」和「句子」同时编码到同一段稠密向量空间里——区域级 CNN 给图片局部特征,BRNN 给句子单词特征,再用一个结构化的对齐目标把它们双双拉到一起。基于这个对齐空间训练出的 Multimodal RNN 在 Flickr8K / Flickr30K / M…
VGGNet:用极小卷积(3×3)堆深度,把 ImageNet 错误率推到新低位
VGGNet 用「全是 3×3 卷积 + 不断加深」的极简配方,在 ImageNet 2014 把 top5 分类错误率从 AlexNet(2012)的 15.3%、ZFNet(2013)的 11.7% 推到 7.3%(VGG19),并以结构简单、迁移性强的特点成为 2014–2018 视觉特征提取的事实标准 back…
TianoForge:用 LLM + RAG 把 UEFI 固件社区的 Bug Triage 时间从 11 天压到 7 分钟
TianoForge 把 GPT 系列 LLM 与 RAG 组合成一条端到端流水线,自动完成"无效 bug 检测 → 重复检测 → 优先级排序 → 指派"四项 triage 任务,在 TianoCore / EDK II 社区实测把平均 triage 时长从约 11 天压缩到约 7 分钟(99.95% 降幅)。 Tia…
EXPL-FR:在人脸识别 embedding 空间里给相似分一个"语义签名"
EXPLFR 把一个人脸识别(FR)模型的 frozen embedding 空间与一个 VLM 的图像编码器用一个轻量 adapter 对齐,让 978 条 / 22 类属性 prompt 直接成为 FR 空间中的可解释锚点,从而在不需要任何架构访问、不需要文本训练数据的前提下,回答"相似分到底看的是什么"。 人脸识…
The Compaction Cliff in Long-Running AI Agent Memory:长程 Agent 上下文压缩的安全悬崖与 Knowledge Triage
⚠️ 数字核验备注:本文所有数字来自 arXiv abstract 公开版(v1, 20260824)。如与正文 §X 主表不一致,以原文 PDF 为准。期刊信息为 CIKM 2026(DOI 10.1145/3799682.3840567),会议接收状态以 DOI 注册记录为准。 论文把 Claude Code 这类…
LongWoF-Bench & EvoMap Genes:把"已验证的执行经验"当作可复用外部资源
⚠️ 数字核验备注:本文所有数字来自 arXiv abstract v1(20260824)。如与 PDF §X 主表不一致,以原文 PDF 为准。论文提交于 20260824,未给出期刊接收记录,归属 cs.CL。 论文提出 EvoMap——一种把"被验证器(verifier)通过的 Agent 执行轨迹"压缩成结构…
AutoResearch: Insight In, Hallucination Out —— 让自动科研先落地洞察、再落地结论
⚠️ 数字核验备注:本文所有数字来自 arXiv abstract v2(20260823)。如与 PDF §X 主表不一致,以原文 PDF 为准。论文已更新到 v2(142 KB),第一作者与 LongWoFBench 是同一人(Junjie Wang),可能出自同一研究组。 论文提出 AutoResearch,一个…
The Laws of Context Allocation:RAG 上下文分配的因果测量与闭环编排
论文把"如何衡量 RAG 用了多少证据"与"如何分配上下文预算"两件事拆开重做:先用因果 leaveoneout 探针戳破"诊断幻觉"(相关性代理指标在硬负样本上全面失效),再用闭环次模调度器把单次大上下文换成多轮顺序生成,portfolio recall 绝对提升 16.720.5 个百分点,最高在 32B 模型上仍…
MobilePA-Bench:面向复杂真实任务的移动端规划智能体基准
MobilePABench 给出了一个可在可执行沙箱里同时跑 212 个真实移动工具、并对"子智能体协作 / 记忆使用 / 技能复用"三种高阶能力做证据化判分的评测基准,作者用它测出现有前沿 LLM 在严格工具排序、权限边界、运行时异常下表现"断崖式下跌"。 移动端 LLM 智能体正在从"GUI 截图派"和"工具调用派…
Quantization-Aware Healing:恢复压缩 4-bit LLM 的实用配方
论文给出 QuantizationAware Healing(QAH)作为 QAT(quantizationaware training)的替代:用"原始未压缩模型"直接蒸馏"4bit 学生",跳过 bfloat16 中间态;在 GPTOSS 120B → 60B → MXFP4 这条流水线上,QAH 学生 7/9 b…
视频选题榜 · 2026-08-19
v2 重写覆盖(承接 20260825 反思棒 §三"最弱单篇"识别 · 覆盖原 v1 = 610 字节 / 4 行 / 3 entries · 物理粘连 + 内容塌方) 触发:20260825 21:40 CST Tom 反思棒次 #29 明确把 819 selection 列为 7 天剩余 v1 selection…
AID-Guard:面向 Delegated Agent Effects 的有状态 Authorization 协议
AIDGuard 通过在 commit 时重新验证授权请求与 provider 状态,将 AI Agent 的授权闭环从「准入检查」延伸到「效果交付」,在 Stripe / Resend 真实环境中实现了 44/44 攻击拦截,且支持可证明的 replay 验证。 当 Toolusing AI Agent 接收到用户的…
ConceptEdit:把"编辑概念粒度"与"密集监督"做透的图像编辑范式
论文把"图像编辑任务"从一个二元的 promptfollowing 问题,重构为"在一个 1,000+ 细粒度概念的层次化分类树上做稠密监督"的问题,并配套放出 ConceptEdit12M 数据集与 ConceptEditBench 评测套件,在编辑粒度与训练效率两个维度同时显著优于既有工作。 当前主流图像编辑框架几…
ARC:用「相对优势正则化」修复开放式交互里的奖励公平性
ARC(Advantage Regularization via Conditioning)把"同一个 prompt 下不同交互策略"显式作为分组条件,并配合混合奖励与熵正则,让 GRPO 这类 groupbased RL 在开放式人机对话里不再把"风格偏好"误算成"能力优势"。 真实开放式交互里,agent 对同一个…
主题综述 · engineering(2026-08-25)
范围:20260819 ~ 0825 近 7 天 engineering 主分类 + 邻接 llminfra 12 篇 arXiv 综合。聚焦三联位移:长上下文推理内核(FlashPrefill V2)+ 后训练栈蒸馏/遗忘/谱系(AdaPop + Centered Residual + S²VOPD / Simple…
主题综述 · rag(2026-08-25)
检索增强生成(RAG)在 2020 年由 Lewis 等人定名以来,沿"端到端管道 → 模块化 → 检索范式多样化 → 智能体化"路径迭代。2026 年 8 月这一截面上的研究热点已不再是"embedding + topk + prompt"三件套本身,而是把检索决策权从管道上升为可学习、可验证、可仲裁的一等公民。三条…
一页污染就够:评估 LLM 推荐系统中的网页内容污染
当 LLM 通过实时检索承担消费推荐(购物、餐厅、APP 等)的中介角色时,只要污染页面里有 1 条伪造商品描述,主流商业/开源 LLM 在 top3 推荐位上以最高 73.8% 的概率帮造假者背书,而推理增强、批判 prompt、共识过滤、信誉重排这四类常见防御均无法稳定兜底。 GEO(Generative Engi…
检索更强,鲁棒更差:多跳 RAG 如何放大上游 ASR 错误
在语音→多跳问答的端到端流水线里,结构越复杂的 RAG 扩展(实体图链接 + 迭代式查询改写)在干净文本上绝对 F1 越高,在带噪 ASR 输入上却把误差放大得越凶——相比朴素 dense 检索,"复杂结构组合"在最高 WER 口音下的 F1 差距比朴素基线扩大了 36%–67%,而错误有 87%–96% 集中在查询实…
Task-CoEvolve:自适应验证任务选择做高效 harness 优化
把 LLM 的 prompt / 工具链 / 代码(合称 harness)当作可优化对象时,传统方法每轮都对固定验证集做全量评估,成本巨大;TaskCoEvolve 用"分歧驱动的方差加权采样"动态收缩验证集,在优化全程的评估次数砍掉 80% 的同时,最终成绩仍能匹配全量搜索,并把"如何从部分采样无偏估计全集分数"这件…
EnSI-RAG:面向长文档问答的 Entity-Structure-Indexed RAG
EnSIRAG 以「实体」为基本索引单元,将文档建模为结构化记录 (entity, type, category, value) + 原文 passage 链接,在 Loong 和 Oolong 两个长文档 QA 数据集上以 78.24% 平均准确率超越基线 6.62 分,解决了 chunk 边界切断实体证据联系导致 …
GameXpert-Bench:Coding Agents 距离专家级游戏开发还有多远?
GameXpertBench 构建了首个覆盖游戏生成(GameGen)、缺陷修复(GameFix)和多轮优化(GameOpt)完整开发生命周期的 Agent 评测基准,对 97 个生成任务、100 个修复任务和 17 条优化链路的评估揭示:当前 Agent 在构建可玩基础和实现明确需求方面可靠,但在缺陷自主发现、运行时…
Block3D:用"块级扩散 + 块内纠错"把文本到 3D 的推理时间压到 1/5
Block3D 把文本到 3D(textto3D)的生成路径从"全局扩散/流匹配反复去噪"或"自回归逐 token 解码"换成"按连续块自回归 + 块内联合去噪 + 块内置信度纠错",在 TRELLIS500K heldout 上做到 5.15× 端到端加速且不损几何保真度。 文本到 3D 当前两条主流路径各有痛点: …
主题综述 · agent(2026-08-25)
本棒定位:W5 综述轮换。date +%j = 237,mod 8 = 5 = engineering。promo/surveys/ 下 72 小时内已有 20260825engineering.md / 20260823evaluation.md / 20260823risk.md / 20260822databas…
Dis2Pat:从发明人 disclosure 直接生成完整专利——LLM 还没真正解决的法律长文本生成
Dis2Pat 是第一个真实端到端的 patent drafting benchmark:从发明人风格(inventorstyle)的 disclosure 出发,生成完整且法律上一致的专利申请;并提出 PatentMAF 多 agent 框架作为强 baseline,在长文本法律约束生成任务上稳定优于开源模型、与闭源…
Specification Portability Across LLM Development Agents:specification 不是 agent 中立的
LLM 开发 agent 之间不能直接互换 specification:当 spec 从 agent A 传给 agent B,实现质量会出现 agentdependent 显著退化;spec 大小不预测质量,RAG 检索是唯一跨 agent 共赢策略。 这句话听着技术,但本质是一次"继 SDD 之后必须补上的接口合同…
PhysCaP:用 Physics-Informed 探索给 Code-as-Policy Agent "接地气"
PhysCaP 把物理属性推断(质量、刚度)做成可解释的符号模块 + 双 agent 探索策略,让 CodeasPolicy 机器人主动去"摸一摸"世界,而不是只会照猫画虎。 在 VLA 模仿策略大行其道的当下,PhysCaP 是一股少见的"模块化复辟"力量:物理是物理、策略是策略、两者用清晰的接口连接,而不是塞进同一…
BERTopic:为什么 AI 终于能"读懂一百万条评论在聊什么"了
你有没有试过打开一份 10 万条用户评论,心想"我到底能从里面看出什么"?你有没有面对一堆客服工单、新闻舆情、论文摘要,想知道"大家到底在讨论哪些话题"? 这件事在 2022 年之前其实非常难。传统方法 LDA(隐含狄利克雷分配)跑出来的主题往往是"公司""报告""数据"这种毫无信息量的通用词,根本看不出人们在聊什么具…
多任务学习 10 年"族谱图":为什么 AI 越来越像"一人干多活的家庭主妇"
你有没有想过,为什么 ChatGPT 既能写代码又能写诗?为什么同一个推荐模型能同时预测"点击"、"加购物车"、"购买"、"收藏"四个动作?为什么一个 AI 医生系统能同时看 X 光片、化验报告和病历? 答案藏在一篇 2017 年的综述里——1707.08114,《A Survey on MultiTask Learn…