解读
1758 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
京东 Oxygen AI 商品中心(Oxygen AIIC)V1:工业级 LLM/VLM 商品知识生产与服务
这是一篇来自京东的工业级 LLM/VLM 系统论文:在 7 亿用户、几百亿 SKU 的电商平台上,用 LLM/VLM 搭了一个商品知识生产与服务的"中枢",覆盖搜索/推荐/运营/类目规划四大场景,把搜索流量覆盖率推到 80.4%、商品信息质量问题下降 37%、上架自动填核心属性超过 80%。 电商平台的"商品知识"是搜…
Physics Informed Deep Learning (Part I): Data-driven Solutions of Nonlinear Partial Differential Equations
Physics Informed Neural Networks(PINN)将物理定律(由非线性偏微分方程 PDE 描述)编码为神经网络的损失函数约束,使网络在数据稀缺甚至无标签数据的情况下也能学习到符合物理规律的真解,且输出对所有输入坐标和自由参数天然可导。 传统科学计算依赖数值方法(有限元、有限差分、有限体积法)求…
面向纵向胸部 X 光报告的过渡感知 Best-of-N 采样
本文是论文 TransitionAware bestofN sampling for Longitudinal Chest Xray Reports(Gulluk et al., 2026, arXiv:2606.28393, cs.CV)的深度解读。 针对"纵向胸部 X 光报告生成"任务,作者提出了首个面向预训练报告…
Data Flow Control(DFC):AI Agent 数据安全策略的内核级执行框架
Data Flow Control(DFC)将 AI Agent 生成查询时的数据安全合规问题从「Prompt 层的后验检查」下沉为「数据库内核级的前摄执行」——通过声明式的 provenance monomials 聚合谓词策略语言,配合 Passant 查询重写引擎,在不物化 provenance 的前提下实现跨五…
多模态 LLM 的计算幽默:方法、数据集、评估与挑战
这是一篇关于「MLLM 如何理解视觉幽默」的综述:以「能力层级(识别 → 解释/推理 → 生成)」为骨架,把梗图、漫画、连环画里的多模态幽默任务、基准、评估与建模范式系统梳理一遍,核心论点是 MLLM 在幽默任务上仍受困于捷径学习式评测、文化与叙事覆盖不足、证据接地弱、安全与版权四道坎。 幽默理解长期被视为 NLP 与…
AutoIndex:为检索学习表征程序
AutoIndex 把"文档表示"从一次性的预处理选择提升为一类可学习的程序(representation program):由 agent 在验证集信号引导下,自动搜索对文档"切分 / 增强 / 归一化 / 重加权 / 重组"的执行程序,不改检索器本身,就能在固定 BM25 上把 8 个任务 Recall@100 平…
Flow-Controlled Scheduling:LLM 推理的稳态流控调度
这篇论文把 LLM 推理服务的"系统不稳、KV cache 爆、延迟抖动"归因到了一个被忽视的核心变量——prompt 加入活跃集的速率——然后用一套简洁的"流控调度(flowcontrol scheduling)"把 admission control 从经验调参升级为有 provable stability 的算法…
系统性测量偏差:LLM 推理基准测得根本不是你以为的那些数
这篇论文指出当下几乎所有"LLM 推理性能基准"测出来的 TTFT / TPOT 数字都被严重高估,因为主流 benchmark 客户端(locust、benchmark.py、GenAIPerf 等)都是 singleprocess asyncio 架构——而这个架构在几百~几千 QPS 下就被 Python GIL…
SparseX:交错 LLM 服务中的段级 KV cache 共享
SparseX 把 LLM 在线服务里的 KV cache 复用从 prefixonly 推到任意段级:以连续 token 段作为复用单元,利用复用场景下天然产生的 SparseQ 索引识别需要修正的"关键 token",然后在单次前向里完成 SparseKV Recomputation,从而在多轮对话、RAG、Age…
Deep Learning on Point Sets for 3D Classification and Segmentation(PointNet)
PointNet 提出了一种直接消费原始 3D 点云(无需体素化或渲染成图像)的深度神经网络,通过对称函数(Symmetry Function) 保证置换不变性,在 3D 物体分类、部件分割、场景语义解析三项任务上达到或超越 SOTA,同时提供严谨的理论分析解释其对点云扰动和缺失的鲁棒性来源。 3D 数据有多种表达方式…
Llama 2: Open Foundation and Fine-Tuned Chat Models
Meta 发布 Llama 2 系列(7B/13B/70B 参数),在 2 万亿 tokens 公开数据上预训练后,通过监督微调(SFT)+ 基于人类反馈的强化学习(RLHF)两阶段 finetuning,推出 Llama 2Chat;其在开源基准上全面超越此前开源模型,在helpfulness上接近闭源的 ChatG…
From SRA to Self-Flow:扩散 Transformer 训练里的"数据增强"还是"自监督"?
这篇论文做了一个非常干净的"拆变量"实验:SelfFlow 相对 SRA 的提升,到底是来自 dualtimestep 输入里不同噪声 token 之间的注意力交互,还是单纯来自把同一张图当成多个训练样本的数据增强?结论是后者——把跨噪声注意力切断,模型不仅没变差,还更好。 扩散 Transformer(Diffusi…
当经典缓存策略失效时:面向语义检索缓冲区的学习增强替换(SOLAR)
SOLAR 提出一种「学习增强」的语义缓存替换框架,把 LLM Agent 检索缓冲区的"何时改"交给 regret 累积决定、把"换成什么"交给基于隐式检索反馈的贝叶斯在线学习决定,从而在缓存容量与时域无关的前提下达到常数竞争比 ≤ 3,并相对 FIFO 在紧缓存下取得 5–75% 的相对提升。 LLM Agent(…
GaussianSelector:基于图优化的轻量人机协作 3D 高斯泼溅物体选择
GaussianSelector 提出了一种 trainingfree、面向 3D Gaussian Splatting(3DGS)重建场景的交互式物体选择框架:把稠密 Gaussian 粗化为几何一致的 superpoint,按外观与空间连续性构图,把用户在少量视角下的稀疏涂鸦经 visibilityaware 提升…
ASGE-RR:面向动态 AI-Agent 调用的可修订预留 Agentic 服务图嵌入
把 AIAgent 工作流里「运行时才显现的远程依赖调用」重新建模为一个在线网络控制问题 ASGE,并通过可修订预留(Revisable Reservations)让控制器在为当前调用分配资源的同时,为后续高价值调用提前预留容量,比同信息量的滚动时域与现调用导向控制器在 WAN 测试床上多完成最多 10% 的工作流价值…
Weights or Skills? 机器人学习两条路:把能力烤进冻结权重的 VLA,还是让 Agent 自己写可执行技能
把「机器人学习到底走哪条路」切成两个对立的赌注——Weights 派 (VLA 模型,把能力冻结在权重里) 与 Skills 派 (让 Agent 自己写并改写可执行代码技能),沿「自我改进程度」一轴把 codeaspolicy 方法排成从零样本程序合成、闭环自修复、持久技能记忆,一直到把执行反馈 + 技能记忆 + 进…
FactorJEPA:把整体未来拆成布局-实体-交互三通道的因子化世界模型,专攻拥挤混乱的全球南方城市
针对「拥挤、异质、软边界、持续遮挡」的全球南方 (Global South) 城市场景,提出把整体未来潜变量 (latent) 拆成「布局 / 实体 / 交互」三条独立通道的因子化 JEPA (FactorJEPA),并发布首个大规模 DENSEWORLD 数据集 (22 城 / 1000 小时视频);在 2B 与 1…
Deep Learning using Rectified Linear Units (ReLU)
这篇论文用 10 次随机试验 + 非参数 KruskalWallis H 检验重新回答了一个老问题:在图像分类、文本分类、图像重建三条任务上,ReLU 是不是真的优于 Sigmoid / Tanh——答案是肯定的,且差异统计显著;同时顺带"认领"了常被错配的引用,把 ReLU 引入深度学习的源头给 Nair & Hin…
Graph Convolutional Matrix Completion
把"矩阵补全"重新建模为"二部图上的链接预测",并用可微消息传递(Graph AutoEncoder)直接在 useritem 二部图上做端到端学习——这是 Graph Convolutional Matrix Completion(GCMC)给出的核心答案;在标准协同过滤 benchmark 上达到 SOTA,并能在…
MLlib: Machine Learning in Apache Spark
MLlib 是 Apache Spark 内置的分布式机器学习库,本文系统介绍它的设计目标、核心算法实现、底层统计/优化/线性代数原语以及 API 抽象——把"在 Spark 这种通用数据并行引擎上做机器学习"这件事从工程角度讲清楚,并不是一篇提出新算法的工作,而是一篇把"工程 + 算法 + 生态"打包交付的系统性论文…
SynthText:用合成数据训练深度网络解决自然场景文字识别
这篇 Jaderberg 等人的工作(arXiv:1406.2227,2014)证明:在自然场景文字识别(Scene Text Recognition, STR)任务上,完全用合成引擎生成的图片训练出的深度神经网络,可以击败当年依赖人工标注数据的 SOTA——而且三种不同的输出编码方式(字典编码、字符序列、字符 ngr…
Self-Consistency:用多条推理路径投票,换取思维链的稳定性
SelfConsistency 把 ChainofThought(CoT)从「一条 greedy 路径决定答案」改成「采样多条推理路径 → 对最终答案投票」,用一种几乎零训练成本、纯解码侧的改动,在一系列数学与常识推理基准上获得显著提升,并被后续工作当作 LLM 推理时的默认 baseline。 CoT(Wei et …
InstructGPT:用人类反馈微调语言模型以遵循指令
InstructGPT 证明:通过对 GPT3 进行"监督微调 + 人类反馈强化学习(RLHF)"两阶段训练,1.3B 参数模型在人类偏好评测中即可击败 175B 的 GPT3,并在真实性与有害性上同时改善,而 NLP 公开数据集性能几乎不回归。 2022 年初 GPT3 已经把语言模型参数规模推到 175B,但学术界…
感知语音的可解释 MEG 解码:皮层源与驱动检索的刺激特征
把 MEG 到语音检索的深度网络从"扁平面板 + 深卷积解码器"重构成"球谐空间前端 + 25 路浅分支解码器",在 MEGMASC 上以约 1/20 的解码器参数量达到 39.75% Top1,且权重首次能映射到皮层源空间、并通过遮挡实验定位到真正驱动检索的语音特征。 过去两年,基于 wav2vec 2.0 嵌入、以…
Activity Frames:面向 Agent 记忆与回放的确定性屏幕活动编译
把"用户做过的操作"作为一等公民压进 Agent 的记忆,而不是用前沿模型在每次推理时重新推导——这是一条零模型、确定性、可字节复现的屏幕活动编译流水线,能把单日原始捕获压成 86× 小的 promptready 上下文块,并在 51 天单用户语料上让 Agent 的"今日回放问答"准确率从 LLM 摘要的 66–80…
KVAE:面向多模态生成模型的 tokenizer 家族
把 tokenizer 从"接在某个扩散模型后面的小模块"升级为"可独立评测、跨音频/图像/视频统一比较的一等组件"——Kandinsky Lab 发布的 KVAE 家族(KVAEAudio / KVAE3D / KVAE2D)在 PSNR / LPIPS / PESQ / Frechet Distance / CLI…
Beyond Top-K:以可解释的 Agentic 操作取代黑盒检索
对于财务报表、审计报告、监管申报这一类"数字单位由远端表头定义、长程表格占主导"的结构化长文档,传统 chunk + embed + topk 的 RAG 在结构上就是错的——作者把这条论断做成可度量的实验,并在 51 道验证题上用一个不依赖 embedding 的 Agentic 检索(READ)把准确率从 dens…
转型中的持续学习:从参数中心到系统级适应的三轴综述
这是一篇 23 页综述,把持续学习(CL)从"参数中心视角"重定义为"系统级适应视角",并提出 When × How × Where 三轴框架(时间阶段 × 优化机制 × 更新位置),系统梳理从经典参数适配,到 onpolicy、testtime training、外部 memory/skill libraries/交…
MameLoshnLM:意第绪语语言模型与评估基准
针对意第绪语这一"文本传统丰富但数字存在感极低"的语言,作者发布了首个开源 8B 参数专用模型 MameLoshnLM,并通过两个新资源(Oytser 预训练语料 + Kashes 多任务基准)证明:把 Llama 3.1 8B 在高质量目标语言语料上持续预训练,能在低资源语言上同时击败同规模多语言基线,并捕获更准确的…
从经济主体到智能体经济:面向经济世界模型的系统蓝图
把"经济世界模型(EWM)"组织为六级能力阶梯,从固定规则主体一路升到「自适应 LLM 主体 + 自我演化的制度 + simtoreal 经济孪生」,并指出当前文献在 4–6 级近乎空白——这是一份给 AI + 经济学交叉社区的实现路线图,而不是一个新模型。 过去十年,agentbased modeling(ABM)在…