解读
1096 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
系统性测量偏差:LLM 推理基准测得根本不是你以为的那些数
这篇论文指出当下几乎所有"LLM 推理性能基准"测出来的 TTFT / TPOT 数字都被严重高估,因为主流 benchmark 客户端(locust、benchmark.py、GenAIPerf 等)都是 singleprocess asyncio 架构——而这个架构在几百~几千 QPS 下就被 Python GIL…
SparseX:交错 LLM 服务中的段级 KV cache 共享
SparseX 把 LLM 在线服务里的 KV cache 复用从 prefixonly 推到任意段级:以连续 token 段作为复用单元,利用复用场景下天然产生的 SparseQ 索引识别需要修正的"关键 token",然后在单次前向里完成 SparseKV Recomputation,从而在多轮对话、RAG、Age…
Deep Learning on Point Sets for 3D Classification and Segmentation(PointNet)
PointNet 提出了一种直接消费原始 3D 点云(无需体素化或渲染成图像)的深度神经网络,通过对称函数(Symmetry Function) 保证置换不变性,在 3D 物体分类、部件分割、场景语义解析三项任务上达到或超越 SOTA,同时提供严谨的理论分析解释其对点云扰动和缺失的鲁棒性来源。 3D 数据有多种表达方式…
Llama 2: Open Foundation and Fine-Tuned Chat Models
Meta 发布 Llama 2 系列(7B/13B/70B 参数),在 2 万亿 tokens 公开数据上预训练后,通过监督微调(SFT)+ 基于人类反馈的强化学习(RLHF)两阶段 finetuning,推出 Llama 2Chat;其在开源基准上全面超越此前开源模型,在helpfulness上接近闭源的 ChatG…
From SRA to Self-Flow:扩散 Transformer 训练里的"数据增强"还是"自监督"?
这篇论文做了一个非常干净的"拆变量"实验:SelfFlow 相对 SRA 的提升,到底是来自 dualtimestep 输入里不同噪声 token 之间的注意力交互,还是单纯来自把同一张图当成多个训练样本的数据增强?结论是后者——把跨噪声注意力切断,模型不仅没变差,还更好。 扩散 Transformer(Diffusi…
当经典缓存策略失效时:面向语义检索缓冲区的学习增强替换(SOLAR)
SOLAR 提出一种「学习增强」的语义缓存替换框架,把 LLM Agent 检索缓冲区的"何时改"交给 regret 累积决定、把"换成什么"交给基于隐式检索反馈的贝叶斯在线学习决定,从而在缓存容量与时域无关的前提下达到常数竞争比 ≤ 3,并相对 FIFO 在紧缓存下取得 5–75% 的相对提升。 LLM Agent(…
GaussianSelector:基于图优化的轻量人机协作 3D 高斯泼溅物体选择
GaussianSelector 提出了一种 trainingfree、面向 3D Gaussian Splatting(3DGS)重建场景的交互式物体选择框架:把稠密 Gaussian 粗化为几何一致的 superpoint,按外观与空间连续性构图,把用户在少量视角下的稀疏涂鸦经 visibilityaware 提升…
ASGE-RR:面向动态 AI-Agent 调用的可修订预留 Agentic 服务图嵌入
把 AIAgent 工作流里「运行时才显现的远程依赖调用」重新建模为一个在线网络控制问题 ASGE,并通过可修订预留(Revisable Reservations)让控制器在为当前调用分配资源的同时,为后续高价值调用提前预留容量,比同信息量的滚动时域与现调用导向控制器在 WAN 测试床上多完成最多 10% 的工作流价值…
Weights or Skills? 机器人学习两条路:把能力烤进冻结权重的 VLA,还是让 Agent 自己写可执行技能
把「机器人学习到底走哪条路」切成两个对立的赌注——Weights 派 (VLA 模型,把能力冻结在权重里) 与 Skills 派 (让 Agent 自己写并改写可执行代码技能),沿「自我改进程度」一轴把 codeaspolicy 方法排成从零样本程序合成、闭环自修复、持久技能记忆,一直到把执行反馈 + 技能记忆 + 进…
FactorJEPA:把整体未来拆成布局-实体-交互三通道的因子化世界模型,专攻拥挤混乱的全球南方城市
针对「拥挤、异质、软边界、持续遮挡」的全球南方 (Global South) 城市场景,提出把整体未来潜变量 (latent) 拆成「布局 / 实体 / 交互」三条独立通道的因子化 JEPA (FactorJEPA),并发布首个大规模 DENSEWORLD 数据集 (22 城 / 1000 小时视频);在 2B 与 1…
Deep Learning using Rectified Linear Units (ReLU)
这篇论文用 10 次随机试验 + 非参数 KruskalWallis H 检验重新回答了一个老问题:在图像分类、文本分类、图像重建三条任务上,ReLU 是不是真的优于 Sigmoid / Tanh——答案是肯定的,且差异统计显著;同时顺带"认领"了常被错配的引用,把 ReLU 引入深度学习的源头给 Nair & Hin…
Graph Convolutional Matrix Completion
把"矩阵补全"重新建模为"二部图上的链接预测",并用可微消息传递(Graph AutoEncoder)直接在 useritem 二部图上做端到端学习——这是 Graph Convolutional Matrix Completion(GCMC)给出的核心答案;在标准协同过滤 benchmark 上达到 SOTA,并能在…
MLlib: Machine Learning in Apache Spark
MLlib 是 Apache Spark 内置的分布式机器学习库,本文系统介绍它的设计目标、核心算法实现、底层统计/优化/线性代数原语以及 API 抽象——把"在 Spark 这种通用数据并行引擎上做机器学习"这件事从工程角度讲清楚,并不是一篇提出新算法的工作,而是一篇把"工程 + 算法 + 生态"打包交付的系统性论文…
SynthText:用合成数据训练深度网络解决自然场景文字识别
这篇 Jaderberg 等人的工作(arXiv:1406.2227,2014)证明:在自然场景文字识别(Scene Text Recognition, STR)任务上,完全用合成引擎生成的图片训练出的深度神经网络,可以击败当年依赖人工标注数据的 SOTA——而且三种不同的输出编码方式(字典编码、字符序列、字符 ngr…
Self-Consistency:用多条推理路径投票,换取思维链的稳定性
SelfConsistency 把 ChainofThought(CoT)从「一条 greedy 路径决定答案」改成「采样多条推理路径 → 对最终答案投票」,用一种几乎零训练成本、纯解码侧的改动,在一系列数学与常识推理基准上获得显著提升,并被后续工作当作 LLM 推理时的默认 baseline。 CoT(Wei et …
InstructGPT:用人类反馈微调语言模型以遵循指令
InstructGPT 证明:通过对 GPT3 进行"监督微调 + 人类反馈强化学习(RLHF)"两阶段训练,1.3B 参数模型在人类偏好评测中即可击败 175B 的 GPT3,并在真实性与有害性上同时改善,而 NLP 公开数据集性能几乎不回归。 2022 年初 GPT3 已经把语言模型参数规模推到 175B,但学术界…
感知语音的可解释 MEG 解码:皮层源与驱动检索的刺激特征
把 MEG 到语音检索的深度网络从"扁平面板 + 深卷积解码器"重构成"球谐空间前端 + 25 路浅分支解码器",在 MEGMASC 上以约 1/20 的解码器参数量达到 39.75% Top1,且权重首次能映射到皮层源空间、并通过遮挡实验定位到真正驱动检索的语音特征。 过去两年,基于 wav2vec 2.0 嵌入、以…
Activity Frames:面向 Agent 记忆与回放的确定性屏幕活动编译
把"用户做过的操作"作为一等公民压进 Agent 的记忆,而不是用前沿模型在每次推理时重新推导——这是一条零模型、确定性、可字节复现的屏幕活动编译流水线,能把单日原始捕获压成 86× 小的 promptready 上下文块,并在 51 天单用户语料上让 Agent 的"今日回放问答"准确率从 LLM 摘要的 66–80…
KVAE:面向多模态生成模型的 tokenizer 家族
把 tokenizer 从"接在某个扩散模型后面的小模块"升级为"可独立评测、跨音频/图像/视频统一比较的一等组件"——Kandinsky Lab 发布的 KVAE 家族(KVAEAudio / KVAE3D / KVAE2D)在 PSNR / LPIPS / PESQ / Frechet Distance / CLI…
Beyond Top-K:以可解释的 Agentic 操作取代黑盒检索
对于财务报表、审计报告、监管申报这一类"数字单位由远端表头定义、长程表格占主导"的结构化长文档,传统 chunk + embed + topk 的 RAG 在结构上就是错的——作者把这条论断做成可度量的实验,并在 51 道验证题上用一个不依赖 embedding 的 Agentic 检索(READ)把准确率从 dens…
转型中的持续学习:从参数中心到系统级适应的三轴综述
这是一篇 23 页综述,把持续学习(CL)从"参数中心视角"重定义为"系统级适应视角",并提出 When × How × Where 三轴框架(时间阶段 × 优化机制 × 更新位置),系统梳理从经典参数适配,到 onpolicy、testtime training、外部 memory/skill libraries/交…
MameLoshnLM:意第绪语语言模型与评估基准
针对意第绪语这一"文本传统丰富但数字存在感极低"的语言,作者发布了首个开源 8B 参数专用模型 MameLoshnLM,并通过两个新资源(Oytser 预训练语料 + Kashes 多任务基准)证明:把 Llama 3.1 8B 在高质量目标语言语料上持续预训练,能在低资源语言上同时击败同规模多语言基线,并捕获更准确的…
从经济主体到智能体经济:面向经济世界模型的系统蓝图
把"经济世界模型(EWM)"组织为六级能力阶梯,从固定规则主体一路升到「自适应 LLM 主体 + 自我演化的制度 + simtoreal 经济孪生」,并指出当前文献在 4–6 级近乎空白——这是一份给 AI + 经济学交叉社区的实现路线图,而不是一个新模型。 过去十年,agentbased modeling(ABM)在…
面向 AI Agent 签名工作流的硬件密钥存储:一种零信任 MCP 强制执行架构
把 AI Agent 用来签署 Git 提交、API 调用和签发证书的私钥从「软件可读取的明文」彻底迁移到「硬件不可导出的密闭容器」,并用五层零信任栈守住每一次签名意图,将注入攻击下的密钥外泄成功率从 19.3% 压到 0%。 论文开篇给出一个具体的生产事故:某个被广泛部署的 Agent 框架在不到五分钟内通过邮件注入…
TNT:用「Transformer in Transformer」在 patch 内再开一层注意力
TNT(Transformer iN Transformer)在 ViT 之外再嵌一个「子 Transformer」,先把 16×16 的 patch 当作「visual sentence」,再切成更小的 4×4「visual words」做 patch 内注意力,让 ImageNet top1 在相近算力下比同代 V…
DataSpace:在异构工作空间上做可验证表格分析的数据 Agent 基准
DataSpace 是一个让数据 Agent 在「任务本地异构工作空间」上直接产出可校验表格结果的基准:410 个跨语言任务、7439 个 artifact、合计 15.01 GB,覆盖 CSV / JSON / SQLite / Markdown / PDF / 视频等模态;六款前沿多模态模型的最佳准确率仅 66.3…
MASS:用「权威共享状态」把多智能体世界模型解耦为逻辑引擎 + 渲染引擎
MASS 把多智能体视频世界模型拆成「可学习逻辑引擎」与「可学习渲染引擎」两条独立通路,全局状态由逻辑引擎唯一权威地推进,再让渲染引擎按需为任意视角生成画面,从而在 1024 个并发玩家的 Snake 仿真里稳定推演 10000 个循环步,并显著降低跨视角不一致。 现有视频世界模型(类 Sora、Genie、GameN…
ALBERT:更轻的 BERT,用参数共享与分解换来可放大的预训练
ALBERT 用「跨层参数共享 + 词嵌入矩阵低秩分解 + 句间连贯性自监督损失」三件套,把 BERTlarge 的参数体量压到原来的约 1/10,同时在 GLUE / RACE / SQuAD 上拿到当时的新 SOTA,证明了「更大不一定要更宽更深,结构与训练目标同样重要」。 20182019 年的 NLP 战场,大…
A Structured Self-Attentive Sentence Embedding:把句子压成「可解释的 2D 矩阵」而不是「一维向量」
Lin 等人提出用「双向 LSTM + 结构化自注意力」把句子编码成 n×d 的 2D 矩阵(每一行 attend 到句子的不同部分),并用一个简单正则项防止所有行坍缩到同一关注点——既保留了可解释的「句子到底在编码什么」,又显著优于当时主流的句子向量方法,在作者画像、情感分类、文本蕴含三类任务上同时拿到增益。 201…
Chain-of-Thought Prompting:用思维链提示激发大语言模型的推理能力
说明:研究知识库 paper_cards 中该 arxiv 编号(2201.11903)被错误映射到"BNAI, NOTOKEN, MINDUNITY"标题(这是 OpenAlex/S2 enrich 流水线的 metadata 错配,OpenAlex 上 W4221143046 工作 ID 与 arXiv 2201.…