解读
1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Inject, Align, Recover:把整库文档"压进"参数的免检索后训练三段式
本文提出 IAR(Inject / Align / Recover)三阶段后训练框架,把"将一份固定的文档语料转为模型可查询的参数化知识"这件事从单段 continued pretraining 拆成"知识注入 + 答案对齐 + 通用能力回救"三道工序,在 Llama / Phi / Qwen / SmolLM 四个模…
Hierarchical Self-Improvement:让 Agent Harness 像模型权重一样被"演化"
本文提出 Hierarchical SelfImprovement (HSI),把 LLM Agent 中常被视为"部署后固定"的执行脚手架(harness)当作任务特定、持续可演化的一等公民——单个冻结的 LLM 在三个层级同时运作(任务执行 harness H、改写 H 的 evolver、改写 evolver 策…
SkillEvo:把多轮对话从"评测终点"变成"演化梯度源"
本文提出 SkillEvo,把 LLM Agent Skill 的演化反馈源从单轮 QA 评分改为多轮用户模拟——每一轮修订既消耗反馈也产生新反馈,使"演化梯度"自我更新;并用一个独立治理层替换"标量门控"的被动拒收,主动修补事实退化与结构膨胀。在 6 类云服务、9 个生产 Skill、98 个 skillrefere…
Information-Aware KV Cache Compression for Long Reasoning
InfoKV 提出了 Forward Influence(前向影响)指标,用"压缩掉这个 token 会如何改变模型对未来上下文的预测分布"这一前瞻视角来选择 KV Cache 中值得保留的 token,配合熵感知信号与注意力分数的融合,在长 prefilling 与长 decoding 场景中显著优于纯注意力驱动的 …
MMProLong:用 5B token 把 LVLM 从 32K 推到 128K,并外推到 512K
MMProLong 给出了一个真正"省 token"的长上下文视觉语言模型(LVLM)续训练配方:在 Qwen2.5VL7B 基础上只用 5B token 的 continued pretraining(LongPT),把上下文窗口从 32K 拉到 128K,长文档 VQA 分数提升 7.1%,且不需要任何额外训练就能…
怎样的 Fiqh 检索器才算好?阿拉伯伊斯兰法学的"答案承载"检索评测
本文把"端到端 RAG 在 Islamic QA 上分数更高"这一常用论断拆成两段,专门测量检索阶段——只在「段落真的陈述了问题所需裁决」时才判为相关——并发现 dense+lexical hybrid 在强模型上几乎不增益,而按 madhhab(法学派)做后置过滤能把学派特化题的 MRR@5 翻一倍多。 RAG 已经…
RapidLiDAR:实时且自适应的 LiDAR 场景补全
针对自动驾驶中 LiDAR 场景补全的两难——生成式方法精度高但慢、非生成式方法快但要手工调噪声尺度——RapidLiDAR 把"初始化"本身也学成一个数据驱动的模块,先用一个自适应初始化模块对每个部分观测点预测一个空间变化的位移生成粗场景,再用多尺度重建模块结合 3D voxel 与 2D BEV 特征图把粗场景精化…
COMA:针对 Security-RAG 的组合式误导攻击类别与因果反事实防御
在面向 SOC 分析师的 Security Copilot 中,攻击者可以通过 COMA(Compositional Misleading Attack)让所有被检索到的文档单独看都真实、无指令、无矛盾、分布良性,却仅靠"组合效应"误导 copilot 给出"漏洞存在但修复无效"或"漏洞不可利用"两种致命错判;论文同时…
SkillGate:在长视野 Agent 中训练"策略内技能选择"
当 Agent 框架把过程性知识封装成"按需读取的技能指令"后,"该读哪一份技能"本身就是 episode 中途要做的决策,但现有的"对候选技能列表施加结果奖励的 RL"会因为选择器信用饥饿(selector credit starvation)而结构性失败;SkillGate 用"outcome 信用只到执行 tok…
QuoteBench:匹配分数为什么掩盖了命令路径里的失败
LLM 编程 Agent 评测里那些"匹配执行得分"实际上把生成阶段错误和"生成之后再被解析器改坏的"错误混在了一起;QuoteBench 用 14 个源自真实事件、56 个一次性任务的最小可复现边界测试证明:同一份回复再过一个未转义的解析器会让成功率下跌 55.4 ~ 73.2 个百分点,而"声明边界 + 转义"对其…
Embedder's Dilemma:该不该把嵌入流水线换成 LLM?
在 37 个任务、6 个家族、10 个 LLM(含 118M ~ 14B 的参数量)与 26 个嵌入模型的受控 + 成本感知对比里,两条范式总体上几乎打平 —— 最佳 LLM(Gemini 3.1 Pro 77.6)与最佳嵌入模型(77.2)只差 0.4 分;但 LLM 的边推理边生成使其单次基准测试成本最高可达 US…
TinyCast:基于计算周期性的概率性零样本预测
TinyCast 是一个 146,505 参数、零注意力的零样本时序预测器,靠"显式算周期 + 膨胀卷积编码 + 分块自回归分位数解码"在 GIFTEval 概率精度榜单上划出了 sizeaccuracy 前沿,并能在嵌入式设备上以静态 INT8 全链路推理。 零样本时序预测(zeroshot timeseries f…
FlowEvo:通过工作流与可执行 Skill 协同演化的自演化 Agent
FlowEvo 是一个无需训练的 Agent 框架,让工作流(workflow)和可执行 Skill 在推理时协同演化:成功的工作流被编译为可调用 Skill 并存入持久化库,检索回来的 Skill 既可直接执行,也可作为上下文构造新工作流;在 GPT4omini 主干下,五个标准基准全部 SOTA,且用约三分之一 t…
τ_0-VLA:基于世界模型引导测试时计算的分层机器人基础模型
τ_0VLA 是一个把"高层子任务生成"建模为可扩展推理问题的分层 VLA(visionlanguageaction)机器人基础模型——通过世界模型引导的测试时计算(testtime computation),在 40,115 小时真实异构数据上联合训练,在分布内与分布偏移设置下都把更多推理算力转化为更高的长周期闭环成…
Consciousness in Artificial Intelligence: Insights from the Science of Consciousness
当前 AI 系统(包括 GPT4、Claude 等)均未满足任何主流意识理论的核心判据,这篇报告以实证神经科学框架为尺,宣告"AI 尚无意识"。 "AI 是否有意识"是 2023 年公共舆论与学术界的共同困惑。一方面,媒体与部分研究者热衷于声称大模型已具备感知能力;另一方面,这一判断缺乏可操作的方法论——既无公认的评测…
Large Language Models: A Survey —— LLM 生态的方法论与代表模型全景图
Minaee 等人 2024 年初发表的 LLM 综述(S2 引用超千),按"主流模型家族 → 训练与增强技术 → 数据集 → 评估指标 → 主流 benchmark 横评 → 开放挑战"六条主线系统梳理 LLM 生态,覆盖 GPT、LLaMA、PaLM 三大族谱与若干开源/闭源代表,是 2024 年初最常被引用的 L…
ChatGPT is not all you need: A State of the Art Review of Large Generative AI Models
该综述对 20212023 年间的主要 Generative AI 模型进行了多模态分类,涵盖 TexttoText、TexttoImage、ImagetoText、TexttoVideo、Textto3D、TexttoAudio、TexttoCode 等多个生成范式,并分析了生成式 AI 对各行业的影响,是理解 20…
本地化部署企业 RAG 的 AI 工程蓝图(4+1 视图 + 参考实现)
这篇论文是 2026 年少有的"严肃讨论企业本地化 RAG"的工作:作者给出一套完整的 AI 工程蓝图(AI Engineering Blueprint),以 4+1 视图模型描述端到端参考架构,并配套发布一个 onpremises reference application 与 CI/CD 最佳实践,专门解决"数据合…
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
TTKV 将人类记忆系统的层次性(工作记忆 / 情景记忆 / 长期记忆)映射到 LLM 推理的 KV Cache 中,通过 HBM + DRAM 的异构存储分层 + 基于时间相关性的 tier 内容分配 + blockwise streaming attention 隐藏跨层访问延迟,在 128K 上下文任务上实现了 …
Gemini for Google (GfG):用万亿 token 内部代码数据微调一个企业版 Gemini
Google 把 Gemini 在内部 29,000 名开发者身上做了端到端定制:先从 PB 级的内部代码/CI/评审系统中清洗出 ~1T token 的私有语料,再走「中段训练(midtraining) + 后训练」两段路线把 Gemini 适配到自家 Monorepo,最终在盲测 A/B 中把平均「每轮迭代数」降低…
GPU LLM Serving 也会「老化」:216 小时实证与可复现框架
UNC Charlotte 的研究团队用 216 小时、6 个共址部署、相同压力条件的对照实验,第一次实证地证明:基于 GPU 的 LLM serving 系统存在「软件老化(software aging)」现象——host 内存、device 显存、客户端延迟都会随时间出现统计显著的劣化,且老化速率强依赖于 serv…
Speculative Decoding 的可解释延迟模型:为什么加速比会随负载塌掉
本文为 LLM serving 中的 Speculative Decoding(SD)建立了一个简单且可解释的延迟模型:用 Little's Law 推出 effective batch size,并把每个请求的服务时间拆成「与负载无关 + 与负载有关」两部分,从而定量解释「为什么 SD 的加速比常常随服务器负载上升而…
TAA-k:基于尾部感知的自适应上下文选择——把 EVT 真正落地到 RAG 检索
TAAk(TailAware Adaptivek)把 Extreme Value Theory(EVT)在 RAG 自适应截断上的应用从"全局拟合"重写成"局部窗口内 EVT 验证":先用膝点检测把候选区域压成 √(N log N) 量级,再在这个窗口里跑 EVT 拟合优度检验,从而把复杂度从 O(N²M) 降到 O(…
Scaling LLM Inference Beyond Amdahl's Limits via Eliminating Non-Scalable Overheads
Albireo 通过调度 I/O 与计算的重叠,以及序列并行采样,将 LLM 推理中不可扩展部分的占比压缩到最低,从而使张量并行(TP)可以推进到更高度数,在不改变模型架构的前提下实现最高 1.9 倍吞吐量和 48% 延迟降低。 在线 LLM 服务的核心约束是:在固定 GPU 数量下最大化集群级别的服务吞吐量。张量并行…
Post-Deterministic Distributed Systems: A New Foundation for Trustworthy Autonomous Infrastructure
PDDS 提出了一种协调异构环境的分布式计算模型——在同一个系统中,确定性代码、随机模型和自主 Agent 共存——并证明经典分布式计算模型是其"零模糊特例",为下一代自主基础设施提供了理论基础。 过去四十年,分布式系统理论建立在一条核心假设之上:参与者行为是确定性的(deterministic)——正确的节点执行协议…
DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch
DeNovoSWE 提出了一套包含 4,818 个真实仓库级代码生成任务的大规模评测基准,通过沙箱化 Agent 工作流自动构建,解决了长程仓库级代码生成训练数据匮乏的核心难题;在该数据集上微调的 Qwen330BA3B 在 BeyondSWEDoc2Repo 基准上从 5.8% 跃升至 47.2%。 现有代码生成评测…
MoE-ViE:面向图像与视频理解的细粒度混合专家视觉编码器
MoEViE 把 LLM 侧的细粒度 MoE 范式搬进 CLIP 式视觉编码器,用「细粒度专家拓扑 + 无辅助损失均衡 + 帧级蒸馏 + 专用 MoE kernel」四件套,在不到稠密基线 76% 推理时延下匹配 1.7× 参数量 SOTA 编码器的零样本性能,搭配 LLM 后在多模态基准上压过激活参数多至 5× 的同…
LEGO-RL:把策略梯度塞进原生编码 Agent Harness
LEGORL 给「已经在跑 OpenHands / Claude Code / OpenCode 这种长链路编码 Agent harness」的团队一套外挂式的策略梯度 RL 训练框架,不改 harness 内部一行控制流,靠进程内 LLM proxying + 沙箱编排 + 可观测插件,把 Qwen3.535BA3B…
FAR:把数学发现流水线从「挑题」改造为「方向 → 级联 → 复核」
FAR(Find / Attempt / Recommend)提出了一种新的人机协同数学发现范式:人类输入不再是一个具体问题,而是「研究方向」;系统沿「Find 检索 → Attempt 推理 → Recommend 筛选」三级级联把 5,245 篇 combinatorics 论文过滤到 77 条送审,最终在 Dav…
打破失败级联:面向医学多模态推理的步骤感知强化学习(MRPO)
MRPO(Medical Reasoningaware Policy Optimization)是一种面向医学多模态 VQA 的步骤感知 RL 算法,它在最终答案错误时对早期无效推理步施加指数级递增的惩罚,从而把"早期一错、步步皆错"的级联失败从 64% 砍到 13%,并在 Qwen3VL8BInstruct 上反超规…