解读
1524 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
LLM Agent 安全综述:威胁面、攻击、防御与评估
这篇综述把 247 篇 LLM Agent 安全相关文献串成一张以"信息流 × 委托权限 × 持久状态"三轴为骨架的全景图,论证当下 prompt injection 与工具劫持仍是主战场,但状态污染与多 Agent 传播正在变成新的核心风险,而防御层彼此割裂、benchmark 又偏理想化,呼吁把 Agent 安全当…
用图增强的大语言模型做空间检索:当 RAG 走出文本框
声明:本解读基于公开 arxiv 摘要页(abs/2606.22909)与所属分类(cs.DB / cs.AI / cs.IR)。论文卡在仓库内暂缺,所有具体数字若未在摘要中给出,标注"原文未明确"。 把 LLM 当成"提问者"、把空间数据库当成"回答者",用图结构(Rtree、邻接表、知识图谱)作为中介,让自然语言问…
LISA:把"侧支网络"对齐到似然分数——视觉条件可控生成的加速器
声明:本解读基于 arxiv 公开 HTML 版(arxiv.org/html/2606.27192v1)的摘要与第 1–3 节,未下载 PDF、未运行代码。具体 FID / 用户研究等实验数字若未在上游页面给出,标注"原文未明确"或仅引用文中已经明文的指标(如图 1 的 2.78× 收敛、decoder 约 0.1%…
参数高效的量子启发快速权重编程器用于流量矩阵预测
本文把"门控量子启发的 KolmogorovArnold 网络快速权重编程器"(GQKANFWP)搬上网络流量矩阵(Traffic Matrix, TM)预测任务,在只使用较大 LSTM 22.4% 参数量的前提下,于 Abilene 数据集上拿下最低的 pooled RMSE,并在通道级别取得明显多于 LSTM 的"…
LLM Agent 综述:LLM 作为通用智能体的崛起与潜力
这篇 86 页综述(Xi et al., 复旦 NLP 实验室,arXiv:2309.07864)系统梳理了"基于大语言模型的智能体(LLMbased Agent)"这一方向:先追溯 Agent 概念从哲学到 AI 的演变,再提出"大脑感知行动"统一框架,最后覆盖单 Agent、多 Agent、人机协作、Agent 社…
Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Tasks
Claude Opus 4.6 与 GPT5.4 xhigh 等顶级 Coding Agent,在面对生僻编程语言时,不是硬写目标语言代码,而是用 Python 生成目标语言代码(metaprogramming)——禁止这一策略后性能骤降,揭示了现有评测体系对真实能力的遮蔽。 主流 Coding Agent 评测(SW…
理解环境感知信息检索:让 LLM 为不同 retriever 学会"换一种提问方式"
针对 RAG 中"同一个 query 用不同 retriever 效果差异巨大"这一长期被忽视的问题,本文用强化学习(RL)系统训练 LLM 为不同 retriever 学习差异化的 query 改写策略,并提出 branching rollout 提升多步检索的训练稳定性,是"retrieveraware RAG"的…
Context-Aware RL for Agentic and Multimodal LLMs(上下文感知的强化学习,用于 Agent 与多模态大模型)
ContextRL 提出一种"上下文二选一"的间接辅助强化学习目标:让模型在"查询 + 答案 + 两个高度相似的上下文"之间选出真正支撑该答案的那一个,从而把"细粒度证据感知"写进 reward,平均在 5 个长周期基准上较 GRPO 提升 +2.2%、在 12 个 VQA 基准上提升 +1.8%,且增益并非来自"多了…
Primacy Bias in Multimodal Retrieval-Augmented Question Answering
多模态 KBVQA 中的检索信息并非「迷失在中间」(U 形),而是「迷失在末尾」——gold passage 放在首位比放在末位可高出 26 分,且 retrievalside 修复全部无效,闭gap必须从 reader 侧下手。 当 VisionLanguage Model(VLM)需要在超出其参数知识范围的问题上给…
Directory-Aware Query and Maintenance in Vector Databases
TrieHI 通过将目录拓扑保留为原生前缀树,使向量数据库首次实现了层级目录语义的高效递归检索与低维护成本写操作,已集成于字节跳动的开源 AI Agent 上下文数据库 OpenViking。 向量数据库(Vector DB)在现代 LLM / Agent 系统中处于核心基础设施地位——负责存储 Embedding、支…
MMLongEmbed:长上下文多模态嵌入模型的系统性基准
MMLongEmbed 把「多模态嵌入模型(Multimodal Embedding Models, MEMs)真的能消化多长的输入」这一关键问题第一次做成可量化的系统基准:通过文本、文档、视频三种模态、四类检索任务、覆盖多个上下文长度区间的评测,作者揭示了一个刺眼的事实——当前 MEMs 在长上下文下严重依赖浅层特征…
VideoRAG & V-RAGBench:视频检索的新范式——Chunk 自适应配置选择
VRAGBench 揭示了现有 VideoRAG 的两个根本问题——基准数据集无法真正评测检索(半数 Query 不用视频也能答对),且所有方法都在 Query 级别统一决定"用哪种模态和粒度"而非在 Chunk 级别自适应选择。CARVE 方法通过并行检索 + Chunk 自适应重排序,让每个视频片段用自己的"最优配…
DeLM:基于共享上下文的去中心化多 Agent 系统
DeLM(Decentralized Language Models)提出一种去中心化多 Agent 框架,用「并行 Agent + 共享已验证上下文 + 任务队列」替代中心调度器,在 SWEbench Verified 上 Avg.@1 / Pass@2 / Pass@4 全面 SOTA(相对最强基线最高 +10.5…
Agent Harness 的构成性定义:什么是、什么不是 harness
本文通过概念分析(conceptual analysis)+ 文献谱系学 + 灰文献对照,给出「agent harness」一个操作性 / 构成性定义,把它与 agent framework、agent SDK、IDE plugin、eval harness、orchestrator 一一划清边界;并用 6 个真实 h…
LLM 越来越强,但评测越来越乱——2023 年那篇被引 7418 次的综述,把"如何评 LLM"做成了独立学科
一句话核心:Chang 等人 2023 年 7 月发表的 LLM 评估综述(ACM TIST 接收,S2 引用 3700+),提出 "评什么 / 在哪里评 / 怎么评"(What / Where / How) 三维框架,系统覆盖 8 大评估任务族、200+ benchmark 的元数据,并维护持续更新的开源材料库——是…
模型"突然变聪明"是不是真的?2022 年那篇被引 7564 次的论文,给你一个诚实的答案
一句话核心:Wei 等人(Google / Stanford, 2022)把"小模型做不出、规模一大突然就能做"的能力命名为 Emergent Abilities,并用 209 个任务、4 个模型家族、近 30 个规模点的实验证据绘制了第一张"涌现地图"。但论文同时诚实写下:涌现可能是模型真获得了新算法,也可能是评测指…
视频选题榜 2026-08-22
物理结构自检(v2 模式 AD 修复):v1 402B / 5 行 / 3 entries;v2 ~17.7KB / 多行 / 8 entries;每 entry 独占一行(v1 物理 OK,v2 加固) v1 selectionradar 脱钩对账(v2 必修复 · 已 822 21:40 E2 反思棒触发时核验):…
128K 长上下文还在等"读秒开聊"?arXiv 2608.19758 把预填充加速拉到 47× 的工程真相
⚠️ 事实守约声明 · A/B/C 类划分版(20260822 反思棒重写) 本稿解读对象是 arXiv 2608.19758(FlashPrefill V2)。上一版(822 14:41 CST 产出版)系统性漏标了 3 处 C 类 agent 推断。本版(822 21:30 反思棒重写)采取 A / B / C 三…
Context-Fractured Decomposition:跨上下文多步越狱与「来源缺口」
本文揭示一种针对使用工具的 LLM Agent的部署级失效模式——「来源缺口(provenance gap)」,并提出 ContextFractured Decomposition(CFD)——一类跨上下文、多步的越狱攻击族:通过在早期交互中保留「看起来无害」的中间产物(工作区文件、日志等),在很久之后、在不同 Age…
Parthenon Law:自我演化的法律 Agent 框架
本文提出 Parthenon,一种面向法律垂直领域的"自我演化"(selfevolving)Agent 框架:把 Model / Harness / Agent 角色 / 法律 Knowledge / 确定性 Tools / 程序性 Skills 拆成可审计面,配以"反泄漏的学习循环",把失败 case 自动沉淀到 s…
OScaR:极低比特 KV Cache 量化的奥卡姆剃刀
OScaR 发现 Token Norm Imbalance(TNI)是 KV Cache 极端量化(INT2/INT4)的核心瓶颈,通过轻量级 Canalized Rotation + OmniToken Scaling 在不引入复杂训练流水线的前提下,实现了接近无损的压缩效果——解码速度提升 3.0×,内存占用降低 …
主题综述 · database(2026-08-22)
20260817 综述以 TEngineDBV / Nova 双 OLAPnative 向量一等公民 + SIGMOD 2026 Filtered Vector Search 10× 延迟差距 + DBAIOps / DBCooker / Tytan 自治运维闭环 + Agentic Transaction ACID …
M³Exam:真实用户-Agent 交互场景下的多模态记忆Benchmark
M³Exam 揭示了现有 MLLM 在真实多会话人Agent 交互中的多模态记忆缺陷:跨模态定位(crossmodal grounding)、跨会话推理(crosssession reasoning)和多模态上下文累积的效率成本是三个核心瓶颈。其提出的 M³Proctor 方法通过按需视觉消费,将准确率提升 13% 的…
AsymCache:把 KV Cache 决策摆到 GPU 注意力内核的同一张桌子上
提出 AsymCache —— 一个计算延迟感知的 KV cache 管理系统,让"哪些 block 留下、哪些 block 驱逐"的决策显式对齐 GPU 注意力内核的执行效率,相比最新基线 TTFT(首 token 时间)降 1.90–2.03×、TPOT(每 token 时间)降 1.62–1.71×,并且可以无缝…
ForeSci:把"AI 研究的前瞻判断力"做成时间受控的考卷
提出 ForeSci —— 一个时间受控的前瞻性 AI 研究判断基准,含 500 道任务、4 个快节奏 AI 子领域、4 类决策族,并配套评测了原生 LLM、Hybrid RAG、以及三种 researchagent 适配方案在 4 种骨干上的表现。显式组织证据能改善可追溯性,但增益强烈依赖决策族类型;诊断还发现一个反…
RAG 还没凉,但"烧进参数"已经能用了:arXiv 2608.20281 三段式让模型免检索问答
你有没有想过这件事 🤔: 你的公司有一份 5000 页的内部知识库——产品手册、合规条款、客服话术 你想让 AI 助手直接答员工问题,不用每次都检索 听起来很美,但每次试都会撞三堵墙: ① 模型"看过"文档但"用不上"——目标不对齐 ② 通用能力一落千丈——MMLU、IFEval 崩盘 ③ 模型能续写文档但不会"按用户…
单目视频变 4D 可重建:arXiv 2608.20335 解决了"几十视角崩塌"这个最关键的工程瓶颈
你有没有试过用手机拍一段舞蹈视频,然后想把它变成一个可以360° 任意角度自由观看的 4D 数字人?👇 你拍了一段 10 秒的街舞 → 想做出能绕着看、暂停、回放、可放 AR/VR 的"立体分身" 现在的问题不是"做不到"——视频扩散模型(可生成视频的 AI)已经可以合成新视角 但当你需要几十个目标视角(从前后左右上下…
Inject, Align, Recover:把整库文档"压进"参数的免检索后训练三段式
本文提出 IAR(Inject / Align / Recover)三阶段后训练框架,把"将一份固定的文档语料转为模型可查询的参数化知识"这件事从单段 continued pretraining 拆成"知识注入 + 答案对齐 + 通用能力回救"三道工序,在 Llama / Phi / Qwen / SmolLM 四个模…
Hierarchical Self-Improvement:让 Agent Harness 像模型权重一样被"演化"
本文提出 Hierarchical SelfImprovement (HSI),把 LLM Agent 中常被视为"部署后固定"的执行脚手架(harness)当作任务特定、持续可演化的一等公民——单个冻结的 LLM 在三个层级同时运作(任务执行 harness H、改写 H 的 evolver、改写 evolver 策…
SkillEvo:把多轮对话从"评测终点"变成"演化梯度源"
本文提出 SkillEvo,把 LLM Agent Skill 的演化反馈源从单轮 QA 评分改为多轮用户模拟——每一轮修订既消耗反馈也产生新反馈,使"演化梯度"自我更新;并用一个独立治理层替换"标量门控"的被动拒收,主动修补事实退化与结构膨胀。在 6 类云服务、9 个生产 Skill、98 个 skillrefere…