解读
1543 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
PrivacyPeek:审计 LLM Agent「拿到了什么」,而不只是「说了什么」
PrivacyPeek 把 LLM Agent 的隐私审计视角从「输出/动作泄漏」前移到「采集阶段过度获取」,在 10 个 Agent / 4 个模型族 × 1182 个 case × 7 类采集行为 × 16 个应用域上证明:过度获取在主流 Agent 中普遍存在,且任务完成能力越强反而泄漏越严重,prompt 级防…
SimWAM:把视频生成器请下"推理席",只让它当"陪练"
一句话结论:SimWAM 用一个冻结的预训练视频专家 + 一个轻量动作专家做联合流匹配训练,推理时丢弃视频分支、只剩一个自包含的轨迹规划器;在 NAVSIM 上拿到 91.5 PDMS,延迟显著低于既有 WAMbased 规划器,并 zeroshot 迁移到 nuScenes。 自检:机制 3 段(联合流匹配 / 隔离…
PHOENIX:把"会说话的医生"塞进鞋盒大小的卫星
一句话结论:PHOENIX 用一个跑在星载嵌入式电脑上的 finetuned Small Language Model + 6 个地面 AI Agent,实现 CubeSat 的预测性自愈与多 Agent 指令回注;在 96 分钟轨道周期里把 85 分钟的"地面失联窗口"变成可观测、可恢复的自治时段。 自检:机制 3 …
主题综述 · engineering(2026-08-05 · v2 重写版)
重写说明:v1 版定位偏移——本应作为"对 20260805 engineering 主题的独立深度综述",实际却是 6 处 inbox/jay 私域路径 + 12 处团队内实例显式署名 + 16 处活文档 §节点号密集引用 + 私域活文档路径 1 处的私域污染叠加(v1 私域污染 SUM = 34,居 804 ~ 8…
YOLO-PEFT:在 YOLO 上做 PEFT 不是「挪一下 LoRA」那么便宜——结构感知的可审计规划器
把语言模型那一套 PEFT(LoRA / Adapter / RSLoRA)原样搬到 YOLO 系列实时检测器上会静默失败——异构算子和检测头组件让 adapter 插入位置有硬约束;YOLOPEFT 把这个约束建模成显式的 constraintplanning 问题,要么给出可审计的预算化 targetmodule …
Do AI Personas Grow?:LLM Agent 在「人生事件」后的性格漂移测得出来,但只能漂到「均值」
用 Big Five 作为心理锚,对 14 个 LLM 测了 11 类人生事件后的性格漂移:方向(变大/变小)能学到一些,但幅度普遍低于人类真实 effectsize,跨人格的散布被人为压缩 34 倍;作者把这件事量化为 BFIAdapt benchmark,并指出当前 PCAgent「会演人类性格的均值,但演不出形状…
主题综述 · multimodal(2026-08-10)
2026 年 78 月的多模态研究已经从「单点架构比拼」过渡到「范式合流」:原生多模态(natively multimodal)、世界模型(world model)与视觉语言动作模型(VLA)三条主线在同一批论文里反复互引。本综述以「开源权重原生多模态基座 → VLA / 世界模型具身 → 多模态评测与生成质量 → 鲁…
单模型自预测误差:双向扩散模型的「往返一致性」检测
用一个统一的条件潜空间扩散模型,通过一个 direction 标志同时学会「时间正向」和「时间反向」推演,再把「前推 i 步 + 反推 i 步」的位移 C_i 当作自监督误差信号——无需 ensemble、无需保留数据、无需已知动力学方程,就能在推理时量化自回归长 rollout 的不可观误差,并把不可逆性转化为「可被…
MLLM 能解码「创造性跳跃」吗?C4:中文成语跨概念创造性评测框架
把「跨概念理解(crossconcept understanding)」这一创造性认知能力形式化成 crossconcept encoding(构题)+ crossconcept decoding(解题),针对中文成语的「跨概念隐喻」构造出 C4 评测框架与 C4Eval 基准(合成 184 + 人工 37 个跨概念成…
当「特权指导」错位:多轮 Agent 的状态匹配路由与上下文自蒸馏
针对多轮 Agent 的 privileged onpolicy distillation,论文把「学生走到了参考轨迹未覆盖的状态」这件事命名 statereference mismatch,并提出 SMRCSD:每一步先用执行状态做匹配检查(StateMatched Routing),匹配上时再用参考轨迹构造「状态条…
你跟 AI 聊得越久越贵?——Zero-Mem:让"AI 记性"这件事一分钱都不用花
你有没有算过这笔账 💸: 你跟某个 AI 助手聊了 100 轮,每次它"记住"你说的话,都要额外调用一次大模型做摘要—— 这一调用就是几百到几千 token 的成本,还有几百毫秒的延迟。 对话越长,"记性"越贵。 更糟的是:摘要常常把原话改写成"差不多意思"——你要找"上次我说哪句话来着",它答不出原句。 arXiv …
AI 终于"长记性"了?——Metis:把记忆能力从外挂硬盘搬进模型大脑
你有没有这种感觉 🧠: ChatGPT 跟你聊得很热,但你下周开新对话,它真的不记得你——你上次提的项目、你的写作习惯、你说过"我对花生过敏"——全部归零。 今天所有 AI 产品都用同一套笨办法对付这个问题:"外挂硬盘"——把对话存在一个外部数据库里(向量库、KV 缓存、笔记系统),下次对话时再检索回来塞进 promp…
视频选题榜 2026-08-10
· RST (Recursive Synthetic Terminal Tasks) · 递归合成 37K terminalagent 任务 · 4 数量级降价到 $0.05/task · round=R1 · RoundTrip Consistency · 双向扩散单模型自检 rollout 误差 · 自监督免测量 …
主题综述 · risk(2026-08-10)
2026 年 8 月,AI 系统级风险研究已经从"对齐税 + 单次注入攻击"扩展为四线并行的成熟子领域:(1) AI Agent 安全访问控制与隐私获取泄露全链路;(2) LLM 工具/MCP/记忆栈的供应链层攻击与签名执行;(3) 前沿模型对齐从 RLHF/RLAIF 转向宪法式中训练 + 参数化外部记忆以降低对齐税…
训练策略优化的幻象:单调推理策略才是 LLM 强化学习的真正目标
这篇论文指出了 LLM RL 后训练里一个被忽视的目标错位——训练引擎里"更好的策略"并不等于推理引擎里"更好的策略"——并提出了新的优化目标 MIPI(Monotonic Inference Policy Improvement)与两步实现 MIPU(Monotonic Inference Policy Update…
Beyond IID:表格基础模型真的有那么通用吗?
本文推出 BeyondArena——第一个面向表格数据(tabular data)的统一整体基准,支持 IID / 时序(temporal)/ 分组(grouped)三类任务,覆盖样本量与特征维度的多个尺度,并包含含文本字段、高基数特征的多样化特征类型;同时开源配套工具 Data Foundry(Python 框架 +…
Agentic Abstention:Agent 真的知道什么时候该停手吗?
论文正式定义并系统研究了「Agentic Abstention(代理式弃答)」这一序列决策问题:在多轮工具调用场景中,LLM Agent 何时该停止行动、承认任务不可完成;并提出一种不更新模型参数的上下文工程方法 CONVOLVE,把成功轨迹蒸馏为可复用的停止规则。 现有 LLM Agent 的评测几乎只奖励「完成任务…
ILLUME-X:照亮统一多模态的自由形式图文交错生成
ILLUMEX 提出一种统一多模态范式,通过「扩展训练数据管线 + 渐进式训练 + 自适应目标」三个组件,在自由形式(自由长度、自由顺序)的图文交错生成上显著优于现有统一模型,并配套提出 ILScore 综合评测指标;论文已被 ECCV 2026 接收。 现有的图文生成模型大致分两类: 扩散类(Stable Diffu…
DuoMem:双空间蒸馏让 4B 端侧模型跑出 72B 记忆 Agent 的水平
DuoMem 提出「上下文空间 + 参数空间」双轨蒸馏,把大型 LLM Agent 在多轮任务中的程序化求解能力迁移到 4B 学生模型;在 ALFWorld 上,4B 模型的任务成功率从 4.3% 跃升到 77.9%,逼近 72B 教师(87.1%),且推理速度快 3 倍以上,可在边缘设备实时部署。 记忆增强型 Age…
从检测到行动:用 LLM Agent 桥接工业故障检测与容错控制
这篇论文给"工业过程控制"加了一个LLM Agent 中间层:把故障检测器(FDI/FTC 中的 Detection 模块)的报警转成约束感知的恢复动作,并用数字工厂孪生 + Graph RAG 在下发到 PLC 之前先仿真验证,避免了"LLM 直接控制物理设备"的不可控风险。 工业过程控制系统里,长期存在一个工程痛点…
QVal:低成本评测长 horizon LLM Agent 的密集监督信号
QVal 提出一个免训练的评测底座,把"密集监督信号"与"训练管线"彻底解耦:直接衡量信号对参考策略 Q 值的排序一致性,发现简单 prompting 基线系统性击败近年文献里"花哨"的密集监督方法,且表现按方法家族聚类——一句话,密集监督这一整片研究领域的主流假设("复杂信号 = 更好的信号")并不成立。 当 LLM…
一个场景,两种深度:探究单目基础模型中的几何歧义
同一透明场景的同一条相机光线可以合法地穿过前景玻璃、落在背景上,但主流单目深度估计模型对"深度该落在哪一层"各有偏好——这并非错误,而是深度监督本身引入的约定俗成。 Monocular depth estimation(单目深度估计)将 3D 世界压缩为每个像素一个深度标量。然而在透明场景中,同一条光线可以同时穿过前景…
MuSViT:面向乐谱表示的基础视觉模型
MuSViT(Music Score Vision Transformer)推出乐谱领域首个基础视觉骨干:用 Masked Autoencoders(MAE)在 IMSLP 970 万页乐谱上预训练 ViT,并通过合成数据 → 真实数据的两阶段课程,最终在四个下游任务(整页/谱表级识别、乐谱符号检测、谱面难度分类)的线…
ZooClaw-FashionSigLIP2:面向稳健时尚检索的蒸馏微调
在通用视觉语言编码器(SigLIP2base)上做全面微调+知识蒸馏,再用 WiSeFT 权重插值与原始模型融合——这条简洁的技术路径,在时尚检索任务上同时击败了 LoRA、更大骨干网络(最高 1B 参数)以及外部训练数据。 视觉语言模型(VLM)做检索的本质是让图像和文本映射到同一个 embedding 空间,然后计…
AI-Infra-Guard:面向多层 Agent 红队测试的统一框架
AIInfraGuard 是一个开源 AI 红队框架,提出"攻击面是分层的"这一核心观察,将 AI Agent 的攻击面分为基础设施层 / 协议与工具层 / Agent 行为层 / 模型层四层,每层匹配最合适的检测范式(确定性规则、LLM 智能体审计、多轮黑盒红队、越狱工具链),并号称是当前唯一同时覆盖 Agent S…
SHIFT:门控调制激活引导,用于 RAG 中的知识冲突缓解
SHIFT 将 RAG 系统中"检索到的上下文"与"模型参数记忆"之间的知识冲突,从直接修改神经元转变为学习一个轻量门控模块(< 0.01% 可训练参数),让 LLM 在生成时自适应地调配内部激活,决定该信上下文还是信记忆。 RAG 系统依赖两个知识来源:Parametric Knowledge(存储在模型参数中的知识…
为什么 GPT-3 解不了小学数学题,加一句"让我们一步步想"就突然开窍了?——CoT Prompting 把"推理"从训练阶段搬到 prompt 阶段
你有没有遇到过这种时刻 🤔: 你问 GPT3(2020)一道小学数学题—— "小明有 12 个苹果,给小红一半后又买了 3 个,现在有几个?" 它直接答:"12"(错了) 你在 prompt 里加一句"让我们一步步想"—— 它忽然写出: "原来 12 个,给一半剩 6 个,又买 3 个 = 9 个" ✅ 这是 2022…
你手机里的输入法,是怎么在不偷看你聊天记录的前提下学会你的习惯的?——FedAvg 把"数据不出端"的联邦学习从概念变成算法
你有没有想过 🤔: 你每天在手机键盘上敲出的字,可能从来没离开过这台手机—— 但第二天,Gboard 还是更懂你了; 你用 iPhone 拍照、相册自动分类,苹果从不上传你的照片; 医院想联合几家训练癌症筛查模型,原始病历不能出院; 银行做反欺诈,客户交易明细绝对不能出库。 这些场景里,"数据不能动"是硬约束。但 AI…
PaLM:用 Pathways 扩展语言建模至 540B
Google 用 Pathways 系统在 6144 块 TPU v4 上训练了一个 540B 密集激活 Transformer(PaLM),在数百项语言基准上以少样本学习的方式刷新 SOTA,并在 BIGbench 上首次让模型平均得分超越人类。 2022 年初,LLM 赛道有两条明显的工程痛点: 1. 规模上限:G…
Visual Instruction Tuning(LLaVA)
Liu 等人首次用 GPT4 生成的语言图像指令微调数据 把一个视觉编码器(CLIP ViTL/14)与一个大语言模型(LLaMA)拼成端到端可训练的视觉对话助手 LLaVA,并在合成多模态指令集上以相对分 85.1% 逼近 GPT4。 2023 年春天多模态 LLM 赛道正卡在一个真问题:视觉语言对齐≠视觉指令跟随。…