解读
1758 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
面向 AI Agent 签名工作流的硬件密钥存储:一种零信任 MCP 强制执行架构
把 AI Agent 用来签署 Git 提交、API 调用和签发证书的私钥从「软件可读取的明文」彻底迁移到「硬件不可导出的密闭容器」,并用五层零信任栈守住每一次签名意图,将注入攻击下的密钥外泄成功率从 19.3% 压到 0%。 论文开篇给出一个具体的生产事故:某个被广泛部署的 Agent 框架在不到五分钟内通过邮件注入…
TNT:用「Transformer in Transformer」在 patch 内再开一层注意力
TNT(Transformer iN Transformer)在 ViT 之外再嵌一个「子 Transformer」,先把 16×16 的 patch 当作「visual sentence」,再切成更小的 4×4「visual words」做 patch 内注意力,让 ImageNet top1 在相近算力下比同代 V…
DataSpace:在异构工作空间上做可验证表格分析的数据 Agent 基准
DataSpace 是一个让数据 Agent 在「任务本地异构工作空间」上直接产出可校验表格结果的基准:410 个跨语言任务、7439 个 artifact、合计 15.01 GB,覆盖 CSV / JSON / SQLite / Markdown / PDF / 视频等模态;六款前沿多模态模型的最佳准确率仅 66.3…
MASS:用「权威共享状态」把多智能体世界模型解耦为逻辑引擎 + 渲染引擎
MASS 把多智能体视频世界模型拆成「可学习逻辑引擎」与「可学习渲染引擎」两条独立通路,全局状态由逻辑引擎唯一权威地推进,再让渲染引擎按需为任意视角生成画面,从而在 1024 个并发玩家的 Snake 仿真里稳定推演 10000 个循环步,并显著降低跨视角不一致。 现有视频世界模型(类 Sora、Genie、GameN…
ALBERT:更轻的 BERT,用参数共享与分解换来可放大的预训练
ALBERT 用「跨层参数共享 + 词嵌入矩阵低秩分解 + 句间连贯性自监督损失」三件套,把 BERTlarge 的参数体量压到原来的约 1/10,同时在 GLUE / RACE / SQuAD 上拿到当时的新 SOTA,证明了「更大不一定要更宽更深,结构与训练目标同样重要」。 20182019 年的 NLP 战场,大…
A Structured Self-Attentive Sentence Embedding:把句子压成「可解释的 2D 矩阵」而不是「一维向量」
Lin 等人提出用「双向 LSTM + 结构化自注意力」把句子编码成 n×d 的 2D 矩阵(每一行 attend 到句子的不同部分),并用一个简单正则项防止所有行坍缩到同一关注点——既保留了可解释的「句子到底在编码什么」,又显著优于当时主流的句子向量方法,在作者画像、情感分类、文本蕴含三类任务上同时拿到增益。 201…
Chain-of-Thought Prompting:用思维链提示激发大语言模型的推理能力
说明:研究知识库 paper_cards 中该 arxiv 编号(2201.11903)被错误映射到"BNAI, NOTOKEN, MINDUNITY"标题(这是 OpenAlex/S2 enrich 流水线的 metadata 错配,OpenAlex 上 W4221143046 工作 ID 与 arXiv 2201.…
BERTScore:用 BERT 上下文嵌入评估文本生成
BERTScore 利用 BERT 的上下文嵌入计算候选句与参考句之间的 token 级余弦相似度,并通过加权的 precision/recall 调和得到 F1,与人类判断的相关性显著高于 BLEU、ROUGE、METEOR 等 ngram 重叠指标,并在对抗性释义任务上展示了更强的鲁棒性。 文本生成评估(机器翻译、…
Synthetic Data + 整体词识别:用合成数据训练神经网络识别自然场景文字
Jaderberg 等人 2014 年提出一个里程碑方案:用合成引擎生成的海量、免费的文字图像训练深度神经网络,对自然场景图片中的英文单词做整体识别。它在 ICDAR 2003、ICDAR 2013、SVT 等标准 benchmark 上大幅刷 SOTA,并确立了「合成数据 + 整体词级 CNN」作为场景文字识别(ST…
Gemini 家族:原生多模态、超大规模、首批在 MMLU 上达到人类专家水平的大模型
Google DeepMind 在 2023 年 12 月发布的 Gemini 家族技术报告介绍了 Ultra / Pro / Nano 三档规模、文本+图像+音频+视频+代码原生多模态的密集 Decoderonly Transformer。其旗舰模型 Gemini Ultra 在 32 项公开基准中的 30 项刷新 …
Gemini:Google 的原生多模态大模型家族技术报告
Google DeepMind 团队在 2023 年底发布的 Gemini 技术报告(arXiv:2312.11805)介绍了 Gemini 这一原生多模态(natively multimodal)模型家族,覆盖 Ultra / Pro / Nano 三个规模,跨图像、音频、视频、文本四种模态。最大规模 Gemini …
DataComp-VLM:面向视觉-语言模型的开源数据策划基准
DataCompVLM(DCVLM)是一个系统性 VLM 训练数据策划基准,包含 160 个数据集、6T 多模态 token,揭示了一个反直觉但稳健的结论:数据混合策略(而非数据过滤)是打造高性能 VLM 的关键,其中指令密集型混合比描述密集型混合更具扩展性优势。 VLM 的训练数据策划长期依赖经验性直觉:用什么数据、…
教导 LLM 在欠发达地区癫痫诊疗中进行推荐与转诊:MANANA 框架解读
在资源受限的乌干达儿科癫痫诊疗场景中,MANANA 通过非参数化 promptlearning 将观察到的处方错误转化为可审计的 prompt memories,结合 Bayesian prompt averaging 实现基于不确定度的自动转诊信号,在独立收集的两个乌干达验证队列上将就诊级别 top3 处方准确率提升…
A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT
将软件工程中"设计模式"的思想系统化引入 Prompt Engineering,首次为 LLM 对话总结出一套可复用、可组合、可跨域迁移的 16 种 Prompt Pattern 模板。 ChatGPT 等 LLM 在实际使用时,用户往往靠"试错"或"玄学调参"来获得好输出——没有统一术语,没有结构化方法论,不同场景的…
EnvACE:用「世界排演」把环境动力学内化到策略里的智能体强化学习方法
EnvACE 提出一种"世界排演(world rehearsal)"机制:让 LLM 智能体在训练时同时扮演「策略者」与「环境」两个角色,由同一份权重端到端优化,绕开对真实或合成可执行环境的依赖;测试时还能在真正执行前做"私有预演",相当于把环境模型折进了策略里。 LLM 智能体训练长程工具调用时,对可执行环境的依赖很…
CalibForge:用对抗式 Solver 校准来规模化生成「可学」的终端智能体任务
CalibForge 是一个自主合成"终端型 agent 任务"的系统:先用「多 solver 不一致」或「强弱 solver 对照」两种对抗信号,把候选任务校准到"强 solver 能过、弱 solver 卡住"的难度区间,从而产出 5,431 条对训练真正有信号的任务;在 TerminalBench 2.0 / S…
W2-VLA:以任务条件化的「未来腕部」潜空间增强细粒度机器人操作
W2VLA(WorldtoWrist VLA)把腕部相机从「第二个视角」重定义为「未来交互的预测对象」:先用一组任务条件化的潜建模 token 在 VLM 与腕部预测器之间建立紧凑接口,再让腕部预测器在动作决策前先在潜空间里「预演」腕部局部交互如何演变,从而在 LIBERO、RoboTwin 2.0 与真机上同时提升单…
EffectLearner:用「世界感知的对象-效应推理」重做视频物体擦除
EffectLearner 把视频物体擦除(Video Object Removal, VOR)的难点从「遮住目标」升级到「显式推理并抹除目标引发的所有因果效应」:VLMbased Reasoner 先对高亮目标视频做跨模态推理,输出紧凑的 effectaware context,DiTbased Eraser 在 m…
PaDoc:把版面预测当成「分支树」的并行文档解析器
PaDoc(Parallel Decoding Document Parser)把端到端文档解析器里的版面预测当作「共享页面表征之上的分支结构」:版面流与各区域内容流在 MLLM 内部以 packed variablelength ancestor attention 并发推进,推理时借助 vLLM 把版面 / 区域当…
Invisible Shortcuts:为什么你的视觉编码器"看见"了你的相机
视觉编码器不只在利用你看得见的偏置(物体背景、纹理),还在利用一种像素级、肉眼不可见的"元数据痕迹"——这些痕迹会编码图像处理、相机采集参数;在大规模语义监督下,模型会自发把它们转成预测特征,构成一种新的 shortcut。论文系统性制造"受控的元数据语义相关性",证明相关性越强、模型对元数据越敏感、且在分布漂移下掉点…
SmartMage:让 3D 场景理解的"模态组合"按问题动态变化
SmartMage 把 3D 场景理解里的"模态组合"从"固定套餐"改成"按问动态配菜"——通过一个 SMART 模块决定"这次该用哪几个模态"、再通过一个 MAGE 模块决定"专家该按哪种模态偏好激活",在 5 个 3D 场景理解 benchmark 上达到 SOTA,并且在只给 RGB 视频时也能在视频理解任务上保…
OSReward:给跨平台计算机使用 Agent 的轨迹奖励模型立一套「真」的标尺
OSReward 把"让 VLM 当 CUA 轨迹法官"这件事从"大家都凭印象打分"变成"有标准化 benchmark + 公开可复现的判官模型":它用一个跨平台、多阶段人工标注的真实轨迹基准,去量度现有 VLM judge 的可靠性,并据此训出 9B / 35B 的 OSShepherd 开放奖励模型,在成本比商业闭…
SegFormer:把 Transformer 编码器与轻量 MLP 解码器拧成一根绳的语义分割框架
SegFormer 用一个分层无位置编码的 Transformer 编码器配纯 MLP 的 allMLP 解码器,在 ADE20K、Cityscapes 上同时拿到比 Swin / SETR 更小的参数量和更高的 mIoU,并展示了对 CityscapesC 的零样本鲁棒性。它回答的核心问题是:Transformer …
PIMiner:用"Agent 对 Agent"智能体系统自动做提示注入红队测试
PIMiner 把"提示注入红队测试"从 RL 训练的端到端攻击器改成"在多个 (数据集, 目标 LLM) 上迭代积累策略库"的智能体系统,最终用每个样本仅 ~10 次查询就拿下 GPT5.1 / Gemini2.5Pro / ClaudeSonnet4.5 三类目标上的高 ASR,并且策略库对新目标 LLM 可直接迁…
FinanceHarness:面向金融领域的自主深度研究框架与可验证基准
FinanceHarness 提出"分层 harness + pointintime 基准"双件套:前者把金融研究 Agent 的环境/数据/执行/奖励四层工程化拼齐,后者用"前置 + 后置 cutoff"双时间窗的命题与 rubric 阻塞未来信息泄露,从而让"金融深度研究"这一通用 Agent 跑不好的任务具备可评…
Brevis:把无损张量压缩重写成程序合成
Brevis 把"无损压缩一个神经网络 checkpoint"这件事,从传统启发式编码的暗箱,重写为在可逆 DSL 上做带类型偏置的 A\ 程序搜索:先学一个"针对 checkpoint 这一类样本"的产程先验(production prior),再用它指导有界 A\ 搜出能 bitexact 重建张量的最短程序;同一…
Resume Means Resume:Agent 工作流持久化层的可机器验证一致性契约
论文把"agent 框架里到底什么算 resume?"这个长期被各框架以模糊文档糊弄过去的语义问题,形式化成 6 条核心性质 + 2 条附带义务的 RESUME CONTRACT,再用 TLA+ 对参考语义在 740 万状态空间上做穷尽模型检测(结果不变),并用一个 39cell 的故障矩阵和并发场景证伪:5 个主流框…
FocusMem:把潜在 GUI 记忆拆成"内容 / 读出 / 信任"三件套
FocusMem 把 GUI 智能体的潜在记忆 (latent memory) 拆成"该存什么 / 在不同决策阶段读出哪一份 / 这块记忆值不值得信"三个独立模块,全部用 GUI 策略冻结下的损失训练,在 5 个 GUIagent 基准上一致超越"单固定记忆块 + 下一动作监督"基线。 GUI agent 需要两段记忆…
ABSeeker:用"答案回溯"给长程搜索 Agent 做细粒度信用分配
ABSeeker 提出 AnswerBacktracked Credit Assignment (ABC):从 groundtruth 答案反推得到"中间线索集",再用线索集对轨迹里的每一步打分,把"轨迹级稀疏奖励"翻成"步骤级稠密监督",配合 ABCSFT 和 ABCGRPO,只用 8.5k 样本就能在 4B 模型上…
SIGNPOST-Bench:面向多模态大语言模型的文本-视觉冲突消解基准
SIGNPOSTBench 用"同一图像的反事实五元组"控制变量,把 MLLM 在文本与视觉证据冲突时"听谁的"这件事从猜测变成可量化诊断:在 25,555 张变体图上对 7 家厂商的 20 个 MLLM 横评后,对抗性文本注入让地理定位中位误差从 282 km 抬到 1,347 km(4.8 倍),且每个被评测模型都…