解读
1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Reflexion:让 LLM Agent 通过"语言反思"自我强化,不更新权重
引用:Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan, Shunyu Yao,"Reflexion: Language Agents with Verbal Reinforcement Learning",…
HarnessEval-W:把 LLM 的 harness 范式搬到世界模型评测
把 LLM 评测里成熟的 harness 范式(orchestrator + 子 agent + 证据链)引入视觉世界模型(world model)评测:用一个父 agent 把评测任务拆解为可测子问题,为每个子问题派发配备专门 context 与诊断工具的子 agent,父 agent 收集证据并汇总成 verdic…
GRIP:靠「信息受限前提」做接地推理
在 RAG 系统中用一个对证据施加「强随机瓶颈」、对 query 保持全维访问的容量不对称机制,强制证据通道只编码「query 中没有的残差信息」,从而把 query潜变量互信息从 14.8 bits 压到 0.47 bits(≈30×),在 5 个推理基准上超过强迭代基线,幻觉率降低 73%。 RAG 长期被诟病的隐…
DSPrompt:动态软提示抵御 M-RAG 投毒
在冻结的多模态 retriever 的视觉与文本编码器各层插入若干可学习 soft prompt,按浅→深的 length schedule 分配,并用一个在线多模态攻击者与防御者做动态 minmax 对抗训练,让 defended encoder 的 embedding 直接重塑,不修改检索管道、几乎不增加推理开销(…
Hyper-M2RAG:用超图重写多模态 RAG 的检索与对齐
HyperM2RAG 把多模态 RAG 的"图"从二元简单图换成超图(hypergraph),把跨页/跨模态的 N 元关联作为一等公民建模,并配套"锚点驱动的增量精修(Anchordriven Incremental Refinement)"避免全页重建;论文已被 ACM MM 2026 接收,代码开放在 github…
AnyTalk:用视频生成模型驱动任意角色的语音动画
AnyTalk 把"语音驱动 3D 面部动画"这件事从"必须为每个角色采集专属动画数据"重写成"拿一个预训练视频扩散模型 + 一次角色化微调即可",核心是 CsF(Characterspecific Finetuning,用静音渲染图微调)+ blendshape 反向优化,并蒸馏出可实时推理的 AnyTalk_RT;…
注意力把潜变量"聚拢"到可读形态:对 Global Workspace 的实证反驳
用 Jacobian lens 与一个五臂共享上下文基准,在开放权重 LLM 上找不到"决定哪些表征被读出"的显式门控;真正把潜变量从上下文搬到 query 位置的,是中段层 64layer hybrid 与 62layer dense 同款相对深度处发生的 attentionmediated gathering——一…
FreeToken:把消费级 GPU 变成 frontier-scale MoE 的弹性推理平台
FreeToken 是一个边缘原生(edgenative)的 MoE 推理系统,把"个人机器"视为一个统一弹性推理平台而非"小一号的数据中心 GPU",通过连续地把模型状态与计算映射到机器实际暴露的异构资源上,让 8GB 笔记本 GPU、单卡工作站、消费级游戏台式机这些边缘硬件分别能跑 35B / 284B / 753…
Intent-Guided Decoding:让 RAG 在 factuality 与 faithfulness 之间按用户意图仲裁
针对 RAG 中检索证据"有用 / 无关 / 误导"三类来源信任问题,2608.16515 提出 IntentGuided Decoding (IGD),用 answerlevel filtering + tokenlevel correction 双层机制,在解码阶段按用户意图在 retrieved context …
问答中面向自适应检索与推理的可解释不确定性
这篇工作从 LLM 的内部 hidden states 里直接估出两类可解释的不确定性信号——知识不足(knowledge insufficiency)和知识歧义/冲突(knowledge ambiguity/conflict),并在单次前向传播内据此决定要不要触发 RAG、要不要多走一步推理。 RAG 自从 2023…
Latent-Identity Tuning:在冻结个性化模型的潜空间里做身份编辑
本文提出 LatentIdentity Tuning——在「冻结的、预训练好的」TexttoImage 个性化模型的潜空间里,找出一组有语义意义的方向向量,沿这些方向平移就能对人脸身份做局部化、细粒度、语义一致的编辑,完全不需要额外训练。 个性化 T2I(TexttoImage)模型(如 Textual Inversi…
KVpop——基于预测性在线剪枝的键值缓存压缩
KVpop 用"未来注意力"作为监督信号,直接训练一个 fixedbudget 的 KV 淘汰打分器,并通过延迟记忆机制让打分器在"看完后续若干步"之后再决定保留还是丢弃,从而在 75% 和 88% 的 KV 压缩率下分别保留 Qwen34B 全注意力 98% 和 97% 的推理质量。 自回归解码阶段的 KV cach…
RAEF:把 RAG 搬进单变量时间序列预测,省下微调又胜过 RAF
RAEF(RetrievalAugmented Extended Forecasting)是一种模型无关的单变量时间序列预测增强方法:把 RAG 范式从 LLM 文本场景搬到 Time Series Foundation Model(TSFM)场景,沿 RAF 路线把"输入空间检索 + 拼接聚合"两处机制替换掉 RAF…
模块化认知架构在 Large Language Models 中涌现
通过对 N=46 个跨四个认知领域任务的电路级(circuitlevel)分析,本文证明 LLM 会像人脑一样涌现出功能模块化架构——同一领域任务调用重叠神经元,不同领域任务调用相互分离的神经元,提示模块化可能是智能系统的收敛性(convergent)属性,而非生物进化偶然。 神经科学的经典观察是:大脑皮层存在显著的功…
Nanbeige4.2-3B 在 Apple Silicon 上的工程修复:Looped Transformer 的部署陷阱与显存压缩
一个号称能在边缘设备跑的 3B Agentic 模型,开箱即用跑不起来——5 个独立 bug 把 HuggingFace transformers 部署路径堵死;修完后又遇到 Looped Transformer 的层复用策略让 attention 显存翻倍,作者用 chunkedprefill 把 32 GiB 共享…
增强并不意味着可预测:思维模型中"看起来在推理"与"真的能答对"的裂缝
面向推理的训练让模型的 trace 看起来更审慎(自我修正、假设检验、不确定性表达被放大 3–7×),但与"答对"最相关的几项行为——confidence calibration、knowledge alignment、selfawareness——反而没有被同步放大,作者把这道裂缝命名为 AmplificationL…
这条引用是否切中要点?——命题级法律引用核验的失败模式
把"虚假引用"与"不切中命题的引用"拆开看,现有 LLM 在前者上几乎满分(93–100%),在后者上却只对一半多一点(37–83%),而且规模与推理努力都填不平这条裂缝。 2023 年 Mata v. Avianca 案让全行业第一次意识到"LLM 编造虚假引用"的危害——两位律师向纽约联邦法院递交了一份含六个虚假判…
Apodex Discovery:用于评估与构建探索型 AI 的现实基准与环境
本文提出 Apodex Discovery 框架,把"探索型 AI"(discoverative AI)从 benchmark 走向真实工程级验证:在 561 个行业 / 16 个领域里筛出 423 个真实高价值问题、首发 20 个,再用统一的 environmenttaskepisode 抽象 + TRACES 固定…
Agent 抓 Agent:临床多 Agent 系统中的捷径级联与 Benchmark 作弊
在六个公开临床数据集(文本/影像/表格三类)上的七个 cohort 中,作者系统证明:Gemini 多 Agent 委员会能单独抵御浅层提示(flip 5–16%)但无法抵御"社交合理"的捷径——当两位同伴坚持同一错误答案时,待测 holdout 在 38% 的情况下会跟随错误,而这种作弊在 benchmark 上几乎…
Code Llama: Open Foundation Models for Code
Code Llama 是基于 Llama 2 构建的代码大模型家族,在开源模型中刷新 SOTA,支持代码补全、代码填充(infilling)、长上下文(100k tokens)和指令跟随,7B 参数版本即可超越参数量大 10 倍的通用模型。 2023 年下半年,开源代码模型普遍落后于闭源 GPT4/ChatGPT,且存…
Beyond the Imitation Game: BIG-bench——把 LLM 的能力与局限画成一张可外推的地图
BIGbench 用 204 个任务、横跨模型规模从百万到千亿参数的系统性评测,回答了一个根本问题:语言模型的能力到底能不能随规模"涌现",哪些任务真的会"跳变",哪些只是平缓爬升。结论是:性能与校准都随规模提升,但绝对水平在大多数任务上仍然很差,且可预测性远好于大家以为的"涌现神话"。 2021 年 GPT3 之后,…
GPT-4 在医学挑战题上的能力评估:当通用 LLM 超过医学专才
微软研究院团队用 USMLE 官方练习题与 MultiMedQA 基准系统评估 GPT4,证明未经任何医学专门微调的通用大模型,以零样本提示即可在 USMLE 上超过及格线 20 分以上,并击败针对医学知识专门微调的 MedPaLM,更关键的是置信度校准显著优于 GPT3.5——这是一次"通用智能 领域专才"的标志性实…
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMemVLA 把历史经验统一编码进 VLA 的连续潜空间,把"短期/长期双库记忆 → 检索 → 压缩 → 编织进当前推理流"做成一个端到端框架,让长时序、强时间依赖的操作任务能在固定上下文内完成。 主流 VisionLanguageAction(VLA)模型在预测动作时基本沿用 Markov 假设——只看当前 ob…
Soofi S 30B-A3B:主权开源的德英混合 Mamba-Transformer 基础模型
Soofi S 30BA3B 是一个 30B 总参 / 3B 激活参的 MoE 混合 MambaTransformer 德英双语基础模型,预训练约 27T token,推理时上下文增长几乎不涨 KV cache,主打"主权 + 长上下文 + 高并发"的开源部署场景,并在 17 个开源基线中拿下最佳代码分和欧洲主权模型第…
CtrlVTON:把虚拟试穿从"贴图"变成"可控编辑"
CtrlVTON 把虚拟试穿(VTO)从"把衣服贴到人身上"重构为带分割掩码作为像素级控制信号的图像编辑问题,配合一个新任务 VIPSeg 与新模型 VIPSAM,让用户第一次能真正指定衣服的松紧、穿法(塞 / 不塞、开 / 合)与在身体上的空间位置,并在布局忠实度上超过最强的商用编辑系统。 过去几年的 VTO 已经能…
深度强化学习评估与设计范式的原理性分析:当"更好"未必更好
这是一篇 AAAI 2026 的元分析(metaanalysis)论文:在理论上证明 深度强化学习算法的渐近性能排名与数据规模之间不存在单调关系,并通过大规模实验证实——过去一整支 DRL 研究线在经典设计与评估范式下得到的结论是错的。论文给出 DRL 领域关于 scaling、容量、复杂性的核心分析框架。 DRL 领…
AgentKGV: 面向知识图谱事实核查的智能体 LLM-RAG 框架与两阶段训练
AgentKGV 通过动态路由 + 迭代查询改写 + 两阶段(蒸馏 SFT + 轨迹级 GRPO)训练,让小模型也能准确核查工业级知识图谱三元组,并将检索调用次数降低近一半。 知识图谱(Knowledge Graph)大规模自动构建后,往往包含大量错误三元组——来源嘈杂、NLP 抽取失败、句子歧义都会引入虚假事实。工业…
PanoWorld:全向世界模型的长程记忆与轨迹控制
PanoWorld 利用 360° 全景表示的旋转等变性(rotationequivariant),将相机轨迹简化为固定朝向的平移,通过 DPRC(稠密全景射线条件)与 GMA(几何感知记忆增强)模块解决全景世界模型中的长程记忆与物理一致性问题。 世界模型(World Model)是机器人在真实环境中做规划和模拟的基础…
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
VLM 在误导性图表面前容易"被视觉欺骗所骗"——将倒置坐标轴、截断数据、异常视觉结构误读为正常;ChartCynics 用"怀疑式推理"双路径范式将感知与验证解耦,在 Qwen3VL8B 基础上提升约 29%,在两个 Benchmark 上分别达到 74.43% 和 64.55%,超越所有专有 SOTA 模型。 Ch…
你的 AI 旅行 Agent 会为你预订一场斗牛:面向前沿 AI 模型隐式动物福利的 Agent 评测基准
TAC(TAC) 是首个面向 Agent 场景的隐式动物福利评估基准,通过 52 个测试场景(覆盖 6 类动物)发现主流前沿模型在旅行预订任务中系统性倾向选择有害选项,加入伦理身份提示词后福利率从 32% 跃升至 80%,揭示了 LLM 在 Agentic 设置下价值对齐的新挑战。 先前研究已通过问答 Benchmar…