Explainers · 学术推广产出

解读

1528 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Intent-Guided Decoding:让 RAG 在 factuality 与 faithfulness 之间按用户意图仲裁
针对 RAG 中检索证据"有用 / 无关 / 误导"三类来源信任问题,2608.16515 提出 IntentGuided Decoding (IGD),用 answerlevel filtering + tokenlevel correction 双层机制,在解码阶段按用户意图在 retrieved context …
深度解读 arXiv:2608.16515 2026-08-18
主题综述 · multimodal(2026-08-18)
机制段 4 条 + 工程段 4 条 + ⚠️ 数字核验 5 处:✓ 私域五维(ip/kp/rn/fp/oc)grep 命中数:0 CJK 字数(Python re.findall 含中日韩统一表):3,413 / 实际字节 18,984 / 偏差 < 10% 综合论文:8 篇(arXiv:2608.13489 / 26…
周综述 2026-08-18
问答中面向自适应检索与推理的可解释不确定性
这篇工作从 LLM 的内部 hidden states 里直接估出两类可解释的不确定性信号——知识不足(knowledge insufficiency)和知识歧义/冲突(knowledge ambiguity/conflict),并在单次前向传播内据此决定要不要触发 RAG、要不要多走一步推理。 RAG 自从 2023…
深度解读 arXiv:2607.07380 2026-08-18
Latent-Identity Tuning:在冻结个性化模型的潜空间里做身份编辑
本文提出 LatentIdentity Tuning——在「冻结的、预训练好的」TexttoImage 个性化模型的潜空间里,找出一组有语义意义的方向向量,沿这些方向平移就能对人脸身份做局部化、细粒度、语义一致的编辑,完全不需要额外训练。 个性化 T2I(TexttoImage)模型(如 Textual Inversi…
深度解读 arXiv:2607.11885 2026-08-18
KVpop——基于预测性在线剪枝的键值缓存压缩
KVpop 用"未来注意力"作为监督信号,直接训练一个 fixedbudget 的 KV 淘汰打分器,并通过延迟记忆机制让打分器在"看完后续若干步"之后再决定保留还是丢弃,从而在 75% 和 88% 的 KV 压缩率下分别保留 Qwen34B 全注意力 98% 和 97% 的推理质量。 自回归解码阶段的 KV cach…
深度解读 arXiv:2607.05061 2026-08-18
RAEF:把 RAG 搬进单变量时间序列预测,省下微调又胜过 RAF
RAEF(RetrievalAugmented Extended Forecasting)是一种模型无关的单变量时间序列预测增强方法:把 RAG 范式从 LLM 文本场景搬到 Time Series Foundation Model(TSFM)场景,沿 RAF 路线把"输入空间检索 + 拼接聚合"两处机制替换掉 RAF…
深度解读 arXiv:2608.14054 2026-08-18
模块化认知架构在 Large Language Models 中涌现
通过对 N=46 个跨四个认知领域任务的电路级(circuitlevel)分析,本文证明 LLM 会像人脑一样涌现出功能模块化架构——同一领域任务调用重叠神经元,不同领域任务调用相互分离的神经元,提示模块化可能是智能系统的收敛性(convergent)属性,而非生物进化偶然。 神经科学的经典观察是:大脑皮层存在显著的功…
深度解读 arXiv:2608.13567 2026-08-18
Nanbeige4.2-3B 在 Apple Silicon 上的工程修复:Looped Transformer 的部署陷阱与显存压缩
一个号称能在边缘设备跑的 3B Agentic 模型,开箱即用跑不起来——5 个独立 bug 把 HuggingFace transformers 部署路径堵死;修完后又遇到 Looped Transformer 的层复用策略让 attention 显存翻倍,作者用 chunkedprefill 把 32 GiB 共享…
深度解读 arXiv:2608.13987 2026-08-18
增强并不意味着可预测:思维模型中"看起来在推理"与"真的能答对"的裂缝
面向推理的训练让模型的 trace 看起来更审慎(自我修正、假设检验、不确定性表达被放大 3–7×),但与"答对"最相关的几项行为——confidence calibration、knowledge alignment、selfawareness——反而没有被同步放大,作者把这道裂缝命名为 AmplificationL…
深度解读 arXiv:2608.13760 2026-08-18
这条引用是否切中要点?——命题级法律引用核验的失败模式
把"虚假引用"与"不切中命题的引用"拆开看,现有 LLM 在前者上几乎满分(93–100%),在后者上却只对一半多一点(37–83%),而且规模与推理努力都填不平这条裂缝。 2023 年 Mata v. Avianca 案让全行业第一次意识到"LLM 编造虚假引用"的危害——两位律师向纽约联邦法院递交了一份含六个虚假判…
深度解读 arXiv:2608.12571 2026-08-18
Apodex Discovery:用于评估与构建探索型 AI 的现实基准与环境
本文提出 Apodex Discovery 框架,把"探索型 AI"(discoverative AI)从 benchmark 走向真实工程级验证:在 561 个行业 / 16 个领域里筛出 423 个真实高价值问题、首发 20 个,再用统一的 environmenttaskepisode 抽象 + TRACES 固定…
深度解读 arXiv:2608.11341 2026-08-18
Agent 抓 Agent:临床多 Agent 系统中的捷径级联与 Benchmark 作弊
在六个公开临床数据集(文本/影像/表格三类)上的七个 cohort 中,作者系统证明:Gemini 多 Agent 委员会能单独抵御浅层提示(flip 5–16%)但无法抵御"社交合理"的捷径——当两位同伴坚持同一错误答案时,待测 holdout 在 38% 的情况下会跟随错误,而这种作弊在 benchmark 上几乎…
深度解读 arXiv:2608.03744 2026-08-18
为什么 GPT-4 解"24 点"比登天还难,让它"在心里下三盘棋"就能 74% 一次过?——Tree of Thoughts 把"思考"从一条线变成了一棵树
你有没有这种感觉: 你让 GPT4 玩 24 点 —— 给定 4 个数字,用加减乘除算出 24。 它直接答:"4×4+4+4 = 24" ❌(用了三个 4,题目只给了一个 4) 你说"一步步想"——它写出推理链,但一条路走到底,中间错了也不知道回头。 这是 2023 年所有"思维链"(ChainofThought)方法…
科普版 arXiv:2305.10601 2026-08-18
为什么 AI Agent 写代码一错再错,你只要告诉它"你刚才又错了",它就能自己改对?——Reflexion 把"反思"做成了 agent 的肌肉记忆
你有没有这种感觉: 你让 ChatGPT 写一个 Python 函数,它第一次写错了。 你说"不对,你再想想",它改了。 又错了,你说"还是不对",它又改。 第 5 次终于对了——但前 4 次的"错在哪",它一个都没记住。 下次遇到类似问题,它又从第一次错的版本开始重来。 这是 2023 年所有 LLM agent 的…
科普版 arXiv:2303.11366 2026-08-18
2608-14210
date: 20260818 round: R2 arxiv: source: /shared/videokb/scripts/tom/20260818_R2_legalraghallucinationclaimlevelshortvideoscript.md 标题:法律 RAG 假前提命中注定高幻觉 目标观众:LLM…
视频脚本 arXiv:2608.14210 2026-08-18
Code Llama: Open Foundation Models for Code
Code Llama 是基于 Llama 2 构建的代码大模型家族,在开源模型中刷新 SOTA,支持代码补全、代码填充(infilling)、长上下文(100k tokens)和指令跟随,7B 参数版本即可超越参数量大 10 倍的通用模型。 2023 年下半年,开源代码模型普遍落后于闭源 GPT4/ChatGPT,且存…
深度解读 arXiv:2308.12950 2026-08-18
Beyond the Imitation Game: BIG-bench——把 LLM 的能力与局限画成一张可外推的地图
BIGbench 用 204 个任务、横跨模型规模从百万到千亿参数的系统性评测,回答了一个根本问题:语言模型的能力到底能不能随规模"涌现",哪些任务真的会"跳变",哪些只是平缓爬升。结论是:性能与校准都随规模提升,但绝对水平在大多数任务上仍然很差,且可预测性远好于大家以为的"涌现神话"。 2021 年 GPT3 之后,…
深度解读 arXiv:2206.04615 2026-08-18
GPT-4 在医学挑战题上的能力评估:当通用 LLM 超过医学专才
微软研究院团队用 USMLE 官方练习题与 MultiMedQA 基准系统评估 GPT4,证明未经任何医学专门微调的通用大模型,以零样本提示即可在 USMLE 上超过及格线 20 分以上,并击败针对医学知识专门微调的 MedPaLM,更关键的是置信度校准显著优于 GPT3.5——这是一次"通用智能 领域专才"的标志性实…
深度解读 arXiv:2303.13375 2026-08-18
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMemVLA 把历史经验统一编码进 VLA 的连续潜空间,把"短期/长期双库记忆 → 检索 → 压缩 → 编织进当前推理流"做成一个端到端框架,让长时序、强时间依赖的操作任务能在固定上下文内完成。 主流 VisionLanguageAction(VLA)模型在预测动作时基本沿用 Markov 假设——只看当前 ob…
深度解读 arXiv:2607.07608 2026-08-18
Soofi S 30B-A3B:主权开源的德英混合 Mamba-Transformer 基础模型
Soofi S 30BA3B 是一个 30B 总参 / 3B 激活参的 MoE 混合 MambaTransformer 德英双语基础模型,预训练约 27T token,推理时上下文增长几乎不涨 KV cache,主打"主权 + 长上下文 + 高并发"的开源部署场景,并在 17 个开源基线中拿下最佳代码分和欧洲主权模型第…
深度解读 arXiv:2607.09424 2026-08-18
CtrlVTON:把虚拟试穿从"贴图"变成"可控编辑"
CtrlVTON 把虚拟试穿(VTO)从"把衣服贴到人身上"重构为带分割掩码作为像素级控制信号的图像编辑问题,配合一个新任务 VIPSeg 与新模型 VIPSAM,让用户第一次能真正指定衣服的松紧、穿法(塞 / 不塞、开 / 合)与在身体上的空间位置,并在布局忠实度上超过最强的商用编辑系统。 过去几年的 VTO 已经能…
深度解读 arXiv:2607.09362 2026-08-18
深度强化学习评估与设计范式的原理性分析:当"更好"未必更好
这是一篇 AAAI 2026 的元分析(metaanalysis)论文:在理论上证明 深度强化学习算法的渐近性能排名与数据规模之间不存在单调关系,并通过大规模实验证实——过去一整支 DRL 研究线在经典设计与评估范式下得到的结论是错的。论文给出 DRL 领域关于 scaling、容量、复杂性的核心分析框架。 DRL 领…
深度解读 arXiv:2607.07769 2026-08-18
AgentKGV: 面向知识图谱事实核查的智能体 LLM-RAG 框架与两阶段训练
AgentKGV 通过动态路由 + 迭代查询改写 + 两阶段(蒸馏 SFT + 轨迹级 GRPO)训练,让小模型也能准确核查工业级知识图谱三元组,并将检索调用次数降低近一半。 知识图谱(Knowledge Graph)大规模自动构建后,往往包含大量错误三元组——来源嘈杂、NLP 抽取失败、句子歧义都会引入虚假事实。工业…
深度解读 arXiv:2607.09092 2026-08-18
PanoWorld:全向世界模型的长程记忆与轨迹控制
PanoWorld 利用 360° 全景表示的旋转等变性(rotationequivariant),将相机轨迹简化为固定朝向的平移,通过 DPRC(稠密全景射线条件)与 GMA(几何感知记忆增强)模块解决全景世界模型中的长程记忆与物理一致性问题。 世界模型(World Model)是机器人在真实环境中做规划和模拟的基础…
深度解读 arXiv:2607.09661 2026-08-18
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
VLM 在误导性图表面前容易"被视觉欺骗所骗"——将倒置坐标轴、截断数据、异常视觉结构误读为正常;ChartCynics 用"怀疑式推理"双路径范式将感知与验证解耦,在 Qwen3VL8B 基础上提升约 29%,在两个 Benchmark 上分别达到 74.43% 和 64.55%,超越所有专有 SOTA 模型。 Ch…
深度解读 arXiv:2603.28583 2026-08-18
你的 AI 旅行 Agent 会为你预订一场斗牛:面向前沿 AI 模型隐式动物福利的 Agent 评测基准
TAC(TAC) 是首个面向 Agent 场景的隐式动物福利评估基准,通过 52 个测试场景(覆盖 6 类动物)发现主流前沿模型在旅行预订任务中系统性倾向选择有害选项,加入伦理身份提示词后福利率从 32% 跃升至 80%,揭示了 LLM 在 Agentic 设置下价值对齐的新挑战。 先前研究已通过问答 Benchmar…
深度解读 arXiv:2606.18142 2026-08-18
RESOURCE2SKILL:从人类创建的多模态资源中蒸馏可执行 Agent 技能
RESOURCE2SKILL 提出将教程视频、代码仓库、文章和参考制品等人类多模态资源,通过统一的蒸馏框架转化为软件 Agent 的可执行技能,构建为层次化多模态 Skill Wiki,在 7 个实际创作领域平均提升 11.9 个百分点,显著优于强基线方法。 当前软件 Agent 的技能库(Skill Library …
深度解读 arXiv:2606.29538 2026-08-18
让 AI 看病这件事,2022 年 Google 第一次严肃做对了——为什么 Med-PaLM 把「医学 LLM 评估」从「选择题正确率」升级到「人类医生打分」是真的封神
你有没有想过 🤔: 当你今天用 ChatGPT 问「我吃了布洛芬能不能喝酒」「孩子发烧 39 度要不要去医院」,得到一段看起来专业、看起来面面俱到的回答—— 你真的信吗?这回答有没有漏掉禁忌症?有没有把偏方说成主推?会不会因为太「礼貌」把医生本该拒答的边缘问题「圆回去」? 这件事在 2022 年底之前,整个 AI 圈没…
科普版 arXiv:2212.13138 2026-08-17
ChatGPT 自己「主动去查 Google」之前一年,已经有一篇论文让 AI「自己教自己用计算器」——为什么 Toolformer 是 Agent 时代的「地基」
你有没有想过 🤔: 今天的 ChatGPT、Claude、Gemini,主动帮你查实时天气、调计算器算 17×23、打开数据库跑 SQL,这件事看起来理所当然—— 但它们都是「主动」调用的,不是你一步一步指挥的。 让 AI 学会「自己决定什么时候该用工具、该用哪个工具、参数怎么填」——这件事真正被一篇论文工程化地跑通,…
科普版 arXiv:2302.04761 2026-08-17
StudioRecon:低重叠稀疏相机下的 4D 人体场景重建
StudioRecon 将背景与人体的三维表示解耦,通过视频扩散模型合成数百个可控视角的新视角图像来增强背景监督,并结合跨视角身份关联和多视角关键点三角化,实现仅用 4~N 台稀疏低重叠相机完成 SOTA 质量的 4D 人体场景重建。 当前高保真动态人体捕捉依赖密集相机阵列(数十到数百台),在影棚级专业环境中效果出色。…
深度解读 arXiv:2607.09125 2026-08-17