Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Self-Consistency:自洽性解码策略提升语言模型的思维链推理
SelfConsistency 是一种基于"多数投票"的后处理解码策略:让 LLM 生成多条不同的推理路径,再选择出现频率最高的答案作为最终输出。在不改变模型本身、不需要任何额外训练的情况下,该方法将思维链提示(ChainofThought Prompting)的效果提升了 17.9%(GSM8K)到 3.9%(ARC…
深度解读 arXiv:2203.11171 2026-08-02
See2Think:多模态模型真的使用了中间视觉状态吗?
多模态大模型在推理中生成草图、标注、中间图像——但它们真的依赖这些视觉状态吗?See2Think 实验答案是:高度依赖,但「faithful rendering」是最大瓶颈;且有了高反馈利用率也不一定转化为精度提升。 多模态 LLM(如 GPT4V、Gemini、QwenVL 等)在推理时越来越多地使用中间视觉状态(i…
深度解读 arXiv:2607.26769 2026-08-02
基于文件系统的 LLM 智能体记忆:组织、演进与可持续性
当前 LLM 智能体普遍用「把 markdown 文件塞进文件夹」作为长期记忆,但实验证明:这种默认方式在记忆不断增长时组织会退化、没有最强管理 Agent 就无法维持收益——而且换一套工具集对记忆结构的影响几乎和换模型一样大。 现实部署的 LLM 智能体越来越依赖文件系统记忆(filesystembased memo…
深度解读 arXiv:2607.26637 2026-08-02
Deep Research 可靠吗?误导性知识会诱发错误结论
只需在 Deep Research 检索结果中插入一篇「看起来很专业但事实错误」的文档,主流 Deep Research 系统就有超过 50% 的概率把错误结论写进最终报告——而它们自己有能力判断这是误导信息。 Deep Research 智能体(如 DeerFlow、WebThinker、Gemini Deep Re…
深度解读 arXiv:2607.20891 2026-08-02
主题综述 · llm-infra(2026-08-02)
主题:llminfra(LLM 推理与服务系统)。本综述以 20260729 → 20260802 四天窗口为主干,叠加 inbox/spark 20260802 llminfrae1prepv14 第 14 棒(HF 入侵事件 P0 立标 + 推理引擎 5 选 1 横评 + vLLM Korea Meetup PD …
周综述 2026-08-02
你公司那个 AI 助理为什么总"记错事"、甚至"嘴漏隐私"?arXiv 2603.11768 给了 3 道治理门
你有没有遇到过这种事 🧠: 你让公司 AI 助理帮你订了 3 月的机票——下个月它跟你说"我查到你 5 月要飞北京,要不要订酒店?";你让它处理一份客户合同,内容包含对方身份证号——半年后另一个项目里它突然把这条合同细节当成"历史知识"主动提了出来。 这不全是 AI 的"幻觉"——这是 AI 长期记忆系统的"腐败"。 …
科普版 arXiv:2603.11768 2026-08-02
医生没时间给 AI 标数据怎么办?一篇被引 1017 次的论文,把"不完美医学影像"玩出了 7 种解法
你有没有想过一件事 🧠: 你妈最近做了一次 CT,医生看了 5 分钟就给出报告——但要训练一个能识别"早期肺癌结节"的 AI,医生得在电脑前一格一格地把肿瘤边缘画出来。一张 3D 肺部 CT,标注要 48 小时。一个医院的肺结节数据,全部标完需要 5 个医生全职干 2 个月。 所以现实是:医学影像里"干净数据"几乎不存…
科普版 arXiv:1908.10454 2026-08-02
视频选题榜 2026-08-02
· MisKnowAgent: Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions · 注入 1 篇误导文档 FCAR 平均飙升至 54.7% · 能识别 ≠ 会拒绝的工作流层失效模式 · round=R1 · Metis:…
选题榜 2026-08-02
LLM 推理太贵太慢?——arXiv 2604.19769 把"KV 缓存淘汰"重新定义成排序问题,128K 上下文跨层流量砍 5.94 倍
你有没有好奇过一件事 🧠: 你用 GPT4、Claude、Gemini 跑 128K 长上下文任务——比如丢一整本电子书进去问"第 47 章讲了什么"——底层到底发生了什么? LLM 的推理不是"读完一整段再回答",而是一个字一个字往外蹦——每个新字都要回头看前面所有字。这个"回头看"的成本,就是 KV Cache(K…
科普版 arXiv:2604.19769 2026-08-02
多 Agent 协作还在"流水线"?——arXiv 2606.05608 用"经验驱动编排"让 GRPO 训练成本砍半,效果持平
你有没有用过那种"多 Agent 协作"产品 🛠️: 一个 Planner 拆任务,几个 Worker 各自跑,中间用 RAG 查资料——听起来很美,但跑起来又贵又慢。 问题出在哪?编排方式是"静态流水线"——任务怎么拆、谁来做、做完之后下一步谁接,全是写死的。现实任务一旦偏离预设剧本,这套流水线就懵: 上游 Work…
科普版 arXiv:2606.05608 2026-08-02
Metis · 记忆装进基础模型
20260802 R2 · Metis Memory Foundation Model arxiv: videokb 脚本原路径: /shared/videokb/scripts/tom/20260802_R2_shortvideoscript.md <! §0 字幕层不进入 标题:Metis · 记忆装进基础模型 目…
视频脚本 arXiv:2607.26760 2026-08-02
AI 写的东西为什么总是"那个味"?——一篇被引 4413 次的论文告诉你,问题不在模型,在解码
你有没有遇到过这种事? 你让 ChatGPT 写个故事,它给你——"他走在路上,突然遇到一个老人。老人对他笑了笑,说道……" 你让 AI 起个标题,它给你——"探索未来:人工智能如何改变我们的生活方式"。 你让 AI 写推荐语,它给你——"本文将介绍……的优势……分析……的重要性……" "那个味"——平淡、安全、像模板…
科普版 arXiv:1904.09751 2026-08-01
TensorFlow 这篇论文凭什么被引 11804 次?因为它写下了今天所有 AI 框架的"出生证明"
你有没有想过这件事? 你今天跑的 PyTorch 模型、你在手机上用的语音识别、你在 ChatGPT 里看到的回复——它们的"共同祖先",都指向 2016 年 Google 那一篇 36 页的论文。 不是夸张。 arXiv:1603.04467(TensorFlow: A System for LargeScale M…
科普版 arXiv:1603.04467 2026-08-01
ShadowDancer:从视频与"阴影"中学习统一动力学表示,教视频世界模型任意动作
本文提出 ShadowDancer,用"影子配对(shadow pairs)"——一段动力学在两种外观独立重采样下的视频对——训练模型"从一个影子预测另一个影子",从而学到剥离外观、只保留动作的统一动力学表示;任何一段演示视频都能变成可复用的动作资产,在新场景里无动作标签、无运动估计器、无需微调即可做帧级控制;在多种动…
深度解读 arXiv:2607.28362 2026-08-01
Fairness Pruning:通过差异激活定位 GLU-MLP 层中的人口统计偏差
Fairness Pruning 提出一种"在推理阶段采集激活、用最小对比 prompt 对筛选差异响应神经元、再通过定向置零改变模型对人口统计属性响应"的轻量级结构性干预方法,在 ≤3B 模型上验证了偏差处理电路与通用能力电路可解耦(dissociable),并指出当前 BiasScore 缺乏符号信息会带来双向偏差…
深度解读 arXiv:2607.28319 2026-08-01
Σ-Mem:基于 LLM 的多智能体系统的在线可靠性记忆
本文提出 ΣMem(SigmaMem),一种面向多智能体系统的在线可靠性记忆:它不存储"交互内容",而是用两个实对称矩阵(每个对等方的历史能力证据 + 对等方两两之间的关系证据)显式建模"哪个 peer 在什么条件下可信",并用 Weyl 不等式给出每一步更新的谱变化上界,保证在线更新稳定、可叠加;同一个记忆可通过统一…
深度解读 arXiv:2607.27958 2026-08-01
DualG-MRAG:面向多模态 RAG 的宏观推理与微观匹配解耦
DualGMRAG 提出双层图解耦架构,将多跳多模态 RAG 中的全局拓扑路由(Macro Graph)与细粒度证据匹配(Micro Graph)分开,并通过 GNN Retriever 驱动的查询传导消息传递实现动态关联传播,在证据召回率和复杂问答准确率上均超越基线。 MMRAG(Multimodal Retriev…
深度解读 arXiv:2607.28580 2026-08-01
CoMem:利用 Transformer 深度分工实现无界上下文记忆
CoMem(Comprehension Memory)发现 Transformer 深度并非均匀使用——中低层负责语义理解,上层专化为预测——并将此分工规律转化为一种无界上下文记忆机制:对每个上下文 chunk 仅通过中间层写入,检索固定数量的缓存残差状态,然后在压缩包上重算上层,达成与存储长度无关的固定读取计算和内存…
深度解读 arXiv:2607.28263 2026-08-01
LEDGERMIND:基于结构化证据账本的可溯源约束多模态 Agent 推理
LEDGERMIND 将多模态 Agent 轨迹重新建模为可溯源约束的状态机,通过 Structured Evidence Ledger(结构化证据账本)将工具输出归一化,使下游推理声明必须引用账本中的有效条目,从而在实体和数值层面强制溯源,并在四种常见失败模式上取得显著改善。 当前多模态 Agent(VQA 场景)日…
深度解读 arXiv:2607.28374 2026-08-01
OmniScope:面向全模态大语言模型的模态解耦 Token 压缩
OmniScope 是一个免训练的全模态 LLM token 压缩框架,用「查询共享 + 显著性解耦」替代「单模态单向引导」,在激进压缩(25% token 保留率)下最多实现 3.53× prefill 加速、15% GPU 显存下降,平均准确率仅掉 0.35 个百分点。 全模态大语言模型(OmniLLM,如 Qwe…
深度解读 arXiv:2607.23193 2026-08-01
主题综述 · RAG(2026-08-01)
2026 年 H2 的 LLM 应用栈里,RAG 已经不再是 2023–2024 那种"向量检索 + 提示词拼接"的固定管线。围绕它的争论也从"RAG 还是长上下文"逐渐让位给更细的问题:在 agentic 循环里,检索该由谁调度?多模态证据要不要做图结构?知识图谱、向量、重排序器能不能拼成可量化的选型空间?2026 …
周综述 2026-08-01
"AI 当医生看完 19 次住院记录,敢开药吗?"——arXiv 2607.09322 终于把医疗 AI 的长程决策放到了显微镜下
你有没有想过这件事 🏥: 一个病人过去三年住了 19 次院——糖尿病、肾结石、术后感染、药物过敏、复查随访,光是临床笔记就有几十万字。 AI 真能在这么长的上下文里,做出靠谱的临床决策吗? 不是问"阿司匹林是什么"——这种闭卷题 USMLE 早就有 90% 准确率了; 是问:"这病人下次来,该用什么药?该复查什么?有没…
科普版 arXiv:2607.09322 2026-08-01
知识图谱"老员工换岗就懵"终于有解了——arXiv 2607.28397 用 Graph Language Model 把跨域问答拉满
你有没有被这样的 AI 气到过 🧠: 你问它"我导师的导师最近发过哪篇论文",它信誓旦旦给你编了一个名字——听起来挺像,根本不存在;再问"那位导师的学生里谁跟医疗 AI 相关",它又开始混淆,把别的实验室的人塞进来。 是不是它偷懒?不是。是它根本不知道"导师的导师""学生里"这种关系怎么在图谱里跳。 传统 AI 读知识…
科普版 arXiv:2607.28397 2026-08-01
视频选题榜 2026-08-01
· TurboVLA: RealTime VisionLanguageAction Model at 32 Hz on an RTX 4090 with <1 GB VRAM · TurboVLA 把 VLA 从 LLMcentric V→L→A 改写为 V+L→A 直接融合(DINOv3 + BERT 独立编码 + …
选题榜 2026-08-01
角色扮演 AI 排行榜第一,到你面前却不会"陪聊"?——arXiv 2607.27816 让评测终于读懂"具体用户"
你有没有想过一件事 🎭: 你在某个 AI 角色扮演 App 上看到一个排行榜——"李逍遥"角色,第一名得分 9.2,你兴冲冲下载试用。 结果跟它聊了三轮,它要么装酷装到话都接不下去,要么硬把"御剑乘风"当战斗开场塞进你只是想聊家常的对话里——它根本不知道你想从"李逍遥"这个角色里得到什么。 是不是 AI 退步了? 不是…
科普版 arXiv:2607.27816 2026-08-01
让 AI 写代码"越改越聪明",别再把上次错的下次再错一遍——arXiv 2607.27918 用一张"经验图"锁住每一次教训
你有没有想过一件事 🧠: 你让 AI 自动写代码——比如自动给一个生产排程问题生成求解器——它这一轮跑挂了,下一轮又换个写法重试,但它根本不记得"上次为什么挂",于是一遍遍踩同一个坑。 人类工程师怎么避免?靠 postmortem(事后复盘)——把"上次哪种实现不行 + 为什么不行 + 应该换成什么"写进知识库,下次有…
科普版 arXiv:2607.27918 2026-08-01
Bitemporal · Agent 记时间
<! 镜像自 /shared/videokb/scripts/tom/20260801_R2_bitemporalmemorygraphneo4jhnswagentlocalshortvideoscript.md <! 日期:20260801 · 轮次:R2 <! arXiv 链接: 标题:Bitemporal · A…
视频脚本 arXiv:2607.26520 2026-08-01
TurboVLA 跑上 RTX 4090(视频脚本镜像)
日期:20260801 · 轮次:R1 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260801_R1_turbovlavlav+ladirectfusionrtx409032hzshortvideoscript.md 标题:TurboVLA 跑上 RTX…
视频脚本 arXiv:2607.27205 2026-07-31
AI 看图答题答对了,但推理过程全是"幻觉"——arXiv 2607.28374 给每一步加了"证据锁"
你有没有想过一件事 🔍: 当 AI 给你看一张图、问"车牌号是多少?",它回答"7XAJ492"—— 你怎么知道它是真的"看见了"车牌,还是"猜对了"? 更糟的情况:它说"根据图中的车牌区域 7XAJ492,我判断车主是……"——但你回头查它的推理日志,它压根没调用 OCR 工具,那段"7XAJ492"是从语言模型的语…
科普版 arXiv:2607.28374 2026-07-31
让 AI 学会从钢铁厂日志里"抓重点"——arXiv 2607.28126 把 88% 冗余记录扔进了垃圾桶
你有没有想过一件事 🏭: 一个大型钢铁厂的高炉,每隔几小时就要做一次巡检——焊缝有没有裂、密封面有没有磨、防腐涂层有没有掉——一年下来,光是文字+数值+图片的巡检记录就有几十万条。 现在让你把 AI 派去当"巡检助手":你给它一段问题——"上次密封面磨损是哪个周期开始的?之前有什么征兆?" 它需要从几十万条记录里找出那…
科普版 arXiv:2607.28126 2026-07-31