Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

GLM-RAG:图语言模型驱动的知识图谱检索增强生成
GLMRAG 引入 Graph Language Model(GLM)作为知识图谱 RAG 的 Retriever,在跨域迁移能力和多跳推理效果上超越传统 GNNbased 和向量检索方法,在两个多跳 Benchmark 上达到 SOTA,且随参数规模和子图覆盖增加展现出良好的 scaling 特性。 知识图谱 RAG…
深度解读 arXiv:2607.28397 2026-07-31
ConMem:用贡献感知记忆重构长程工业巡检日志 RAG
ConMem 针对钢铁设备长程巡检场景,提出了基于 Shapley 值的贡献感知记忆框架,将历史日志中每个证据单元的诊断价值量化,在受限记忆预算下优先保留高价值弱信号,在真实数据集上实现 76.0% QA 准确率,并将 LLM 输入 token 数减少 88.2%、响应时间降低 86.6%。 工业巡检(尤其是钢铁设备)…
深度解读 arXiv:2607.28126 2026-07-31
OptGraph:用 GraphRAG 把自动进化优化做对
OptGraph 是首个把 GraphRAG(图检索增强生成) 引入 LLM 驱动的自动化进化优化(automated evolutionary optimization)的工作流,通过类型化图(typed graph) 沉淀"建模模式—问题形式化—实现细节—错误修正"四类经验,使检索到的上下文由平面文档变为带关系的结…
深度解读 arXiv:2607.27918 2026-07-31
跳出「借来的历史」:面向交互式角色扮演评估的人物对齐用户模拟
角色扮演智能体(RolePlaying Agents, RPAs)的主流评测都是「喂固定对话历史,看后续回复是否贴脸」,但这种设计既剥离了「真实多轮」里用户历史对 RPA 输出的塑形作用,又用与用户偏好脱钩的统一 rubric 打分。本文提出 PALATE:用 5 个 peruser 模拟器与 300 个角色档案,让候…
深度解读 arXiv:2607.27816 2026-07-31
主题综述 · agent(2026-07-31)
范围:2026 年 7 月中下旬 LLM Agent 主线增量;侧重「记忆、技能、安全、评测」四个交叉轴。论文卡主战场以 paper_cards 主分类=agent 的 5★ 立标与 20260729~31 新卡为主,结合 spark 731 agente1prep、flyp 731 SkillRiseandMetis…
周综述 2026-07-31
GPU kernel 优化不用靠人海战术了——arXiv 2512.09196 让"自动调优"摸到 5 倍性能天花板
你有没有发现一个尴尬的现实 💻: 同一家公司、同一个 LLM 推理服务,资深 GPU 工程师手写的 kernel,比普通工程师写的版本快 35 倍——但这种"专家经验"既难传承、也难规模化。 更糟的是:模型每换一代,优化套路要重写一遍;硬件每换一档(A100 → H100),又得重新学一遍。 arXiv 2512.09…
科普版 arXiv:2512.09196 2026-07-31
让 AI 在游戏里"学会思考",只用了一个标量——arXiv 2607.25308 把稀疏奖励问题彻底解开了
你有没有想过一件事 🧠: 下棋、写代码、做决策——这些人类觉得"有套路"的事,让 AI 学起来居然比解一道数学题难 100 倍? 不是因为模型不够大,也不是因为算力不够,而是因为老师不知道怎么给反馈。 传统做法是"赢了就加分,输了就扣分"——但 AI 在一盘棋里下了 200 步,哪一步是关键? 它不知道。 arXiv …
科普版 arXiv:2607.25308 2026-07-31
2026-07-31 · R3 · LEDGERMIND 短视频脚本镜像
arXiv: videokb 脚本原路径: /shared/videokb/scripts/tom/20260731_R3_shortvideoscript.md 标题:LEDGERMIND · 证据账本 目标观众:多模态 Agent 工程师 一句话核心观点:多模态 Agent 推理,从「答对就行」变「每一步都能查账」…
视频脚本 arXiv:2607.28374 2026-07-31
视频选题榜 2026-07-31
· SkillRise: Agentic Reinforcement Learning for CrossTask Skill Evolution · 跨任务技能演化训练范式 method paper · 单策略 solve+curate 双角色 + 解耦信用分配 + 跨任务测试时 scaling 现象 · round…
选题榜 2026-07-31
主题综述 · database(2026-07-31)
本文综合 KB 内 paper_cards/ 中 9 篇 主分类=database 的纯标签卡片(1603.09320 HNSW、2509.12384 Qdrant on Polaris、2606.08950 "More Cores Hurts"、2606.16903 TrieHI、2606.07923 Larch、2…
周综述 2026-07-31
"我上周说要来北京,下周又说去上海"——AI 助手为什么总是记忆混乱?arXiv 2607.00339 给出了工程答案
你跟 AI 助理聊了半小时,告诉它"我下周去北京出差",它点头记住了;十分钟后你说"算了,改去上海",它又点头;再过十分钟你问"我下周去哪",它把两条矛盾的话一起吐出来,理直气壮地说"你说了北京和上海"—— 然后你就放弃了,自己打开日历看了一眼。 这种"对话越长越糊涂"的体验,不是 AI 不够聪明,是它的记忆架构有结构…
科普版 arXiv:2607.00339 2026-07-31
大学把 AI 做成"万能客服":31.7% 幻觉率砍到 6.6%,arXiv 2607.01115 的 RAG 工程全拆解
你有没有这种感觉:点进一个大学的"招生问答"机器人,问"机械工程专业要修多少学分",它要么回一堆不相干的链接,要么一本正经地编一个答案——直到你打电话去问才发现自己被 AI 骗了。 这不是个例。发展中国家大学里的智能问答系统,幻觉率一度高达 31.7%——也就是说,每问三次就有一次在胡说八道。 最新论文 arXiv 2…
科普版 arXiv:2607.01115 2026-07-31
2026-07-31 · R2 · KAMR 短视频脚本镜像
arXiv: videokb 脚本原路径: /shared/videokb/scripts/tom/20260731_R2_kamrmultihopraganchorbridgeshortvideoscript.md 标题:KAMR · 锚点检索 + 桥接 目标观众:RAG 工程师 一句话核心观点:多跳检索拆两阶段,部…
视频脚本 arXiv:2607.27136 2026-07-31
2026-07-31 · R1 · SkillRise 短视频脚本镜像
arXiv: videokb 脚本原路径: /shared/videokb/scripts/tom/20260731_R1_skillrisecrosstaskskillrlshortvideoscript.md 标题:SkillRise · 自己养 SOP 目标观众:AI 工程师 一句话核心观点:跨任务技能演化训练范…
视频脚本 arXiv:2607.26784 2026-07-31
"AI 红队攻破了系统,但把自己也暴露了"——arXiv 2607.26314 把"操作隐身"做成了可量化 benchmark
想象一个场景:你雇了一个顶级小偷,他说"我把保险箱打开了"。结果你一看监控——他撬锁的时候在墙上画了涂鸦、把工具留在现场、还顺手帮你隔壁邻居也撬了一遍。 听起来很荒诞对吧?但这正是今天自主攻击性 AI Agent(自动化渗透测试机器人)正在大规模犯的错。 最新论文 StealthBench(arXiv 2607.263…
科普版 arXiv:2607.26314 2026-07-30
AI 助理越用越聪明?arXiv 2607.26784 用"跨任务技能进化"给出了工程答案
你有没有这种体验:同一个 AI 助理,第一次帮你订咖啡手忙脚乱,第三次它就知道你忌咖啡因、要燕麦奶、走小程序;但下一个用户、换个新场景,它又从零开始? 这就是 LLM 智能体落地的核心痛点——每次遇到"类似的活"它都重新摸索,不会把今天学到的套路留给明天。SkillRise 这篇论文,直接把这件事当成可学习问题:让同一…
科普版 arXiv:2607.26784 2026-07-30
StealthBench:测量自主攻击性安全 Agent 的操作隐身能力
StealthBench 把「OPSEC」从人话术语搬进评测台:用 11 个真实漏洞赏金/红队轨迹扩展成 14 个 Docker 化任务,沿六维操作安全维度评估自主攻击 Agent,得出当前最强模型安全成功率不超过 54%——能挖漏洞不等于「挖得不露痕迹」。 最近一年自主攻击 Agent(如开源的 PentestAge…
深度解读 arXiv:2607.26314 2026-07-30
SkillRise:跨任务技能进化的智能体强化学习
SkillRise 把「任务求解」与「技能文档维护」合并到同一条策略里,用跨任务序列 + 解耦信用分配,让 LLM 智能体在跑一连串相关任务的 rollout 中,自洽地抽取、精炼并复用可迁移技能;在 ALFWorld / WebShop / ScienceWorld 上相对最强 baseline 提升 2.3–8.5…
深度解读 arXiv:2607.26784 2026-07-30
CAST:把游戏求解器变成 LLM 智能体的回合级教师
CAST 用「classical game solver 在 LLM 行动前后的 costtogo 变化」作为 turnlevel 教师信号,无需求教师 logits,就能获得理论上等价于 onpolicy distillation 的密集监督;在 Sokoban / Minesweeper / Rush Hour 三…
深度解读 arXiv:2607.25308 2026-07-30
拥抱不完美数据集:医学图像分割中深度学习解决方案综述
这是一篇专门给"数据不够干净"的医学图像分割场景做总账的综述——它把"标注稀缺"和"标注噪声/弱标注"两大现实痛点拆成可操作的解决方案库,并给出推荐组合,至今仍是医学影像从业者的入门地图。 医学影像领域的悖论:SOTA 分割网络(UNet、DeepLab、nnUNet)几乎都假设有"大量、干净、像素级对齐"的标注。但临…
深度解读 arXiv:1908.10454 2026-07-30
TensorFlow:异构分布式系统上的大规模机器学习
TensorFlow 以数据流图(dataflow graph)为抽象,提出一套可在从手机到数百台机器集群的异构硬件上统一执行 ML 算法的接口与实现,奠定了现代深度学习框架的工程范式基础。 2015 年前后,Google 内部已有 DistBelief 系统用于训练大规模深度神经网络,但它与具体应用紧耦合、代码难以复…
深度解读 arXiv:1603.04467 2026-07-30
神经文本退化:Nucleus Sampling 如何破解 LLM 输出的"平淡症"
语言模型训练时用 likelihood 目标效果拔群,但用 likelihood 作为解码目标时却产生了平淡、重复的退化文本。论文揭示了人类文本与机器文本在 token 概率分布上的根本差异,并提出 Nucleus Sampling(核采样):动态截取概率分布顶部(nucleus),在保证流畅性的同时大幅提升生成多样性…
深度解读 arXiv:1904.09751 2026-07-30
全球最顶尖的"光"实验室,把过去 30 年的知识塞进了 AI——它怎么做到的?
美国阿贡国家实验室的先进光子源(APS)——全球最顶尖的第三代同步辐射光源,每周给全球数百个研究团队提供高亮度 X 射线,用来研究电池材料、蛋白质结构、催化剂…… 这是国家级的科研基础设施,一旦停摆,损失按小时算。 但这个"国之重器"过去 30 年积累的运维知识,散落在: 电子日志(束流调试记录) 技术文档(设备手册、…
科普版 arXiv:2607.24663 2026-07-30
你给 AI 看一张财务 K 线图,它在密密麻麻的网格里"瞎了"——直到有人把图先"切片"
你有没有试过,让 GPT4o 或者 Claude 帮你看一张财务 K 线图,然后问它"3 月 15 日的收盘价是多少"? AI 的回答往往莫名其妙——它要么说"我看不到具体数字",要么瞎编一个看起来很合理但完全错的答案 📉。 你以为是 AI 不够聪明。 不是 AI 笨,是网格线把它"晃瞎"了。 2026 年 7 月的 …
科普版 arXiv:2607.24554 2026-07-30
2607-24117
date: 20260730 (R3) arxiv: 2607.24117 video_kb_script: /shared/videokb/scripts/tom/20260730_R3_gradingnarratorsisnadrijalshortvideoscript.md 标题:Grading the Narr…
视频脚本 arXiv:2607.24117 2026-07-30
视频选题榜 2026-07-30
· CodeNib: A MultiView Data System for Serving Repository Context to Coding Agents · 编码 Agent 多视图仓库上下文服务 · commit 级 lexical/dense/structural 三视图 + 单一运行时 ranked …
选题榜 2026-07-30
主题综述 · engineering(2026-07-30)
今日 date +%j 取 211,对 8 取模得 3,本应写 llminfra;但 surveys/ 中 llminfra 已有 20260729 综述(72 小时内),按规则顺延:index 4(evaluation,0729 已覆盖)→ 5(engineering,0726 综述距今约 92 小时 72h,未覆盖…
周综述 2026-07-30
给 AI 看一张草图,它答错了——你换一张"写实版"给它,它答对了
你有没有发现一件事 🖼️: 同样是物理题"球经过障碍物会落在哪里",你给 AI 看抽象草图,它答错; 你给 AI 看真实场景图,它答对了。 图片内容一样,只是风格不一样——AI 的答案却变了。 这意味着什么? 意味着我们以前对 AI 的调优,只动了一半。 2026 年 7 月的 arXiv 2607.25537 (VI…
科普版 arXiv:2607.25537 2026-07-30
AI 读完你的财报说"12.4 亿"——但它指给你看的证据,根本不是那行
你有没有遇到过这种场景 🧾: 把一份年报、发票、学术海报丢给 AI,让它回答"2024 年营收是多少"。 AI 答得很干脆——"12.4 亿" ✅ 但当你想确认它到底是从哪里看出来的,AI 给你画了一个框——框在了完全不相关的地方 ❌ 更可怕的是:这种错误根本不会被普通评测抓到。答案对了,证据错了,系统给你打 100 …
科普版 arXiv:2607.24651 2026-07-30
2026-07-30 · R2 · arXiv 2607.25379 · Cyber-Capable AI Agents
videokb 脚本原路径:/shared/videokb/scripts/tom/20260730_R2_shortvideoscript.md arXiv 链接: 标题:CyberCapable · 让 Agent 攻得动也关得住 目标观众:AI Agent 架构师 / Agent 平台 SRE / AI 安全工程…
视频脚本 arXiv:2607.25379 2026-07-30