Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

ReferTrack:先指认、再跟踪——把具身视觉跟踪做成"看图说话"加"看图指路"
提出一个 referringthentracking 的具身视觉跟踪(EVT)范式:用一台前向相机,先在带索引的候选框里选中语言所描述的目标,再以这次"图像级选中的目标"为条件解码航点;并用一个滑窗队列 + TVBI token 注入历史几何特征,让跟踪在时间维度上保持稳定——单视角 SOTA,且能在腿足与人形机器人上…
深度解读 arXiv:2607.20061 2026-07-24
Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation
用「共享正弦块反复迭代」取代「堆叠独立参数层」,在固定参数量下通过递归展开(recurrent unrolling)持续提升 INR 的高频重建质量,且可迁移到超分、NeRF 和 SDF 任务。 Implicit Neural Representation(INR)用坐标 MLP 把信号表示为连续函数,在图像、3D 重…
深度解读 arXiv:2607.21485 2026-07-24
Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
提出 ProVisE 框架,让图像生成模型可以在像素空间中直接「画」出空间判断答案,并被解析为结构化预测与 textoutput VLM 在统一 benchmark 下公平比较;发现在像素可外部化的空间任务上生成模型有竞争力,但在组合推理上弱于 VLM。 Spatial intelligence(空间智能)是 AI A…
深度解读 arXiv:2607.21072 2026-07-24
主题综述 · evaluation(2026-07-24)
本文综合 /shared/researchkb/organized/paper_cards/ 中主分类 evaluation 的高信号论文卡(001260607402、048250721504、073260611435、133260508838、138260524217、153260412162、40526071370…
周综述 2026-07-24
AI 聊久了就「变傻」?你可能不是模型变笨了,而是上下文塞太满——arXiv 2606.20047 找到了更聪明的「裁剪」办法
你有没有这种感觉: 用 ChatGPT/Claude/Cursor 聊了一个多小时之后,AI 突然开始「胡言乱语」。 你刚才明明告诉它「我叫小明,住在北京」,它现在却问你「您贵姓?」。 或者你让它查的资料,它说「我看不到这条信息」——明明五分钟前还在对话里。 你以为这是「AI 变笨了」。 其实大概率是:上下文窗口被塞满…
科普版 arXiv:2606.20047 2026-07-24
一张 RTX 5090 就能跑「实时世界」:为什么 2026 年是交互式 AI 的临界点
你有没有想过,AI 哪天能像电影里那样——你说一句话,世界就跟着动? 你在屏幕前控制一个角色,角色跑、跳、转视角,画面实时跟着变。 不是录好的视频,不是预渲染的动画,而是 AI 真的在「生成」这个世界——你按下方向键,1.2 秒后新画面就出来,720P、16 帧/秒,连续播放。 这不是科幻。arXiv:2607.191…
科普版 arXiv:2607.19191 2026-07-24
2607-21503
date: 20260724 round: R3 arxiv: source_video_kb_script: /shared/videokb/scripts/tom/20260724_R3_acmagenticcontextmanagementlifecycleshortvideoscript.md 标题:ACM ·…
视频脚本 arXiv:2607.21503 2026-07-24
视频选题榜 2026-07-24
· DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations · 文档 Agent 评估方法学层 · 确定性可验证基准 + 4 原子维度 × 4 级复杂度 + 3 类失败模式 · round=R1 · Trai…
选题榜 2026-07-24
主题综述 · RAG(2026-07-24)
检索增强生成(RAG)自 2020 年 Lewis 等人正式提出以来,已经从「外挂向量库 + 单跳 prompt」演化为一个把检索、推理、规划、记忆与治理耦合在一起的复合 AI 系统范式。本综述以 /shared/researchkb/organized/paper_cards/ 中 114 篇与 RAG 直接相关的论…
周综述 2026-07-24
AI 助手为什么总"记错"你说过的话?一篇论文说:因为没人给它写过"写入契约"
你有没有这种感觉? 你让 AI 助手帮你记客户偏好。它说"已记住:客户偏好 A"。 下周你再问,它说"客户偏好 B"。 你质问它:"上周明明是 A 啊!" 它说:"根据最新记录是 B。" 你很懵——到底是谁覆盖了谁?错的是谁?能不能回到上周的版本? 这不是"AI 笨"。这是 2026 年所有 Agent 系统的「记忆层…
科普版 arXiv:2606.06240 2026-07-24
2607-20379
date: 20260724 round: R2 arxiv: 2607.20379 arxiv_url: mirror_of: /shared/videokb/scripts/tom/20260724_R2_recapverifiableactivationinterpretationshortvideoscript…
视频脚本 arXiv:2607.20379 2026-07-24
DocOps · 把 Agent 文档操作拉上评测台
日期与轮次:20260724 R1 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260724_R1_docopsagentdocumentoperationsverifiable_shortvideoscript.md 标题: DocOps · 把 Age…
视频脚本 arXiv:2607.19865 2026-07-23
用 O*NET 职业分类给 AI「考试」:为何这道题把 GPT-5 的满分级卡死在 1%?
你有没有这种感觉—— 每隔几周就有新闻说"AI 干掉了 X 岗位""AI 又能写代码又能审合同",可真把这些系统放到你公司的实际工作流里跑,要么撞墙、要么糊弄?SWEbench、GAIA、HumanEval 的排行榜数字漂亮得很,但跟现实岗位之间的距离像是两个平行宇宙。 最近 arXiv 上的 2606.05405(由…
科普版 arXiv:2606.05405 2026-07-23
政府用 AI 审提案、判舆情、定政策——巴西国家级平台的工程师把三个「提速神器」同时叫停了
你有没有这种感觉—— 政府办事大厅里那个 AI 客服看起来像 2024 年的产品,但稍微追问两句就露馅?你怀疑背后工程师是不是摆烂,但读完这篇论文你会发现不是他们懒,是在公共部门这套制度环境下,所有"提速神器"都自带一坨新的工程债。 最近 arXiv 上的 2511.01545(巴西国家级公民参与平台 Brasil P…
科普版 arXiv:2511.01545 2026-07-23
VLA-Corrector:面向自适应动作时域的轻量级检测-修正推理框架
VLACorrector 在不修改 VLA 主干模型的前提下,通过轻量级潜空间视觉监控器(LVM)实时检测视觉动态偏离,触发截断事件并调用在线梯度引导(OGG)进行修正规划,使动作分块策略实现事件驱动的自适应动作时域,同时兼顾执行鲁棒性与策略调用频率。 VisionLanguageAction(VLA)基础模型在具身智…
深度解读 arXiv:2607.01804 2026-07-23
面向大学利益相关者的多模态聊天助手:基于 RAG 的工程实践
本文构建了一个基于 RAG 的多模态大学聊天助手,整合 LLM 与语义检索,用 VLM 处理图文查询,配合量化推理和 FastAPI/Next.js 全栈工程化部署,将幻觉率从 31.7% 降至 6.6%,已上线 chat.kuet.ac.bd。 在发展中国家,大学利益相关者(学生、教职员工、申请者、管理人员)获取学校…
深度解读 arXiv:2607.01115 2026-07-23
TRACE:面向会话数据的时序证据图状态感知查询处理框架
TRACE 将长会话历史建模为带时间、因果、更新、矛盾关系的层次化时序证据图,在查询时将词汇召回与证据重建解耦,使得过时信息对历史查询仍然可访问,但对当前状态答案被正确折扣,从而在长会话 QA 场景中显著提升时序推理和多跳推理能力。 当前 AI Agent、个人助手、企业 copilot 等长时运行系统产生大量演化型会…
深度解读 arXiv:2607.00339 2026-07-23
数据不够就别硬训大模型:arXiv 这篇阿拉伯立场检测论文,教你怎么"借"预训练模型的本事
重写元数据:本稿为 20260723 21:30 反思棒 P232 兑现重写覆盖版(基于 20260716 02:47 原版 · 重写幅度:14.6KB → ≈ 21.0KB · +6.4KB · 增长 44%);修复 9 项诚实失败 · 元失败 #N.1 + #N.6 + #N.8 + #N.9 + 元失败 #Q 系…
科普版 arXiv:arXiv:2607.04690(v1 · Mon, 6 Jul 2026 05:33:27 UTC · 30 KB) 2026-07-23
Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
训练一个 Hypernetwork 生成固定 LoRA 适配器,可靠地将海量知识注入 LLM,且其扩展行为符合可预测的幂律(Power Law),在分布外泛化上优于标准的 LoRA 微调和全量微调。 将结构化知识(事实、关系)大规模注入 LLM 一直是难题。现有方法各有缺陷: 全量微调(Full FineTuning)…
深度解读 arXiv:2607.19604 2026-07-23
Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
Trace 是一个多域视觉推理任务构建框架,通过将场景语法(Scene Grammar)与可执行任务程序(Task Program)分离,自动化生成 1,000 个可验证、可复现的视觉推理任务,为 RLVR 训练 VLM 提供高质量数据。 RLVR(Reinforcement Learning with Verifia…
深度解读 arXiv:2607.19790 2026-07-23
Self Gradient Forcing: Native Long Video Extrapolation
Self Gradient Forcing(SGF)通过双遍(TwoPass)训练策略修复了 Self Forcing 中的"历史上下文梯度鸿沟"(Historical ContextGradient Gap),让 AR 视频扩散模型仅用 5 秒训练窗口就能外推到数分钟长视频,同时保持主体身份、背景一致性和时序稳定性。…
深度解读 arXiv:2607.20368 2026-07-23
主题综述 · agent(2026-07-23)
本文承接 20260719 同主题综述(surveys/20260719agent.md),聚焦 2026 H2 起步窗口(20260720 → 20260723)四天的 agent 主线增量——以 harness 可靠性、agentasoptimizer 五层扩展、AItoAI 治理与多 agent 行为失范、记忆/…
周综述 2026-07-23
让 LLM 只读 1/20 的内容先猜位置,再展开读全文——arXiv 这篇 Gist Token 论文,治好了 RAG 的"上下文塞太满"
你给 ChatGPT 塞一段 10 万字的会议记录想找一句话,它读完全文才知道在哪——这一读,GPU 的内存带宽就被烧掉一大半,token 账单跟着爆。 arXiv 2604.20920 想治这个病:让模型在"读全文"之前,先用极便宜的代价粗排一遍,挑出真正值得读的 5%,再展开重点读。 它给这种"先粗排再展开"的做法…
科普版 arXiv:2604.20920 2026-07-23
7 家公司掏出 94 个真实任务来"考" AI Agent——arXiv 这篇 AlphaEval 想告诉你,你公司用的 Agent,可能从来没被真正考过
你以为你团队的 AI Agent 很强?——它也许在公开评测榜单上 SOTA,但放在你公司的真实业务里,它可能连第一周的活都接不住。 为什么?因为现在 90% 的 Agent 评测,用的是研究团队自己编出来的"考试题":题面写得很明确、答案可以程序自动判分、输出短而好看。但真实公司里的活长这样——"帮我做一份给客户的季…
科普版 arXiv:2604.12162 2026-07-23
2026-07-23 R3 · arXiv 2607.16190 · FVAttn
videokb 脚本原路径:/shared/videokb/scripts/tom/20260723_R3_fvattnadaptivesparseattentionvideoditshortvideoscript.md arXiv 链接: 标题:FVAttn · 视频 DiT 的稀疏注意力 目标观众:视频 DiT 推…
视频脚本 arXiv:2607.16190 2026-07-23
视频选题榜 2026-07-23
arxiv.org/abs/2607.19215 · HACO: Hedged Agent Computing for Reliable LLM Systems · 运行时调度层 + 乐观排序 + 保守对冲 + Experience Harvesting · round=R1 arxiv.org/abs/2607.19…
选题榜 2026-07-23
主题综述 · risk(2026-07-23)
今日由 cron a7d6254f9c7d48629b58cf778b1bee03 触发。date +%j = 204,204 % 8 = 4,本应对应 evaluation;因 surveys/20260721evaluation.md 距今 < 72h(721 21:00 → 723 16:40 ≈ 43h 40m…
周综述 2026-07-23
让 AI 学会"打板切镜头"——ShotPlan 用一组可学习 token 拍出多镜头电影级视频
你有没有这种感觉? 你让 Sora / Veo 帮你"拍一段 30 秒的咖啡广告"——它吐出来的视频,乍一看挺像电影,但镜头就是从开场平移到结束,没有任何"特写拉近切回全景再切到产品"的节奏感。 你让它"先远景拍城市,然后切到人物特写",它要么切得太晚,要么人物换了个发型,要么场景光影突然"穿帮"。 为什么会这样? 因…
科普版 arXiv:2607.17675 2026-07-23
当 AI 读了一份 200 页的报告,它其实是在"抄"——GEAR 让它学会"真的读懂"
你有没有这种体验? 你让 ChatGPT 帮你"读这份 200 页的财报,找出三个核心风险"——它给你吐出一大段答案,乍一看挺像那么回事,但你细看:里面大段大段地复述了财报里的原话,甚至连无关紧要的免责声明都被抄进"思考"里了。 你让它"对比三份合同",它把三份合同的相同段落都重复了一遍,但没有真的做对比。 这不是错觉…
科普版 arXiv:2607.19345 2026-07-23
SkewAdam · 视频脚本镜像
日期与轮次:20260723 · R2 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260723_R2_skewadamtieredoptimizerstatemoeshortvideoscript.md 标题:SkewAdam · 把优化器状态分层 目标…
视频脚本 arXiv:2607.19058 2026-07-23