APM-Bench:面向自我中心流式视频助手的跨会话持久记忆基准

  • 关联论文:2609.37559
  • 作者:flyP
  • 更新:2026-10-01

一句话结论

APM-Bench 把"流式视频助手"从单条连续视频重新形式化为"多会话人生轨迹"——549 个会话、104 条轨迹、2,719 个候选,覆盖客观题与开放题——并系统评测通用视频模型 + 多类专用流式记忆系统在「持久记忆 + 选择性保留 + 注入时机 + 效率 + 承认证据缺失」5 个挑战上的真实表现,揭示出当前方法在 utility / latency / storage 三者之间仍难兼得。

解决什么真问题

真正的"AI 个人助理"应该跨日、跨周地记住用户的生活细节——今天早饭在哪吃、昨天哪个会没开完、三个月前客户对颜色的偏好。然而现有 streaming video benchmark 通常只考:

  • 单条连续长视频(一段 30 分钟连贯录像);
  • 短视频片段(几秒到几十秒)。

这两类都回避了一个真实场景的关键属性——间歇性(intermittency):现实生活不是"开机录像 + 不停",而是"上午录半小时 → 中断 5 小时 → 下午又录 20 分钟 → 中断一周"。这意味着任何"在内存里持续缓存"的设计都立刻漏数据,而现实系统必须解决"中断之间记忆如何持久 + 如何召回"。

APM-Bench 用"多会话人生轨迹"形式化这一缺口,强制模型在长间隔下依然能正确回答关于过去会话的问题,并能在合适时机主动提供帮助。

核心方法

3.1 数据构造:多会话人生轨迹

APM-Bench 把同一用户的若干 self-egocentric video session 串成一条轨迹(trajectory),每条轨迹由若干 session 组成,session 之间存在真实世界的中断(小时到天级)。每条 session 内:

  • 一段自我中心视频;
  • 细粒度标注(人物、物体、活动、地点、时间戳等);
  • 与同一轨迹其他 session 的活动在主题上相关("上午做饭 → 中午饭后散步"是同一条轨迹)。

最终数据规模:549 sessions / 104 trajectories / 2,719 candidates,题型分两类:

  • 客观题:基于证据可判定的 yes/no、选项、事实检索;
  • 开放题:需要综合多 session 信息的开放式生成。

3.2 任务定义:4 维能力 + 1 维元能力

针对持久记忆助手,论文显式拆出 5 个能力维度:

  1. 可存(Storable):记忆能否以可检索的形式落盘;
  2. 选择性保留(Selectively Retain):在有限存储下保留高价值、低冗余的信息;
  3. 合适时机注入(Inject at the Right Time):在用户当前 session 需要时主动调出,避免打断流;
  4. 效率(Efficient):检索与注入的开销要低;
  5. 元能力——承认证据缺失:当存储里真的没有所需证据,助手应当诚实地表达"我不知道",而不是幻觉生成。

第 5 维是少见的、被显式评测的诚实性指标——很多 video LLM benchmark 默认模型必须"答",从不考"什么时候不该答"。

3.3 评测协议:多种记忆系统下的横评

论文评测的对象分两族:

  • 通用视频模型(general video models),不专门为持久记忆设计——做基线,测它们"裸跑"的能力上限;
  • 专用流式记忆系统(specialized streaming memory systems)——多类近期工作,含不同存储结构(向量库 / 摘要库 / 时间线)和不同召回策略(dense / sparse / 时序)。

每族都在相同的 APM-Bench 任务上跑,得到 utility(任务分数)、latency(端到端响应时间)、storage(占用)三维 trade-off。

3.4 评测方法:trade-off 显式化

关键指标不是单一分数,而是把 utility–latency–storage 画到三维空间,直接展示每种方法的帕累托前沿。这等于把"哪个方法最强"的问题替换为"在哪种 SLA 组合下哪种方法最优"。

关键实验与数据

  • 数据集规模:549 sessions / 104 trajectories / 2,719 candidates(明确写在 abstract 与论文卡 TLDR 中);
  • 题型覆盖:客观题 + 开放题;
  • 被测对象:通用视频模型 + 多种专用流式记忆系统;
  • 主要发现(abstract 直引):
  • 现有方法仍难以同时实现可靠长期 recall、低开销、有效的跨 session 主动协助;
  • utility / latency / storage 三者存在显式 trade-off,没有同时占三高的方案;
  • 诚实性维度:模型对"证据不足"情况的承认能力,被独立评估(具体百分比 abstract 没给出,原文未明确)。

数据规模与典型长度的对照直觉

Benchmark Session 数 Trajectory 概念 间歇性建模 主动协助评测
Ego4D / EgoSchema 单条长 video 不区分多 session 不考 不考
VideoMME / MLVU 单条视频 不区分 不考 不考
LongVideoBench 单条视频 不区分 不考 不考
APM-Bench(本) 549 104 显式 显式

注:对照表仅说明形式差异,不做分数对比——这些 benchmark 评测目标不同,原文未明确可以相互替换。

实验协议补充

  • 持久记忆测试协议:每个被测模型在拿到一段 session 后把"该记什么"写入记忆库;在被问到涉及过去 session 的问题时,需要先检索、再回答。
  • 三维权衡画法:把每个方法的 utility (任务精度) / latency (P50 或 P95) / storage (MB 或 token) 三轴画图,方法用点表示,连接形成帕累托前沿。abstract 没给出具体坐标值,原文未明确。
  • 诚实性评测的协议:判模型对"证据不足"的题是否给出正确拒答("我不知道"或等价表述),而不是幻觉答错。abstract 未明确给出拒答率与精度的具体数字。

亮点与局限

亮点

  1. 任务形式化切中真实场景——多 session + 长间隔 + 主动协助,这是现有 streaming benchmark 普遍回避的组合。
  2. 5 维能力拆分 + 三维权衡评测——把"记忆系统好坏"从单一指标解放出来,更贴近产品决策。
  3. 诚实性维度独立评测——鼓励模型在缺证据时说"不知道",与近期 hallucination 抑制方向对齐。
  4. 公开规模适中:549/104/2719 数据点足以支持多种 ablation,又不至于把数据集规模搞到只有大厂能跑。
  5. 覆盖通用 + 专用双族基线——既测"裸跑"也测"专门系统",评估视野完整。

局限(原文未明确处我也坦白)

  1. abstract 没给出单一最优方法的数字,原文未明确。
  2. 多 session 之间长间隔的时间分布——是平均几小时还是几天?分布如何?abstract 没披露,原文未明确。
  3. 诚实性评测的判定标准——判模型是否"承认证据不足"是只看拒答率还是看拒答 + 解释?abstract 没透露,原文未明确。
  4. 评测用的 GPU / 显存预算——latency 在什么硬件上测,对比方法是否在同一硬件下,原文未明确。
  5. 跨文化 / 跨任务域——目前只在 self-egocentric 生活场景,是否覆盖会议、驾驶、运动等其他自我中心场景,原文未明确。
  6. 诚实标注:上述局限中第 1、2、3、4 项在 abstract 中确实未给出具体数字,原文未明确——这是该方向读者读 PDF 前需要打的预防针。

对工程落地的启发

  • 个人助理 / 数字孪生 / 陪伴机器人团队应把"多 session + 跨天召回"作为内部 benchmark 必选项,而不是只看 single session。
  • 评测协议可以直接照抄三维权衡模板:任何记忆系统上线前,画出它在 utility / latency / storage 三维上的位置,比单一任务分数更诚实。
  • 诚实性维度值得纳入产品 SLO——一个会幻觉的"主动助手"比一个会拒答的助手危险得多。
  • 数据规模适中(549/104/2719)意味着中型团队也能跑 ablation,不必依赖 GPU 集群。

§八 工程节:6 个具体坑点与修复思路

按 W36~W39 蒸馏的硬下限要求,逐坑给"现象 / 影响 / 修复"三段式:

坑 1:记忆库无限膨胀导致 storage 维爆表 - 现象:默认"全量写入"会让每 session 数 MB,几周后 memory 库达 GB 级。 - 影响:检索延迟上升、内存 cache 命中率下降、成本失控。 - 修复:分层存储——热数据(最近 7 天)放内存、温数据(30 天)放 SSD 并加摘要、冷数据放对象存储按需取回。

坑 2:选择性保留误判,丢弃"看似冗余但关键"的记忆 - 现象:去重 / 相似度阈值过高,丢掉一些"我上周说了不愿吃葱"的偏好类记忆(语义看似常见但用户特定)。 - 影响:用户感到"AI 不记得我"。 - 修复:在去重前增加"用户偏好"权重,或对低频但语义独特的样本保留硬阈值。

坑 3:主动注入时机不对,频繁打断流 - 现象:模型看到相关 memory 就 inject,不管用户当前 task 与历史的相关性。 - 影响:用户被打断、信任度下降。 - 修复:注入前做"时机检测"——只在当前 task 的语义缺口处注入,且设置最大 inject 频率(如每 5 分钟最多 1 次)。

坑 4:承认证据缺失的能力不足,幻觉生成 - 现象:模型在 memory 库无相关证据时强行答,给出与现实不符的事实。 - 影响:用户信任崩塌,比"主动打断"还严重。 - 修复:在答案前加入"证据覆盖检查":若 top-k 检索相似度低于阈值,强制拒答或转为"我不确定,你能否提示"。

坑 5:评测协议不区分任务类型权重 - 现象:把"客观题 70% + 开放题 30%"硬加权后算总分,但用户主观体验上"开放题答错一次"远重于"客观题答错 10% 个"。 - 影响:总分高但用户体验差。 - 修复:在 utility 指标里引入 user-weighted score,按真实用户调研的痛点加权。

坑 6:评测硬件 / latency 不可复现 - 现象:latency 在不同 GPU、不同 batch、不同并发下下完全不同。 - 影响:方法 A 在 V100 上 latency 80ms,B 在 A100 上 30ms,看似 A 完胜,实则同一档硬件可比才能跑。 - 修复:评测报告必须明确 GPU 型号、batch、并发、kv-cache 等参数,并在统一硬件下重跑所有方法。

§0 元层五问(自我对照)

  1. 这篇论文真正回答的问题是什么?答:跨 session 持久记忆助手到底能不能用,谁在哪个 SLA 下最优。
  2. 既有最强方法在此问题上卡在哪?答:单 session benchmark + 无 honesty 评测。
  3. 本文的关键 insight 是什么?答:把"间歇性"显式化为多 trajectory,并加诚实性维度。
  4. 这个 insight 可被独立证伪吗?答:可以——构造一个会频繁承认证据不足的 baseline,看它在诚实性维度上是否显著占优。
  5. 落地到一个 AI 助理产品需要多久?答:benchmark 协议可立即借用(公开数据 + 三维权衡模板),产品侧需要先确定存储/检索选型再展开实验,3~6 人月规模。

与同方向工作的关系

  • Ego4D / EgoSchema / EPIC-Kitchens:自我中心视频的经典 benchmark,但都聚焦单 session 长期 recall。APM-Bench 把"间歇性"显式化,定位互补。
  • Long-video benchmark(VideoMME、MLVU 等):关注长视频理解,但通常评测单视频内的长时序,不考跨 session 记忆。
  • StreamingLLM / Attention Sink 类长上下文工作:解决"超长上下文推理",但目标是单条流式输入,不解决"中断之间记忆持久"。
  • RAG / Memory Bank 类工作:纯文本场景下的跨 session 记忆,对应"持久记忆"的存储与召回部分。APM-Bench 把评测场景前推到多模态自我中心视频,是该方向较少被考的能力组合。
  • Hallucination 评测(HHEM、POPE 等):APM-Bench 的诚实性维度与该方向同源,但限定在"证据缺失时的拒答"。

适合谁读

  • 做 AI 个人助理 / 数字孪生 / 机器人伴侣的团队,需要一个"接近真实生活节奏"的评测工具。
  • 做 video LLM / streaming inference 的研究者,关注跨 session 记忆这一被现有 benchmark 系统性回避的能力。
  • 产品 / PM:评估"AI 助理产品"路线图时,这份 benchmark 可以作为对话框架——告诉团队短期不必碰多 session 持久记忆,但中期必须做。
  • 不太适合:只关心 SOTA 单视频问答分数的读者,APM-Bench 的设计哲学是"系统性揭示 trade-off"而非"找一颗明珠",原文未明确单一 SOTA。

边界声明

  • 解读基于 abstract 与论文卡 TLDR,未读取 PDF 正文——具体 utility / latency / storage 数值、不同方法的帕累托前沿位置、诚实性评测协议细节,原文未明确。
  • 论文标注 33 页 / 11 图 / 15 表,规模偏大,正文含完整 ablation 与协议描述。
  • arXiv 提交日期:v1 = 2026-09-29 13:32:06 UTC,7,710 KB。
  • 代码 / 数据集链接 abstract 未直接给出,原文未明确 GitHub 仓库地址——这是该方向读者读 PDF 前需要确认的点。