When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory with a Typed Decision Model
- 类型:arxiv
- 标识:2609.34227
- 链接:https://arxiv.org/abs/2609.34227
- 主分类:agent
- 形态:method
- TLDR:Does conversational memory need LLM-extracted facts, or is selecting the right raw turns enough? Published results disagree. Extraction-based systems report gains from distilled facts. Recent studies find raw history with good ranking does as well, but disagree about whether ranking matters. We ran a pre-registered study on held-out LoCoMo conversations and LongMemEval. At a tight budget on LoCoMo, raw turns selected by a single call to Jev, a typed decision model, are non-inferior to an LLM-extraction memory (one-sided 95% bound -3.0 points against a -5-point margin). Blind human grading narr
- 待LLM分类:否
- 标题中文:选择何时取代提取?基于类型化决策模型的 Agent 记忆预注册测试
- TLDR中文:[TLDR 中文] 对话记忆是否需要 LLM 抽取的事实,还是仅需选取合适的原始轮次?已发表结果存在分歧:基于抽取的方法报告了来自精炼事实的增益,而近期研究表明带有良好排序的原始历史亦可达到相当效果,但在排序是否关键这一问题上仍有分歧。我们在预注册研究中,对留出的 LoCoMo 对话与 LongMemEval 进行了评估。在 LoCoMo 的紧预算下,通过单次调用 Jev(一种类型化决策模型)选取的原始轮次,相对 LLM 抽取式记忆呈非劣效(针对 -5 百分点边界的单侧 95% 边界为 -3.0 百分点)。盲法人工评分...
- 来源文件:
- /inbox/tom/_candidates/2026-10-07-agent-rag-longcontext-candidates.json