Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation
- 类型:arxiv
- 标识:2606.23127
- 链接:https://arxiv.org/abs/2606.23127
- 主分类:evaluation
- 形态:benchmark
- 被引:2
- 被引来源:Semantic Scholar
- S2被引:2
- OpenAlex被引:0
- 影响力被引:0
- TLDR:A benchmark of 382 realistic enterprise tasks spanning six professional roles and 22 procedural skills, designed to evaluate how skills transfer across tasks, roles, and model backbones finds that some skills generalize broadly across tasks and models, whereas others become specialized to role-specific workflows and lose effectiveness under transfer.
- OpenAlex ID:W7165652918
- OpenAlex DOI:10.48550/arxiv.2606.23127
- DOI:10.48550/arxiv.2606.23127
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2606.23127
- OpenAlex更新:2026-07-19
- 副分类:agent
- 待LLM分类:否
- 标题中文:管理 LLM Agent 中的程序性记忆:控制、适应与评估
- TLDR中文:一个包含 382 个真实企业任务、覆盖 6 种专业角色和 22 项程序性技能的基准,用于评估技能在任务、角色和模型骨干间的迁移能力,发现部分技能可在任务和模型间广泛泛化,而另一些则专化为角色特定工作流,在迁移时失去效力。
- 来源文件:
- /inbox/tom/_candidates/2026-07-01-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]