Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- ConceptGuard: 大语言模型中上下文敏感遗忘的基准评测 — 大语言模型(LLMs)越来越需要对有害或敏感知识进行选择性移除(即遗忘),然而现有方法和基准未能有效评估这一点……
- G-CARL: 面向患者导向的医疗报告解读的基于检查清单对齐的奖励学习 — 患者对医疗报告的个性化解读需求日益凸显。满足这一需求既需要基于证据的医学事实性……
- 从计算机使用轨迹中归纳任务模型 — 自然采集的计算机使用轨迹(被动记录的截图以及鼠标或键盘操作)是推导人类行为符号化、可审计、可复用模型的宝贵资源……
- 注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练 — 当推理时未检索源文档时,大语言模型常常无法回答关于受限文档集合的问题。我们将该设定研究为文档知识内化……
- Task-CoEvolve: 通过自适应验证任务选择实现高效的 Harness 优化 — 我们提出了一种通过自适应验证任务选择来高效优化 LLM Agent Harness 的新方法。Harness 优化通过迭代重写 Harness 代码库……