Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- KaliBench:基于 Kali Linux 的网络安全工具调用细粒度基准,提供无运行时依赖的可验证奖励 — LLM 正越来越多地应用于网络安全工作流,用于将分析人员的意图转化为工具调用。然而,现有评测仍主要聚焦于知识……
- 层次化连续扩散语言模型 — 离散扩散语言模型为需要双向推理与全局约束满足的任务提供了相比自回归生成的有力替代方案。然而……
- AutoCompact:面向长周期编程 Agent 的上下文压缩时机学习 — 编程 Agent 通过代码检视、搜索、编辑与测试等长轨迹来完成仓库级软件工程任务。随着任务推进,早期探索……
- 从知识访问到来源学习:发展来源专属能力 — 大语言模型 (LLM) Agent 越来越依赖持久化外部来源来解决一系列知识密集型任务。现有方法主要改进来源内容被……
- 关键词 Harness 失守开放:小语言模型工具调用声明的廉价诊断阶梯 — 关键词匹配基准可能将小模型从未实际执行的工具调用误记为成功。我们在架构匹配的一对西班牙安全语言模型中记录了此类假阳性……