Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准,附带无运行时可验证奖励 — LLM 越来越多地应用于网络安全工作流,用于将分析师意图转化为工具调用。然而,现有评估侧重于知识……
- 分层连续扩散语言模型 — 离散扩散语言模型为需要双向推理与全局约束满足的任务提供了一种引人注目的自回归生成替代方案。然而……
- AutoCompact:长视野编码 Agent 中何时压缩上下文的学习 — 编码 Agent 通过代码检查、搜索、编辑和测试的长轨迹解决仓库级软件工程任务。随着任务推进,先前的探索……
- 从知识访问到来源学习:培养来源专属能力 — 大语言模型(LLM)Agent 日益依赖持久化的外部来源来解决一系列知识密集型任务。已有方法改进了来源内容的……
- 关键词套件开放失败:小语言模型工具使用声明的低成本诊断阶梯 — 关键词匹配基准可能将小模型从未实际执行的工具使用错误地归功于它们。我们在一对架构匹配的西班牙安全语言……