Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- KaliBench:面向 Kali Linux 的细粒度网络安全工具调用基准,提供免运行时可验证奖励 — LLM 越来越多地应用于网络安全工作流,被期望将分析师意图转化为工具调用。然而,现有评测侧重于知识……
- 分层连续扩散语言模型 — 离散扩散语言模型为需要双向推理和全局约束满足的任务提供了相较自回归生成的优越替代方案。然而……
- AutoCompact:让长程编码 Agent 学习何时压缩上下文 — 编码 Agent 通过代码检视、搜索、编辑与测试的长轨迹解决仓库级软件工程任务。随着任务推进,早期探索……
- 从知识访问到来源学习:发展来源特定的胜任能力 — LLM Agent 越来越依赖持久化外部来源来解决一系列知识密集型任务。已有方法提升了来源内容如何……
- 关键词工具调用框架默认放行:面向小语言模型工具调用主张的低成本诊断阶梯 — 关键词匹配基准可能将小模型本未执行的工具调用误判为成功。我们在一对架构匹配的西班牙语安全语言模型中记录了此类误报……