Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- 通过选择性上下文偏好优化学习何时信任 — 语言模型越来越多地依据外部信号来调整其回答,而单一误导性信号就可能把正确答案变为错误。显而易见的解决方案是训练模型抵御误…
- 工具调用的苦涩教训 — 工具使用使 LLM 转变为能在训练数据之外行动的 Agent,对于具备代码能力的模型,程序化工具调用通过用灵活的代码取代僵化的 JSON 调用进一步扩展了这种能力…
- RP-OPSD:面向多语言推理迁移的推理支点引导的 On-Policy 自蒸馏方法 — 多语言推理迁移对于将 LLM 的推理能力从高资源语言扩展到其他语言至关重要。On-Policy 自蒸馏(OPSD)…
- 评测基准的基准:对话 Agent 基准的评估 — 面向任务的对话 Agent 使用精心策划或自动生成的基准进行评估,但基准质量却很少被评估。低质量基准可能存在不一致…
- 针对国家标准文档规则密集型审查的 LLM 基准测试与增强 — LLM 越来越多地用于支持复杂专业任务,但其在规则密集型文档审查方面的能力仍缺乏充分评估。国家标准…