Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- 通过选择性上下文偏好优化学习何时信任 — 语言模型越来越依赖外部信号来给出答案,而单一误导性信号就可能将正确答案变成错误。最直接的应对方案是训练模型抵抗此类干扰……
- 工具调用的苦涩教训 — 工具使用使 LLM 转变为能在训练数据之外操作的 Agent;对于具备代码能力的模型,程序化工具调用通过用代码替代僵化的 JSON 调用进一步扩展了这一能力……
- RP-OPSD:推理支点引导的 On-Policy 自蒸馏用于多语言推理迁移 — 多语言推理迁移对于将大语言模型(LLM)的推理能力扩展到高资源语言之外至关重要。On-Policy 自蒸馏(OPSD)……
- 对基准的基准测试:对话 Agent 基准评估 — 任务型对话 Agent 通常使用人工策划或自动生成的基准进行评估,但基准本身的质量却鲜少被审视。低质量基准可能存在不一致……
- LLM 在国家标准文档规则密集型审查中的基准测试与增强 — 大语言模型(LLM)越来越多地支持复杂专业任务,但其规则密集型文档审查能力仍缺乏充分评估。国家标准……