Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- Learning When to Trust via Selective Context Preference Optimization — 语言模型越来越依赖外部信号来回答问题,而一个误导性信号就可能让正确答案变成错误。显而易见的补救方法是训练模型抵御此类干扰……
- The Bitter Lesson of Tool Calling — 工具使用将 LLM 转变为能在训练数据之外采取行动的 Agent;对于具备代码能力的模型,程序化工具调用通过用动态生成的多语言代码替换僵化的 JSON 调用,进一步延伸了这一能力……
- RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer — 多语言推理迁移对于将大语言模型(LLM)的推理能力扩展到高资源语言之外至关重要。在线自蒸馏(OPSD)……
- Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents — 任务导向的对话 Agent 通常使用人工构建或自动生成的 benchmark 进行评估,但 benchmark 本身的质量却很少被审视。低质量 benchmark 可能包含不一致……
- Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents — 大语言模型(LLM)越来越多地用于支持复杂的专业任务,但其在规则密集型文档审查方面的能力仍缺乏充分评估。国家标准……