Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- UniClawBench: 面向真实任务主动型 Agent 的通用基准 — 大语言模型和多模态大语言模型的快速发展,加速了能够操作日常工具并协助用户的主动型 Agent 的出现
- LLM 作为数据标注者的有效性:AMALIA 在权威性方面的研究 — 国家语言模型为语言社区提供了衡量其公民所言所值的自有工具。葡萄牙的 AMALIA 是一个公开资助的 9B 参数模型……
- 你需要前沿模型作为引用验证器吗?面向深度研究来源归因的 Rubric LLM 基准测试 — 强化学习日益依赖 LLM judge 对每项 rubric 标准进行打分,该 judge 在训练中充当 reward model。在该信号可信使用之前……
- WebSwarm: 面向深且广 Web 搜索的递归多 Agent 编排 — 基于 LLM 的 Web 搜索 Agent 正在将信息获取从简单事实型问答,转变为复杂的深且广搜索与研究导向型任务……
- UltraX: 通过自适应程序化编辑大规模精炼预训练数据 — 随着可用训练数据逼近其物理极限,Scaling Laws 带来的增益开始减弱。因此,改进 LLM 已不再主要依赖……