Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- UniClawBench:面向真实任务 proactive agents 的通用 benchmark — 大语言模型与多模态大语言模型的快速发展,加速了能够操作日常工具并协助日常工作的 proactive agents 的出现……
- LLMs 作为数据标注者的有效性:AMALIA 关于权威性的研究 — 国家语言模型为语言社区提供了衡量公民言论与价值观的工具。葡萄牙的 AMALIA 是一个由公共资助的 9B 参数模型……
- 你需要前沿模型作为引文核验器吗?面向深度研究来源归因的 Rubric LLMs benchmark — 强化学习越来越依赖 LLM judge 对每条 rubric 标准进行评分,该 judge 在训练中充当 reward model。在此类信号可信之前……
- WebSwarm:面向深度与广度 Web 搜索的递归多 Agent 编排 — 基于 LLM 的 Web 搜索 agent 正将信息获取从简单的事实型问答,转变为复杂、深度与广度兼具的搜索与研究导向型任务……
- UltraX:通过自适应程序化编辑实现大规模预训练数据精炼 — 随着可用训练数据逼近其物理极限,Scaling Laws 带来的收益开始递减。因此,提升 LLMs 已较少依赖……