Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- UniClawBench:面向真实任务主动 Agent 的通用基准 — 大语言模型与多模态大语言模型的快速发展,加速了能够操作日常工具并辅助……
- LLM 作为数据标注者的有效性:以权威性为视角的 AMALIA — 国家级语言模型为语言社区提供了衡量其公民言行与价值观的自主工具。葡萄牙的 AMALIA 是一个公开资助的 9B 参数模型……
- 你需要前沿模型作为引用验证器吗?面向深度研究来源归因的 Rubric LLM 基准测试 — 强化学习日益依赖 LLM judge 对每条 rubric 标准进行评分,该 judge 在训练过程中充当 reward model。在此类信号能够被真正……
- WebSwarm:面向深且广 Web 搜索的递归多 Agent 编排 — 基于大语言模型(LLM)的 Web 搜索 Agent 正将信息获取从简单的事实型问答,转变为复杂的深且广搜索与研究导向型……
- UltraX:通过自适应程序化编辑大规模精炼预训练数据 — 随着可用训练数据逼近其物理极限,Scaling Laws 带来的收益开始递减。因此,大语言模型(LLM)的提升已越来越少地依赖……