Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- SocietyBench:反事实社会世界演化预测 — 大语言模型(LLMs)及其上构建的 agents 目前被大量基准测试,检验它们能否完成任务——修复 bug、操控浏览器、操作 GUI。……
- WorldCup Arena:前沿 LLMs 在实时赛事上的前瞻性、无泄漏评估 — 衡量大语言模型预测能力的基准几乎都是回顾性的:事件已发生,答案就在 Web 上的某处,评估……
- TurnSight:面向工具集成推理的轮级事后自蒸馏 — 工具集成推理(TIR)使 LLMs 能通过迭代工具交互解决复杂任务。然而,现有强化学习方法往往依赖轨迹级……
- PAST-Bench:个人 agents 中递归自我改进基础的基准测试 — 递归自我改进要求 agents 将积累的经验转化为更好的未来行为。个人 AI agents 为研究该能力提供了具体场景,因为……
- 当注意力失效:ALiBi 位置编码中的数值故障 — 我们发现 ALiBi 位置编码中一个此前被忽视的失效模式:其线性偏置缩放在浮点精度下发生下溢,使大量注意力……