Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- PalmClaw:面向手机的原生端侧 Agent 框架 — LLM Agent 已不再局限于生成回复,而是通过调用工具、观察结果并迭代决定下一步操作来执行多步任务……
- 鲁棒性的假象:在任务无关上下文下,整体准确率掩盖了预测翻转 — 随着 LLM 能力日益增强,它们被越来越多地部署在上下文丰富的场景中,任务输入常伴随冗长且部分无关的内容……
- 无参考答案时,LLM 评判可能过于宽松 — LLM 评判正越来越多地被用于评估开放式模型回复,常用于无标准答案的场景。然而,在这种情况下它们能否可靠……
- 评估 LLM 在多轮医疗对话中对错误认知的识别能力 — 寻求医疗信息的患者常会提出带有错误假设或误解的问题。在此情形下,安全的医疗沟通不仅需要回答……
- LLM 能编写可靠的评分标准吗?面向实验复现的元评估 — 基于评分标准的评估是评估 LLM 研究 Agent 开放式输出的一种有前景的方法,尤其适用于论文复现场景,其中直接进行论文到代码仓库的对比……