Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- 超越分数:理解 LLM 作为裁判在摘要评估中的机制 — 基于 LLM 的自然语言生成(NLG)质量评估器被广泛用作评分工具和自动训练信号,但其内部评判过程……
- CordisBench:语言模型能否推理动态 Agent Harness 中的组件生命周期? — 动态 Agent Harness 允许语言模型改变塑造其自身执行的软件。这种灵活性带来了新的推理负担:局部插件变更可能传播……
- 言语强化学习的崛起 — 自然语言正成为改进语言 Agent 的主要反馈通道,能够以模型可解释的形式传达意图、偏好和因果结构……
- StudentSim:训练基于 LLM 的学生模拟器 — AI 导师在适应每个学生的优势、弱点和偏好的指导方式时最为有效,但关于哪种指导适用于哪类学生的证据稀缺且生成缓慢……
- 弥合文档 VLM 的成本-质量差距:难度感知的数据策展与质量调整的部署经济学 — 在受监管行业中,每年从数亿份文档中提取结构化字段仍然成本高昂:定制化的 OCR 级联仅覆盖部分工作流程,私……