Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- 测量人类与 LLM 研究思路之间的差距 — LLM 越来越多地被用于头脑风暴研究思路,但现有评估主要根据新颖性、可行性或专家偏好来判断单个思路。我们转而提出:如何……
- 状态-预测分离假说 — Transformer 使用同一前向计算流来预测下一个 token 并存储对未来 token 预测有用的状态。我们形式化了状态-预测分离……
- 蒸馏以检测:通过 Cartridge 蒸馏暴露 LLM 中的隐性偏见 — 部署在高风险场景中的语言模型可能会偏向特定实体、品牌或观点,从而在大规模上引导用户决策。这类偏好性偏见可能难以察……
- 用于 AI 安全评估的对抗性语用学:指令冲突、嵌入命令与策略模糊性的基准 — 语言模型的安全评估越来越依赖于对模糊自然语言行为的判断:模型是否遵循了指令、是否恰当地拒绝……
- AGC-Bench:测量人工通用创造力 — 创造力研究一直在争论创造力是否是领域特定的(如视觉、写作、科学),以及它是否在心理测量上可与一般智力分离。这两个问……