Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- LittleLearner: 教学受控知识暴露下的语言模型 — 现代语言模型在异构的网络规模文本语料上进行训练。因此,研究知识与技能的习得十分困难,因为对相关内容的先前暴露……
- SAEVerbalizer: 通过表征语言化生成稀疏自编码器特征的解释 — 稀疏自编码器(SAE)被提出用于从大语言模型(LLM)表征中提取大量特征,但解释这些特征仍主要依赖外部……
- DFM Mimir v1: 仅使用合规后训练数据在 1B 参数上达到前沿性能的开放 HRM — 当前大语言模型开发依赖大规模且通常不合规的数据集,这为致力于开源与伦理来源数据的研究者设置了较高门槛……
- 跨语言模型预训练度量与任务无关的训练数据影响 — 在语言模型预训练全过程一致地度量训练数据的影响具有挑战性。难以选择能代表……
- 迈向 Gricean 式退让:探查 LLM 的知识边界与所指特异性 — 当被问及知识边界之外的实体时,LLM 常常编造听起来合理的细节,而非退回到更安全、更一般化的陈述。我们将此框定为……