Cool Papers · cs.CL (papers.cool) · RSS 摘要
信源:Cool Papers · cs.CL (papers.cool) · https://papers.cool/arxiv/cs.CL/feed
- 类型多样性使 Transformers 能够进行组合泛化 — 组合泛化已被分为词汇泛化和结构泛化。此前研究表明,对 Transformers 而言,结构泛化比词汇泛化更难……
- SAS:通过上下文排序端到端优化实现简单注意力稀疏化 — 后训练注意力稀疏化通过为每个查询选取少量上下文单元(token 或 block),从而降低预训练 Transformer 的二次累积注意力成本……
- 继续、适应或让步:全双工 Agent 在轮次内对重叠语音的适应 — 全双工评估通常关注 Agent 是继续说话还是停止,这种二元判断无法表达人类常用的第三种反应:在吸收重叠语音的同时继续说话……
- MoE 强化学习中的专家空间探索 — 强化学习(RL)已成为大语言模型后训练的核心。Mixture-of-Experts(MoE)模型的 RL 近期进展主要集中在改进……
- Kraken:基于 LLM 的语音到语音翻译,采用低比特率 VQ 与双路径源条件化 — 语音到语音翻译(S2ST)借助语音 LLM 取得了显著进展,具备联合优化并保留非语言信息的潜力。然而……