GigaAM Multilingual: Foundation Model for Underrepresented Languages
- 类型:arxiv
- 标识:2607.10371
- 链接:https://arxiv.org/abs/2607.10371
- 主分类:engineering
- 形态:method
- 被引:0
- 被引来源:Semantic Scholar + OpenAlex
- S2被引:0
- OpenAlex被引:0
- 影响力被引:0
- TLDR:This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages by presenting GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective, and introduces a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance.
- OpenAlex ID:W7168294649
- OpenAlex DOI:10.48550/arxiv.2607.10371
- DOI:10.48550/arxiv.2607.10371
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.10371
- OpenAlex更新:2026-08-24
- 待LLM分类:否
- 标题中文:GigaAM Multilingual:面向代表性不足语言的基础模型
- TLDR中文:本文针对中亚低资源语言构建鲁棒基础模型的挑战,提出 GigaAM Multilingual:一个基于 HuBERT 风格目标在 2M 小时音频上预训练的 Conformer encoder,并在预训练阶段引入 cluster 级的数据均衡策略,在微调阶段引入域感知采样方法,以缓解头部语言主导问题。
- 来源文件:
- /inbox/tom/_candidates/2026-07-21-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]