GigaAM Multilingual: Foundation Model for Underrepresented Languages

  • 类型:arxiv
  • 标识:2607.10371
  • 链接:https://arxiv.org/abs/2607.10371
  • 主分类:engineering
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar + OpenAlex
  • S2被引:0
  • OpenAlex被引:0
  • 影响力被引:0
  • TLDR:This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages by presenting GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective, and introduces a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance.
  • OpenAlex ID:W7168294649
  • OpenAlex DOI:10.48550/arxiv.2607.10371
  • DOI:10.48550/arxiv.2607.10371
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://doi.org/10.48550/arxiv.2607.10371
  • OpenAlex更新:2026-08-24
  • 待LLM分类:否
  • 标题中文:GigaAM Multilingual:面向代表性不足语言的基础模型
  • TLDR中文:本文针对中亚低资源语言构建鲁棒基础模型的挑战,提出 GigaAM Multilingual:一个基于 HuBERT 风格目标在 2M 小时音频上预训练的 Conformer encoder,并在预训练阶段引入 cluster 级的数据均衡策略,在微调阶段引入域感知采样方法,以缓解头部语言主导问题。
  • 来源文件
  • /inbox/tom/_candidates/2026-07-21-agent-rag-longcontext-candidates.json
  • [S2 enrich]
  • [OpenAlex backfill]