RaghavAgrawal5/nepali-devanagari-tokenizer-retrofit

  • 类型:github
  • 标识:RaghavAgrawal5/nepali-devanagari-tokenizer-retrofit
  • 链接:https://github.com/RaghavAgrawal5/nepali-devanagari-tokenizer-retrofit
  • 主题:llm-infra, engineering
  • 主分类:rag
  • 形态:app
  • 分类:academic-writing
  • Stars:0
  • 周增:+0
  • 语言:Python
  • 许可:MIT
  • 最近提交:2026-08-11
  • 简介:Reproducible research pipeline that reduces Nepali Devanagari tokenization tax by retrofitting a pretrained LLM tokenizer: continued/grapheme-aware BPE candidate mining, greedy marginal-gain vocabulary selection, ID-preserving merge splicing, decomposition-based embedding init, and embedding-only/LoRA/CPT adaptation. Tuned for a 6GB laptop GPU.
  • 上次采集:2026-08-11
  • 首次采集:2026-08-11
  • 学术状态:accepted
  • 学术阶段:research
  • 学术主任务:reproducibility
  • 学术方向:misc
  • 学术用途:research-design
  • 学术相关度:80
  • 学术判定:deterministic
  • 学术证据:anchor:research; task:reproducibility:reproducible research
  • 学术复核时间:2026-08-11T22:01:03+08:00
  • 待LLM分类:否
  • 成熟度:experimental
  • 简介中文:可复现研究流程,通过改造预训练 LLM tokenizer 降低尼泊尔天城文分词成本:连续/字素感知的 BPE 候选挖掘、基于边际增益的贪心词表选择、保留 ID 的 merge 拼接、基于分解的 embedding 初始化,以及 embedding-only/LoRA/CPT 适配;面向 6GB 笔记本 GPU 调优。
  • 来源文件
  • [GitHub Search]