RaghavAgrawal5/nepali-devanagari-tokenizer-retrofit
- 类型:github
- 标识:RaghavAgrawal5/nepali-devanagari-tokenizer-retrofit
- 链接:https://github.com/RaghavAgrawal5/nepali-devanagari-tokenizer-retrofit
- 主题:llm-infra, engineering
- 主分类:rag
- 形态:app
- 分类:academic-writing
- Stars:0
- 周增:+0
- 语言:Python
- 许可:MIT
- 最近提交:2026-08-11
- 简介:Reproducible research pipeline that reduces Nepali Devanagari tokenization tax by retrofitting a pretrained LLM tokenizer: continued/grapheme-aware BPE candidate mining, greedy marginal-gain vocabulary selection, ID-preserving merge splicing, decomposition-based embedding init, and embedding-only/LoRA/CPT adaptation. Tuned for a 6GB laptop GPU.
- 上次采集:2026-08-11
- 首次采集:2026-08-11
- 学术状态:accepted
- 学术阶段:research
- 学术主任务:reproducibility
- 学术方向:misc
- 学术用途:research-design
- 学术相关度:80
- 学术判定:deterministic
- 学术证据:anchor:research; task:reproducibility:reproducible research
- 学术复核时间:2026-08-11T22:01:03+08:00
- 待LLM分类:否
- 成熟度:experimental
- 简介中文:可复现研究流程,通过改造预训练 LLM tokenizer 降低尼泊尔天城文分词成本:连续/字素感知的 BPE 候选挖掘、基于边际增益的贪心词表选择、保留 ID 的 merge 拼接、基于分解的 embedding 初始化,以及 embedding-only/LoRA/CPT 适配;面向 6GB 笔记本 GPU 调优。
- 来源文件:
- [GitHub Search]