基于 HuggingFace Tokenizers 训练自定义分词器
在大模型开发流程中,分词器(Tokenizers)是文本预处理的核心组件。神经网络无法直接理解人类的原始文本,分词器的核心作用,就是将自然语言转换为模型可用于计算的数值序列。Hugging Face Tokenizers 是底层由 Rust 编写的高性能开源分词库,原生支持 BPE、WordPiece、Unigram 等多种分词算法,内置批量处理、padding、truncate 等能力,可适配绝大多数开源大模型。本文将编写分词器训练脚本,基于高质量语料,参考 Qwen3 分词器的设计思路,从零训练一套自定义分词词典,为后续自研大模型的训练搭建词典基座。