Instructions to use OpenFormosa/PangolinTokenizer with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use OpenFormosa/PangolinTokenizer with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("OpenFormosa/PangolinTokenizer", device_map="auto") - Notebooks
- Google Colab
- Kaggle
|
Download README.md from OpenFormosa/PangolinTokenizer: direct link, hf CLI and curl.
- Browser
- Download file 1.61 kB
-
https://huggingface.co/OpenFormosa/PangolinTokenizer/resolve/82e506e0a6574454c826e805c269326120571f63/README.md
- Command line
-
hf download hf://OpenFormosa/PangolinTokenizer@82e506e0a6574454c826e805c269326120571f63/README.md
-
curl -L -o README.md https://huggingface.co/OpenFormosa/PangolinTokenizer/resolve/82e506e0a6574454c826e805c269326120571f63/README.md
1.61 kB
metadata
license: other
library_name: transformers
tags:
- tokenizer
- byte-level-bpe
- traditional-chinese
- taiwan
- multilingual
PangolinTokenizer
Byte-level BPE tokenizer trained for Traditional Chinese, Taiwan text, multilingual text, rich transcription, OCR-style text, and generic multimodal control formats.
Usage
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained(
"voidful/PangolinTokenizer",
trust_remote_code=False,
)
text = "<|system|>台灣健保與注音ㄅㄆㄇ,Tailo: Tâi-uân"
ids = tokenizer.encode(text)
decoded = tokenizer.decode(ids)
Files
config.jsontokenizer_config.jsontokenizer.jsonvocab.jsonmerges.txtspecial_tokens_map.jsonevaluation_report.json
Tokenizer Details
- Type: Byte-level BPE
- Vocabulary size: 114,688
- Learned merges: 114,397
- Model max length metadata: 131,072
- Minimum merge frequency: 5
- Transformers class:
GPT2TokenizerFast trust_remote_code: not required
Safety Notes
This tokenizer intentionally does not include discrete audio codec token ranges. It also intentionally does not include dense timestamp token ranges. Audio should be represented through external references or embeddings outside this tokenizer.
Evaluation checks confirmed:
- Transformers
AutoTokenizerloading works withtrust_remote_code=False - Traditional Chinese and Bopomofo smoke roundtrip works
- No tokens matching
<|audio_[0-9]+|> - No dense timestamp token ranges matching
<|ts_[0-9]+|>,<|timestamp_[0-9]+|>, or<|time_[0-9]+|>