Instructions to use OpenFormosa/PangolinTokenizer with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use OpenFormosa/PangolinTokenizer with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("OpenFormosa/PangolinTokenizer", device_map="auto") - Notebooks
- Google Colab
- Kaggle
|
Download README.md from OpenFormosa/PangolinTokenizer: direct link, hf CLI and curl.
- Browser
- Download file 1.61 kB
-
https://huggingface.co/OpenFormosa/PangolinTokenizer/resolve/82e506e0a6574454c826e805c269326120571f63/README.md
- Command line
-
hf download hf://OpenFormosa/PangolinTokenizer@82e506e0a6574454c826e805c269326120571f63/README.md
-
curl -L -o README.md https://huggingface.co/OpenFormosa/PangolinTokenizer/resolve/82e506e0a6574454c826e805c269326120571f63/README.md
1.61 kB
| license: other | |
| library_name: transformers | |
| tags: | |
| - tokenizer | |
| - byte-level-bpe | |
| - traditional-chinese | |
| - taiwan | |
| - multilingual | |
| # PangolinTokenizer | |
| Byte-level BPE tokenizer trained for Traditional Chinese, Taiwan text, multilingual | |
| text, rich transcription, OCR-style text, and generic multimodal control formats. | |
| ## Usage | |
| ```python | |
| from transformers import AutoTokenizer | |
| tokenizer = AutoTokenizer.from_pretrained( | |
| "voidful/PangolinTokenizer", | |
| trust_remote_code=False, | |
| ) | |
| text = "<|system|>台灣健保與注音ㄅㄆㄇ,Tailo: Tâi-uân" | |
| ids = tokenizer.encode(text) | |
| decoded = tokenizer.decode(ids) | |
| ``` | |
| ## Files | |
| - `config.json` | |
| - `tokenizer_config.json` | |
| - `tokenizer.json` | |
| - `vocab.json` | |
| - `merges.txt` | |
| - `special_tokens_map.json` | |
| - `evaluation_report.json` | |
| ## Tokenizer Details | |
| - Type: Byte-level BPE | |
| - Vocabulary size: 114,688 | |
| - Learned merges: 114,397 | |
| - Model max length metadata: 131,072 | |
| - Minimum merge frequency: 5 | |
| - Transformers class: `GPT2TokenizerFast` | |
| - `trust_remote_code`: not required | |
| ## Safety Notes | |
| This tokenizer intentionally does not include discrete audio codec token ranges. | |
| It also intentionally does not include dense timestamp token ranges. Audio should | |
| be represented through external references or embeddings outside this tokenizer. | |
| Evaluation checks confirmed: | |
| - Transformers `AutoTokenizer` loading works with `trust_remote_code=False` | |
| - Traditional Chinese and Bopomofo smoke roundtrip works | |
| - No tokens matching `<|audio_[0-9]+|>` | |
| - No dense timestamp token ranges matching `<|ts_[0-9]+|>`, | |
| `<|timestamp_[0-9]+|>`, or `<|time_[0-9]+|>` | |