PangolinTokenizer / README.md
voidful's picture
Upload Pangolin tokenizer
82e506e verified
|
Raw History Blame
1.61 kB
---
license: other
library_name: transformers
tags:
- tokenizer
- byte-level-bpe
- traditional-chinese
- taiwan
- multilingual
---
# PangolinTokenizer
Byte-level BPE tokenizer trained for Traditional Chinese, Taiwan text, multilingual
text, rich transcription, OCR-style text, and generic multimodal control formats.
## Usage
```python
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained(
"voidful/PangolinTokenizer",
trust_remote_code=False,
)
text = "<|system|>台灣健保與注音ㄅㄆㄇ,Tailo: Tâi-uân"
ids = tokenizer.encode(text)
decoded = tokenizer.decode(ids)
```
## Files
- `config.json`
- `tokenizer_config.json`
- `tokenizer.json`
- `vocab.json`
- `merges.txt`
- `special_tokens_map.json`
- `evaluation_report.json`
## Tokenizer Details
- Type: Byte-level BPE
- Vocabulary size: 114,688
- Learned merges: 114,397
- Model max length metadata: 131,072
- Minimum merge frequency: 5
- Transformers class: `GPT2TokenizerFast`
- `trust_remote_code`: not required
## Safety Notes
This tokenizer intentionally does not include discrete audio codec token ranges.
It also intentionally does not include dense timestamp token ranges. Audio should
be represented through external references or embeddings outside this tokenizer.
Evaluation checks confirmed:
- Transformers `AutoTokenizer` loading works with `trust_remote_code=False`
- Traditional Chinese and Bopomofo smoke roundtrip works
- No tokens matching `<|audio_[0-9]+|>`
- No dense timestamp token ranges matching `<|ts_[0-9]+|>`,
`<|timestamp_[0-9]+|>`, or `<|time_[0-9]+|>`