Commit ·
4b441a6
0
Parent(s):
Duplicate from elbruno/Qwen3-TTS-12Hz-0.6B-CustomVoice-ONNX
Browse filesCo-authored-by: Bruno Capuano <elbruno@users.noreply.huggingface.co>
- .gitattributes +38 -0
- README.md +50 -0
- code_predictor.onnx +3 -0
- embeddings/codec_head_weight.npy +3 -0
- embeddings/config.json +61 -0
- embeddings/cp_codec_embedding_0.npy +3 -0
- embeddings/cp_codec_embedding_1.npy +3 -0
- embeddings/cp_codec_embedding_10.npy +3 -0
- embeddings/cp_codec_embedding_11.npy +3 -0
- embeddings/cp_codec_embedding_12.npy +3 -0
- embeddings/cp_codec_embedding_13.npy +3 -0
- embeddings/cp_codec_embedding_14.npy +3 -0
- embeddings/cp_codec_embedding_2.npy +3 -0
- embeddings/cp_codec_embedding_3.npy +3 -0
- embeddings/cp_codec_embedding_4.npy +3 -0
- embeddings/cp_codec_embedding_5.npy +3 -0
- embeddings/cp_codec_embedding_6.npy +3 -0
- embeddings/cp_codec_embedding_7.npy +3 -0
- embeddings/cp_codec_embedding_8.npy +3 -0
- embeddings/cp_codec_embedding_9.npy +3 -0
- embeddings/speaker_ids.json +11 -0
- embeddings/talker_codec_embedding.npy +3 -0
- embeddings/text_embedding.npy +3 -0
- embeddings/text_projection_fc1_bias.npy +3 -0
- embeddings/text_projection_fc1_weight.npy +3 -0
- embeddings/text_projection_fc2_bias.npy +3 -0
- embeddings/text_projection_fc2_weight.npy +3 -0
- talker_decode.onnx +3 -0
- talker_decode.onnx.data +3 -0
- talker_prefill.onnx +3 -0
- talker_prefill.onnx.data +3 -0
- tokenizer/merges.txt +0 -0
- tokenizer/vocab.json +0 -0
- vocoder.onnx +3 -0
- vocoder.onnx.data +3 -0
.gitattributes
ADDED
|
@@ -0,0 +1,38 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
*.7z filter=lfs diff=lfs merge=lfs -text
|
| 2 |
+
*.arrow filter=lfs diff=lfs merge=lfs -text
|
| 3 |
+
*.bin filter=lfs diff=lfs merge=lfs -text
|
| 4 |
+
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
| 5 |
+
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
| 6 |
+
*.ftz filter=lfs diff=lfs merge=lfs -text
|
| 7 |
+
*.gz filter=lfs diff=lfs merge=lfs -text
|
| 8 |
+
*.h5 filter=lfs diff=lfs merge=lfs -text
|
| 9 |
+
*.joblib filter=lfs diff=lfs merge=lfs -text
|
| 10 |
+
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
| 11 |
+
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
| 12 |
+
*.model filter=lfs diff=lfs merge=lfs -text
|
| 13 |
+
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
| 14 |
+
*.npy filter=lfs diff=lfs merge=lfs -text
|
| 15 |
+
*.npz filter=lfs diff=lfs merge=lfs -text
|
| 16 |
+
*.onnx filter=lfs diff=lfs merge=lfs -text
|
| 17 |
+
*.ot filter=lfs diff=lfs merge=lfs -text
|
| 18 |
+
*.parquet filter=lfs diff=lfs merge=lfs -text
|
| 19 |
+
*.pb filter=lfs diff=lfs merge=lfs -text
|
| 20 |
+
*.pickle filter=lfs diff=lfs merge=lfs -text
|
| 21 |
+
*.pkl filter=lfs diff=lfs merge=lfs -text
|
| 22 |
+
*.pt filter=lfs diff=lfs merge=lfs -text
|
| 23 |
+
*.pth filter=lfs diff=lfs merge=lfs -text
|
| 24 |
+
*.rar filter=lfs diff=lfs merge=lfs -text
|
| 25 |
+
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
| 26 |
+
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
| 27 |
+
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
| 28 |
+
*.tar filter=lfs diff=lfs merge=lfs -text
|
| 29 |
+
*.tflite filter=lfs diff=lfs merge=lfs -text
|
| 30 |
+
*.tgz filter=lfs diff=lfs merge=lfs -text
|
| 31 |
+
*.wasm filter=lfs diff=lfs merge=lfs -text
|
| 32 |
+
*.xz filter=lfs diff=lfs merge=lfs -text
|
| 33 |
+
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
+
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
+
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
| 36 |
+
talker_decode.onnx.data filter=lfs diff=lfs merge=lfs -text
|
| 37 |
+
talker_prefill.onnx.data filter=lfs diff=lfs merge=lfs -text
|
| 38 |
+
vocoder.onnx.data filter=lfs diff=lfs merge=lfs -text
|
README.md
ADDED
|
@@ -0,0 +1,50 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
---
|
| 2 |
+
license: apache-2.0
|
| 3 |
+
tags:
|
| 4 |
+
- onnx
|
| 5 |
+
- tts
|
| 6 |
+
- qwen3-tts
|
| 7 |
+
- text-to-speech
|
| 8 |
+
base_model: Qwen/Qwen3-TTS-12Hz-0.6B-CustomVoice
|
| 9 |
+
---
|
| 10 |
+
|
| 11 |
+
# Qwen3-TTS 12Hz 0.6B CustomVoice — ONNX
|
| 12 |
+
|
| 13 |
+
ONNX export of [Qwen/Qwen3-TTS-12Hz-0.6B-CustomVoice](https://huggingface.co/Qwen/Qwen3-TTS-12Hz-0.6B-CustomVoice) for local inference with C# / ONNX Runtime.
|
| 14 |
+
|
| 15 |
+
## Files
|
| 16 |
+
|
| 17 |
+
| File | Description | Size |
|
| 18 |
+
|------|-------------|------|
|
| 19 |
+
| `talker_prefill.onnx` + `.data` | Talker LM prefill (28 layers) | ~1.7 GB |
|
| 20 |
+
| `talker_decode.onnx` + `.data` | Talker LM single-step decode | ~1.7 GB |
|
| 21 |
+
| `code_predictor.onnx` | Code Predictor (5 layers, 15 groups) | ~420 MB |
|
| 22 |
+
| `vocoder.onnx` + `.data` | Vocoder decoder (24kHz output) | ~437 MB |
|
| 23 |
+
| `embeddings/` | Text/codec embeddings as .npy + config | ~1.4 GB |
|
| 24 |
+
| `tokenizer/` | BPE tokenizer (vocab.json, merges.txt) | ~4 MB |
|
| 25 |
+
|
| 26 |
+
## Usage with C#
|
| 27 |
+
|
| 28 |
+
```bash
|
| 29 |
+
# Clone the app repo
|
| 30 |
+
git clone https://github.com/elbruno/qwen-labs-cs.git
|
| 31 |
+
cd qwen-labs-cs
|
| 32 |
+
|
| 33 |
+
# Download models
|
| 34 |
+
python python/download_onnx_models.py --repo-id elbruno/Qwen3-TTS-12Hz-0.6B-CustomVoice-ONNX
|
| 35 |
+
|
| 36 |
+
# Run
|
| 37 |
+
dotnet run --project src/QwenTTS -- --model-dir python/onnx_runtime --text "Hello world" --speaker ryan --language english
|
| 38 |
+
```
|
| 39 |
+
|
| 40 |
+
## Architecture
|
| 41 |
+
|
| 42 |
+
- **Talker**: 28 transformer layers, 16 attn heads, 8 KV heads, hidden=1024
|
| 43 |
+
- **Code Predictor**: 5 layers, generates codebook groups 1-15
|
| 44 |
+
- **Vocoder**: RVQ dequantize → transformer → BigVGAN decoder, 12Hz → 24kHz (1920× upsample)
|
| 45 |
+
- **KV Cache**: Decode uses stacked format (num_layers, B, num_kv_heads, T, head_dim)
|
| 46 |
+
- **Speakers**: serena, vivian, uncle_fu, ryan, aiden, ono_anna, sohee, eric, dylan
|
| 47 |
+
|
| 48 |
+
## License
|
| 49 |
+
|
| 50 |
+
Apache-2.0 (same as base model)
|
code_predictor.onnx
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4e741d1e16ba61ca446b060b16d2da9519b11d18aae5d7bbbfcd273745a38225
|
| 3 |
+
size 440686845
|
embeddings/codec_head_weight.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:b54db90bbad7148ddb49eb9c693d0956055e80bcd7c6f985293d7da050f0adc6
|
| 3 |
+
size 12583040
|
embeddings/config.json
ADDED
|
@@ -0,0 +1,61 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"talker": {
|
| 3 |
+
"hidden_size": 1024,
|
| 4 |
+
"text_hidden_size": 2048,
|
| 5 |
+
"vocab_size": 3072,
|
| 6 |
+
"num_hidden_layers": 28,
|
| 7 |
+
"num_attention_heads": 16,
|
| 8 |
+
"num_key_value_heads": 8,
|
| 9 |
+
"head_dim": 128,
|
| 10 |
+
"num_code_groups": 16,
|
| 11 |
+
"codec_eos_token_id": 2150,
|
| 12 |
+
"codec_think_id": 2154,
|
| 13 |
+
"codec_nothink_id": 2155,
|
| 14 |
+
"codec_think_bos_id": 2156,
|
| 15 |
+
"codec_think_eos_id": 2157,
|
| 16 |
+
"codec_pad_id": 2148,
|
| 17 |
+
"codec_bos_id": 2149,
|
| 18 |
+
"rope_theta": 1000000
|
| 19 |
+
},
|
| 20 |
+
"code_predictor": {
|
| 21 |
+
"hidden_size": 1024,
|
| 22 |
+
"vocab_size": 2048,
|
| 23 |
+
"num_hidden_layers": 5,
|
| 24 |
+
"num_attention_heads": 16,
|
| 25 |
+
"num_key_value_heads": 8,
|
| 26 |
+
"head_dim": 128,
|
| 27 |
+
"rope_theta": 1000000
|
| 28 |
+
},
|
| 29 |
+
"tts": {
|
| 30 |
+
"tts_bos_token_id": 151672,
|
| 31 |
+
"tts_eos_token_id": 151673,
|
| 32 |
+
"tts_pad_token_id": 151671,
|
| 33 |
+
"im_start_token_id": 151644,
|
| 34 |
+
"im_end_token_id": 151645
|
| 35 |
+
},
|
| 36 |
+
"language_ids": {
|
| 37 |
+
"chinese": 2055,
|
| 38 |
+
"english": 2050,
|
| 39 |
+
"german": 2053,
|
| 40 |
+
"italian": 2070,
|
| 41 |
+
"portuguese": 2071,
|
| 42 |
+
"spanish": 2054,
|
| 43 |
+
"japanese": 2058,
|
| 44 |
+
"korean": 2064,
|
| 45 |
+
"french": 2061,
|
| 46 |
+
"russian": 2069,
|
| 47 |
+
"beijing_dialect": 2074,
|
| 48 |
+
"sichuan_dialect": 2062
|
| 49 |
+
},
|
| 50 |
+
"speaker_dialect": {
|
| 51 |
+
"serena": false,
|
| 52 |
+
"vivian": false,
|
| 53 |
+
"uncle_fu": false,
|
| 54 |
+
"ryan": false,
|
| 55 |
+
"aiden": false,
|
| 56 |
+
"ono_anna": false,
|
| 57 |
+
"sohee": false,
|
| 58 |
+
"eric": "sichuan_dialect",
|
| 59 |
+
"dylan": "beijing_dialect"
|
| 60 |
+
}
|
| 61 |
+
}
|
embeddings/cp_codec_embedding_0.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:9b1bd89a06be7fc6eb07e6b03d6d3fdc4762b5d0e0db124d74c608c0638082e3
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_1.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f0d6e187dec6f037980e38911b27016c0531bb34718bb96ccb954366fc495d21
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_10.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0e6d1bd968d39d53064bf430a0117cd83d452ee3ecf78dbe2648ad4b783d9091
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_11.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c9a1cb9ed2749c9f94fc29a939afdbb8ec341ba3f734c10b507f82a441a7c20e
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_12.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4cc774bda9a3b868461a36d08cd92370b71e162589598d1796b66fd1bb0520d1
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_13.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bf0454c373ff115501d1642675125146e92d91703442ffdf87a35a7b4fe94919
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_14.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:57cb0ce39de77611a7be8f3932debe3a2fa9eba9189e7b3fac890c482ce9a8ba
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_2.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5ae15feb83dc7f97e6f939fe98c9dda91c08749c2a69384d71a8414166792825
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_3.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:2d740ecfaa6591dcf014570a322192dd022f169bcca80849c41801ff496a866a
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_4.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3b466f7d3213b7a8b29381ee47338a9ac4de30460ac3d2defdaceaa0bab657e2
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_5.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:494fde5327423a7462d5e3063dcd8f2ad87de411fe5093c587cf8e56b3ae53df
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_6.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e6d6780db3685caee084edbce3b2517e5fa52b6a077890dff9c14b6638bfb564
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_7.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4d10c51b112e7188062a712e0d664a22dd448cea52ed102e094943c871ec3577
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_8.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3bc9ba51d40d91be04f478d9330363af3d1ac1218144e7bf0c8b920bd4d1832a
|
| 3 |
+
size 8388736
|
embeddings/cp_codec_embedding_9.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:41add7203fe62f322fa66ad353d5a91f265413a5c711681769d5979e526ced51
|
| 3 |
+
size 8388736
|
embeddings/speaker_ids.json
ADDED
|
@@ -0,0 +1,11 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"serena": 3066,
|
| 3 |
+
"vivian": 3065,
|
| 4 |
+
"uncle_fu": 3010,
|
| 5 |
+
"ryan": 3061,
|
| 6 |
+
"aiden": 2861,
|
| 7 |
+
"ono_anna": 2873,
|
| 8 |
+
"sohee": 2864,
|
| 9 |
+
"eric": 2875,
|
| 10 |
+
"dylan": 2878
|
| 11 |
+
}
|
embeddings/talker_codec_embedding.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:65a94ed3c86cb17e40504a581c746b274a4e56ba200c6f99f383a1bb6274cfbd
|
| 3 |
+
size 12583040
|
embeddings/text_embedding.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:210383e70be9dd7f5debcfcb24acb0de9c111836dd4920bc545b4cd8dd35956b
|
| 3 |
+
size 1244659840
|
embeddings/text_projection_fc1_bias.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e9a50b7668d089b5fc250f15a61941b97e573e43430587be06c404cbe447c5dc
|
| 3 |
+
size 8320
|
embeddings/text_projection_fc1_weight.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4b39093c0011eca2a955fcd272a7165271e3a37ff0d24ab51d5cfa60925b77af
|
| 3 |
+
size 16777344
|
embeddings/text_projection_fc2_bias.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e66b17cef017c40c37970d27a626171d9a75ab4729fdab7843f8d1f9e9ce7963
|
| 3 |
+
size 4224
|
embeddings/text_projection_fc2_weight.npy
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:104adb52eabb786a4e26696b323e11a92e4b3568849c04960e907ac44d687b4d
|
| 3 |
+
size 8388736
|
talker_decode.onnx
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:1a0ba437c0c39a011eddfbb43e2838e8eadfcc46021b2cdd5c7d562597935296
|
| 3 |
+
size 4718468
|
talker_decode.onnx.data
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:389276b5ef745a38a5d9a5a4e5a39746ed590643f9cd3571eb8d6125c93bfd6e
|
| 3 |
+
size 1774452736
|
talker_prefill.onnx
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:cbd0bf1cd0ccc66a68d2238ae64622c6e033b7b50e1a0b7bc64d1758ec94c113
|
| 3 |
+
size 4617430
|
talker_prefill.onnx.data
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:389276b5ef745a38a5d9a5a4e5a39746ed590643f9cd3571eb8d6125c93bfd6e
|
| 3 |
+
size 1774452736
|
tokenizer/merges.txt
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
tokenizer/vocab.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
vocoder.onnx
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4ee20178c7ab322891ce412d92edcfbade2e5e94a8cffe054e17b760fc764e45
|
| 3 |
+
size 2712067
|
vocoder.onnx.data
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f4cd93d2b48b833a6aaca7d5a3c95dd99853baba565514cb91777e3ce3c4cc8d
|
| 3 |
+
size 456261632
|