parakeet-tdt-0.6b-v3 โ€” fp16 ONNX

fp16 conversion of istupakov/parakeet-tdt-0.6b-v3-onnx (same graph layout: encoder-model + fused decoder_joint-model, .fp16 suffix), made with onnxruntime's transformers.float16 converter (keep_io_types=True, path-based shape inference for the >2GB encoder). I/O stays fp32, weights/compute fp16.

Verified vs the fp32 export: random-input parity cos โ‰ˆ 1.0, and END-TO-END transcripts are byte-identical on DirectML while decoding ~2ร— faster (66 s clip: 231 ms vs 459 ms warm, RTX 3080 Ti; encoder 92 ms vs 300 ms). Half the download/VRAM of fp32.

Made for WinSTT.

Downloads last month
66
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for Masterx/parakeet-tdt-0.6b-v3-fp16-onnx

Quantized
(64)
this model