GGUF
Japanese
How to use from
Unsloth Studio
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh
# Run unsloth studio
unsloth studio -H 0.0.0.0 -p 8888
# Then open http://localhost:8888 in your browser
# Search for WariHima/drafters-gemma4-ja-v1-gguf to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex
# Run unsloth studio
unsloth studio -H 0.0.0.0 -p 8888
# Then open http://localhost:8888 in your browser
# Search for WariHima/drafters-gemma4-ja-v1-gguf to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required
# Open https://huggingface.co/spaces/unsloth/studio in your browser
# Search for WariHima/drafters-gemma4-ja-v1-gguf to start chatting
Quick Links

drafters gemma4 ja v1 gguf

gemma4モデル用の、ドラフトモデル専用のモデルです。そのため単体での生成は不可能です
上流のllama.cppで使えます。(それ以外の環境は試していない)

量子化形式

bf16モデル
tq1_0モデル (おすすめ)

解説

gemma4トークナイザは語彙が約260kあり、その中で日本語に相当するものはごくわずかです。

gemma4トークナイザを使用して日本語トークンを出力し、 ターゲットモデルの出力時間のなかで、
ドラフト出力トークン数 > (ドラフトモデルのtoken/s) / (ターゲットモデルのtoken/s)
が成り立てば理論上速度が向上します。

ので、128dim、総パラメータ70mのqwen3nextアーキテクチャで作成し、ggufファイルはtq1_0を使用しました。

性能

rtx3060 faあり、gemma4-it-12b(q4_k_m) ドラフトモデルはtq1_0
の環境で軽く試したかぎりは26tk/sから31tk/sまで上がりました。
他のgemma4モデルでも多分動く、はず?


architecture

qwen3next model
tokenizer from google/gemma-4-12B

train

training code in ./training_codes
少量のwikipediaデータでフルスクラッチ学習しました。 学習にかかった時間はrtx3060一枚で約3時間ほど。

Downloads last month
567
GGUF
Model size
72.3M params
Architecture
qwen3next
Hardware compatibility
Log In to add your hardware

1-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for WariHima/drafters-gemma4-ja-v1-gguf

Quantized
(1)
this model

Collection including WariHima/drafters-gemma4-ja-v1-gguf