--- license: apache-2.0 language: - ja - en - de - fr - it base_model: swiss-ai/Apertus-v1.5-8B library_name: mlx pipeline_tag: text-generation tags: - mlx - apertus - multilingual - quantized --- # Apertus-v1.5-8B (MLX 4bit, text LM) スイスAIイニシアチブの [Apertus-v1.5-8B](https://huggingface.co/swiss-ai/Apertus-v1.5-8B)(Apache-2.0・多言語・xIELU活性/QK-norm/llama3型RoPEスケーリングの独自アーキテクチャ)から**テキストLM部分を抽出してMLX変換**したものです(4bit量子化・group size 64・実効4.5bpw)。最軽量版(4.3GB・8GB Macでも動作見込み)です。 **このMLX版の価値**: 上流モデルはリリース版transformers/vLLMでは動かず、[swiss-ai専用フォーク](https://github.com/swiss-ai/transformers/tree/3797303dda74844e3d1f8977ff5518bb91f818b4)が必要ですが、この変換は**mlx-lm標準でそのまま動きます**(`pip install mlx-lm`のみ)。 **スコープ**: 元モデルは画像・音声入力対応のomniモデルですが、本repoは**テキスト専用**の抽出です(vision/audioトークナイザは含みません。埋め込みはテキスト出力語彙131,072行に切り詰め済み — テキスト対話のトークンIDはすべてこの範囲内であることを確認しています)。 ## 使い方 ```bash pip install mlx-lm python -m mlx_lm generate --model tokimoa/apertus-v1.5-8b-mlx-4bit --prompt "富士山の標高を教えてください。" --max-tokens 200 --temp 0.0 ``` **Deliberation(思考モード)に注意**: chat templateに思考モードのフラグがあり、mlx-lm経由の既定では**有効**(`<|inner_prefix|>`で内部推論を出力してから回答)、Hugging Face transformersの既定では無効になります。無効にしたい場合は`apply_chat_template`に`enable_thinking=False`を渡してください。 ## 変換品質の検証(tokimoa) transformers公式実装(swiss-aiフォーク・**CPU** bf16)との突き合わせ検証: - **同一入力でのprefillロジット比較: 日本語ビジネスプローブ5種すべてでtop-1トークン一致**。ただしcos類似度は0.93〜0.98で8bit版(0.999以上)よりノイズが乗ります。長い思考出力では文字列レベルのブレが出るため、品質重視なら[8bit版](https://huggingface.co/tokimoa/apertus-v1.5-8b-mlx-8bit)を推奨します - bf16版は反復実行で出力完全一致(決定論的) - 検証時の発見: 参照フォークは**MPS上では出力が破綻**します(縮退ループ)。参照はCPUで実行しました(変換品質とは無関係の上流問題) ## 実測速度(M4 Max 36GB) - 生成: 約75 tok/s / ピークメモリ: 4.7GB(重み4.3GB) ## 変換情報 - 変換元: `swiss-ai/Apertus-v1.5-8B`(公式BF16、commit a411d83)からテキストLM抽出(`model.language_model.*`→`model.*`・lm_head保持・embed切り詰め) - 変換: `mlx-lm 0.31.3` `convert -q --q-bits 4`(group size 64 affine、実効4.5bpw) - 兄弟repo: [bf16](https://huggingface.co/tokimoa/apertus-v1.5-8b-mlx-bf16)(参照一致検証の基準)/ [8bit](https://huggingface.co/tokimoa/apertus-v1.5-8b-mlx-8bit)(**推奨**) - 変換者: [tokimoa](https://tokimoa.jp) ## ライセンス Apache-2.0(元モデルに準拠)。上流の[利用ポリシー(AUP)](https://github.com/swiss-ai/apertus-legal/blob/main/apertus_1.5/USAGE_POLICY.pdf)も参照してください。