Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -22,7 +22,7 @@ pipeline_tag: text-generation
|
|
| 22 |
|
| 23 |
- アーキテクチャは素直な **LlamaForCausalLM**(Dense 33B・64層・語彙196,608の日本語特化トークナイザ・64kコンテキスト)
|
| 24 |
- **SM120(Blackwell)+ 素のvLLM v0.22.0** 向け。compressed-tensors自動判定、`--quantization`フラグ不要
|
| 25 |
-
- 量子化除外は `lm_head` のみ(視覚塔もMoEルーターも無い
|
| 26 |
|
| 27 |
## 実測(TP=4・32kコンテキスト・KV fp8・RTX PRO 2000 Blackwell ×4)
|
| 28 |
|
|
@@ -55,15 +55,15 @@ P2Pの無いボードでは `NCCL_P2P_DISABLE=1` と `--disable-custom-all-reduc
|
|
| 55 |
"chat_template_kwargs": {"reasoning_effort": "low"} // low / medium / high
|
| 56 |
```
|
| 57 |
|
| 58 |
-
## 検証
|
| 59 |
|
| 60 |
-
日本語の音韻課題(モーラ数え・俳句の音数走査・字余り検出)
|
| 61 |
|
| 62 |
-
- **effort=low**: 語のモーラ数え 10/12。俳句の音数走査はほぼ不能
|
| 63 |
-
- **effort=high**:
|
| 64 |
-
-
|
| 65 |
|
| 66 |
-
|
| 67 |
|
| 68 |
> 潮騒に 足あと残す 夕焼けかな
|
| 69 |
|
|
|
|
| 22 |
|
| 23 |
- アーキテクチャは素直な **LlamaForCausalLM**(Dense 33B・64層・語彙196,608の日本語特化トークナイザ・64kコンテキスト)
|
| 24 |
- **SM120(Blackwell)+ 素のvLLM v0.22.0** 向け。compressed-tensors自動判定、`--quantization`フラグ不要
|
| 25 |
+
- 量子化除外は `lm_head` のみ(視覚塔もMoEルーターも無いため)
|
| 26 |
|
| 27 |
## 実測(TP=4・32kコンテキスト・KV fp8・RTX PRO 2000 Blackwell ×4)
|
| 28 |
|
|
|
|
| 55 |
"chat_template_kwargs": {"reasoning_effort": "low"} // low / medium / high
|
| 56 |
```
|
| 57 |
|
| 58 |
+
## 検証記録 — reasoning_effort 別の観察(小規模)
|
| 59 |
|
| 60 |
+
日本語の音韻課題(モーラ数え12語・俳句の音数走査3句・字余り検出)を、当環境の汎用27B(Qwen3.8-27B NVFP4)と並べて試した記録です。**モデル2体・各課題1〜2回の小規模な検証**であり、一般化はできません。判断は結果を見てご自身で。
|
| 61 |
|
| 62 |
+
- **effort=low**: 語のモーラ数え 10/12(汎用27Bは11/12)。俳句の音数走査は両者ともほぼ不能。ひらがな分かち書きで渡すと両者とも正解した(表記→音の変換が律速で、数える力そのものはある、と読める挙動)
|
| 63 |
+
- **effort=high**: 「古池や〜」を5-7-5と走査し、字余りの句を「5-7-6、字余りあり」と検出した。汎用27Bも最高effortで同じ検出に到達した
|
| 64 |
+
- 速度はeffortに応じて変わります(lowが最速)。どのeffortで使うかは用途に合わせて
|
| 65 |
|
| 66 |
+
出力例(effort=low・パーサで本文分離済み):
|
| 67 |
|
| 68 |
> 潮騒に 足あと残す 夕焼けかな
|
| 69 |
|