Update README.md
Browse files
README.md
CHANGED
|
@@ -11,7 +11,7 @@ tags:
|
|
| 11 |
|
| 12 |
Представляем `GigaChat3-10B-A1.8B-base` — базовую (pretrain) модель семейства GigaChat. Модель основана на архитектуре Mixture-of-Experts (MoE) с 10B общих и 1.8B активных параметров.
|
| 13 |
Архитектура включает **Multi-head Latent Attention (MLA)** и **Multi-Token Prediction (MTP)**, за счет чего модель оптимизирована для высокой пропускной способности (throughput) при инференсе.
|
| 14 |
-
Больше подробностей в хабр статье
|
| 15 |
|
| 16 |
## Важное замечание: Base vs. Instruct
|
| 17 |
|
|
|
|
| 11 |
|
| 12 |
Представляем `GigaChat3-10B-A1.8B-base` — базовую (pretrain) модель семейства GigaChat. Модель основана на архитектуре Mixture-of-Experts (MoE) с 10B общих и 1.8B активных параметров.
|
| 13 |
Архитектура включает **Multi-head Latent Attention (MLA)** и **Multi-Token Prediction (MTP)**, за счет чего модель оптимизирована для высокой пропускной способности (throughput) при инференсе.
|
| 14 |
+
Больше подробностей [в хабр статье](https://habr.com/en/companies/sberdevices/articles/968904/).
|
| 15 |
|
| 16 |
## Важное замечание: Base vs. Instruct
|
| 17 |
|