Ddavidich commited on
Commit
7d43654
·
verified ·
1 Parent(s): a95dc44

Теги: transformers и 3-bit; library_name намеренно остаётся vllm

Browse files

Тег transformers добавлен для поиска, но library_name не меняется. Причина
замерена и описана в разделе про transformers: модель там ЗАГРУЖАЕТСЯ за
12.7 с на 18.2 ГБ, но прямой проход требует около 55 ГБ — у compressed-tensors
в transformers нет квантованных ядер, и первый forward разворачивает модель в
bf16 на месте (их же model_compressor.py: 'This allows for generation without
requiring CT to handle quantized kernels'). Поставить library_name: transformers
значило бы включить виджет вывода, ведущий на путь, требующий 64 ГБ.

Тег 3-bit отражает новую раскладку: поздние 32 слоя MLP в несимметричных трёх
битах. На требование transformers это не влияет — разворачивание идёт в bf16
независимо от разрядности в файле.

Files changed (1) hide show
  1. README.md +2 -0
README.md CHANGED
@@ -21,8 +21,10 @@ tags:
21
  - rtx-5090
22
  - rtx-4090
23
  - vllm
 
24
  - quantization
25
  - nvfp4
 
26
  - fp8
27
  - int8
28
  - kv-cache-quantization
 
21
  - rtx-5090
22
  - rtx-4090
23
  - vllm
24
+ - transformers
25
  - quantization
26
  - nvfp4
27
+ - 3-bit
28
  - fp8
29
  - int8
30
  - kv-cache-quantization