AvoCahDoe's picture
RL-MPQ Conservative — 2026-06-11T15:30:00.883980
ca8cb5e verified
|
Raw
History Blame Contribute Delete
1.21 kB
metadata
license: llama2
base_model: meta-llama/Llama-2-7b-hf
tags:
  - rl-mpq
  - mixed-precision
  - quantization
library_name: transformers

LLAMA-2-7B — Conservative

Subfolder of AvoCahDoe/llama-2-7b-rlmpq (all RL-MPQ scenarios for this model).

Fake-quantized weights for Conservative applied to meta-llama/Llama-2-7b-hf (per-layer asymmetric group-wise quant, group_size=128).

Load

from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "AvoCahDoe/llama-2-7b-rlmpq"
model = AutoModelForCausalLM.from_pretrained(repo, subfolder="Conservative", torch_dtype="float16")
tokenizer = AutoTokenizer.from_pretrained(repo, subfolder="Conservative")

Metrics

Metric Value
Scenario Conservative
Average bits per weight 5.125
Compression ratio (vs FP16) 3.122x
WikiText-2 perplexity 5.0276
Layers 32
Bit distribution {'4': 23, '8': 9}

Policy (bits per layer)

[8, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 8, 8, 8, 8, 8, 8, 8, 8]

Generated: 2026-06-11T15:30:00.790589