--- license: llama2 base_model: meta-llama/Llama-2-7b-hf tags: - rl-mpq - mixed-precision - quantization library_name: transformers --- # LLAMA-2-7B — Conservative Subfolder of [`AvoCahDoe/llama-2-7b-rlmpq`](https://huggingface.co/AvoCahDoe/llama-2-7b-rlmpq) (all RL-MPQ scenarios for this model). Fake-quantized weights for **Conservative** applied to [meta-llama/Llama-2-7b-hf](https://huggingface.co/meta-llama/Llama-2-7b-hf) (per-layer asymmetric group-wise quant, group_size=128). ## Load ```python from transformers import AutoModelForCausalLM, AutoTokenizer repo = "AvoCahDoe/llama-2-7b-rlmpq" model = AutoModelForCausalLM.from_pretrained(repo, subfolder="Conservative", torch_dtype="float16") tokenizer = AutoTokenizer.from_pretrained(repo, subfolder="Conservative") ``` ## Metrics | Metric | Value | |--------|-------| | Scenario | Conservative | | Average bits per weight | 5.125 | | Compression ratio (vs FP16) | 3.122x | | WikiText-2 perplexity | 5.0276 | | Layers | 32 | | Bit distribution | {'4': 23, '8': 9} | ## Policy (bits per layer) ``` [8, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 8, 8, 8, 8, 8, 8, 8, 8] ``` Generated: 2026-06-11T15:30:00.790589