--- license: llama2 base_model: meta-llama/Llama-2-7b-hf tags: - rl-mpq - mixed-precision - quantization library_name: transformers --- # LLAMA-2-7B — Extreme Survival Subfolder of [`AvoCahDoe/llama-2-7b-rlmpq`](https://huggingface.co/AvoCahDoe/llama-2-7b-rlmpq) (all RL-MPQ scenarios for this model). Fake-quantized weights for **Extreme_Survival** applied to [meta-llama/Llama-2-7b-hf](https://huggingface.co/meta-llama/Llama-2-7b-hf) (per-layer asymmetric group-wise quant, group_size=128). ## Load ```python from transformers import AutoModelForCausalLM, AutoTokenizer repo = "AvoCahDoe/llama-2-7b-rlmpq" model = AutoModelForCausalLM.from_pretrained(repo, subfolder="Extreme_Survival", torch_dtype="float16") tokenizer = AutoTokenizer.from_pretrained(repo, subfolder="Extreme_Survival") ``` ## Metrics | Metric | Value | |--------|-------| | Scenario | Extreme_Survival | | Average bits per weight | 2.9688 | | Compression ratio (vs FP16) | 5.3895x | | WikiText-2 perplexity | 10.9577 | | Layers | 32 | | Bit distribution | {'2': 2, '3': 29, '4': 1} | ## Policy (bits per layer) ``` [4, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 3, 2, 2] ``` Generated: 2026-06-11T15:33:26.058931