Llama-2-70b-hf — KronQ W3A16 (fake-quant fp16)

Paper: arXiv:2607.07964 · Code: GitHub

⚠️ Fake-quant fp16 checkpoint. 3-bit weights stored in fp16 (KronQ does not pack int3) — same size as bf16, for PPL/accuracy reproduction only. For deployable low-bit see the W4A16 / W2A16 (packed) repos.

Llama-2-70b-hf quantized to 3-bit weights with KronQ, exported as a standard fp16 model.

Results (WikiText-2, seqlen 2048)

Perplexity: 3.66

Zero-shot accuracy:

PIQA ARC-E ARC-C HellaSwag WinoGrande BoolQ OBQA Average
82.26 81.86 58.28 82.45 78.53 82.97 48.80 73.59

(lm-evaluation-harness, 0-shot. acc_norm for PIQA/HellaSwag/ARC/OBQA, acc for WinoGrande/BoolQ.)

Usage

Loads as a standard fp16 model (no KronQ code):

from transformers import AutoModelForCausalLM, AutoTokenizer
m = AutoModelForCausalLM.from_pretrained("donghyunli/Llama-2-70b-KronQ-W3A16-fake", torch_dtype="float16", device_map="auto")

Recipe

Per-channel asymmetric W3, weight-only (a_bits=16), --alpha 0.25, BiIP, act_order, raw H_G.

License

Derivative of Llama-2-70b-hf — llama2 license.

Downloads last month
21
Safetensors
Model size
69B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for donghyunli/Llama-2-70b-KronQ-W3A16-fake

Finetuned
(36)
this model

Paper for donghyunli/Llama-2-70b-KronQ-W3A16-fake