Qwen3.8-27B-NVFP4-RTX5090-LMHead4 / model-00002-of-00003.safetensors

Commit History

NVFP4 lm_head variant: -8.8% size, +8.4% decode, no accuracy cost
e60a41d
verified

jared89 commited on