AWQ - 8 Bit

#3
by shrisha - opened

Hello, Just wondering, are you planing do the 8 Bit model as well?
Thanks.
Greetings!

这个需求现在开始变得强烈而合理。
https://github.com/vllm-project/vllm/issues/39749
vllm 第二季度的核心目标之一是实现权重从 vram 卸载到 dram 或磁盘。
然后这些工作这几天陆续已经合并了,在 vllm0.20 就可以用得上了
https://github.com/vllm-project/vllm/issues/38256

如果是特定用例,MoE的权重激活一般在 12%-30%. Qwen3.5 系列专家数量在 128, 稀疏度相对高,这是权重卸载非常适用的模型。而这个模型是地球上最经典的适配 rtx3090 的模型。

我和 Gemini Pro, Claude 讨论,权重卸载的情况下,要同时能在 RTX3090 上单卡运行,速度极快,精度极高,上下文充足,最佳的格式会是什么。都告诉我是 awq8bit 外加 bfloat16 激活。

所以,如果 awq-8bit 发布,那么在过几天 vllm0.20 发布后,刚好赶得上第一波最经典,强烈的需求。

我对你们的模型非常有好感。 微调普遍会损坏模型,量化也难免损失很大,你们的模型是地球上量化最出色的。如果问 8bit awq 最经典的版本是谁家的?我感觉理应是你们制作的。

Sign up or log in to comment