Amey9766 commited on
Commit
445b7b8
·
verified ·
1 Parent(s): 4381e0e

Update app.py

Browse files
Files changed (1) hide show
  1. app.py +8 -4
app.py CHANGED
@@ -1,6 +1,5 @@
1
  import os
2
  import torch
3
- import gradio as gr
4
  from transformers import AutoTokenizer, AutoModelForCausalLM, AutoConfig
5
 
6
  MODEL_ID = "Amey9766/llama32B-hospitality-review-triage"
@@ -8,15 +7,20 @@ HF_TOKEN = os.getenv("HF_TOKEN")
8
 
9
  tokenizer = AutoTokenizer.from_pretrained(MODEL_ID, token=HF_TOKEN)
10
 
11
- # Load config and REMOVE any quantization config
12
  config = AutoConfig.from_pretrained(MODEL_ID, token=HF_TOKEN)
 
 
13
  if hasattr(config, "quantization_config"):
14
- config.quantization_config = None
 
 
 
15
 
16
  model = AutoModelForCausalLM.from_pretrained(
17
  MODEL_ID,
18
  token=HF_TOKEN,
19
- config=config, # <-- important
 
20
  device_map="auto",
21
  dtype=torch.float16 if torch.cuda.is_available() else torch.float32
22
  )
 
1
  import os
2
  import torch
 
3
  from transformers import AutoTokenizer, AutoModelForCausalLM, AutoConfig
4
 
5
  MODEL_ID = "Amey9766/llama32B-hospitality-review-triage"
 
7
 
8
  tokenizer = AutoTokenizer.from_pretrained(MODEL_ID, token=HF_TOKEN)
9
 
 
10
  config = AutoConfig.from_pretrained(MODEL_ID, token=HF_TOKEN)
11
+
12
+ # IMPORTANT: remove quantization_config cleanly
13
  if hasattr(config, "quantization_config"):
14
+ try:
15
+ delattr(config, "quantization_config") # best option
16
+ except Exception:
17
+ config.quantization_config = {} # fallback
18
 
19
  model = AutoModelForCausalLM.from_pretrained(
20
  MODEL_ID,
21
  token=HF_TOKEN,
22
+ config=config,
23
+ quantization_config=None, # prevents auto-quant logic
24
  device_map="auto",
25
  dtype=torch.float16 if torch.cuda.is_available() else torch.float32
26
  )