Instructions to use hymmmm/exaone-3.5-7.8b-emt-awq-calib with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Local Apps Settings
- vLLM
How to use hymmmm/exaone-3.5-7.8b-emt-awq-calib with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "hymmmm/exaone-3.5-7.8b-emt-awq-calib" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "hymmmm/exaone-3.5-7.8b-emt-awq-calib", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/hymmmm/exaone-3.5-7.8b-emt-awq-calib
- SGLang
How to use hymmmm/exaone-3.5-7.8b-emt-awq-calib with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "hymmmm/exaone-3.5-7.8b-emt-awq-calib" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "hymmmm/exaone-3.5-7.8b-emt-awq-calib", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "hymmmm/exaone-3.5-7.8b-emt-awq-calib" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "hymmmm/exaone-3.5-7.8b-emt-awq-calib", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use hymmmm/exaone-3.5-7.8b-emt-awq-calib with Docker Model Runner:
docker model run hf.co/hymmmm/exaone-3.5-7.8b-emt-awq-calib
Configuration Parsing Warning:In config.json: "quantization_config.modules_to_not_convert" must be an array
EXAONE 3.5 7.8B ยท EMT Full Fine-tuning (AWQ 4-bit, calibration ๋ณ๊ฒฝ)
์ํ: ๐งช ์์ํ ๋ณด์ ์คํ (ํ๊ตญ์ด ๋๋ฉ์ธ calibration)
ํ๊ตญ์ด ์์ ์๊ธ(119 ๊ตฌ๊ธ๋์) ๋ํ์ฉ์ผ๋ก ํ์ธํ๋ํ EXAONE 3.5 7.8B ๋ชจ๋ธ์ ๋๋ค.
์ด ๋ชจ๋ธ์
- ํ์ต ๊ฐ์ค์น:
exaone-3.5-7.8b-emt-awq์ ๊ฐ์ Full FT ๋ชจ๋ธ(๋ฐ์ดํฐ v2, 2 epoch) - ์ฐจ์ด: AWQ ์์ํ๋ง ๋ค์ ์ํ โ AutoAWQ ๊ธฐ๋ณธ ๋ณด์ ๋ฐ์ดํฐ(pileval, ์์ด) ๋์ ํ์ต ๋ฐ์ดํฐ
final_dataset.jsonl์ EXAONE ๋ํ ํฌ๋งท([|user|]โฆ[|assistant|]โฆ[|endofturn|])์ผ๋ก ๋ณํํดcalib_data๋ก ์ง์ ๋๊ธฐ๊ณ ,max_calib_seq_len์ 2048๋ก ๋๋ ค ๋ค์ ์์ํํ์ต๋๋ค. ์์ด ๋ณด์ ๋ฐ์ดํฐ๋ก ์์ํํ์ ๋ ํ๊ตญ์ด ์๊ธ ๋๋ฉ์ธ ์ ๋ ฅ(OOD)์์ ์ถ๋ ฅ์ด ๋ฌด๋์ง๋ ๋ฌธ์ ๋ฅผ ํด๊ฒฐํ๋ ค๋ ๋ชฉ์ ์ ๋๋ค. - ์์ํํ์ง ์๋ ๋ ์ด์ด๊ฐ ๋ด๊ธด ๋ ๋ฒ์งธ ๊ฐ์ค์น ํ์ผ์
emt-awq์ ๋ฐ์ดํธ ๋จ์๋ก ๊ฐ๊ณ , ์์ํ๋ ์ฒซ ๋ฒ์งธ ํ์ผ๋ง ๋ค๋ฆ ๋๋ค.
| ํญ๋ชฉ | ๊ฐ |
|---|---|
| ๋ฐฉ๋ฒ | Full fine-tuning (BF16), assistant ํด๋ง ํ์ต (`[ |
| ํ์ต | 2 epoch, lr 1e-5, batch 1 ร grad_accum 4 ร 8 GPU (=32), max_length 1,024 |
| ํ๊ฒฝ | SageMaker ml.p4d.24xlarge (8รA100), DeepSpeed ZeRO-3, transformers 5.5.0 |
| eval_loss | epoch1 0.9126 โ epoch2 0.8479 |
์ฌ์ฉ๋ฒ (vLLM)
from vllm import LLM, SamplingParams
llm = LLM(
model="hymmmm/exaone-3.5-7.8b-emt-awq-calib",
quantization="awq",
dtype="float16",
max_model_len=8192,
trust_remote_code=True,
)
out = llm.chat(
[{"role": "user", "content": "3์ธ ๋จ์, ์ด์ฑ๊ฒฝ๋ จ ํ ์์ ์ ํ. ํ์ฅ์์ ๋ญ ํ์ธํด์ผ ํ๋์?"}],
SamplingParams(temperature=0.3, max_tokens=1024),
)
print(out[0].outputs[0].text)
๋ชจ๋ธ ํจ๋ฐ๋ฆฌ ํ๋์ ๋ณด๊ธฐ
HAPES(์์ ์๊ธ 119 ๊ตฌ๊ธ๋์ ๋ณด์กฐ ์ฑ๋ด) ์ฐ๊ตฌ์์ ๋ง๋ ๋ชจ๋ธ๋ค์ ๋๋ค. ๋ชจ๋ ๊ฐ์ ๊ณผ์ (๊ตฌ๊ธ๋์โ์ฑ๋ด ๋ํ)๋ก ํ์ตํ๊ณ , ๋ฐฑ๋ณธ ยท ํ์ต ๋ฐฉ์ ยท ๋ฐ์ดํฐ ๋ฒ์ ๋ง ๋ค๋ฆ ๋๋ค.
| ๋ ํฌ | ๋ฐฑ๋ณธ | ํ์ต ๋ฐฉ์ | ํ์ต ๋ฐ์ดํฐ | ํ์ | ์ํ |
|---|---|---|---|---|---|
| exaone-3.5-7.8b-emt-qlora-awq-v2 | EXAONE 3.5 7.8B | QLoRA (EOS ์์ ) | v2 ยท 2,001๊ฑด | AWQ 4bit | โ ๊ถ์ฅ ยท HAPES ์ฑ ๊ธฐ๋ณธ ๋ชจ๋ธ |
| qwen3-8b-emt-qlora-awq-v2 | Qwen3 8B | QLoRA (EOS ์์ ) | v2 ยท 2,001๊ฑด | AWQ 4bit | โ ๋ฐฑ๋ณธ ๋น๊ต๊ตฐ |
| exaone-3.5-7.8b-emt-awq | EXAONE 3.5 7.8B | Full FT (BF16) | v2 ยท 2,001๊ฑด | AWQ 4bit | โ ํ์ต๋ฐฉ์ ๋น๊ต๊ตฐ (Full vs QLoRA) |
| exaone-3.5-7.8b-emt-awq-calib | EXAONE 3.5 7.8B | Full FT (BF16) | v2 ยท 2,001๊ฑด | AWQ 4bit (๋๋ฉ์ธ ๋ณด์ ) | ๐งช ์์ํ ๋ณด์ ์คํ |
| exaone-3.5-7.8b-emt-qlora-awq | EXAONE 3.5 7.8B | QLoRA (EOS ๋ฒ๊ทธ) | v2 ยท 2,001๊ฑด | AWQ 4bit | โ ์ฌ์ฉ ๊ธ์ง โ v2 ์ฌ์ฉ |
| qwen3-8b-emt-qlora-awq | Qwen3 8B | QLoRA (EOS ๋ฒ๊ทธ) | v2 ยท 2,001๊ฑด | AWQ 4bit | โ ์ฌ์ฉ ๊ธ์ง โ v2 ์ฌ์ฉ |
| exaone-3.5-7.8b-emt-chatbot | EXAONE 3.5 7.8B | Full FT (BF16) | v1 ยท 2,021๊ฑด | BF16 ์๋ณธ | ๐๏ธ ๊ตฌ๋ฒ์ (2026-01) |
| exaone-3.5-7.8b-awq | EXAONE 3.5 7.8B | ์ emt-chatbot์ ์์ํ |
v1 ยท 2,021๊ฑด | AWQ 4bit | ๐๏ธ ๊ตฌ๋ฒ์ (2026-01) |
- ๋ฐ์ดํฐ v1 (2026-01): ์ด๊ธฐ ๋ํ ๋ฐ์ดํฐ์ 2,021๊ฑด, train/val/test = 70/15/15, ์ต๋ 512 ํ ํฐ.
- ๋ฐ์ดํฐ v2 (2026-06):
final_dataset.jsonl2,001๊ฑด(๋จ์ผํด 712 ยท ๋ฉํฐํด 1,289), train/val = 1,800/201 (์ฃผํธ์ ร ๋ํ์ ํ ์ธตํ, seed 42), ์ต๋ 1,024 ํ ํฐ(์๋ฆผ 0%). - EOS ๋ฒ๊ทธ: v1 QLoRA ํ์ต์ฉ chat_template์์
{% generation %}๋ธ๋ก์ด ์ข ๋ฃ ํ ํฐ([|endofturn|]/<|im_end|>)์ ๋นผ๋จน์ด, assistant-only loss๊ฐ ๋ฉ์ถ๋ ๋ฒ์ ํ์ตํ์ง ๋ชปํจ โ ๊ฐ์ ๋ฌธ์ฅ ๋ฌดํ ๋ฐ๋ณตยท๊ฐ์ง ๋ํ ํด ์์ฑ. v2๋ ์ข ๋ฃ ํ ํฐ๊น์ง ํ์ต ๋์์ ๋ฃ์ด ์ฌํ์ตํ์ต๋๋ค. - Full FT vs QLoRA: Full FT๋ epoch 2์์ ๊ณผ์ ํฉ์ด ํ์ธ๋์ต๋๋ค(ํ์ต ๋ฐ์ดํฐ ์ฝ 1M ํ ํฐ์ผ๋ก 7.8B ์ ์ฒด ํ๋ผ๋ฏธํฐ๋ฅผ ํ์ตํ๊ธฐ์ ๋ฐ์ดํฐ๊ฐ ์์). ๊ทธ๋์ QLoRA๋ฅผ ๋ฉ์ธ ๋ฐฉ์์ผ๋ก ์ฑํํ๊ณ , Full FT๋ ๋น๊ต๊ตฐ์ผ๋ก ๋จ๊ฒผ์ต๋๋ค.
- ๋ชจ๋ AWQ ๋ชจ๋ธ: AutoAWQ, 4-bit, group size 128, zero point, GEMM ์ปค๋. ๋ณด์ (calibration) ๋ฐ์ดํฐ๋
-calib๋ง ํ๊ตญ์ด ๋๋ฉ์ธ ๋ํ(final_dataset.jsonl, ์ต๋ 2,048 ํ ํฐ)์ด๊ณ , ๋๋จธ์ง๋ AutoAWQ ๊ธฐ๋ณธ๊ฐ(pileval, ์์ด)์ ๋๋ค.
์ฃผ์
์ฐ๊ตฌ์ฉ ๋ชจ๋ธ์ ๋๋ค. ์ค์ ํ์ ์ฒ์น์ ๋จ๋ ์ผ๋ก ์ฌ์ฉํ์ง ๋ง์ธ์. ์ฝ๋ฌผ ์ฉ๋ ๋ฑ ์์น ์ ๋ณด๋ ๋ฐ๋์ ๊ณต์ ์ง์นจ์ผ๋ก ํ์ธํด์ผ ํฉ๋๋ค. HAPES ์ฑ์์๋ RAG(ํ์ฅ์๊ธ์ฒ์น ์ง์นจยท์ค๋ ยท์์ ๊ธฐ์ ์งํ ๋ฌธ์)์ ํจ๊ป ์ฌ์ฉํฉ๋๋ค.
- Downloads last month
- 26
Model tree for hymmmm/exaone-3.5-7.8b-emt-awq-calib
Base model
LGAI-EXAONE/EXAONE-3.5-7.8B-Instruct