frankenstallm / source /configs /korean_1b_sft.yaml
somebody-to-love's picture
Upload folder using huggingface_hub
da19444 verified
Raw
History Blame
1.22 kB
# Korean LLM 1B โ€” SFT (Supervised Fine-Tuning) ์„ค์ •
#
# Base model: korean_1b_fp8_run1/checkpoint-0034000 (1.19B params, 34k pretrain steps)
# SFT ๋ชฉํ‘œ: instruction following + ๋ฐ˜๋ณต ํ‡ดํ™” ์™„ํ™” + ์ƒ์„ฑ ํ’ˆ์งˆ ํ–ฅ์ƒ
#
# ์‹คํ–‰: bash scripts/launch_sft.sh
model:
vocab_size: 64000
d_model: 2048
n_layers: 24
n_heads: 16
n_kv_heads: 4
d_ffn: 5472
max_seq_len: 4096
rope_theta: 500000.0
dropout: 0.0
bias: false
use_flash_attn: true
use_fp8: true
train:
max_steps: 5000 # SFT: ์ˆ˜์ฒœ steps๋ฉด ์ถฉ๋ถ„ (pretrain 34k ๋Œ€๋น„ ~10%)
batch_size: 4 # per GPU (SFT๋Š” seq๊ฐ€ ๋‹ค์–‘ํ•˜๋ฏ€๋กœ ์ž‘๊ฒŒ)
grad_accum_steps: 2 # eff_batch: 4 ร— 8GPU ร— 2 ร— 4096 = 262,144 tok/step
lr: 2.0e-5 # pretrain์˜ 1/10 (catastrophic forgetting ๋ฐฉ์ง€)
weight_decay: 0.01 # pretrain 0.1๋ณด๋‹ค ์•ฝํ•˜๊ฒŒ
warmup_steps: 150 # 3000 steps์˜ 3.3%
max_grad_norm: 1.0
log_interval: 10
save_interval: 500
eval_interval: 100
use_amp: false # FP8 ์‚ฌ์šฉ ์‹œ ๋ถˆํ•„์š”
compile_model: false
fp8_amax_history_len: 16
fp8_amax_compute_algo: "max"
fp8_format: "MXFP8"
tokenizer:
vocab_size: 64000
type: sentencepiece_unigram