frankenstallm / source /configs /korean_3b_sft_v2.yaml
somebody-to-love's picture
Upload folder using huggingface_hub
da19444 verified
Raw
History Blame
1.91 kB
# Korean 3B SFT v2 Configuration
#
# Base model: checkpoints/korean_3b_fp8_run1/checkpoint-0057000 (3B params pretrained)
# SFT v2 ๋ชฉํ‘œ: v1์˜ underfitting ํ•ด๊ฒฐ + forgetting ๋ฐฉ์ง€ (data mixing)
# ์•„ํ‚คํ…์ฒ˜: LLaMA-3 3B ์ฐธ๊ณ  (d=3072, 28L, 24H, GQA 8:1)
#
# ์‹คํ–‰: bash scripts/launch_3b_sft_v2.sh
#
# [์„ค๊ณ„ ๊ทผ๊ฑฐ โ€” SFT v1 ์‹คํŒจ ๋ถ„์„ 2026-03-06]
# v1 ๋ฌธ์ œ: lr=1e-5 โ†’ val_loss ๋ณ€ํ™” 0 (์‚ฌ์‹ค์ƒ ํ•™์Šต ์•ˆ ๋จ)
# v2 ๋ณ€๊ฒฝ:
# - lr: 1e-5 โ†’ 5e-5 (5๋ฐฐ โ†‘, 3B SFT ํ‘œ์ค€ ๋ฒ”์œ„)
# - batch: 4 ร— 8GPU ร— 8 grad_accum = 256 eff_batch (v1 ๋Œ€๋น„ 4๋ฐฐ โ†‘)
# - warmup: 500 โ†’ 2000 (๋†’์€ LR์— ๋งž์ถฐ ์•ˆ์ •ํ™”)
# - max_steps: 33000 โ†’ 15000 (์ˆ˜๋ ด ๋นจ๋ผ์ง, ๊ณผ์ ํ•ฉ ๋ฐฉ์ง€)
# - weight_decay: 0.01 โ†’ 0.05 (forgetting ์–ต์ œ)
# - data mixing: SFT 70% + pretrain 30% (forgetting ๋ฐฉ์ง€)
model:
vocab_size: 64000
d_model: 3072
n_layers: 28
n_heads: 24
n_kv_heads: 8
d_ffn: 8192
max_seq_len: 4096
rope_theta: 500000.0
dropout: 0.0
bias: false
use_flash_attn: true
use_fp8: true
train:
max_steps: 15000 # v1 33000 โ†’ 15000 (์ˆ˜๋ ด ๋นจ๋ผ์ง)
batch_size: 4 # v1 2 โ†’ 4 (VRAM ์—ฌ์œ  ์ถฉ๋ถ„: 48/183GB)
grad_accum_steps: 8 # v1 4 โ†’ 8 (eff_batch: 4 ร— 8GPU ร— 8 = 256)
lr: 5.0e-5 # v1 1e-5 โ†’ 5e-5 (5๋ฐฐ โ†‘, underfitting ํ•ด๊ฒฐ)
weight_decay: 0.05 # v1 0.01 โ†’ 0.05 (forgetting ์–ต์ œ)
warmup_steps: 2000 # v1 500 โ†’ 2000 (๋†’์€ LR ์•ˆ์ •ํ™”)
max_grad_norm: 1.0 # gradient clipping
log_interval: 10
save_interval: 2000
eval_interval: 500
use_amp: false
compile_model: false
neftune_alpha: 5.0 # NEFTune noise injection (์œ ์ง€)
# Data mixing (forgetting ๋ฐฉ์ง€)
pretrain_mix_ratio: 0.3 # pretrain ๋ฐ์ดํ„ฐ 30% ํ˜ผํ•ฉ
pretrain_data: data/3b_train.bin # pretrain ๋ฐ์ดํ„ฐ ๊ฒฝ๋กœ
tokenizer:
vocab_size: 64000
type: sentencepiece_unigram