frankenstallm / source /eval /reports /03_repetition_calibration_report.md
pathcosmos's picture
Upload folder using huggingface_hub (#29)
5b1ff4d
|
Raw
History Blame
12.1 kB

๋ณด๊ณ ์„œ 03 โ€” ๋ฐ˜๋ณต ๋ถ„์„ ๋ฐ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ ์ ๊ฒ€

๋ชจ๋ธ: korean_1b_fp8_run1 (~1.19B ํŒŒ๋ผ๋ฏธํ„ฐ) ํ•™์Šต ๋‹จ๊ณ„: 34,000 steps ์ž‘์„ฑ์ผ: 2026-02-26


Part A โ€” ๋ฐ˜๋ณต ๋ถ„์„ (Repetition Analysis)

1. N-gram ๋ฐ˜๋ณต๋ฅ  ๊ฒฐ๊ณผ

์•„๋ž˜ ํ‘œ๋Š” 10๊ฐœ ํ”„๋กฌํ”„ํŠธ์— ๋Œ€ํ•ด greedy decoding์œผ๋กœ ์ƒ์„ฑํ•œ ์ถœ๋ ฅ์˜ N-gram ๋ฐ˜๋ณต๋ฅ ์„ ์ธก์ •ํ•œ ๊ฒฐ๊ณผ๋‹ค. ๊ฐ ์—ด์˜ ๊ฐ’์€ ์ „์ฒด ์ƒ์„ฑ ํ† ํฐ ์ค‘ ์ด๋ฏธ ๋“ฑ์žฅํ•œ N-gram์ด ๋‹ค์‹œ ๋“ฑ์žฅํ•˜๋Š” ๋น„์œจ์„ ๋‚˜ํƒ€๋‚ธ๋‹ค.

ํ”„๋กฌํ”„ํŠธ 1-gram 2-gram 3-gram 4-gram ํŒ์ •
ํ•œ๊ตญ์˜ ์ˆ˜๋„๋Š” 75.3% 68.4% 65.3% 64.9% DEGENERATE
์ธ๊ณต์ง€๋Šฅ์ด๋ž€ 50.7% 31.9% 29.6% 27.1% OK
์˜ค๋Š˜ ๋‚ ์”จ๊ฐ€ ์ข‹์•„์„œ 7.6% 0.0% 0.0% 0.0% OK
๋Œ€ํ•œ๋ฏผ๊ตญ์˜ ์—ญ์‚ฌ... 90.7% 89.2% 87.7% 86.9% DEGENERATE
์„œ์šธ์—์„œ ๋ถ€์‚ฐ๊นŒ์ง€ 24.1% 7.3% 2.5% 0.0% OK
ํŒŒ์ด์ฌ ์ฝ”๋“œ 75.0% 71.8% 68.4% 64.9% DEGENERATE
1 + 1 = 2์ด๊ณ  69.9% 44.7% 22.1% 0.0% OK
๋ด„์ด ์˜ค๋ฉด ๊ฝƒ์ด ํ”ผ๊ณ  30.0% 15.2% 9.2% 6.2% OK
๊น€์น˜์ฐŒ๊ฐœ๋ฅผ ๋งŒ๋“ค๋ ค๋ฉด 31.0% 11.1% 5.1% 3.1% OK
์„ธ์ข…๋Œ€์™•์€ 14.8% 7.5% 5.1% 3.8% OK
ํ‰๊ท  46.9% 34.7% 29.5% 25.7% โ€”

ํŒ์ • ๊ธฐ์ค€: 4-gram ๋ฐ˜๋ณต๋ฅ  50% ์ดˆ๊ณผ ๋˜๋Š” 3-gram ๋ฐ˜๋ณต๋ฅ  60% ์ดˆ๊ณผ ์‹œ DEGENERATE๋กœ ๋ถ„๋ฅ˜ DEGENERATE ๋น„์œจ: 3/10 (30%)


2. ๋ถ„์„

2-1. ๋ฐ˜๋ณต ํ‡ดํ™”(degenerate repetition)์˜ ์›์ธ

1. 1B base model์˜ ์ „ํ˜•์  ํ•œ๊ณ„

1B ๊ทœ๋ชจ์˜ base pretrain ๋ชจ๋ธ์€ ํ•™์Šต๋œ ํ™•๋ฅ  ๋ถ„ํฌ์—์„œ ๊ณ ํ™•๋ฅ  ์‹œํ€€์Šค๊ฐ€ ๋ฐ˜๋ณต ๋ฃจํ”„์— ์ง„์ž…ํ•˜๋Š” ๊ฒฝํ–ฅ์ด ์žˆ๋‹ค. Greedy decoding์€ ๋งค step๋งˆ๋‹ค ๊ฐ€์žฅ ๋†’์€ ํ™•๋ฅ ์˜ ํ† ํฐ์„ ์„ ํƒํ•˜๋ฏ€๋กœ, ๋ชจ๋ธ์ด ํ•œ ๋ฒˆ ํŠน์ • ํŒจํ„ด์„ ์ƒ์„ฑํ•˜๋ฉด ๊ทธ ํŒจํ„ด์ด ๋‹ค์Œ ํ† ํฐ ์˜ˆ์ธก์— ์œ ๋ฆฌํ•œ ์ปจํ…์ŠคํŠธ๋กœ ์ž‘์šฉํ•ด ์Šค์Šค๋กœ ๊ฐ•ํ™”๋œ๋‹ค.

2. Full-sequence forward์˜ ์ปจํ…์ŠคํŠธ ๋ˆ„์  ํšจ๊ณผ

KV cache ์—†์ด full-sequence forward ๋ฐฉ์‹์œผ๋กœ ์ƒ์„ฑํ•  ๊ฒฝ์šฐ, ์•ž์—์„œ ๋ฐ˜๋ณต๋œ ํ† ํฐ๋“ค์ด ์ปจํ…์ŠคํŠธ๋ฅผ ์ ์œ ํ•˜์—ฌ ์ดํ›„ ์ƒ์„ฑ์—์„œ ๊ฐ™์€ ํŒจํ„ด์„ ๋”์šฑ ๋†’์€ ํ™•๋ฅ ๋กœ ์œ ๋„ํ•œ๋‹ค. ๋ฐ˜๋ณต์ด ๋ฐ˜๋ณต์„ ๋‚ณ๋Š” ํ”ผ๋“œ๋ฐฑ ๋ฃจํ”„๊ฐ€ ํ˜•์„ฑ๋œ๋‹ค.

3. ์‚ฌ์‹ค ๊ธฐ๋ฐ˜ ํ”„๋กฌํ”„ํŠธ์—์„œ์˜ ์ทจ์•ฝ์„ฑ

"ํ•œ๊ตญ์˜ ์ˆ˜๋„๋Š”", "๋Œ€ํ•œ๋ฏผ๊ตญ์˜ ์—ญ์‚ฌ" ๊ฐ™์€ ํ”„๋กฌํ”„ํŠธ๋Š” ๋ชจ๋ธ์ด ๋‹จ์ผ ์‚ฌ์‹ค(์˜ˆ: "์„œ์šธ")์„ ์•Œ์ง€๋งŒ, ๊ทธ ์‚ฌ์‹ค์„ ๊ธฐ๋ฐ˜์œผ๋กœ ๋‹ค์Œ ๋ฌธ์žฅ์œผ๋กœ ์ „ํ™˜ํ•˜๋Š” ๋‹ค์–‘์„ฑ์ด ๋ถ€์กฑํ•  ๋•Œ ๋ฐ˜๋ณต์ด ๋ฐœ์ƒํ•œ๋‹ค. ๋ชจ๋ธ์€ "์„œ์šธ์€ ์ˆ˜๋„์ž…๋‹ˆ๋‹ค. ์„œ์šธ์€ ์ˆ˜๋„์ž…๋‹ˆ๋‹ค." ์‹์œผ๋กœ ๋™์ผํ•œ ๋ฌธ์žฅ์„ ๋ฐ˜๋ณต ์ƒ์„ฑํ•œ๋‹ค.

4. ์ฝ”๋“œ ํ”„๋กฌํ”„ํŠธ์˜ ์ทจ์•ฝ์„ฑ

"ํŒŒ์ด์ฌ ์ฝ”๋“œ" ํ”„๋กฌํ”„ํŠธ์—์„œ๋„ DEGENERATE ํŒ์ •์ด ๋‚˜ํƒ€๋‚ฌ๋‹ค. ์ด๋Š” ํ•™์Šต ๋ฐ์ดํ„ฐ์˜ ํ•œ๊ตญ์–ด ์ฝ”๋“œ ๊ด€๋ จ ๋ฌธ์„œ๊ฐ€ ์ƒ๋Œ€์ ์œผ๋กœ ๋ถ€์กฑํ•˜๊ธฐ ๋•Œ๋ฌธ์œผ๋กœ ์ถ”์ •๋œ๋‹ค. ์ฝ”๋“œ ๊ตฌ์กฐ(๋“ค์—ฌ์“ฐ๊ธฐ, ๋ฐ˜๋ณต ํ‚ค์›Œ๋“œ)๊ฐ€ N-gram ๋ฐ˜๋ณต๋ฅ ์„ ๋†’์ด๋Š” ํšจ๊ณผ๋„ ์žˆ๋‹ค.

2-2. ์–‘ํ˜ธํ•œ ํ”„๋กฌํ”„ํŠธ์˜ ํŠน์„ฑ

"์˜ค๋Š˜ ๋‚ ์”จ๊ฐ€ ์ข‹์•„์„œ", "๊น€์น˜์ฐŒ๊ฐœ๋ฅผ ๋งŒ๋“ค๋ ค๋ฉด", "์„ธ์ข…๋Œ€์™•์€" ๋“ฑ ๊ฐœ๋ฐฉํ˜•์ด๊ณ  ์ƒํ™œ ๋ฐ€์ฐฉํ˜•์ธ ํ”„๋กฌํ”„ํŠธ์—์„œ๋Š” ๋ฐ˜๋ณต๋ฅ ์ด ๋‚ฎ๋‹ค. ์ด๋“ค ํ”„๋กฌํ”„ํŠธ๋Š” ํ•™์Šต ๋ฐ์ดํ„ฐ์—์„œ ๋‹ค์–‘ํ•œ ๋ฐฉ์‹์œผ๋กœ ์ด์–ด์ง€๋Š” ๋ฌธ์žฅ๊ณผ ์—ฐ๊ฒฐ๋˜์–ด ์žˆ์–ด ๋ชจ๋ธ์ด ์—ฌ๋Ÿฌ ๊ฒฝ๋กœ๋ฅผ ํƒ์ƒ‰ํ•  ์ˆ˜ ์žˆ๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค.

2-3. 1B pretrain-only ๋ชจ๋ธ ๊ธฐ์ค€์—์„œ์˜ ํ‰๊ฐ€

Instruction tuning(SFT/RLHF) ์ด์ „์˜ base pretrain ๋ชจ๋ธ์—์„œ 30% degenerate๋Š” ์˜ˆ์ƒ ๋ฒ”์œ„ ๋‚ด๋‹ค. GPT-2(1.5B), OPT-1.3B ๋“ฑ ๋™๊ธ‰ ๋ชจ๋ธ๋“ค๋„ greedy decoding์—์„œ ๋น„์Šทํ•œ ์ˆ˜์ค€์˜ ๋ฐ˜๋ณต ๋ฌธ์ œ๋ฅผ ๋ณด์˜€๋‹ค. ๋ชจ๋ธ ํฌ๊ธฐ๊ฐ€ ์ปค์ง€๊ฑฐ๋‚˜ instruction tuning์ด ์ ์šฉ๋˜๋ฉด ์ด ๋น„์œจ์€ ๋Œ€ํญ ๊ฐ์†Œํ•œ๋‹ค.


3. ๊ฐœ์„  ์ „๋žต

3-1. ์ƒ˜ํ”Œ๋ง(Sampling) ๋‹จ๊ณ„ ๊ฐœ์„ 

์ƒ์„ฑ ์‹œ ์•„๋ž˜ ๊ธฐ๋ฒ•์„ ์ ์šฉํ•˜๋ฉด ๋ฐ˜๋ณต ๋ฌธ์ œ๋ฅผ ์ฆ‰์‹œ ์™„ํ™”ํ•  ์ˆ˜ ์žˆ๋‹ค.

  • Repetition penalty (theta = 1.2~1.5): ์ด๋ฏธ ์ƒ์„ฑ๋œ ํ† ํฐ์˜ ๋กœ์ง“์„ ํŽ˜๋„ํ‹ฐ๋กœ ๊ฐ์†Œ์‹œ์ผœ ๋ฐ˜๋ณต์„ ์–ต์ œ. theta=1.3์ด ํ’ˆ์งˆ๊ณผ ๋‹ค์–‘์„ฑ์˜ ๊ท ํ˜•์ ์œผ๋กœ ์ถ”์ฒœ
  • Frequency penalty: ๋‹จ์ˆœ ๋ฐ˜๋ณต๋ฟ ์•„๋‹ˆ๋ผ ๋นˆ๋ฒˆํ•˜๊ฒŒ ๋“ฑ์žฅํ•˜๋Š” ํ† ํฐ ์ „์ฒด๋ฅผ ์–ต์ œ
  • Top-p (nucleus) sampling: p=0.9๋กœ ์„ค์ •ํ•˜๋ฉด greedy์˜ ๋ฐ˜๋ณต ๋ฃจํ”„๋ฅผ ๋Š๋Š” ๋ฐ ํšจ๊ณผ์ 
  • Temperature: 0.7~0.9 ๋ฒ”์œ„์—์„œ ๋‹ค์–‘์„ฑ์„ ๋†’์ด๋ฉด์„œ๋„ coherence ์œ ์ง€

3-2. ํ•™์Šต ๋‹จ๊ณ„ ๊ฐœ์„ 

  • SFT (Supervised Fine-Tuning): ๋‹ค์–‘ํ•œ ์งˆ๋ฌธ-๋‹ต๋ณ€ ์Œ์œผ๋กœ fine-tuningํ•˜๋ฉด instruction following ๋Šฅ๋ ฅ๊ณผ ๋™์‹œ์— ๋ฐ˜๋ณต ์–ต์ œ ํŒจํ„ด์ด ํ•™์Šต๋จ
  • DPO (Direct Preference Optimization): ๋ฐ˜๋ณต์ด ์‹ฌํ•œ ์ถœ๋ ฅ์„ rejected๋กœ, ๋‹ค์–‘ํ•œ ์ถœ๋ ฅ์„ chosen์œผ๋กœ ์„ค์ •ํ•˜๋ฉด ๋ฐ˜๋ณต ๋ฌธ์ œ๋ฅผ ์ง์ ‘ ์ค„์ผ ์ˆ˜ ์žˆ์Œ
  • ๋ฐ์ดํ„ฐ ๋‹ค์–‘์„ฑ ๊ฐ•ํ™”: ์ฝ”๋“œ, ์‚ฌ์‹ค ์„œ์ˆ  ๊ด€๋ จ ํ•œ๊ตญ์–ด ๋ฐ์ดํ„ฐ๋ฅผ ๋ณด๊ฐ•ํ•˜๋ฉด ํ•ด๋‹น ๋„๋ฉ”์ธ์˜ ๋ฐ˜๋ณต ์ทจ์•ฝ์„ฑ ๊ฐœ์„ 

3-3. ๋ชจ๋ธ ํฌ๊ธฐ ํ™•์žฅ

7B ์ด์ƒ ๋ชจ๋ธ์—์„œ ๋ฐ˜๋ณต ๋ฌธ์ œ๊ฐ€ ๊ฐ์†Œํ•˜๋Š” ๊ฒฝํ–ฅ์ด ์žˆ๋‹ค. ํ˜„์žฌ 1B base pretrain ์ˆ˜์ค€์—์„œ๋Š” ๋ฐ˜๋ณต์ด ๊ตฌ์กฐ์ ์œผ๋กœ ๋ฐœ์ƒํ•  ์ˆ˜๋ฐ–์— ์—†์œผ๋ฉฐ, ๋ชจ๋ธ capacity ์ฆ๊ฐ€๊ฐ€ ๊ฐ€์žฅ ๊ทผ๋ณธ์ ์ธ ํ•ด๊ฒฐ์ฑ…์ด๋‹ค.


Part B โ€” ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ ์ ๊ฒ€ (Calibration Check)

1. ๊ฒฐ๊ณผ

๊ฒ€์ฆ ๋ฐ์ดํ„ฐ์…‹์—์„œ 10,240๊ฐœ ํ† ํฐ์„ ์ƒ˜ํ”Œ๋งํ•˜์—ฌ ๋ชจ๋ธ์˜ ์˜ˆ์ธก ์‹ ๋ขฐ๋„์™€ ์ •ํ™•๋„๋ฅผ ์ธก์ •ํ–ˆ๋‹ค.

์ง€ํ‘œ ๊ฐ’
๋ถ„์„ ํ† ํฐ ์ˆ˜ 10,240
ํ‰๊ท  ์ •๋‹ต ํ† ํฐ ํ™•๋ฅ  (Mean correct-token prob) 0.4738
ํ‰๊ท  ์˜ˆ์ธก ์—”ํŠธ๋กœํ”ผ 2.2413 nats
Accuracy @1 (Top-1 ์ •ํ™•๋„) 56.18%
Accuracy @5 72.35%
Accuracy @10 77.75%

2. ๋ถ„์„

2-1. Accuracy@1 = 56.18%

๋‹ค์Œ ํ† ํฐ์„ 56%์˜ ํ™•๋ฅ ๋กœ ์ •ํ™•ํžˆ ๋งžํžŒ๋‹ค๋Š” ๊ฒƒ์€ 1B ๊ทœ๋ชจ ๋ชจ๋ธ ๊ธฐ์ค€์œผ๋กœ ์–‘ํ˜ธํ•œ ์ˆ˜์น˜๋‹ค. ๋น„๊ต ๊ธฐ์ค€์œผ๋กœ, GPT-2(1.5B)์˜ ์˜์–ด WikiText์—์„œ์˜ Top-1 accuracy๊ฐ€ ์•ฝ 40~50% ์ˆ˜์ค€์ด์—ˆ์œผ๋ฏ€๋กœ, ํ•œ๊ตญ์–ด ๋ฐ์ดํ„ฐ์—์„œ 56%๋Š” ๊ทธ๋ณด๋‹ค ๋†’์€ ์ˆ˜์ค€์ด๋‹ค.

ํ•œ๊ตญ์–ด ํŠน์„ฑ์ƒ ์กฐ์‚ฌ(์ด/๊ฐ€, ์„/๋ฅผ, ์€/๋Š”), ์–ด๋ฏธ(~๋‹ค, ~๊ณ , ~์„œ), ๋ฌธ์žฅ ์ข…๊ฒฐ์–ด๋ฏธ ๋“ฑ ๋ฌธ๋ฒ•์ ์œผ๋กœ ์˜ˆ์ธก ๊ฐ€๋Šฅํ•œ ํ† ํฐ์ด ๋งŽ์•„ accuracy๊ฐ€ ์ƒ๋Œ€์ ์œผ๋กœ ๋†’๊ฒŒ ๋‚˜ํƒ€๋‚  ์ˆ˜ ์žˆ๋‹ค๋Š” ์ ๋„ ๊ณ ๋ คํ•ด์•ผ ํ•œ๋‹ค. ๊ทธ๋Ÿผ์—๋„ ๋ถˆ๊ตฌํ•˜๊ณ  56%๋Š” ๋ชจ๋ธ์ด ์–ธ์–ด ๊ตฌ์กฐ๋ฅผ ์ถฉ๋ถ„ํžˆ ํ•™์Šตํ–ˆ์Œ์„ ๋‚˜ํƒ€๋‚ธ๋‹ค.

2-2. Accuracy@5 = 72.35%

Top-5 ์•ˆ์— ์ •๋‹ต์ด ์žˆ๋Š” ๋น„์œจ์ด 72%๋กœ, ๋ชจ๋ธ์ด ํ•ฉ๋ฆฌ์ ์ธ ํ›„๋ณด๊ตฐ์„ ์ž˜ ์ œ์‹œํ•˜๊ณ  ์žˆ๋‹ค. Accuracy@1(56%)๊ณผ @5(72%) ์‚ฌ์ด์˜ ๊ฒฉ์ฐจ๋Š” ์•ฝ 16%p๋‹ค. ์ด๋Š” ๋ชจ๋ธ์ด ํ™•์‹ ํ•˜์ง€ ๋ชปํ•˜๋Š” ํ† ํฐ์ด 16% ์ •๋„ ์กด์žฌํ•˜์ง€๋งŒ, ๊ทธ ํ† ํฐ๋“ค์€ ์—ฌ์ „ํžˆ ์ƒ์œ„ 5๊ฐœ ํ›„๋ณด๊ตฐ ์•ˆ์— ํฌํ•จ์‹œํ‚จ๋‹ค๋Š” ์˜๋ฏธ๋‹ค. ์ฆ‰ ๋ชจ๋ธ์ด ํ‹€๋ฆด ๋•Œ๋„ "ํ•ฉ๋ฆฌ์ ์œผ๋กœ ํ‹€๋ฆฐ๋‹ค"๋Š” ๊ฒƒ์„ ์‹œ์‚ฌํ•œ๋‹ค.

2-3. Accuracy@10 = 77.75%

@5(72.35%)์™€ @10(77.75%) ์‚ฌ์ด์˜ ๊ฒฉ์ฐจ๋Š” ์•ฝ 5%p๋กœ, @1โ†’@5 ๊ฒฉ์ฐจ(16%p)๋ณด๋‹ค ํฌ๊ฒŒ ์ค„์–ด๋“ ๋‹ค. Top-5๋ฅผ ๋„˜์–ด์„œ๋ฉด ์ถ”๊ฐ€์ ์ธ ์ด๋“์ด ๊ธ‰๊ฒฉํžˆ ๊ฐ์†Œํ•˜๋Š” ์ˆ˜์ต ์ฒด๊ฐ ๊ตฌ์กฐ๋‹ค. ๋‚˜๋จธ์ง€ 22.25%์˜ ํ† ํฐ์€ Top-10์—๋„ ํฌํ•จ๋˜์ง€ ์•Š์œผ๋ฉฐ, ์ด๋“ค์€ ์ฃผ๋กœ ๋‹ค์Œ์— ํ•ด๋‹นํ•  ๊ฐ€๋Šฅ์„ฑ์ด ๋†’๋‹ค:

  • ๊ณ ์œ ๋ช…์‚ฌ: ์ธ๋ฌผ๋ช…, ์ง€๋ช…, ๋ธŒ๋žœ๋“œ๋ช… ๋“ฑ ํ•™์Šต ๋นˆ๋„๊ฐ€ ๋‚ฎ์€ ํ† ํฐ
  • ์ˆซ์ž ๋ฐ ์ˆ˜์น˜: ํŠน์ • ์—ฐ๋„, ๊ธˆ์•ก, ํ†ต๊ณ„ ์ˆ˜์น˜
  • ๋“œ๋ฌธ ํ‘œํ˜„: ์ €๋นˆ๋„ ์–ดํœ˜, ์ „๋ฌธ ์šฉ์–ด, ์‹ ์กฐ์–ด

์ด 22.25%๊ฐ€ ๋ชจ๋ธ์˜ ์‹ค์งˆ์ ์ธ ์ทจ์•ฝ ๊ตฌ๊ฐ„์ด๋‹ค.

2-4. Mean correct-token prob = 0.4738

์ •๋‹ต ํ† ํฐ์— ๋ถ€์—ฌํ•˜๋Š” ํ‰๊ท  ํ™•๋ฅ ์ด 47%๋‹ค. ์ด๋Š” ๋ชจ๋ธ์ด ์ •๋‹ต ํ† ํฐ์„ ์ ˆ๋ฐ˜์— ๊ฐ€๊นŒ์šด ํ™•๋ฅ ๋กœ "๊ฐ€์žฅ ์œ ๋ ฅํ•œ ํ›„๋ณด"๋กœ ์ง€๋ชฉํ•œ๋‹ค๋Š” ์˜๋ฏธ๋กœ, ๊ฝค ๋†’์€ ํ™•์‹ ๋„๋‹ค.

NLL(Negative Log-Likelihood)๊ณผ์˜ ๊ด€๊ณ„์—์„œ PPL = exp(mean NLL) โ‰ˆ exp(โˆ’ln(0.4738)) โ‰ˆ 1/0.4738 โ‰ˆ 2.11 ์ด ๋˜์–ด์•ผ ํ•˜์ง€๋งŒ, ์‹ค์ œ ์ธก์ •๋œ ์—”ํŠธ๋กœํ”ผ๊ฐ€ 2.2413 nats์ž„์„ ๊ณ ๋ คํ•˜๋ฉด PPL โ‰ˆ exp(2.2413) โ‰ˆ 9.4 ์ˆ˜์ค€์ด๋‹ค. ์ด๋Š” 10,240 ํ† ํฐ subset์˜ ํ†ต๊ณ„๋กœ, ์ „์ฒด ๊ฒ€์ฆ์…‹์˜ PPL=6.95์™€ ๋‹ค์†Œ ์ฐจ์ด๊ฐ€ ์žˆ์œผ๋‚˜ subset ์ƒ˜ํ”Œ๋ง ํŽธํ–ฅ ๋ฒ”์œ„ ๋‚ด๋‹ค.

2-5. Mean entropy = 2.2413 nats

  • bits ๋ณ€ํ™˜: 2.2413 / ln(2) โ‰ˆ 3.23 bits
  • ์œ ํšจ ํ›„๋ณด ์ˆ˜: 2^3.23 โ‰ˆ 9.4๊ฐœ์˜ ํ† ํฐ์ด ์‹ค์งˆ์ ์œผ๋กœ ๊ฒฝ์Ÿํ•œ๋‹ค๋Š” ์˜๋ฏธ
  • ํ•ด์„: 64K vocabulary ์ค‘ ๋งค step๋งˆ๋‹ค ํ‰๊ท  ์•ฝ 9~10๊ฐœ์˜ ํ† ํฐ์ด ์˜๋ฏธ ์žˆ๋Š” ํ™•๋ฅ ์„ ๊ฐ€์ง„๋‹ค๋Š” ๋œป์œผ๋กœ, ๋ชจ๋ธ์ด ์ถฉ๋ถ„ํžˆ confidentํ•˜๋ฉด์„œ๋„ ์™„์ „ํžˆ ๊ฒฐ์ •๋ก ์ ์ด์ง€ ์•Š์Œ์„ ๋ณด์—ฌ์ค€๋‹ค. ์ด ์ˆ˜์ค€์˜ ์—”ํŠธ๋กœํ”ผ๋Š” ๋ฐ˜๋ณต ์—†์ด ๋‹ค์–‘ํ•œ ์ƒ์„ฑ์ด ๊ฐ€๋Šฅํ•œ healthyํ•œ ๋ถ„ํฌ๋ฅผ ์˜๋ฏธํ•œ๋‹ค.

3. ์ข…ํ•ฉ ํ‰๊ฐ€

์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜์€ ์ „๋ฐ˜์ ์œผ๋กœ ๊ฑด๊ฐ•ํ•œ ์ˆ˜์ค€์ด๋‹ค. ํ•ต์‹ฌ ์ง€ํ‘œ๋ฅผ ์ข…ํ•ฉํ•˜๋ฉด:

  1. ์˜ˆ์ธก ํ’ˆ์งˆ ์–‘ํ˜ธ: Accuracy@1 = 56%, Accuracy@5 = 72%๋กœ, ๋ชจ๋ธ์ด ๋‹ค์Œ ํ† ํฐ์„ ์ž˜ ์˜ˆ์ธกํ•˜๋ฉฐ ๋ถˆํ™•์‹คํ•œ ๊ฒฝ์šฐ์—๋„ ํ•ฉ๋ฆฌ์ ์ธ ํ›„๋ณด๊ตฐ์„ ์ œ์‹œํ•œ๋‹ค.

  2. ์ ์ ˆํ•œ ํ™•์‹ ๋„: ํ‰๊ท  ์ •๋‹ต ํ™•๋ฅ  47%, ํ‰๊ท  ์—”ํŠธ๋กœํ”ผ 2.24 nats๋กœ, ๋ชจ๋ธ์ด ๋„ˆ๋ฌด ์ž์‹  ์—†๊ฑฐ๋‚˜(under-confident) ๋„ˆ๋ฌด ์ž์‹ ๋งŒ๋งŒํ•˜์ง€(over-confident) ์•Š๋‹ค. ์ด๋Š” temperature=1.0์—์„œ ์ƒ์„ฑ์ด ํ•ฉ๋ฆฌ์ ์œผ๋กœ ์ž‘๋™ํ•  ๊ฒƒ์„ ์‹œ์‚ฌํ•œ๋‹ค.

  3. Greedy decoding ์ ํ•ฉ์„ฑ: Top-1์ด 56%์ด๋ฉด greedy decoding๋„ ํ•ฉ๋ฆฌ์ ์ธ ๊ฒฐ๊ณผ๋ฅผ ์ค„ ์ˆ˜ ์žˆ๋‹ค. ๋‹จ, ๋‹ค์–‘์„ฑ์€ ๋ถ€์กฑํ•˜๋ฏ€๋กœ ์‹ค์ œ ์ƒ์„ฑ ์• ํ”Œ๋ฆฌ์ผ€์ด์…˜์—์„œ๋Š” sampling์ด ๊ถŒ์žฅ๋œ๋‹ค.

  4. ์ทจ์•ฝ ๊ตฌ๊ฐ„ ์กด์žฌ: Top-10 ๋ฐ–์˜ 22.25% ํ† ํฐ์ด ๋ชจ๋ธ์˜ ์‹ค์งˆ์  ์•ฝ์ ์ด๋ฉฐ, ์ด๋Š” ์ฃผ๋กœ factual knowledge(์‚ฌ์‹ค ์ง€์‹) ๋ถ€์กฑ์—์„œ ๊ธฐ์ธํ•œ๋‹ค. ์ด ๋ถ€๋ถ„์€ ๋” ๋งŽ์€ ํ•™์Šต ๋ฐ์ดํ„ฐ ๋˜๋Š” ์™ธ๋ถ€ ์ง€์‹ ์†Œ์Šค(RAG ๋“ฑ) ํ™œ์šฉ์œผ๋กœ ๋ณด์™„ ๊ฐ€๋Šฅํ•˜๋‹ค.


4. ๊ฐœ์„  ๋ฐฉํ–ฅ

4-1. ๋ชจ๋ธ ํฌ๊ธฐ ์ฆ๊ฐ€

๋ชจ๋ธ ํŒŒ๋ผ๋ฏธํ„ฐ๊ฐ€ ๋Š˜์–ด๋‚จ์— ๋”ฐ๋ผ Accuracy@1์ด ์ƒ์Šนํ•˜๋Š” ๊ฒฝํ–ฅ์ด ๋šœ๋ ทํ•˜๋‹ค. 7B ๋ชจ๋ธ์€ 1B ๋Œ€๋น„ @1์ด 10~15%p ํ–ฅ์ƒ๋˜๋Š” ๊ฒƒ์ด ์ผ๋ฐ˜์ ์ด๋‹ค. ํ˜„์žฌ 1B ๋ชจ๋ธ์˜ 56%๋Š” ๊ธฐ๋ฐ˜์ด ํƒ„ํƒ„ํ•˜์—ฌ ํ™•์žฅ ์‹œ ์ข‹์€ ์ถœ๋ฐœ์ ์ด ๋œ๋‹ค.

4-2. SFT ํ›„ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ ๋ชจ๋‹ˆํ„ฐ๋ง

SFT(Supervised Fine-Tuning) ์ดํ›„ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜์ด ๋ณ€ํ•  ์ˆ˜ ์žˆ๋‹ค. ์ผ๋ฐ˜์ ์œผ๋กœ SFT ํ›„ ๋ชจ๋ธ์€ ํŠน์ • ์‘๋‹ต ํŒจํ„ด์— over-confidentํ•ด์ง€๋Š” ๊ฒฝํ–ฅ์ด ์žˆ์–ด accuracy๊ฐ€ ์•ฝ๊ฐ„ ํ•˜๋ฝํ•˜๊ณ  ์—”ํŠธ๋กœํ”ผ๊ฐ€ ๋‚ฎ์•„์งˆ ์ˆ˜ ์žˆ๋‹ค. SFT ์™„๋ฃŒ ํ›„ ๋™์ผ ์ง€ํ‘œ๋กœ ์žฌ์ธก์ •ํ•˜์—ฌ ๋น„๊ต๋ฅผ ๊ถŒ์žฅํ•œ๋‹ค.

4-3. Temperature ํŠœ๋‹

ํ˜„์žฌ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ ๊ฒฐ๊ณผ๋ฅผ ํ™œ์šฉํ•˜์—ฌ ์ตœ์  temperature๋ฅผ ๊ฒฐ์ •ํ•  ์ˆ˜ ์žˆ๋‹ค. ํ‰๊ท  ์—”ํŠธ๋กœํ”ผ 2.24 nats ๊ธฐ์ค€:

  • Temperature < 1.0: ์—”ํŠธ๋กœํ”ผ ๊ฐ์†Œ, ๋” ๊ฒฐ์ •๋ก ์  ์ƒ์„ฑ, ๋ฐ˜๋ณต ์œ„ํ—˜ ์ฆ๊ฐ€
  • Temperature = 1.0: ํ˜„์žฌ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ ๊ทธ๋Œ€๋กœ ์œ ์ง€
  • Temperature 0.7~0.8: ๋‹ค์–‘์„ฑ๊ณผ coherence์˜ ๊ท ํ˜•์ ์œผ๋กœ ์ถ”์ฒœ

Temperature scaling์„ ํ†ตํ•ด ECE(Expected Calibration Error)๋ฅผ ์ตœ์†Œํ™”ํ•˜๋Š” ์ตœ์ ๊ฐ’์„ ์ฐพ๋Š” ํ›„์ฒ˜๋ฆฌ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜๋„ ๊ณ ๋ คํ•  ์ˆ˜ ์žˆ๋‹ค.

4-4. Top-10 ๋ฐ– ์ทจ์•ฝ ํ† ํฐ ๋ถ„์„

22.25%์˜ Top-10 ๋ฐ– ํ† ํฐ์„ ๋ณ„๋„๋กœ ์ˆ˜์ง‘ยท๋ถ„์„ํ•˜์—ฌ ์ด๋“ค์˜ ๋„๋ฉ”์ธ ๋ถ„ํฌ๋ฅผ ํŒŒ์•…ํ•˜๋ฉด, ์ถ”๊ฐ€ ํ•™์Šต ๋ฐ์ดํ„ฐ ์ˆ˜์ง‘ ๋ฐฉํ–ฅ์„ ๊ฒฐ์ •ํ•˜๋Š” ๋ฐ ํ™œ์šฉํ•  ์ˆ˜ ์žˆ๋‹ค. ์˜ˆ๋ฅผ ๋“ค์–ด ๊ณ ์œ ๋ช…์‚ฌ ๊ด€๋ จ ํ† ํฐ์ด ๋งŽ๋‹ค๋ฉด ์œ„ํ‚คํ”ผ๋””์•„ ๊ธฐ๋ฐ˜ ๋ฐ์ดํ„ฐ๋ฅผ ๋ณด๊ฐ•ํ•˜๋Š” ๊ฒƒ์ด ํšจ๊ณผ์ ์ด๋‹ค.


์š”์•ฝ

๊ตฌ๋ถ„ ์ง€ํ‘œ ๊ฐ’ ํ‰๊ฐ€
๋ฐ˜๋ณต ๋ถ„์„ DEGENERATE ๋น„์œจ 30% (3/10) 1B base ์ˆ˜์ค€์—์„œ ์ •์ƒ ๋ฒ”์œ„
๋ฐ˜๋ณต ๋ถ„์„ ํ‰๊ท  4-gram ๋ฐ˜๋ณต๋ฅ  25.7% ์ž์—ฐ์Šค๋Ÿฌ์šด ํ”„๋กฌํ”„ํŠธ์—์„œ ๋‚ฎ์Œ
์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ Accuracy@1 56.18% ์–‘ํ˜ธ
์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ Accuracy@5 72.35% ์–‘ํ˜ธ
์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ Mean entropy 2.24 nats ๊ฑด๊ฐ•ํ•œ ๋ถ„ํฌ

๊ฒฐ๋ก : korean_1b_fp8_run1 ๋ชจ๋ธ์€ ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ ์ธก๋ฉด์—์„œ 1B pretrain ๋ชจ๋ธ๋กœ์„œ ๊ฑด๊ฐ•ํ•œ ์ƒํƒœ๋ฅผ ๋ณด์ธ๋‹ค. ๋ฐ˜๋ณต ํ‡ดํ™”๋Š” ์‚ฌ์‹ค ๊ธฐ๋ฐ˜ยท์ฝ”๋“œ ํ”„๋กฌํ”„ํŠธ์—์„œ ๊ตญ์†Œ์ ์œผ๋กœ ๋ฐœ์ƒํ•˜๋ฉฐ, sampling ์ „๋žต ๊ฐœ์„ (repetition penalty, top-p)์œผ๋กœ ์ฆ‰์‹œ ์™„ํ™” ๊ฐ€๋Šฅํ•˜๋‹ค. ํ–ฅํ›„ SFT/DPO ๋‹จ๊ณ„์—์„œ ๊ทผ๋ณธ์ ์ธ ๊ฐœ์„ ์ด ์˜ˆ์ƒ๋œ๋‹ค.