Safety-WaRP (WSR-Tune) β gsm8k (basis/mask: beavertails) fine-tuned keep_ratio=0.50
kmseong/llama2_7b-chat-Safety-FT-lr5e-5 λ₯Ό μμμ μΌλ‘, WaRP(Weight space Rotation Process) μ¬νλΌλ―Έν°ν 곡κ°μμ
μμ κ΄λ ¨ κ³μ λ°©ν₯μ λκ²°ν μ± gsm8k (basis/mask: beavertails) λ‘ downstream fine-tuning ν λͺ¨λΈμ
λλ€.
- κ° weight matrix λ₯Ό μ
λ ₯ νμ±κ° 곡λΆμ°μ κ³ μ κΈ°μ
Uλ‘ νμ (C = W U) - μμ λ°μ΄ν°(circuit_breakers)μ λν gradient μ€μλ μμ
keep_ratioμ’νλ₯Ό λκ²° - λλ¨Έμ§("flat") μ’νλ§ νμ΅ β forward μ mask+detach λ‘ κ΅¬ν (non-freeze λ°©μ)
- token-wise constrained SFT (shallow-vs-deep) κ²°ν©
μ μ© λ²μ: q_proj, k_proj, v_proj, up_proj, down_proj / μ 체 32κ° layer / per-layer μ€μλ.
Training run
| base model | kmseong/llama2_7b-chat-Safety-FT-lr5e-5 |
| downstream data | gsm8k (basis/mask: beavertails) (7473 samples) |
| epochs / lr | 3 / 5e-05 |
| batch x grad_accum | 2 x 8 (effective 16) |
| optimizer / scheduler | adamw_torch / cosine |
| coordinate space | non_freeze |
| frozen safety coefficients | 2,281,877,037 / 4,496,293,888 (50.75%) |
| train wall-clock | 2003 s |
| train peak VRAM (device) | 100.16 GB |
- Downloads last month
- 67
Inference Providers NEW
This model isn't deployed by any Inference Provider. π Ask for provider support
Model tree for kmseong/llama2_7b_chat-WaRP-beavertails-kr0.50_lr5e-5
Base model
meta-llama/Llama-3.2-3B-Instruct Finetuned
kmseong/llama2_7b-chat-Safety-FT-lr5e-5