Safety-WaRP (WSR-Tune) β€” gsm8k (basis/mask: beavertails) fine-tuned keep_ratio=0.50

kmseong/llama2_7b-chat-Safety-FT-lr5e-5 λ₯Ό μ‹œμž‘μ μœΌλ‘œ, WaRP(Weight space Rotation Process) μž¬νŒŒλΌλ―Έν„°ν™” κ³΅κ°„μ—μ„œ μ•ˆμ „ κ΄€λ ¨ κ³„μˆ˜ λ°©ν–₯을 λ™κ²°ν•œ 채 gsm8k (basis/mask: beavertails) 둜 downstream fine-tuning ν•œ λͺ¨λΈμž…λ‹ˆλ‹€.

  • 각 weight matrix λ₯Ό μž…λ ₯ ν™œμ„±κ°’ κ³΅λΆ„μ‚°μ˜ κ³ μœ κΈ°μ € U 둜 νšŒμ „ (C = W U)
  • μ•ˆμ „ 데이터(circuit_breakers)에 λŒ€ν•œ gradient μ€‘μš”λ„ μƒμœ„ keep_ratio μ’Œν‘œλ₯Ό 동결
  • λ‚˜λ¨Έμ§€("flat") μ’Œν‘œλ§Œ ν•™μŠ΅ β€” forward 의 mask+detach 둜 κ΅¬ν˜„ (non-freeze 방식)
  • token-wise constrained SFT (shallow-vs-deep) κ²°ν•©

적용 λ²”μœ„: q_proj, k_proj, v_proj, up_proj, down_proj / 전체 32개 layer / per-layer μ€‘μš”λ„.

Training run

base model kmseong/llama2_7b-chat-Safety-FT-lr5e-5
downstream data gsm8k (basis/mask: beavertails) (7473 samples)
epochs / lr 3 / 5e-05
batch x grad_accum 2 x 8 (effective 16)
optimizer / scheduler adamw_torch / cosine
coordinate space non_freeze
frozen safety coefficients 2,281,877,037 / 4,496,293,888 (50.75%)
train wall-clock 2003 s
train peak VRAM (device) 100.16 GB
Downloads last month
67
Safetensors
Model size
7B params
Tensor type
BF16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for kmseong/llama2_7b_chat-WaRP-beavertails-kr0.50_lr5e-5