kmseong's picture
Upload Safety-WaRP Phase 3 model (keep_ratio=0.30, lr=5e-5)
a5f254f verified
|
Raw History Blame Contribute Delete
1.44 kB
---
license: llama2
base_model: "kmseong/llama2_7b-chat-Safety-FT-lr5e-5"
tags:
- "safety"
- "warp"
- "wsr-tune"
- "circuit-breakers"
- "gsm8k-basis-mask-beavertails"
---
# Safety-WaRP (WSR-Tune) β€” gsm8k (basis/mask: beavertails) fine-tuned keep_ratio=0.30
`kmseong/llama2_7b-chat-Safety-FT-lr5e-5` λ₯Ό μ‹œμž‘μ μœΌλ‘œ, WaRP(Weight space Rotation Process) μž¬νŒŒλΌλ―Έν„°ν™” κ³΅κ°„μ—μ„œ
**μ•ˆμ „ κ΄€λ ¨ κ³„μˆ˜ λ°©ν–₯을 λ™κ²°ν•œ 채** gsm8k (basis/mask: beavertails) 둜 downstream fine-tuning ν•œ λͺ¨λΈμž…λ‹ˆλ‹€.
- 각 weight matrix λ₯Ό μž…λ ₯ ν™œμ„±κ°’ κ³΅λΆ„μ‚°μ˜ κ³ μœ κΈ°μ € `U` 둜 νšŒμ „ (`C = W U`)
- μ•ˆμ „ 데이터(circuit_breakers)에 λŒ€ν•œ gradient μ€‘μš”λ„ μƒμœ„ `keep_ratio` μ’Œν‘œλ₯Ό 동결
- λ‚˜λ¨Έμ§€("flat") μ’Œν‘œλ§Œ ν•™μŠ΅ β€” forward 의 mask+detach 둜 κ΅¬ν˜„ (non-freeze 방식)
- token-wise constrained SFT (shallow-vs-deep) κ²°ν•©
적용 λ²”μœ„: `q_proj, k_proj, v_proj, up_proj, down_proj` / 전체 32개 layer / per-layer μ€‘μš”λ„.
## Training run
| | |
|---|---|
| base model | `kmseong/llama2_7b-chat-Safety-FT-lr5e-5` |
| downstream data | gsm8k (basis/mask: beavertails) (7473 samples) |
| epochs / lr | 3 / 5e-05 |
| batch x grad_accum | 2 x 8 (effective 16) |
| optimizer / scheduler | adamw_torch / cosine |
| coordinate space | non_freeze |
| frozen safety coefficients | 1,362,206,182 / 4,496,293,888 (30.30%) |
| train wall-clock | 1981 s |
| train peak VRAM (device) | 98.52 GB |