|
Download README.md from kmseong/llama2_7b_chat-WaRP-beavertails-kr0.05_lr5e-5: direct link, hf CLI and curl.
- Browser
- Download file 1.43 kB
-
https://huggingface.co/kmseong/llama2_7b_chat-WaRP-beavertails-kr0.05_lr5e-5/resolve/main/README.md
- Command line
-
hf download hf://kmseong/llama2_7b_chat-WaRP-beavertails-kr0.05_lr5e-5/README.md
-
curl -L -o README.md https://huggingface.co/kmseong/llama2_7b_chat-WaRP-beavertails-kr0.05_lr5e-5/resolve/main/README.md
1.43 kB
metadata
license: llama2
base_model: kmseong/llama2_7b-chat-Safety-FT-lr5e-5
tags:
- safety
- warp
- wsr-tune
- circuit-breakers
- gsm8k-basis-mask-beavertails
Safety-WaRP (WSR-Tune) β gsm8k (basis/mask: beavertails) fine-tuned keep_ratio=0.05
kmseong/llama2_7b-chat-Safety-FT-lr5e-5 λ₯Ό μμμ μΌλ‘, WaRP(Weight space Rotation Process) μ¬νλΌλ―Έν°ν 곡κ°μμ
μμ κ΄λ ¨ κ³μ λ°©ν₯μ λκ²°ν μ± gsm8k (basis/mask: beavertails) λ‘ downstream fine-tuning ν λͺ¨λΈμ
λλ€.
- κ° weight matrix λ₯Ό μ
λ ₯ νμ±κ° 곡λΆμ°μ κ³ μ κΈ°μ
Uλ‘ νμ (C = W U) - μμ λ°μ΄ν°(circuit_breakers)μ λν gradient μ€μλ μμ
keep_ratioμ’νλ₯Ό λκ²° - λλ¨Έμ§("flat") μ’νλ§ νμ΅ β forward μ mask+detach λ‘ κ΅¬ν (non-freeze λ°©μ)
- token-wise constrained SFT (shallow-vs-deep) κ²°ν©
μ μ© λ²μ: q_proj, k_proj, v_proj, up_proj, down_proj / μ 체 32κ° layer / per-layer μ€μλ.
Training run
| base model | kmseong/llama2_7b-chat-Safety-FT-lr5e-5 |
| downstream data | gsm8k (basis/mask: beavertails) (7473 samples) |
| epochs / lr | 3 / 5e-05 |
| batch x grad_accum | 2 x 8 (effective 16) |
| optimizer / scheduler | adamw_torch / cosine |
| coordinate space | non_freeze |
| frozen safety coefficients | 228,385,094 / 4,496,293,888 (5.08%) |
| train wall-clock | 1954 s |
| train peak VRAM (device) | 95.95 GB |