| # RL GRPO for the gemma-4-26B-A4B NLA (self-contained trainer, bf16, GPU0). | |
| # reward = -log reconstruction MSE; --train-critic REQUIRED (else advantages collapse). | |
| set -u | |
| set -a; source /root/.nla_env; set +a | |
| export PYTHONUNBUFFERED=1 | |
| export WANDB_ENTITY=MATS10-CS-JB | |
| export WANDB_RUN_GROUP=g4a | |
| export TOKENIZERS_PARALLELISM=false | |
| DATA=${DATA:-/data/gemma4_nla/or} | |
| CK=/ckpts/gemma4_nla | |
| BASE=google/gemma-4-26B-A4B-it | |
| AV=${AV:-$CK/av/iter_0001000} | |
| AR=${AR:-$CK/ar/iter_0001000} | |
| CUDA_VISIBLE_DEVICES=${GPU:-0} python3 -m nla.train_rl_self_contained \ | |
| --av-ckpt "$AV" --ar-ckpt "$AR" \ | |
| --base-ckpt "$BASE" --quant none \ | |
| --rl-parquet $DATA/rl_shuf.parquet --sidecar $DATA/rl_shuf.parquet \ | |
| --save-dir $CK/rl \ | |
| --num-steps 500 --batch-prompts 16 --group-size 16 \ | |
| --max-new-tokens 150 --temperature 1.0 \ | |
| --lr 1e-5 --kl-beta 0.01 --clip-eps 0.2 \ | |
| --train-critic --critic-lr 5e-5 \ | |
| --logp-micro-batch 2 --max-rows 30000 \ | |
| --save-every 20 --eval-every 20 --eval-n-prompts 20 --eval-skip-rows 35000 \ | |
| --eval-n-hallucination 0 --eval-n-karvonen 0 \ | |
| --max-grad-norm 1.0 \ | |
| --wandb-project cot-oracle --wandb-name g4a_rl_grpo --seed 0 | |