model_config: configs/model_500m.yaml tokenizer_dir: artifacts/kawk500m-sft-dataset/tokenizer data: sequence_length: 2048 hf_dataset: repo_id: Infinity08/KAWK500M-Korean-SFT-v1 config_name: default revision: 0a8e914359a063b916cfd9a3ee068a38ddcc1f79 train_split: train validation_split: validation shuffle_buffer: 10000 validation_sequences: 300 training: output_dir: runs/kawk500m-ko-instruct-v1-a100 seed: 5150 precision: bf16 per_device_batch_size: 12 gradient_accumulation_steps: 5 epochs: 2.0 max_steps: null learning_rate: 2.0e-5 min_learning_rate: 2.0e-6 warmup_ratio: 0.03 weight_decay: 0.01 adam_beta1: 0.9 adam_beta2: 0.95 adam_eps: 1.0e-8 max_grad_norm: 1.0 gradient_checkpointing: false log_every: 10 eval_every: 100 eval_batches: 20 save_every: 250 save_final: true torch_compile: false compile_mode: default