### model model_name_or_path: google/gemma-3n-E2B-it image_max_pixels: 1048576 trust_remote_code: true ### method stage: sft do_train: true finetuning_type: lora freeze_vision_tower: false freeze_multi_modal_projector: false freeze_language_model: false lora_rank: 32 lora_target: "q_proj, k_proj, v_proj, o_proj" deepspeed: examples/deepspeed/ds_z2_config.json ### dataset dataset: and_ctrl_train # video: mllm_video_demo template: gemma3n cutoff_len: 1024 # 2048 -> 1024 (토큰 짧으면 속도/메모리 이득) # max_samples: 1000 # 전체 학습이면 제거/주석 처리 overwrite_cache: true preprocessing_num_workers: 8 dataloader_num_workers: 8 # 8~16 권장, 중간값으로 상향 ### output output_dir: saves/gemma-e2b/lora/sft/train logging_steps: 1 save_steps: 300 plot_loss: true overwrite_output_dir: true save_only_model: false report_to: wandb # choices: [none, wandb, tensorboard, swanlab, mlflow] run_name: and_ctrl-skt-gemma-e2b-lora-sft-train ### train per_device_train_batch_size: 4 gradient_accumulation_steps: 48 learning_rate: 2e-5 num_train_epochs: 5.0 lr_scheduler_type: cosine warmup_ratio: 0.1 bf16: true ddp_timeout: 180000000 resume_from_checkpoint: null seed: 42 # 추가 적용(요청 사항) gradient_checkpointing: true optim: adamw_torch_fused weight_decay: 0.01 ### eval val_size: 0.05 per_device_eval_batch_size: 1 eval_strategy: steps eval_steps: 500