logging: project: pixel_titok_video_4 run_name: TL128-BS16-128_32-LPIPS1.0 logging_interval: 50 save_path: out_deploy save_step_interval: 1000 keep_prior_checkpoints: 2 # -1 to keep all resume_from_checkpoint: lpips-90k.ckpt init_from_checkpoint: init_is_latent_ckpt: False discard_disc_on_resume: False model: titok: temporal_patch_size: 4 spatial_patch_size: 16 fsq_levels: [7, 5, 5, 5, 5] num_latent_tokens: 128 encoder_size: base decoder_size: base exp_residual: False lpips_weight: 1.0 lpips_subsample: 8 # calculate lpips score from lpips_subsample frames in each clip. Use -1 to sample all. disc: use_disc: True disc_start: 90000 disc_factor: 1.0 disc_weight: 0.1 lecam_weight: 0.001 # 0.0 = disabled, 0.001 normal. Disabled for single-pass disc every_n: 2 # train disc every n generator steps adapt_disc_weight: False dataset: train_dataset: ["hf://datasets/sailvideo/MiraData-v1/**/*.tar", "hf://datasets/sailvideo/webvid10m_resize128/**/*.tar"] eval_dataset: "03.tar" resolution: 128 num_frames: 32 frames_per_second: 8 workers: 4 pin_memory: False # uses extra VRAM when enabled. optimizer: titok: learning_rate: 1e-4 beta1: 0.9 beta2: 0.99 weight_decay: 1e-4 warmup_steps: 2000 end_lr: 1e-5 disc: learning_rate: 1e-4 beta1: 0.9 beta2: 0.99 weight_decay: 1e-4 warmup_steps: 0 end_lr: 1e-5 training: torch_compile: True seed: 42 max_grad_norm: 1.0 batch_size: 16 enable_tf32: True precision: bf16-mixed train_devices: 1 accelerator: 'gpu' max_steps: 300000 val_step_interval: 500 eval_log_codebook: True eval_recon_log_num: 4 # should be less than eval_sample_size eval_sample_size: 32 eval_batch_size: 4 eval_clear_cache: True