NilanE's picture
Upload config.yaml with huggingface_hub
2afe070 verified
Raw
History Blame Contribute Delete
2.12 kB
logging:
project: pixel_titok_video_4
run_name: TL128-BS16-128_32-LPIPS1.0
logging_interval: 50
save_path: out_deploy
save_step_interval: 1000
keep_prior_checkpoints: 2 # -1 to keep all
resume_from_checkpoint: lpips-90k.ckpt
init_from_checkpoint:
init_is_latent_ckpt: False
discard_disc_on_resume: False
model:
titok:
temporal_patch_size: 4
spatial_patch_size: 16
fsq_levels: [7, 5, 5, 5, 5]
num_latent_tokens: 128
encoder_size: base
decoder_size: base
exp_residual: False
lpips_weight: 1.0
lpips_subsample: 8 # calculate lpips score from lpips_subsample frames in each clip. Use -1 to sample all.
disc:
use_disc: True
disc_start: 90000
disc_factor: 1.0
disc_weight: 0.1
lecam_weight: 0.001 # 0.0 = disabled, 0.001 normal. Disabled for single-pass disc
every_n: 2 # train disc every n generator steps
adapt_disc_weight: False
dataset:
train_dataset: ["hf://datasets/sailvideo/MiraData-v1/**/*.tar", "hf://datasets/sailvideo/webvid10m_resize128/**/*.tar"]
eval_dataset: "03.tar"
resolution: 128
num_frames: 32
frames_per_second: 8
workers: 4
pin_memory: False # uses extra VRAM when enabled.
optimizer:
titok:
learning_rate: 1e-4
beta1: 0.9
beta2: 0.99
weight_decay: 1e-4
warmup_steps: 2000
end_lr: 1e-5
disc:
learning_rate: 1e-4
beta1: 0.9
beta2: 0.99
weight_decay: 1e-4
warmup_steps: 0
end_lr: 1e-5
training:
torch_compile: True
seed: 42
max_grad_norm: 1.0
batch_size: 16
enable_tf32: True
precision: bf16-mixed
train_devices: 1
accelerator: 'gpu'
max_steps: 300000
val_step_interval: 500
eval_log_codebook: True
eval_recon_log_num: 4 # should be less than eval_sample_size
eval_sample_size: 32
eval_batch_size: 4
eval_clear_cache: True