{ "decoder_type": "pos_free", "distill_dim": ["EC_1280", "EP_1280", "DC_1280", "DP_1280"], "distill_location": "encoder-decoder-separate", "distill_mode": "dinov3_fancy", "embedding_dim": 32, "hypocnn_cfg": { "hid_dim": 256, "in_dim": 256, "ks": "3", "out_bias": 0.0, "out_dim": 3, "strds": "4" }, "hyponet_cfg": { "depth": 3, "force_act": true, "hidden_dim": "256_256", "in_dim": 2, "out_bias": 0.0, "out_dim": 256, "pe_dim": 64, "strides": "1_1_1", "use_pe": true }, "is_patch_mode": true, "mod_idxs": "1", "n_groups": null, "tokenizer_cfg": { "decoder_dim": 1280, "dim": 1024, "fixed_posemb": false, "frozen_posemb": false, "input_size": 256, "mae_init": false, "mask_dim": 1280, "mask_ratio": 0.0, "modern": true, "patch_size": 16, "use_decoder": false, "use_transcoder": false }, "transformer_decoder_cfg": { "attention": false, "depth": 4, "dim": 1280, "ff_dim": 4096, "head_dim": 80, "n_head": 16 }, "transformer_encoder_cfg": { "dim": 1024, "img_size": 512, "mae_init": false, "name": "vitl_16_norm_only_rope_fixed_ft", "use_registers": false }, "transformer_transcoder_cfg": { "dim": -1 }, "use_global_token": true, "use_hypocnn": true }