backbone: vit_large_patch16_128 backbone_checkpoint_path_or_url: null backbone_kwargs: depth: 24 embed_dim: 1080 global_pool: '' grad_checkpoint_every: 0 half_patch_embed: true init_values: 1.0 min_area_for_padding: 0.0 mlp_ratio: 4 num_classes: 0 num_heads: 12 patch_size: - 16 - 16 - 8 pixdim: - 0.75 - 0.75 - 3.0 pos_embed: rope qkv_bias: true rope_kwargs: base: 1000.0 sliding_window_size: - 128 - 128 - 32 do_snippet_alignment: enabled: true localization_sigma: 2.0 localization_tau: 0.1 localization_weight: 0.004 projector_mode_image: copy projector_mode_text: copy rope_mode: physical snippet_mode: axis_localization feature_comb_embed_dim: 1080 feature_comb_num_heads: 12 feature_comb_num_layers: 4 feature_combiner: feat_vit_large feature_combiner_checkpoint_path_or_url: null feature_combiner_kwargs: global_pool: '' init_values: 1.0 num_classes: 0 pos_embed: rope rope_kwargs: base: 100.0 freeze_image_projection: false freeze_text_projection: false image_backbone_embed_dim: 1080 image_projection_weights: null model_name: spectre-large-pretrained model_settings: null projection_dim: 512 radfinder_hf_weights: /scratch/local/radiologie/xmed_output/radfinder_hf_export text_backbone_kwargs: grad_checkpoint: false lora_alpha: 64.0 lora_dropout: 0.05 lora_r: 16 lora_target_keywords: - q_proj - k_proj - v_proj - o_proj tokenizer_max_length: 4096 use_lora: true text_hidden_size: 1024 text_projection_weights: null text_tokenizer: Qwen/Qwen3-Embedding-0.6B text_weights: null train_img_size: - 384 - 384 - 128