plbert_params: vocab_size: 198 hidden_size: 768 num_attention_heads: 12 intermediate_size: 2048 max_position_embeddings: 512 num_hidden_layers: 12 dropout: 0.1 model_params: multispeaker: true vocab: "$-´;:,.!?¡¿—…\"«»“” ()†/=ABCDEFGHIJKLMNOPQRSTUVWXYZabcdefghijklmnopqrstuvwxyzéýíó'̯'͡ɑɐɒæɓʙβɔɕçɗɖðʤəɘɚɛɜɝɞɟʄɡɠɢʛɦɧħɥʜɨɪʝɭɬɫɮʟɱɯɰŋɳɲɴøɵɸθœɶʘɹɺɾɻʀʁɽʂʃʈʧʉʊʋⱱʌɣɤʍχʎʏʑʐʒʔʡʕʢǀǁǂǃˈˌːˑʼʴʰʱʲ'̩'ᵻ" dim_in: 64 hidden_dim: 512 max_conv_dim: 512 n_layer: 3 n_mels: 80 n_token: 181 # number of phoneme tokens max_dur: 50 # maximum duration of a single phoneme style_dim: 128 # style vector size dropout: 0.0 # config for decoder decoder: type: 'istftnet' # either hifigan or istftnet resblock_kernel_sizes: [3,7,11] upsample_rates : [10, 6] upsample_initial_channel: 512 resblock_dilation_sizes: [[1,3,5], [1,3,5], [1,3,5]] upsample_kernel_sizes: [20, 12] gen_istft_n_fft: 20 gen_istft_hop_size: 5 # style diffusion model config diffusion: embedding_mask_proba: 0.1 # transformer config transformer: num_layers: 3 num_heads: 8 head_features: 64 multiplier: 2 # diffusion distribution config dist: sigma_data: 0.18 mean: -4.0 std: 4.0 asr_params: input_dim: 80 hidden_dim: 256 n_token: 181 token_embedding_dim: 512