name: checkpoint model_family: wav2vec2_llama model_config: wav2vec2_asr_config: encoder_config: model_dim: 1024 max_seq_len: 4096 feature_dim: 512 use_fbank: false first_pass_dropout_p: 0.0 layer_norm_features: false feature_extractor_layer_descs: - - 512 - 10 - 5 - - 512 - 3 - 2 - - 512 - 3 - 2 - - 512 - 3 - 2 - - 512 - 3 - 2 - - 512 - 2 - 2 - - 512 - 2 - 2 feature_extractor_bias: true feature_extractor_layer_norm_convs: true feature_grad_scale: 0.1 num_fbank_channels: 0 fbank_stride: 0 sample_fbank_every_k: 0 pos_encoder_type: conv pos_encoder_depth: 1 pos_conv_kernel_size: 128 num_pos_conv_groups: 16 use_conformer: false num_encoder_layers: 24 num_encoder_attn_heads: 16 ffn_inner_dim: 4096 dropout_p: 0.0 attn_dropout_p: 0.0 ffn_inner_dropout_p: 0.1 layer_drop_p: 0.1 norm_order: PRE depthwise_conv_kernel_size: 0 target_vocab_size: 9812 final_dropout_p: 0.0 use_masking: false temporal_mask_span_len: 10 max_temporal_mask_prob: 0.0 min_num_temporal_mask_spans: 2 spatial_mask_span_len: 64 max_spatial_mask_prob: 0.0 min_num_spatial_mask_spans: 2 llama_config: model_dim: 4096 max_seq_len: 8192 vocab_size: 9812 pad_idx: 1 tied_embeddings: false num_layers: 12 num_attn_heads: 8 num_key_value_heads: 8 ffn_inner_dim: 4096 ffn_inner_dim_scale: 0.6666666666666666 ffn_inner_dim_multiplier: 1.0 ffn_inner_dim_multiple_of: 256 rope_theta: 10000.0 use_scaled_rope: false rope_scale: factor: 8.0 frequency_factors: - 1.0 - 4.0 original_context_length: 8192 dropout_p: 0.1 init_std: null init_std_scale: layer shard_embed_dim: true beam_search_config: nbest: 5 length_norm: false compression_window: 100 compression_threshold: 4.0 streaming_config: is_streaming: false segment_secs: 15.0 sample_rate: 16000 n_context_segments: 1 text_tokenizer: '' min_audio_ms: 25 encoder_stacking: 1 frozen_encoder: 1 lang_embeddings_p: 0.5 language_column_name: lang context_text_only: false n_special_tokens: 1 unk_idx: 3 bos_idx: 0 eos_idx: 2 pad_idx: 1 boh_idx: null eoh_idx: null model_type: LLM_ASR_LID n_context_examples: 0