| name: checkpoint | |
| model_family: wav2vec2_llama | |
| model_config: | |
| wav2vec2_asr_config: | |
| encoder_config: | |
| model_dim: 1024 | |
| max_seq_len: 4096 | |
| feature_dim: 512 | |
| use_fbank: false | |
| first_pass_dropout_p: 0.0 | |
| layer_norm_features: false | |
| feature_extractor_layer_descs: | |
| - - 512 | |
| - 10 | |
| - 5 | |
| - - 512 | |
| - 3 | |
| - 2 | |
| - - 512 | |
| - 3 | |
| - 2 | |
| - - 512 | |
| - 3 | |
| - 2 | |
| - - 512 | |
| - 3 | |
| - 2 | |
| - - 512 | |
| - 2 | |
| - 2 | |
| - - 512 | |
| - 2 | |
| - 2 | |
| feature_extractor_bias: true | |
| feature_extractor_layer_norm_convs: true | |
| feature_grad_scale: 0.1 | |
| num_fbank_channels: 0 | |
| fbank_stride: 0 | |
| sample_fbank_every_k: 0 | |
| pos_encoder_type: conv | |
| pos_encoder_depth: 1 | |
| pos_conv_kernel_size: 128 | |
| num_pos_conv_groups: 16 | |
| use_conformer: false | |
| num_encoder_layers: 24 | |
| num_encoder_attn_heads: 16 | |
| ffn_inner_dim: 4096 | |
| dropout_p: 0.0 | |
| attn_dropout_p: 0.0 | |
| ffn_inner_dropout_p: 0.1 | |
| layer_drop_p: 0.1 | |
| norm_order: PRE | |
| depthwise_conv_kernel_size: 0 | |
| target_vocab_size: 9812 | |
| final_dropout_p: 0.0 | |
| use_masking: false | |
| temporal_mask_span_len: 10 | |
| max_temporal_mask_prob: 0.0 | |
| min_num_temporal_mask_spans: 2 | |
| spatial_mask_span_len: 64 | |
| max_spatial_mask_prob: 0.0 | |
| min_num_spatial_mask_spans: 2 | |
| llama_config: | |
| model_dim: 4096 | |
| max_seq_len: 8192 | |
| vocab_size: 9812 | |
| pad_idx: 1 | |
| tied_embeddings: false | |
| num_layers: 12 | |
| num_attn_heads: 8 | |
| num_key_value_heads: 8 | |
| ffn_inner_dim: 4096 | |
| ffn_inner_dim_scale: 0.6666666666666666 | |
| ffn_inner_dim_multiplier: 1.0 | |
| ffn_inner_dim_multiple_of: 256 | |
| rope_theta: 10000.0 | |
| use_scaled_rope: false | |
| rope_scale: | |
| factor: 8.0 | |
| frequency_factors: | |
| - 1.0 | |
| - 4.0 | |
| original_context_length: 8192 | |
| dropout_p: 0.1 | |
| init_std: null | |
| init_std_scale: layer | |
| shard_embed_dim: true | |
| beam_search_config: | |
| nbest: 5 | |
| length_norm: false | |
| compression_window: 100 | |
| compression_threshold: 4.0 | |
| streaming_config: | |
| is_streaming: false | |
| segment_secs: 15.0 | |
| sample_rate: 16000 | |
| n_context_segments: 1 | |
| text_tokenizer: '' | |
| min_audio_ms: 25 | |
| encoder_stacking: 1 | |
| frozen_encoder: 1 | |
| lang_embeddings_p: 0.5 | |
| language_column_name: lang | |
| context_text_only: false | |
| n_special_tokens: 1 | |
| unk_idx: 3 | |
| bos_idx: 0 | |
| eos_idx: 2 | |
| pad_idx: 1 | |
| boh_idx: null | |
| eoh_idx: null | |
| model_type: LLM_ASR_LID | |
| n_context_examples: 0 | |