anyantudre commited on
Commit
f0e28b2
·
verified ·
1 Parent(s): b343a96

model weights

Browse files
added_tokens.json ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ {
2
+ "</s>": 122,
3
+ "<s>": 121
4
+ }
config.json ADDED
@@ -0,0 +1,81 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation_dropout": 0.0,
3
+ "adapter_act": "relu",
4
+ "adapter_kernel_size": 3,
5
+ "adapter_stride": 2,
6
+ "add_adapter": true,
7
+ "apply_spec_augment": false,
8
+ "architectures": [
9
+ "Wav2Vec2BertForCTC"
10
+ ],
11
+ "attention_dropout": 0.0,
12
+ "bos_token_id": 121,
13
+ "classifier_proj_size": 768,
14
+ "codevector_dim": 768,
15
+ "conformer_conv_dropout": 0.1,
16
+ "contrastive_logits_temperature": 0.1,
17
+ "conv_depthwise_kernel_size": 31,
18
+ "ctc_loss_reduction": "mean",
19
+ "ctc_zero_infinity": true,
20
+ "diversity_loss_weight": 0.1,
21
+ "dtype": "float32",
22
+ "eos_token_id": 122,
23
+ "feat_proj_dropout": 0.0,
24
+ "feat_quantizer_dropout": 0.0,
25
+ "feature_projection_input_dim": 160,
26
+ "final_dropout": 0.1,
27
+ "hidden_act": "swish",
28
+ "hidden_dropout": 0.0,
29
+ "hidden_size": 1024,
30
+ "initializer_range": 0.02,
31
+ "intermediate_size": 4096,
32
+ "layer_norm_eps": 1e-05,
33
+ "layerdrop": 0.0,
34
+ "left_max_position_embeddings": 64,
35
+ "mask_feature_length": 10,
36
+ "mask_feature_min_masks": 0,
37
+ "mask_feature_prob": 0.0,
38
+ "mask_time_length": 10,
39
+ "mask_time_min_masks": 2,
40
+ "mask_time_prob": 0.05,
41
+ "max_source_positions": 5000,
42
+ "model_type": "wav2vec2-bert",
43
+ "num_adapter_layers": 1,
44
+ "num_attention_heads": 16,
45
+ "num_codevector_groups": 2,
46
+ "num_codevectors_per_group": 320,
47
+ "num_hidden_layers": 24,
48
+ "num_negatives": 100,
49
+ "output_hidden_size": 1024,
50
+ "pad_token_id": 120,
51
+ "position_embeddings_type": "relative_key",
52
+ "proj_codevector_dim": 768,
53
+ "right_max_position_embeddings": 8,
54
+ "rotary_embedding_base": 10000,
55
+ "tdnn_dilation": [
56
+ 1,
57
+ 2,
58
+ 3,
59
+ 1,
60
+ 1
61
+ ],
62
+ "tdnn_dim": [
63
+ 512,
64
+ 512,
65
+ 512,
66
+ 512,
67
+ 1500
68
+ ],
69
+ "tdnn_kernel": [
70
+ 5,
71
+ 3,
72
+ 3,
73
+ 1,
74
+ 1
75
+ ],
76
+ "transformers_version": "4.57.6",
77
+ "use_intermediate_ffn_before_adapter": false,
78
+ "use_weighted_layer_sum": false,
79
+ "vocab_size": 123,
80
+ "xvector_output_dim": 512
81
+ }
final_metrics.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "loss": 0.4904663860797882,
3
+ "wer": 0.3875640020296139,
4
+ "cer": 0.18429939282676616,
5
+ "score": 0.28593169742819,
6
+ "runtime": 21.1894,
7
+ "samples_per_second": 37.755,
8
+ "steps_per_second": 3.162
9
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8ea627314e14ea4bcb4937f727e290df212ce30e0fdfd0789db59231a4bf4c40
3
+ size 2423323060
preprocessor_config.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "feature_extractor_type": "SeamlessM4TFeatureExtractor",
3
+ "feature_size": 80,
4
+ "num_mel_bins": 80,
5
+ "padding_side": "right",
6
+ "padding_value": 1,
7
+ "processor_class": "Wav2Vec2BertProcessor",
8
+ "return_attention_mask": true,
9
+ "sampling_rate": 16000,
10
+ "stride": 2
11
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token": "<s>",
3
+ "eos_token": "</s>",
4
+ "pad_token": "[PAD]",
5
+ "unk_token": "[UNK]"
6
+ }
tokenizer_config.json ADDED
@@ -0,0 +1,49 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "added_tokens_decoder": {
3
+ "119": {
4
+ "content": "[UNK]",
5
+ "lstrip": true,
6
+ "normalized": false,
7
+ "rstrip": true,
8
+ "single_word": false,
9
+ "special": false
10
+ },
11
+ "120": {
12
+ "content": "[PAD]",
13
+ "lstrip": true,
14
+ "normalized": false,
15
+ "rstrip": true,
16
+ "single_word": false,
17
+ "special": false
18
+ },
19
+ "121": {
20
+ "content": "<s>",
21
+ "lstrip": false,
22
+ "normalized": false,
23
+ "rstrip": false,
24
+ "single_word": false,
25
+ "special": true
26
+ },
27
+ "122": {
28
+ "content": "</s>",
29
+ "lstrip": false,
30
+ "normalized": false,
31
+ "rstrip": false,
32
+ "single_word": false,
33
+ "special": true
34
+ }
35
+ },
36
+ "bos_token": "<s>",
37
+ "clean_up_tokenization_spaces": false,
38
+ "do_lower_case": false,
39
+ "eos_token": "</s>",
40
+ "extra_special_tokens": {},
41
+ "model_max_length": 1000000000000000019884624838656,
42
+ "pad_token": "[PAD]",
43
+ "processor_class": "Wav2Vec2BertProcessor",
44
+ "replace_word_delimiter_char": " ",
45
+ "target_lang": null,
46
+ "tokenizer_class": "Wav2Vec2CTCTokenizer",
47
+ "unk_token": "[UNK]",
48
+ "word_delimiter_token": "|"
49
+ }
vocab.json ADDED
@@ -0,0 +1,123 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "!": 0,
3
+ "\"": 1,
4
+ "&": 2,
5
+ "'": 3,
6
+ "(": 4,
7
+ ")": 5,
8
+ ",": 6,
9
+ "-": 7,
10
+ ".": 8,
11
+ "/": 9,
12
+ "0": 10,
13
+ "1": 11,
14
+ "2": 12,
15
+ "3": 13,
16
+ "4": 14,
17
+ "5": 15,
18
+ "6": 16,
19
+ "7": 17,
20
+ "8": 18,
21
+ "9": 19,
22
+ ":": 20,
23
+ ";": 21,
24
+ "<": 22,
25
+ "=": 23,
26
+ ">": 24,
27
+ "?": 25,
28
+ "A": 26,
29
+ "B": 27,
30
+ "C": 28,
31
+ "D": 29,
32
+ "E": 30,
33
+ "F": 31,
34
+ "G": 32,
35
+ "H": 33,
36
+ "I": 34,
37
+ "J": 35,
38
+ "K": 36,
39
+ "L": 37,
40
+ "M": 38,
41
+ "N": 39,
42
+ "O": 40,
43
+ "P": 41,
44
+ "Q": 42,
45
+ "R": 43,
46
+ "S": 44,
47
+ "T": 45,
48
+ "U": 46,
49
+ "V": 47,
50
+ "W": 48,
51
+ "X": 49,
52
+ "Y": 50,
53
+ "Z": 51,
54
+ "[PAD]": 120,
55
+ "[UNK]": 119,
56
+ "\\": 52,
57
+ "`": 53,
58
+ "a": 54,
59
+ "b": 55,
60
+ "c": 56,
61
+ "d": 57,
62
+ "e": 58,
63
+ "f": 59,
64
+ "g": 60,
65
+ "h": 61,
66
+ "i": 62,
67
+ "j": 63,
68
+ "k": 64,
69
+ "l": 65,
70
+ "m": 66,
71
+ "n": 67,
72
+ "o": 68,
73
+ "p": 69,
74
+ "q": 70,
75
+ "r": 71,
76
+ "s": 72,
77
+ "t": 73,
78
+ "u": 74,
79
+ "v": 75,
80
+ "w": 76,
81
+ "x": 77,
82
+ "y": 78,
83
+ "z": 79,
84
+ "|": 118,
85
+ "«": 80,
86
+ "»": 81,
87
+ "É": 82,
88
+ "×": 83,
89
+ "à": 84,
90
+ "á": 85,
91
+ "â": 86,
92
+ "ç": 87,
93
+ "è": 88,
94
+ "é": 89,
95
+ "ê": 90,
96
+ "ë": 91,
97
+ "ì": 92,
98
+ "í": 93,
99
+ "î": 94,
100
+ "ï": 95,
101
+ "ñ": 96,
102
+ "ò": 97,
103
+ "ó": 98,
104
+ "ô": 99,
105
+ "ù": 100,
106
+ "ú": 101,
107
+ "û": 102,
108
+ "ü": 103,
109
+ "þ": 104,
110
+ "ā": 105,
111
+ "ĝ": 106,
112
+ "Ķ": 107,
113
+ "ķ": 108,
114
+ "Ĺ": 109,
115
+ "ĺ": 110,
116
+ "Ŋ": 111,
117
+ "ŋ": 112,
118
+ "Œ": 113,
119
+ "œ": 114,
120
+ "ᵑ": 115,
121
+ "⭐": 116,
122
+ "️": 117
123
+ }