anyantudre commited on
Commit
61e8100
·
verified ·
1 Parent(s): f55d1b9

Upload folder using huggingface_hub

Browse files
.failed ADDED
File without changes
added_tokens.json ADDED
@@ -0,0 +1,4 @@
 
 
 
 
 
1
+ {
2
+ "</s>": 80,
3
+ "<s>": 79
4
+ }
config.yaml ADDED
@@ -0,0 +1,71 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ seed: 42
2
+ data:
3
+ hf_dataset: google/WaxalNLP
4
+ languages:
5
+ - lin
6
+ - sna
7
+ - lug
8
+ configs:
9
+ lin: lin_asr
10
+ sna: sna_asr
11
+ lug: lug_asr
12
+ sample_rate: 16000
13
+ max_duration_s: 40.0
14
+ min_duration_s: 0.5
15
+ holdout: speaker_disjoint
16
+ holdout_frac: 0.05
17
+ limit: null
18
+ model:
19
+ type: w2v_bert
20
+ id: facebook/w2v-bert-2.0
21
+ language_adapter: null
22
+ freeze_encoder: false
23
+ gradient_checkpointing: true
24
+ add_adapter: true
25
+ freeze_base: false
26
+ train:
27
+ output_dir: experiments/w2vbert_multi_s42
28
+ per_device_batch_size: 4
29
+ grad_accum: 8
30
+ lr: 0.0001
31
+ warmup_ratio: 0.1
32
+ num_epochs: 5
33
+ max_steps: -1
34
+ save_steps: 1000
35
+ eval_steps: 1000
36
+ eval_max_samples: 800
37
+ save_total_limit: 1
38
+ fp16: true
39
+ bf16: false
40
+ auto_find_batch_size: true
41
+ resume: true
42
+ hub_model_id: anyantudre/waxal-w2vbert_multi_s42
43
+ augment:
44
+ enabled: false
45
+ noise_dir: null
46
+ rir_dir: null
47
+ noise_min_snr: 5.0
48
+ noise_max_snr: 25.0
49
+ p_noise: 0.5
50
+ p_rir: 0.3
51
+ p_gaussian: 0.2
52
+ p_gain: 0.4
53
+ p_pitch: 0.25
54
+ p_speed: 0.25
55
+ p_air: 0.15
56
+ p_mp3: 0.2
57
+ decode:
58
+ num_beams: 1
59
+ max_new_tokens: 225
60
+ ctc_beam_width: 1
61
+ lm: null
62
+ lm_alpha: 0.5
63
+ lm_beta: 1.5
64
+ normalize:
65
+ lowercase: true
66
+ nfc: true
67
+ strip_punct: true
68
+ collapse_ws: true
69
+ infer:
70
+ language_from_id: false
71
+ audio_dir: null
preprocessor_config.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "feature_extractor_type": "SeamlessM4TFeatureExtractor",
3
+ "feature_size": 80,
4
+ "num_mel_bins": 80,
5
+ "padding_side": "right",
6
+ "padding_value": 1,
7
+ "processor_class": "Wav2Vec2BertProcessor",
8
+ "return_attention_mask": true,
9
+ "sampling_rate": 16000,
10
+ "stride": 2
11
+ }
special_tokens_map.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "bos_token": "<s>",
3
+ "eos_token": "</s>",
4
+ "pad_token": "[PAD]",
5
+ "unk_token": "[UNK]"
6
+ }
tokenizer_config.json ADDED
@@ -0,0 +1,49 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "added_tokens_decoder": {
3
+ "77": {
4
+ "content": "[UNK]",
5
+ "lstrip": true,
6
+ "normalized": false,
7
+ "rstrip": true,
8
+ "single_word": false,
9
+ "special": false
10
+ },
11
+ "78": {
12
+ "content": "[PAD]",
13
+ "lstrip": true,
14
+ "normalized": false,
15
+ "rstrip": true,
16
+ "single_word": false,
17
+ "special": false
18
+ },
19
+ "79": {
20
+ "content": "<s>",
21
+ "lstrip": false,
22
+ "normalized": false,
23
+ "rstrip": false,
24
+ "single_word": false,
25
+ "special": true
26
+ },
27
+ "80": {
28
+ "content": "</s>",
29
+ "lstrip": false,
30
+ "normalized": false,
31
+ "rstrip": false,
32
+ "single_word": false,
33
+ "special": true
34
+ }
35
+ },
36
+ "bos_token": "<s>",
37
+ "clean_up_tokenization_spaces": false,
38
+ "do_lower_case": false,
39
+ "eos_token": "</s>",
40
+ "extra_special_tokens": {},
41
+ "model_max_length": 1000000000000000019884624838656,
42
+ "pad_token": "[PAD]",
43
+ "processor_class": "Wav2Vec2BertProcessor",
44
+ "replace_word_delimiter_char": " ",
45
+ "target_lang": null,
46
+ "tokenizer_class": "Wav2Vec2CTCTokenizer",
47
+ "unk_token": "[UNK]",
48
+ "word_delimiter_token": "|"
49
+ }
vocab.json ADDED
@@ -0,0 +1,81 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "&": 0,
3
+ "'": 1,
4
+ "-": 2,
5
+ "/": 3,
6
+ "0": 4,
7
+ "1": 5,
8
+ "2": 6,
9
+ "3": 7,
10
+ "4": 8,
11
+ "5": 9,
12
+ "6": 10,
13
+ "7": 11,
14
+ "8": 12,
15
+ "9": 13,
16
+ "<": 14,
17
+ "=": 15,
18
+ ">": 16,
19
+ "[PAD]": 78,
20
+ "[UNK]": 77,
21
+ "\\": 17,
22
+ "`": 18,
23
+ "a": 19,
24
+ "b": 20,
25
+ "c": 21,
26
+ "d": 22,
27
+ "e": 23,
28
+ "f": 24,
29
+ "g": 25,
30
+ "h": 26,
31
+ "i": 27,
32
+ "j": 28,
33
+ "k": 29,
34
+ "l": 30,
35
+ "m": 31,
36
+ "n": 32,
37
+ "o": 33,
38
+ "p": 34,
39
+ "q": 35,
40
+ "r": 36,
41
+ "s": 37,
42
+ "t": 38,
43
+ "u": 39,
44
+ "v": 40,
45
+ "w": 41,
46
+ "x": 42,
47
+ "y": 43,
48
+ "z": 44,
49
+ "|": 76,
50
+ "×": 45,
51
+ "à": 46,
52
+ "á": 47,
53
+ "â": 48,
54
+ "ç": 49,
55
+ "è": 50,
56
+ "é": 51,
57
+ "ê": 52,
58
+ "ë": 53,
59
+ "ì": 54,
60
+ "í": 55,
61
+ "î": 56,
62
+ "ï": 57,
63
+ "ñ": 58,
64
+ "ò": 59,
65
+ "ó": 60,
66
+ "ô": 61,
67
+ "ù": 62,
68
+ "ú": 63,
69
+ "û": 64,
70
+ "ü": 65,
71
+ "þ": 66,
72
+ "ā": 67,
73
+ "ĝ": 68,
74
+ "ķ": 69,
75
+ "ĺ": 70,
76
+ "ŋ": 71,
77
+ "œ": 72,
78
+ "ᵑ": 73,
79
+ "⭐": 74,
80
+ "️": 75
81
+ }