GnafiY commited on
Commit
ff48553
·
verified ·
1 Parent(s): 279354f

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -1,35 +1,4 @@
1
- *.7z filter=lfs diff=lfs merge=lfs -text
2
- *.arrow filter=lfs diff=lfs merge=lfs -text
3
- *.bin filter=lfs diff=lfs merge=lfs -text
4
- *.bz2 filter=lfs diff=lfs merge=lfs -text
5
- *.ckpt filter=lfs diff=lfs merge=lfs -text
6
- *.ftz filter=lfs diff=lfs merge=lfs -text
7
- *.gz filter=lfs diff=lfs merge=lfs -text
8
- *.h5 filter=lfs diff=lfs merge=lfs -text
9
- *.joblib filter=lfs diff=lfs merge=lfs -text
10
- *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
- *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
- *.model filter=lfs diff=lfs merge=lfs -text
13
- *.msgpack filter=lfs diff=lfs merge=lfs -text
14
- *.npy filter=lfs diff=lfs merge=lfs -text
15
- *.npz filter=lfs diff=lfs merge=lfs -text
16
- *.onnx filter=lfs diff=lfs merge=lfs -text
17
- *.ot filter=lfs diff=lfs merge=lfs -text
18
- *.parquet filter=lfs diff=lfs merge=lfs -text
19
- *.pb filter=lfs diff=lfs merge=lfs -text
20
- *.pickle filter=lfs diff=lfs merge=lfs -text
21
- *.pkl filter=lfs diff=lfs merge=lfs -text
22
- *.pt filter=lfs diff=lfs merge=lfs -text
23
- *.pth filter=lfs diff=lfs merge=lfs -text
24
- *.rar filter=lfs diff=lfs merge=lfs -text
25
- *.safetensors filter=lfs diff=lfs merge=lfs -text
26
- saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
- *.tar.* filter=lfs diff=lfs merge=lfs -text
28
- *.tar filter=lfs diff=lfs merge=lfs -text
29
- *.tflite filter=lfs diff=lfs merge=lfs -text
30
- *.tgz filter=lfs diff=lfs merge=lfs -text
31
- *.wasm filter=lfs diff=lfs merge=lfs -text
32
- *.xz filter=lfs diff=lfs merge=lfs -text
33
- *.zip filter=lfs diff=lfs merge=lfs -text
34
- *.zst filter=lfs diff=lfs merge=lfs -text
35
- *tfevents* filter=lfs diff=lfs merge=lfs -text
 
1
+ mix-clean/backbone/models/checkpoint_150.pt filter=lfs diff=lfs merge=lfs -text
2
+ mix-clean/kce/epoch_149.pt filter=lfs diff=lfs merge=lfs -text
3
+ backbone/models/checkpoint_150.pt filter=lfs diff=lfs merge=lfs -text
4
+ kce/epoch_149.pt filter=lfs diff=lfs merge=lfs -text
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
README.md ADDED
@@ -0,0 +1,18 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # DAE-TSE Pretrained Models
2
+
3
+ ## KCE (Keyword-guided Cue Encoder)
4
+
5
+ - **File**: `kce/epoch_149.pt`
6
+ - **Architecture**: `AEDKWSASRPhone`
7
+ - **Training data**: LibriSpeech train-clean-360 + train-other-500
8
+ - **Validation data**: LibriSpeech train-clean-100
9
+ - **Config**: `kce/model.yaml`, `kce/data.yaml`
10
+
11
+ ## Backbone (DAE-BSRNN)
12
+
13
+ - **File**: `backbone/models/checkpoint_150.pt`
14
+ - **Architecture**: `DAE-BSRNN` (text-aware BSRNN with TC-ASR encoder)
15
+ - **Training data**: Libri2Mix-100 mix-clean
16
+ - **Config**: `backbone/config.yaml`
17
+
18
+ > After downloading, update `model_args.tse_model.asr_encoder.checkpoint_dir` in `backbone/config.yaml` to the absolute path of `kce/epoch_149.pt`.
backbone/config.yaml ADDED
@@ -0,0 +1,106 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ clip_grad: 5.0
2
+ config: confs/whole_utt/dae-bsrnn.yaml
3
+ data_type: shard
4
+ dataloader_args:
5
+ batch_size: 1
6
+ drop_last: true
7
+ num_workers: 1
8
+ pin_memory: true
9
+ prefetch_factor: 6
10
+ dataset_args:
11
+ SSA_enroll_prob: 0
12
+ additional:
13
+ train:
14
+ data_list: data/text_cue/dump/ready/train-100.jsonl
15
+ data_type: TC-ASR
16
+ val:
17
+ data_list: data/text_cue/dump/ready/dev.jsonl
18
+ data_type: TC-ASR
19
+ chunk_len: 48000
20
+ fbank_args:
21
+ dither: 1.0
22
+ frame_length: 25
23
+ frame_shift: 10
24
+ num_mel_bins: 80
25
+ noise_enroll_prob: 0
26
+ noise_lmdb_file: ./data/musan/lmdb
27
+ noise_prob: 0
28
+ resample_rate: 16000
29
+ reverb_enroll_prob: 0
30
+ sample_num_per_epoch: 0
31
+ shuffle: false
32
+ shuffle_args:
33
+ shuffle_size: 2500
34
+ speaker_feat: true
35
+ specaug_enroll_prob: 0
36
+ enable_amp: false
37
+ exp_dir: exp/whole_utt/dae-bsrnn
38
+ gpus:
39
+ - 0
40
+ - 1
41
+ - 2
42
+ - 3
43
+ - 4
44
+ - 5
45
+ - 6
46
+ - 7
47
+ log_batch_interval: 100
48
+ loss: SISDR
49
+ loss_args: {}
50
+ model:
51
+ tse_model: DAE-BSRNN
52
+ model_args:
53
+ tse_model:
54
+ cue_emb_dim: 128
55
+ asr_encoder:
56
+ model_name: 'TCASREncoder'
57
+ checkpoint_path: exp/kce/epoch_149.pt #'checkpoint directory to the kce encoder', e.g. Pretrained/mix-clean/kce/epoch_149.pt
58
+ fnn:
59
+ input_dim: 256
60
+ num_layer: 3
61
+ output_dim: 128
62
+ multi_task: false
63
+ spksInTrain: 251
64
+ cue_fuse:
65
+ fuse_type: FiLM
66
+ multi_fuse: false
67
+ feature_dim: 128
68
+ multi_task: false
69
+ num_repeat: 6
70
+ spk_optim_head: asr
71
+ sr: 16000
72
+ stride: 128
73
+ win: 512
74
+ model_init:
75
+ discriminator: null
76
+ spk_model: null
77
+ tse_model: null
78
+ num_avg: 10
79
+ num_epochs: 150
80
+ optimizer:
81
+ tse_model: Adam
82
+ optimizer_args:
83
+ tse_model:
84
+ lr: 0.001
85
+ weight_decay: 0.0001
86
+ save_epoch_interval: 1
87
+ scheduler:
88
+ tse_model: ExponentialDecrease
89
+ scheduler_args:
90
+ scale_ratio: 1.0
91
+ tse_model:
92
+ epoch_iter: 1737
93
+ final_lr: 2.5e-05
94
+ initial_lr: 0.001
95
+ num_epochs: 150
96
+ warm_from_zero: false
97
+ warm_up_epoch: 0
98
+ seed: 42
99
+ train_data: data/clean/train-100/shard.list
100
+ train_spk2utt: data/clean/train-100/spk2enroll.json
101
+ train_utt2spk: data/clean/train-100/single.utt2spk
102
+ val_data: data/clean/dev/shard.list
103
+ val_spk1_enroll: data/clean/dev/spk1.enroll
104
+ val_spk2_enroll: data/clean/dev/spk2.enroll
105
+ val_spk2utt: data/clean/dev/single.wav.scp
106
+ whole_utt: true
backbone/models/checkpoint_150.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:404a63efc4c6df122c2902a0b72339ce86725e685c978357d8ce3bb81b4a911e
3
+ size 220761736
kce/data.yaml ADDED
@@ -0,0 +1,71 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ batch_size: 48
2
+ epoch: 150
3
+ fetch_key: mixspeech,mixspeech_len,phn_label,phn_label_len,keyword,keyword_len,bpe_label,bpe_label_len,target,spk_label
4
+ keyword_selection_conf:
5
+ config:
6
+ positive_prob: 1
7
+ sample_config:
8
+ continuous: true
9
+ keyword_length_range:
10
+ - 2
11
+ - 6
12
+ special_token:
13
+ eok: 5003
14
+ peok: 72
15
+ psok: 71
16
+ punk: 73
17
+ sok: 5002
18
+ unk: 1
19
+ with_trans: true
20
+ use_filler_label_for_neg: false
21
+ selection_strategy: random_sample
22
+ length_key: mixspeech,speech,keyword
23
+ meta_save_config:
24
+ save_dir: xxx
25
+ use: false
26
+ num_workers: 9
27
+ shuffle: true
28
+ speech_config:
29
+ data_type: raw
30
+ feats_config:
31
+ frame_length: 25
32
+ frame_shift: 10
33
+ num_mel_bins: 80
34
+ feats_type: fbank
35
+ mix_config:
36
+ max_or_min: max
37
+ wav_shift_config:
38
+ sampler: uniform
39
+ sampler_config:
40
+ high: 1.0
41
+ low: 0.0
42
+ shift_seconds: 3
43
+ wav_shift_prob: 0.3
44
+ wav_shift_type: fixed_shift_duration
45
+ noise_interference:
46
+ corrupt_list: aishell_ke_data/noise.cutted.scp
47
+ num_corrupt: 1
48
+ prob: 0.5
49
+ sampler: uniform
50
+ sampler_config:
51
+ low: 0.2
52
+ use: false
53
+ post_feats_config:
54
+ splice_config:
55
+ left_context: 5
56
+ right_context: 5
57
+ subsample_rate: 3
58
+ use: false
59
+ return_raw: true
60
+ speech_interference:
61
+ num_corrupt: 1
62
+ sampler: uniform
63
+ sampler_config:
64
+ high: 0.9
65
+ low: 0.1
66
+ use: true
67
+ start_epoch: 0
68
+ sv_config:
69
+ spk2cls: data/dump/speaker_label/spk2cls.json
70
+ train_list: data/dump/datalist/train-860.jsonl
71
+ valid_list: data/dump/datalist/valid.jsonl
kce/epoch_149.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bab0fa440b264185ed5b90b805b783a9d75890f350cd87cfb0910ecedb54d9e3
3
+ size 134200203
kce/model.yaml ADDED
@@ -0,0 +1,83 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ audio_net_config:
2
+ input_trans:
3
+ act: ReLU
4
+ dim:
5
+ - 256
6
+ - 256
7
+ norm: LayerNorm
8
+ num_block: 1
9
+ transformer_config:
10
+ conv_config:
11
+ channels: 256
12
+ corss_att_config:
13
+ n_feats: 256
14
+ n_head: 1
15
+ norm: LayerNorm
16
+ cross_att: MultiHeadCrossAtt
17
+ feed_forward_config: &id001
18
+ act: ReLU
19
+ dim:
20
+ - 256
21
+ - 2048
22
+ - 256
23
+ norm: LayerNorm
24
+ num_block: 1
25
+ self_att: MultiHeadAtt
26
+ self_att_config: &id002
27
+ n_feats: 256
28
+ n_head: 4
29
+ size: 256
30
+ decoder_net_config:
31
+ input_trans:
32
+ act: ReLU
33
+ dim: 256
34
+ norm: LayerNorm
35
+ num_block: 1
36
+ transformer_config:
37
+ corss_att_config:
38
+ n_feats: 256
39
+ n_head: 1
40
+ norm: LayerNorm
41
+ cross_att: MultiHeadCrossAtt
42
+ feed_forward_config: *id001
43
+ self_att: MultiHeadAtt
44
+ self_att_config: *id002
45
+ size: 256
46
+ eos: 5004
47
+ kw_net_config:
48
+ input_trans:
49
+ act: ReLU
50
+ dim: 256
51
+ norm: LayerNorm
52
+ num_block: 1
53
+ num_bpe_token: 5005
54
+ num_phn_token: 74
55
+ transformer_config:
56
+ feed_forward_config: *id001
57
+ self_att: MultiHeadAtt
58
+ self_att_config: *id002
59
+ size: 256
60
+ loss_weight:
61
+ - 0.3
62
+ - 0.1
63
+ - 0.3
64
+ num_audio_block: 9
65
+ num_doecoder_block: 4
66
+ num_kw_block: 4
67
+ sos: 2
68
+ sv_net_config:
69
+ front_output_size: 256
70
+ num_classes: 2338
71
+ pooling_conf:
72
+ use_softmax: False
73
+ layer_indices:
74
+ - 0
75
+ - 1
76
+ - 2
77
+ - 3
78
+ - 4
79
+ - 5
80
+ - 6
81
+ - 7
82
+ - 8
83
+ type: learnable_weights