Upload folder using huggingface_hub
Browse files- .gitattributes +4 -35
- README.md +18 -0
- backbone/config.yaml +106 -0
- backbone/models/checkpoint_150.pt +3 -0
- kce/data.yaml +71 -0
- kce/epoch_149.pt +3 -0
- kce/model.yaml +83 -0
.gitattributes
CHANGED
|
@@ -1,35 +1,4 @@
|
|
| 1 |
-
|
| 2 |
-
|
| 3 |
-
|
| 4 |
-
|
| 5 |
-
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
| 6 |
-
*.ftz filter=lfs diff=lfs merge=lfs -text
|
| 7 |
-
*.gz filter=lfs diff=lfs merge=lfs -text
|
| 8 |
-
*.h5 filter=lfs diff=lfs merge=lfs -text
|
| 9 |
-
*.joblib filter=lfs diff=lfs merge=lfs -text
|
| 10 |
-
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
| 11 |
-
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
| 12 |
-
*.model filter=lfs diff=lfs merge=lfs -text
|
| 13 |
-
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
| 14 |
-
*.npy filter=lfs diff=lfs merge=lfs -text
|
| 15 |
-
*.npz filter=lfs diff=lfs merge=lfs -text
|
| 16 |
-
*.onnx filter=lfs diff=lfs merge=lfs -text
|
| 17 |
-
*.ot filter=lfs diff=lfs merge=lfs -text
|
| 18 |
-
*.parquet filter=lfs diff=lfs merge=lfs -text
|
| 19 |
-
*.pb filter=lfs diff=lfs merge=lfs -text
|
| 20 |
-
*.pickle filter=lfs diff=lfs merge=lfs -text
|
| 21 |
-
*.pkl filter=lfs diff=lfs merge=lfs -text
|
| 22 |
-
*.pt filter=lfs diff=lfs merge=lfs -text
|
| 23 |
-
*.pth filter=lfs diff=lfs merge=lfs -text
|
| 24 |
-
*.rar filter=lfs diff=lfs merge=lfs -text
|
| 25 |
-
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
| 26 |
-
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
| 27 |
-
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
| 28 |
-
*.tar filter=lfs diff=lfs merge=lfs -text
|
| 29 |
-
*.tflite filter=lfs diff=lfs merge=lfs -text
|
| 30 |
-
*.tgz filter=lfs diff=lfs merge=lfs -text
|
| 31 |
-
*.wasm filter=lfs diff=lfs merge=lfs -text
|
| 32 |
-
*.xz filter=lfs diff=lfs merge=lfs -text
|
| 33 |
-
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
-
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
-
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
|
|
|
| 1 |
+
mix-clean/backbone/models/checkpoint_150.pt filter=lfs diff=lfs merge=lfs -text
|
| 2 |
+
mix-clean/kce/epoch_149.pt filter=lfs diff=lfs merge=lfs -text
|
| 3 |
+
backbone/models/checkpoint_150.pt filter=lfs diff=lfs merge=lfs -text
|
| 4 |
+
kce/epoch_149.pt filter=lfs diff=lfs merge=lfs -text
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
README.md
ADDED
|
@@ -0,0 +1,18 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# DAE-TSE Pretrained Models
|
| 2 |
+
|
| 3 |
+
## KCE (Keyword-guided Cue Encoder)
|
| 4 |
+
|
| 5 |
+
- **File**: `kce/epoch_149.pt`
|
| 6 |
+
- **Architecture**: `AEDKWSASRPhone`
|
| 7 |
+
- **Training data**: LibriSpeech train-clean-360 + train-other-500
|
| 8 |
+
- **Validation data**: LibriSpeech train-clean-100
|
| 9 |
+
- **Config**: `kce/model.yaml`, `kce/data.yaml`
|
| 10 |
+
|
| 11 |
+
## Backbone (DAE-BSRNN)
|
| 12 |
+
|
| 13 |
+
- **File**: `backbone/models/checkpoint_150.pt`
|
| 14 |
+
- **Architecture**: `DAE-BSRNN` (text-aware BSRNN with TC-ASR encoder)
|
| 15 |
+
- **Training data**: Libri2Mix-100 mix-clean
|
| 16 |
+
- **Config**: `backbone/config.yaml`
|
| 17 |
+
|
| 18 |
+
> After downloading, update `model_args.tse_model.asr_encoder.checkpoint_dir` in `backbone/config.yaml` to the absolute path of `kce/epoch_149.pt`.
|
backbone/config.yaml
ADDED
|
@@ -0,0 +1,106 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
clip_grad: 5.0
|
| 2 |
+
config: confs/whole_utt/dae-bsrnn.yaml
|
| 3 |
+
data_type: shard
|
| 4 |
+
dataloader_args:
|
| 5 |
+
batch_size: 1
|
| 6 |
+
drop_last: true
|
| 7 |
+
num_workers: 1
|
| 8 |
+
pin_memory: true
|
| 9 |
+
prefetch_factor: 6
|
| 10 |
+
dataset_args:
|
| 11 |
+
SSA_enroll_prob: 0
|
| 12 |
+
additional:
|
| 13 |
+
train:
|
| 14 |
+
data_list: data/text_cue/dump/ready/train-100.jsonl
|
| 15 |
+
data_type: TC-ASR
|
| 16 |
+
val:
|
| 17 |
+
data_list: data/text_cue/dump/ready/dev.jsonl
|
| 18 |
+
data_type: TC-ASR
|
| 19 |
+
chunk_len: 48000
|
| 20 |
+
fbank_args:
|
| 21 |
+
dither: 1.0
|
| 22 |
+
frame_length: 25
|
| 23 |
+
frame_shift: 10
|
| 24 |
+
num_mel_bins: 80
|
| 25 |
+
noise_enroll_prob: 0
|
| 26 |
+
noise_lmdb_file: ./data/musan/lmdb
|
| 27 |
+
noise_prob: 0
|
| 28 |
+
resample_rate: 16000
|
| 29 |
+
reverb_enroll_prob: 0
|
| 30 |
+
sample_num_per_epoch: 0
|
| 31 |
+
shuffle: false
|
| 32 |
+
shuffle_args:
|
| 33 |
+
shuffle_size: 2500
|
| 34 |
+
speaker_feat: true
|
| 35 |
+
specaug_enroll_prob: 0
|
| 36 |
+
enable_amp: false
|
| 37 |
+
exp_dir: exp/whole_utt/dae-bsrnn
|
| 38 |
+
gpus:
|
| 39 |
+
- 0
|
| 40 |
+
- 1
|
| 41 |
+
- 2
|
| 42 |
+
- 3
|
| 43 |
+
- 4
|
| 44 |
+
- 5
|
| 45 |
+
- 6
|
| 46 |
+
- 7
|
| 47 |
+
log_batch_interval: 100
|
| 48 |
+
loss: SISDR
|
| 49 |
+
loss_args: {}
|
| 50 |
+
model:
|
| 51 |
+
tse_model: DAE-BSRNN
|
| 52 |
+
model_args:
|
| 53 |
+
tse_model:
|
| 54 |
+
cue_emb_dim: 128
|
| 55 |
+
asr_encoder:
|
| 56 |
+
model_name: 'TCASREncoder'
|
| 57 |
+
checkpoint_path: exp/kce/epoch_149.pt #'checkpoint directory to the kce encoder', e.g. Pretrained/mix-clean/kce/epoch_149.pt
|
| 58 |
+
fnn:
|
| 59 |
+
input_dim: 256
|
| 60 |
+
num_layer: 3
|
| 61 |
+
output_dim: 128
|
| 62 |
+
multi_task: false
|
| 63 |
+
spksInTrain: 251
|
| 64 |
+
cue_fuse:
|
| 65 |
+
fuse_type: FiLM
|
| 66 |
+
multi_fuse: false
|
| 67 |
+
feature_dim: 128
|
| 68 |
+
multi_task: false
|
| 69 |
+
num_repeat: 6
|
| 70 |
+
spk_optim_head: asr
|
| 71 |
+
sr: 16000
|
| 72 |
+
stride: 128
|
| 73 |
+
win: 512
|
| 74 |
+
model_init:
|
| 75 |
+
discriminator: null
|
| 76 |
+
spk_model: null
|
| 77 |
+
tse_model: null
|
| 78 |
+
num_avg: 10
|
| 79 |
+
num_epochs: 150
|
| 80 |
+
optimizer:
|
| 81 |
+
tse_model: Adam
|
| 82 |
+
optimizer_args:
|
| 83 |
+
tse_model:
|
| 84 |
+
lr: 0.001
|
| 85 |
+
weight_decay: 0.0001
|
| 86 |
+
save_epoch_interval: 1
|
| 87 |
+
scheduler:
|
| 88 |
+
tse_model: ExponentialDecrease
|
| 89 |
+
scheduler_args:
|
| 90 |
+
scale_ratio: 1.0
|
| 91 |
+
tse_model:
|
| 92 |
+
epoch_iter: 1737
|
| 93 |
+
final_lr: 2.5e-05
|
| 94 |
+
initial_lr: 0.001
|
| 95 |
+
num_epochs: 150
|
| 96 |
+
warm_from_zero: false
|
| 97 |
+
warm_up_epoch: 0
|
| 98 |
+
seed: 42
|
| 99 |
+
train_data: data/clean/train-100/shard.list
|
| 100 |
+
train_spk2utt: data/clean/train-100/spk2enroll.json
|
| 101 |
+
train_utt2spk: data/clean/train-100/single.utt2spk
|
| 102 |
+
val_data: data/clean/dev/shard.list
|
| 103 |
+
val_spk1_enroll: data/clean/dev/spk1.enroll
|
| 104 |
+
val_spk2_enroll: data/clean/dev/spk2.enroll
|
| 105 |
+
val_spk2utt: data/clean/dev/single.wav.scp
|
| 106 |
+
whole_utt: true
|
backbone/models/checkpoint_150.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:404a63efc4c6df122c2902a0b72339ce86725e685c978357d8ce3bb81b4a911e
|
| 3 |
+
size 220761736
|
kce/data.yaml
ADDED
|
@@ -0,0 +1,71 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
batch_size: 48
|
| 2 |
+
epoch: 150
|
| 3 |
+
fetch_key: mixspeech,mixspeech_len,phn_label,phn_label_len,keyword,keyword_len,bpe_label,bpe_label_len,target,spk_label
|
| 4 |
+
keyword_selection_conf:
|
| 5 |
+
config:
|
| 6 |
+
positive_prob: 1
|
| 7 |
+
sample_config:
|
| 8 |
+
continuous: true
|
| 9 |
+
keyword_length_range:
|
| 10 |
+
- 2
|
| 11 |
+
- 6
|
| 12 |
+
special_token:
|
| 13 |
+
eok: 5003
|
| 14 |
+
peok: 72
|
| 15 |
+
psok: 71
|
| 16 |
+
punk: 73
|
| 17 |
+
sok: 5002
|
| 18 |
+
unk: 1
|
| 19 |
+
with_trans: true
|
| 20 |
+
use_filler_label_for_neg: false
|
| 21 |
+
selection_strategy: random_sample
|
| 22 |
+
length_key: mixspeech,speech,keyword
|
| 23 |
+
meta_save_config:
|
| 24 |
+
save_dir: xxx
|
| 25 |
+
use: false
|
| 26 |
+
num_workers: 9
|
| 27 |
+
shuffle: true
|
| 28 |
+
speech_config:
|
| 29 |
+
data_type: raw
|
| 30 |
+
feats_config:
|
| 31 |
+
frame_length: 25
|
| 32 |
+
frame_shift: 10
|
| 33 |
+
num_mel_bins: 80
|
| 34 |
+
feats_type: fbank
|
| 35 |
+
mix_config:
|
| 36 |
+
max_or_min: max
|
| 37 |
+
wav_shift_config:
|
| 38 |
+
sampler: uniform
|
| 39 |
+
sampler_config:
|
| 40 |
+
high: 1.0
|
| 41 |
+
low: 0.0
|
| 42 |
+
shift_seconds: 3
|
| 43 |
+
wav_shift_prob: 0.3
|
| 44 |
+
wav_shift_type: fixed_shift_duration
|
| 45 |
+
noise_interference:
|
| 46 |
+
corrupt_list: aishell_ke_data/noise.cutted.scp
|
| 47 |
+
num_corrupt: 1
|
| 48 |
+
prob: 0.5
|
| 49 |
+
sampler: uniform
|
| 50 |
+
sampler_config:
|
| 51 |
+
low: 0.2
|
| 52 |
+
use: false
|
| 53 |
+
post_feats_config:
|
| 54 |
+
splice_config:
|
| 55 |
+
left_context: 5
|
| 56 |
+
right_context: 5
|
| 57 |
+
subsample_rate: 3
|
| 58 |
+
use: false
|
| 59 |
+
return_raw: true
|
| 60 |
+
speech_interference:
|
| 61 |
+
num_corrupt: 1
|
| 62 |
+
sampler: uniform
|
| 63 |
+
sampler_config:
|
| 64 |
+
high: 0.9
|
| 65 |
+
low: 0.1
|
| 66 |
+
use: true
|
| 67 |
+
start_epoch: 0
|
| 68 |
+
sv_config:
|
| 69 |
+
spk2cls: data/dump/speaker_label/spk2cls.json
|
| 70 |
+
train_list: data/dump/datalist/train-860.jsonl
|
| 71 |
+
valid_list: data/dump/datalist/valid.jsonl
|
kce/epoch_149.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bab0fa440b264185ed5b90b805b783a9d75890f350cd87cfb0910ecedb54d9e3
|
| 3 |
+
size 134200203
|
kce/model.yaml
ADDED
|
@@ -0,0 +1,83 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
audio_net_config:
|
| 2 |
+
input_trans:
|
| 3 |
+
act: ReLU
|
| 4 |
+
dim:
|
| 5 |
+
- 256
|
| 6 |
+
- 256
|
| 7 |
+
norm: LayerNorm
|
| 8 |
+
num_block: 1
|
| 9 |
+
transformer_config:
|
| 10 |
+
conv_config:
|
| 11 |
+
channels: 256
|
| 12 |
+
corss_att_config:
|
| 13 |
+
n_feats: 256
|
| 14 |
+
n_head: 1
|
| 15 |
+
norm: LayerNorm
|
| 16 |
+
cross_att: MultiHeadCrossAtt
|
| 17 |
+
feed_forward_config: &id001
|
| 18 |
+
act: ReLU
|
| 19 |
+
dim:
|
| 20 |
+
- 256
|
| 21 |
+
- 2048
|
| 22 |
+
- 256
|
| 23 |
+
norm: LayerNorm
|
| 24 |
+
num_block: 1
|
| 25 |
+
self_att: MultiHeadAtt
|
| 26 |
+
self_att_config: &id002
|
| 27 |
+
n_feats: 256
|
| 28 |
+
n_head: 4
|
| 29 |
+
size: 256
|
| 30 |
+
decoder_net_config:
|
| 31 |
+
input_trans:
|
| 32 |
+
act: ReLU
|
| 33 |
+
dim: 256
|
| 34 |
+
norm: LayerNorm
|
| 35 |
+
num_block: 1
|
| 36 |
+
transformer_config:
|
| 37 |
+
corss_att_config:
|
| 38 |
+
n_feats: 256
|
| 39 |
+
n_head: 1
|
| 40 |
+
norm: LayerNorm
|
| 41 |
+
cross_att: MultiHeadCrossAtt
|
| 42 |
+
feed_forward_config: *id001
|
| 43 |
+
self_att: MultiHeadAtt
|
| 44 |
+
self_att_config: *id002
|
| 45 |
+
size: 256
|
| 46 |
+
eos: 5004
|
| 47 |
+
kw_net_config:
|
| 48 |
+
input_trans:
|
| 49 |
+
act: ReLU
|
| 50 |
+
dim: 256
|
| 51 |
+
norm: LayerNorm
|
| 52 |
+
num_block: 1
|
| 53 |
+
num_bpe_token: 5005
|
| 54 |
+
num_phn_token: 74
|
| 55 |
+
transformer_config:
|
| 56 |
+
feed_forward_config: *id001
|
| 57 |
+
self_att: MultiHeadAtt
|
| 58 |
+
self_att_config: *id002
|
| 59 |
+
size: 256
|
| 60 |
+
loss_weight:
|
| 61 |
+
- 0.3
|
| 62 |
+
- 0.1
|
| 63 |
+
- 0.3
|
| 64 |
+
num_audio_block: 9
|
| 65 |
+
num_doecoder_block: 4
|
| 66 |
+
num_kw_block: 4
|
| 67 |
+
sos: 2
|
| 68 |
+
sv_net_config:
|
| 69 |
+
front_output_size: 256
|
| 70 |
+
num_classes: 2338
|
| 71 |
+
pooling_conf:
|
| 72 |
+
use_softmax: False
|
| 73 |
+
layer_indices:
|
| 74 |
+
- 0
|
| 75 |
+
- 1
|
| 76 |
+
- 2
|
| 77 |
+
- 3
|
| 78 |
+
- 4
|
| 79 |
+
- 5
|
| 80 |
+
- 6
|
| 81 |
+
- 7
|
| 82 |
+
- 8
|
| 83 |
+
type: learnable_weights
|