Instructions to use kaanhgunay/pocket-tts-tr with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Pocket-TTS
How to use kaanhgunay/pocket-tts-tr with Pocket-TTS:
from pocket_tts import TTSModel import scipy.io.wavfile tts_model = TTSModel.load_model("kaanhgunay/pocket-tts-tr") voice_state = tts_model.get_state_for_audio_prompt( "hf://kyutai/tts-voices/alba-mackenna/casual.wav" ) audio = tts_model.generate_audio(voice_state, "Hello world, this is a test.") # Audio is a 1D torch tensor containing PCM data. scipy.io.wavfile.write("output.wav", tts_model.sample_rate, audio.numpy()) - Notebooks
- Google Colab
- Kaggle
| weights_path: hf://kaanhgunay/pocket-tts-tr/model.safetensors@v0.1-base | |
| weights_path_without_voice_cloning: null | |
| default_temperature: 0.3 | |
| flow_lm: | |
| insert_bos_before_voice: true | |
| dtype: float32 | |
| flow: | |
| depth: 6 | |
| dim: 512 | |
| transformer: | |
| d_model: 1024 | |
| hidden_scale: 4 | |
| max_period: 10000 | |
| num_heads: 16 | |
| num_layers: 24 | |
| lookup_table: | |
| dim: 1024 | |
| n_bins: 4000 | |
| tokenizer: sentencepiece | |
| tokenizer_path: hf://kaanhgunay/pocket-tts-tr/tokenizer.model@v0.1-base | |
| mimi: | |
| dtype: float32 | |
| sample_rate: 24000 | |
| inner_dim: 32 | |
| outer_dim: 512 | |
| channels: 1 | |
| frame_rate: 12.5 | |
| seanet: | |
| dimension: 512 | |
| channels: 1 | |
| n_filters: 64 | |
| n_residual_layers: 1 | |
| ratios: | |
| - 6 | |
| - 5 | |
| - 4 | |
| kernel_size: 7 | |
| residual_kernel_size: 3 | |
| last_kernel_size: 3 | |
| dilation_base: 2 | |
| pad_mode: constant | |
| compress: 2 | |
| transformer: | |
| d_model: 512 | |
| num_heads: 8 | |
| num_layers: 2 | |
| layer_scale: 0.01 | |
| context: 250 | |
| dim_feedforward: 2048 | |
| input_dimension: 512 | |
| output_dimensions: | |
| - 512 | |
| quantizer: | |
| dimension: 32 | |
| output_dimension: 512 | |