Instructions to use AlicanKiraz0/Kizagan-TTS-v1.0 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- VoxCPM
How to use AlicanKiraz0/Kizagan-TTS-v1.0 with VoxCPM:
import soundfile as sf from voxcpm import VoxCPM model = VoxCPM.from_pretrained("AlicanKiraz0/Kizagan-TTS-v1.0") wav = model.generate( text="VoxCPM is an innovative end-to-end TTS model from ModelBest, designed to generate highly expressive speech.", prompt_wav_path=None, # optional: path to a prompt speech for voice cloning prompt_text=None, # optional: reference text cfg_value=2.0, # LM guidance on LocDiT, higher for better adherence to the prompt, but maybe worse inference_timesteps=10, # LocDiT inference timesteps, higher for better result, lower for fast speed normalize=True, # enable external TN tool denoise=True, # enable external Denoise tool retry_badcase=True, # enable retrying mode for some bad cases (unstoppable) retry_badcase_max_times=3, # maximum retrying times retry_badcase_ratio_threshold=6.0, # maximum length restriction for bad case detection (simple but effective), it could be adjusted for slow pace speech ) sf.write("output.wav", wav, 16000) print("saved: output.wav") - Notebooks
- Google Colab
- Kaggle
File size: 3,944 Bytes
90d34be a22aac8 90d34be a22aac8 90d34be 1f89369 90d34be 1f89369 90d34be | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 | {
"schema_version": 1,
"model_id": "AlicanKiraz0/Kizagan-TTS-v1.0",
"release_version": "1.0",
"release_date": "2026-09-07",
"source_model": "AlicanKiraz0/Kizagan-TTS-step_1500",
"source_revision": "458112a0fc3d850de38951796290e48ef710bc26",
"base_model": "openbmb/VoxCPM2",
"base_revision": "bffb3df5a29440629464e5e839f4d214c8714c3d",
"voxcpm_source_commit": "f772e498a45fbb5fb8e13fbf9b9c48be9fe33e69",
"new_optimizer_steps": 0,
"weights_changed_from_source": false,
"recommended_method": "fresh reference-conditioned generation for each explicitly segmented sentence",
"dataset_recordings_included": false,
"files": [
{
"path": "LICENSE",
"bytes": 11298,
"sha256": "4f10acc209addacfad28293315c74c4cd648f771ee1263a748f1781d1e0265e4"
},
{
"path": "NOTICE",
"bytes": 509,
"sha256": "7c070bb12657803796a479ec173f6596f35756c49e3362d479fbfbf32e62e143"
},
{
"path": "README.md",
"bytes": 23261,
"sha256": "ca0bfd2f4d1aa6f0f143a4a185d4e8f404361c7a5b3d6e00e45a7a2258da1bd1"
},
{
"path": "audiovae.pth",
"bytes": 376951122,
"sha256": "94b5d51e107e0507d4acc976cfdadb64edd6fd06d1f751dadbf2fd1594274bf1"
},
{
"path": "config.json",
"bytes": 4336,
"sha256": "405f0dcd92f7feba6011ed4eac5c8d4f74cba9712f07fd5cfa3063bbdd95402c"
},
{
"path": "evaluation/README.md",
"bytes": 2064,
"sha256": "9f0f2b3647a7643cbc8efdad667251006991e530bd38cb774d3da792bf392aa1"
},
{
"path": "evaluation/metrics.json",
"bytes": 5265,
"sha256": "434664ee7b9eaaf51357b596cfce1461babade8a89b1c1060e28a29a4c233efe"
},
{
"path": "evaluation/release_smoke.json",
"bytes": 791,
"sha256": "a43be21eb9781777a8fa59041c536df02588f51acd8dc564aa2ae0e5c859ab56"
},
{
"path": "examples/library.sentences.txt",
"bytes": 1377,
"sha256": "abd916bd5c27ecbd0aeb9b23cabc6a0dd22fddb1cac110fc16b87731bc2c47e3"
},
{
"path": "examples/platform.sentences.txt",
"bytes": 1261,
"sha256": "c55ec92e89e7899e0437e665674398abbf79ff31180454d2d563c90ebd6009e3"
},
{
"path": "examples/quickstart.sentences.txt",
"bytes": 62,
"sha256": "eec23ec02cdb969462031031d6d7f36972f90df4e8ca57ec2946933b34cc5c7b"
},
{
"path": "examples/quickstart.wav",
"bytes": 645200,
"sha256": "480ee6fe4632bbac479861571b4442841674adb1bb7a6d7911a61527dd000dfa"
},
{
"path": "inference.py",
"bytes": 14987,
"sha256": "7c0b2acb55672c1dd866237e4535bf1bcd1b6a798c5be163f31b376802066ff3"
},
{
"path": "merge_manifest.json",
"bytes": 870,
"sha256": "3b9bc1f55569d5495f6dccf788c5da3349e606c200328af5cdf180a9bf320e0d"
},
{
"path": "model.safetensors",
"bytes": 4580080752,
"sha256": "780bea8f21515c6dc97e577b37aa350f3cbdb4b1f669ee5ebb5bbe969b6b4ba5"
},
{
"path": "special_tokens_map.json",
"bytes": 1632,
"sha256": "068594063e37662c02b21acf42ebb334ef6a74fb810e68a2368f88f08351de76"
},
{
"path": "tokenization_voxcpm2.py",
"bytes": 2895,
"sha256": "84489ea32b6ee0cae22ed5480cacb6df85c46624c3119be9a2021c3649a12729"
},
{
"path": "tokenizer.json",
"bytes": 3676772,
"sha256": "f8984687e4a92a3503d521396d454b7d68e9fdaab2a0288eb3536c7c1aa4bc20"
},
{
"path": "tokenizer_config.json",
"bytes": 5059,
"sha256": "e78a3ebb48a0b9437efd1823b6b726c823da89e49dd8bcc90c02419d9baa772b"
}
],
"manifest_scope": "Files listed here exclude release_manifest.json and SHA256SUMS themselves.",
"documentation_update": {
"date": "2026-09-07",
"topic": "Voice cloning and advanced Python API usage",
"parent_commit": "90d34bee01d7ffaf3d7cffce3fbabdb8f3329dde",
"weights_changed": false,
"inference_script_changed": false
}
}
|