Instructions to use Misha24-10/F5-TTS_RUSSIAN with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- F5-TTS
How to use Misha24-10/F5-TTS_RUSSIAN with F5-TTS:
# No code snippets available yet for this library. # To use this model, check the repository files and the library's documentation. # Want to help? PRs adding snippets are welcome at: # https://github.com/huggingface/huggingface.js
- Notebooks
- Google Colab
- Kaggle
Проблема эмоциональных реплик
Коллеги-энтузиасты, подскажите пожалуйста, кто-нибудь сталкивался с проблемой при генерации аудио, где в качестве референса выступает эмоциональная запись?
Например:
Запись, где в качестве аудио референса используется восклицательная реплика (Длительность 3.5 секунды):
"Они совсем близко. Открывай дверь! Живо!". (Здесь в референсной записи на ударных гласных есть характерный хрип из-за сильной эмоции).
Модель в данном случае перенимает этот хрип и усиливает его, что в итоге приводит к тому, что всё итоговое аудио начинает сильно хрипеть.
Я перепробывал множество способов, как справиться с этой проблемой, но стоящего решения, который бы значительно не искажал итоговую эмоцию не нашёл.
Полагаю, что проблема в том, что fine-tune производился на датасете без эмоциональных реплик и модель не умеет правильно с ними работать?
Если кто-то нашёл способ, как справиться с подобной проблемой поделитесь, пожалуйста.
К сожалению по результатам моих исследований модель прекрасно знает о существовании (Крик) (Шёпот) etc, т.к. видела это в исходных данных. Но совершенно не понимает что с этим делать. Единственный путь для регулирования эмоций в F5 это использовать разный референсные записи для разных эмоций. Для (Радостный) - одна референсная запись. Для (Злой) - другая. И дальше через трансформер подставлять нужное в текст. Это можно делать достаточно быстро и динамически.
Что касается самого референса - По моим исследованиям влияет экспрессивность (нижние и верхние границы), чем референс экспрессивней - тем он живее, но менее стабильный. Чем референс спокойнее - тем он более плоский как робот. Очень экспрессивную запись можно подавить через Attention scale, поправив Q / K весы. (Например 0.9 вместо 1.0 для FP32 модели или 0.09 для FP16)
Если твой референс хрипит, он будет хрипеть. С этим ты ничего не сделаешь.