Проблема эмоциональных реплик

#51
by WH0AMl - opened

Коллеги-энтузиасты, подскажите пожалуйста, кто-нибудь сталкивался с проблемой при генерации аудио, где в качестве референса выступает эмоциональная запись?

Например:
Запись, где в качестве аудио референса используется восклицательная реплика (Длительность 3.5 секунды):
"Они совсем близко. Открывай дверь! Живо!". (Здесь в референсной записи на ударных гласных есть характерный хрип из-за сильной эмоции).

Модель в данном случае перенимает этот хрип и усиливает его, что в итоге приводит к тому, что всё итоговое аудио начинает сильно хрипеть.

Я перепробывал множество способов, как справиться с этой проблемой, но стоящего решения, который бы значительно не искажал итоговую эмоцию не нашёл.

Полагаю, что проблема в том, что fine-tune производился на датасете без эмоциональных реплик и модель не умеет правильно с ними работать?

Если кто-то нашёл способ, как справиться с подобной проблемой поделитесь, пожалуйста.

К сожалению по результатам моих исследований модель прекрасно знает о существовании (Крик) (Шёпот) etc, т.к. видела это в исходных данных. Но совершенно не понимает что с этим делать. Единственный путь для регулирования эмоций в F5 это использовать разный референсные записи для разных эмоций. Для (Радостный) - одна референсная запись. Для (Злой) - другая. И дальше через трансформер подставлять нужное в текст. Это можно делать достаточно быстро и динамически.

Что касается самого референса - По моим исследованиям влияет экспрессивность (нижние и верхние границы), чем референс экспрессивней - тем он живее, но менее стабильный. Чем референс спокойнее - тем он более плоский как робот. Очень экспрессивную запись можно подавить через Attention scale, поправив Q / K весы. (Например 0.9 вместо 1.0 для FP32 модели или 0.09 для FP16)

Если твой референс хрипит, он будет хрипеть. С этим ты ничего не сделаешь.

Sign up or log in to comment