Spaces:
Paused
Paused
Serhiy Stetskovych commited on
Commit ·
ba44164
1
Parent(s): 509e004
Split to sentances for verbalization.
Browse files- app.py +6 -4
- verbalizer.py +1 -1
app.py
CHANGED
|
@@ -20,7 +20,7 @@ prompts_dir = 'voices'
|
|
| 20 |
verbalizer = Verbalizer()
|
| 21 |
|
| 22 |
|
| 23 |
-
def split_to_parts(text):
|
| 24 |
text = re.sub(r'([^.,!:?\-])\n', r'\1. ', text)
|
| 25 |
text = text.replace('\n', ' ')
|
| 26 |
split_symbols = '.?!:'
|
|
@@ -29,7 +29,9 @@ def split_to_parts(text):
|
|
| 29 |
last = len(text)-1
|
| 30 |
for i, s in enumerate(text):
|
| 31 |
parts[index] += s
|
| 32 |
-
if s in split_symbols and i < last and text[i+1] == ' '
|
|
|
|
|
|
|
| 33 |
index += 1
|
| 34 |
parts.append('')
|
| 35 |
return parts
|
|
@@ -64,11 +66,11 @@ models = {
|
|
| 64 |
|
| 65 |
|
| 66 |
def verbalize(text):
|
| 67 |
-
parts = split_to_parts(text)
|
| 68 |
verbalized = ''
|
| 69 |
for part in parts:
|
| 70 |
if part.strip():
|
| 71 |
-
verbalized += verbalizer.process_text(part)[0] + ' '
|
| 72 |
return verbalized
|
| 73 |
|
| 74 |
description = f'''
|
|
|
|
| 20 |
verbalizer = Verbalizer()
|
| 21 |
|
| 22 |
|
| 23 |
+
def split_to_parts(text, group=True):
|
| 24 |
text = re.sub(r'([^.,!:?\-])\n', r'\1. ', text)
|
| 25 |
text = text.replace('\n', ' ')
|
| 26 |
split_symbols = '.?!:'
|
|
|
|
| 29 |
last = len(text)-1
|
| 30 |
for i, s in enumerate(text):
|
| 31 |
parts[index] += s
|
| 32 |
+
if s in split_symbols and i < last and text[i+1] == ' ':
|
| 33 |
+
if group and len(parts[index]) <= 20:
|
| 34 |
+
continue
|
| 35 |
index += 1
|
| 36 |
parts.append('')
|
| 37 |
return parts
|
|
|
|
| 66 |
|
| 67 |
|
| 68 |
def verbalize(text):
|
| 69 |
+
parts = split_to_parts(text, group=False)
|
| 70 |
verbalized = ''
|
| 71 |
for part in parts:
|
| 72 |
if part.strip():
|
| 73 |
+
verbalized += verbalizer.process_text(part.strip())[0] + ' '
|
| 74 |
return verbalized
|
| 75 |
|
| 76 |
description = f'''
|
verbalizer.py
CHANGED
|
@@ -22,7 +22,7 @@ class Verbalizer():
|
|
| 22 |
self.translator = ctranslate2.Translator(
|
| 23 |
local_model_path,
|
| 24 |
device='cpu',
|
| 25 |
-
compute_type="int8",
|
| 26 |
)
|
| 27 |
|
| 28 |
# Load tokenizer
|
|
|
|
| 22 |
self.translator = ctranslate2.Translator(
|
| 23 |
local_model_path,
|
| 24 |
device='cpu',
|
| 25 |
+
compute_type="int8",
|
| 26 |
)
|
| 27 |
|
| 28 |
# Load tokenizer
|