Serhiy Stetskovych commited on
Commit
ba44164
·
1 Parent(s): 509e004

Split to sentances for verbalization.

Browse files
Files changed (2) hide show
  1. app.py +6 -4
  2. verbalizer.py +1 -1
app.py CHANGED
@@ -20,7 +20,7 @@ prompts_dir = 'voices'
20
  verbalizer = Verbalizer()
21
 
22
 
23
- def split_to_parts(text):
24
  text = re.sub(r'([^.,!:?\-])\n', r'\1. ', text)
25
  text = text.replace('\n', ' ')
26
  split_symbols = '.?!:'
@@ -29,7 +29,9 @@ def split_to_parts(text):
29
  last = len(text)-1
30
  for i, s in enumerate(text):
31
  parts[index] += s
32
- if s in split_symbols and i < last and text[i+1] == ' ' and len(parts[index]) > 20:
 
 
33
  index += 1
34
  parts.append('')
35
  return parts
@@ -64,11 +66,11 @@ models = {
64
 
65
 
66
  def verbalize(text):
67
- parts = split_to_parts(text)
68
  verbalized = ''
69
  for part in parts:
70
  if part.strip():
71
- verbalized += verbalizer.process_text(part)[0] + ' '
72
  return verbalized
73
 
74
  description = f'''
 
20
  verbalizer = Verbalizer()
21
 
22
 
23
+ def split_to_parts(text, group=True):
24
  text = re.sub(r'([^.,!:?\-])\n', r'\1. ', text)
25
  text = text.replace('\n', ' ')
26
  split_symbols = '.?!:'
 
29
  last = len(text)-1
30
  for i, s in enumerate(text):
31
  parts[index] += s
32
+ if s in split_symbols and i < last and text[i+1] == ' ':
33
+ if group and len(parts[index]) <= 20:
34
+ continue
35
  index += 1
36
  parts.append('')
37
  return parts
 
66
 
67
 
68
  def verbalize(text):
69
+ parts = split_to_parts(text, group=False)
70
  verbalized = ''
71
  for part in parts:
72
  if part.strip():
73
+ verbalized += verbalizer.process_text(part.strip())[0] + ' '
74
  return verbalized
75
 
76
  description = f'''
verbalizer.py CHANGED
@@ -22,7 +22,7 @@ class Verbalizer():
22
  self.translator = ctranslate2.Translator(
23
  local_model_path,
24
  device='cpu',
25
- compute_type="int8", # Use INT8 quantization for CPU
26
  )
27
 
28
  # Load tokenizer
 
22
  self.translator = ctranslate2.Translator(
23
  local_model_path,
24
  device='cpu',
25
+ compute_type="int8",
26
  )
27
 
28
  # Load tokenizer