Spaces:
Running
Running
Commit ·
7bd87dc
1
Parent(s): 0ad7a68
fix token count bug
Browse files- chinesebleu.py +3 -3
chinesebleu.py
CHANGED
|
@@ -140,7 +140,7 @@ class ChineseBLEU(evaluate.Metric):
|
|
| 140 |
ref_tokens = [self._tokenize_chinese(r, tokenizer) for r in references]
|
| 141 |
|
| 142 |
# For total number of tokens < 4, fallback to character-level tokenizations
|
| 143 |
-
if len(pred_tokens) < 4 or len(ref_tokens) < 4:
|
| 144 |
tokenizer = 'char'
|
| 145 |
pred_tokens = [self._tokenize_chinese(p, tokenizer) for p in predictions]
|
| 146 |
ref_tokens = [self._tokenize_chinese(r, tokenizer) for r in references]
|
|
@@ -202,8 +202,8 @@ class ChineseBLEU(evaluate.Metric):
|
|
| 202 |
"counts": counts,
|
| 203 |
"totals": totals,
|
| 204 |
"precisions": precisions,
|
| 205 |
-
"ref_len": len(ref_tokens),
|
| 206 |
-
"sys_len": len(pred_tokens),
|
| 207 |
"bp": bp,
|
| 208 |
"tokenizer": tokenizer
|
| 209 |
}
|
|
|
|
| 140 |
ref_tokens = [self._tokenize_chinese(r, tokenizer) for r in references]
|
| 141 |
|
| 142 |
# For total number of tokens < 4, fallback to character-level tokenizations
|
| 143 |
+
if len(pred_tokens[0]) < 4 or len(ref_tokens[0]) < 4:
|
| 144 |
tokenizer = 'char'
|
| 145 |
pred_tokens = [self._tokenize_chinese(p, tokenizer) for p in predictions]
|
| 146 |
ref_tokens = [self._tokenize_chinese(r, tokenizer) for r in references]
|
|
|
|
| 202 |
"counts": counts,
|
| 203 |
"totals": totals,
|
| 204 |
"precisions": precisions,
|
| 205 |
+
"ref_len": len(ref_tokens[0]),
|
| 206 |
+
"sys_len": len(pred_tokens[0]),
|
| 207 |
"bp": bp,
|
| 208 |
"tokenizer": tokenizer
|
| 209 |
}
|