Skip to content

Commit 14543c2

Browse files
fix(asr): preserve Unicode in transcription JSON
Signed-off-by: Sylvester Kaczmarek <assistant@SylvesterKaczmarek.com> Signed-off-by: Sylvester Kaczmarek <16242628+sylvesterkaczmarek@users.noreply.github.com>
1 parent ee1d657 commit 14543c2

1 file changed

Lines changed: 2 additions & 2 deletions

File tree

nemo/collections/asr/parts/utils/transcribe_utils.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -536,7 +536,7 @@ def write_transcription(
536536
item['pred_lang_chars'] = transcription.langs_chars
537537
if not cfg.decoding.beam.return_best_hypothesis:
538538
item['beams'] = beams[idx]
539-
f.write(json.dumps(item) + "\n")
539+
f.write(json.dumps(item, ensure_ascii=False) + "\n")
540540
else:
541541
with open(cfg.dataset_manifest, 'r', encoding='utf-8') as fr:
542542
for idx, line in enumerate(fr):
@@ -573,7 +573,7 @@ def write_transcription(
573573

574574
if not cfg.decoding.beam.return_best_hypothesis:
575575
item['beams'] = beams[idx]
576-
f.write(json.dumps(item) + "\n")
576+
f.write(json.dumps(item, ensure_ascii=False) + "\n")
577577

578578
return cfg.output_filename, pred_text_attr_name
579579

0 commit comments

Comments
 (0)