Trainer-app/Audio.py at main · IJCS/Trainer-app · GitHub

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
import io
import wave
import pyttsx3
import pyaudio
from pydub import AudioSegment


_cache = {}
_language = 'es'
_rate = 150
_pause_duration = 500


def set_language(language):
    global _language
    _language = language


def set_rate(rate):
    global _rate
    _rate = rate


def set_pause(pause_ms):
    global _pause_duration
    _pause_duration = pause_ms


def generate(word):
    if word in _cache:
        return

    engine = pyttsx3.init()
    voices =  engine.getProperty('voices')
    for voice in voices:
        if _language in voice.languages or _language in voice.id.lower():
            engine.setProperty('voice', voice.id)
            break

    engine.setProperty('rate', _rate)

    audio_buffer = io.BytesIO()
    engine.save_to_file(word, 'temp_audio.wav')
    engine.runAndWait()

    audio_segment = AudioSegment.from_wav('temp_audio.wav')
    _cache[word] = audio_segment

    import os
    os.remove('temp_audio.wav')


def play(*words):
    if not words:
        return

    segments = []
    pause = AudioSegment.silent(duration=_pause_duration)

    for i, word in enumerate(words):
        if word not in _cache:
            generate(word)

        segments.append(_cache[word])

        if i < len(words) - 1:
            segments.append(pause)

    combined = sum(segments)

    audio_data = io.BytesIO()
    combined.export(audio_data, format='wav')
    audio_data.seek(0)

    with wave.open(audio_data, 'rb') as wf:
        p = pyaudio.PyAudio()

        stream = p.open(format=p.get_format_from_width(wf.getsampwidth()),
                       channels=wf.getnchannels(),
                       rate=wf.getframerate(),
                       output=True)

        chunk_size = 1024
        data = wf.readframes(chunk_size)

        while data:
            stream.write(data)
            data = wf.readframes(chunk_size)

        stream.stop_stream()
        stream.close()
        p.terminate()


def ready(word):
    return word in _cache


def clean(words=None):
    global _cache

    if words is None:
        _cache.clear()
    else:
        words_to_keep = set(words) if not isinstance(words, set) else words
        _cache = {word: audio for word, audio in _cache.items()
                 if word in words_to_keep}