Синтез речи
TTS · озвучивание текста
Это понятие впервые встречается на программе «Инженерия и системный подход к решению задач» — примерно 11-12 лет (5-6 класс).
Программа превращает написанный текст в звучащую речь: набираешь слова — устройство произносит их вслух. Так говорят навигатор и голосовой помощник.
Чтение вслух: как человек читает голосом любую книгу, программа озвучивает любой текст.
Включить в телефоне озвучивание текста, дать прочитать своё имя и выдуманное слово; заметить, что читается даже то, чего в словаре нет.
Преобразование текста в звук речи. Программа разбивает текст на мелкие звуки, подставляет их звучание и склеивает в непрерывную речь, добавляя ударения и интонацию. В отличие от набора заранее записанных фраз, синтез читает любой новый текст. Это задача, обратная распознаванию речи: там звук превращают в текст, здесь текст — в звук.
Дать голосовому помощнику в проекте «умный дом» озвучить две фразы — простую и со сложным словом или числом; отметить, где ударение или интонация вышли неестественно.
Синтез речи (TTS): генерация звукового сигнала по тексту. Классический конвейер — нормализация текста (числа и сокращения → слова), разбиение на фонемы, модель просодии (ударения, паузы, интонация), генерация звуковой волны. Современные системы строят речь нейросетью, звучат почти как человек и умеют клонировать голос по короткой записи — отсюда риск голосовых подделок. Качество меряют разборчивостью и естественностью; узкие места — омографы («замок»), редкие имена, эмоции.
Дать синтезатору фразу с омографом («за́мок/замо́к») и с числом «1500»; определить, где система ошиблась в ударении или чтении числа, и назвать этап конвейера, на котором возникла ошибка.
Частое заблуждение
«Компьютер просто проигрывает заранее записанные человеком слова». Нет: современный синтез строит звук по буквам и произносит любой новый текст — даже выдуманное слово, которого никто не записывал.