Ударение по знаку

Qwen3-TTS дообучена слушаться знака ударения U+0301 после гласной. Здесь можно сравнить на слух исходную модель и адаптер v3, обученный только на данных со свободными лицензиями. Голос в обоих случаях один и тот же: turgenev.

Примеры отобраны случайно, а не лучшие. Рядом с каждой записью стоит вердикт автоматического детектора. По одному слову он ошибается примерно в каждом десятом случае, поэтому ухо здесь главнее.

21%исходная модель следует знаку на ненормативном слоге
49%адаптер v3, p = 0.002
59%ESpeech, источник данных v3, тот же детектор
0.983сходство голоса с образцом (исходная 0.985)

Абзац целиком

Трудные слова и омографы подряд. Один голос и один сид, весь абзац озвучен одним проходом, как это делает сервер. Ниже текст в том виде, в каком его получил адаптер со знаками: синим отмечено, куда RUAccent поставил ударение.

Все три записи Whisper распознаёт без единой ошибки. Автоматический детектор ударений разницы между вариантами здесь не различает: его шум (10–12% ложных тревог) больше самой разницы. Судить стоит на слух.

Знак против привычки

Знак стоит на слоге, где ударение не нормативно. Исходная модель знак не понимает и говорит по-своему. Адаптер должен сказать так, как указывает знак, даже если это звучит неправильно.

Трудные слова

Слова, которые исходная модель произнесла не так, как ждёт RUAccent, при двух разных сидах. Здесь они озвучены заново третьим сидом: у исходной модели без знаков, у адаптера со знаками по RUAccent. Детектор ошибается и на части самих этих слов: для Silero с верной разметкой он поднимает тревогу в 36% случаев.

Методика и все числа — отчёт эксперимента 23, решение — ADR 0023. Начало истории с ударениями — раунд 13 статьи.