Что такое Irodori-TTS? Возможности и настройка на Windows 11

28 июля 2026 г.

Что такое Irodori-TTS? Возможности и настройка на Windows 11


dog

Что за программа для озвучки ИИ Irodori-TTS?

Многих, вероятно, интересует новая программа для озвучки ИИ под названием «Irodori-TTS».

В этой статье мы в доступной форме разберем особенности, возможности, предостережения и способы использования Irodori-TTS.

Кроме того, для тех, кому настройка кажется сложной, мы также представим метод синтеза речи, который можно использовать прямо сейчас без установки.

О чем вы узнаете из этой статьи

  1. Что это за программа Irodori-TTS?
  2. Возможности и предостережения при использовании Irodori-TTS
  3. Как использовать Irodori-TTS (от настройки до регулировки голоса)
  4. Рекомендуемый метод, если настройка среды кажется сложной

Что такое Irodori-TTS? Обзор японской программы ИИ-синтеза речи

Что такое Irodori-TTS? Обзор японской программы ИИ-синтеза речи

Для начала кратко разберем особенности Irodori-TTS как программы для синтеза речи на базе ИИ.

Irodori-TTS — это локально работающая модель ИИ-синтеза речи

Irodori-TTS — это программа для синтеза речи ИИ, специализирующаяся на японском языке.

Разработчиком является Aratako, а сама программа опубликована бесплатно с открытым исходным кодом (лицензия MIT).

Главная особенность заключается в возможности «локальной работы», когда синтез речи полностью выполняется только на вашем ПК.

Поскольку вся обработка генерации голоса происходит на локальном компьютере, текстовые данные и сгенерированные аудиофайлы не отправляются на внешние серверы.

После первоначальной настройки генерировать голос можно без подключения к интернету, и количество генераций не ограничено.

Однако для настройки требуются инструменты программирования, такие как Python и Git.

Кроме того, для быстрой работы рекомендуется использовать высокопроизводительный ПК с видеокартой (GPU).

Возможности и ограничения Irodori-TTS

Возможности и ограничения Irodori-TTS

Далее разберем, что можно и чего нельзя делать с помощью Irodori-TTS.

Что можно делать в Irodori-TTS

Так как Irodori-TTS работает в локальной среде, вы можете генерировать аудио неограниченное количество раз.

Даже в условиях отсутствия интернета после завершения первой настройки вы сможете свободно создавать голос.

Предусмотрено несколько способов управления тем, какой именно голос создавать; используя функцию кэпшн (caption), можно создавать желаемый тембр голоса, просто задавая текстовые инструкции.

Также возможно воссоздать имеющийся голос с помощью клонирования или добавить эмоциональную окраску с помощью эмодзи.

Благодаря лицензии MIT сгенерированное аудио можно использовать в коммерческих целях.

Предостережения при использовании Irodori-TTS

С другой стороны, у Irodori-TTS есть моменты, о которых стоит знать перед использованием.

Длительность одного аудио ограничена примерно 30 секундами

За одну генерацию можно озвучить текст длительностью около 30 секунд.

Если вам нужно озвучить длинный текст, его придется разбивать на части и генерировать несколько раз.

Сложно добиться именно того голоса или манеры речи, которые вы задумали

Irodori-TTS дает большую свободу, но при этом в ней нет предустановленного голоса по умолчанию (базового голоса).

Поэтому, если не указать кэпшн или референсное аудио, пол и возраст голоса будут меняться случайным образом при каждой генерации.

Чтобы озвучивать текст одним и тем же голосом, необходимо загружать референсный аудиофайл.

Кроме того, функции ручной настройки интонации и ударений отсутствуют.

Поддерживается только японский язык

Поддерживаемым языком является только японский, иностранные языки (например, английский) не поддерживаются.

Также стоит учитывать, что иногда могут возникать ошибки в чтении иероглифов (кандзи).

Рекомендуется мощный ПК с GPU

В зависимости от характеристик ПК генерация голоса может занять время.

На ПК без GPU генерация даже короткого предложения занимает около 1 минуты.

На процессорах начального уровня, таких как Celeron или N100, практическое использование кажется затруднительным.

Как использовать Irodori-TTS (процесс настройки)

Ниже приведено краткое руководство по использованию Irodori-TTS.

Общий процесс настройки выглядит следующим образом:

  1. Установка необходимого ПО
  2. Создание рабочей папки
  3. Клонирование Irodori-TTS из GitHub
  4. Установка необходимых пакетов
  5. Запуск Irodori-TTS
  6. Загрузка модели ИИ
  7. Озвучивание текста

1. Установка необходимого ПО для Irodori-TTS

Для настройки Irodori-TTS требуется подготовка.

Сначала установите эти три компонента:

  • Python 3.10 или выше: язык программирования
  • Git: система управления версиями (нужна для загрузки Irodori-TTS)
  • uv: менеджер пакетов Python

Чтобы установить Python, Git и uv, сначала щелкните правой кнопкой мыши на меню «Пуск» и выберите «Терминал» (запуск от имени администратора не обязателен).

Нажмите «Терминал»

Откроется окно терминала (PowerShell).

Терминал (PowerShell)

Введите и выполните в этом окне следующие команды:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Выполнение команд

Теперь все необходимое для настройки Irodori-TTS установлено.

*Python управляется через uv, поэтому он будет установлен автоматически во время настройки.

После установки закройте терминал (PowerShell) и откройте его снова (чтобы обновились пути PATH).

2. Создание рабочей папки

Затем создайте рабочую папку.

Сюда будет установлен Irodori-TTS.

В данном примере мы создали папку с именем «irodori-tts» прямо в корне диска C.

Создание рабочей папки

После создания папки перейдите в нее в терминале.

cd C:\irodori-tts

Переход в рабочую папку

3. Клонирование Irodori-TTS из GitHub

Введите в терминале следующую команду, чтобы клонировать репозиторий Irodori-TTS из GitHub.

git clone https://github.com/Aratako/Irodori-TTS.git

Клонирование репозитория из GitHub

Клонирование репозитория завершится за несколько секунд.

Введите следующую команду, чтобы перейти в папку клонированного репозитория:

cd Irodori-TTS

Переход в папку

4. Установка необходимых пакетов

Введите и выполните следующую команду для установки пакетов, необходимых для работы Irodori-TTS:

uv sync

Установка пакетов

Это может занять время, так как загружается и устанавливается большое количество пакетов.

Экран во время установки пакетов

Сам Python также будет установлен здесь.

Дождитесь завершения, не закрывая окно терминала.

Поскольку загружается около 3 ГБ данных, рекомендуется выполнять настройку в месте с хорошим интернет-соединением.

5. Запуск Irodori-TTS

Как только загрузка и установка пакетов завершатся, настройка окончена.

Запустите Irodori-TTS.

Введите и выполните следующую команду и немного подождите запуска:

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Когда в терминале появится следующее сообщение, запуск завершен:

Экран завершения запуска

Running on local URL: http://0.0.0.0:7860

Откройте веб-браузер и перейдите по адресу http://localhost:7860.

Откроется интерфейс Irodori-TTS (WebUI).

Интерфейс Irodori-TTS WebUI

6. Загрузка модели ИИ

Чтобы загрузить модель ИИ для озвучивания текста, нажмите «Load Model».

Load Model

При первом использовании нажатие этой кнопки инициирует загрузку модели ИИ.

Когда в поле Model Status (обведено красным на следующем изображении) появится сообщение о завершении, загрузка модели ИИ окончена.

Model Status

7. Озвучивание текста в Irodori-TTS

В Irodori-TTS можно задавать инструкции по озвучиванию, включая эмоции, но для начала попробуем озвучить текст без инструкций.

Прокрутите вниз до поля ввода текста и введите предложение, которое хотите озвучить.

Ввод текста

В данном случае попробуем озвучить «こんにちは、これはイロドリTTSで作成された音声です。» (Здравствуйте, это голос, созданный в Иродори-TTS).

(При написании «Irodori-TTS» латиницей озвучка была некорректной, поэтому мы написали название катаканой).

Нажмите кнопку «Generate», чтобы начать генерацию голоса.

Начало генерации

Irodori-TTS использует CPU или GPU вашего ПК для генерации голоса.

Поэтому время генерации сильно зависит от производительности ПК.

В этот раз мы генерировали на ноутбуке без GPU, поэтому даже для короткого предложения потребовалась примерно 1 минута.

Справка: Тестовая генерация проводилась в среде CPU: Ryzen 5 4650U, RAM: DDR4 32GB, Windows 11 Pro 24H2.

По завершении появится волновая форма аудио, и вы сможете его прослушать.

Завершение генерации

Пример озвучки предложения «こんにちは、これはイロドリTTSで作成された音声です。»

Если при прослушивании все в порядке, нажмите кнопку загрузки (иконка со стрелкой вниз), чтобы сохранить аудиофайл.

Аудиофайл сохраняется в формате WAV.

Теперь вы смогли синтезировать голос с помощью Irodori-TTS.

Как настроить голос в Irodori-TTS

В Irodori-TTS можно настраивать пол, эмоции и другие выражения различными способами.

Задание эмоций с помощью эмодзи

Нажав «Emoji Palette» под полем ввода текста, вы можете выбрать эмодзи.

Emoji Palette

Каждому эмодзи соответствует определенное эмоциональное выражение:

  • 😊 Радостно, весело
  • 😭 Рыдания, плач
  • 😰 Спешка, волнение
  • ⏩ Быстрая речь
  • 📖 Нарратив, монолог

Просто добавив эмодзи в поле ввода текста, вы сможете озвучить его с заданным эмоциональным окрасом.

Пример озвучки «😊 こんにちは、これはイロドリTTSで作成された音声です。»

Пример озвучки «📖 こんにちは、これはイロドリTTSで作成された音声です。»

Однако при использовании только эмодзи нельзя точно указать пол или возраст.

Озвучка одним и тем же голосом через загрузку референса

В Irodori-TTS можно загрузить референсный аудиофайл, чтобы программа озвучивала текст, ориентируясь на этот голос.

Референсное аудио загружается в область с надписью 「音声をここにドロップ - または - クリックしてアップロード」 (Перетащите аудио сюда или нажмите для загрузки).

Загрузка референсного аудио

Это не только позволяет использовать один и тот же голос, но и обеспечивает более чистое качество звука по сравнению с генерацией без параметров.

Прямая настройка стиля озвучки через функцию кэпшн (caption)

В Irodori-TTS также можно напрямую текстом указать, каким голосом нужно озвучить текст.

Для использования функции кэпшн необходимо запустить версию «VoiceDesign版», при этом команда запуска в терминале меняется.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

Запуск версии VoiceDesign

Выполнение этой команды запустит интерфейс версии VoiceDesign.

Поскольку версия VoiceDesign использует отличную от стандартной модель ИИ, при первом использовании нужно нажать «Load Model» и скачать модель отдельно.

Объем модели составляет около 2 ГБ, поэтому рекомендуется скачивать ее при хорошем интернет-соединении.

В интерфейсе версии VoiceDesign есть текстовое поле «Caption / Style Prompt (optional)».

Caption / Style Prompt (optional)

Здесь вы описываете словами, какой голос вам нужен:

  • Озвучьте спокойным женским голосом, мягко и естественно, создавая ощущение близости.
  • Бодрым мужским голосом, говорите ярко и четко.
  • Низким мужским голосом, читайте беспристрастно, как диктор новостей.

Таким образом можно задать параметры голоса.

Например, при указании «Спокойным женским голосом, мягко и естественно, создавая ощущение близости» получился такой результат:

Пример с использованием кэпшн «Озвучьте спокойным женским голосом...»

В этом случае также удалось получить чистую и разборчивую озвучку.

Однако у функции кэпшн есть свои нюансы.

Генерация через кэпшн занимает больше времени по сравнению с другими способами.

В этот раз на ноутбуке генерация этого короткого предложения заняла около 5 минут.

Для использования функции кэпшн настоятельно рекомендуется мощный ПК с GPU.

Что будет, если озвучить английский текст?

Irodori-TTS — это программа, предназначенная только для японского языка.

Что же произойдет, если попробовать озвучить английский текст?

Для пробы введем простое предложение.

Пример озвучки «Hello, this is a voice recording created using Irodori-TTS.»

Как видите, слово «Hello» произносится как «Харо» с японским акцентом, а часть «recording» стала неразборчивой — корректно озвучить текст не удалось.

Если вы хотите озвучивать английский текст, рекомендуется использовать ИИ-сервисы с поддержкой иностранных языков.

Рекомендуемый метод синтеза речи для тех, кому настройка кажется сложной

Прочитав до этого момента, вы могли почувствовать, что настройка Irodori-TTS выглядит довольно хлопотно.

Если вы не привыкли работать в терминале, только подготовка Python, Git и других инструментов, а также установка пакетов и загрузка моделей ИИ может занять много времени.

Кроме того, если у вас нет ПК с GPU, одна генерация голоса занимает слишком много времени, что делает использование программы для озвучки видеороликов затруднительным.

Длинные тексты приходится разбивать на части по 30 секунд и генерировать аудио многократно.

Для тех, кто хочет создавать голос из текста без установки и сложной настройки, мы представляем сервис синтеза речи ИИ, работающий в браузере.

『Ondoku』: Голос ИИ, не требующий установки

Ondoku

Если вы хотите легко синтезировать речь с помощью новейшего ИИ, мы рекомендуем сервис 『Ondoku』.

『Ondoku』 — это сервис синтеза речи ИИ, где вы можете создать аудио, просто открыв браузер и вставив текст.

Вы можете бесплатно создавать озвучку прямо сейчас на ПК, смартфоне или планшете.

Генерация голоса происходит в облаке (на стороне сервера), поэтому наличие GPU в вашем ПК не имеет значения.

С самого начала доступно множество голосов: мужские, женские, детские и другие. Вам не нужно готовить референсы или кэпшн — достаточно просто выбрать понравившийся голос.

Длинные тексты также можно озвучивать целиком.

Более того, Ondoku поддерживает английский язык!

Сервис поддерживает французский, испанский, корейский, китайский и многие другие языки, поэтому его можно использовать для озвучки не только на японском.

Кроме того, вы можете попробовать еще более естественную озвучку с ИИ-голосами нового поколения (OndokuBeta).

Если вы ищете способ превратить текст в голос, почему бы не попробовать 『Ondoku』, который доступен бесплатно и прост в использовании?

Сравнение различий между Ondoku и Irodori-TTS

В завершение сравним основные различия между Ondoku и Irodori-TTS.

👆 Прокрутите в сторону
Параметр Ondoku Irodori-TTS
Метод работы Облачный (в браузере) Локальный (на вашем ПК)
Настройка Не требуется Нужна настройка среды (Python, Git и др.)
Поддерживаемые языки Более 35 языков Только японский
Выбор голоса Просто выбрать из списка Клонирование, кэпшн, эмодзи
Лимит одной генерации Поддерживает длинные тексты До ~30 секунд
Коммерческое использование Возможно (при бесплатном использовании нужна ссылка) Возможно (лицензия MIT)
Поддерживаемые устройства ПК, смартфон, планшет ПК (рекомендуется GPU)
Стоимость Есть бесплатный план (платный для большего объема) Бесплатно (т.к. работает локально)

При сравнении можно сказать, что Ondoku лучше подходит для тех, кому важна простота и моментальное использование, а Irodori-TTS — для обладателей мощных ПК, желающих детально настроить голос.

Тем, кому аудио нужно прямо сейчас, кому требуется озвучка на разных языках или возможность работы со смартфона/планшета, мы рекомендуем Ondoku.

Он также подойдет тем, кто хочет озвучивать длинные тексты целиком, не тратить время на установку или не имеет мощной видеокарты.

Поскольку высококачественное аудио можно создать, просто открыв браузер, почему бы не начать использовать Ondoku бесплатно уже сегодня?

Итоги: особенности, настройка и использование Irodori-TTS

В этой статье мы разобрали Irodori-TTS — программу для синтеза речи ИИ, работающую локально и специализирующуюся на японском языке.

Irodori-TTS — привлекательный инструмент для тех, кто хочет детально проработать звучание через клонирование голоса, дизайн тембра с помощью кэпшн и управление эмоциями через эмодзи.

Однако способ настройки и использования ориентирован на продвинутых пользователей, так как требует подготовки среды Python и Git.

Кроме того, на ПК без видеокарты генерация голоса занимает значительное время.

Для тех, кто хочет «быстро и легко использовать синтез речи», мы рекомендуем 『Ondoku』, который работает в браузере.

Попробуйте создать качественную озвучку с помощью простого в использовании бесплатного синтеза речи ИИ!

■ Программное обеспечение для синтеза речи с искусственным интеллектом «Ondoku».

«Ондоку» — это онлайн-инструмент для преобразования текста в речь, который можно использовать без каких-либо первоначальных затрат.

  • Поддерживает около 50 языков, включая японский, английский, китайский, корейский, испанский, французский и немецкий.
  • Доступно как с ПК, так и со смартфона
  • Подходит для бизнеса, образования, развлечений и т. д.
  • Установка не требуется, можно использовать сразу из браузера.
  • Также поддерживает чтение изображений

Чтобы им воспользоваться, просто введите текст или загрузите файл с сайта. Создавайте естественные звуковые файлы за считанные секунды. Вы можете бесплатно использовать синтез речи длиной до 5000 символов, поэтому сначала попробуйте.

Программное обеспечение для преобразования текста в речь «Ondoku» может считывать 5000 символов каждый месяц с помощью голоса AI бесплатно. Вы можете легко скачать MP3, а также возможно коммерческое использование. Если вы зарегистрируетесь бесплатно, вы сможете бесплатно конвертировать до 5000 символов в месяц из текста в речь. Попробуйте Ондоку прямо сейчас.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Смежная статья

Программа для чтения текста Ondoku. Это сервис для преобразования текста в речь, который не требует установки и доступный всем для бесплатного использования. Если вы зарегистрируетесь бесплатно, вы сможете получать до 5000 символов бесплатно каждый месяц. Зарегестрируйтесь сейчас бесплатно