¿Qué es Irodori-TTS? Funciones, precauciones y guía de uso fácil

28 de julio de 2026

¿Qué es Irodori-TTS? Funciones, precauciones y guía de uso fácil


perro

¿Qué tipo de software de lectura de IA es Irodori-TTS?

Es probable que muchas personas sientan curiosidad por el nuevo software de lectura de IA llamado «Irodori-TTS».

En este artículo, explicaremos de manera sencilla las características, lo que se puede hacer, las precauciones y el uso de Irodori-TTS.

Además, para aquellos que sientan que la «configuración parece difícil», también presentamos un método de síntesis de voz que se puede usar de inmediato sin necesidad de instalación.

Lo que aprenderás en este artículo

  1. ¿Qué tipo de software es Irodori-TTS?
  2. Lo que se puede hacer y precauciones con Irodori-TTS
  3. Cómo usar Irodori-TTS (desde la configuración hasta el ajuste de voz)
  4. Método recomendado cuando la construcción del entorno es difícil

¿Qué es Irodori-TTS? Explicación del software de síntesis de voz de IA en japonés

¿Qué es Irodori-TTS? Explicación del software de síntesis de voz de IA en japonés

En primer lugar, explicaremos brevemente qué tipo de software de síntesis de voz de IA es Irodori-TTS y sus características.

Irodori-TTS es un modelo de síntesis de voz de IA que funciona localmente

Irodori-TTS es un software de síntesis de voz de IA especializado en japonés.

El desarrollador es Aratako-san, y se ha publicado de forma gratuita como código abierto (licencia MIT).

Su característica principal es que permite el «funcionamiento local», donde la síntesis de voz se completa únicamente en su propia PC.

Dado que todo el procesamiento de generación de voz se realiza en la PC local, el texto y los datos de voz generados no se envían a servidores externos.

Después de la configuración inicial, es posible generar voz sin conexión a Internet, y no hay límites en el número de generaciones.

Sin embargo, la configuración requiere herramientas de programación como Python y Git.

Además, para que funcione a alta velocidad, se recomienda una PC de alto rendimiento equipada con una GPU (tarjeta gráfica).

Lo que se puede hacer y lo que no se puede hacer con Irodori-TTS

Lo que se puede hacer y lo que no se puede hacer con Irodori-TTS

A continuación, explicaremos lo que se puede y no se puede hacer con Irodori-TTS.

Lo que se puede hacer con Irodori-TTS

Dado que Irodori-TTS funciona en un entorno local, puede generar voz de forma ilimitada tantas veces como desee.

Incluso en entornos sin conexión a Internet, una vez finalizada la configuración inicial, puede crear voz libremente.

También se proporcionan múltiples métodos para indicar qué tipo de voz crear; utilizando la función de capturas (captions), puede crear la calidad de voz de su preferencia solo con instrucciones de texto.

Además, es posible reproducir voces que ya tenga mediante la clonación de voz o añadir expresiones emocionales con emojis.

Al tener una licencia MIT, el uso comercial de la voz generada también es posible.

Precauciones con Irodori-TTS

Por otro lado, hay algunas precauciones que debe conocer antes de usar Irodori-TTS.

El audio que se puede crear a la vez es de hasta unos 30 segundos

La lectura que se puede generar en una sola vez es de hasta unos 30 segundos.

Si desea leer un texto largo, es necesario dividir el texto y generarlo varias veces.

Es difícil lograr la voz o la forma de hablar exactamente como se desea

A cambio de su alto grado de libertad, Irodori-TTS no tiene voces predeterminadas (voces base).

Por lo tanto, si no se especifican capturas o una voz de referencia, el género y la edad cambiarán de forma aleatoria cada vez que se genere.

Cuando desee leer con la misma voz, es necesario cargar una voz de referencia.

Además, no dispone de una función para ajustar manualmente la entonación o el acento.

El idioma compatible es solo japonés

El idioma compatible es solo el japonés, y no es compatible con idiomas extranjeros como el inglés.

Además, pueden ocurrir errores en la lectura de los caracteres Kanji, por lo que se requiere precaución.

Se recomienda una PC de altas especificaciones con GPU

Dependiendo de las especificaciones de la PC, la generación de voz puede llevar tiempo.

En una PC que no esté equipada con una GPU, incluso un texto corto puede tardar aproximadamente 1 minuto en generarse.

En CPUs de gama de entrada como Celeron o N100, se siente que el uso práctico es difícil.

Cómo usar Irodori-TTS (flujo de configuración)

A partir de aquí, explicaremos brevemente cómo usar Irodori-TTS.

El flujo general de la configuración es el siguiente:

  1. Instalar el software necesario
  2. Crear una carpeta de trabajo
  3. Clonar Irodori-TTS desde GitHub
  4. Instalar los paquetes necesarios
  5. Iniciar Irodori-TTS
  6. Cargar el modelo de IA
  7. Leer el texto

1. Instalar el software necesario para Irodori-TTS

Para configurar Irodori-TTS, se requiere una preparación previa.

Primero, instale estos tres tipos:

  • Python 3.10 o superior: lenguaje de programación
  • Git: sistema de control de versiones (necesario para descargar Irodori-TTS)
  • uv: gestor de paquetes de Python

Para instalar Python, Git y uv, primero haga clic derecho en el menú de inicio y haga clic en «Terminal» (no es necesario ejecutarlo como administrador).

Hacer clic en «Terminal»

Se abrirá la pantalla de la terminal (PowerShell).

Terminal (PowerShell)

En esta pantalla, introduzca y ejecute los siguientes comandos:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Comandos en ejecución

Con esto, ha instalado lo necesario para configurar Irodori-TTS.

*Python será gestionado por uv, por lo que se instalará automáticamente durante la configuración.

Una vez instalado, cierre la terminal (PowerShell) y ábrala de nuevo (para que se reconozcan las rutas o «path»).

2. Crear una carpeta de trabajo

A continuación, cree una carpeta de trabajo.

Aquí es donde se instalará Irodori-TTS.

En este ejemplo, creamos una carpeta llamada «irodori-tts» directamente en el disco C.

Crear carpeta de trabajo

Una vez creada la carpeta, diríjase a ella en la terminal.

cd C:\irodori-tts

Moverse a la carpeta de trabajo

3. Clonar Irodori-TTS desde GitHub

Introduzca el siguiente comando en la terminal para clonar el repositorio de Irodori-TTS desde GitHub.

git clone https://github.com/Aratako/Irodori-TTS.git

Clonar repositorio desde GitHub

La clonación del repositorio terminará en pocos segundos.

Introduzca el siguiente comando para moverse a la carpeta del repositorio clonado.

cd Irodori-TTS

Moverse a la carpeta

4. Instalar los paquetes necesarios

Introduzca y ejecute el siguiente comando para instalar los paquetes necesarios para que funcione Irodori-TTS.

uv sync

Instalar paquetes

Llevará tiempo debido a la gran cantidad de paquetes que se descargan e instalan.

Pantalla durante la instalación de paquetes

El propio Python también se instalará aquí.

Mientras se descarga e instala, espere sin cerrar la pantalla de la terminal.

Dado que se descargarán archivos con una capacidad cercana a los 3GB, se recomienda realizar la configuración en un lugar con buena conexión a Internet.

5. Iniciar Irodori-TTS

Una vez terminada la descarga e instalación de los paquetes, la configuración está completa.

Inicie Irodori-TTS.

Introduzca y ejecute el siguiente comando, y espere un poco hasta que se inicie.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Cuando aparezca lo siguiente en la terminal, el inicio se habrá completado.

Pantalla de inicio completado

Running on local URL: http://0.0.0.0:7860

Abra su navegador web y acceda a http://localhost:7860.

De esta manera, se abrirá la pantalla de Irodori-TTS (WebUI).

WebUI de Irodori-TTS

6. Cargar el modelo de IA

Haga clic en «Load Model» para cargar el modelo de IA que se utilizará para la lectura de texto.

Load Model

Al usarlo por primera vez, al presionar este botón comenzará la descarga del modelo de IA.

Cuando aparezca el mensaje de finalización en Model Status (el lugar rodeado en rojo en la siguiente imagen), la carga del modelo de IA habrá terminado.

Model Status

7. Leer texto con Irodori-TTS

En Irodori-TTS puede dar instrucciones sobre la forma de lectura, incluidas las expresiones emocionales, pero primero, como ejemplo, intentemos leer sin instrucciones.

Si se desplaza hacia abajo, encontrará un campo de entrada de texto, así que introduzca la frase que desea leer.

Introducir texto

En esta ocasión, intentaremos leer «こんにちは、これはイロドリTTSで作成された音声です。」 (Hola, este es un audio creado con Irodori-TTS).

(Como al escribir «Irodori-TTS» en alfabeto no se leía correctamente, lo escribimos en katakana como «イロドリTTS»).

Al presionar el botón «Generate», comenzará la generación de la voz.

Comenzar generación

Irodori-TTS utiliza la CPU o GPU (tarjeta gráfica) de su PC para generar la voz.

Por lo tanto, el tiempo necesario para la generación cambiará enormemente según el rendimiento de la PC.

Como en esta ocasión generamos en una laptop que no tiene GPU, aunque era una frase corta, la generación tardó aproximadamente 1 minuto.

Referencia: Se realizó una generación de prueba en un entorno con CPU: Ryzen 5 4650U, Memoria: DDR4 32GB, Windows 11 Pro 24H2.

Una vez finalizada la generación, se mostrará la forma de onda del audio y podrá reproducirlo.

Generación completada

Ejemplo de lectura de «こんにちは、これはイロドリTTSで作成された音声です。」

Si la escucha es correcta, presione el botón de descarga (icono de flecha hacia abajo) para guardar el archivo de audio.

El archivo de audio se guardará en formato WAV.

Con esto, ha logrado sintetizar voz utilizando Irodori-TTS.

Cómo ajustar la voz en Irodori-TTS

En Irodori-TTS, puede ajustar expresiones como el género y las emociones de varias maneras.

Especificar expresiones emocionales con emojis

Al hacer clic en «Emoji Palette» debajo del campo de entrada de texto, puede seleccionar emojis.

Emoji Palette

A cada emoji se le ha asignado una expresión emocional.

  • 😊 Alegremente, con felicidad
  • 😭 Sollozos, voz de llanto
  • 😰 Con prisa, agitación
  • ⏩ Habla rápida
  • 📖 Narración, monólogo

Solo con poner el emoji en el campo de entrada de texto, puede leer con la expresión emocional especificada.

Ejemplo de lectura de «😊 こんにちは、これはイロドリTTSで作成された音声です。」

Ejemplo de lectura de «📖 こんにちは、これはイロドリTTSで作成された音声です。」

Sin embargo, solo especificando un emoji, no es posible determinar concretamente el género o la edad.

Cargar una voz de referencia para leer con la misma voz

En Irodori-TTS, puede cargar un archivo de voz de referencia y hacer que lea tomando esa voz como base.

La voz de referencia se carga desde la sección que dice 「音声をここにドロップ - または - クリックしてアップロード」 (Arrastre el audio aquí - o - haga clic para subir).

Cargar voz de referencia

No solo permite leer con la misma voz, sino que, en comparación con cuando no se especifica nada, permite leer con una calidad de sonido más clara.

También es posible ajustar el estilo de lectura directamente con la función de capturas

En Irodori-TTS, también puede especificar directamente mediante texto qué tipo de voz desea para la lectura.

Para usar la función de capturas, es necesario iniciar la «versión VoiceDesign», y el comando para iniciar Irodori-TTS en la terminal cambia.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

Iniciar versión VoiceDesign

Al ejecutar este comando, se iniciará la pantalla de operación de la versión VoiceDesign.

Dado que la versión VoiceDesign utiliza un modelo de IA diferente al de la versión estándar, al usarla por primera vez es necesario hacer clic en «Load Model» y descargar el modelo por separado.

Dado que el modelo de IA tiene una capacidad de unos 2GB, se recomienda descargarlo en un lugar con buena conexión.

En la pantalla de operación de la versión VoiceDesign, hay un cuadro de texto llamado «Caption / Style Prompt (optional)».

Caption / Style Prompt (optional)

Aquí, introduzca una frase describiendo con qué voz desea que se lea.

  • Por favor, lea de forma natural y suave, con una voz femenina calmada y una sensación de cercanía.
  • Por favor, hable de forma clara y alegre, con una voz masculina enérgica.
  • Por favor, lea de forma impasible como un presentador de noticias, con una voz masculina grave.

De esta manera, puede especificar qué tipo de voz utilizar.

Por ejemplo, al especificar 「落ち着いた女性の声で、近い距離感でやわらかく自然に読み上げてください。」 (Por favor, lea de forma natural y suave, con una voz femenina calmada y una sensación de cercanía), se obtuvo este audio.

Ejemplo especificando una voz femenina calmada

Aquí también fue posible generar una lectura con una calidad de sonido clara y fácil de escuchar.

Sin embargo, la función de capturas tiene una precaución.

La función de capturas tarda más tiempo en generar la voz en comparación con otros métodos de lectura.

En esta ocasión, al generar en una laptop, la generación de esta frase corta tardó unos 5 minutos.

Al usar la función de capturas, se recomienda una PC de altas especificaciones equipada con GPU.

¿Qué pasa si se lee un texto en inglés?

Irodori-TTS es un software de lectura compatible únicamente con japonés.

Entonces, ¿qué sucede si intentamos leer un texto en inglés?

Probemos introduciendo un ejemplo sencillo.

Ejemplo de lectura de «Hello, this is a voice recording created using Irodori-TTS.»

De esta manera, «Hello» se pronunció como «Harō» en katakana, y la parte de «recording» resultó en una pronunciación ininteligible, por lo que no fue posible leer correctamente.

Si desea leer texto en inglés, se recomienda utilizar un servicio de lectura de IA compatible con idiomas extranjeros.

Método de síntesis de voz recomendado cuando «la configuración es difícil»

Al llegar hasta aquí, es probable que algunos sientan que la configuración de Irodori-TTS parece un poco complicada.

Si no está acostumbrado al manejo de terminales, solo el procedimiento de preparar herramientas como Python y Git, instalar paquetes y descargar el modelo de IA puede llevar mucho tiempo.

Además, si no tiene una PC equipada con GPU, la síntesis de voz tarda demasiado en cada ocasión, lo que dificulta su uso para propósitos como la narración de videos.

Los textos largos deben dividirse en partes de unos 30 segundos y generar el audio repetidamente.

Para quienes deseen crear voz a partir de texto sin necesidad de instalación ni configuración, a partir de aquí presentamos un servicio de síntesis de voz de IA que se puede usar en el navegador.

『Ondoku』: Voz de IA utilizable sin necesidad de instalación

Ondoku

Cuando desee realizar una síntesis de voz sencilla con la IA más avanzada, el servicio de síntesis de voz de IA recomendado es 『Ondoku』.

『Ondoku』 es un servicio de síntesis de voz de IA donde solo necesita abrir su navegador y pegar el texto para crear audio.

Puede crear audio de forma gratuita ahora mismo desde su PC, smartphone o tableta.

Dado que la generación de voz se realiza en la nube (lado del servidor), no hay problema si su PC no está equipada con una GPU.

Como ya se proporcionan múltiples voces desde el principio, como voces masculinas, femeninas y de niños, puede leer de inmediato simplemente eligiendo una, sin necesidad de preparar voces de referencia o capturas.

También es posible leer textos largos tal cual.

¡Además, Ondoku es compatible con el inglés!

Al ser compatible con múltiples idiomas como francés, español, coreano y chino, puede usarse para lecturas en otros idiomas aparte del japonés.

Además, con la voz de IA de próxima generación (OndokuBeta), puede experimentar una lectura aún más natural.

Si busca un método para leer texto como voz, ¿por qué no prueba 『Ondoku』, que es fácil y gratuito de usar?

Comparación de las diferencias entre Ondoku e Irodori-TTS

Por último, comparamos las principales diferencias entre Ondoku e Irodori-TTS.

👆 Puede desplazarse lateralmente
Elemento Ondoku Irodori-TTS
Método de funcionamiento Nube (operación en navegador) Local (procesamiento en PC propia)
Configuración No requerida Requiere construcción de entorno Python, Git, etc.
Idiomas compatibles Más de 35 idiomas Solo japonés
Cómo elegir la voz Solo elegir entre múltiples voces Especificar por clonación de voz, capturas o emojis
Límite por generación Compatible con textos largos Hasta aprox. 30 segundos
Uso comercial Posible (requiere atribución en uso gratuito) Posible (Licencia MIT)
Dispositivos compatibles PC, smartphone, tableta PC (Se recomienda GPU)
Tarifa Plan gratuito disponible (Aumento de caracteres en planes de pago) Gratis (Debido al funcionamiento local)

Al comparar, puede utilizarlos según sus necesidades: Ondoku por su facilidad y uso inmediato, e Irodori-TTS si tiene una PC de alto rendimiento y desea detallar meticulosamente la creación de la voz.

Para quienes necesitan voz de inmediato, requieren lecturas en múltiples idiomas o desean usarlo en smartphones o tabletas, Ondoku es el recomendado.

También es ideal para quienes desean leer textos largos tal cual, no quieren dedicar tiempo a la configuración o no tienen una GPU instalada en su PC.

Dado que puede generar audio de alta calidad simplemente abriendo su navegador, ¿por qué no prueba Ondoku de forma gratuita?

Resumen de características, configuración y uso de Irodori-TTS

En este artículo, explicamos Irodori-TTS, un software de síntesis de voz de IA de funcionamiento local especializado en japonés.

Irodori-TTS es una herramienta atractiva para quienes desean esmerarse en la expresión vocal, con funciones como el diseño de calidad de voz mediante clonación de voz o capturas, y el control emocional mediante emojis.

Sin embargo, el método de configuración y el uso están dirigidos a usuarios avanzados, y la configuración requiere la construcción de un entorno con Python y Git.

Además, en una PC sin GPU, la generación de voz llevará tiempo.

Para quienes deseen «utilizar la síntesis de voz de forma fácil ahora mismo», se recomienda 『Ondoku』, que se puede usar solo con el navegador.

Con una síntesis de voz de IA gratuita y fácil de usar, ¿por qué no intenta usted también crear audio de alta calidad?

■ Software de síntesis de voz con IA “Ondoku”

"Ondoku" es una herramienta de conversión de texto a voz en línea que se puede utilizar sin costo inicial.

  • Admite aproximadamente 50 idiomas, incluidos japonés, inglés, chino, coreano, español, francés y alemán.
  • Disponible tanto desde PC como desde teléfono inteligente
  • Adecuado para negocios, educación, entretenimiento, etc.
  • No requiere instalación, puede usarse inmediatamente desde su navegador
  • También admite la lectura de imágenes.

Para usarlo, simplemente ingrese texto o cargue un archivo desde el sitio. Genere archivos de sonido naturales en segundos. Puede utilizar la síntesis de voz de hasta 5000 caracteres de forma gratuita, así que pruébelo primero.

El software de texto a voz "Ondoku" puede leer 5000 caracteres cada mes con voz AI de forma gratuita. Puede descargar MP3 fácilmente y también es posible el uso comercial. Si te registras gratis, puedes convertir hasta 5000 caracteres por mes de forma gratuita de texto a voz. Prueba Ondoku ahora.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Artículo relacionado

Software de lectura de texto Ondoku. Es un servicio de conversión de texto a voz que no requiere instalación y puede ser utilizado por cualquier persona de forma gratuita. Si te registras gratis, podrás obtener hasta 5000 caracteres gratis cada mes. Regístrese ahora gratis