¿Qué es Irodori-TTS? Funciones, precauciones y guía de uso fácil
28 de julio de 2026
¿Qué tipo de software de lectura de IA es Irodori-TTS?
Es probable que muchas personas sientan curiosidad por el nuevo software de lectura de IA llamado «Irodori-TTS».
En este artículo, explicaremos de manera sencilla las características, lo que se puede hacer, las precauciones y el uso de Irodori-TTS.
Además, para aquellos que sientan que la «configuración parece difícil», también presentamos un método de síntesis de voz que se puede usar de inmediato sin necesidad de instalación.
Lo que aprenderás en este artículo
- ¿Qué tipo de software es Irodori-TTS?
- Lo que se puede hacer y precauciones con Irodori-TTS
- Cómo usar Irodori-TTS (desde la configuración hasta el ajuste de voz)
- Método recomendado cuando la construcción del entorno es difícil
¿Qué es Irodori-TTS? Explicación del software de síntesis de voz de IA en japonés
En primer lugar, explicaremos brevemente qué tipo de software de síntesis de voz de IA es Irodori-TTS y sus características.
Irodori-TTS es un modelo de síntesis de voz de IA que funciona localmente
Irodori-TTS es un software de síntesis de voz de IA especializado en japonés.
El desarrollador es Aratako-san, y se ha publicado de forma gratuita como código abierto (licencia MIT).
Su característica principal es que permite el «funcionamiento local», donde la síntesis de voz se completa únicamente en su propia PC.
Dado que todo el procesamiento de generación de voz se realiza en la PC local, el texto y los datos de voz generados no se envían a servidores externos.
Después de la configuración inicial, es posible generar voz sin conexión a Internet, y no hay límites en el número de generaciones.
Sin embargo, la configuración requiere herramientas de programación como Python y Git.
Además, para que funcione a alta velocidad, se recomienda una PC de alto rendimiento equipada con una GPU (tarjeta gráfica).
Lo que se puede hacer y lo que no se puede hacer con Irodori-TTS
A continuación, explicaremos lo que se puede y no se puede hacer con Irodori-TTS.
Lo que se puede hacer con Irodori-TTS
Dado que Irodori-TTS funciona en un entorno local, puede generar voz de forma ilimitada tantas veces como desee.
Incluso en entornos sin conexión a Internet, una vez finalizada la configuración inicial, puede crear voz libremente.
También se proporcionan múltiples métodos para indicar qué tipo de voz crear; utilizando la función de capturas (captions), puede crear la calidad de voz de su preferencia solo con instrucciones de texto.
Además, es posible reproducir voces que ya tenga mediante la clonación de voz o añadir expresiones emocionales con emojis.
Al tener una licencia MIT, el uso comercial de la voz generada también es posible.
Precauciones con Irodori-TTS
Por otro lado, hay algunas precauciones que debe conocer antes de usar Irodori-TTS.
El audio que se puede crear a la vez es de hasta unos 30 segundos
La lectura que se puede generar en una sola vez es de hasta unos 30 segundos.
Si desea leer un texto largo, es necesario dividir el texto y generarlo varias veces.
Es difícil lograr la voz o la forma de hablar exactamente como se desea
A cambio de su alto grado de libertad, Irodori-TTS no tiene voces predeterminadas (voces base).
Por lo tanto, si no se especifican capturas o una voz de referencia, el género y la edad cambiarán de forma aleatoria cada vez que se genere.
Cuando desee leer con la misma voz, es necesario cargar una voz de referencia.
Además, no dispone de una función para ajustar manualmente la entonación o el acento.
El idioma compatible es solo japonés
El idioma compatible es solo el japonés, y no es compatible con idiomas extranjeros como el inglés.
Además, pueden ocurrir errores en la lectura de los caracteres Kanji, por lo que se requiere precaución.
Se recomienda una PC de altas especificaciones con GPU
Dependiendo de las especificaciones de la PC, la generación de voz puede llevar tiempo.
En una PC que no esté equipada con una GPU, incluso un texto corto puede tardar aproximadamente 1 minuto en generarse.
En CPUs de gama de entrada como Celeron o N100, se siente que el uso práctico es difícil.
Cómo usar Irodori-TTS (flujo de configuración)
A partir de aquí, explicaremos brevemente cómo usar Irodori-TTS.
El flujo general de la configuración es el siguiente:
- Instalar el software necesario
- Crear una carpeta de trabajo
- Clonar Irodori-TTS desde GitHub
- Instalar los paquetes necesarios
- Iniciar Irodori-TTS
- Cargar el modelo de IA
- Leer el texto
1. Instalar el software necesario para Irodori-TTS
Para configurar Irodori-TTS, se requiere una preparación previa.
Primero, instale estos tres tipos:
- Python 3.10 o superior: lenguaje de programación
- Git: sistema de control de versiones (necesario para descargar Irodori-TTS)
- uv: gestor de paquetes de Python
Para instalar Python, Git y uv, primero haga clic derecho en el menú de inicio y haga clic en «Terminal» (no es necesario ejecutarlo como administrador).
Se abrirá la pantalla de la terminal (PowerShell).
En esta pantalla, introduzca y ejecute los siguientes comandos:
winget install --id Git.Git -e
winget install --id=astral-sh.uv -e
Con esto, ha instalado lo necesario para configurar Irodori-TTS.
*Python será gestionado por uv, por lo que se instalará automáticamente durante la configuración.
Una vez instalado, cierre la terminal (PowerShell) y ábrala de nuevo (para que se reconozcan las rutas o «path»).
2. Crear una carpeta de trabajo
A continuación, cree una carpeta de trabajo.
Aquí es donde se instalará Irodori-TTS.
En este ejemplo, creamos una carpeta llamada «irodori-tts» directamente en el disco C.
Una vez creada la carpeta, diríjase a ella en la terminal.
cd C:\irodori-tts
3. Clonar Irodori-TTS desde GitHub
Introduzca el siguiente comando en la terminal para clonar el repositorio de Irodori-TTS desde GitHub.
git clone https://github.com/Aratako/Irodori-TTS.git
La clonación del repositorio terminará en pocos segundos.
Introduzca el siguiente comando para moverse a la carpeta del repositorio clonado.
cd Irodori-TTS
4. Instalar los paquetes necesarios
Introduzca y ejecute el siguiente comando para instalar los paquetes necesarios para que funcione Irodori-TTS.
uv sync
Llevará tiempo debido a la gran cantidad de paquetes que se descargan e instalan.
El propio Python también se instalará aquí.
Mientras se descarga e instala, espere sin cerrar la pantalla de la terminal.
Dado que se descargarán archivos con una capacidad cercana a los 3GB, se recomienda realizar la configuración en un lugar con buena conexión a Internet.
5. Iniciar Irodori-TTS
Una vez terminada la descarga e instalación de los paquetes, la configuración está completa.
Inicie Irodori-TTS.
Introduzca y ejecute el siguiente comando, y espere un poco hasta que se inicie.
uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860
Cuando aparezca lo siguiente en la terminal, el inicio se habrá completado.
Running on local URL: http://0.0.0.0:7860
Abra su navegador web y acceda a http://localhost:7860.
De esta manera, se abrirá la pantalla de Irodori-TTS (WebUI).
6. Cargar el modelo de IA
Haga clic en «Load Model» para cargar el modelo de IA que se utilizará para la lectura de texto.
Al usarlo por primera vez, al presionar este botón comenzará la descarga del modelo de IA.
Cuando aparezca el mensaje de finalización en Model Status (el lugar rodeado en rojo en la siguiente imagen), la carga del modelo de IA habrá terminado.
7. Leer texto con Irodori-TTS
En Irodori-TTS puede dar instrucciones sobre la forma de lectura, incluidas las expresiones emocionales, pero primero, como ejemplo, intentemos leer sin instrucciones.
Si se desplaza hacia abajo, encontrará un campo de entrada de texto, así que introduzca la frase que desea leer.
En esta ocasión, intentaremos leer «こんにちは、これはイロドリTTSで作成された音声です。」 (Hola, este es un audio creado con Irodori-TTS).
(Como al escribir «Irodori-TTS» en alfabeto no se leía correctamente, lo escribimos en katakana como «イロドリTTS»).
Al presionar el botón «Generate», comenzará la generación de la voz.
Irodori-TTS utiliza la CPU o GPU (tarjeta gráfica) de su PC para generar la voz.
Por lo tanto, el tiempo necesario para la generación cambiará enormemente según el rendimiento de la PC.
Como en esta ocasión generamos en una laptop que no tiene GPU, aunque era una frase corta, la generación tardó aproximadamente 1 minuto.
Referencia: Se realizó una generación de prueba en un entorno con CPU: Ryzen 5 4650U, Memoria: DDR4 32GB, Windows 11 Pro 24H2.
Una vez finalizada la generación, se mostrará la forma de onda del audio y podrá reproducirlo.
Ejemplo de lectura de «こんにちは、これはイロドリTTSで作成された音声です。」
Si la escucha es correcta, presione el botón de descarga (icono de flecha hacia abajo) para guardar el archivo de audio.
El archivo de audio se guardará en formato WAV.
Con esto, ha logrado sintetizar voz utilizando Irodori-TTS.
Cómo ajustar la voz en Irodori-TTS
En Irodori-TTS, puede ajustar expresiones como el género y las emociones de varias maneras.
Especificar expresiones emocionales con emojis
Al hacer clic en «Emoji Palette» debajo del campo de entrada de texto, puede seleccionar emojis.
A cada emoji se le ha asignado una expresión emocional.
- 😊 Alegremente, con felicidad
- 😭 Sollozos, voz de llanto
- 😰 Con prisa, agitación
- ⏩ Habla rápida
- 📖 Narración, monólogo
Solo con poner el emoji en el campo de entrada de texto, puede leer con la expresión emocional especificada.
Ejemplo de lectura de «😊 こんにちは、これはイロドリTTSで作成された音声です。」
Ejemplo de lectura de «📖 こんにちは、これはイロドリTTSで作成された音声です。」
Sin embargo, solo especificando un emoji, no es posible determinar concretamente el género o la edad.
Cargar una voz de referencia para leer con la misma voz
En Irodori-TTS, puede cargar un archivo de voz de referencia y hacer que lea tomando esa voz como base.
La voz de referencia se carga desde la sección que dice 「音声をここにドロップ - または - クリックしてアップロード」 (Arrastre el audio aquí - o - haga clic para subir).
No solo permite leer con la misma voz, sino que, en comparación con cuando no se especifica nada, permite leer con una calidad de sonido más clara.
También es posible ajustar el estilo de lectura directamente con la función de capturas
En Irodori-TTS, también puede especificar directamente mediante texto qué tipo de voz desea para la lectura.
Para usar la función de capturas, es necesario iniciar la «versión VoiceDesign», y el comando para iniciar Irodori-TTS en la terminal cambia.
uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861
Al ejecutar este comando, se iniciará la pantalla de operación de la versión VoiceDesign.
Dado que la versión VoiceDesign utiliza un modelo de IA diferente al de la versión estándar, al usarla por primera vez es necesario hacer clic en «Load Model» y descargar el modelo por separado.
Dado que el modelo de IA tiene una capacidad de unos 2GB, se recomienda descargarlo en un lugar con buena conexión.
En la pantalla de operación de la versión VoiceDesign, hay un cuadro de texto llamado «Caption / Style Prompt (optional)».
Aquí, introduzca una frase describiendo con qué voz desea que se lea.
- Por favor, lea de forma natural y suave, con una voz femenina calmada y una sensación de cercanía.
- Por favor, hable de forma clara y alegre, con una voz masculina enérgica.
- Por favor, lea de forma impasible como un presentador de noticias, con una voz masculina grave.
De esta manera, puede especificar qué tipo de voz utilizar.
Por ejemplo, al especificar 「落ち着いた女性の声で、近い距離感でやわらかく自然に読み上げてください。」 (Por favor, lea de forma natural y suave, con una voz femenina calmada y una sensación de cercanía), se obtuvo este audio.
Ejemplo especificando una voz femenina calmada
Aquí también fue posible generar una lectura con una calidad de sonido clara y fácil de escuchar.
Sin embargo, la función de capturas tiene una precaución.
La función de capturas tarda más tiempo en generar la voz en comparación con otros métodos de lectura.
En esta ocasión, al generar en una laptop, la generación de esta frase corta tardó unos 5 minutos.
Al usar la función de capturas, se recomienda una PC de altas especificaciones equipada con GPU.
¿Qué pasa si se lee un texto en inglés?
Irodori-TTS es un software de lectura compatible únicamente con japonés.
Entonces, ¿qué sucede si intentamos leer un texto en inglés?
Probemos introduciendo un ejemplo sencillo.
Ejemplo de lectura de «Hello, this is a voice recording created using Irodori-TTS.»
De esta manera, «Hello» se pronunció como «Harō» en katakana, y la parte de «recording» resultó en una pronunciación ininteligible, por lo que no fue posible leer correctamente.
Si desea leer texto en inglés, se recomienda utilizar un servicio de lectura de IA compatible con idiomas extranjeros.
Método de síntesis de voz recomendado cuando «la configuración es difícil»
Al llegar hasta aquí, es probable que algunos sientan que la configuración de Irodori-TTS parece un poco complicada.
Si no está acostumbrado al manejo de terminales, solo el procedimiento de preparar herramientas como Python y Git, instalar paquetes y descargar el modelo de IA puede llevar mucho tiempo.
Además, si no tiene una PC equipada con GPU, la síntesis de voz tarda demasiado en cada ocasión, lo que dificulta su uso para propósitos como la narración de videos.
Los textos largos deben dividirse en partes de unos 30 segundos y generar el audio repetidamente.
Para quienes deseen crear voz a partir de texto sin necesidad de instalación ni configuración, a partir de aquí presentamos un servicio de síntesis de voz de IA que se puede usar en el navegador.
『Ondoku』: Voz de IA utilizable sin necesidad de instalación
Cuando desee realizar una síntesis de voz sencilla con la IA más avanzada, el servicio de síntesis de voz de IA recomendado es 『Ondoku』.
『Ondoku』 es un servicio de síntesis de voz de IA donde solo necesita abrir su navegador y pegar el texto para crear audio.
Puede crear audio de forma gratuita ahora mismo desde su PC, smartphone o tableta.
Dado que la generación de voz se realiza en la nube (lado del servidor), no hay problema si su PC no está equipada con una GPU.
Como ya se proporcionan múltiples voces desde el principio, como voces masculinas, femeninas y de niños, puede leer de inmediato simplemente eligiendo una, sin necesidad de preparar voces de referencia o capturas.
También es posible leer textos largos tal cual.
¡Además, Ondoku es compatible con el inglés!
Al ser compatible con múltiples idiomas como francés, español, coreano y chino, puede usarse para lecturas en otros idiomas aparte del japonés.
Además, con la voz de IA de próxima generación (OndokuBeta), puede experimentar una lectura aún más natural.
Si busca un método para leer texto como voz, ¿por qué no prueba 『Ondoku』, que es fácil y gratuito de usar?
Comparación de las diferencias entre Ondoku e Irodori-TTS
Por último, comparamos las principales diferencias entre Ondoku e Irodori-TTS.
| Elemento | Ondoku | Irodori-TTS |
|---|---|---|
| Método de funcionamiento | Nube (operación en navegador) | Local (procesamiento en PC propia) |
| Configuración | No requerida | Requiere construcción de entorno Python, Git, etc. |
| Idiomas compatibles | Más de 35 idiomas | Solo japonés |
| Cómo elegir la voz | Solo elegir entre múltiples voces | Especificar por clonación de voz, capturas o emojis |
| Límite por generación | Compatible con textos largos | Hasta aprox. 30 segundos |
| Uso comercial | Posible (requiere atribución en uso gratuito) | Posible (Licencia MIT) |
| Dispositivos compatibles | PC, smartphone, tableta | PC (Se recomienda GPU) |
| Tarifa | Plan gratuito disponible (Aumento de caracteres en planes de pago) | Gratis (Debido al funcionamiento local) |
Al comparar, puede utilizarlos según sus necesidades: Ondoku por su facilidad y uso inmediato, e Irodori-TTS si tiene una PC de alto rendimiento y desea detallar meticulosamente la creación de la voz.
Para quienes necesitan voz de inmediato, requieren lecturas en múltiples idiomas o desean usarlo en smartphones o tabletas, Ondoku es el recomendado.
También es ideal para quienes desean leer textos largos tal cual, no quieren dedicar tiempo a la configuración o no tienen una GPU instalada en su PC.
Dado que puede generar audio de alta calidad simplemente abriendo su navegador, ¿por qué no prueba Ondoku de forma gratuita?
Resumen de características, configuración y uso de Irodori-TTS
En este artículo, explicamos Irodori-TTS, un software de síntesis de voz de IA de funcionamiento local especializado en japonés.
Irodori-TTS es una herramienta atractiva para quienes desean esmerarse en la expresión vocal, con funciones como el diseño de calidad de voz mediante clonación de voz o capturas, y el control emocional mediante emojis.
Sin embargo, el método de configuración y el uso están dirigidos a usuarios avanzados, y la configuración requiere la construcción de un entorno con Python y Git.
Además, en una PC sin GPU, la generación de voz llevará tiempo.
Para quienes deseen «utilizar la síntesis de voz de forma fácil ahora mismo», se recomienda 『Ondoku』, que se puede usar solo con el navegador.
Con una síntesis de voz de IA gratuita y fácil de usar, ¿por qué no intenta usted también crear audio de alta calidad?
■ Software de síntesis de voz con IA “Ondoku”
"Ondoku" es una herramienta de conversión de texto a voz en línea que se puede utilizar sin costo inicial.
- Admite aproximadamente 50 idiomas, incluidos japonés, inglés, chino, coreano, español, francés y alemán.
- Disponible tanto desde PC como desde teléfono inteligente
- Adecuado para negocios, educación, entretenimiento, etc.
- No requiere instalación, puede usarse inmediatamente desde su navegador
- También admite la lectura de imágenes.
Para usarlo, simplemente ingrese texto o cargue un archivo desde el sitio. Genere archivos de sonido naturales en segundos. Puede utilizar la síntesis de voz de hasta 5000 caracteres de forma gratuita, así que pruébelo primero.
Email: ondoku3.com@gmail.com
Software de lectura de texto Ondoku. Es un servicio de conversión de texto a voz que no requiere instalación y puede ser utilizado por cualquier persona de forma gratuita. Si te registras gratis, podrás obtener hasta 5000 caracteres gratis cada mes. Regístrese ahora gratis