O que é Irodori-TTS? Recursos, cuidados e guia de uso simples

28 de Julho de 2026

O que é Irodori-TTS? Recursos, cuidados e guia de uso simples


dog

Que tipo de software de leitura por AI é o Irodori-TTS?

Muitos de vocês devem estar curiosos sobre o novo software de leitura por AI "Irodori-TTS".

Neste artigo, explicaremos de forma fácil de entender as características, o que ele pode fazer, pontos de atenção e como usar o Irodori-TTS.

Além disso, para aqueles que sentem que a "configuração parece difícil", também apresentaremos um método de síntese de voz que pode ser usado agora mesmo sem necessidade de instalação.

O que você aprenderá neste artigo

  1. Que tipo de software é o Irodori-TTS?
  2. O que é possível fazer com o Irodori-TTS e pontos de atenção
  3. Como usar o Irodori-TTS (desde a configuração até o ajuste de voz)
  4. Método recomendado quando a construção do ambiente é difícil

O que é Irodori-TTS? Explicação do software de síntese de voz por AI em japonês

O que é Irodori-TTS? Explicação do software de síntese de voz por AI em japonês

Primeiramente, explicaremos brevemente as características do Irodori-TTS e que tipo de software de síntese de voz por AI ele é.

Irodori-TTS é um modelo de síntese de voz por AI que funciona localmente

O Irodori-TTS é um software de síntese de voz por AI especializado na língua japonesa.

O desenvolvedor é Aratako-san, e o software é disponibilizado gratuitamente como Open Source (licença MIT).

A maior característica é que ele permite a "operação local", onde a síntese de voz é concluída apenas no seu próprio PC.

Como todo o processamento de geração de voz é realizado no PC local, o texto e os dados de voz gerados não são enviados para servidores externos.

Após a configuração inicial, é possível gerar voz sem conexão com a internet, e não há limites para o número de gerações.

No entanto, a configuração requer ferramentas de programação como Python e Git.

Além disso, para operar em alta velocidade, recomenda-se um PC de alto desempenho equipado com uma GPU (placa de vídeo).

O que é possível e o que não é possível fazer com Irodori-TTS

O que é possível e o que não é possível fazer com Irodori-TTS

A seguir, explicaremos o que você pode e não pode fazer com o Irodori-TTS.

O que é possível fazer com Irodori-TTS

Como o Irodori-TTS funciona em um ambiente local, você pode gerar vozes ilimitadamente quantas vezes quiser.

Mesmo em ambientes sem conexão à internet, uma vez concluída a configuração inicial, você pode criar vozes livremente.

Existem vários métodos para instruir que tipo de voz criar; usando a função de Caption, você pode criar a qualidade de voz de sua preferência apenas com instruções de texto.

Também é possível reproduzir vozes que você já possui através de clonagem de voz, ou adicionar expressões emocionais usando emojis.

Como possui licença MIT, o uso comercial das vozes geradas também é permitido.

Pontos de atenção do Irodori-TTS

Por outro lado, existem alguns pontos de atenção que você deve conhecer antes de usar o Irodori-TTS.

A voz que pode ser criada por vez é de até aproximadamente 30 segundos

A leitura que pode ser feita em uma única geração é de até cerca de 30 segundos.

Se você quiser ler textos longos, precisará dividir o texto e gerar a voz várias vezes.

É difícil obter exatamente a voz ou a forma de falar desejada

Devido à alta flexibilidade do Irodori-TTS, não há vozes padrão (vozes base) preparadas.

Por isso, se você não especificar um Caption ou uma voz de referência, o gênero e a idade mudarão aleatoriamente a cada geração.

Quando quiser ler com a mesma voz, é necessário carregar uma voz de referência.

Além disso, não há uma função para ajustar manualmente a entonação ou a acentuação.

O idioma suportado é apenas o japonês

O idioma suportado é apenas o japonês, não sendo compatível com idiomas estrangeiros como o inglês.

Além disso, é preciso ter cuidado, pois podem ocorrer erros na leitura de kanjis.

Recomenda-se um PC de alta especificação com GPU

Dependendo das especificações do PC, a geração de voz pode levar tempo.

Em PCs que não possuem GPU, mesmo textos curtos levam cerca de 1 minuto para serem gerados.

Em CPUs de classe básica, como Celeron ou N100, sente-se que o uso prático é difícil.

Como usar o Irodori-TTS (Fluxo de configuração)

A partir daqui, explicaremos brevemente como usar o Irodori-TTS.

O fluxo geral da configuração é o seguinte:

  1. Instalar o software necessário
  2. Criar uma pasta de trabalho
  3. Clonar o Irodori-TTS do GitHub
  4. Instalar os pacotes necessários
  5. Iniciar o Irodori-TTS
  6. Carregar o modelo de AI
  7. Ler o texto

1. Instalar o software necessário para o Irodori-TTS

A preparação é necessária para configurar o Irodori-TTS.

Primeiro, instale estes três tipos:

  • Python 3.10 ou superior: Linguagem de programação
  • Git: Sistema de controle de versão (necessário para baixar o Irodori-TTS)
  • uv: Gerenciador de pacotes para Python

Para instalar Python, Git e uv, primeiro clique com o botão direito no menu iniciar e clique em "Terminal" (não é necessário iniciar como administrador).

Clique em 'Terminal'

A tela do terminal (PowerShell) será aberta.

Terminal (PowerShell)

Nesta tela, insira e execute os seguintes comandos:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Comando em execução

Com isso, você instalou o necessário para configurar o Irodori-TTS.

*O Python é gerenciado pelo uv, portanto será instalado automaticamente durante a configuração.

Após a instalação, feche o terminal (PowerShell) e abra-o novamente (para "atualizar o PATH").

2. Criar uma pasta de trabalho

Em seguida, crie uma pasta de trabalho.

O Irodori-TTS será instalado aqui.

Desta vez, criamos uma pasta chamada "irodori-tts" diretamente na unidade C.

Criar pasta de trabalho

Após criar a pasta, mova-se para essa pasta no terminal.

cd C:\irodori-tts

Mover para a pasta de trabalho

3. Clonar o Irodori-TTS do GitHub

Insira o seguinte comando no terminal para clonar o repositório do Irodori-TTS do GitHub.

git clone https://github.com/Aratako/Irodori-TTS.git

Clonar repositório do GitHub

A clonagem do repositório terminará em poucos segundos.

Insira o seguinte comando para mover-se para a pasta do repositório clonado.

cd Irodori-TTS

Mover pasta

4. Instalar os pacotes necessários

Insira e execute o seguinte comando para instalar os pacotes necessários para rodar o Irodori-TTS.

uv sync

Instalar pacotes

Levará algum tempo, pois uma grande quantidade de pacotes será baixada e instalada.

Tela durante a instalação de pacotes

O próprio Python também será instalado aqui.

Aguarde sem fechar a tela do terminal durante o download e a instalação.

Como arquivos de quase 3GB de capacidade serão baixados, recomenda-se configurar em um local com boa conexão de rede.

5. Iniciar o Irodori-TTS

Quando o download e a instalação dos pacotes terminarem, a configuração estará concluída.

Inicie o Irodori-TTS.

Insira e execute o seguinte comando e aguarde um pouco pela inicialização.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Quando aparecer o seguinte no terminal, a inicialização está concluída.

Tela de inicialização concluída

Running on local URL: http://0.0.0.0:7860

Abra o navegador web e acesse http://localhost:7860.

Assim, a tela do Irodori-TTS (WebUI) será aberta.

WebUI do Irodori-TTS

6. Carregar o modelo de AI

Para carregar o modelo de AI usado para a leitura de texto, clique em "Load Model".

Load Model

Ao usar pela primeira vez, o download do modelo de AI começará ao pressionar este botão.

Quando a mensagem de conclusão for exibida no Model Status (área circulada em vermelho na próxima imagem), o carregamento do modelo de AI estará concluído.

Model Status

7. Ler o texto com Irodori-TTS

No Irodori-TTS, você pode dar instruções sobre como ler, incluindo expressões emocionais, mas primeiro, como exemplo, vamos ler sem instruções.

Ao rolar para baixo, haverá um campo de entrada de texto; insira a frase que deseja ler.

Inserir frase

Desta vez, tentaremos ler "こんにちは、これはイロドリTTSで作成された音声です。" (Olá, esta é uma voz criada com Irodori-TTS).

(Ao escrever "Irodori-TTS" com alfabeto, a leitura não foi feita corretamente, por isso usei katakana "イロドリTTS")

Pressione o botão "Generate" para iniciar a geração da voz.

Iniciar geração

O Irodori-TTS gera a voz usando a CPU ou GPU (placa de vídeo) do seu PC local.

Portanto, o tempo de geração varia muito dependendo do desempenho do seu PC.

Desta vez, como geramos em um notebook sem GPU, levou cerca de 1 minuto para gerar esta frase curta.

Referência: Geração de teste realizada no ambiente CPU: Ryzen 5 4650U Memória: DDR4 32GB Windows 11 Pro 24H2.

Quando a geração terminar, a forma de onda da voz será exibida e você poderá reproduzir o áudio.

Geração concluída

Exemplo de leitura de "こんにちは、これはイロドリTTSで作成された音声です。"

Se não houver problemas após ouvir, pressione o botão de download (ícone de seta para baixo) para salvar o arquivo de voz.

O arquivo de voz será salvo no formato WAV.

Com isso, conseguimos sintetizar voz usando o Irodori-TTS.

Como ajustar a voz no Irodori-TTS

No Irodori-TTS, você pode ajustar expressões como gênero e emoção de várias maneiras.

Especificar expressões emocionais com emojis

Ao clicar em "Emoji Palette" abaixo do campo de entrada de texto, você pode selecionar emojis.

Emoji Palette

Cada emoji tem uma expressão emocional atribuída.

  • 😊 Alegremente, parecendo feliz
  • 😭 Soluçando, voz de choro
  • 😰 Com pressa, agitado
  • ⏩ Fala rápida
  • 📖 Narração, monólogo

Basta colocar um emoji no campo de entrada de texto para ler com a expressão emocional especificada.

Exemplo de leitura de "😊 こんにちは、これはイロドリTTSで作成された音声です。"

Exemplo de leitura de "📖 こんにちは、これはイロドリTTSで作成された音声です。"

No entanto, apenas especificando um emoji, não é possível especificar concretamente o gênero ou a idade.

Carregar voz de referência para ler com a mesma voz

No Irodori-TTS, você pode carregar um arquivo de voz de referência para que ele leia usando essa voz como base.

A voz de referência deve ser carregada na área onde está escrito "Solte o áudio aqui - ou - clique para fazer o upload".

Carregar voz de referência

Além de poder ler com a mesma voz, a qualidade do áudio lido será mais nítida em comparação com quando nada é especificado.

Também é possível ajustar o estilo de leitura diretamente com a função de Caption

No Irodori-TTS, você também pode especificar diretamente por texto que tipo de voz deseja para a leitura.

Para usar a função de Caption, é necessário iniciar a "versão VoiceDesign", e o comando para iniciar o Irodori-TTS no terminal muda.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

Iniciar versão VoiceDesign

Ao executar este comando, a tela de operação da versão VoiceDesign será iniciada.

Como a versão VoiceDesign usa um modelo de AI diferente da versão padrão, ao usar pela primeira vez, você precisa clicar em "Load Model" e baixar o modelo separadamente da versão padrão.

O modelo de AI tem cerca de 2GB, por isso recomenda-se baixar em um local com boa conexão de rede.

Na tela de operação da versão VoiceDesign, existe a caixa de texto "Caption / Style Prompt (optional)".

Caption / Style Prompt (optional)

Aqui, insira em texto como você deseja que a voz seja lida.

  • Por favor, leia com uma voz feminina calma, com uma sensação de proximidade, de forma suave e natural.
  • Por favor, fale com uma voz masculina enérgica, de forma alegre e clara.
  • Por favor, leia com uma voz masculina grave, de forma imparcial como um apresentador de notícias.

Dessa forma, você pode especificar que tipo de voz será usada para a leitura.

Por exemplo, ao especificar "Por favor, leia com uma voz feminina calma, com uma sensação de proximidade, de forma suave e natural.", a voz ficou assim:

Exemplo com a especificação "Por favor, leia com uma voz feminina calma, com uma sensação de proximidade, de forma suave e natural."

Aqui também foi possível ler com uma voz nítida e fácil de ouvir.

No entanto, há pontos de atenção na função de Caption.

A função de Caption leva mais tempo para gerar a voz em comparação com outros métodos de leitura.

Desta vez, ao gerar no notebook, levou cerca de 5 minutos para gerar esta frase curta.

Ao usar a função de Caption, recomenda-se um PC de alto desempenho equipado com GPU.

O que acontece ao ler um texto em inglês?

O Irodori-TTS é um software de leitura compatível apenas com o japonês.

Então, o que acontece se tentarmos ler um texto em inglês?

Como teste, inserimos uma frase de exemplo simples.

Exemplo de leitura de "Hello, this is a voice recording created using Irodori-TTS."

Desta forma, o Hello tornou-se "Haro" com pronúncia de katakana, e a parte de recording ficou com uma pronúncia ininteligível, não sendo possível ler corretamente.

Quando quiser ler textos em inglês, recomenda-se usar um serviço de leitura por AI compatível com idiomas estrangeiros.

Método de síntese de voz recomendado quando "a configuração é difícil"

Ao ler até aqui, alguns de vocês podem ter sentido que a configuração do Irodori-TTS parece um pouco trabalhosa.

Se você não está acostumado a operar o terminal, apenas os procedimentos de preparar ferramentas como Python e Git, instalar pacotes e baixar modelos de AI podem levar tempo.

Além disso, se você não possui um PC com GPU, a síntese de uma única voz levará muito tempo, dificultando o uso para fins como narração de vídeos.

Textos longos precisam ser divididos em partes de cerca de 30 segundos cada e a voz deve ser gerada várias vezes.

Para aqueles que desejam criar voz a partir de texto sem instalação ou configuração, apresentaremos a partir daqui um serviço de síntese de voz por AI que pode ser usado no navegador.

"Ondoku": Voz por AI que pode ser usada sem instalação

Ondoku

Para quando você deseja sintetizar voz facilmente com a AI mais recente, o recomendado é o serviço de síntese de voz por AI "Ondoku".

"Ondoku" é um serviço de síntese de voz por AI onde você pode criar voz apenas abrindo o navegador e colando o texto.

Você pode criar vozes gratuitamente agora mesmo em PCs, smartphones e tablets.

Como a geração de voz é feita na nuvem (lado do servidor), não há problema se o seu PC não tiver uma GPU.

Vozes masculinas, femininas, infantis, etc., vários tipos de vozes já estão preparados desde o início, então você pode ler imediatamente apenas escolhendo, sem precisar preparar vozes de referência ou Captions.

Textos longos também podem ser lidos como estão.

Além disso, o Ondoku também suporta inglês!

Ele suporta vários idiomas, como francês, espanhol, coreano, chinês, podendo ser usado para leitura em outros idiomas além do japonês.

Além disso, com a voz de AI de próxima geração (OndokuBeta), você pode experimentar uma leitura ainda mais natural.

Se você está procurando um método para ler texto como voz, por que não experimenta o "Ondoku", que é fácil de usar e gratuito?

Comparação das diferenças entre Ondoku e Irodori-TTS

Por fim, comparamos as principais diferenças entre Ondoku e Irodori-TTS.

👆 Você pode rolar horizontalmente
Item Ondoku Irodori-TTS
Método de operação Nuvem (operação no navegador) Local (processamento no próprio PC)
Configuração Desnecessária Necessária construção de ambiente com Python, Git, etc.
Idiomas suportados Mais de 35 idiomas Apenas japonês
Como escolher a voz Basta escolher entre várias vozes Especificar por clonagem de voz, Caption, emojis
Limite de geração por vez Suporta textos longos Até aproximadamente 30 segundos
Uso comercial Possível (necessário crédito no plano gratuito) Possível (licença MIT)
Dispositivos compatíveis PC, smartphone, tablet PC (GPU recomendada)
Tarifa Possui plano gratuito (número de caracteres expandido em planos pagos) Grátis (devido à operação local)

Comparando, você pode escolher o Ondoku pela facilidade e uso imediato, ou o Irodori-TTS se você possui um PC de alto desempenho e deseja criar vozes detalhadamente.

Para quem deseja voz agora, quem precisa de leitura em vários idiomas, ou quem deseja usar em smartphone ou tablet, o Ondoku é o recomendado.

Também é indicado para quem deseja ler textos longos como estão, quem não quer gastar tempo com configuração, ou quem não possui GPU no PC.

Como você pode gerar vozes de alta qualidade imediatamente apenas abrindo o navegador, que tal começar usando o Ondoku gratuitamente?

Resumo das características, configuração e como usar o Irodori-TTS

Neste artigo, explicamos sobre o Irodori-TTS, um software de síntese de voz por AI com operação local especializado em japonês.

O Irodori-TTS é uma ferramenta atraente para quem deseja se dedicar à expressão vocal, como design de qualidade de voz via clonagem ou Captions, e controle emocional via emojis.

No entanto, o método de configuração e o uso são voltados para usuários avançados, exigindo a construção de um ambiente com Python e Git para a configuração.

Além disso, em PCs sem GPU, a geração de voz leva tempo.

Para aqueles que "querem usar a síntese de voz de forma fácil e agora mesmo", o recomendado é o "Ondoku", que pode ser usado apenas com o navegador.

Por que você também não cria vozes de alta qualidade com a síntese de voz por AI gratuita e fácil de usar?

■ Software de síntese de voz AI “Ondoku”

"Ondoku" é uma ferramenta online de conversão de texto em fala que pode ser usada sem custo inicial.

  • Suporta aproximadamente 50 idiomas, incluindo japonês, inglês, chinês, coreano, espanhol, francês e alemão.
  • Disponível para PC e smartphone
  • Adequado para negócios, educação, entretenimento, etc.
  • Não requer instalação, pode ser usado imediatamente no seu navegador
  • Também suporta leitura de imagens

Para utilizá-lo, basta inserir um texto ou fazer upload de um arquivo do site. Gere arquivos de som naturais em segundos. Você pode usar síntese de voz para até 5.000 caracteres gratuitamente, então experimente primeiro.

O software de conversão de texto em fala "Ondoku" pode ler 5.000 caracteres todos os meses com voz AI gratuitamente. Você pode facilmente baixar MP3s e o uso comercial também é possível. Se você se inscrever gratuitamente, poderá converter até 5.000 caracteres por mês gratuitamente de texto em fala. Experimente o Ondoku agora.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Artigo relacionado

Software de leitura de texto Ondoku. É um serviço de conversão de texto em voz que não requer instalação e pode ser usado por qualquer pessoa gratuitamente. Se você se registrar gratuitamente, poderá obter até 5.000 caracteres gratuitamente por mês. Registe-se agora gratuitamente