Hva er Irodori-TTS? Funksjoner og bruk forklart på en enkel måte

28. juli 2026

Hva er Irodori-TTS? Funksjoner og bruk forklart på en enkel måte


hund

Hva slags AI-opplesningsprogramvare er Irodori-TTS?

Det er sikkert mange som er nysgjerrige på den nye AI-opplesningsprogramvaren «Irodori-TTS».

I denne artikkelen vil vi forklare kjennetegnene, hva man kan gjøre, ting å være oppmerksom på og hvordan man bruker Irodori-TTS på en lettfattelig måte.

I tillegg, for de som føler at «oppsettet virker vanskelig», introduserer vi også en talesyntesemetode som kan brukes med en gang uten installasjon.

Dette vil du lære i denne artikkelen

  1. Hva slags programvare er Irodori-TTS?
  2. Hva du kan gjøre med Irodori-TTS og ting å være oppmerksom på
  3. Hvordan bruke Irodori-TTS (fra oppsett til lydjustering)
  4. Anbefalt metode når miljøoppsettet er vanskelig

Hva er Irodori-TTS? Forklaring av japansk AI-talesynteseprogramvare

Hva er Irodori-TTS? Forklaring av japansk AI-talesynteseprogramvare

Først vil vi gi en enkel forklaring på hva slags AI-talesynteseprogramvare Irodori-TTS er og dens kjennetegn.

Irodori-TTS er en AI-talesyntesemodell som kjører lokalt

Irodori-TTS er en AI-talesynteseprogramvare spesialisert for det japanske språket.

Utvikleren er Aratako, og den er utgitt gratis som åpen kildekode (MIT-lisens).

Det største kjennetegnet er at den støtter «lokal kjøring», der talesyntesen fullføres kun på din egen PC.

Siden hele prosessen med å generere tale skjer på din lokale PC, blir tekst eller genererte lyddata aldri sendt til eksterne servere.

Etter det første oppsettet kan du generere tale uten internettforbindelse, og det er ingen begrensning på antall genereringer.

Vær imidlertid oppmerksom på at oppsettet krever verktøy for programmering som Python og Git.

For rask operasjon anbefales det også en høyspesifisert PC utstyrt med GPU (grafikkort).

Hva Irodori-TTS kan og ikke kan gjøre

Hva Irodori-TTS kan og ikke kan gjøre

Neste punkt er en forklaring på hva du kan og ikke kan gjøre med Irodori-TTS.

Hva du kan gjøre med Irodori-TTS

Siden Irodori-TTS kjører i et lokalt miljø, kan du generere tale ubegrenset antall ganger.

Selv i miljøer uten internettforbindelse kan du fritt lage tale når det første oppsettet er ferdig.

Det finnes flere metoder for å instruere hva slags tale som skal lages, og ved å bruke bildetekstfunksjonen (caption) kan du skape din foretrukne stemmekvalitet kun ved hjelp av tekstinstruksjoner.

Det er også mulig å gjenskape eksisterende stemmer med stemmekloning eller legge til følelsesuttrykk ved hjelp av emoji.

Siden den har MIT-lisens, er det også mulig med kommersiell bruk av den genererte talen.

Ting å være oppmerksom på med Irodori-TTS

På den andre siden er det noen punkter du bør kjenne til før du bruker Irodori-TTS.

Talen som kan opprettes om gangen er begrenset til ca. 30 sekunder

I én enkelt generering kan den lese opp i inntil ca. 30 sekunder.

Hvis du vil lese opp en lang tekst, må du dele opp teksten og generere den i flere omganger.

Det er vanskelig å få stemmen eller måten å snakke på nøyaktig slik du ønsker

Fordi Irodori-TTS har høy grad av frihet, er det ingen forhåndsdefinerte standardstemmer (basestemmer).

Derfor vil kjønn og alder endre seg tilfeldig hver gang du genererer, med mindre du spesifiserer bildetekster eller referanselyd.

Når du vil lese opp med samme stemme, må du laste inn en referanselyd.

I tillegg finnes det ingen funksjon for å manuelt justere trykk eller intonasjon.

Støttet språk er kun japansk

Det støttede språket er kun japansk, og den støtter ikke fremmedspråk som engelsk.

Vær også oppmerksom på at det kan forekomme feillesing av kanji.

Høyspesifisert PC med GPU anbefales

Avhengig av PC-spesifikasjonene kan det ta tid å generere tale.

På en PC uten GPU kan det ta rundt ett minutt å generere selv en kort tekst.

For prosessorer i startklassen, som Celeron eller N100, føles det vanskelig å bruke programvaren i praksis.

Hvordan bruke Irodori-TTS (gjennomgang av oppsett)

Herfra vil vi gi en enkel forklaring på hvordan man bruker Irodori-TTS.

Hele prosessen for oppsettet er som følger:

  1. Installer nødvendig programvare
  2. Opprett en arbeidsmappe
  3. Klone Irodori-TTS fra GitHub
  4. Installer nødvendige pakker
  5. Start Irodori-TTS
  6. Last inn AI-modell
  7. Les opp tekst

1. Installer nødvendig programvare for Irodori-TTS

For å sette opp Irodori-TTS kreves det noen forberedelser.

Først må du installere disse tre typene:

  • Python 3.10 eller høyere: Programmeringsspråk
  • Git: Versjonskontrollsystem (nødvendig for å laste ned Irodori-TTS)
  • uv: Pakkebehandler for Python

For å installere Python, Git og uv, høyreklikker du først på startmenyen og klikker på «Terminal» (du trenger ikke å starte som administrator).

Klikk på «Terminal»

Da åpnes terminalvinduet (PowerShell).

Terminal (PowerShell)

Skriv inn følgende kommandoer i dette vinduet og kjør dem:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Kommando utføres

Nå har du installert det som er nødvendig for å sette opp Irodori-TTS.

*Python administreres av uv, så det blir automatisk installert under oppsettet.

Etter installasjonen må du lukke terminalen (PowerShell) og åpne den på nytt (for å «legge til i PATH»).

2. Opprett en arbeidsmappe

Deretter oppretter du en arbeidsmappe.

Det er her Irodori-TTS vil bli installert.

I dette eksempelet har vi opprettet en mappe med navnet «irodori-tts» direkte under C-stasjonen.

Opprett arbeidsmappe

Når mappen er opprettet, flytter du deg til den mappen i terminalen.

cd C:\irodori-tts

Flytt til arbeidsmappe

3. Klone Irodori-TTS fra GitHub

Skriv inn følgende kommando i terminalen for å klone Irodori-TTS-repositoriet fra GitHub.

git clone https://github.com/Aratako/Irodori-TTS.git

Klone repositorium fra GitHub

Kloningen av repositoriet tar bare noen få sekunder.

Skriv inn neste kommando for å gå inn i den klonede mappen.

cd Irodori-TTS

Gå inn i mappen

4. Installer nødvendige pakker

Skriv inn og kjør følgende kommando for å installere pakkene som trengs for å kjøre Irodori-TTS.

uv sync

Installer pakker

Dette vil ta litt tid da et stort antall pakker må lastes ned og installeres.

Skjermbilde under pakkeinstallasjon

Selve Python-installasjonen skjer også her.

Vent mens nedlasting og installasjon pågår uten å lukke terminalvinduet.

Siden filer på nesten 3 GB skal lastes ned, anbefales det å gjøre oppsettet på et sted med god internettforbindelse.

5. Start Irodori-TTS

Når nedlasting og installasjon av pakker er ferdig, er oppsettet fullført.

Start Irodori-TTS.

Skriv inn følgende kommando, kjør den, og vent litt til den starter.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Når følgende vises i terminalen, er oppstarten ferdig:

Skjermbilde etter fullført oppstart

Running on local URL: http://0.0.0.0:7860

Åpne en nettleser og gå til http://localhost:7860.

Nå åpnes brukergrensesnittet (WebUI) for Irodori-TTS.

Irodori-TTS WebUI

6. Last inn AI-modell

Klikk på «Load Model» for å laste inn AI-modellen som skal brukes til tekstopplesning.

Load Model

Første gang du bruker denne knappen, starter nedlastingen av AI-modellen.

Når en bekreftelsesmelding vises under Model Status (markert med rødt i bildet under), er AI-modellen ferdig innlastet.

Model Status

7. Les opp tekst med Irodori-TTS

I Irodori-TTS kan du gi instruksjoner om hvordan teksten skal leses opp, inkludert følelsesuttrykk, men la oss først prøve å lese opp uten instruksjoner som et eksempel.

Rull ned til tekstfeltet og skriv inn teksten du vil lese opp.

Skriv inn tekst

I dette tilfellet prøver vi å lese opp «こんにちは、これはイロドリTTSで作成された音声です。」 (Hei, dette er en stemme laget med Irodori-TTS).

(Siden den ikke leste korrekt når «Irodori-TTS» ble skrevet med latinske bokstaver, skrev jeg det med katakana som «イロドリTTS»).

Klikk på «Generate»-knappen for å starte genereringen av lyden.

Start generering

Irodori-TTS bruker din lokale PCs CPU eller GPU (grafikkort) for å generere lyden.

Derfor vil tiden det tar å generere variere stort avhengig av PC-ens ytelse.

Siden dette ble generert på en bærbar PC uten GPU denne gangen, tok det ca. ett minutt for denne korte setningen.

Referanse: Testgenerering ble utført i et miljø med CPU: Ryzen 5 4650U, RAM: 32GB DDR4, Windows 11 Pro 24H2.

Når genereringen er ferdig, vises lydbølgen og du kan spille av lyden.

Generering ferdig

Eksempel på opplesning av «こんにちは、これはイロドリTTSで作成された音声です。»

Hvis du er fornøyd etter å ha lyttet, klikker du på nedlastingsknappen (ikonet med pil ned) for å lagre lydfilen.

Lydfilen lagres i WAV-format.

Nå har du lyktes i å syntetisere tale ved hjelp av Irodori-TTS.

Hvordan justere lyden i Irodori-TTS

I Irodori-TTS kan du justere uttrykk som kjønn og følelser på ulike måter.

Angi følelsesuttrykk med emoji

Klikk på «Emoji Palette» under tekstfeltet for å velge emojier.

Emoji Palette

Hver emoji er tildelt et bestemt følelsesuttrykk.

  • 😊 Muntert, glad
  • 😭 Snufsing, gråt
  • 😰 I hastverk, opprørt
  • ⏩ Rask tale
  • 📖 Narrasjon, monolog

Ved å sette inn en emoji i tekstfeltet kan du lese opp med det spesifiserte følelsesuttrykket.

Eksempel på opplesning av «😊 こんにちは、これはイロドリTTSで作成された音声です。»

Eksempel på opplesning av «📖 こんにちは、これはイロドリTTSで作成された音声です。»

Vær imidlertid oppmerksom på at du ikke kan spesifisere kjønn eller alder konkret kun ved å bruke emoji.

Last inn referanselyd for å lese opp med samme stemme

I Irodori-TTS kan du laste inn en referanselydfil og la programvaren lese opp med den stemmen som referanse.

Referanselyden lastes inn der det står «音声をここにドロップ - または - クリックしてアップロード» (Slipp lyd her - eller - klikk for å laste opp).

Last inn referanselyd

I tillegg til å kunne lese opp med samme stemme, kan du få en klarere lydkvalitet sammenlignet med når ingenting er spesifisert.

Mulig å justere opplesningsstilen direkte med bildetekstfunksjonen (caption)

I Irodori-TTS kan du også spesifisere direkte med tekst hva slags stemme som skal brukes.

For å bruke bildetekstfunksjonen må du starte «VoiceDesign-versjonen», og kommandoen for å starte Irodori-TTS i terminalen endres.

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

Start VoiceDesign-versjonen

Når denne kommandoen kjøres, starter kontrollskjermen for VoiceDesign-versjonen.

Siden VoiceDesign-versjonen bruker en annen AI-modell enn standardversjonen, må du klikke på «Load Model» og laste ned modellen separat fra standardversjonen første gang du bruker den.

AI-modellen er på ca. 2 GB, så det anbefales å laste den ned på et sted med god internettforbindelse.

I VoiceDesign-skjermen finnes det et tekstfelt for «Caption / Style Prompt (optional)».

Caption / Style Prompt (optional)

Her skriver du inn en beskrivelse av hvordan du vil at stemmen skal høres ut.

  • Les opp med en rolig kvinnestemme, med en nær og myk, naturlig følelse.
  • Snakk med en munter mannsstemme, lyst og tydelig.
  • Les opp med en dyp mannsstemme, monotont som en nyhetsanker.

På denne måten kan du spesifisere stemmen.

For eksempel, hvis man spesifiserer «落ち着いた女性の声で、近い距離感でやわらかく自然に読み上げてください。» (Les opp med en rolig kvinnestemme, med en nær og myk, naturlig følelse), ble resultatet slik:

Eksempel med spesifisert bildetekst

Her ble det også generert en lettfattelig stemme med klar lydkvalitet.

Men vær oppmerksom på ett poeng med bildetekstfunksjonen.

Bildetekstfunksjonen tar lengre tid å generere lyd enn andre opplesningsmetoder.

Da jeg genererte på en bærbar PC denne gangen, tok det ca. 5 minutter å generere denne korte setningen.

Hvis du skal bruke bildetekstfunksjonen, anbefales en høyspesifisert PC med GPU.

Hva skjer hvis du leser opp engelsk tekst?

Irodori-TTS er en programvare som kun støtter japansk.

Så, hva skjer hvis vi prøver å lese opp engelsk tekst?

La oss prøve å skrive inn en enkel eksempelsetning.

Eksempel på opplesning av «Hello, this is a voice recording created using Irodori-TTS.»

Som du kan høre, ble «Hello» uttalt som «haroo» med katakana-aksent, og «recording» ble uforståelig. Den klarte ikke å lese det opp korrekt.

Hvis du vil lese opp engelsk tekst, anbefales det å bruke en AI-tjeneste som støtter fremmedspråk.

Anbefalt talesyntesemetode når «oppsettet er vanskelig»

Etter å ha lest så langt, føler kanskje noen at oppsettet av Irodori-TTS virker litt krevende.

Hvis du ikke er vant til terminaloperasjoner, kan bare det å forberede verktøy som Python og Git, installere pakker og laste ned AI-modeller ta mye tid.

I tillegg, hvis du ikke har en PC med GPU, tar hver talesyntese så lang tid at det er vanskelig å bruke til formål som videonarrasjon.

Lange tekster må deles opp i bolker på ca. 30 sekunder og genereres mange ganger.

For de som ønsker å lage tale fra tekst uten installasjon eller oppsett, vil vi herfra introdusere en AI-talesyntesetjeneste som kan brukes i nettleseren.

«Ondoku» – AI-stemme som kan brukes uten installasjon

Ondoku

Når du vil utføre enkel talesyntese med den nyeste AI-teknologien, anbefales AI-talesyntesetjenesten «Ondoku».

«Ondoku» er en AI-talesyntesetjeneste der du bare trenger å åpne nettleseren og lime inn tekst for å lage tale.

Du kan lage tale gratis med en gang på PC, smarttelefon eller nettbrett.

Siden genereringen av lyden skjer i skyen (på serversiden), er det ikke noe problem om PC-en din ikke har GPU.

Siden flere stemmer som herrestemmer, damestemmer og barnestemmer er tilgjengelige fra start, trenger du ikke å forberede referanselyd eller bildetekster; du bare velger og leser opp med en gang.

Lange tekster kan også leses opp som de er.

Dessuten støtter Ondoku også engelsk!

Den støtter mange språk som fransk, spansk, koreansk og kinesisk, så den kan også brukes til opplesning på andre språk enn japansk.

I tillegg kan du oppleve enda mer naturlig opplesning med neste generasjons AI-stemme (OndokuBeta).

Hvis du leter etter en måte å lese opp tekst som tale på, hvorfor ikke prøve «Ondoku», som er gratis og enkel å bruke?

Sammenligning av forskjeller mellom Ondoku og Irodori-TTS

Til slutt sammenligner vi de viktigste forskjellene mellom Ondoku og Irodori-TTS.

👆 Du kan rulle horisontalt
Element Ondoku Irodori-TTS
Driftsmåte Sky (opereres i nettleser) Lokal (behandles på egen PC)
Oppsett Ikke nødvendig Krever miljøoppsett som Python/Git
Støttede språk Over 35 språk Kun japansk
Hvordan velge stemme Velg blant flere stemmer Spesifiser med stemmekloning/bildetekst/emoji
Grense per generering Støtter lang tekst Inntil ca. 30 sekunder
Kommersiell bruk Mulig (krever kreditering ved gratis bruk) Mulig (MIT-lisens)
Støttede enheter PC, mobil, nettbrett PC (GPU anbefales)
Pris Gratisplan finnes (betalingsplaner for flere tegn) Gratis (siden den kjører lokalt)

Ved sammenligning kan man se at Ondoku egner seg for enkelhet og umiddelbar bruk, mens Irodori-TTS er for de som har en kraftig PC og ønsker å finjustere stemmen i detalj.

For de som trenger tale med en gang, de som trenger opplesning på flere språk, eller de som vil bruke mobil eller nettbrett, anbefales Ondoku.

Den passer også for de som vil lese opp lange tekster direkte, de som ikke vil bruke tid på oppsett, eller de som ikke har en PC med GPU.

Siden du kan generere høykvalitets tale bare ved å åpne nettleseren, hvorfor ikke prøve Ondoku gratis i dag?

Oppsummering av Irodori-TTS kjennetegn, oppsett og bruk

I denne artikkelen har vi forklart om Irodori-TTS, en AI-talesynteseprogramvare for lokal kjøring spesialisert på japansk.

Irodori-TTS er et attraktivt verktøy for de som ønsker å være nøye med stemmeuttrykk, med funksjoner som stemmekloning, stemmedesign via bildetekst og følelseskontroll med emoji.

Vær imidlertid oppmerksom på at oppsettsmetoden og bruken er for avanserte brukere, og krever miljøoppsett av Python og Git.

I tillegg tar generering av tale tid på en PC uten GPU.

For de som vil bruke talesyntese enkelt og med en gang, anbefales «Ondoku», som kan brukes kun med en nettleser.

Hvorfor ikke prøve å skape tale av høy kvalitet med en gratis og lettfattelig AI-talesyntese?

■ AI talesyntese programvare «Ondoku»

"Ondoku" er et online tekst-til-tale-verktøy som kan brukes uten innledende kostnad.

  • Støtter omtrent 50 språk, inkludert japansk, engelsk, kinesisk, koreansk, spansk, fransk og tysk.
  • Tilgjengelig fra både PC og smarttelefon
  • Egnet for forretninger, utdanning, underholdning, etc.
  • Ingen installasjon nødvendig, kan brukes umiddelbart fra nettleseren din
  • Støtter også lesing fra bilder

For å bruke den, skriv inn tekst eller last opp en fil fra nettstedet. Generer naturlige lydfiler på sekunder. Du kan bruke talesyntese for opptil 5000 tegn gratis, så prøv det først.

Tekst-til-tale-programvaren "Ondoku" kan lese opp 5000 tegn hver måned med AI-stemme gratis. Du kan enkelt laste ned MP3-er og kommersiell bruk er også mulig. Hvis du registrerer deg gratis, kan du konvertere opptil 5000 tegn per måned gratis fra tekst til tale. Prøv Ondoku nå.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Relatert artikkel