Hva er Irodori-TTS? Funksjoner og bruk forklart på en enkel måte
28. juli 2026
Hva slags AI-opplesningsprogramvare er Irodori-TTS?
Det er sikkert mange som er nysgjerrige på den nye AI-opplesningsprogramvaren «Irodori-TTS».
I denne artikkelen vil vi forklare kjennetegnene, hva man kan gjøre, ting å være oppmerksom på og hvordan man bruker Irodori-TTS på en lettfattelig måte.
I tillegg, for de som føler at «oppsettet virker vanskelig», introduserer vi også en talesyntesemetode som kan brukes med en gang uten installasjon.
Dette vil du lære i denne artikkelen
- Hva slags programvare er Irodori-TTS?
- Hva du kan gjøre med Irodori-TTS og ting å være oppmerksom på
- Hvordan bruke Irodori-TTS (fra oppsett til lydjustering)
- Anbefalt metode når miljøoppsettet er vanskelig
Hva er Irodori-TTS? Forklaring av japansk AI-talesynteseprogramvare
Først vil vi gi en enkel forklaring på hva slags AI-talesynteseprogramvare Irodori-TTS er og dens kjennetegn.
Irodori-TTS er en AI-talesyntesemodell som kjører lokalt
Irodori-TTS er en AI-talesynteseprogramvare spesialisert for det japanske språket.
Utvikleren er Aratako, og den er utgitt gratis som åpen kildekode (MIT-lisens).
Det største kjennetegnet er at den støtter «lokal kjøring», der talesyntesen fullføres kun på din egen PC.
Siden hele prosessen med å generere tale skjer på din lokale PC, blir tekst eller genererte lyddata aldri sendt til eksterne servere.
Etter det første oppsettet kan du generere tale uten internettforbindelse, og det er ingen begrensning på antall genereringer.
Vær imidlertid oppmerksom på at oppsettet krever verktøy for programmering som Python og Git.
For rask operasjon anbefales det også en høyspesifisert PC utstyrt med GPU (grafikkort).
Hva Irodori-TTS kan og ikke kan gjøre
Neste punkt er en forklaring på hva du kan og ikke kan gjøre med Irodori-TTS.
Hva du kan gjøre med Irodori-TTS
Siden Irodori-TTS kjører i et lokalt miljø, kan du generere tale ubegrenset antall ganger.
Selv i miljøer uten internettforbindelse kan du fritt lage tale når det første oppsettet er ferdig.
Det finnes flere metoder for å instruere hva slags tale som skal lages, og ved å bruke bildetekstfunksjonen (caption) kan du skape din foretrukne stemmekvalitet kun ved hjelp av tekstinstruksjoner.
Det er også mulig å gjenskape eksisterende stemmer med stemmekloning eller legge til følelsesuttrykk ved hjelp av emoji.
Siden den har MIT-lisens, er det også mulig med kommersiell bruk av den genererte talen.
Ting å være oppmerksom på med Irodori-TTS
På den andre siden er det noen punkter du bør kjenne til før du bruker Irodori-TTS.
Talen som kan opprettes om gangen er begrenset til ca. 30 sekunder
I én enkelt generering kan den lese opp i inntil ca. 30 sekunder.
Hvis du vil lese opp en lang tekst, må du dele opp teksten og generere den i flere omganger.
Det er vanskelig å få stemmen eller måten å snakke på nøyaktig slik du ønsker
Fordi Irodori-TTS har høy grad av frihet, er det ingen forhåndsdefinerte standardstemmer (basestemmer).
Derfor vil kjønn og alder endre seg tilfeldig hver gang du genererer, med mindre du spesifiserer bildetekster eller referanselyd.
Når du vil lese opp med samme stemme, må du laste inn en referanselyd.
I tillegg finnes det ingen funksjon for å manuelt justere trykk eller intonasjon.
Støttet språk er kun japansk
Det støttede språket er kun japansk, og den støtter ikke fremmedspråk som engelsk.
Vær også oppmerksom på at det kan forekomme feillesing av kanji.
Høyspesifisert PC med GPU anbefales
Avhengig av PC-spesifikasjonene kan det ta tid å generere tale.
På en PC uten GPU kan det ta rundt ett minutt å generere selv en kort tekst.
For prosessorer i startklassen, som Celeron eller N100, føles det vanskelig å bruke programvaren i praksis.
Hvordan bruke Irodori-TTS (gjennomgang av oppsett)
Herfra vil vi gi en enkel forklaring på hvordan man bruker Irodori-TTS.
Hele prosessen for oppsettet er som følger:
- Installer nødvendig programvare
- Opprett en arbeidsmappe
- Klone Irodori-TTS fra GitHub
- Installer nødvendige pakker
- Start Irodori-TTS
- Last inn AI-modell
- Les opp tekst
1. Installer nødvendig programvare for Irodori-TTS
For å sette opp Irodori-TTS kreves det noen forberedelser.
Først må du installere disse tre typene:
- Python 3.10 eller høyere: Programmeringsspråk
- Git: Versjonskontrollsystem (nødvendig for å laste ned Irodori-TTS)
- uv: Pakkebehandler for Python
For å installere Python, Git og uv, høyreklikker du først på startmenyen og klikker på «Terminal» (du trenger ikke å starte som administrator).
Da åpnes terminalvinduet (PowerShell).
Skriv inn følgende kommandoer i dette vinduet og kjør dem:
winget install --id Git.Git -e
winget install --id=astral-sh.uv -e
Nå har du installert det som er nødvendig for å sette opp Irodori-TTS.
*Python administreres av uv, så det blir automatisk installert under oppsettet.
Etter installasjonen må du lukke terminalen (PowerShell) og åpne den på nytt (for å «legge til i PATH»).
2. Opprett en arbeidsmappe
Deretter oppretter du en arbeidsmappe.
Det er her Irodori-TTS vil bli installert.
I dette eksempelet har vi opprettet en mappe med navnet «irodori-tts» direkte under C-stasjonen.
Når mappen er opprettet, flytter du deg til den mappen i terminalen.
cd C:\irodori-tts
3. Klone Irodori-TTS fra GitHub
Skriv inn følgende kommando i terminalen for å klone Irodori-TTS-repositoriet fra GitHub.
git clone https://github.com/Aratako/Irodori-TTS.git
Kloningen av repositoriet tar bare noen få sekunder.
Skriv inn neste kommando for å gå inn i den klonede mappen.
cd Irodori-TTS
4. Installer nødvendige pakker
Skriv inn og kjør følgende kommando for å installere pakkene som trengs for å kjøre Irodori-TTS.
uv sync
Dette vil ta litt tid da et stort antall pakker må lastes ned og installeres.
Selve Python-installasjonen skjer også her.
Vent mens nedlasting og installasjon pågår uten å lukke terminalvinduet.
Siden filer på nesten 3 GB skal lastes ned, anbefales det å gjøre oppsettet på et sted med god internettforbindelse.
5. Start Irodori-TTS
Når nedlasting og installasjon av pakker er ferdig, er oppsettet fullført.
Start Irodori-TTS.
Skriv inn følgende kommando, kjør den, og vent litt til den starter.
uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860
Når følgende vises i terminalen, er oppstarten ferdig:
Running on local URL: http://0.0.0.0:7860
Åpne en nettleser og gå til http://localhost:7860.
Nå åpnes brukergrensesnittet (WebUI) for Irodori-TTS.
6. Last inn AI-modell
Klikk på «Load Model» for å laste inn AI-modellen som skal brukes til tekstopplesning.
Første gang du bruker denne knappen, starter nedlastingen av AI-modellen.
Når en bekreftelsesmelding vises under Model Status (markert med rødt i bildet under), er AI-modellen ferdig innlastet.
7. Les opp tekst med Irodori-TTS
I Irodori-TTS kan du gi instruksjoner om hvordan teksten skal leses opp, inkludert følelsesuttrykk, men la oss først prøve å lese opp uten instruksjoner som et eksempel.
Rull ned til tekstfeltet og skriv inn teksten du vil lese opp.
I dette tilfellet prøver vi å lese opp «こんにちは、これはイロドリTTSで作成された音声です。」 (Hei, dette er en stemme laget med Irodori-TTS).
(Siden den ikke leste korrekt når «Irodori-TTS» ble skrevet med latinske bokstaver, skrev jeg det med katakana som «イロドリTTS»).
Klikk på «Generate»-knappen for å starte genereringen av lyden.
Irodori-TTS bruker din lokale PCs CPU eller GPU (grafikkort) for å generere lyden.
Derfor vil tiden det tar å generere variere stort avhengig av PC-ens ytelse.
Siden dette ble generert på en bærbar PC uten GPU denne gangen, tok det ca. ett minutt for denne korte setningen.
Referanse: Testgenerering ble utført i et miljø med CPU: Ryzen 5 4650U, RAM: 32GB DDR4, Windows 11 Pro 24H2.
Når genereringen er ferdig, vises lydbølgen og du kan spille av lyden.
Eksempel på opplesning av «こんにちは、これはイロドリTTSで作成された音声です。»
Hvis du er fornøyd etter å ha lyttet, klikker du på nedlastingsknappen (ikonet med pil ned) for å lagre lydfilen.
Lydfilen lagres i WAV-format.
Nå har du lyktes i å syntetisere tale ved hjelp av Irodori-TTS.
Hvordan justere lyden i Irodori-TTS
I Irodori-TTS kan du justere uttrykk som kjønn og følelser på ulike måter.
Angi følelsesuttrykk med emoji
Klikk på «Emoji Palette» under tekstfeltet for å velge emojier.
Hver emoji er tildelt et bestemt følelsesuttrykk.
- 😊 Muntert, glad
- 😭 Snufsing, gråt
- 😰 I hastverk, opprørt
- ⏩ Rask tale
- 📖 Narrasjon, monolog
Ved å sette inn en emoji i tekstfeltet kan du lese opp med det spesifiserte følelsesuttrykket.
Eksempel på opplesning av «😊 こんにちは、これはイロドリTTSで作成された音声です。»
Eksempel på opplesning av «📖 こんにちは、これはイロドリTTSで作成された音声です。»
Vær imidlertid oppmerksom på at du ikke kan spesifisere kjønn eller alder konkret kun ved å bruke emoji.
Last inn referanselyd for å lese opp med samme stemme
I Irodori-TTS kan du laste inn en referanselydfil og la programvaren lese opp med den stemmen som referanse.
Referanselyden lastes inn der det står «音声をここにドロップ - または - クリックしてアップロード» (Slipp lyd her - eller - klikk for å laste opp).
I tillegg til å kunne lese opp med samme stemme, kan du få en klarere lydkvalitet sammenlignet med når ingenting er spesifisert.
Mulig å justere opplesningsstilen direkte med bildetekstfunksjonen (caption)
I Irodori-TTS kan du også spesifisere direkte med tekst hva slags stemme som skal brukes.
For å bruke bildetekstfunksjonen må du starte «VoiceDesign-versjonen», og kommandoen for å starte Irodori-TTS i terminalen endres.
uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861
Når denne kommandoen kjøres, starter kontrollskjermen for VoiceDesign-versjonen.
Siden VoiceDesign-versjonen bruker en annen AI-modell enn standardversjonen, må du klikke på «Load Model» og laste ned modellen separat fra standardversjonen første gang du bruker den.
AI-modellen er på ca. 2 GB, så det anbefales å laste den ned på et sted med god internettforbindelse.
I VoiceDesign-skjermen finnes det et tekstfelt for «Caption / Style Prompt (optional)».
Her skriver du inn en beskrivelse av hvordan du vil at stemmen skal høres ut.
- Les opp med en rolig kvinnestemme, med en nær og myk, naturlig følelse.
- Snakk med en munter mannsstemme, lyst og tydelig.
- Les opp med en dyp mannsstemme, monotont som en nyhetsanker.
På denne måten kan du spesifisere stemmen.
For eksempel, hvis man spesifiserer «落ち着いた女性の声で、近い距離感でやわらかく自然に読み上げてください。» (Les opp med en rolig kvinnestemme, med en nær og myk, naturlig følelse), ble resultatet slik:
Eksempel med spesifisert bildetekst
Her ble det også generert en lettfattelig stemme med klar lydkvalitet.
Men vær oppmerksom på ett poeng med bildetekstfunksjonen.
Bildetekstfunksjonen tar lengre tid å generere lyd enn andre opplesningsmetoder.
Da jeg genererte på en bærbar PC denne gangen, tok det ca. 5 minutter å generere denne korte setningen.
Hvis du skal bruke bildetekstfunksjonen, anbefales en høyspesifisert PC med GPU.
Hva skjer hvis du leser opp engelsk tekst?
Irodori-TTS er en programvare som kun støtter japansk.
Så, hva skjer hvis vi prøver å lese opp engelsk tekst?
La oss prøve å skrive inn en enkel eksempelsetning.
Eksempel på opplesning av «Hello, this is a voice recording created using Irodori-TTS.»
Som du kan høre, ble «Hello» uttalt som «haroo» med katakana-aksent, og «recording» ble uforståelig. Den klarte ikke å lese det opp korrekt.
Hvis du vil lese opp engelsk tekst, anbefales det å bruke en AI-tjeneste som støtter fremmedspråk.
Anbefalt talesyntesemetode når «oppsettet er vanskelig»
Etter å ha lest så langt, føler kanskje noen at oppsettet av Irodori-TTS virker litt krevende.
Hvis du ikke er vant til terminaloperasjoner, kan bare det å forberede verktøy som Python og Git, installere pakker og laste ned AI-modeller ta mye tid.
I tillegg, hvis du ikke har en PC med GPU, tar hver talesyntese så lang tid at det er vanskelig å bruke til formål som videonarrasjon.
Lange tekster må deles opp i bolker på ca. 30 sekunder og genereres mange ganger.
For de som ønsker å lage tale fra tekst uten installasjon eller oppsett, vil vi herfra introdusere en AI-talesyntesetjeneste som kan brukes i nettleseren.
«Ondoku» – AI-stemme som kan brukes uten installasjon
Når du vil utføre enkel talesyntese med den nyeste AI-teknologien, anbefales AI-talesyntesetjenesten «Ondoku».
«Ondoku» er en AI-talesyntesetjeneste der du bare trenger å åpne nettleseren og lime inn tekst for å lage tale.
Du kan lage tale gratis med en gang på PC, smarttelefon eller nettbrett.
Siden genereringen av lyden skjer i skyen (på serversiden), er det ikke noe problem om PC-en din ikke har GPU.
Siden flere stemmer som herrestemmer, damestemmer og barnestemmer er tilgjengelige fra start, trenger du ikke å forberede referanselyd eller bildetekster; du bare velger og leser opp med en gang.
Lange tekster kan også leses opp som de er.
Dessuten støtter Ondoku også engelsk!
Den støtter mange språk som fransk, spansk, koreansk og kinesisk, så den kan også brukes til opplesning på andre språk enn japansk.
I tillegg kan du oppleve enda mer naturlig opplesning med neste generasjons AI-stemme (OndokuBeta).
Hvis du leter etter en måte å lese opp tekst som tale på, hvorfor ikke prøve «Ondoku», som er gratis og enkel å bruke?
Sammenligning av forskjeller mellom Ondoku og Irodori-TTS
Til slutt sammenligner vi de viktigste forskjellene mellom Ondoku og Irodori-TTS.
| Element | Ondoku | Irodori-TTS |
|---|---|---|
| Driftsmåte | Sky (opereres i nettleser) | Lokal (behandles på egen PC) |
| Oppsett | Ikke nødvendig | Krever miljøoppsett som Python/Git |
| Støttede språk | Over 35 språk | Kun japansk |
| Hvordan velge stemme | Velg blant flere stemmer | Spesifiser med stemmekloning/bildetekst/emoji |
| Grense per generering | Støtter lang tekst | Inntil ca. 30 sekunder |
| Kommersiell bruk | Mulig (krever kreditering ved gratis bruk) | Mulig (MIT-lisens) |
| Støttede enheter | PC, mobil, nettbrett | PC (GPU anbefales) |
| Pris | Gratisplan finnes (betalingsplaner for flere tegn) | Gratis (siden den kjører lokalt) |
Ved sammenligning kan man se at Ondoku egner seg for enkelhet og umiddelbar bruk, mens Irodori-TTS er for de som har en kraftig PC og ønsker å finjustere stemmen i detalj.
For de som trenger tale med en gang, de som trenger opplesning på flere språk, eller de som vil bruke mobil eller nettbrett, anbefales Ondoku.
Den passer også for de som vil lese opp lange tekster direkte, de som ikke vil bruke tid på oppsett, eller de som ikke har en PC med GPU.
Siden du kan generere høykvalitets tale bare ved å åpne nettleseren, hvorfor ikke prøve Ondoku gratis i dag?
Oppsummering av Irodori-TTS kjennetegn, oppsett og bruk
I denne artikkelen har vi forklart om Irodori-TTS, en AI-talesynteseprogramvare for lokal kjøring spesialisert på japansk.
Irodori-TTS er et attraktivt verktøy for de som ønsker å være nøye med stemmeuttrykk, med funksjoner som stemmekloning, stemmedesign via bildetekst og følelseskontroll med emoji.
Vær imidlertid oppmerksom på at oppsettsmetoden og bruken er for avanserte brukere, og krever miljøoppsett av Python og Git.
I tillegg tar generering av tale tid på en PC uten GPU.
For de som vil bruke talesyntese enkelt og med en gang, anbefales «Ondoku», som kan brukes kun med en nettleser.
Hvorfor ikke prøve å skape tale av høy kvalitet med en gratis og lettfattelig AI-talesyntese?
■ AI talesyntese programvare «Ondoku»
"Ondoku" er et online tekst-til-tale-verktøy som kan brukes uten innledende kostnad.
- Støtter omtrent 50 språk, inkludert japansk, engelsk, kinesisk, koreansk, spansk, fransk og tysk.
- Tilgjengelig fra både PC og smarttelefon
- Egnet for forretninger, utdanning, underholdning, etc.
- Ingen installasjon nødvendig, kan brukes umiddelbart fra nettleseren din
- Støtter også lesing fra bilder
For å bruke den, skriv inn tekst eller last opp en fil fra nettstedet. Generer naturlige lydfiler på sekunder. Du kan bruke talesyntese for opptil 5000 tegn gratis, så prøv det først.
Email: ondoku3.com@gmail.com
Programvare for tekstlesing Ondoku. Det er en tekst-til-tale-tjeneste som ikke krever installasjon og kan brukes av hvem som helst gratis. Hvis du registrerer deg gratis, kan du få opptil 5000 tegn gratis hver måned. Registrer deg gratis nå
- Hva er Ondoku?
- Les tekst på Ondoku
- Gratis registrering
- Rate plan
- Liste over artikler
- Prøv andre gratistjenester