Hvad er Irodori-TTS? Guide til funktioner, tips og brug

28. juli 2026

Hvad er Irodori-TTS? Guide til funktioner, tips og brug


dog

Hvad er Irodori-TTS for en AI-oplæsningssoftware?

Mange er sikkert nysgerrige efter den nye AI-oplæsningssoftware "Irodori-TTS".

I denne artikel forklarer vi Irodori-TTS' funktioner, muligheder, forholdsregler og anvendelse på en letforståelig måde.

For dem, der synes, at "opsætningen virker svær", introducerer vi desuden en stemmesyntese-metode, der kan bruges med det samme uden installation.

Det lærer du i denne artikel

  1. Hvad er Irodori-TTS for en software?
  2. Muligheder og forholdsregler med Irodori-TTS
  3. Sådan bruger du Irodori-TTS (fra opsætning til lydjustering)
  4. Anbefalede metoder, hvis miljøkonfigurationen er svær

Hvad er Irodori-TTS? Forklaring af japansk AI-stemmesyntese-software

Hvad er Irodori-TTS? Forklaring af japansk AI-stemmesyntese-software

Først og fremmest vil vi kort forklare, hvad Irodori-TTS er for en AI-stemmesyntese-software, og hvad dens funktioner er.

Irodori-TTS er en AI-stemmesyntese-model, der kører lokalt

Irodori-TTS er en AI-stemmesyntese-software specialiseret i japansk.

Udvikleren er Aratako, og den er udgivet gratis som open source (MIT-licens).

Den største funktion er muligheden for "lokal drift", hvor stemmesyntesen fuldføres udelukkende på din egen PC.

Da al stemmegenerering sker på din lokale PC, sendes hverken tekst eller de genererede lyddata til eksterne servere.

Efter den indledende opsætning kan du generere tale uden internetforbindelse, og der er ingen begrænsninger på antallet af genereringer.

Opsætningen kræver dog programmeringsværktøjer som Python og Git.

For hurtig drift anbefales desuden en højtydende PC udstyret med en GPU (grafikkort).

Hvad du kan og ikke kan med Irodori-TTS

Hvad du kan og ikke kan med Irodori-TTS

Dernæst forklarer vi, hvad du kan og ikke kan med Irodori-TTS.

Hvad du kan med Irodori-TTS

Da Irodori-TTS kører i et lokalt miljø, kan du generere tale ubegrænset antal gange.

Selv i miljøer uden internetforbindelse kan du frit oprette tale, når den indledende opsætning er færdig.

Der er flere måder at instruere om, hvilken slags tale der skal oprettes, og ved at bruge caption-funktionen kan du skabe din foretrukne stemmekvalitet blot med tekstinstruktioner.

Det er også muligt at genskabe eksisterende stemmer med stemme-cloning eller tilføje følelsesmæssige udtryk med emojis.

Da det er en MIT-licens, er kommerciel brug af den genererede tale også tilladt.

Forholdsregler ved Irodori-TTS

På den anden side er der også nogle forholdsregler, man bør kende, før man bruger Irodori-TTS.

Tale kan genereres i op til ca. 30 sekunder ad gangen

I en enkelt generering kan der maksimalt oplæses ca. 30 sekunder.

Hvis du vil oplæse lange tekster, skal du opdele teksten og generere den flere gange.

Det er svært at få stemmen og talemåden præcis som ønsket

Irodori-TTS tilbyder høj grad af frihed, men til gengæld findes der ingen standardstemmer (basestemmer).

Derfor vil køn og alder ændre sig tilfældigt ved hver generering, medmindre du angiver en caption eller en referencelyd.

Hvis du vil oplæse med den samme stemme, skal du indlæse en referencelyd.

Desuden er der ingen funktion til manuelt at justere betoning eller intonation.

Understøttede sprog er kun japansk

Det understøttede sprog er kun japansk, og fremmedsprog som engelsk understøttes ikke.

Vær også opmærksom på, at der kan forekomme fejl i udtalen af kanji.

High-spec PC med GPU anbefales

Afhængigt af PC-specifikationerne kan det tage tid at generere tale.

På en PC uden GPU tager det omkring et minut at generere selv korte sætninger.

Med entry-level CPU'er som Celeron eller N100 føles praktisk brug vanskelig.

Sådan bruger du Irodori-TTS (opsætningsforløb)

Herfra forklarer vi kort, hvordan man bruger Irodori-TTS.

Det overordnede opsætningsforløb er som følger:

  1. Installer den nødvendige software
  2. Opret en arbejdsmappe
  3. Clone Irodori-TTS fra GitHub
  4. Installer nødvendige pakker
  5. Start Irodori-TTS
  6. Indlæs AI-model
  7. Oplæs tekst

1. Installer nødvendig software til Irodori-TTS

Opsætning af Irodori-TTS kræver lidt forberedelse.

Først skal du installere disse tre typer software:

  • Python 3.10 eller nyere: Programmeringssprog
  • Git: Versionsstyringssystem (nødvendigt for at downloade Irodori-TTS)
  • uv: Pakkehåndtering til Python

For at installere Python, Git og uv skal du først højreklikke på startmenuen og klikke på "Terminal" (det er ikke nødvendigt at køre som administrator).

Klik på "Terminal"

Derefter åbnes terminalvinduet (PowerShell).

Terminal (PowerShell)

Indtast og kør følgende kommandoer i dette vindue:

winget install --id Git.Git -e

winget install --id=astral-sh.uv -e

Kommando kører

Nu er de nødvendige ting til opsætning af Irodori-TTS installeret.

*Da Python administreres af uv, installeres det automatisk under opsætningen.

Efter installationen skal du lukke og genåbne terminalen (PowerShell) én gang (for at "opdatere stien/path").

2. Opret en arbejdsmappe

Dernæst skal du oprette en arbejdsmappe.

Det er her, Irodori-TTS vil blive installeret.

I dette eksempel oprettede vi en mappe med navnet "irodori-tts" direkte på C-drevet.

Opret arbejdsmappe

Når mappen er oprettet, skal du navigere til den i terminalen.

cd C:\irodori-tts

Naviger til arbejdsmappe

3. Clone Irodori-TTS fra GitHub

Indtast følgende kommando i terminalen for at clone Irodori-TTS-repositoriet fra GitHub.

git clone https://github.com/Aratako/Irodori-TTS.git

Clone repositorie fra GitHub

Clonen af repositoriet er færdig på få sekunder.

Indtast følgende kommando for at gå til den clonede mappe:

cd Irodori-TTS

Skift mappe

4. Installer nødvendige pakker

Indtast og kør følgende kommando for at installere de nødvendige pakker til at køre Irodori-TTS.

uv sync

Installer pakker

Det tager tid, da en stor mængde pakker skal downloades og installeres.

Skærm under pakkeinstallation

Selve Python installeres også her.

Vent uden at lukke terminalvinduet, mens download og installation er i gang.

Da filer på næsten 3 GB downloades, anbefales det at udføre opsætningen et sted med en god internetforbindelse.

5. Start Irodori-TTS

Når download og installation af pakker er færdig, er opsætningen fuldført.

Start Irodori-TTS.

Indtast og kør følgende kommando, og vent et øjeblik på opstarten.

uv run python gradio_app.py --server-name 0.0.0.0 --server-port 7860

Når følgende vises i terminalen, er opstarten fuldført:

Skærm med færdig opstart

Running on local URL: http://0.0.0.0:7860

Åbn en webbrowser og gå til http://localhost:7860.

Nu åbnes Irodori-TTS-skærmen (WebUI).

Irodori-TTS WebUI

6. Indlæs AI-model

Klik på "Load Model" for at indlæse den AI-model, der skal bruges til tekstlæsning.

Load Model

Første gang du trykker på denne knap, starter downloaden af AI-modellen.

Når en færdiggørelsesbesked vises i Model Status (omkranset med rødt i det næste billede), er indlæsningen af AI-modellen færdig.

Model Status

7. Oplæs tekst med Irodori-TTS

I Irodori-TTS kan du give instruktioner om oplæsningsmåde, herunder følelsesmæssige udtryk, men lad os først prøve at oplæse uden instruktioner som et eksempel.

Rul ned til tekstfeltet og indtast den tekst, du vil have læst op.

Indtast tekst

Denne gang prøver vi at oplæse "こんにちは、これはイロドリTTSで作成された音声です。" (Hej, dette er en stemme oprettet med Irodori-TTS).

(Da det ikke blev læst korrekt med det latinske alfabet "Irodori-TTS", brugte vi katakana "イロドリTTS").

Tryk på "Generate"-knappen for at starte stemmegenereringen.

Start generering

Irodori-TTS bruger din PCs CPU eller GPU (grafikkort) til at generere tale.

Derfor varierer den tid, det tager at generere, meget afhængigt af din PCs ydeevne.

Da dette blev genereret på en bærbar computer uden GPU denne gang, tog det ca. 1 minut for denne korte tekst.

Reference: Testgenerering udført i et miljø med CPU: Ryzen 5 4650U, RAM: DDR4 32GB, Windows 11 Pro 24H2.

Når genereringen er færdig, vises lydbølgen, og du kan afspille lyden.

Generering færdig

Eksempel på oplæsning af "こんにちは、これはイロドリTTSで作成された音声です。"

Hvis det lyder rigtigt, skal du trykke på download-knappen (pil ned-ikonet) for at gemme lydfilen.

Lydfilen gemmes i WAV-format.

Nu har du syntetiseret tale ved hjælp af Irodori-TTS.

Sådan justeres lyden i Irodori-TTS

Irodori-TTS giver dig mulighed for at justere udtryk som køn og følelser på forskellige måder.

Angiv følelsesmæssige udtryk med emojis

Klik på "Emoji Palette" under tekstfeltet for at vælge emojis.

Emoji Palette

Hver emoji er tildelt et følelsesmæssigt udtryk:

  • 😊 Glad, fornøjet
  • 😭 Hulken, gråd
  • 😰 Forvirret, rystet
  • ⏩ Hurtig tale
  • 📖 Narration, monolog

Du kan få teksten læst op med det angivne følelsesmæssige udtryk blot ved at indsætte emojis i tekstfeltet.

Eksempel på oplæsning af "😊 こんにちは、これはイロドリTTSで作成された音声です。"

Eksempel på oplæsning af "📖 こんにちは、これはイロドリTTSで作成された音声です。"

Vær dog opmærksom på, at køn og alder ikke kan specificeres specifikt blot ved at bruge emojis.

Indlæs en referencelyd for at oplæse med den samme stemme

I Irodori-TTS kan du indlæse en referencelydfil og lade softwaren oplæse med den stemme som reference.

Referencelyden indlæses i det felt, hvor der står "Drop audio here - or - click to upload" (Træk lyd herhen - eller - klik for at uploade).

Indlæs referencelyd

Udover at kunne oplæse med den samme stemme, kan du opnå en klarere lydkvalitet sammenlignet med ikke at angive noget.

Direkte justering af oplæsningsstil via caption-funktionen er også muligt

I Irodori-TTS kan du også direkte angive med tekst, hvilken slags stemme der skal læses op med.

For at bruge caption-funktionen skal du starte "VoiceDesign-versionen", hvilket ændrer kommandoen til at starte Irodori-TTS i terminalen:

uv run python gradio_app_voicedesign.py --server-name 0.0.0.0 --server-port 7861

Start VoiceDesign-version

Når du kører denne kommando, starter brugerfladen til VoiceDesign-versionen.

Da VoiceDesign-versionen bruger en anden AI-model end standardversionen, skal du klikke på "Load Model" første gang for at downloade modellen separat fra standardversionen.

Da AI-modellen fylder ca. 2 GB, anbefales det at downloade den et sted med god internetforbindelse.

På betjeningsskærmen for VoiceDesign-versionen er der et tekstfelt ved navn "Caption / Style Prompt (optional)".

Caption / Style Prompt (optional)

Her indtaster du en beskrivelse af, hvilken stemme du ønsker skal læse op:

  • Læs venligst op med en rolig kvindestemme, med en tæt følelse og på en blød og naturlig måde.
  • Tal venligst med en energisk mandsstemme, lyst og tydeligt.
  • Læs venligst med en dyb mandsstemme, nøgternt som en nyhedsoplæser.

På denne måde kan du angive, hvilken stemme der skal bruges.

For eksempel, når man bruger instruktionen "Læs venligst op med en rolig kvindestemme, med en tæt følelse og på en blød og naturlig måde.", blev resultatet denne stemme:

Eksempel med instruktionen "Læs venligst op med en rolig kvindestemme, med en tæt følelse og på en blød og naturlig måde."

Også her var det muligt at få læst op med en klar og letforståelig lydkvalitet.

Der er dog forholdsregler ved caption-funktionen.

Caption-funktionen tager længere tid at generere tale sammenlignet med andre oplæsningsmetoder.

Da vi genererede det på en bærbar computer denne gang, tog det ca. 5 minutter at generere denne korte tekst.

Når du bruger caption-funktionen, anbefales en high-spec PC med GPU.

Hvad sker der, hvis man oplæser engelsk tekst?

Irodori-TTS er en oplæsningssoftware, der kun understøtter japansk.

Men hvad sker der, hvis man prøver at oplæse engelsk tekst?

Lad os prøve at indtaste et simpelt eksempel:

Eksempel på oplæsning af "Hello, this is a voice recording created using Irodori-TTS."

Som det kan høres, blev "Hello" udtalt som katakana "Haro", og "recording"-delen blev uforståelig, så den kunne ikke læses korrekt op.

Hvis du vil oplæse engelsk tekst, anbefales det at bruge en AI-oplæsningstjeneste, der understøtter fremmedsprog.

Anbefalet stemmesyntese-metode, hvis "opsætningen virker svær"

Efter at have læst hertil, føler nogle måske, at opsætningen af Irodori-TTS virker lidt besværlig.

Hvis du ikke er vant til terminal-operationer, kan det tage tid bare at forberede værktøjer som Python og Git, installere pakker og downloade AI-modellen.

Hvis du ikke har en PC med GPU, tager hver stemmesyntese desuden for lang tid, hvilket gør det svært at bruge til formål som video-narration.

Lange tekster skal opdeles i bidder af ca. 30 sekunder og genereres flere gange.

For dem, der ønsker at lave tale fra tekst uden installation eller opsætning, vil vi nu introducere en AI-stemmesyntese-tjeneste, der kan bruges i browseren.

『Ondoku』: AI-stemme der kan bruges uden installation

Ondoku

Hvis du nemt vil lave stemmesyntese med den nyeste AI, anbefaler vi AI-stemmesyntese-tjenesten 『Ondoku』.

『Ondoku』 er en AI-stemmesyntese-tjeneste, hvor du kan oprette tale blot ved at åbne browseren og indsætte tekst.

Du kan oprette tale gratis med det samme på PC, smartphone eller tablet.

Da stemmegenereringen foregår i skyen (på serversiden), er det ikke et problem, hvis din PC ikke har en GPU.

Der findes flere stemmer klar fra starten, såsom mandsstemmer, kvindestemmer og børnestemmer, så du kan læse op med det samme blot ved at vælge, uden at skulle forberede referencelyd eller captions.

Lange tekster kan også læses op direkte.

Og Ondoku understøtter endda engelsk!

Da den understøtter mange sprog som fransk, spansk, koreansk og kinesisk, kan den også bruges til oplæsning på andre sprog end japansk.

Du kan desuden opleve endnu mere naturlig oplæsning med næste generations AI-stemmer (OndokuBeta).

Hvis du leder efter en måde at læse tekst op som tale, hvorfor så ikke prøve 『Ondoku』, som er gratis og nemt at bruge?

Sammenligning af forskellene mellem Ondoku og Irodori-TTS

Til sidst sammenligner vi de vigtigste forskelle mellem Ondoku og Irodori-TTS.

👆 Du kan scrolle sidelæns
Punkt Ondoku Irodori-TTS
Driftsmetode Cloud (betjenes i browser) Lokal (behandles på egen PC)
Opsætning Ikke nødvendig Miljøkonfiguration af Python, Git osv. påkrævet
Understøttede sprog Over 35 sprog Kun japansk
Valg af stemme Vælg blot blandt flere stemmer Angiv via stemme-cloning, caption eller emojis
Maks. grænse pr. generering Understøtter lange tekster Op til ca. 30 sekunder
Kommerciel brug Muligt (kreditering påkrævet ved gratis brug) Muligt (MIT-licens)
Understøttede enheder PC, smartphone, tablet PC (GPU anbefales)
Pris Gratis plan tilgængelig (betalte planer udvider antal tegn) Gratis (da den kører lokalt)

Sammenlignet kan du vælge Ondoku for brugervenlighed og øjeblikkelig brug, eller Irodori-TTS hvis du har en high-end PC og ønsker at finjustere stemmen i detaljer.

Ondoku anbefales til dem, der har brug for tale med det samme, dem der har brug for flersproget oplæsning, eller dem der ønsker at bruge det på smartphone eller tablet.

Den er også velegnet til dem, der vil læse lange tekster op direkte, dem der ikke vil bruge tid på opsætning, eller dem hvis PC ikke har en GPU.

Da du kan generere tale i høj kvalitet blot ved at åbne browseren, hvorfor så ikke starte med at bruge Ondoku gratis?

Oversigt over Irodori-TTS' funktioner, opsætning og anvendelse

I denne artikel har vi forklaret Irodori-TTS, en AI-stemmesyntese-software specialiseret i japansk, der kører lokalt.

Irodori-TTS er et attraktivt værktøj for dem, der går op i stemmeudtryk, med funktioner som stemme-cloning, stemmedesign via captions og følelseskontrol via emojis.

Dog er opsætningsmetoden og brugen henvendt til avancerede brugere, og opsætningen kræver miljøkonfiguration af Python og Git.

Desuden tager stemmegenereringen tid på PC'er uden GPU.

For dem, der "ønsker at bruge stemmesyntese nemt og hurtigt", anbefales 『Ondoku』, som kan bruges udelukkende i browseren.

Hvorfor ikke selv prøve at oprette tale i høj kvalitet med den brugervenlige og gratis AI-stemmesyntese?

■ AI-talesyntesesoftware "Ondoku"

"Ondoku" er et online tekst-til-tale-værktøj, der kan bruges uden startomkostninger.

  • Understøtter cirka 50 sprog, inklusive japansk, engelsk, kinesisk, koreansk, spansk, fransk og tysk.
  • Tilgængelig fra både pc og smartphone
  • Velegnet til forretning, uddannelse, underholdning osv.
  • Ingen installation nødvendig, kan bruges med det samme fra din browser
  • Understøtter også læsning fra billeder

For at bruge det skal du blot indtaste tekst eller uploade en fil fra webstedet. Generer naturlige lydfiler på få sekunder. Du kan bruge talesyntese for op til 5.000 tegn gratis, så prøv det først.

Tekst-til-tale-software "Ondoku" kan læse 5000 tegn hver måned med AI-stemme gratis. Du kan nemt downloade MP3'er og kommerciel brug er også mulig. Hvis du tilmelder dig gratis, kan du konvertere op til 5.000 tegn om måneden gratis fra tekst til tale. Prøv Ondoku nu.
HP: ondoku3.com
Email: ondoku3.com@gmail.com
Relateret artikel