Run This Ai
EN DE

MetaVoice

Grundlagenmodell für menschenähnliche, expressive Text-to-Speech (TTS) mit emotionalem Sprachrhythmus und Zero-Shot Voice Cloning

★ 4,202 GitHub Apache-2.0 ttstext-to-speechvoice-cloningaudioaideep-learning Bild & Video

Überblick

MetaVoice-1B ist ein grundlegendes TTS-Modell mit 1,2 Milliarden Parametern, das auf 100.000 Stunden Sprachmaterial trainiert wurde, um eine menschenähnliche und ausdrucksstarke Text-zu-Sprache-Synthese zu ermöglichen. Es priorisiert emotionalen Sprachrhythmus und Tonfall im Englischen und unterstützt Zero-Shot-Voice-Cloning für amerikanische und britische Stimmen mit nur 30 Sekunden Referenzaudio. MetaVoice unterstützt zudem sprachübergreifendes Voice-Cloning mittels Fine-Tuning, wofür nur 1 Minute Trainingsdaten erforderlich ist. Das Modell kann Texte beliebiger Länge synthetisieren und wird mit einer Docker-basierten Weboberfläche sowie einem API-Server bereitgestellt. Zu den Hauptmerkmalen gehören: emotionaler Sprachrhythmus und Tonfall, Zero-Shot-Cloning für US/UK-Stimmen, sprachübergreifendes Voice-Cloning mit Fine-Tuning, Textsynthese beliebiger Länge, Docker-Compose-Bereitstellung mit Weboberfläche sowie eine Apache 2.0-Lizenz für die uneingeschränkte Nutzung.

Anforderungen

Min vCPU
4
Min RAM
8192 MB
Min Disk
10 GB
Rec vCPU
8
Rec RAM
16384 MB
Rec Disk
20 GB

Empfohlener VPS

Hostinger · KVM 8

8 vCPU · 32256 MB · 400 GB

$20.00
Zum Anbieter

Affiliate-Hinweis

Docker Compose

# Generated by Run This Ai — docker-compose.yml
services:
  metavoice:
    image: saladtechnologies/metavoice-api:latest
    restart: unless-stopped
    ports:
      - 8080:8080
    volumes:
      - ./data/metavoice:/data

Bester VPS für MetaVoice →

Verwandte Tools

Anleitungen & Artikel