Run This Ai
EN DE

NeMo Speech

NVIDIAs skalierbares generatives KI-Framework für Sprache – ASR, TTS und Sprachmodelle in einem Toolkit.

★ 17,871 GitHub Apache-2.0 speechasrttsnvidianemoaudio Sprache & Audio

Überblick

NeMo Speech (NVIDIA NeMo) ist ein skalierbares generatives KI-Framework, das für Forscher und Entwickler im Bereich Sprach-KI entwickelt wurde. Es bietet produktionsreife Bausteine für automatische Spracherkennung (ASR), Text-to-Speech (TTS) und Sprachmodelle, darunter Tools wie Parakeet und Canary für hochpräzise Transkription und Übersetzung sowie auf FastConformer basierende Modelle für Echtzeit-Inferenz. Es ist unter der Apache-2.0-Lizenz verfügbar und hat über 17.000 GitHub-Sterne.

Anforderungen

Min vCPU
2
Min RAM
4096 MB
Min Disk
10 GB
Rec vCPU
4
Rec RAM
8192 MB
Rec Disk
20 GB

Empfohlener VPS

Hostinger · KVM 4

4 vCPU · 16384 MB · 200 GB

$11.99
Zum Anbieter

Hostinger · KVM 4

4 vCPU · 16384 MB · 200 GB

$11.99
Zum Anbieter

Hostinger · KVM 8

8 vCPU · 32256 MB · 400 GB

$20.00
Zum Anbieter

Affiliate-Hinweis

Docker Compose

# Generated by Run This Ai — docker-compose.yml
services:
  nemo-speech:
    image: nvcr.io/nvidia/nemo:latest
    restart: unless-stopped
    ports:
      - 8080:8080
    volumes:
      - ./data/nemo-speech:/data

Bester VPS für NeMo Speech →

Verwandte Tools

Anleitungen & Artikel