Sprache & Audio
DIA
Ultrarealistische Dialog-TTS in einem Durchgang
FunASR
End-to-End-Spracherkennungs-Toolkit mit Streaming-ASR, VAD, Interpunktion und Sprecher-Diarisierung
Supertonic
Blitzschnelle, mehrsprachige Text-zu-Sprache-Ausgabe direkt auf dem Gerät, nativ via ONNX.
Abogen
Erstelle Hörbücher aus EPUBs, PDFs und Texten mit synchronisierten Untertiteln.
ebook2audiobook
Erstelle Hörbücher aus E-Books mit Voice-Cloning und über 1158 Sprachen.
NeMo Speech
NVIDIAs skalierbares generatives KI-Framework für Sprache – ASR, TTS und Sprachmodelle in einem Toolkit.
ESPnet
Das End-to-End-Sprachverarbeitungstoolkit für ASR, TTS, Sprachübersetzung und Sprecher-Diarisierung.
Piper
Schnelle, lokale neuronale Text-to-Speech-Lösung, die vollständig offline läuft
Moonshine Voice
Echtzeit-KI für Sprache auf dem Gerät: Spracherkennung, Absichtserkennung und Sprachausgabe für die Entwicklung schneller, privater Sprachassistenten und Schnittstellen.
Anarlog
Local-first KI-Meeting-Protokollierung – Transkription auf dem Gerät, Nutzung eigener LLMs möglich
Ultravox
Open-Source multimodales LLM für Echtzeit-Sprach-KI – Texteingabe, Sprachausgabe mit extrem geringer Latenz.
Vexa
Open-Source-Meeting-Transkriptions-API für Google Meet, Microsoft Teams und Zoom
WhisperLiveKit
Echtzeit-Spracherkennung lokal mit Streaming-ASR, Sprecher-Diarisierung, Übersetzung und OpenAI/Deepgram-kompatiblen APIs.