Bild & Video
Generative Bild-, Audio- und Video-Modelle.
Stable Diffusion WebUI
Generative image models in your browser
CogVLM
Open-source vision-language foundation model for multimodal understanding and visual question answering
MeloTTS
High-quality multilingual text-to-speech by MyShell.ai — supports English, Spanish, French, Chinese, Japanese, and Korean
SwarmUI
Modular Stable Diffusion Web UI with ComfyUI backend — high performance, extensible
Open-Sora
Democratizing efficient video production with open-source AI
Kohya SS
GUI for Stable Diffusion training — LoRA, Dreambooth, and fine-tuning made easy
CosyVoice
Alibaba's multilingual voice generation and cloning with natural emotion, tone, and accent control
Tortoise TTS
High-quality multi-voice text-to-speech with emphasis on natural prosody, emotion, and voice variety
F5-TTS
High-quality non-autoregressive text-to-speech with flow matching
SenseVoice
Multilingual speech understanding — ASR, emotion recognition & audio event detection, 50+ languages
moondream
Tiny open-source vision-language model that runs on CPU, in ~2GB RAM — image captioning, VQA, OCR
Demucs
Meta's AI music source separation — split any song into vocals, drums, bass, and other stems
Pixelle Video
KI-gestützte, vollautomatisierte Kurzvideo-Engine – generieren Sie virale Kurzvideos aus Skripten oder Themen mit KI-Voiceovers, Untertiteln und visuellen Effekten
Toonflow
Open-Source-KI-Tool zur Erstellung von Kurzfilmen – verwandeln Sie Romane und Skripte mit KI-gestütztem Skriptschreiben, Storyboarding sowie Charakter- und Videogenerierung in animierte Kurzfilme
MetaVoice
Grundlagenmodell für menschenähnliche, expressive Text-to-Speech (TTS) mit emotionalem Sprachrhythmus und Zero-Shot Voice Cloning
Scriberr
Selbstgehostete KI-Audiotranskription mit Sprechererkennung, KI-Chat und höchstem Datenschutz. Vollständig offline, keine Daten verlassen jemals Ihren Server.
OpenPencil
Open-Source KI-natives Vektor-Design-Tool mit gleichzeitigen Agenten-Teams. Verwandeln Sie Prompts direkt auf der Live-Canvas in Benutzeroberflächen. Design-as-Code – eine moderne, selbst hostbare Alternative zu Pencil.
Sana
Effiziente hochauflösende Bildsynthese mit einem linearen Diffusion-Transformer – 4K-Bilder bis zu 100-mal schneller.
FastVideo
Ein einheitliches Inferenz- und Post-Training-Framework für beschleunigte Videogenerierung
LightX2V
Leichtgewichtiges Framework für die Inferenz von Bild-, Video- und Aktionsgenerierung
GPT Image Playground
Selbstgehostete Spielwiese für Bildgenerierung & -bearbeitung auf Basis der OpenAI gpt-image-2 API – Text-zu-Bild, Referenzbearbeitung & maskenbasiertes Inpainting.
LLaVA
Large Language and Vision Assistant — multimodal AI with GPT-4 level capabilities
SnapOtter
SnapOtter
ComfyUI
The most powerful and modular diffusion model GUI with a graph/nodes interface for Stable Diffusion
InvokeAI
Professional creative AI tools for visual media — generate and edit images with an industry-leading UI
Fish Speech
State-of-the-art open-source multilingual text-to-speech and voice cloning system
Spleeter
Deezer source separation library — isolate vocals, drums, bass & more with AI
Fooocus
AI image generator focusing on prompts and generating — a Midjourney-like experience offline
OpenVoice
Instant voice cloning by MIT and MyShell - Audio foundation model
Fooocus-API
REST API for Fooocus – Generate stunning AI images via API endpoints
Buzz
Transcribe and translate audio offline on your PC. Powered by OpenAI Whisper.
GFPGAN
AI-powered face restoration — enhance blurry old faces with remarkable quality
Coqui TTS
Open-source deep learning toolkit for text-to-speech, battle-tested in research and production
whisper.cpp
High-performance C++ port of OpenAI Whisper for fast local speech recognition
ChatTTS
High-quality conversational text-to-speech model optimized for natural daily dialogue
Bark
Text-prompted generative audio model that produces speech, music, and sound effects from natural language
RVC
Retrieval-based voice conversion WebUI — train AI voice models with just 10 minutes of audio
WhisperX
Automatic speech recognition with word-level timestamps and speaker diarization
Real-ESRGAN
Image super-resolution upscaler with AI — enhance and enlarge images with remarkable quality
Faster-Whisper
Fast Whisper transcription with CTranslate2 — 4x faster than OpenAI Whisper with lower memory usage
AudioCraft
Meta's open-source AI library for audio generation — MusicGen for text-to-music and AudioGen for text-to-sound