Run This Ai
EN DE

Bild & Video

Generative Bild-, Audio- und Video-Modelle.

Stable Diffusion WebUI

Generative image models in your browser

★ 140,000

CogVLM

Open-source vision-language foundation model for multimodal understanding and visual question answering

★ 6,740

MeloTTS

High-quality multilingual text-to-speech by MyShell.ai — supports English, Spanish, French, Chinese, Japanese, and Korean

★ 7,518

SwarmUI

Modular Stable Diffusion Web UI with ComfyUI backend — high performance, extensible

★ 4,279

Open-Sora

Democratizing efficient video production with open-source AI

★ 29,156

Kohya SS

GUI for Stable Diffusion training — LoRA, Dreambooth, and fine-tuning made easy

★ 12,421

CosyVoice

Alibaba's multilingual voice generation and cloning with natural emotion, tone, and accent control

★ 21,898

Tortoise TTS

High-quality multi-voice text-to-speech with emphasis on natural prosody, emotion, and voice variety

★ 14,865

F5-TTS

High-quality non-autoregressive text-to-speech with flow matching

★ 14,848

SenseVoice

Multilingual speech understanding — ASR, emotion recognition & audio event detection, 50+ languages

★ 8,734

moondream

Tiny open-source vision-language model that runs on CPU, in ~2GB RAM — image captioning, VQA, OCR

★ 9,813

Demucs

Meta's AI music source separation — split any song into vocals, drums, bass, and other stems

★ 10,263

Pixelle Video

KI-gestützte, vollautomatisierte Kurzvideo-Engine – generieren Sie virale Kurzvideos aus Skripten oder Themen mit KI-Voiceovers, Untertiteln und visuellen Effekten

★ 24,217

Toonflow

Open-Source-KI-Tool zur Erstellung von Kurzfilmen – verwandeln Sie Romane und Skripte mit KI-gestütztem Skriptschreiben, Storyboarding sowie Charakter- und Videogenerierung in animierte Kurzfilme

★ 11,316

MetaVoice

Grundlagenmodell für menschenähnliche, expressive Text-to-Speech (TTS) mit emotionalem Sprachrhythmus und Zero-Shot Voice Cloning

★ 4,202

Scriberr

Selbstgehostete KI-Audiotranskription mit Sprechererkennung, KI-Chat und höchstem Datenschutz. Vollständig offline, keine Daten verlassen jemals Ihren Server.

★ 2,840

OpenPencil

Open-Source KI-natives Vektor-Design-Tool mit gleichzeitigen Agenten-Teams. Verwandeln Sie Prompts direkt auf der Live-Canvas in Benutzeroberflächen. Design-as-Code – eine moderne, selbst hostbare Alternative zu Pencil.

★ 4,634

Sana

Effiziente hochauflösende Bildsynthese mit einem linearen Diffusion-Transformer – 4K-Bilder bis zu 100-mal schneller.

★ 8,792

FastVideo

Ein einheitliches Inferenz- und Post-Training-Framework für beschleunigte Videogenerierung

★ 3,985

LightX2V

Leichtgewichtiges Framework für die Inferenz von Bild-, Video- und Aktionsgenerierung

★ 2,714

GPT Image Playground

Selbstgehostete Spielwiese für Bildgenerierung & -bearbeitung auf Basis der OpenAI gpt-image-2 API – Text-zu-Bild, Referenzbearbeitung & maskenbasiertes Inpainting.

★ 3,523

LLaVA

Large Language and Vision Assistant — multimodal AI with GPT-4 level capabilities

★ 25,000

SnapOtter

SnapOtter

★ 1,797

ComfyUI

The most powerful and modular diffusion model GUI with a graph/nodes interface for Stable Diffusion

★ 118,476

InvokeAI

Professional creative AI tools for visual media — generate and edit images with an industry-leading UI

★ 23,000

Fish Speech

State-of-the-art open-source multilingual text-to-speech and voice cloning system

★ 31,004

Spleeter

Deezer source separation library — isolate vocals, drums, bass & more with AI

★ 28,255

Fooocus

AI image generator focusing on prompts and generating — a Midjourney-like experience offline

★ 50,553

OpenVoice

Instant voice cloning by MIT and MyShell - Audio foundation model

★ 36,798

Fooocus-API

REST API for Fooocus – Generate stunning AI images via API endpoints

★ 668

Buzz

Transcribe and translate audio offline on your PC. Powered by OpenAI Whisper.

★ 19,862

GFPGAN

AI-powered face restoration — enhance blurry old faces with remarkable quality

★ 37,481

Coqui TTS

Open-source deep learning toolkit for text-to-speech, battle-tested in research and production

★ 45,643

whisper.cpp

High-performance C++ port of OpenAI Whisper for fast local speech recognition

★ 51,133

ChatTTS

High-quality conversational text-to-speech model optimized for natural daily dialogue

★ 39,525

Bark

Text-prompted generative audio model that produces speech, music, and sound effects from natural language

★ 39,182

RVC

Retrieval-based voice conversion WebUI — train AI voice models with just 10 minutes of audio

★ 36,196

WhisperX

Automatic speech recognition with word-level timestamps and speaker diarization

★ 22,785

Real-ESRGAN

Image super-resolution upscaler with AI — enhance and enlarge images with remarkable quality

★ 35,946

Faster-Whisper

Fast Whisper transcription with CTranslate2 — 4x faster than OpenAI Whisper with lower memory usage

★ 23,921

AudioCraft

Meta's open-source AI library for audio generation — MusicGen for text-to-music and AudioGen for text-to-sound

★ 23,426