Run This Ai
EN DE

Colibri

Führen Sie Frontier-MoE-Modelle (744 Mrd. bis 2,8 Bio. Parameter) auf Ihrer vorhandenen Hardware aus. Reines C, null Abhängigkeiten, Experten werden von der Festplatte gestreamt.

★ 25,364 GitHub Apache-2.0 llminferencemoeself-hostedcopenai-compatible LLM & Chat

Überblick

Colibri ist eine in reinem C geschriebene Inference-Engine, die führende Mixture-of-Experts-Modelle wie GLM-5.2 (744B), Kimi K3 (2.8T), Inkling (975B) und DeepSeek V4 Flash (284B) auf Consumer- und heterogener Hardware ausführt. Sie behandelt VRAM, RAM und Speicher als eine einzige mehrstufige Speicherhierarchie und streamt Experten bei Bedarf von der Festplatte – ein 744B-Modell läuft so mit nur ~10 GB residentem RAM. Enthalten sind eine Chat-CLI (coli chat), ein OpenAI-kompatibler Server (coli serve) und ein Live-Web-Dashboard (coli web) mit Token-Metriken, Stufenanzeigen und einer Echtzeit-Expert-Cortex-Ansicht. Apache-2.0-Lizenz, eine C-Datei pro Modellfamilie, null Engine-Abhängigkeiten.

Anforderungen

Min vCPU
2
Min RAM
8192 MB
Min Disk
10 GB
Rec vCPU
8
Rec RAM
32768 MB
Rec Disk
20 GB

Verwandte Tools

Anleitungen & Artikel