Run This Ai
EN DE

LMCache

Beschleunige dein LLM mit der schnellsten KV-Cache-Layer

★ 11,355 GitHub Apache-2.0 kv-cachellmvllmsglanginferencegpu

Überblick

LMCache ist eine Open-Source-KV-Cache-Engine, die die LLM-Bereitstellung mit vLLM und SGLang beschleunigt, indem sie KV-Caches über Anfragen hinweg speichert und wiederverwendet. Sie bietet einen höheren Durchsatz, eine geringere Latenz und drastisch reduzierte Kosten. Der LMCache Server führt einen produktionsreifen, verteilten KV-Cache-Dienst mit einer einheitlichen Schnittstelle, Prefix-Caching, semantischem Chunking und elastischem Multi-GPU-Deployment ein, wodurch Long-Context- und Multi-Turn-Workloads erheblich schneller und kostengünstiger werden.

Anforderungen

Min vCPU
2
Min RAM
4096 MB
Min Disk
10 GB
Rec vCPU
4
Rec RAM
8192 MB
Rec Disk
20 GB

Empfohlener VPS

Hostinger · KVM 4

4 vCPU · 16384 MB · 200 GB

$11.99
Zum Anbieter

Hostinger · KVM 4

4 vCPU · 16384 MB · 200 GB

$11.99
Zum Anbieter

Hostinger · KVM 8

8 vCPU · 32256 MB · 400 GB

$20.00
Zum Anbieter

Affiliate-Hinweis

Docker Compose

# Generated by Run This Ai — docker-compose.yml
services:
  lmcache:
    image: https://github.com/LMCache/LMCache/blob/dev/docker/Dockerfile
    restart: unless-stopped
    ports:
      - 8080:8080
    volumes:
      - ./data/lmcache:/data

Bester VPS für LMCache →

Anleitungen & Artikel