LMCache
Beschleunige dein LLM mit der schnellsten KV-Cache-Layer
Überblick
LMCache ist eine Open-Source-KV-Cache-Engine, die die LLM-Bereitstellung mit vLLM und SGLang beschleunigt, indem sie KV-Caches über Anfragen hinweg speichert und wiederverwendet. Sie bietet einen höheren Durchsatz, eine geringere Latenz und drastisch reduzierte Kosten. Der LMCache Server führt einen produktionsreifen, verteilten KV-Cache-Dienst mit einer einheitlichen Schnittstelle, Prefix-Caching, semantischem Chunking und elastischem Multi-GPU-Deployment ein, wodurch Long-Context- und Multi-Turn-Workloads erheblich schneller und kostengünstiger werden.
Anforderungen
Min vCPU
2
Min RAM
4096 MB
Min Disk
10 GB
Rec vCPU
4
Rec RAM
8192 MB
Rec Disk
20 GB
Empfohlener VPS
Hostinger · KVM 4
4 vCPU · 16384 MB · 200 GB
Hostinger · KVM 4
4 vCPU · 16384 MB · 200 GB
Hostinger · KVM 8
8 vCPU · 32256 MB · 400 GB
Affiliate-Hinweis
Docker Compose
# Generated by Run This Ai — docker-compose.yml
services:
lmcache:
image: https://github.com/LMCache/LMCache/blob/dev/docker/Dockerfile
restart: unless-stopped
ports:
- 8080:8080
volumes:
- ./data/lmcache:/data
Anleitungen & Artikel
How to Deploy LMCache with vLLM: Step-by-Step Tutorial
A hands-on tutorial for installing LMCache, enabling it in vLLM, running the distributed LMCache Server, and verifying time-to-first-token improvements.
Aug 25, 2026
LMCache: The Fastest KV Cache Layer for LLM Serving
LMCache is an open-source KV cache engine that accelerates vLLM and SGLang by reusing KV caches across requests — boosting throughput, cutting latency, and slashing LLM serving costs.
Aug 25, 2026