Run This Ai
EN DE

vLLM Ascend

High-Throughput LLM-Serving auf Huawei Ascend NPUs. Community-gepflegtes Hardware-Plugin für vLLM.

★ 2,621 GitHub Apache-2.0 vllmascendhuaweinpullm-inferenceinference LLM & Chat

Überblick

vLLM Ascend ist ein von der Community gepflegtes Hardware-Plugin, das die vLLM-Inferenz-Engine auf Huawei Ascend-NPUs bringt. Es ermöglicht das Bereitstellen großer Sprachmodelle mit hohem Durchsatz und geringer Latenz auf Ascend 910B- und 310P-Hardware und bietet eine kostengünstige, energieeffiziente Alternative zu NVIDIA-GPUs für selbst gehostete LLM-Bereitstellungen. Das Projekt wird aktiv von der vLLM-Community weiterentwickelt, unterstützt die neuesten vLLM-Versionen durch das Begleitpaket „vllm-ascend“ von Ascend und wird mit einem offiziellen Docker-Image für einen schnellen Start geliefert.

Anforderungen

Min vCPU
2
Min RAM
8192 MB
Min Disk
10 GB
Rec vCPU
8
Rec RAM
32768 MB
Rec Disk
20 GB

Docker Compose

# Generated by Run This Ai — docker-compose.yml
services:
  vllm-ascend:
    image: ascendai/vllm-ascend:latest
    restart: unless-stopped
    ports:
      - 8080:8080
    volumes:
      - ./data/vllm-ascend:/data

Bester VPS für vLLM Ascend →

Verwandte Tools

Anleitungen & Artikel