Run This Ai
EN DE

EvalScope

Ein schlankes und anpassbares Framework für die effiziente Evaluierung und das Performance-Benchmarking großer Modelle (LLMs, VLMs, KI-Agenten).

★ 3,183 GitHub Apache-2.0 llmevaluationbenchmarkvlmagents LLM & Chat

Überblick

EvalScope ist ein schlankes, anpassbares Framework des ModelScope-Teams von Alibaba für die effiziente Evaluierung und das Performance-Benchmarking großer Modelle – einschließlich LLMs, VLMs und KI-Agenten. Es bietet eine einheitliche API zur Ausführung von Benchmarks wie MMLU, GSM8K und HumanEval, unterstützt native sowie OpenAI-kompatible Modell-APIs und lässt sich nahtlos in das ModelScope-Ökosystem integrieren. Evaluieren Sie Modelle über mehrere Benchmarks hinweg mit einem einzigen Befehl, erstellen Sie detaillierte Berichte und vergleichen Sie Ergebnisse direkt miteinander.

Anforderungen

Min vCPU
2
Min RAM
4096 MB
Min Disk
10 GB
Rec vCPU
4
Rec RAM
8192 MB
Rec Disk
20 GB

Empfohlener VPS

Hostinger · KVM 4

4 vCPU · 16384 MB · 200 GB

$11.99
Zum Anbieter

Hostinger · KVM 4

4 vCPU · 16384 MB · 200 GB

$11.99
Zum Anbieter

Hostinger · KVM 8

8 vCPU · 32256 MB · 400 GB

$20.00
Zum Anbieter

Affiliate-Hinweis

Docker Compose

# Generated by Run This Ai — docker-compose.yml
services:
  evalscope:
    image: primussafe/evalscope:latest
    restart: unless-stopped
    ports:
      - 8080:8080
    volumes:
      - ./data/evalscope:/data

Bester VPS für EvalScope →

Verwandte Tools

Anleitungen & Artikel