LLM-VRAM-Rechner

Mit dem LLM-VRAM-Rechner berechnen Sie den GPU-Speicherbedarf für Modellgewichte, Quantisierung, KV-Cache und Runtime-Puffer bei lokalen LLM-Inferenzen.

840.0K Berechnungen Aktualisiert · 2026-06-10 Lokale Ausführung · Kein Daten-Upload
AD

So nutzen Sie den LLM-VRAM-Rechner

Der LLM-VRAM-Rechner unterstützt Entwickler, KI-Forscher und Privatanwender dabei, den exakten GPU-Speicherbedarf für die lokale Inferenz von Open-Source-Sprachmodellen (z. B. Llama 3, Mistral oder Qwen) präzise zu kalkulieren. Anhand weniger Modellparameter ermittelt das Tool, ob ein Modell auf Ihrer vorhandenen Grafikkarte lauffähig ist:

  1. Modellparameter & Quantisierung wählen — Geben Sie die Parameteranzahl in Milliarden (z. B. 8B, 14B oder 70B) ein und wählen Sie die gewünschte Gewichtspräzision (FP16, INT8, INT4 oder INT2). Die Berechnung zeigt unmittelbar, wie stark moderne Quantisierungsmethoden (wie GGUF, AWQ oder EXL2) den Speicher der Modellgewichte komprimieren.
  2. Voreinstellungen (Presets) nutzen — Für einen schnellen Einstieg bietet der Rechner praxisnahe Presets für gängige Setups wie 8B-Einstiegsmodelle, 14B-Mittelklassemodelle, 70B-Großmodelle sowie Long-Context-Szenarien.
  3. Architektur- und Kontextparameter anpassen — Hinterlegen Sie die Kontextlänge (z. B. 4.096 bis 131.072 Tokens), die Batch-Größe, die Schichtenanzahl sowie die Konfiguration von Attention- und KV-Heads. Der LLM-VRAM-Rechner berechnet den resultierenden KV-Cache-Speicher für Ihre spezifische Attention-Architektur (MHA, GQA oder MQA).
  4. Ergebnisse & GPU-Empfehlung ablesen — Das Tool schlüsselt den Gesamtspeicher detailliert nach Modellgewichten, KV-Cache und Runtime-Puffer auf und ordnet das Setup einer geeigneten Grafikkartenklasse (z. B. 8 GB, 12 GB, 16 GB, 24 GB oder 48 GB) zu.

Formeln & mathematische Grundlagen

Der LLM-VRAM-Rechner basiert auf den etablierten mathematischen Formeln zur Speicherallokation in modernen Inferenz-Engines (wie vLLM, Ollama, llama.cpp oder TGI):

1. Speicherbedarf der Modellgewichte

Der statische Speicher für die Modellgewichte ergibt sich aus der Parameteranzahl und den Bits pro Parameter:

$$\text{VRAM}_{\text{Gewichte}} (\text{GiB}) = \frac{\text{Parameter} \times 10^9 \times (\text{Bits} / 8)}{1024^3}$$

2. Speicherbedarf des KV-Caches

Der Key-Value-Cache speichert die Aufmerksamkeitszustände vorangegangener Tokens für jede Transformer-Schicht. Zunächst ermittelt der Rechner die Dimension pro Attention-Head:

$$\text{Head-Dimension} = \frac{\text{Hidden Size}}{\text{Attention-Heads}}$$

Anschließend wird der KV-Cache-Bedarf über Schichten, Batch-Größe, Kontextlänge und KV-Heads für K- und V-Tensoren berechnet:

$$\text{VRAM}_{\text{KV-Cache}} (\text{GiB}) = \frac{\text{Schichten} \times \text{Batch} \times \text{Kontext} \times \text{KV-Heads} \times \text{Head-Dimension} \times 2 \times (\text{KV-Bits} / 8)}{1024^3}$$

3. Runtime-Puffer & Gesamtspeicher

Für CUDA-Aktivierungen, temporäre Tensoren, Memory Fragmentation und Framework-Overhead kalkuliert der LLM-VRAM-Rechner einen prozentualen Puffer (mindestens 0,5 GiB):

$$\text{VRAM}{\text{Puffer}} (\text{GiB}) = \max\left(0{,}5;; (\text{VRAM}{\text{Gewichte}} + \text{VRAM}{\text{KV-Cache}}) \times \frac{\text{Puffer}{%}}{100}\right)$$

$$\text{VRAM}{\text{Gesamt}} (\text{GiB}) = \text{VRAM}{\text{Gewichte}} + \text{VRAM}{\text{KV-Cache}} + \text{VRAM}{\text{Puffer}}$$

Liegt die Gesamtauslastung über 90 % der jeweiligen GPU-Kapazität, weist die Auswertung auf ein knappes Setup hin, da Betriebssystem-Overhead und Display-Server zusätzlichen VRAM belegen können.

Praxisbeispiel: 8B- vs. 70B-Modell auf lokaler Hardware

Das folgende Praxisszenario verdeutlicht, wie der LLM-VRAM-Rechner bei der Hardwareplanung hilft:

  • Llama-3-8B (INT4 Quantisierung, 8K Kontext, Batch 1):

    • Modellgewichte: ca. 4,19 GiB
    • KV-Cache (GQA mit 8 KV-Heads): ca. 0,50 GiB
    • Runtime-Puffer (20 %): ca. 0,94 GiB
    • Gesamt-VRAM: ca. 5,63 GiB (Empfehlung: 8 GB GPU wie RTX 4060)
  • Llama-3-70B (INT4 Quantisierung, 8K Kontext, Batch 1):

    • Modellgewichte: ca. 36,68 GiB
    • KV-Cache (GQA mit 8 KV-Heads): ca. 1,25 GiB
    • Runtime-Puffer (20 %): ca. 7,59 GiB
    • Gesamt-VRAM: ca. 45,52 GiB (Empfehlung: 48 GB GPU wie RTX 6000 Ada oder 2x 24 GB RTX 3090/4090)

Typische Einsatzbereiche für den LLM-VRAM-Rechner

Der LLM-VRAM-Rechner bietet wertvolle Orientierung für unterschiedliche Anwendungsfälle im DACH-Raum:

  • Lokale Workstations & Homelabs: Prüfen Sie vor dem Modell-Download, ob Ihr lokales Setup ausreicht oder ob eine stärkere 4-Bit-Quantisierung gewählt werden sollte.
  • RAG- & Dokumenten-Workflows: Bei Retrieval-Augmented Generation mit großen Dokumentenmengen und 32K–128K Kontextfenstern zeigt die Modellierung, ab welcher Kontextlänge der KV-Cache die GPU überlastet.
  • GPU-Server-Beschaffung: Planen Sie Investitionen in KI-Hardware für Unternehmen, indem Sie mit dem LLM-VRAM-Rechner den VRAM-Bedarf bei parallelen Nutzeranfragen (höhere Batch-Größen) simulieren.
  • Architekturvergleiche: Evaluieren Sie auf Hugging Face veröffentlichte Modelle anhand ihrer Layer- und Head-Konfigurationen in diesem Tool, um die Effizienz von Grouped-Query Attention gegenüber älteren Architekturen zu quantifizieren.

Häufige Fragen zu LLM-VRAM-Rechner

Was berechnet der LLM-VRAM-Rechner genau?

Der LLM-VRAM-Rechner ermittelt den gesamten GPU-Speicherbedarf für lokale KI-Modelle. Er schlüsselt den Speicher in Modellgewichte, KV-Cache und Runtime-Puffer auf und empfiehlt die passende Grafikkarten-Klasse.

Warum reicht die Dateigröße des Modells für die VRAM-Planung nicht aus?

Die reine Dateigröße berücksichtigt nur die Modellgewichte. Während der Inferenz belegen der KV-Cache für den Kontext, temporäre CUDA-Tensoren und Framework-Puffer zusätzlichen VRAM, was ohne Puffer zu Out-of-Memory-Fehlern (OOM) führt.

Welche Rolle spielen KV-Heads und Grouped-Query Attention (GQA)?

Modelle mit Grouped-Query Attention (GQA) besitzen deutlich weniger KV-Heads als Attention-Heads. Dadurch reduziert sich der Speicherverbrauch des KV-Caches bei langen Kontextfenstern erheblich im Vergleich zu Multi-Head Attention.

Berechnet dieses Tool auch API-Kosten oder Token-Preise?

Nein. Der LLM-VRAM-Rechner ist auf den physischen GPU-Speicherbedarf (VRAM) lokaler Inferenz ausgelegt und kalkuliert keine Cloud-API-Preise oder Token-Abrechnungen.

Werden meine eingegebenen Modelldaten auf einem Server gespeichert?

Nein. Alle Berechnungen erfolgen vollständig lokal in Ihrem Webbrowser; es werden keinerlei Daten an externe Server übertragen.