Zum Inhalt springen
0621 877 55 990
DAVINCI Rechenzentrum

Kostenloses Werkzeug · GPU-Rechner

Wie viel Grafikspeicher braucht Ihr lokales Sprachmodell?

Vier Fragen, eine Schätzung in Gigabyte und die passende Kartengröße. Eine Schätzung für die Planung, keine Messung. Tatsächlicher Bedarf hängt vom Modell, der Software und der Last ab – vor einer Anschaffung testen wir mit Ihrem Anwendungsfall.

Eine Schätzung für die Planung, keine Messung. Tatsächlicher Bedarf hängt vom Modell, der Software und der Last ab – vor einer Anschaffung testen wir mit Ihrem Anwendungsfall.

Wie groß ist das Modell? (Milliarden Parameter)
In welcher Genauigkeit soll es laufen?
Wie lang sind die Eingaben?
Wie viele Personen nutzen es gleichzeitig?

Rund 10 GB Grafikspeicher

Empfehlung: eine Grafikkarte mit mindestens 16 GB Speicher.

Modellgewichte

4.8 GB

8 Mrd. Parameter × 0,6 GB je Milliarde – nach der Faustregel und dem Beispiel im Leitfaden von Hugging Face.

Kontext und gleichzeitige Nutzung

4.8 GB

Annahme: 50 % der Gewichte je aktivem Kontext, 2 Kontexte gleichzeitig im Speicher. Das ist eine Planungsannahme, keine Messung.

  • 14Jahre

    unternehmerisch im IT-Betrieb, GmbH seit 2020

  • InternationaleExpertise

    Betreuung in Deutschland, Europa und dem Nahen Osten

  • 99,9 %Verfügbarkeit

    der Cloud-Services, je Kalendermonat

  • 15 Min.Reaktionszeit

    im Notfall, rund um die Uhr

  • ISO 27001zertifiziert

    Partner-Rechenzentren in Deutschland

Wie der Rechner schätzt

Der Speicher entscheidet, ob ein Modell überhaupt läuft – die Rechenleistung, wie schnell.

Ein Sprachmodell muss vollständig in den Grafikspeicher passen, um schnell zu antworten. Hugging Face nennt dafür eine Faustregel: X Milliarden Parameter brauchen in 16-Bit-Genauigkeit rund 2 × X GB für die Gewichte. Mit 8 oder 4 Bit sinkt der Bedarf deutlich; im Beispiel des Leitfadens fiel ein Modell mit rund 15 Milliarden Parametern von 32 GB auf 15 GB in 8 Bit und gut 9 GB in 4 Bit.

Dazu kommt der Speicher für die Eingaben, der mit ihrer Länge und der Zahl gleichzeitiger Anfragen wächst. Dafür setzt der Rechner Zuschläge an, die er als Annahme ausweist. Wo das Modell laufen kann und welche Daten es sehen darf, beschreibt die Seite Eigener KI-Server.

Ihr nächster Schritt

Von der Schätzung zum passenden Server

Wir testen mit Ihrem Anwendungsfall, welches Modell genügt, und sagen Ihnen, welche Hardware es trägt – ohne überdimensionierte Anschaffung.

Die Prüfpunkte

Was der GPU-Rechner ansieht

Modellgewichte
Rund 2 GB je Milliarde Parameter in 16 Bit, weniger in 8 und 4 Bit – nach der Faustregel von Hugging Face.
Kontext
Der Speicher für die Eingaben wächst mit ihrer Länge; lange Dokumente brauchen deutlich mehr.
Gleichzeitige Nutzung
Jede laufende Anfrage braucht ihren eigenen Kontextspeicher.
Kartengröße
Welche Speichergröße einer Grafikkarte das Ergebnis trägt – oder ob mehrere Karten nötig sind.

Geprüft am 2026-10-06.

Häufige Fragen

Wie genau ist die Schätzung?

Für die Gewichte recht genau, für Kontext und gleichzeitige Nutzung eine Planungsannahme. Der tatsächliche Bedarf hängt vom Modell, von der Software und vom Lastprofil ab. Vor einer Anschaffung testen wir mit Ihrem Anwendungsfall.

Verliert ein Modell in 4 Bit an Qualität?

Hugging Face beschreibt, dass sich Gewichte auf 8 oder 4 Bit verringern lassen, ohne dass die Leistung deutlich sinkt. Für die meisten Aufgaben im Unternehmen ist 4 Bit ein guter Ausgangspunkt; bei anspruchsvollen Aufgaben lohnt der Vergleich.

Was ist Ollama?

Ein verbreitetes Werkzeug, um offene Sprachmodelle auf eigener Hardware auszuführen. Der Rechner gilt für Ollama ebenso wie für andere Laufzeitumgebungen, weil der Speicherbedarf vor allem vom Modell abhängt.

Warum keine Preise?

Weil Preise für Grafikkarten und Server stark schwanken und vom Gesamtpaket abhängen. Der Rechner beantwortet die Frage, welche Größe nötig ist; das Angebot dazu stellen wir auf Anfrage.