Kostenloses Werkzeug · GPU-Rechner
Wie viel Grafikspeicher braucht Ihr lokales Sprachmodell?
Vier Fragen, eine Schätzung in Gigabyte und die passende Kartengröße. Eine Schätzung für die Planung, keine Messung. Tatsächlicher Bedarf hängt vom Modell, der Software und der Last ab – vor einer Anschaffung testen wir mit Ihrem Anwendungsfall.
Eine Schätzung für die Planung, keine Messung. Tatsächlicher Bedarf hängt vom Modell, der Software und der Last ab – vor einer Anschaffung testen wir mit Ihrem Anwendungsfall.
Rund 10 GB Grafikspeicher
Empfehlung: eine Grafikkarte mit mindestens 16 GB Speicher.
Modellgewichte
4.8 GB
8 Mrd. Parameter × 0,6 GB je Milliarde – nach der Faustregel und dem Beispiel im Leitfaden von Hugging Face.
Kontext und gleichzeitige Nutzung
4.8 GB
Annahme: 50 % der Gewichte je aktivem Kontext, 2 Kontexte gleichzeitig im Speicher. Das ist eine Planungsannahme, keine Messung.
14Jahre
unternehmerisch im IT-Betrieb, GmbH seit 2020
InternationaleExpertise
Betreuung in Deutschland, Europa und dem Nahen Osten
99,9 %Verfügbarkeit
der Cloud-Services, je Kalendermonat
15 Min.Reaktionszeit
im Notfall, rund um die Uhr
ISO 27001zertifiziert
Partner-Rechenzentren in Deutschland
Wie der Rechner schätzt
Der Speicher entscheidet, ob ein Modell überhaupt läuft – die Rechenleistung, wie schnell.
Ein Sprachmodell muss vollständig in den Grafikspeicher passen, um schnell zu antworten. Hugging Face nennt dafür eine Faustregel: X Milliarden Parameter brauchen in 16-Bit-Genauigkeit rund 2 × X GB für die Gewichte. Mit 8 oder 4 Bit sinkt der Bedarf deutlich; im Beispiel des Leitfadens fiel ein Modell mit rund 15 Milliarden Parametern von 32 GB auf 15 GB in 8 Bit und gut 9 GB in 4 Bit.
Dazu kommt der Speicher für die Eingaben, der mit ihrer Länge und der Zahl gleichzeitiger Anfragen wächst. Dafür setzt der Rechner Zuschläge an, die er als Annahme ausweist. Wo das Modell laufen kann und welche Daten es sehen darf, beschreibt die Seite Eigener KI-Server.
Ihr nächster Schritt
Von der Schätzung zum passenden Server
Wir testen mit Ihrem Anwendungsfall, welches Modell genügt, und sagen Ihnen, welche Hardware es trägt – ohne überdimensionierte Anschaffung.
Die Prüfpunkte
Was der GPU-Rechner ansieht
- Modellgewichte
- Rund 2 GB je Milliarde Parameter in 16 Bit, weniger in 8 und 4 Bit – nach der Faustregel von Hugging Face.
- Kontext
- Der Speicher für die Eingaben wächst mit ihrer Länge; lange Dokumente brauchen deutlich mehr.
- Gleichzeitige Nutzung
- Jede laufende Anfrage braucht ihren eigenen Kontextspeicher.
- Kartengröße
- Welche Speichergröße einer Grafikkarte das Ergebnis trägt – oder ob mehrere Karten nötig sind.
Geprüft am 2026-10-06.
Häufige Fragen
Wie genau ist die Schätzung?
Für die Gewichte recht genau, für Kontext und gleichzeitige Nutzung eine Planungsannahme. Der tatsächliche Bedarf hängt vom Modell, von der Software und vom Lastprofil ab. Vor einer Anschaffung testen wir mit Ihrem Anwendungsfall.
Verliert ein Modell in 4 Bit an Qualität?
Hugging Face beschreibt, dass sich Gewichte auf 8 oder 4 Bit verringern lassen, ohne dass die Leistung deutlich sinkt. Für die meisten Aufgaben im Unternehmen ist 4 Bit ein guter Ausgangspunkt; bei anspruchsvollen Aufgaben lohnt der Vergleich.
Was ist Ollama?
Ein verbreitetes Werkzeug, um offene Sprachmodelle auf eigener Hardware auszuführen. Der Rechner gilt für Ollama ebenso wie für andere Laufzeitumgebungen, weil der Speicherbedarf vor allem vom Modell abhängt.
Warum keine Preise?
Weil Preise für Grafikkarten und Server stark schwanken und vom Gesamtpaket abhängen. Der Rechner beantwortet die Frage, welche Größe nötig ist; das Angebot dazu stellen wir auf Anfrage.
Fundstellen
- Hugging Face: Optimizing LLMs for Speed and Memory (Faustregel 2 GB je Mrd. Parameter in 16 Bit, Beispiel 8 und 4 Bit, Key-Value-Cache) – Hugging Face
- Hugging Face: Quantization – Überblick – Hugging Face
- Ollama – lokale Sprachmodelle ausführen (Projektseite) – Ollama
Weiter: Leistung: KI & Automatisierung · Eigener KI-Server · KI-Infrastruktur · KI-Agenten · AI-Act-Check
