Features Templates Lokale KI Use Cases Sicherheit Preise Blog Partner werden Demo buchen
Login Kostenlos starten

Lokale KI · Modell-Datenbank

Lokale KI-Modelle im Überblick

Alle relevanten Open-Source-Modelle, die du lokal mit Ollama, LM Studio oder llama.cpp betreiben kannst, mit Speicherbedarf, Kontextfenster, Lizenz und Deutsch-Qualität. Der Speicher-Filter zeigt, welche Modelle in deine Hardware passen. Wann sich lokal überhaupt lohnt, klärt der ausführliche Leitfaden.

Ob ein Modell dann schnell genug läuft, hängt von der Speicherbandbreite deines Geräts ab, nicht nur davon, ob es in den Speicher passt. Das rechnet dir der Hardware-Rechner aus.

Passt in
38 von 49 Modellen
Lizenz
DeepSeek V4-Pro 98 1.600B · 49B aktiv 880 GB 1M gut MIT 1457 $1,60
GLM-5.2 Neu 97 753B · 40B aktiv 415 GB 1M gut MIT $0,00
Kimi K2.6 96 1.000B · 32B aktiv 560 GB 256K gut Modified MIT 1460 $0,95
GLM-5 94 744B · 40B aktiv 410 GB 200K gut MIT 1458 $0,60
DeepSeek V4-Flash 93 284B · 13B aktiv 155 GB 1M gut MIT 1436 $0,09
Qwen3 235B-A22B 92 235B · 22B aktiv 140 GB 32K stark Apache 2.0 1375 $0,45
Kimi K2.7 Code 91 1.000B · 32B aktiv 560 GB 256K gut Modified MIT $0,71
Mistral Medium 3.5 128B 88 128B 75 GB 256K stark Modified MIT
gpt-oss 120B Neu 86 117B · 5,1B aktiv 80 GB 128K gut Apache 2.0 1352 $0,04
Mistral Small 4 119B 85 119B · 6,5B aktiv 70 GB 256K stark Apache 2.0 $0,08
Devstral 2 123B 83 123B 74 GB 256K gut Modified MIT $0,40
Qwen3.6 27B Neu 82 27B 18 GB 256K stark Apache 2.0 $0,30
Qwen3-Coder-Next 80 80B · 3B aktiv 52 GB 256K gut Apache 2.0 $0,12
Qwen3 32B 78 32B 21 GB 32K stark Apache 2.0 1347 $0,08
Gemma 4 31B 77 31B 20 GB 256K stark Apache 2.0 1451
QwQ 32B Neu 76 32,5B 21 GB 128K stark Apache 2.0 1336
Qwen3 30B-A3B 72 30B · 3B aktiv 20 GB 32K stark Apache 2.0 1327 $0,12
gpt-oss 20B Neu 71 21B · 3,6B aktiv 16 GB 128K gut Apache 2.0 1317 $0,03
Mistral Small 3.1 24B 70 24B 16 GB 128K stark Apache 2.0 1303 $0,35
DiffusionGemma 26B-A4B Neu 69 25,2B · 3,8B aktiv 14 GB 256K stark Apache 2.0
Gemma 4 26B-A4B 68 25,2B · 3,8B aktiv 14 GB 256K stark Apache 2.0 1438 $0,00
Devstral Small 2 24B 67 24B 16 GB 256K gut Apache 2.0
Qwen3 14B 64 14B 11 GB 32K stark Apache 2.0 $0,12
Ministral 3 14B 63 14B 11,5 GB 256K stark Apache 2.0 $0,20
Gemma 4 12B 62 12B 9,5 GB 256K stark Apache 2.0
Phi-4 14B 60 14B 11 GB 16K solide MIT 1256 $0,07
GLM-4.1V 9B Thinking Neu 56 10B 8,5 GB 64K solide MIT
Qwen3-VL 8B 54 8B 7,5 GB 256K gut Apache 2.0 $0,12
Ministral 3 8B 53 9B 7,5 GB 256K stark Apache 2.0 $0,08
Qwen3 8B 52 8B 7 GB 32K stark Apache 2.0 $0,12
EuroLLM 22B Neu 48 22,6B 15,5 GB 32K stark Apache 2.0
Gemma 4 E4B 41 8B 4,5 GB 128K gut Apache 2.0
Qwen3 4B 38 4B 4 GB 32K gut Apache 2.0
Ministral 3 3B 37 3,8B 4,5 GB 256K gut Apache 2.0 $0,10
EuroLLM 9B Neu 34 9,2B 7,5 GB 4K stark Apache 2.0
Gemma 4 E2B 33 5,1B 3 GB 128K gut Apache 2.0
Teuken 7B Neu 30 7B 6 GB 4K stark Apache 2.0
Qwen3 1.7B 24 1,7B 2,5 GB 32K gut Apache 2.0

LMArena (Stand 13.09.)

Was sich zuletzt geändert hat

Wie die Werte zustande kommen

Transparenz vorweg: Die Zahlen sind sorgfältig geschätzte Richtwerte für den Praxisbetrieb, keine Laborbenchmarks. Das Prüfdatum steht unter der Tabelle, pro Modell führt das Symbol neben dem Namen zur offiziellen Modelcard.

Speicherbedarf

Der Speicherwert gilt für die Quantisierung Q4_K_M (der Standard in Ollama und LM Studio) inklusive eines kleinen Kontextfensters. Faustregel: rund 0,55 GB pro Milliarde Parameter plus etwas Overhead. Modelle, die schon quantisiert trainiert wurden (gpt-oss, Kimi K3), führen stattdessen die vom Hersteller genannte Mindestgröße, und wo der Hersteller keine veröffentlicht hat, das Gewicht der veröffentlichten Dateien.

Mixture-of-Experts

Bei MoE-Modellen bestimmt die Gesamtzahl der Parameter den Speicherbedarf (alle Experten liegen im RAM), während nur die aktiven Parameter das Tempo bestimmen. Daher der Geschwindigkeitsvorteil bei gleicher Größe.

Stärke-Richtwert

Die Stärke ist ein gerundeter Richtwert (0–100), der mit der Modellgröße steigt. Er hilft beim Vergleich innerhalb dieser Liste, ist aber kein offizieller Benchmark-Score.

Hinweis zum Kontextfenster: Die Qwen3-Textmodelle ab 4B laufen nativ mit 32K Token und lassen sich per YaRN auf bis zu 128K erweitern (das 1.7B-Modell bleibt bei 32K). Die Tabelle zeigt den nativen Wert.

Häufige Fragen

Welches lokale KI-Modell ist am besten für Deutsch?
Für deutschsprachige Aufgaben gelten die Gemma-Modelle als besonders stark, gefolgt von Qwen3 und Mistral. Die Tabelle zeigt die Deutsch-Qualität pro Modell als Einschätzung.
Was bedeutet das Kontextfenster?
Das Kontextfenster ist die Textmenge in Token, die ein Modell gleichzeitig verarbeiten kann. 32K reichen für die meisten Aufgaben; lange Dokumente profitieren von 128K oder mehr. Mehr Kontext kostet zusätzlichen Speicher.
Sind diese Modelle kommerziell nutzbar?
Das hängt von der Lizenz ab (Spalte „Lizenz“). Apache 2.0 und MIT erlauben freie kommerzielle Nutzung; Lizenzen wie die Llama Community License oder die Gemma Terms haben Einschränkungen, die du im Zweifel in der Original-Lizenz prüfen solltest.
Was ist ein MoE-Modell?
Bei einem Mixture-of-Experts-Modell liegen alle Parameter im Speicher, aber pro Token rechnet nur ein Bruchteil davon (die aktiven Parameter). Dadurch ist es so schnell wie ein viel kleineres Modell, braucht aber den Speicher des großen.

Vom Modell zum Produktivsystem

Lass dein Modell lokal laufen, Corporate LLM macht ein Produktivsystem draus: RAG, Agenten-System, Skills und Connectoren. 100% DSGVO-konform.