Alle relevanten Open-Source-Modelle, die du lokal mit Ollama, LM Studio oder llama.cpp betreiben kannst, mit Speicherbedarf, Kontextfenster, Lizenz und Deutsch-Qualität. Der Speicher-Filter zeigt, welche Modelle in deine Hardware passen. Wann sich lokal überhaupt lohnt, klärt der ausführliche Leitfaden.
Ob ein Modell dann schnell genug läuft, hängt von der Speicherbandbreite deines Geräts ab, nicht nur davon, ob es in den Speicher passt. Das rechnet dir der Hardware-Rechner aus.
Passt in
38 von 49 Modellen
Lizenz
Kimi K3Neu
99
2.800B · 104B aktiv
1.560 GB
1M
gut
Kimi K3 License
—
$2,65
Das größte offen verfügbare Modell überhaupt: 2,8 Bio. Parameter, davon 104 Mrd. aktiv. Braucht rund 1,5 TB Speicher, dort dann auf Augenhöhe mit den geschlossenen Spitzenmodellen.
Größtes offenes Modell
1M Kontext
MXFP4 nativ
DeepSeek V4-Pro
98
1.600B · 49B aktiv
880 GB
1M
gut
MIT
1457
$1,60
DeepSeeks neues Flaggschiff: 1,6 Billionen Parameter, drei Reasoning-Stufen und 1-Mio-Kontext für Großserver.
Frontier-Klasse
1M Kontext
MIT-Lizenz
GLM-5.2Neu
97
753B · 40B aktiv
415 GB
1M
gut
MIT
—
$0,00
Nachfolger von GLM-5 mit fünffachem Kontextfenster und MIT-Lizenz, also ohne jede Nutzungsbeschränkung. Auf lange, mehrstufige Aufgaben ausgelegt.
1M Kontext
MIT-Lizenz
Lange Aufgaben
Kimi K2.6
96
1.000B · 32B aktiv
560 GB
256K
gut
Modified MIT
1460
$0,95
Moonshots Spitzenmodell: eines der stärksten offenen Modelle, nur für große Server.
Top Open-Weights
Frontier-Klasse
MoE-schnell
DeepSeek-V3
95
671B · 37B aktiv
400 GB
128K
gut
DeepSeek License
1358
$0,26
Spitzenmodell für dedizierte Server mit mehreren GPUs.
Frontier-Klasse
Server-Hardware
GLM-5
94
744B · 40B aktiv
410 GB
200K
gut
MIT
1458
$0,60
Zhipus Frontier-MoE für dedizierte Server, frei unter MIT-Lizenz.
Frontier-Reasoning
MoE-schnell
MIT-Lizenz
DeepSeek V4-Flash
93
284B · 13B aktiv
155 GB
1M
gut
MIT
1436
$0,09
Schlanke V4-Variante: Frontier-Reasoning mit 1-Mio-Kontext für Workstations.
1M Kontext
MoE-schnell
MIT-Lizenz
Qwen3 235B-A22B
92
235B · 22B aktiv
140 GB
32K
stark
Apache 2.0
1375
$0,45
Frontier-nahes MoE-Modell für Workstations mit viel Speicher.
Frontier-nah
MoE-schnell
Kimi K2.7 Code
91
1.000B · 32B aktiv
560 GB
256K
gut
Modified MIT
—
$0,71
Moonshots Coding-Fokus-Variante von Kimi K2.6: für lang laufende Software-Engineering-Agenten.
Coding-Spezialist
Agentisch
Sehr schnell (MoE)
Mistral Medium 3.5 128B
88
128B
75 GB
256K
stark
Modified MIT
—
—
Mistrals dichtes 128B-Flaggschiff: Instruction-Following, Reasoning und Coding in einem Modell.
Starkes Allround-Modell
256K Kontext
EU-Modell
Nemotron 3 SuperNeu
87
120B · 12B aktiv
70 GB
1M
gut
NVIDIA Nemotron Open Model
—
—
NVIDIAs offenes Reasoning-Modell aus Mamba- und Transformer-Schichten. 12 Mrd. aktive Parameter halten es schnell, das Kontextfenster reicht bis 1 Mio. Token.
1M Kontext
Agentisch
Mamba-Hybrid
Llama 3.3 70B
86
70B
43 GB
128K
gut
Llama Community
1318
$0,10
Großes Modell auf Augenhöhe mit früheren Cloud-Flaggschiffen.
Flaggschiff-Klasse
Sehr fähig
gpt-oss 120BNeu
86
117B · 5,1B aktiv
80 GB
128K
gut
Apache 2.0
1352
$0,04
OpenAIs großes offenes Modell, ausgelegt auf genau eine 80-GB-Karte. Apache 2.0 ohne Einschränkung für den kommerziellen Einsatz.
Passt auf eine H100
Tool-Calling
MXFP4 nativ
Mistral Small 4 119B
85
119B · 6,5B aktiv
70 GB
256K
stark
Apache 2.0
—
$0,08
MoE-Modell mit 119B Gesamt- und 6,5B aktiven Parametern: General-Purpose- und Reasoning-Modus in einem.
Hybrid Reasoning
Sehr schnell (MoE)
256K Kontext
Llama 4 Scout
84
109B · 17B aktiv
62 GB
10M
gut
Llama 4 Community
1321
$0,10
Riesiges Kontextfenster (10 Mio. Token) für ganze Dokumentenberge.
10M Kontext
MoE-schnell
Multimodal
Devstral 2 123B
83
123B
74 GB
256K
gut
Modified MIT
—
$0,40
Großer Coding-Agent von Mistral: 123B Parameter für anspruchsvolle Software-Engineering-Aufgaben.
Coding-Spezialist
Agentisch
256K Kontext
Qwen3.6 27BNeu
82
27B
18 GB
256K
stark
Apache 2.0
—
$0,30
Dichtes 27B-Modell, das auf Coding-Benchmarks den 397B-Vorgänger schlägt. Derzeit die beste Wahl für eine einzelne 24-GB-Karte.
Bild & Video
262K Kontext
Stark im Code
Qwen3-Coder-Next
80
80B · 3B aktiv
52 GB
256K
gut
Apache 2.0
—
$0,12
MoE-Coding-Modell: 80B-Qualität fürs Programmieren bei 3B-Tempo.
Coding-Spezialist
Sehr schnell (MoE)
Tool-Calling
Qwen3 32B
78
32B
21 GB
32K
stark
Apache 2.0
1347
$0,08
Das fähigste Modell, das noch auf eine 24-GB-GPU passt.
Stärkstes dichtes Modell
Reasoning
Gemma 4 31B
77
31B
20 GB
256K
stark
Apache 2.0
1451
—
Gemma-Flaggschiff: erstklassiges Deutsch, Bildverständnis und freie Apache-Lizenz.
Top Deutsch
Multimodal
Apache 2.0
QwQ 32BNeu
76
32,5B
21 GB
128K
stark
Apache 2.0
1336
—
Reasoning-Spezialist, der seine Zwischenschritte ausschreibt. Stark bei Mathe und Logik, dafür langsamer in der Antwort, weil er erst denkt.
Reasoning
Mathe & Logik
Apache 2.0
Gemma 3 27B
74
27B
18 GB
128K
stark
Gemma Terms
1365
$0,08
Eine der besten Optionen für deutschsprachige Aufgaben.
Top Deutsch
Multimodal
Qwen3 30B-A3B
72
30B · 3B aktiv
20 GB
32K
stark
Apache 2.0
1327
$0,12
MoE-Modell: 30B-Qualität bei der Geschwindigkeit eines 3B-Modells.
Sehr schnell (MoE)
Reasoning
gpt-oss 20BNeu
71
21B · 3,6B aktiv
16 GB
128K
gut
Apache 2.0
1317
$0,03
OpenAIs offenes Modell für Consumer-Hardware. Nur 3,6 Mrd. aktive Parameter, dadurch schnell, und dank MXFP4-Training ab 16 GB lauffähig.
Tool-Calling
Reasoning-Stufen
MXFP4 nativ
Mistral Small 3.1 24B
70
24B
16 GB
128K
stark
Apache 2.0
1303
$0,35
Europäisches Modell mit sehr gutem Tempo-zu-Qualität-Verhältnis.
EU-Modell
Schnell
Tool-Calling
DiffusionGemma 26B-A4BNeu
69
25,2B · 3,8B aktiv
14 GB
256K
stark
Apache 2.0
—
—
Erstes offenes Diffusions-LLM von Google: erzeugt Text blockweise parallel statt Token für Token, dadurch über 1.000 Tokens/Sekunde bei 25B-Qualität.
Diffusions-LLM
Extrem schnell
256K Kontext
Gemma 4 26B-A4B
68
25,2B · 3,8B aktiv
14 GB
256K
stark
Apache 2.0
1438
$0,00
Erstes MoE-Modell der Gemma-4-Reihe: 25B-Qualität bei der Geschwindigkeit eines 4B-Modells, mit nativem Tool-Calling.
Sehr schnell (MoE)
Tool-Calling
256K Kontext
Devstral Small 2 24B
67
24B
16 GB
256K
gut
Apache 2.0
—
—
Mistrals Coding-Agent in 24B: spezialisiert auf Codebasen-Exploration und Multi-Datei-Edits.
Coding-Spezialist
Agentisch
256K Kontext
Qwen3 14B
64
14B
11 GB
32K
stark
Apache 2.0
—
$0,12
Der Sweet-Spot: stark, vielseitig, läuft auf Mittelklasse-GPUs.
Reasoning
Tool-Calling
Ministral 3 14B
63
14B
11,5 GB
256K
stark
Apache 2.0
—
$0,20
Der Sweet-Spot der Ministral-3-Reihe: starkes Deutsch, Bildverständnis und 256K Kontext.
Multimodal (Bild)
256K Kontext
Starkes Deutsch
Gemma 4 12B
62
12B
9,5 GB
256K
stark
Apache 2.0
—
—
Neue Gemma-Generation: starkes Deutsch und Bildverständnis, jetzt unter Apache 2.0.
Starkes Deutsch
Multimodal
256K Kontext
Phi-4 14B
60
14B
11 GB
16K
solide
MIT
1256
$0,07
Microsofts Spezialist für Logik, Mathe und Programmierung.
Reasoning
Mathe & Code
Gemma 3 12B
58
12B
9,5 GB
128K
stark
Gemma Terms
1342
$0,05
Hervorragendes Deutsch und Bildverständnis bei moderatem Bedarf.
Starkes Deutsch
Multimodal
GLM-4.1V 9B ThinkingNeu
56
10B
8,5 GB
64K
solide
MIT
—
—
Vision-Sprachmodell mit eingebautem Reasoning-Modus: erreicht bei Bild- und Dokumentenverständnis Ergebnisse auf Augenhöhe mit 72B-Modellen.
Vision (Bild)
Reasoning
MIT-Lizenz
Qwen3-VL 8B
54
8B
7,5 GB
256K
gut
Apache 2.0
—
$0,12
Sieht Bilder und Dokumente: Qwen3 mit Vision für lokale OCR und Analyse.
Vision (Bild)
Lange Kontexte
Tool-Calling
Ministral 3 8B
53
9B
7,5 GB
256K
stark
Apache 2.0
—
$0,08
Vielseitiges 8B-Modell aus Mistrals neuer Ministral-3-Reihe mit Bildverständnis und riesigem Kontext.
Multimodal (Bild)
256K Kontext
Tool-Calling
Qwen3 8B
52
8B
7 GB
32K
stark
Apache 2.0
—
$0,12
Sehr gutes Allround-Modell für den Alltag im Unternehmen.
Reasoning
Tool-Calling
Mehrsprachig
EuroLLM 22BNeu
48
22,6B
15,5 GB
32K
stark
Apache 2.0
—
—
Größere EuroLLM-Generation aus dem UTTER-Projekt mit 22,6 Mrd. Parametern. Anders als die 9B-Version und Teuken bringt sie ein 32K-Kontextfenster mit.
35 Sprachen
Aus Europa
32K Kontext
Llama 3.1 8B
46
8B
6,5 GB
128K
solide
Llama Community
—
—
Der Klassiker mit riesigem Ökosystem an Spezialvarianten.
Weit verbreitet
Viele Finetunes
Gemma 4 E4B
41
8B
4,5 GB
128K
gut
Apache 2.0
—
—
Kompaktes multimodales Gemma-4-Modell: Bild- und Audioeingabe bei geringem Speicherbedarf dank Per-Layer-Embeddings.
Effizient (PLE)
Bild & Audio
128K Kontext
Qwen3 4B
38
4B
4 GB
32K
gut
Apache 2.0
—
—
Starker Einstieg, läuft schon auf kleinen Geräten flüssig.
Gutes Preis-Leistung
Tool-Calling
Ministral 3 3B
37
3,8B
4,5 GB
256K
gut
Apache 2.0
—
$0,10
Kompaktes Mistral-Modell mit Bildverständnis und großem Kontextfenster für schwache Hardware.
Multimodal (Bild)
256K Kontext
Klein
Gemma 3 4B
36
4B
4,5 GB
128K
gut
Gemma Terms
1303
$0,05
Kann Bilder verstehen und hat ein großes Kontextfenster.
Multimodal (Bild)
Lange Kontexte
EuroLLM 9BNeu
34
9,2B
7,5 GB
4K
stark
Apache 2.0
—
—
Europäisches Mehrsprachmodell aus dem UTTER-Projekt, auf allen EU-Amtssprachen trainiert. Wie Teuken durch 4K Kontext ausgebremst.
35 Sprachen
Aus Europa
Apache 2.0
Gemma 4 E2B
33
5,1B
3 GB
128K
gut
Apache 2.0
—
—
Winziges Edge-Modell der neuen Gemma-4-Generation mit Bild- und Audioverständnis dank Per-Layer-Embeddings.
Effizient (PLE)
Bild & Audio
Für schwache Hardware
Llama 3.2 3B
30
3B
3,5 GB
128K
solide
Llama Community
1167
$0,05
Schlankes Modell mit großem Kontextfenster.
Lange Kontexte
Edge-tauglich
Teuken 7BNeu
30
7B
6 GB
4K
stark
Apache 2.0
—
—
Vom Fraunhofer IAIS im Projekt OpenGPT-X trainiert, deutsch- und europazentriert. Das Kontextfenster von 4K und der Datenstand 2023 begrenzen den Einsatz heute stark.
Alle 24 EU-Sprachen
Aus Deutschland
Apache 2.0
Qwen3 1.7B
24
1,7B
2,5 GB
32K
gut
Apache 2.0
—
—
Kompaktes Allround-Modell mit ordentlichem Deutsch.
Klein
Mehrsprachig
Gemma 3 1B
18
1B
2 GB
32K
gut
Gemma Terms
—
—
Winziges Modell für einfache Aufgaben und schwache Hardware.
Sehr klein
Blitzschnell
Kein Modell passt zu diesen Filtern. Setze den Speicher-Filter höher.
LMArena (Stand 13.09.)
Was sich zuletzt geändert hat
Wie die Werte zustande kommen
Transparenz vorweg: Die Zahlen sind sorgfältig geschätzte Richtwerte für den Praxisbetrieb, keine Laborbenchmarks. Das Prüfdatum steht unter der Tabelle, pro Modell führt das Symbol neben dem Namen zur offiziellen Modelcard.
Speicherbedarf
Der Speicherwert gilt für die Quantisierung Q4_K_M (der Standard in Ollama und LM Studio) inklusive eines kleinen Kontextfensters. Faustregel: rund 0,55 GB pro Milliarde Parameter plus etwas Overhead. Modelle, die schon quantisiert trainiert wurden (gpt-oss, Kimi K3), führen stattdessen die vom Hersteller genannte Mindestgröße, und wo der Hersteller keine veröffentlicht hat, das Gewicht der veröffentlichten Dateien.
Mixture-of-Experts
Bei MoE-Modellen bestimmt die Gesamtzahl der Parameter den Speicherbedarf (alle Experten liegen im RAM), während nur die aktiven Parameter das Tempo bestimmen. Daher der Geschwindigkeitsvorteil bei gleicher Größe.
Stärke-Richtwert
Die Stärke ist ein gerundeter Richtwert (0–100), der mit der Modellgröße steigt. Er hilft beim Vergleich innerhalb dieser Liste, ist aber kein offizieller Benchmark-Score.
Hinweis zum Kontextfenster: Die Qwen3-Textmodelle ab 4B laufen nativ mit 32K Token und lassen sich per YaRN auf bis zu 128K erweitern (das 1.7B-Modell bleibt bei 32K). Die Tabelle zeigt den nativen Wert.
Häufige Fragen
Welches lokale KI-Modell ist am besten für Deutsch?
Für deutschsprachige Aufgaben gelten die Gemma-Modelle als besonders stark, gefolgt von Qwen3 und Mistral. Die Tabelle zeigt die Deutsch-Qualität pro Modell als Einschätzung.
Was bedeutet das Kontextfenster?
Das Kontextfenster ist die Textmenge in Token, die ein Modell gleichzeitig verarbeiten kann. 32K reichen für die meisten Aufgaben; lange Dokumente profitieren von 128K oder mehr. Mehr Kontext kostet zusätzlichen Speicher.
Sind diese Modelle kommerziell nutzbar?
Das hängt von der Lizenz ab (Spalte „Lizenz“). Apache 2.0 und MIT erlauben freie kommerzielle Nutzung; Lizenzen wie die Llama Community License oder die Gemma Terms haben Einschränkungen, die du im Zweifel in der Original-Lizenz prüfen solltest.
Was ist ein MoE-Modell?
Bei einem Mixture-of-Experts-Modell liegen alle Parameter im Speicher, aber pro Token rechnet nur ein Bruchteil davon (die aktiven Parameter). Dadurch ist es so schnell wie ein viel kleineres Modell, braucht aber den Speicher des großen.
Vom Modell zum Produktivsystem
Lass dein Modell lokal laufen, Corporate LLM macht ein Produktivsystem draus: RAG, Agenten-System, Skills und Connectoren. 100% DSGVO-konform.