Ein 3,4-GB-Download namens qwen3.5:4b-q4_K_M (ein LLM, ein grosses Sprachmodell) beantwortet heute Abend auf einem ganz normalen 16-GB-Laptop eine Frage – ohne Cloud-Konto. Lade das Modell mit Ollama, stell ihm eine Frage mit 4K-Kontext, und schon läuft ein echtes KI-Modell lokal auf der Hardware, die du bereits besitzt. Es verarbeitet Text und Bilder. Dabei geht es um Inferenz, nicht um Training: Das Modell lernt nichts Neues, sondern antwortet einfach.
Ein vager "AI PC"-Aufkleber auf dem Laptopkarton ersetzt keine belastbaren technischen Daten. Entscheidend sind RAM, der Speicher, den die GPU nutzen kann, Speicherplatz und echte Software-Unterstützung. 16 GB Arbeitsspeicher sind ein solider Einstieg in kleine KI-Modelle – kein Wert, den du sofort abhaken musst, aber auch kein Versprechen für alles, was ein Datenblatt bewirbt. Mehr Speicher bringt mehr Kontext und mehr Spielraum fürs Multitasking. Mit 16 GB kannst du loslegen.
Die Downloadgrösse eines Modells und sein RAM-Bedarf während der Ausführung sind zwei verschiedene Dinge. Wer beides verwechselt, macht den häufigsten Fehler beim Laptopkauf für KI. Die 3,4 GB von qwen3.5:4b-q4_K_M sind die Datei auf der SSD. Zum Laden braucht das Modell echten Arbeitsspeicher. Das gilt auch für das Kontextfenster, also den laufenden Gesprächsverlauf, den das Modell während der Antwort im Speicher hält, den sogenannten KV-Cache. Dazu kommen die Engine selbst und alles andere, was dein Betriebssystem und andere Apps bereits belegen.
Ollama lädt standardmässig einen Kontext von 4.096 Tokens, und du kannst ihn erhöhen. Wenn mehrere Anfragen gleichzeitig laufen, steigt der Speicherbedarf für den Kontext grob mit der Zahl der parallelen Anfragen. Auf dem Datenblatt eines Modells stehen vielleicht 128K oder 256K Tokens Kontextfenster. Sieh das als Obergrenze des Modells – nicht als Zusage, dass dein 16-GB-Laptop das alles gleichzeitig stemmen kann.
Apple-Silicon-Chips nutzen Unified Memory: CPU und GPU greifen auf denselben gemeinsamen Pool von 16, 24 oder 32 GB zu. Es gibt also keinen separaten Grafikspeicher, der knapp werden kann. Ein typischer Windows- oder Linux-Laptop mit dedizierter NVIDIA-GPU funktioniert anders. System-RAM und der eigene VRAM der GPU sind zwei getrennte Speicherpools – 16 GB Arbeitsspeicher plus eine 8-GB-GPU ergeben also nicht einfach einen frei nutzbaren 24-GB-Pool für ein Modell.
Wenn ein Modell nicht komplett auf die GPU passt, läuft ein Teil davon stattdessen auf der CPU. Dieses teilweise Offloading kann ein Modell, das sich technisch noch laden lässt, spürbar ausbremsen. Mit ollama ps siehst du genau diese CPU/GPU-Aufteilung für alles, was gerade geladen ist.
Kapazität ist nur die halbe Geschichte. Genauso wichtig ist, wie schnell sich dieser Speicher ansprechen lässt: Apple nennt 153 GB/s Speicherbandbreite für das MacBook Air M5. Genau diese Bandbreite, nicht nur die Grösse, ist ein Grund dafür, dass sich Unified Memory reaktionsschnell anfühlt und nicht bloss gerade so reicht.
Quantisierung steckt hinter diesem 3,4-GB-Download: Wenn die Gewichte eines Modells mit geringerer numerischer Präzision gespeichert werden, schrumpft die Datei. Beim 9B-Modell von Qwen3.5 sieht man die Spanne besonders deutlich. Dasselbe 9B-Modell wird als Q4_K_M mit 6,6 GB heruntergeladen, als Q8_0 mit 11 GB und mit voller BF16-Präzision mit 19 GB. Dasselbe Modell, dieselbe Parameterzahl – aber drei sehr unterschiedliche Downloadgrössen. Und wieder gilt: Das ist die Dateigrösse, nicht der RAM-Bedarf während der Ausführung.
Geringere Präzision kostet in der Regel etwas Qualität. Wie viel genau, hängt aber von der Aufgabe ab und nicht von einem festen Prozentsatz. Bevor du Qwen als erstes Modell auswählst, solltest du noch etwas wissen: Manche Nutzer:innen berichten, dass der "Thinking"-Schritt eine spürbare Verzögerung erzeugt, bevor eine Antwort erscheint, verglichen mit Modellen, die direkter antworten. Am besten probierst du beide Ansätze mit deinen eigenen Aufgaben aus, statt einfach anzunehmen, einer sei grundsätzlich besser.
Wenn du bereits ein MacBook mit 16 GB besitzt, starte mit einem 2-4B-Modell in Q4-Präzision und einem 4K-Kontext, bevor du überhaupt an einen Neukauf denkst. Ein 9B-Q4-Modell oder etwas wie Gemma 4 12B QAT könnte ebenfalls laufen. Ob das klappt, hängt davon ab, wie viele andere Apps geöffnet sind, wie viel Kontext du nutzt und wie warm das Gerät schon ist. Sieh es also als sinnvollen Test, nicht als Garantie.
Du willst dafür gezielt ein neues Gerät kaufen? Das MacBook Air 13" mit M5-Chip kommt standardmässig mit 16 GB Unified Memory und lässt sich auf bis zu 32 GB konfigurieren. Der grössere Bildschirm klingt nach einem Upgrade. Das 15-Zoll-M5-Air startet aber mit denselben Speicheroptionen von 16, 24 und 32 GB und derselben Bandbreite von 153 GB/s wie das 13-Zoll-Modell. Wähle die Bildschirmgrösse nach Komfort – mehr KI-Spielraum bekommst du dadurch nicht.
Auch ein Windows- oder Linux-Laptop mit 16 GB ohne dedizierte GPU kann ein kleines Modell ausführen. Ollama läuft nativ unter Windows – lade also ein 2-4B-Q4-Modell und probiere es auf der CPU oder mit integrierter Grafik aus, bevor du Geld ausgibst. Rechne dabei mit grösseren Unterschieden als bei Apple Silicon: Eine feste Zahl für Tokens pro Sekunde lässt sich nicht für jedes Gerät angeben, weil nicht jede Konfiguration vermessen wurde.
Das Lenovo ThinkPad T14 G2 und das HP EliteBook x360 1040 G7 bieten beide 16 GB RAM mit integrierter Grafik, also genau diese Klasse. Gerade bei älteren refurbished Geräten wie diesen beiden solltest du zuerst einen Punkt prüfen: LM Studio setzt unter Windows x64 AVX2-Unterstützung voraus, und nicht alle älteren CPUs beherrschen diesen Befehlssatz. Prüfe deinen konkreten Prozessor, bevor du davon ausgehst, dass jeder Laptop in dieser Klasse das gewählte Tool ausführen kann.
NVIDIAs Laptop-GPUs tragen dieselben Namen wie Desktop-Karten – und der Name verrät weniger, als man denkt. Die RTX 5060 Laptop GPU bringt 8 GB GDDR7-Speicher und einen veröffentlichten Leistungsbereich von 45 bis 100 Watt mit. Die RTX 5070 Ti Laptop GPU bietet 12 GB GDDR7 und 60 bis 115 Watt. Ein Online-Ergebnis für eine Desktop-RTX-5070-Ti lässt sich also nicht einfach auf eine Laptop-RTX-5070-Ti übertragen, auch wenn der Name das nahelegt.
Im selben Namen steckt noch eine zweite Falle. Zwei Laptops können beide eine "RTX 5070 Ti Laptop GPU" haben und sich unter Dauerlast trotzdem unterschiedlich verhalten: Ein dünnes, leichtes Gehäuse und ein dickeres, schwereres Modell führen Wärme unterschiedlich ab. Derselbe GPU-Name garantiert deshalb nicht dieselbe Praxisgeschwindigkeit, sobald die Lüfter eine Weile laufen. Prüfe immer die genaue VRAM-Angabe und die konkrete Leistungskonfiguration des Laptops – nie nur den Namen der GPU-Familie.
Wenn du gezielt ein Gerät suchst, das regelmässig lokale KI ausführen soll, sind 24 bis 32 GB Unified Memory die entspanntere Apple-Klasse: Damit bleibt echter Spielraum für ein grösseres Modell, mehr Kontext oder einfach dafür, andere Apps offen zu lassen, während du arbeitest. 32 GB lohnen sich, wenn du das häufig nutzen willst und dein Budget es hergibt.
Das MacBook Pro 13" mit M2-Chip ist ein konkretes refurbished Beispiel oberhalb der 16-GB-Einstiegsklasse: Seine 8-Core-CPU und 10-Core-GPU lassen sich mit bis zu 24 GB Unified Memory kombinieren. Der Chip ist älter als der im M5 Air. Entscheidend ist deshalb seine Obergrenze von 24 GB – nicht die separaten 24- und 32-GB-Optionen des M5 Air.
Wenn du einen neuen Windows- oder Linux-Laptop gezielt für lokale KI kaufst, achte auf 32 GB Arbeitsspeicher zusammen mit einer dedizierten NVIDIA-Laptop-GPU mit mindestens 8 GB eigenem VRAM, besser 12 GB, wenn ein etwas schwereres oder teureres Gerät für dich in Ordnung ist. 8 GB sind ein realistisches Ziel für 4-7B-Modelle in Q4-Präzision mit moderatem Kontext, bieten aber nicht automatisch genug Spielraum: Selbst der 6,6-GB-Download eines 9B-Q4-Modells kann für entspanntes Arbeiten mehr als nur 8 GB benötigen. Mit 12 GB lassen sich Modelle dieser Grösse deutlich leichter testen.
Das Dell Precision 7730 ist ein konkretes refurbished Beispiel für dieses Grundprinzip, auch wenn es nicht exakt die neuen Chips von oben nutzt: 32 GB Arbeitsspeicher treffen hier auf eine dedizierte NVIDIA Quadro P3200 mit eigenen 6 GB VRAM. Das ist eine andere GPU-Generation und -Klasse als NVIDIAs aktuelle RTX 5060 und 5070 Ti Laptop GPUs – das Prinzip getrennter Speicherpools bleibt aber dasselbe.
AMDs Ryzen-AI-Max+-395-Prozessor unterstützt je nach Konfiguration des fertigen Laptops bis zu 128 GB LPDDR5x-Arbeitsspeicher. Das ist eine andere Speicherarchitektur, die man kennen sollte – allerdings mit einem Haken: In Ollamas Linux-ROCm-Supportliste taucht dieser Chip auf, in der Windows-ROCm-Liste aktuell nicht.
Das ist kein Grund, den Chip pauschal abzuschreiben. Bei einem konkreten Laptop solltest du aber den tatsächlich verbauten Speicher, das Betriebssystem, das GPU-Backend, den Treiber und das Verhalten mit Ollama genau prüfen, bevor du ihn empfiehlst. Sieh einen AMD-Laptop mit viel Speicher als interessante Alternativarchitektur, die sorgfältige Recherche verdient – nicht als automatischen Erstkauf für alle, die lokale KI gerade erst ausprobieren.
Ollama ist der einfachste Weg, ein Modell auf deinem eigenen Rechner zum Laufen zu bringen: Du lädst ein Modell und startest es – schon beantwortet ein lokaler Server Anfragen, ganz ohne Cloud-Konto für ein heruntergeladenes Modell. Hinter allen Beispielen hier steckt genau dieses Tool.
LM Studio ist die grafische Alternative mit eigenem Modellbrowser und Chatfenster. Das Tool nennt auch seine Mindestanforderungen: mindestens 16 GB RAM auf dem Mac oder unter Windows sowie AVX2-Unterstützung unter Windows x64; unter Windows werden ausserdem 4 GB dedizierter VRAM empfohlen. Beide Werkzeuge sauber einzurichten, ist noch einmal ein eigenes Thema.
Ein wichtiger Hinweis, bevor du irgendeiner einzelnen Geschwindigkeitsangabe im Netz vertraust: Das offizielle Tool llama-bench trennt die Geschwindigkeit der Prompt-Verarbeitung von der Generierungsgeschwindigkeit und zeigt Schwankungen über mehrere Durchläufe statt nur einer einzigen Zahl. Ein Forenbeitrag mit einer einzelnen Tokens-pro-Sekunde-Angabe verrät meist nicht, welcher der beiden Werte gemeint ist oder wie oft überhaupt gemessen wurde.
Wenn du gezielt für lokale KI kaufen oder aufrüsten willst, prüfe die konkreten Details statt des Marketings.
Exaktes GPU-Modell und VRAM: Prüfe nicht nur den Namen der GPU-Familie, sondern auch die genaue Laptop-Variante und ihre konkrete Speicherausstattung. Hinter demselben Namen können unterschiedliche VRAM-Grössen stecken.
Verlöteter oder aufrüstbarer RAM: Bei manchen Laptops kannst du später Speicher nachrüsten, bei vielen modernen dünnen und leichten Geräten nicht. Das solltest du vor dem Kauf wissen.
Freier SSD-Speicher: Modelldownloads reichen von unter einem Gigabyte bis deutlich über zehn Gigabyte. Eine wachsende Sammlung summiert sich neben deinen übrigen Dateien schnell.
Thermisches Verhalten unter Dauerlast: Ein Modell, das eine einzige Frage beantwortet, und ein Laptop, der mehrere Anfragen hintereinander bearbeitet, sind zwei verschiedene Tests. Lüftergeräusche und Drosselung nach wiederholten Prompts sagen mehr aus als eine einzelne kurze Demo.
Betriebssystem- und Treiberunterstützung: Prüfe, ob deine konkrete Kombination aus GPU-Backend und Betriebssystem von Ollama oder LM Studio unterstützt wird, statt die Unterstützung vorauszusetzen.
Die NPU-TOPS-Zahl auf dem Karton ist keine Garantie für den Durchsatz. Das ist ein Marketingwert, kein getestetes Ergebnis der Engine, die du tatsächlich nutzen wirst. Ein vages "AI PC"-Label ersetzt keine der Prüfungen oben.
Brauche ich eine dedizierte GPU, um KI lokal auszuführen?
Nein. Ein kleines Modell läuft auf vielen 16-GB-Laptops auch auf der CPU oder mit integrierter Grafik, nur mit grösseren Unterschieden bei der Geschwindigkeit als auf einem Laptop mit dedizierter GPU. Starte mit einem 2-4B-Modell, bevor du überhaupt davon ausgehst, dass du dedizierte Grafik brauchst.
Reichen 8 GB RAM aus?
Für die hier besprochenen Modelle ist das nicht komfortabel. 16 GB sind der realistische Einstieg, wenn du berücksichtigst, dass Modell, Kontextfenster, Engine und Betriebssystem denselben Speicher teilen.
Ist es dasselbe, ein Modell lokal auszuführen und es zu trainieren?
Nein. Alles oben ist Inferenz: Du stellst einem bereits trainierten Modell Fragen. Beim Training wird ein Modell von Grund auf aufgebaut, und dafür braucht es deutlich mehr Hardware als alles, was hier vorgestellt wird.
Garantiert mehr RAM schnellere Antworten?
Nein. Mehr Speicher schafft Spielraum für grössere Modelle, längeren Kontext und mehr geöffnete Apps. Die tatsächliche Geschwindigkeit hängt aber von Speicherbandbreite, GPU-Backend und dem konkreten Modell ab – nicht allein von der Speichergrösse.
Bleiben meine Daten privat, wenn ein Modell lokal läuft?
Ja – in dem Sinn, dass deine Prompts auf deinem Rechner bleiben und nicht an einen Cloud-Anbieter gehen. Ollama ist standardmässig an deinen eigenen Laptop gebunden und sendet keine Anfragen an andere Orte, solange du nicht bewusst Cloud-Zugriff einrichtest.
Du hast schon einen 16-GB-Laptop? Installiere heute Abend Ollama und probiere ein kleines Modell aus, bevor du auch nur einen Euro für etwas Neues ausgibst. Wenn du gezielt dafür kaufst, nutze die Checkliste oben und die fünf refurbished Laptops aus diesem Ratgeber für einen ersten Vergleich – statt dich auf ein Marketing-Datenblatt zu verlassen.
Jeder Laptop auf refurbed wird geprüft und bewertet, bevor er gelistet wird. Du bekommst also den RAM und die Konfiguration, die du kaufst. Im nächsten Ratgeber dieser Serie geht es darum, wie du deine erste App mit dem Modell verbindest, das du gerade ausprobiert hast.
Erstmals zum Newsletter anmelden, CHF 15 sparen!
Verpasse kein Angebot mehr.
Informationen über die Verwendung personenbezogener Daten findest du in unserer Datenschutzerklärung.
Anmeldung bestätigen
Klicke auf den Link in unserer Bestätigungs-Mail, um deinen Gutschein zu erhalten. Er gilt ab einem Einkauf von 200 CHF.