Lokale KI auf deinem Laptop: Dein erster eigener KI-Dienst

Ein KI-Modell auf deinem Laptop beantwortet deine Frage ganz ohne Internetverbindung. Anschliessend beantwortet es dieselbe Frage für eine zweite App auf demselben Rechner – ohne dass du etwas umstellen musst. So wird aus dem Laptop, den du bereits nutzt, ein kleiner, persönlicher KI-Dienst, den andere Apps und Skripte aufrufen können.

Du lädst ein fertiges Modell herunter und führst es aus, statt selbst eines zu trainieren. Falls du noch nicht geprüft hast, ob dein Laptop dafür genug RAM oder VRAM hat, lies zuerst wie viel RAM dein Laptop für lokale KI braucht. Weisst du bereits, dass dein Gerät die Anforderungen erfüllt, kannst du direkt weiterlesen.

Vier Ebenen: So ist ein lokales KI-Setup aufgebaut

Ein lokales KI-Setup lässt sich in vier getrennte Ebenen unterteilen – die vierte ist optional. Wenn du sie auseinanderhältst, kannst du die folgenden Schritte leichter nachvollziehen.

Modellgewichte werden als Datei heruntergeladen – zum Beispiel als 3,4 GB grosse, quantisierte Version eines kleinen Modells. Die 3,4 GB geben an, wie viel Platz die Datei auf deinem Laufwerk belegt – nicht, wie viel RAM das Modell im Betrieb braucht.

Die Inferenz-Engine ist das Programm, das die Modellgewichte lädt und Anfragen beantwortet. Hier übernimmt Ollama diese Aufgabe und stellt eine lokale HTTP-API bereit. So können andere Apps deinen Laptop als KI-Dienst nutzen.

Das Frontend schickt die Anfrage ab und entscheidet, ob der Prompt auf deinem Laptop bleibt oder anderswohin gesendet wird. Das kann Ollamas integrierter Chat sein, ein kurzes Skript oder eine separate App.

Ein optionaler Dokumentenindex lässt das Chatmodell deine eigenen Dateien durchsuchen. Dafür brauchst du ein separates Embedding-Modell und einen eigenen Speicherbereich. Der Index wird nicht automatisch angelegt und ist nicht Thema dieser Anleitung.

Kurz gesagt: Eine App oder ein Skript ruft 127.0.0.1:11434 auf. Dort nimmt Ollama die Anfrage entgegen und lädt das Modell, das du heruntergeladen hast. Löschst du das Modell, bleibt der gespeicherte Chatverlauf eines Frontends erhalten – er ist an einem anderen Ort gespeichert.

Vor der Installation: Ist dein Laptop ähnlich ausgestattet wie eines dieser beiden Modelle?

Nimm dir vor der Installation zwei Minuten Zeit und notiere dir die wichtigsten Daten deines Laptops: RAM-Grösse, Betriebssystem, Prozessor und den freien Speicherplatz auf der SSD. Hat er dedizierten Grafikspeicher (VRAM), halte auch dessen Grösse fest. Wie viel RAM und VRAM lokale KI braucht und warum, erfährst du im Ratgeber wie viel RAM dein Laptop für lokale KI braucht.

Diese beiden Laptops sind aktuell bei refurbed erhältlich. Beide sind refurbished: Sie wurden professionell geprüft, gereinigt und wiederaufbereitet. Für beide gilt eine Garantie von 12 Monaten. Das eine gehört zu Apples Einstiegsmodellen mit Apple Silicon, das andere ist ein Windows-Laptop mit dediziertem Grafikspeicher. Mit beiden kannst du alle folgenden Schritte durchführen.

Ollama auf macOS, Windows oder Linux installieren

Lade unter macOS oder Windows die offizielle Ollama-App herunter. Unter Linux folgst du der Installationsanleitung von Ollama. Starte Ollama nach der Installation einmal. Falls unter Linux noch kein Ollama-Dienst Anfragen entgegennimmt, führe ollama serve aus.

Mit der aktuellen App kannst du Modelle lokal ausführen oder Cloud-Optionen nutzen. Wähle den Tag eines heruntergeladenen lokalen Modells. Für die lokale Inferenz musst du dich nicht anmelden.

Für diese Anleitung lädst du das Modell qwen3.5:4b-q4_K_M herunter. Der Download ist 3,4 GB gross. Der konkrete Modell-Tag ist wichtig: Die allgemeine Bezeichnung „latest“ kann unbemerkt auf ein deutlich grösseres Modell verweisen als das, mit dem du getestet hast. Die 3,4 GB geben die Dateigrösse auf dem Laufwerk an. Wie viel RAM das Modell beim Beantworten von Anfragen braucht, lässt sich daraus nicht ablesen.

So lädst du dein erstes Modell herunter und startest den ersten Chat

Für den ersten Chat mit dem Modell genügen zwei Befehle:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

Der erste Befehl lädt das Modell herunter, der zweite öffnet einen interaktiven Chat. Gib dem Modell statt einer allgemeinen Begrüssung eine kleine, konkrete Aufgabe, zum Beispiel: „Mach aus diesen drei Besprechungsnotizen eine Aufgabenliste. Erfinde keine Datumsangaben.“

Wenn du fertig bist, gib /bye ein, um den Chat zu beenden.

Die KI läuft jetzt lokal auf deinem Laptop: So rufst du die API auf

Im Terminal kommuniziert das Chat-Frontend mit der Engine. Jetzt rufst du die Engine direkt auf – so wie eine andere App.

Unter macOS oder Linux:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'

Unter Windows mit PowerShell:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'

Den Antworttext findest du im Feld message.content. Wenn du stream auf false setzt, erhältst du die vollständige Antwort auf einmal statt in einzelnen Teilen. Mit num_ctx: 4096 hältst du den Kontext für den ersten Test überschaubar; das beworbene Maximum des Modells liegt deutlich höher.

Was du aus der Antwort ablesen kannst

Neben dem Antworttext unter message.content liefert Ollama weitere Angaben, mit denen du die Geschwindigkeit einordnen kannst: load_duration, prompt_eval_count, prompt_eval_duration, eval_count und eval_duration.

Die Felder zeigen dir, wie lange das Laden des Modells in den Arbeitsspeicher oder den Grafikspeicher und die Antwortgenerierung jeweils dauern. Eine einzelne Angabe in „Tokens pro Sekunde“ unterscheidet diese beiden Schritte nicht. Die erste Anfrage nach dem Start von Ollama dauert meist am längsten, weil das Modell erst geladen werden muss. Bei der nächsten Anfrage entfällt diese Ladezeit.

Konkrete Messwerte hängen ganz von deinem Laptop ab. Deshalb nennen wir hier keine Zahlen als typische Werte. Vergleiche lieber die Werte aus zwei Durchläufen auf demselben Laptop, statt dich auf eine einzelne Geschwindigkeitsangabe zu verlassen.

Modelle prüfen: ps, ls und automatisches Entladen bei Inaktivität

Mit drei Befehlen prüfst du geladene Modelle, listest Downloads auf und löschst Modelle, die du nicht mehr brauchst.

ollama ps zeigt, welche Modelle gerade geladen sind und auf welcher Hardware sie laufen. In der Prozessorspalte siehst du 100 % GPU, 100 % CPU oder eine Aufteilung zwischen beiden.

ollama ls listet alle heruntergeladenen Modelle auf.

ollama rm qwen3.5:4b-q4_K_M löscht ein heruntergeladenes Modell, das du nicht mehr brauchst.

Standardmässig entlädt Ollama ein Modell nach fünf Minuten Inaktivität. Zeigt ollama ps kein geladenes Modell an, schick erst eine neue Anfrage, bevor du einen Fehler vermutest.

Eine zweite App über die lokale OpenAI-kompatible API anbinden

Jetzt stellt dein Laptop das Modell auch einer zweiten App bereit. Dafür verbindest du sie mit Ollama auf demselben Rechner statt mit einem Cloud-Dienst.

Die meisten Apps, bei denen du einen OpenAI-kompatiblen Endpunkt selbst eintragen kannst, verlangen drei Angaben: Basis-URL, Modellname und API-Schlüssel. Trage http://localhost:11434/v1/ als Basis-URL und qwen3.5:4b-q4_K_M als Modellnamen ein.

Manche Apps akzeptieren beim API-Schlüssel kein leeres Feld. Die Ollama-Dokumentation verwendet deshalb den Platzhalter api_key='ollama' und stellt klar: Der lokale Server verlangt einen nicht leeren Eintrag, prüft den Wert aber nicht. Die Zeichenfolge authentifiziert nichts – sie ist kein Passwort, sondern füllt nur ein Formularfeld aus.

Die OpenAI-Kompatibilität umfasst nur einen Teil der jeweiligen API. Teste deshalb jede Funktion, die du nutzen möchtest, mit deiner App – etwa Bildeingaben oder Tool-Calling. Gehe nicht davon aus, dass alle Funktionen unterstützt werden.

Internetverbindung trennen, Anfrage wiederholen: Läuft das Modell lokal?

Bisher lässt sich nicht ausschliessen, dass im Hintergrund doch eine Internetverbindung genutzt wird. Ein Offline-Test schafft Klarheit.

Sobald das Modell vollständig heruntergeladen ist, schalte das WLAN deines Laptops aus oder zieh das Netzwerkkabel. Wiederhole dann dieselbe Anfrage wie zuvor – im Chat oder über die API. Bekommst du ohne jede Internetverbindung eine Antwort auf deine Frage, ist bewiesen, dass das Modell lokal läuft.

Als Beweis zählt weder eine Antwort, die du nur mit Internetverbindung bekommst, noch eine Antwort von https://ollama.com statt localhost. Auch der Tag eines Cloud-Modells statt des Tags eines heruntergeladenen Modells ist kein Nachweis. Anfragen an ein lokales Modell bleiben auf deinem Laptop; Ollamas separate Cloud-Modelle laufen dagegen über einen gehosteten Dienst.

Dein Offline-KI-Assistent: Was deine Privatsphäre schützt – und was nicht

Ein lokales KI-Setup bleibt nicht automatisch privat. Deshalb solltest du wissen, was dich schützt und worauf du dich nicht verlassen kannst.

Standardmässig nimmt Ollama Anfragen nur unter 127.0.0.1:11434 entgegen. Damit ist der Dienst ausschliesslich von deinem Laptop aus erreichbar. Lass diese Einstellung unverändert: Setze OLLAMA_HOST=0.0.0.0 nicht und richte keine Portweiterleitung ein, die Port 11434 aus dem öffentlichen Internet erreichbar macht. Ollama prüft den Wert des Platzhalter-API-Schlüssels aus dem vorigen Abschnitt nicht. Ist der Port öffentlich erreichbar, kann deshalb jeder auf den Dienst zugreifen.

Du kannst Ollamas eigene Cloud-Funktionen auch vollständig deaktivieren. Das ist optional: Mit dem Tag eines heruntergeladenen lokalen Modells hast du dich bereits für die lokale Ausführung entschieden. Trage {"disable_ollama_cloud": true} in ~/.ollama/server.json ein oder setze OLLAMA_NO_CLOUD=1. Starte Ollama danach neu, damit die Änderung wirksam wird.

Wenn du aus einem anderen Zimmer oder von einem anderen Gerät aus auf Ollama zugreifen willst, wird die Einrichtung anspruchsvoller. Dazu gehören ein privates Netzwerk und ein vorgeschalteter Proxy mit Authentifizierung. Darauf gehen wir hier nicht ein. Eine direkte Portfreigabe ist dafür nicht der richtige Weg.

Wenn es hakt: Das kannst du zuerst prüfen

Hier findest du die häufigsten Probleme und erfährst, was du zuerst prüfen kannst.

Verbindung verweigert. Prüfe, ob die Ollama-App oder ollama serve läuft, und versuche es erneut.

Die erste Antwort dauert länger als die folgenden. Das liegt am Laden des Modells, nicht an der Geschwindigkeit der Antwortgenerierung. An den zuvor genannten Feldern der Antwort erkennst du den Unterschied.

Alles wirkt deutlich langsamer als erwartet. Mit ollama ps siehst du, ob das Modell nur auf der CPU oder auf CPU und GPU läuft. Prüfe ausserdem, ob deine GPU und die zugehörigen Treiber unter deinem Betriebssystem unterstützt werden.

Wenig freier Arbeitsspeicher oder Abstürze. Nutze den Tag eines kleineren Modells, reduziere num_ctx und schliesse andere speicherhungrige Apps. Versuche es dann erneut.

Der Speicherplatz wird knapp. Mit ollama ls siehst du, welche Modelle heruntergeladen sind. Ungenutzte Modelle entfernst du mit ollama rm.

Passt dieses Setup nicht zu dir, etwa weil du Modelle in einer grafischen Oberfläche durchstöbern oder CPU und GPU feiner steuern möchtest, schau dir stattdessen LM Studio oder llama.cpp an. Das spricht für einen Wechsel der Engine – nicht dafür, zwei Setups parallel zu betreiben.

Häufige Fragen zur lokalen KI auf dem Laptop

Brauche ich nach der Einrichtung noch Internet? Nein. Sobald das Modell vollständig heruntergeladen ist, kannst du mit ihm chatten und es über die API ansprechen – beides ohne Internetverbindung.

Schützt der Platzhalter-API-Schlüssel meinen Endpunkt? Nein. Ollamas lokaler Server akzeptiert jeden nicht leeren Wert, ohne ihn zu prüfen. Der Schlüssel, den manche Apps verlangen, ist deshalb keine Sicherheitsmassnahme.

Bleibt mein Prompt auf meinem Laptop? Ja, wenn du den Tag eines heruntergeladenen lokalen Modells nutzt. Ollama bietet auch separate Cloud-Modelle an, die über einen gehosteten Dienst laufen. Ob dein Prompt auf dem Laptop bleibt, hängt also vom gewählten Modell-Tag ab – nicht von einer versteckten Voreinstellung.

Brauche ich eine dedizierte Grafikkarte? Nein. Auch allein mit der CPU kann dein Laptop ein kleines Modell ausführen – in der Regel langsamer. Mit ollama ps siehst du, ob die CPU, die GPU oder beide deine Anfrage verarbeitet haben.

Wie nutze ich ein grösseres oder anderes Modell? Prüfe zuerst RAM und VRAM. Dann ersetzt du in den Befehlen ollama pull und ollama run den Modell-Tag. Die Hintergründe erfährst du im Ratgeber „Wie viel RAM dein Laptop für lokale KI braucht“.

Merkt sich das Modell meine Dokumente ab jetzt dauerhaft? Nein. Ein Chatmodell speichert den Inhalt eines Ordners nicht von selbst dauerhaft. Um eigene Dateien zu durchsuchen, brauchst du einen separaten Dokumentenindex. Diese optionale Einrichtung behandeln wir hier nicht.

Jetzt bist du dran: Setz deinen eigenen KI-Dienst ein

Such dir eine echte Aufgabe aus und bearbeite sie auf beiden Wegen: im integrierten Chat und in der zweiten App, die du eben verbunden hast. Du könntest eine persönliche Notiz zusammenfassen, mehrere Dateien in benannte Gruppen sortieren oder dir einen kurzen Codeausschnitt in einfachen Worten erklären lassen.

Welche Aufgabe du auch wählst: Notiere dir den genauen Modell-Tag, die Engine-Version, die Kontexteinstellung, die URL und die Aufgabe selbst. Damit lässt sich das Ergebnis später reproduzieren – von dir oder von anderen, die dasselbe ausprobieren.

Hat sich gezeigt, dass dein Laptop für dieses Setup zu wenig RAM oder VRAM hat, ist ein Gerät mit mehr Reserven eine Überlegung wert. Im nächsten Teil der Reihe zeigen wir dir, wie du dir eine kleine Auswahl an Modellen zusammenstellst: eines für Chats, eines für Code und eines für die Suche.

Refurbished Laptop für lokale KI, erhältlich bei refurbed

Erstmals zum Newsletter anmelden, CHF 15 sparen!

Verpasse kein Angebot mehr.

Informationen über die Verwendung personenbezogener Daten findest du in unserer Datenschutzerklärung.