KI Neuigkeiten
09 Aug. 2026
Read 10 min
lokale KI Erweiterungen für VS Code: So Kosten senken
lokale KI Erweiterungen für VS Code sparen Credits halten Code privat & beschleunigen Routineaufgaben.
Wer Cloud-Kosten senken will, kann Routineaufgaben lokal erledigen: lokale KI Erweiterungen für VS Code bringen Chat, Code-Vervollständigung und sogar Agenten direkt auf deinen Rechner. In diesem Überblick siehst du, welche Tools auf Ollama setzen, wie sie Credits bei Copilot sparen und deinen Code auf dem Gerät halten.
Seit dem 1. Juni rechnet GitHub Copilot nutzungsbasiert ab. Chat, Agenten und viele Modell-Features verbrauchen nun AI Credits. Code-Vervollständigungen und „Next Edit“ bleiben inklusive. Das macht lokale Alternativen attraktiver. Der folgende Überblick zeigt, wie lokale KI Erweiterungen für VS Code dabei helfen können, Alltagsarbeit vom Cloud-Meter zu lösen.
Alle hier gezeigten Erweiterungen setzen auf Ollama als lokalen Laufzeitdienst. Die Auswahl beruht auf einer Suche im Visual Studio Code Marketplace nach der exakten Phrase „local AI“, sortiert nach Installationen. Es ist keine Wertung oder Empfehlung. Installationszahlen zeigen Installationen, nicht aktive Nutzer. Stand der Zahlen: 4. August 2026.
Top-Tools: lokale KI Erweiterungen für VS Code im Überblick
Local AI Pilot – Ollama
- Publisher: Offline AI
- Installs: 16.9K
- Rating: 4/5
- Kosten: Free
- Engine: Ollama
Local AI Pilot läuft standardmäßig direkt gegen eine lokale Ollama-Instanz. Es bietet Chat, Code-Completion, kontextuelle Vorschläge sowie Befehle zum Erklären, Fixen oder Review von markiertem Code. Ein Container-Modus ergänzt RAG-Dokumentfragen, Chat-Historie und Caching. Achtung: In dieser Konfiguration kann das Tool auch entfernte Anbieter wie OpenAI, Anthropic, Google Gemini, Cohere oder Mistral AI nutzen. Ob Daten lokal bleiben, hängt also von der Einstellung ab. Für Completions empfiehlt die Doku FIM-Modelle; große Modelle brauchen spürbar mehr RAM und Rechenleistung. Chat- und Completion-Modelle lassen sich getrennt wählen.
DeepSeek Offline
- Publisher: Vatsalya Gautam
- Installs: 6.2K
- Rating: k. A.
- Kosten: Free
- Engine: Ollama mit DeepSeek-R1
DeepSeek Offline fokussiert sich auf das kompakte Modell deepseek-r1:1.5b über Ollama. Es liefert eine Seitenleiste für Offline-Hilfe, Erklärungen und Vorschläge. Der Publisher nennt Mindestanforderungen von 8 GB RAM (Empfehlung: 16 GB) und 10 GB Speicher für Modelldateien. Die Windows-Anleitung ist deutlich komplexer (WSL2, Docker Desktop, Ollama in WSL). Ollama selbst bietet inzwischen eine native Windows-App, die der Publisher-Anleitung nicht entspricht. Das GitHub-Repo ist klein (7 Commits, keine Releases zum Zeitpunkt der Betrachtung). Prüfe Setup und Pflegeaufwand, bevor du es fest in den Alltag einplanst.
Ollama Agent – Local AI Coding Assistant
- Publisher: Nishant Unavane
- Installs: 5.4K
- Rating: 3/5
- Kosten: Free
- Engine: Ollama
Ollama Agent bietet viel Funktionsumfang: Chat, optionale Ghost-Text-Completions, schnelle Inline-Edits, Code-Review, Test- und Doku-Generierung, wiederverwendbare Prompts, Verlauf sowie Projektindex für semantische Suche. Es kann Terminalausgaben, Diagnosen, Workspace-Struktur, Git-Änderungen und Dateien als Kontext einbeziehen. Im Read-Modus liest es nur; im Agent-Modus darf es Dateien lesen, suchen, erstellen/ändern und Aufgaben in bis zu acht Schritten ausführen. Standard-Anbieter ist Ollama; Beispiele nennen Llama, Mistral, Code Llama und DeepSeek Coder. In den Settings stehen aber auch OpenAI und Anthropic. Wer strikt lokal bleiben will, prüft Provider, Host und Modell genau.
Ollama Codex
- Publisher: Parth Kansara
- Installs: 4K
- Rating: k. A.
- Kosten: Free
- Engine: Ollama
Ollama Codex bindet sich in den nativen VS-Code-Chat ein. Nach dem Pull eines Modells in Ollama sprichst du den Assistenten mit @ollama an. Die Erweiterung kann mehr als Q&A: Sie schlägt Fixes vor, hilft beim Refactoring, diagnostiziert Konfigurationsprobleme und führt agentische Aktionen über das Projekt aus (inkl. Erstellen, Ändern und Löschen von Dateien). Prüfe Änderungen sorgfältig. Empfohlen werden Qwen2.5-Coder 14B oder Gemma. Die Architektur: VS-Code-Extension, eine Agent-Schicht für Prompts/Tools/Memory, die Ollama-Runtime und das lokale Modell. Es wird kein Cloud-Provider genannt – das spricht für einen vollständig lokalen Betrieb.
Local AI Code Completion
- Publisher: chjweb
- Installs: 3.2K
- Rating: 5/5
- Kosten: Free
- Engine: Ollama mit Code Llama
Local AI Code Completion konzentriert sich auf ein Ziel: lokale Code-Vervollständigung. Du löst Vorschläge mit Ctrl+Alt+C aus, nimmst sie mit Tab an oder brichst mit Esc ab. Standard ist Code Llama 7B über Ollama; Modell, Temperatur und Top‑p sind anpassbar. Genannte Sprachen sind u. a. Python, C++, Java, PHP, TypeScript/JavaScript, C# und Bash. Start und Inferenz können je nach Rechner langsam sein. Wartungshinweis: Letztes GitHub-Release vom 5. Januar 2024; die Doku behauptet noch, Ollama unterstütze Windows nicht. Seit 2024 gibt es allerdings eine konfigurierbare Ollama-Base-URL (lokal oder remote). Prüfe daher die Kompatibilität mit aktuellem VS Code und Ollama.
Auswahl und Einsatz: Was passt zu deinem Projekt?
Diese Tools zeigen, wie vielseitig lokale Workflows heute sind. Wer Credits sparen und Code privat halten will, fährt mit lokale KI Erweiterungen für VS Code gut – solange Setup, Ressourcen und Pflege passen. Beachte dabei:
- Provider prüfen: Manche Extensions können optional Cloud-APIs nutzen. Stelle lokal laufende Modelle und Hosts explizit ein.
- Modellwahl trennen: Nutze bei Bedarf unterschiedliche Ollama-Modelle für Chat und Completion.
- Ressourcen planen: Größere Modelle brauchen mehr RAM, Rechenleistung und Speicherplatz.
- Wartung im Blick: Installationszahlen sind kein Garant für aktive Pflege. Repos und Releases checken.
- Sorgfältig reviewen: Agenten, die Dateien ändern oder löschen dürfen, brauchen klare Grenzen und Code-Review.
Warum jetzt lokal? Untersuchungen zeigen steigendes Interesse an Open-Source-GenAI, wachsende persönliche Ausgaben und Kosten als häufigen Schmerzpunkt. Eine Analyse schätzt das Ollama-Ökosystem von 1,5 Mio. aktiven Nutzern (Mai 2024) auf etwa 5 Mio. (Mai 2026). Das unterstreicht die Reife der Laufzeit – ohne Anspruch auf geprüfte Zahlen.
Unterm Strich bilden diese Lösungen eine schlanke, aber nützliche lokale Schicht über VS Code. Sie reichen von einfacher Completion bis zu Agentenläufen mit Projektkontext. Sie ersetzen die großen, polierten Cloud-Assistenten nicht, und lokal ist nicht „gratis“: Hardware, RAM, Speicher und Strom zahlst du selbst. Doch für sensible Repos und Routineaufgaben, die kein Frontier-Modell brauchen, zeigen lokale KI Erweiterungen für VS Code heute einen klaren Weg, Cloud-Nutzung zu zügeln und gleichzeitig produktiv zu bleiben.
For more news: Click Here
FAQ
Contents