Kurzantwort: Lokale KI bedeutet, dass ein Sprachmodell auf eigener Hardware im Unternehmen läuft statt in der Cloud. Das lohnt sich vor allem bei sensiblen Daten, hohem Dauervolumen und stabilen Anwendungsfällen. Für gelegentliche Textarbeit bleiben Cloud-Dienste in der Regel günstiger und leistungsfähiger.
Die Frage taucht in fast jedem zweiten Gespräch auf: Können wir KI nicht einfach bei uns im Haus betreiben, damit keine Daten abfließen? Die Antwort lautet: technisch ja, wirtschaftlich manchmal. Was vor zwei Jahren noch ein Forschungsprojekt war, lässt sich heute an einem Nachmittag aufsetzen. Ob es sich rechnet, ist eine ganz andere Frage. Dieser Beitrag zeigt, was lokale Modelle heute leisten, welche Hardware wirklich nötig ist und ab welchem Nutzungsvolumen die Rechnung kippt.
Was „lokal“ eigentlich heißt
Der Begriff wird unsauber benutzt. Drei Varianten werden regelmäßig durcheinandergeworfen, und nur eine davon ist echte lokale KI.
Variante 1: Cloud-Dienst mit Zusicherung. Sie nutzen ChatGPT, Claude oder Gemini in einem Geschäftstarif. Die Daten verlassen das Haus, der Anbieter sagt vertraglich zu, sie nicht für Training zu verwenden. Das ist keine lokale KI, sondern ein Auftragsverarbeitungsverhältnis.
Variante 2: Private Cloud. Ein Modell läuft in einem abgeschotteten Bereich eines Rechenzentrums, etwa in einer europäischen Region eines Hyperscalers. Die Daten verlassen Ihr Haus ebenfalls, bleiben aber in einer definierten Umgebung. Häufig ein guter Kompromiss, aber technisch weiterhin Cloud.
Variante 3: Echte lokale KI. Das Modell liegt auf einem Server in Ihren Räumen oder in Ihrem gemieteten Rack. Kein Prompt verlässt das Netz. Nur diese Variante löst das Datenschutzargument vollständig, und nur um sie geht es hier.
Der praktische Einstieg läuft heute fast immer über eine Laufzeitumgebung wie Ollama, die offene Modelle mit einem Befehl herunterlädt und startbereit macht. Das eigentliche Kunststück ist nicht die Installation, sondern die Auswahl des passenden Modells und die Anbindung an Ihre Daten.
Wann sich lokale KI rechnet
Es gibt drei Konstellationen, in denen sich der Aufwand regelmäßig lohnt.
Sensible Daten ohne Wenn und Aber
Personalakten, Patientendaten, Konstruktionszeichnungen, Mandantenunterlagen. Überall dort, wo eine Weitergabe an Dritte auch mit Vertrag heikel bleibt oder wo Kunden vertraglich eine Verarbeitung im eigenen Haus verlangen, ist die lokale Variante oft der einzige gangbare Weg. Das Bundesamt für Sicherheit in der Informationstechnik beschreibt in seiner Publikation Generative KI-Modelle: Chancen und Risiken für Industrie und Behörden ausführlich, welche Risiken beim Umgang mit solchen Modellen zu bewerten sind – die Überlegungen gelten für lokale wie für Cloud-Modelle.
Hohes, gleichmäßiges Volumen
Wer täglich zehntausende Dokumente klassifiziert, Produktbeschreibungen erzeugt oder Support-Tickets vorsortiert, zahlt in der Cloud pro Anfrage. Lokal zahlen Sie einmal die Hardware und danach nur noch Strom. Ab einem bestimmten Volumen dreht sich die Rechnung.
Offline-Fähigkeit als Anforderung
Produktionsumgebungen ohne Internetanbindung, Baustellen, Schiffe, mobile Labore. Wo keine stabile Verbindung existiert, ist die Frage nicht Kosten, sondern Machbarkeit.
Wann sich lokale KI nicht rechnet
Ebenso ehrlich gehört die Gegenseite dazu. Lokale Modelle sind bei komplexem Denken, langen Kontexten und mehrsprachigen Aufgaben spürbar schwächer als die jeweils aktuellen Spitzenmodelle der großen Anbieter. Wer im Team fünfzehn Leute hat, die täglich ein paar Texte formulieren und E-Mails zusammenfassen, bekommt für weniger Geld mehr Qualität aus der Cloud. Hinzu kommt: Ein lokales Modell aktualisiert sich nicht von allein. Jemand muss Updates einspielen, Modelle austauschen und die Hardware betreuen. Diese Betriebskosten werden in Angeboten gern unterschlagen. Wie Sie diese Abwägung strukturiert treffen, haben wir im Beitrag Den richtigen KI-Stack für Ihr Unternehmen wählen beschrieben.
Welche Hardware Sie wirklich brauchen
Die entscheidende Größe ist der Grafikspeicher. Ein Modell muss vollständig hineinpassen, sonst wird es zäh. Als Faustregel gilt: Ein Modell mit X Milliarden Parametern braucht in üblicher Quantisierung rund X Gigabyte Grafikspeicher, plus Reserve für den Kontext.
| Modellklasse | Grafikspeicher | Taugt für | Grenzen |
|---|---|---|---|
| 7 bis 9 Mrd. Parameter | ab 8 GB | Klassifikation, Zusammenfassungen, einfache Extraktion | Schwach bei Logik und langen Dokumenten |
| 12 bis 14 Mrd. Parameter | ab 16 GB | Interne Wissenssuche, Textentwürfe, Übersetzung | Merklich unter Cloud-Niveau bei Fachsprache |
| 27 bis 32 Mrd. Parameter | ab 32 GB | Anspruchsvolle Auswertung, mehrstufige Aufgaben | Bereits Serverhardware nötig |
| 70 Mrd. Parameter und mehr | ab 80 GB | Nahe an Cloud-Qualität für viele Aufgaben | Investition im fünfstelligen Bereich |
Für den Einstieg reicht in vielen Fällen eine einzelne Workstation-Grafikkarte mit 24 GB. Damit laufen Modelle bis rund 14 Milliarden Parameter flüssig, und genau in dieser Klasse liegen die meisten sinnvollen Büro-Anwendungsfälle.
Rechenbeispiel: 18 Mitarbeitende, drei Jahre
Ein Ingenieurbüro mit 18 Personen will Angebotstexte, Protokolle und interne Recherche mit KI unterstützen. Zwei Wege, dieselbe Laufzeit.
Weg A – Cloud. Angenommen 25 Euro netto je Nutzer und Monat für einen Geschäftstarif. Das sind 18 mal 25 gleich 450 Euro im Monat, 5.400 Euro im Jahr, 16.200 Euro in drei Jahren. Kein Betriebsaufwand, sofort verfügbar, jederzeit kündbar.
Weg B – lokal. Ein Server mit einer 24-GB-Karte, angesetzt mit 6.500 Euro Anschaffung (Preise in diesem Beispiel: Stand September 2026). Einrichtung und Anbindung an das Dokumentenarchiv: 5.000 Euro einmalig. Strom bei durchschnittlich 350 Watt im Betrieb und 30 Cent je Kilowattstunde ergibt rund 0,105 Euro je Stunde, bei 2.500 Betriebsstunden im Jahr also etwa 263 Euro jährlich. Betreuung und Updates: 1.200 Euro im Jahr. Summe über drei Jahre: 6.500 plus 5.000 plus dreimal 1.463 gleich 15.889 Euro.
Die beiden Wege liegen nach drei Jahren also nur rund 300 Euro auseinander – bei deutlich höherem Risiko und geringerer Modellqualität auf der lokalen Seite. Erst wenn die Nutzerzahl steigt oder ein Großteil der Verarbeitung automatisiert im Hintergrund läuft, kippt die Rechnung klar zugunsten der eigenen Hardware. Alle genannten Beträge sind Annahmen für dieses Beispiel, keine Herstellerangaben. Wie sich die Gesamtkosten von KI-Projekten sonst noch zusammensetzen, zeigt der Beitrag Was kostet KI im Unternehmen?.
Datenschutz: echter Vorteil, aber kein Freifahrtschein
Wenn kein Prompt das Haus verlässt, entfällt die gesamte Diskussion um Drittlandtransfer und Auftragsverarbeitung. Das ist ein handfester Vorteil. Er ersetzt aber nicht die übrigen Pflichten: Zugriffsrechte, Protokollierung, Löschkonzepte und technische Sicherheitsmaßnahmen nach Artikel 32 der Datenschutz-Grundverordnung gelten unverändert. Ein lokal betriebenes Modell, das jeder Mitarbeitende ohne Rechtekonzept auf das gesamte Dateisystem loslassen kann, ist datenschutzrechtlich schlechter aufgestellt als ein sauber konfigurierter Cloud-Dienst.
Außerdem: Auch ein lokales Modell kann falsche Aussagen erzeugen. Die Pflicht zur inhaltlichen Kontrolle bleibt bei Ihnen. Eine praktische Einordnung dazu finden Sie im Praxis-Leitfaden zum DSGVO-konformen Arbeiten mit KI.
In vier Schritten starten
Erstens: einen Anwendungsfall benennen. Nicht „KI einführen“, sondern „Angebotstexte aus dem Leistungsverzeichnis erzeugen“. Ohne konkreten Fall lässt sich weder Hardware noch Modell sinnvoll wählen.
Zweitens: mit geliehener Hardware testen. Eine Stunde auf einer gemieteten GPU-Instanz kostet wenige Euro. Testen Sie zwei bis drei Modellgrößen an echten Dokumenten, bevor Sie etwas kaufen.
Drittens: die Datenanbindung planen. Der Nutzen entsteht selten aus dem Modell allein, sondern aus der Verbindung mit Ihren Dokumenten. Wie das aussieht, beschreibt der Beitrag KI-Wissensdatenbank: Firmenwissen durchsuchbar machen.
Viertens: den Betrieb klären. Wer spielt Updates ein, wer haftet bei Ausfall, wer beobachtet die Qualität? Ohne Antwort auf diese Fragen bleibt am Ende ein teurer Server ohne Zuständigkeit übrig. Wenn Sie diesen Teil nicht selbst stemmen wollen, übernehmen wir ihn im Managed Service.
Häufige Fragen
Brauche ich zwingend eine teure Grafikkarte?
Nein. Aktuelle Rechner mit gemeinsam genutztem Arbeitsspeicher schaffen kleinere Modelle ordentlich. Für Einzelplatz-Tests reicht das. Sobald mehrere Personen gleichzeitig zugreifen, führt an dedizierter Grafikhardware kein Weg vorbei.
Sind offene Modelle wirklich kostenlos?
Die Modellgewichte ja, der Betrieb nein. Und die Lizenzen unterscheiden sich erheblich: Manche erlauben jede kommerzielle Nutzung, andere begrenzen sie ab bestimmten Nutzerzahlen. Prüfen Sie die Lizenz jedes Modells einzeln, bevor Sie es produktiv einsetzen.
Kann ich Cloud und lokal kombinieren?
Ja, und das ist häufig die beste Lösung. Sensible Verarbeitung läuft lokal, anspruchsvolle Einzelfälle gehen an ein Cloud-Modell. Voraussetzung ist eine klare Regel, welche Daten welchen Weg nehmen dürfen.
Wie lange bleibt ein lokales Modell aktuell?
Rechnen Sie mit sechs bis zwölf Monaten, bis eine deutlich bessere Alternative erscheint. Die Hardware bleibt nutzbar, das Modell tauschen Sie aus. Planen Sie diesen Wechsel von Anfang an ein.
Was ist mit dem EU AI Act?
Der Ort der Verarbeitung ändert nichts an der Risikoeinstufung. Ein lokal betriebenes System unterliegt denselben Regeln wie ein Cloud-System. Details dazu im Beitrag EU AI Act: Pflichten für KMU.
Nächster Schritt
Ob lokale KI in Ihrem Betrieb sinnvoll ist, entscheidet sich an Ihren Daten und Ihrem Volumen – nicht an der Technik. Wir sehen uns beides an und rechnen beide Wege durch. Starten Sie mit dem KI-Check, sehen Sie sich unsere Leistungen rund um KI-Tools an oder schreiben Sie uns über das Kontaktformular.



