Kurzantwort: Eine KI-Wissensdatenbank beantwortet Fragen zu internen Dokumenten in natürlicher Sprache und nennt die Quelle. Technisch steckt dahinter meist RAG: Das Modell sucht erst in Ihren Dateien und antwortet dann. Der Erfolg hängt nicht am Modell, sondern an der Pflege der Inhalte.
Jedes Unternehmen ab etwa 20 Mitarbeitenden hat dasselbe Problem: Das Wissen ist da, aber niemand findet es. Es liegt in Angeboten von 2023, in einer Betriebsanleitung als PDF, in einer E-Mail-Antwort an einen Kunden, in dem Kopf der Kollegin, die gerade im Urlaub ist. Der Reflex, dieses Problem mit einem Chatbot zu lösen, ist richtig – nur scheitern die meisten Projekte nicht an der Technik, sondern an der Frage, welche Dokumente überhaupt hineindürfen.
Wie das technisch funktioniert
Das Verfahren heißt Retrieval Augmented Generation, kurz RAG. Microsoft beschreibt es in der eigenen Dokumentation zu Azure AI Search als Ansatz, der die Antworten eines Sprachmodells auf die eigenen, geschützten Inhalte stützt. Google formuliert den Nutzen in der Dokumentation zur Fundierung von Modellantworten noch direkter: Das Verfahren reduziert Halluzinationen und verankert Antworten in Ihren Datenquellen.
Der Ablauf besteht aus vier Schritten:
- Zerlegen. Ihre Dokumente werden in Abschnitte von einigen hundert Wörtern geschnitten. Wie klug geschnitten wird, entscheidet später über die Antwortqualität – ein Abschnitt, der mitten in einer Tabelle endet, liefert unbrauchbare Treffer.
- Einbetten. Jeder Abschnitt bekommt eine mathematische Darstellung seiner Bedeutung. Dadurch findet das System auch dann etwas, wenn die Frage andere Wörter verwendet als das Dokument.
- Suchen. Zu jeder Frage werden die passendsten Abschnitte herausgesucht, meist eine Kombination aus Bedeutungssuche und klassischer Stichwortsuche.
- Antworten. Das Sprachmodell bekommt Frage und gefundene Abschnitte und formuliert daraus eine Antwort – mit Quellenangabe.
Der letzte Punkt ist das eigentliche Qualitätsmerkmal. Eine Wissensdatenbank ohne Quellenangabe ist wertlos, weil niemand die Antwort überprüfen kann. Bestehen Sie bei jedem Anbieter darauf, dass jede Antwort auf das Dokument und idealerweise auf die Seite verweist.
Vier Wege im Vergleich
| Ansatz | Typische Kosten | Einführungsdauer | Stärke | Schwäche |
|---|---|---|---|---|
| Bessere klassische Suche in der Dateiablage | oft im vorhandenen System enthalten | Tage | keine neuen Risiken, sofort wirksam | findet nur, wer die richtigen Wörter kennt |
| Chatfunktion des vorhandenen Office-Pakets | Lizenzaufpreis je Nutzer, im zweistelligen Eurobereich | 1 bis 3 Wochen | Rechte werden aus dem bestehenden System übernommen | an einen Hersteller gebunden, wenig steuerbar |
| Eigene RAG-Lösung auf ausgewählten Quellen | einmalige Einrichtung plus laufender Betrieb, meist mittlerer vierstelliger Bereich pro Jahr | 4 bis 10 Wochen | Sie bestimmen Inhalte, Rechte und Antwortverhalten | braucht dauerhafte Pflege und Zuständigkeit |
| Modell auf eigenen Daten nachtrainieren | hoch, meist fünfstellig | Monate | Stil und Fachsprache werden übernommen | Wissen veraltet mit dem Training, keine Quellenangaben |
Für die allermeisten mittelständischen Betriebe ist der dritte Weg der richtige – und der vierte fast nie. Nachtrainieren löst ein Stilproblem, kein Wissensproblem: Was das Modell gelernt hat, veraltet mit jedem neuen Preisblatt. Wenn Sie grundsätzlich zwischen Ansätzen abwägen, hilft unser Beitrag Den richtigen KI-Stack für Ihr Unternehmen wählen.
Rechenbeispiel: 40 Wissensarbeiter, 20 Minuten am Tag
Wie viel Zeit die Suche nach internen Informationen kostet, ist erstaunlich schlecht belegt. Die meistzitierte Zahl stammt aus einer Untersuchung des McKinsey Global Institute aus dem Jahr 2012, die für sogenannte Interaction Worker knapp 20 Prozent der Arbeitswoche für das Suchen interner Informationen und passender Kollegen ansetzt. Die Zahl ist alt und stammt aus einem Marktbericht, nicht aus einer aktuellen Erhebung – nehmen Sie sie als Größenordnung, nicht als Beleg für Ihren Betrieb. Besser ist es, im eigenen Haus zu messen.
Rechnen wir konservativ mit 20 Minuten pro Person und Tag in einem Betrieb mit 40 Wissensarbeitern und einem internen Stundensatz von 55 Euro:
- Suchaufwand heute: 40 × 20 Minuten = 800 Minuten am Tag, also 13,3 Stunden. Bei 215 Arbeitstagen sind das 2.867 Stunden im Jahr – rund 157.700 Euro.
- Realistische Verkürzung: 30 Prozent, nicht 80. Das entspricht rund 47.300 Euro im Jahr.
- Kosten: 15.000 Euro einmalig für Einrichtung, Rechtekonzept und Schulung. Laufend 350 Euro im Monat für Betrieb und Modellnutzung sowie ein halber Pflegetag im Monat, zusammen rund 6.840 Euro im Jahr.
Die Investition ist damit im ersten Jahr gedeckt. Aber der ehrliche Teil steht im Kleingedruckten: Die 30 Prozent entstehen nur, wenn die Inhalte gepflegt sind. Wird die Datenbank auf eine ungeräumte Dateiablage gesetzt, liegt die Verkürzung bei null – und Sie haben ein Werkzeug bezahlt, das Ihren Leuten falsche Antworten mit selbstbewusstem Ton liefert.
Der Teil, den alle unterschätzen: Auswahl und Rechte
Die häufigste Fehlannahme lautet: „Wir werfen einfach das gesamte Laufwerk hinein.“ Damit erzeugen Sie zwei Probleme gleichzeitig.
Erstens veraltete Inhalte. Wenn das Preisblatt von 2022 und das von 2026 im selben Topf liegen, antwortet das System mit dem, was besser zur Frage passt – nicht mit dem, was aktuell ist. Jede Quelle braucht ein Gültigkeitsdatum und einen Verantwortlichen.
Zweitens Berechtigungen. Wenn die Wissensdatenbank Zugriff auf alles hat, ihre Nutzer aber nicht, wird sie zur Umgehung Ihres Rechtekonzepts. Ein Auszubildender fragt nach Gehaltsbändern und bekommt sie. Klären Sie vor dem ersten Import, ob das System Berechtigungen der Ablage übernimmt oder eigene Regeln braucht.
Ein dritter Punkt betrifft die Sicherheit. Das Bundesamt für Sicherheit in der Informationstechnik weist in seiner Cybersicherheitswarnung zu indirekten Prompt Injections darauf hin, dass Sprachmodelle für diese Angriffsform anfällig sind: Angreifer können Anweisungen in den Quellen platzieren, die das Modell später verarbeitet. Für eine interne Wissensdatenbank heißt das konkret: Dokumente aus unsicheren Quellen – eingehende E-Mail-Anhänge, hochgeladene Kundendateien – gehören nicht ungeprüft in den Index. Eine breitere Einordnung der Risiken liefert die BSI-Publikation zu generativen KI-Modellen.
Ein realistischer Einführungsplan
- Fragen sammeln, nicht Dokumente. Zwei Wochen lang notieren alle, welche Fragen sie an Kolleginnen und Kollegen stellen mussten. Diese Liste ist Ihr Anforderungskatalog – und der spätere Testfall.
- Einen Bereich auswählen. Nicht das ganze Unternehmen. Ein Bereich mit klar abgegrenzten Dokumenten und einem interessierten Team: Service, Technik, Vertrieb.
- Quellen kuratieren. 50 gute Dokumente schlagen 5.000 ungeprüfte. Jedes Dokument bekommt Gültigkeitsdatum und Verantwortliche.
- Gegen die Fragenliste testen. Beantwortet das System 30 echte Fragen richtig und mit korrekter Quelle? Alles unter 80 Prozent ist noch nicht produktionsreif.
- Pflege verankern. Ein fester Termin im Monat, eine zuständige Person, eine Liste der Fragen, die schlecht beantwortet wurden. Ohne diesen Schritt verfällt die Qualität innerhalb eines halben Jahres.
Wie Sie die Anbindung an bestehende Systeme umsetzen, beschreiben wir in unseren Leistungen zur Automatisierung; die Auswahl und den Betrieb der Modelle finden Sie unter KI-Tools.
Klein starten, messbar bleiben
Wir bauen Ihre Wissensdatenbank auf einem Bereich mit kuratierten Quellen auf, testen gegen 30 echte Fragen aus Ihrem Alltag und übernehmen auf Wunsch Pflege und Betrieb.
Woran Projekte scheitern
Es gibt keine zuständige Person. Eine Wissensdatenbank ist kein Projekt, sondern ein Betrieb. Wenn niemand benannt ist, der veraltete Dokumente entfernt und schlechte Antworten nacharbeitet, ist das Ergebnis nach sechs Monaten schlechter als die Dateisuche vorher.
Die Erwartung ist zu hoch. Wer verspricht, das System beantworte alle Fragen, erzeugt Enttäuschung. Sagen Sie von Anfang an, welche Fragen es beantwortet – und dass es bei allem anderen ehrlich passen soll.
Niemand nutzt es. Ein Werkzeug, das nicht dort ist, wo gearbeitet wird, wird nicht benutzt. Die Suche gehört in das Programm, in dem Ihre Leute ohnehin den Tag verbringen – nicht auf eine eigene Website, die man sich merken muss.
Häufige Fragen
Brauchen wir dafür ein lokal betriebenes Modell?
Meistens nicht. Entscheidend ist, wo Ihre Dokumente liegen und ob der Anbieter sie zum Training verwendet. Ein europäisch gehosteter Dienst mit Auftragsverarbeitungsvertrag und ausgeschaltetem Training erfüllt für die meisten Betriebe die Anforderungen. Bei besonders sensiblen Beständen kann ein lokales Modell sinnvoll sein – der Betriebsaufwand ist allerdings erheblich. Die datenschutzrechtliche Prüfung beschreiben wir im Praxis-Leitfaden zum DSGVO-konformen Arbeiten mit KI.
Wie viele Dokumente braucht es, damit sich das lohnt?
Weniger als die meisten denken. Ab etwa 200 relevanten Dokumenten wird die klassische Suche unübersichtlich. Wichtiger als die Menge ist die Häufigkeit derselben Fragen: Wenn fünf Fragen jede Woche mehrfach gestellt werden, lohnt sich der Aufbau bereits.
Was passiert, wenn das System etwas Falsches sagt?
Es wird das tun – deshalb die Quellenangabe. Nutzen Sie sie als Regel: Keine Antwort ohne Beleg, und bei Kundenkommunikation prüft ein Mensch, bevor sie das Haus verlässt. Für Fragen mit rechtlicher oder finanzieller Tragweite sollte das System auf die zuständige Person verweisen statt zu antworten.
Können wir E-Mails einbinden?
Technisch ja, empfehlenswert selten. E-Mail-Bestände enthalten personenbezogene Daten, Entwürfe, widersprüchliche Aussagen und Vertrauliches. Wenn überhaupt, dann ein klar abgegrenztes Postfach wie den Serviceeingang – nie das persönliche Postfach der Belegschaft.
Wie messen wir den Nutzen?
Über drei Zahlen: Anzahl der Fragen pro Woche, Anteil der Antworten mit brauchbarer Quelle und Anzahl der Rückfragen, die trotzdem an Kolleginnen und Kollegen gehen. Die dritte Zahl ist die ehrlichste.
Nächster Schritt
Wir starten solche Projekte bewusst klein: ein Bereich, kuratierte Quellen, 30 echte Testfragen. Nach vier Wochen wissen Sie, ob es trägt. Beginnen Sie mit dem KI-Check oder sprechen Sie uns über das Kontaktformular an. Wenn Sie zunächst die Grundlagen im Team schaffen wollen, hilft der Leitfaden zu ChatGPT im Unternehmen.



