Dokumente, Dienste und Sprachmodelle im Betrieb

KI On-Premise oder extern betreiben: Welche Daten verlassen das Unternehmen?

Am Beispiel eines KI-Assistenten, der Fragen anhand betrieblicher Dokumente beantwortet, zeigt dieser Beitrag, welche Komponenten intern oder extern laufen und welche Daten dabei übertragen werden. On-Premise bezeichnet hier den Betrieb auf Infrastruktur vor Ort im Unternehmen.

SystemwissenAutor: Hannes SchubertVeröffentlicht: Aktualisiert:

Doch der Standort der Benutzeroberfläche sagt noch nicht, wo das Sprachmodell arbeitet: Auch eine intern bereitgestellte Anwendung kann Dokumentausschnitte an einen externen Dienst senden. Entscheidend ist deshalb der Weg von der Frage über die verwendeten Informationen bis zur Antwort.

Was bei einem dokumentengestützten KI-Assistenten betrieben wird

Ein Sprachmodell erzeugt Text auf Grundlage seiner Eingaben und gelernten Modellparameter. Training bestimmt oder verändert solche Parameter anhand von Trainingsdaten. Davon zu unterscheiden ist die Nutzung des trainierten Modells, um Eingaben zu verarbeiten und eine Ausgabe zu erzeugen; im Betrieb wird dafür der Begriff Inferenz verwendet. ISO/IEC 22989 definiert Inferenz allgemeiner als Schlussfolgern und beschreibt gesondert das trainierte Modell und das Modelltraining.[6]

Soll der Assistent betriebliche Dokumente berücksichtigen, kommt eine Suche hinzu. Sie ermittelt passende Ausschnitte, die zusammen mit der Frage an das Sprachmodell übergeben werden. Dieses Prinzip heißt Retrieval-Augmented Generation, kurz RAG. Das BSI beschreibt damit die Einbeziehung hinterlegter Informationen, ohne dass diese zuvor als Trainingsmaterial verwendet worden sein müssen. Daraus folgt nicht, dass jede RAG-Architektur ohne Training entsteht; der ursprüngliche Ansatz von Lewis und Kollegen umfasst auch das gemeinsame Nachtrainieren von Komponenten.[2][4]

Für den hier betrachteten Assistenten lassen sich vier Teile unterscheiden: die Anwendung, die Dokumentablage, der Suchindex mit der Suche und die Verarbeitung durch das Sprachmodell. Bei einer vektorbasierten Suche werden Dokumentpassagen und Anfragen in numerische Darstellungen, sogenannte Embeddings, umgewandelt. Der Index hält die Darstellungen der Passagen für die Suche bereit. Das Erzeugen dieser Embeddings ist ein eigener Verarbeitungsschritt.[3]

Drei Betriebsfälle am selben Beispiel

Die folgenden Fälle sind eigene Architekturbeispiele für denselben Assistenten, keine vollständige Einteilung aller KI-Systeme. In jedem Fall fragt eine Mitarbeiterin nach der freigegebenen Wartungsanweisung für ein bestimmtes Gerät. Geändert wird, wo die Komponenten laufen und wer sie betreibt.

VergleichsfallVerteilung der KomponentenDatenweg im Beispiel
A · Vollständig vor OrtAnwendung, Dokumente, Index, Embedding-Erzeugung und Sprachmodell laufen im Betrieb.Für Suche und Antworterzeugung ist in diesem Beispiel kein externer Dienst vorgesehen.
B · Dediziert beim DienstleisterAlle genannten Komponenten liegen auf einer für den Betrieb vorgesehenen Umgebung beim Dienstleister.Dokumente und Anfragen werden beim Dienstleister verarbeitet.
C · Interne Suche, externes SprachmodellAnwendung, Dokumentablage, Index und Embedding-Erzeugung bleiben intern. Das Sprachmodell wird extern aufgerufen.Die Frage und ausgewählte Dokumentausschnitte werden an den Modell-Endpunkt übertragen.

In Fall B liegen die Daten außerhalb des eigenen Betriebs beim Dienstleister. Das gilt auch dann, wenn das Unternehmen die Umgebung selbst administriert. Eine dedizierte Bereitstellung beschreibt die vorgesehene Nutzung der Umgebung; welche Personen administrativ zugreifen können, muss zusätzlich geklärt werden.

Eigenbetrieb, On-Premise und Cloud sind deshalb keine austauschbaren Begriffe. Eigenbetrieb betrifft die Verantwortung für den Betrieb, On-Premise hier den Standort. Nach der NIST-Definition kann eine Private Cloud sowohl innerhalb als auch außerhalb der eigenen Räumlichkeiten liegen.[1]

Auch eine API bezeichnet zunächst eine Programmierschnittstelle, keinen Betriebsort. Sie kann interne oder externe Komponenten verbinden. Fall C ist hier eine hybride Verteilung interner und externer Komponenten. Das ist nicht automatisch eine Hybrid Cloud im Sinne von NIST: Dort bezeichnet der Begriff die Verbindung mehrerer eigenständiger Cloud-Infrastrukturen.[1]

Welche Daten beim Abruf einer Antwort übertragen werden

Vor der ersten Frage wird der für die Suche vorgesehene Dokumentbestand vorbereitet. Im beschriebenen vektorbasierten Aufbau werden seine Passagen durch einen Encoder verarbeitet und ihre Embeddings indexiert. Karpukhin und Kollegen unterscheiden diesen vorbereitenden Schritt von der späteren Umwandlung einer konkreten Anfrage in einen Suchvektor.[3]

In Fall C bleibt diese Verarbeitung zunächst intern. Wird stattdessen ein externer Embedding-Dienst eingesetzt, werden beim ersten Indexaufbau sämtliche dafür vorgesehenen Dokumentpassagen an diesen Dienst übertragen – nicht nur spätere Suchtreffer. Bei Aktualisierungen gehen die Passagen hinaus, deren Embeddings neu berechnet werden; ein vollständiger Neuaufbau kann erneut den gesamten einbezogenen Bestand betreffen. Das ist eine Konsequenz der gewählten Komponentenverteilung, keine Aussage darüber, wo die Encoder im Forschungsansatz betrieben wurden.[3]

Bei der Frage nach der Wartungsanweisung ermittelt die Anwendung zunächst passende und für die Mitarbeiterin zugängliche Ausschnitte. Das BSI beschreibt, dass Berechtigungen bei der Suche berücksichtigt werden können, und rät davon ab, ein Rechte- und Rollensystem allein durch textuelle Anweisungen an das Modell umzusetzen.[4]

Anschließend sendet die Anwendung in Fall C die Frage zusammen mit den ausgewählten Ausschnitten an das externe Sprachmodell. Die Dokumentablage bleibt intern, Teile ihres Inhalts verlassen den Betrieb dennoch. Wird zusätzlich auch die Anfrage extern in ein Embedding umgewandelt, entsteht ein weiterer Übertragungsweg zum Embedding-Dienst. Dieser und der Dienst für die Antworterzeugung müssen nicht identisch sein.[2][3][4]

Die Antwort wird an die Anwendung zurückgegeben. Für das Architekturbeispiel ist außerdem festzulegen, ob und wo Frage, Ausschnitte und Antwort in einem Chatverlauf oder Protokoll gespeichert werden. Die sichtbare Antwort ist damit nur ein Teil der Verarbeitungskette; Speicherung und spätere Zugriffe gehören in dieselbe Betrachtung.

Betriebsfälle A und B mit allen Komponenten an einem Standort; Fall C mit internen Komponenten und externem Sprachmodell.
Eigene Architekturdarstellung zu den Fällen A–C: In Fall C bleiben Dokumentablage, Suche und Embedding-Erzeugung intern. Frage und ausgewählte Dokumentausschnitte werden an das externe Sprachmodell übertragen; die Antwort geht an die Anwendung zurück. Ein externer Embedding-Dienst wäre ein zusätzlicher Datenweg. Grundlagen: [2–4].

Was vor der Wahl des Betriebs geklärt werden muss

Für jeden beteiligten Dienst sollte feststehen, welche Inhalte er erhält, wo er sie verarbeitet oder speichert und wer darauf zugreifen kann. Das NIST-Profil für generative KI empfiehlt, Dritte mit Zugriff auf Organisationsinhalte zu erfassen. Ebenso behandelt es die Prüfung von Vertragsbedingungen und Risiken einer unerlaubten weiteren Datennutzung. Aus der bloßen Bezeichnung „API“ lässt sich keine konkrete Regel zur Speicherung oder Verwendung von Eingaben ableiten.[5]

Eine eigene Frage betrifft den Modellstand: Welche Version verarbeitet die Anfrage, wer bestimmt den Wechselzeitpunkt und wie werden Änderungen angekündigt und geprüft? Das BSI nennt Versionierung als Auswahlkriterium und weist darauf hin, dass Einflussmöglichkeiten von Betriebsform und Vertragsgestaltung abhängen können. Das NIST-Profil empfiehlt die fortlaufende Überwachung eingesetzter generativer Systeme Dritter.[4][5]

Daraus ergibt sich für die Auswahl: Die Kontrollmöglichkeiten müssen am konkreten Angebot geprüft werden. Weder darf bei jeder Modell-API ein unangekündigter Wechsel unterstellt werden, noch ersetzt die eigene Administration ein geregeltes Änderungsverfahren. Versionierte Wissensmodelle betreffen einen anderen Modelltyp; auch dort muss jedoch erkennbar bleiben, auf welchen Stand sich eine Prüfung bezieht.

Zum Betrieb gehört ferner eine Antwort darauf, was bei Ausfall einer Komponente geschieht. Ob die Suche noch nutzbar ist, eine Anfrage offenbleibt oder ein anderer Arbeitsweg vorgesehen wird, muss für den konkreten Einsatz geklärt werden. Bei der Einführung von Workflow-Software sind solche Ersatzwege ebenfalls Teil der Vorbereitung auf den Regelbetrieb.

Drei Fragen zum eigenen Betriebsaufwand

Der Datenweg allein beantwortet noch nicht, ob eine Betriebsform zur eigenen Organisation passt. Für die erste Einordnung helfen drei Fragen:

  • Wie gleichmäßig wird der Assistent genutzt – und welche Lastspitzen sind zu erwarten?
  • Was passiert bei einem Ausfall, und wie lange ist der vorgesehene Ersatzweg tragfähig?
  • Wer pflegt Sprachmodell, Suchindex und Zugriffe und prüft Änderungen im laufenden Betrieb?

Diese Fragen ergeben noch keine Kostenrechnung. Sie benennen den Bedarf, gegen den ein konkretes Betriebsangebot geprüft werden kann. Eine pauschale Empfehlung für eigene Server oder einen externen Dienst lässt sich daraus nicht ableiten.

Die konkrete Verarbeitungskette prüfen

Eine überzeugend formulierte Antwort kann dennoch falsch sein. NIST beschreibt unter „Confabulation“ auch Ausgaben mit erfundenen Begründungen oder Quellenangaben und empfiehlt, die Quellen und Zitate generierter Antworten zu überprüfen. Das BSI weist außerdem darauf hin, dass eine hinterlegte Wissensbasis selbst manipuliert sein kann. RAG ist damit keine Garantie für fachliche Richtigkeit.[4][5]

Im Wartungsbeispiel ist die Antwort deshalb gegen die tatsächlich verwendeten Ausschnitte und deren Eignung für das betreffende Gerät zu prüfen. Für Entscheidungsunterstützung bleibt das Abrufen einer Information von der Entscheidung über die anschließende Handlung zu unterscheiden.

Ein Prüfprotokoll könnte dafür Anfrage, verwendete Dokumentausschnitte, Modell- und Konfigurationsbezug sowie Antwort zusammenführen. Das ist ein architektonischer Vorschlag für die Nachprüfung, keine pauschale Vorgabe zur vollständigen Speicherung aller Inhalte. Welche Angaben benötigt werden, wer sie sehen darf und wie lange sie aufbewahrt werden, muss für den Einsatz festgelegt werden.

Die Prüfung eines Sprachmodellergebnisses ist dabei nicht mit der Validierung eines regelbasierten Wissensmodells gleichzusetzen. Auch dort bleibt eine bestandene Validierung an ihren Prüfgegenstand und ihre Grenzen gebunden. Ein formal passendes Ausgabeformat beantwortet noch nicht die Frage, ob die Wartungsanweisung fachlich richtig wiedergegeben wurde.

Soll eine Person auf dieser Grundlage handeln, muss sie relevante Angaben prüfen und eine unpassende Antwort zurückweisen können; nur dann ist menschliche Aufsicht wirksam. Für die Wahl der Betriebsform lautet die konkrete Prüfung daher: Welche Dokumentpassagen verarbeitet welcher Dienst, mit welchem Modellstand – und woran lässt sich die zurückgegebene Antwort anschließend überprüfen?

Primärquellen und weiterführende Literatur

[1] NIST: The NIST Definition of Cloud Computing. SP 800-145, September 2011, Abschnitt 2, S. 2–3. Originalquelle

[2] Lewis et al.: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020; verwendet: arXiv:2005.11401v4, 12. April 2021, Abb. 1 und Abschnitt 2, S. 2–3. Originalquelle

[3] Karpukhin et al.: Dense Passage Retrieval for Open-Domain Question Answering. EMNLP 2020, S. 6769–6781; hier Abschnitt 3.1, S. 6770–6771. Originalquelle

[4] BSI: Generative KI-Modelle: Chancen und Risiken für Industrie und Behörden. Version 2.0, 17. Januar 2025; S. 36–37 und 48. Originalquelle

[5] NIST: Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. AI 600-1, Juli 2024; Abschnitt 2.2, GV-6.1-007, GV-6.2-004, GV-6.2-007 und MS-2.5-003. Originalquelle

[6] ISO/IEC 22989:2022, Information technology — Artificial intelligence — Artificial intelligence concepts and terminology, Edition 1, 2022; Begriffe 3.1.17, 3.3.5, 3.3.7–3.3.8, 3.3.14–3.3.16. Kostenpflichtige Norm. Originalquelle.