Modellüberwachung, Veränderungen und erneute Prüfung

Concept Drift in der Produktion: Wann ein KI-Modell erneut geprüft werden muss

Concept Drift bezeichnet hier eine Veränderung des Zusammenhangs zwischen den Eingaben eines KI-Modells und dem fachlich zu bewertenden Ergebnis. Bei der Analyse industrieller Messwerte stellt sich damit eine Betriebsfrage: Passen die Hinweise des eingesetzten Modells noch zum Prozess, für den es geprüft wurde? Andere Messwerte allein beantworten diese Frage nicht. Entscheidend ist, Eingabeveränderungen und die Qualität der Hinweise über die Zeit getrennt zu untersuchen.[2][4]

SystemwissenAutor: Hannes SchubertVeröffentlicht: Aktualisiert:

Ein Drift-Signal ist ein Anlass zur Untersuchung, noch keine Diagnose der Ursache oder der Modellleistung.

Was Concept Drift von veränderten Eingabedaten unterscheidet

Gama und Mitautoren bezeichnen eine Änderung des Zusammenhangs zwischen Eingaben und Zielgröße als „real concept drift“. Sie kann mit oder ohne eine veränderte Verteilung der Eingaben auftreten. Diese engere Bedeutung liegt dem Beitrag zugrunde.[2]

ISO/IEC 22989 beschreibt Data Drift und Concept Drift dagegen in Abschnitt 5.11.9.1 bereits mit eingetretenem Genauigkeitsverlust und unterscheidet dessen Ursachen: veränderte statistische Eigenschaften der Betriebsdaten beziehungsweise eine verschobene Entscheidungsgrenze. Ein bloß beobachteter Eingabeshift belegt diese dort beschriebenen Leistungsprobleme noch nicht.[1]

Im folgenden, hypothetischen Beispiel untersucht ein unverändertes Modell Temperaturfenster einer festgelegten Haltephase. Es wurde mit fachlich als normal eingeordneten Fällen trainiert und markiert Abweichungen vom erlernten Normalbild. Solche Trainingsdaten sind nicht vollständig ungelabelt: Die Auswahl als normal ist bereits eine Einordnung.[3]

Für die spätere Prüfung werden die Modellhinweise mit eigenständigen fachlichen Bewertungen der Fenster verglichen. Diese Übertragung auf ein Normalbild-Modell ist ein Anwendungsvorschlag; Gamas Darstellung überwachten Lernens liefert dafür keinen unmittelbaren Leistungsnachweis. Die Unterscheidung zwischen Grenzwert, Regelkarte und trainiertem Modell betrifft die vorgelagerte Verfahrenswahl.[2][3]

Der Gegenstand ist damit ein Analysemodell für Messwerte. Beim Prozesslernen geht es dagegen um beobachtetes Prozessverhalten und daraus entwickelte betriebliche Veränderungen.

Referenzzustand und Beobachtungszeitraum festlegen

Damit eine spätere Veränderung erkennbar wird, braucht der Vergleich einen festgehaltenen Ausgangspunkt. Für das Beispiel bietet sich an, Modellfassung, Vorverarbeitung, Haltephase und die vertretenen Produktvarianten zusammen mit dem Referenzzeitraum zu dokumentieren. Zum späteren Beobachtungszeitraum gehört dieselbe Zuordnung. Das ist ein Vorschlag für die Prozessarchitektur, keine vorgegebene Prüfliste der Quellen. Dazu gehört im vorgeschlagenen Aufbau auch die Festlegung, in welchem Rhythmus und bei welchen Änderungen – etwa einer neuen Variante oder geänderter Vorverarbeitung – der Vergleich wiederholt wird.

Die zeitliche Zuordnung darf im Vergleich nicht verschwinden. Gama und Mitautoren weisen für sich verändernde Datenströme darauf hin, dass ein Vermischen der zeitlichen Reihenfolge die Evaluation beeinträchtigt. Ein Modell kann in einem Teil des Verlaufs gut und in einem anderen schlecht abschneiden.[2]

Im Beispiel bleibt deshalb sichtbar, welche Fenster aus der Referenz und welche aus dem späteren Betrieb stammen. Auswertungen lassen sich zusätzlich nach Produktvariante trennen. Wurde zwischenzeitlich die Vorverarbeitung geändert, ist auch das zu berücksichtigen: Sonst werden möglicherweise unterschiedlich aufbereitete Eingaben wie gleichartige Beobachtungen verglichen.

Wenn ein anderer Produktmix das Signal verändert

Angenommen, die bekannten Varianten haben unterschiedliche typische Temperaturverläufe, und im späteren Zeitraum wird eine davon häufiger hergestellt. Dann kann sich die zusammengefasste Verteilung der Eingaben verschieben, obwohl sich der fachliche Zusammenhang innerhalb der Varianten nicht verändert hat. Dies ist die Annahme des Beispiels, kein gemessener Betriebsbefund.

Ein Verteilungsvergleich kann eine solche Änderung untersuchen, ohne dass für jedes neue Fenster bereits eine Ergebnisbewertung vorliegt. Ob die Modellhinweise schlechter geworden sind, ist eine andere Frage: Rabanser und Mitautoren trennen die Erkennung eines Verteilungswechsels ausdrücklich von dessen Auswirkung auf die Vorhersagequalität. Ihre Untersuchung liefert dafür eine allgemeine Grundlage, aber keine geprüfte Methode für diese Temperatur-Zeitreihe.[4]

Anders liegt der Fall, wenn eine neue Variante oder ein Wertebereich in den Referenzfällen gar nicht vertreten war. Ein Modell des bisherigen Normalverhaltens kann solche Fenster als abweichend markieren, obwohl sie fachlich zulässig sind und sich der Zusammenhang im bisherigen Einsatzbereich nicht verändert hat. Ob es sie tatsächlich markiert, hängt vom Modell und seiner Einstellung ab. Die fehlende Abdeckung ist bereits ein Anlass, Referenzdaten und Einsatzbereich zu prüfen – kein Beweis für Concept Drift.[3]

Eine neue Zusammensetzung der Eingaben ist somit weder automatisch ein Leistungsproblem noch eine Entwarnung. Im Beispiel wäre zunächst zu klären, ob nur die Anteile bekannter Varianten anders sind oder ob das Modell inzwischen außerhalb des bislang geprüften Bereichs eingesetzt wird.

Was ohne fachliche Bewertungen offen bleibt

Bewertungen können verspätet eintreffen, fehlerhaft oder verzerrt sein und erheblichen Aufwand verursachen. Gama und Mitautoren benennen diese Grenzen des Feedbacks ausdrücklich. Eine fehlende Bewertung darf deshalb in der Auswertung nicht stillschweigend als Bestätigung eines Modellhinweises erscheinen.[2]

Für das Temperaturbeispiel lautet eine mögliche Prüffrage: Hätte dieses Fenster nach den festgelegten fachlichen Kriterien untersucht werden müssen? Die Antwort wird getrennt von der ursprünglichen Modellmarkierung erfasst. Wo sie ungeklärt bleibt, bleibt auch der Fall als ungeklärt erkennbar. So wird aus einer ausstehenden Prüfung kein scheinbar korrektes Ergebnis.

Nur markierte Fenster nachzuprüfen reicht nicht: Damit lassen sich unbegründete Markierungen untersuchen, aber keine Auffälligkeiten finden, die das Modell überhaupt nicht angezeigt hat. Auch unmarkierte Fenster gehören deshalb in die fachliche Prüfung. Wie diese Fälle ausgewählt wurden, muss bei der Auswertung erkennbar bleiben.

Eine gezielte Auswahl schwieriger Fälle kann Schwächen aufdecken, ergibt für sich aber noch keine allgemeine Fehlerquote des gesamten Betriebs. Dazu müsste die Auswahl diese Aussage tragen. Bleiben Bewertungen lückenhaft oder auf bestimmte Varianten beschränkt, gilt die Einschränkung auch für das Urteil über die Modellqualität.

Auch die Qualität menschlicher Rückmeldung gehört zur Prüfung: Ein fachliches Urteil ist kein automatisch fehlerfreies Referenzergebnis. Eine für die Evaluation erfasste Bewertung wird dadurch auch noch nicht zum Trainingsdatum.[2]

Eingaben und Ergebnisse gemeinsam beurteilen

Für die betriebliche Prüfung lassen sich vier Konstellationen unterscheiden. Die folgende Ordnung ist ein Architekturvorschlag, kein Diagnoseverfahren aus einer Norm.

Veränderte Eingaben, bisher keine belegte Verschlechterung: Der Produktmix, die Abdeckung des Einsatzbereichs und die Belastbarkeit der Ergebnisbewertungen werden geprüft. Sind die Bewertungen unvollständig, ist „keine Verschlechterung belegt“ keine Bestätigung unveränderter Qualität. Auch eine veränderte Markierungsrate des Modells gehört zu den Beobachtungen: Sie zeigt, dass sich etwas verändert hat, nicht ob die Markierungen zutreffen.

Schlechter bewertete Hinweise, kein erkannter Eingabeshift: Ein unauffälliger Eingabevergleich schließt eine Änderung des fachlichen Zusammenhangs nicht aus. Ebenso können die Bewertungskriterien oder die Datengrundlage der Prüfung ungeeignet sein. Aus dieser Konstellation allein lässt sich die Ursache nicht bestimmen.[2]

Veränderte Eingaben und schlechter bewertete Hinweise: Beides zusammen begründet eine vertiefte Untersuchung, beweist aber noch nicht, dass die erkannte Verteilungsänderung die Verschlechterung verursacht hat. Welche Varianten und Zeiträume betroffen sind, ist Teil dieser Untersuchung.

Zu wenige belastbare Bewertungen: Das Eingabesignal bleibt beschreibbar, ein Urteil über die Ergebnisqualität bleibt offen. Für den weiteren Einsatz ist dann eine Entscheidung unter dieser Unsicherheit nötig; fehlende Rückmeldung ersetzt keine Prüfung. Für diesen Fall lässt sich vorab festlegen, wer entscheidet und welche Zwischenstufen in Frage kommen – etwa ein eingeschränkter Einsatz oder eine zusätzliche fachliche Prüfung, bis belastbare Bewertungen vorliegen.

Ein einzelnes ungewöhnliches Fenster beweist noch keinen zeitlichen Drift. Es kann unabhängig davon einen fachlich wichtigen Untersuchungsanlass darstellen. Ob anschließend Datenaufbereitung, Einsatzgrenze oder Modellfassung geändert werden, hängt vom Befund ab.[2]

Eingaben und fachlich bewertete Ergebnisse getrennt beobachten und gemeinsam beurteilen
Eigene schematische Darstellung des vorgeschlagenen Prüfaufbaus. Fehlende Bewertungen bleiben offen; aus veränderten Eingaben folgt kein automatisches Nachtraining.

Alte und neue Modellfassung auf denselben Fällen vergleichen

Wenn eine neue Fassung geprüft werden soll, reicht ein Vergleich zweier Gesamtwerte aus unterschiedlichen Zeiträumen nicht aus, um den Unterschied der Fassungen zu beurteilen: Dann können auch andere Fälle hinter dem Ergebnis stehen. Für das Beispiel bietet sich ein gemeinsamer, zurückgehaltener Prüfbestand an, auf den beide Fassungen angewendet werden. Dieser Vergleichsaufbau ist ein eigener Vorschlag.

Die Prüffälle müssen von den Daten getrennt bleiben, die zur Entwicklung und Abstimmung der neuen Fassung genutzt wurden. ISO/IEC 22989 erläutert diese Trennung, um eine überschätzte Modellleistung zu vermeiden.[1]

In den gemeinsamen Prüfbestand gehören für diesen Vorschlag sowohl Fälle aus dem aktuellen Betrieb als auch weiterhin relevante frühere Einsatzfälle. Die Auswertung hält Produktvarianten und Zeiträume auseinander. Beide Fassungen werden gegen dieselben fachlichen Kriterien bewertet; unklare Referenzbewertungen bleiben auch im Vergleich ungeklärt.

Unbegründete Markierungen und übersehene Auffälligkeiten werden getrennt betrachtet. Weniger Markierungen sind keine Verbesserung, wenn dadurch mehr fachlich relevante Fenster unentdeckt bleiben. Ebenso kann ein besseres Gesamtergebnis eine Verschlechterung bei einer seltenen Variante verdecken.

Das Ergebnis dieser Prüfung trägt die Entscheidung über den weiteren Einsatz. Bei einer Änderung wird festgehalten, für welchen Bereich und ab wann die neue Fassung gilt; bei unverändertem Weiterbetrieb bleiben Begründung und verbleibende Unsicherheit erhalten. So lässt sich später noch unterscheiden, ob sich der Prozess, die Bewertung oder das eingesetzte Modell verändert hat.

Primärquellen und weiterführende Literatur

ISO/IEC 22989:2022 – Information technology — Artificial intelligence — Artificial intelligence concepts and terminology. Kostenpflichtige Norm. Originalquelle

Gama et al.: A Survey on Concept Drift Adaptation. ACM Computing Surveys 46(4), 2014, Artikel 44. Fundstellen nach dem beigefügten 44-seitigen Repository-Manuskript, nicht nach der finalen Verlagspaginierung. Originalquelle

Chandola, Banerjee und Kumar: Anomaly Detection: A Survey. Technischer Bericht TR 07-017; Fundstellen nach der beigefügten Manuskriptfassung. Originalquelle

Rabanser, Günnemann und Lipton: Failing Loudly: An Empirical Study of Methods for Detecting Dataset Shift. NeurIPS 2019. Originalquelle