Referenzzeiträume, Markierungen und Erkennungsqualität
Anomalieerkennung in der Produktion: Wann zählt ein auffälliger Verlauf als erkannt?
Anomalieerkennung, englisch Anomaly Detection, sucht in Daten nach Beobachtungen oder Mustern, die vom erwarteten Verhalten abweichen. In der Produktion kann das einen einzelnen Messwert betreffen, aber auch einen zusammenhängenden Verlauf. Ob eine solche Auffälligkeit als erkannt zählt, hängt davon ab, was die Auswertung markieren soll: einzelne Zeitpunkte, ein ganzes Fenster oder einen Zeitraum mit Anfang und Ende. Ein Treffer irgendwo im Verlauf beantwortet noch nicht, wie vollständig dieser erfasst wurde.[1][2]
Bevor Treffer gezählt werden, muss feststehen, was als ein Fall gilt und wie die Markierungen diesem Fall zugeordnet werden.
Was Anomalieerkennung erkennt – und was daraus noch nicht folgt
Auffälligkeit ist zunächst eine Aussage über Daten im Verhältnis zu einer Erwartung. Welche Abweichung relevant ist, hängt von der Aufgabe ab; die Grenze zwischen normalem und anomalem Verhalten ist nicht immer eindeutig. Ein markierter Temperaturverlauf belegt deshalb für sich allein weder einen Produktfehler noch dessen Ursache.[1]
Im folgenden fiktiven Beispiel wird die Temperatur während einer festgelegten Haltephase einer Produktionsanlage untersucht. Produktvariante und betrachtete Phase bleiben für den Vergleich gleich. Welche Erwartung an den Verlauf sinnvoll ist, hängt auch vom Zustand des Prozesses ab: Eine Temperaturänderung beim Aufheizen ist anders einzuordnen als während einer Haltephase.
Angenommen wird ein Verfahren, dessen Referenz aus für diese Aufgabe als normal ausgewählten Verläufen gewonnen wurde. Das ist eine Festlegung des Beispiels, keine Eigenschaft jeder Anomalieerkennung. Die verfügbaren Daten und Bewertungen unterscheiden sich zwischen Verfahren und Anwendungen.[1]
Einzelwert, Messvektor oder zusammenhängender Verlauf?
Eine Auswertung kann jeder abgeschlossenen Haltephase ein einziges Urteil zuordnen. Dann ist das Fenster markiert oder nicht markiert. Daraus lässt sich noch nicht ablesen, welcher Teil seines Verlaufs auffällig war. Ein anderes Verfahren kann dagegen einzelne Zeitpunkte oder Abschnitte auf der Zeitachse markieren. Erst diese feinere Ausgabe erlaubt die Frage, ob Beginn, Dauer und Ende eines auffälligen Zeitraums erfasst wurden.
Auch die Zahl der Messgrößen ist davon zu unterscheiden. Ein Datenpunkt kann nur die Temperatur enthalten oder mehrere gleichzeitig betrachtete Größen. Ein Vektor aus mehreren Messgrößen ist multivariat; er ist deshalb aber noch kein Zeitraum. Die zeitliche Einheit und die Zahl der Merkmale sind zwei verschiedene Eigenschaften der Auswertung.[1]
Chandola, Banerjee und Kumar unterscheiden auffällige Einzelbeobachtungen, kontextabhängige Auffälligkeiten und Auffälligkeiten einer Gruppe zusammenhängender Beobachtungen; Kontextabhängigkeit kann dabei Einzelwerte wie Gruppen betreffen.[1] Tatbul und Mitautoren ordnen Auffälligkeiten, die sich über einen zusammenhängenden Zeitraum erstrecken, als Teilmenge der kontextabhängigen und der Gruppenauffälligkeiten ein.[2] Für das Temperaturbeispiel ist deshalb entscheidend, ob ein einzelner Wert oder das Verhalten über eine Zeitspanne die gesuchte Auffälligkeit bildet.
Wann ein Ereignis als erkannt zählt
Für das Beispiel wird innerhalb der Haltephase ein zusammenhängender Zeitraum fachlich als relevante Auffälligkeit eingeordnet. Er dient als Referenz für den Vergleich. Der übrige dargestellte Verlauf sei ebenfalls geprüft und für diese Aufgabe als unauffällig bewertet. Das Beispiel enthält damit keine unbekannten Abschnitte; ein realer Versuch kann solche durchaus haben.
Eine erste mögliche Ausgabe markiert nur einen kurzen Abschnitt innerhalb des Referenzzeitraums. Damit hat sie die Auffälligkeit als solche erfasst. Ob dieser Teiltreffer für die Aufgabe genügt, ist eine andere Frage. Soll die Dauer der Auffälligkeit erfasst werden, fehlt ein Teil der gesuchten Information.[2]
Eine zweite Ausgabe deckt fast den gesamten Zeitraum ab. Eine dritte markiert mehrere voneinander getrennte Stücke darin. Wird nur die Zahl markierter Messpunkte betrachtet, kann der Unterschied zwischen einer zusammenhängenden und einer zerstückelten Ausgabe verloren gehen. Für eine Aufgabe, die ein Ereignis als zusammengehörigen Vorgang erfassen soll, kann gerade dieser Unterschied wichtig sein.[2]
Zusätzlich kann eine Ausgabe einen Abschnitt außerhalb des Referenzzeitraums markieren. Da dieser im Beispiel als unauffällig bewertet wurde, ist diese Markierung für die festgelegte Aufgabe unbegründet. Dass dieselbe Ausgabe den relevanten Zeitraum gut abdeckt, macht die zusätzliche Markierung nicht zu einem Treffer.
Tatbul und Mitautoren beschreiben einen Bewertungsansatz für solche Zeitbereiche. Er unterscheidet, ob eine Auffälligkeit überhaupt getroffen wird, wie groß die Überdeckung ist, wo sie innerhalb des Zeitraums liegt und ob mehrere getrennte Markierungen auf denselben Zeitraum treffen. Die Gewichtung lässt sich an die Aufgabe anpassen. Das ist ein Forschungsansatz, keine allgemeine Vorgabe, dass eine bestimmte Teilabdeckung immer genügen muss.[2]
Die Begriffe Precision und Recall beziehen sich bei einer klassischen Zählung auf zwei unterschiedliche Mengen: Precision beschreibt den Anteil zutreffender positiver Ausgaben an allen positiven Ausgaben; Recall den Anteil erkannter positiver Referenzfälle an allen positiven Referenzfällen. Als positive Klasse gilt hier die für den Vergleich festgelegte Auffälligkeit – kein nachgewiesener Produktmangel. Für diese Zählung muss die Einheit gleich bleiben: Messpunkte, Fenster oder nach einer festgelegten Regel zugeordnete Ereignisse.[2]
Bei teilweise überlappenden Zeitbereichen reicht die bloße Zahl markierter Punkte nicht aus, um auch die Qualität der Ereigniserkennung auszudrücken. Eine Kennzahl muss erkennen lassen, wie Teilabdeckung und mehrere Markierungen behandelt wurden. Werden andere Einheiten oder Zuordnungsregeln verwendet, sind gleich benannte Kennzahlen nicht ohne Weiteres vergleichbar.[2]
Dabei bleibt die Lage einer Markierung von ihrer Verfügbarkeit getrennt. Ein Verfahren kann einen frühen Abschnitt erst nach Abschluss des gesamten Fensters markieren. Daraus folgt keine frühe Meldung im laufenden Prozess. Ob der Hinweis rechtzeitig für die fachliche Prüfung vorliegt, hängt vom vorgesehenen Ablauf und der tatsächlichen Bereitstellung ab.
Was vor dem ersten Vergleich feststehen sollte
Die Grenzen des Referenzzeitraums verdienen dieselbe Aufmerksamkeit wie die Markierungen. Wenn der Übergang zwischen normalem und auffälligem Verhalten unscharf ist, kann eine geringfügig andere Festlegung von Anfang oder Ende die Überdeckung verändern. Für das Beispiel gehört deshalb zur fachlichen Referenz auch, nach welchen Kriterien diese Grenzen gezogen wurden.[1]
Für einen solchen Vergleich lassen sich daraus fünf Festlegungen ableiten:
- Die Einheit: Wird ein Messpunkt, ein Fenster oder ein zusammenhängender Zeitraum bewertet?
- Die Zuordnung: Wann gehört eine Markierung zu einem Referenzzeitraum, und wie werden Überlappungen behandelt?
- Die Abdeckung: Genügt das Auffinden des Ereignisses, oder zählen auch erfasste Dauer und Lage?
- Die Fragmentierung: Wie werden mehrere Markierungen für denselben Zeitraum und Markierungen über mehrere Zeiträume hinweg berücksichtigt?
- Die Bewertungsbasis: Welche Abschnitte sind fachlich eingeordnet, und welche bleiben offen?
Auch das Aufteilen einer Zeitreihe kann die Bewertungsaufgabe verändern. Wird ein zusammenhängendes Ereignis an einer Trennstelle zerschnitten, entstehen in den Teilstücken andere Grenzen. Tatbul und Mitautoren teilten die Daten für Training und Test in ihrem Versuchsaufbau so auf, dass die Anomaliezeiträume trotz der Unterteilung intakt blieben. Das ist ihr beschriebenes Vorgehen, keine allgemeine Vorschrift für jede Datenaufteilung. Für den eigenen Versuch sollte erkennbar bleiben, ob Teilstücke noch demselben Ereignis zugeordnet werden.[2]
Welche Daten zur Modellentwicklung dienen und welche für die Prüfung zurückgehalten werden, gehört zur Festlegung der Trainings- und Testdaten. Die hier beschriebene Ereigniszuordnung ergänzt diese Trennung: Sie hält fest, auf welche Einheit sich das Prüfergebnis bezieht.
Für Abschnitte ohne fachliche Bewertung lässt sich nicht entscheiden, ob eine Markierung zutrifft oder eine Auffälligkeit übersehen wurde. Solche Abschnitte dürfen in der Auswertung nicht stillschweigend als unauffällige Referenz behandelt werden. Das Ergebnis des Vergleichs bezieht sich auf die tatsächlich bewertete Menge.
In der Auswertung bleiben damit drei Dinge unterscheidbar: der fachlich eingeordnete Referenzzeitraum, die Ausgabe des Verfahrens und die Regel, nach der beide einander zugeordnet werden. Wird diese Regel verändert, kann sich die Kennzahl ändern, obwohl dieselben Daten und dieselben Markierungen vorliegen.[2]
Eine bestandene Erkennungsaufgabe legt noch nicht fest, welche Handlung im Betrieb folgt. Ein konkreter auffälliger Hinweis benötigt seine fachliche Prüfung. Der Vergleich zeigt zunächst, was das Verfahren unter den festgelegten Bedingungen erkannt hat – und was seine Kennzahlen überhaupt zählen.
Primärquellen und weiterführende Literatur
[1] Chandola, V.; Banerjee, A.; Kumar, V. (2007): Anomaly Detection: A Survey. University of Minnesota, TR 07-017, insbesondere Abschnitte 1.1–1.2 und 2.1–2.3. Verwendet wurde das Repository-Manuskript, nicht die gesetzte ACM-Fassung. Originalquelle.
[2] Tatbul, N.; Lee, T. J.; Zdonik, S.; Alam, M.; Gottschlich, J. (2018): Precision and Recall for Time Series. Advances in Neural Information Processing Systems 31, insbesondere Abschnitte 1, 2, 4 und 5.1. Originalquelle.