CRISP-DM

CRISP-DM

Kernidee

Sechsphasiger Standardprozess, im Kurs in zwei Lesarten: klassisch für Data Mining und angepasst für Automatisierungen.

Herkunft

Cross-Industry Standard Process for Data Mining, EU-Projekt 1996–99 (DaimlerChrysler, NCR Systems Copenhagen, OHRA Bank Groep, SPSS)

Modell BusinessUnderstanding DataUnderstanding DataPreparation Modelling Evaluation Deployment Iterativ Rückschritte sind normal

Im Kurs der fünfte Schritt des AITI Use Case Prozesses: „Der Canvas zeigt, was der Kunde will. CRISP-DM zeigt, wie wir es umsetzen.”

Die sechs Phasen

  1. Business Understanding: Projektziele und Anforderungen aus Unternehmenssicht verstehen und in eine Data-Mining-Problemstellung übersetzen.
  2. Data Understanding: erste Datenerfassung, sich mit den Daten vertraut machen, Datenqualitätsprobleme erkennen.
  3. Data Preparation: alle Aktivitäten zur Erstellung des endgültigen Datensatzes, der in die Modellierungswerkzeuge eingespeist wird.
  4. Modelling: Modellierungstechniken auswählen und anwenden, damit die vorbereiteten Daten optimal genutzt werden.
  5. Evaluation: bevor das Modell ausgerollt wird, prüfen, ob es fachlich wirklich taugt.
  6. Deployment — Operationalisierung in der IT-Infrastruktur. „Die Erstellung des Modells ist im Allgemeinen nicht das Ende des Projekts.”

Zwei Lesarten im Kurs

Klassisch: durchgespielt am Beispiel einer Immobilien-Preisschätzung: historische Verkaufsdaten, Ausreißer entfernen, ein neuronales Netz mit drei Eingaben (Zimmer, Wohnfläche, Entfernung zum Zentrum) trainieren, auf ungesehenen Testdaten prüfen und in die Website integrieren.

Angepasst für Automatisierungen: dieselben sechs Phasen, aber mit anderen Leitfragen: Was passiert heute manuell und wie lange dauert es? Was ist der Trigger (Formular, E-Mail, Zeitplan, Datenbankänderung)? Formate vereinheitlichen. Brauche ich einfache Logik oder KI? Funktioniert der Hauptfall zuverlässig, und was passiert bei Ausnahmen? Workflow aktivieren, Betroffene schulen, dokumentieren.

Zwei Merksätze aus dem Deck

  • Rückschritte sind normal: „Neue Erkenntnisse? Zurück – und das ist gut so.” Wer mitten im Projekt merkt, dass der Trigger anders funktioniert als gedacht, geht eine Phase zurück.
  • Deployment ist kein Abschluss: APIs ändern sich, Systeme bekommen Updates, Formate verschieben sich. Dazu der Begriff Prompt Drift, wenn der Prompt gleich bleibt, die KI sich aber still verändert; abgeleitet vom Data Drift aus dem Machine Learning.

Laut CLAUDE.md existiert die CRISP-DM-Grafik im Kursmaterial in mindestens vier Varianten (Standardversion, Fortschrittsanzeige, Ausfüllvorlage, „Angepasst für Automatisierungen”).

Wird verwendet an