Dipl.-Finanzwirt (FH) Nikolaus Zöllner
6.1 Data Profiling (Datenanalyse)
Data Profiling ist eine statistische Analyse und Bewertung von Datensätzen. Vergleichbar mit einem Archäologen werden Daten mit Werkzeugen ausgegraben, sauber freigelegt, betrachtet, kategorisiert und bewertet. Im Gegensatz zum Archäologen, der dafür i. d. R. Handarbeit mit Schaufel, Spachtel und Pinsel leistet, erfolgt die Analyse beim Data Profiling mit weitgehend digitalen und automatisierten Verfahren.
Ziel des Data Profilings ist es, die vorhandenen Daten systematisch auf Fehler, Inkonsistenzen und Mängel zu untersuchen. Das Data Profiling dient jedoch nicht dazu, erkannte Qualitätsprobleme von Daten zu beheben. Dies bleibt den nachfolgenden Schritten vorbehalten. Die Ergebnisse dienen vielmehr zur Beurteilung, wie gut die untersuchten Daten für bestimmte vorgesehene Zwecke nutzbar sind und mit welchem Aufwand und Risiko weitere Aktivitäten verbunden sind. So können Überraschungen oder Verzögerungen bei der Weiterverarbeitung der Daten abgeschätzt werden. Es empfiehlt sich daher, das Data Profiling möglichst früh in der jeweiligen Projektplanung einzusetzen.
Beim grundlegenden Data Profiling erfolgt ein schrittweises Vorgehen in 4 Stufen:
- Daten integrieren
- Daten analysieren
- Ergebnisse präsentieren
- Ergebnisse bewerten
In einem ersten Schritt müssen die Daten für das Profiling aus den originären Datenquellen extrahiert werden. Dies kann über eine programmgestützte Exportfunktion oder Schnittstelle oder notfalls mit den in der Praxis bekannten Befehlen "Kopieren" (STRG-C) und "Einfügen" (STRG-V) erfolgen. Die Extraktion der Daten vor dem Profiling ist empfehlenswert, um die Daten von den Produktivsystemen zu entkoppeln und "stand-alone" für den Profilingprozess zur Verfügung zu haben. Dadurch wird auch unnötige Netzwerklast auf den Quellsystemen vermieden. Im Rahmen der E...