Helmis / Hollmann | Webbasierte Datenintegration | E-Book | www.sack.de
E-Book

E-Book, Deutsch, 198 Seiten, Web PDF

Reihe: Computer Science and Engineering (German Language)

Helmis / Hollmann Webbasierte Datenintegration

Ansätze zur Messung und Sicherung der Informationsqualität in heterogenen Datenbeständen unter Verwendung eines vollständig webbasierten Werkzeuges
1. Auflage 2009
ISBN: 978-3-8348-9280-5
Verlag: Vieweg & Teubner
Format: PDF
Kopierschutz: 1 - PDF Watermark

Ansätze zur Messung und Sicherung der Informationsqualität in heterogenen Datenbeständen unter Verwendung eines vollständig webbasierten Werkzeuges

E-Book, Deutsch, 198 Seiten, Web PDF

Reihe: Computer Science and Engineering (German Language)

ISBN: 978-3-8348-9280-5
Verlag: Vieweg & Teubner
Format: PDF
Kopierschutz: 1 - PDF Watermark



Unternehmen und Organisationen verwenden heute enorme Menge an Daten, die durch verschiedene IT-Systeme erzeugt werden. Durch die Heterogenität der Datensätze ist eine ganzheitliche Sicht auf Informationen eine große Herausforderung, deren Lösung aber einen immensen Vorteil bietet. Um eine Integration verschiedener Ausgangssysteme zu erhalten, spielt die Informationsqualität, das Messen dieser, wie auch die Sicherung der Datenqualität eine große Rolle.

Die Autoren diskutieren die Problematik der Datenqualität im Fokus eines Integrationsprozesses. Sie stellen am Markt verfügbare Systeme zur Datenintegration und –analyse vor und entwickeln, basierend auf einer Anforderungsanalyse, ein webbasiertes Werkzeug, welches die Integration der Daten ermöglicht und die Qualität der Datenbestände testet. Die Analyse der Bestände, das Auffinden von Duplikaten und die Bereinigung der Daten stehen dabei im Fokus dieses Werkzeuges, welches eine Grundlage für eine umfassende Datenqualitäts- und Bereinigungslösung darstellen kann.
Helmis / Hollmann Webbasierte Datenintegration jetzt bestellen!

Zielgruppe


Research

Weitere Infos & Material


Datenbereinigung und Konsolidierung von heterogenen Datenbeständen.- Datenqualität.- Dimensionen und Architektur der Informationsintegration.- Data Cleaning.- Konzeption des Data Cleaning Toolkits.- Implementierung.- Zusammenfassung und Ausblick.- Auffinden und Bereinigen von Duplikaten in heterogenen Datenbeständen.- Informationen, Daten und Wissen- ein Definitionsversuch.- Informationsintegration im Fokus der Datenqualität.- Duplikate in Datenbeständen.- Konkrete Verfahren zur Dublettenauffindung und Klassifikation.- Konzept der Datenqualitätsanwendung „DCT“.- Implementierung, ausgewählte Algorithmen- und Datenstrukturen.- Fazit und Ausblick.


13 Konzept der Datenqualitätsanwendung „DCT" (S. 147-148)

Nachdem in den vergangenen Kapiteln die theoretischen Grundlagen für das Messen von Datenqualität und das konkrete Auf.nden von Duplikaten vorgestellt wurden, folgt in diesem Kapitel die Dokumentation eines Konzeptes zur konkreten Umsetzung einiger gezeigter Verfahrensweisen in einer leistungsfähigen Anwendung. Dieses Kapitel stellt die entwickelte Software „Data Cleaning Toolkit", kurz „DCT" sowie die zugrunde liegenden Entwicklungsmodelle und Entwürfe dar.

Neben der Architektur der verwendeten Technologie, der der Anwendung als Grundlage dient, werden die Modelle der Applikation, wie auch die zum Einsatz kommenden Datenmodelle beschrieben und dokumentiert. Für eine einfache und effiziente Anwendung, wird die Applikation durch eine einfache, aber leistungsfähige und gut verwendbare Benutzerober.äche bedient. Eingangs werden die Motivation für die Entwicklung der Anwendung, wie auch die gestellten Anforderungen diskutiert.

13.1 Zielstellung der Applikation

Die außerordentliche Notwendigkeit der Erhaltung bzw. Schaffung einer hohen Datenqualität in einem Unternehmensdatenbestand wurde im Verlauf dieser Arbeit mehrfach hervorgehoben und bewiesen. Es erscheint logisch, dass vorgestellte Konzepte und Verfahrensweisen in einer Softwaretechnischen Umsetzung angewendet werden. Die mit Co-Autor Steven Helmis (vgl. [Hel07]) entworfene und prototypisch im Rahmen dieser Masterthesis implementierte Applikation stellt das Ergebnis der thematischen Auseinandersetzung mit Datenqualität und deren Bewertung dar. Ziel der Applikationsentwicklung war es, eine leistungsfähige, modular aufgebaute und universell einsetzbare Lösung zur Datenqualitätsbewertung wie auch der Identi.kation von Duplikaten mit einer adäquaten Visualisierung und Auswertung zu entwickeln.

Als Quelldaten sollten hierbei vor allem verschiedene heterogene Datenbanken unterschiedlicher Datembankmanagementsysteme dienen. Für die eigentliche Bewertung und die Verarbeitung der geladenen, heterogenen Operativdaten wird in der Arbeitsdatenbank eine „Workspace-Table" angelegt, was eine manipulationsfreie Weiterverarbeitung der Quelldaten ermöglicht. In dieser sollen, die im Folgenden beschrieben Verfahren und Funktionen zur Bewertung der Qualität im geladenen Datenbestand und zur Duplikaterkennung nach verschiedenen Gesichtspunkten durchgeführt werden. Eine entsprechende, Grafiken-gestützte Auswertung macht die ermittelten Ergebnisse für Benutzer des Systems interpretierbar. Ebenso sollten externe Referenzdaten für die Qualitätsmessung und die Dublettensuche zum Einsatz kommen.

Die Anwendung soll universell als Client/Sever Anwendung ausgeführt werden. Als Zieltechnologie dient die webbasierte PHP-Skriptsprache. Die Arbeitsdatenbank, wie auch Applikationsdatenstrukturen werden im freien DBMS „MSSQL 2005 Express" verfügbar gemacht. Mit Hilfe von einzurichtenden Konnektoren soll so auf externe, verteilte und über das Internet verfügbare Quelldatenbanken zugegriffen werden. Interpretierbarkeit und Übersichtlichkeit der erzeugten Ergebnisse stand im Vordergrund der Auswertung und Visualiserung am Ende des Bewertungsprozesses.

13.2 Anforderungsanalyse

Für die Entwicklung des „DCT" wurde eine umfangreiche Analyse der eigentlichen Anforderungen an den zu implementierenden Prototypen durchgeführt. Diese sollen im folgenden Abschnitt dargestellt werden und orientieren sich in ihrer Struktur vornehmlich an den Richtlinien des „Reqirements Engineering", also der Anforderungsanalyse für die Softwareentwicklung, die im Referenzwerk von Balzert et al. (vgl. [Bal00]) dargestellt sind. Aus Gründen der Übersichtlichkeit wird jedoch nur ein Teil der von Balzert et al. geforderten Inhalte eines vollständigen P.ichtenhefts (engl. Software Requirement Speci.cation, kurz SRS) in diesem Abschnitt dargestellt.


Steven Helmis und Robert Hollmann studierten Angewandte Informatik an der Fachhochschule Erfurt und wurden für ihre Arbeiten mit dem „Information Quality Best Master Degree Award“ der Deutschen Gesellschaft für Informations- und Datenqualität ausgezeichnet.



Ihre Fragen, Wünsche oder Anmerkungen
Vorname*
Nachname*
Ihre E-Mail-Adresse*
Kundennr.
Ihre Nachricht*
Lediglich mit * gekennzeichnete Felder sind Pflichtfelder.
Wenn Sie die im Kontaktformular eingegebenen Daten durch Klick auf den nachfolgenden Button übersenden, erklären Sie sich damit einverstanden, dass wir Ihr Angaben für die Beantwortung Ihrer Anfrage verwenden. Selbstverständlich werden Ihre Daten vertraulich behandelt und nicht an Dritte weitergegeben. Sie können der Verwendung Ihrer Daten jederzeit widersprechen. Das Datenhandling bei Sack Fachmedien erklären wir Ihnen in unserer Datenschutzerklärung.