(Aktualizováno pro LS 2025/26)
- Přednášky: pátek 7:30 - 9:00 CET, cvičení: pátek 18:00 - 19:30 CET
- Konzultační hodiny individuálně na základě dohody s vyučujícím
- 2025-02-20: Úvod, organizační pokyny, motivace k řešení problematiky datové kvality. Požadavky na úspěšné absolvování kurzu. Co je to kvalita dat a informací. Řízení kvality dat a informací, Data Quality 1-2-3. Konfigurace labu, představení umělých dat, výstupů, MySQL toolbox.
- 2025-02-27: Vlastnosti dat. Příčiny a důsledky nekvalitních dat, Six Sigma, Kaizen, rekonciliace dat, root-cause analýza. Případové studie, měření vlastností dat, měření nákladů nekvalitních dat.
- 2022-03-06: Data Governance, související právní normy, Entity Recognition, kvalita metadat, datové katalogy, Data Lineage a Data Provenance. Právní normy relevantní pro naši praktickou úlohu, návrh principů, standardů, politik v praxi. Entity Recognition v praxi, anonymizace, masking, pseudonymizace dat.
- 2025-03-13: Data Profiling a alternativní přístupy (analýza procesů, testování kontrol), Data Drift. Výstupy profilingu, příklady implementace v různých nástrojích, process mining.
- 2025-03-20: Validace dat, definice pravidel, datové kontroly, DQ Firewall, validační služby, vazba na metriky výkonnosti řízení dat. Validace v praxi, validace proti vybraným API.
- 2025-03-27: Audit kvality dat. Vypracování zprávy auditora. Parsing, standardizace, unifikace. Standardizace a unifikace v praxi. Prevence vzniku chyb, oprava stávajících chyb: standardizace, korekce, implementace kontrol. Proces řízení kvality dat (metodiky, modely, projekt implementace).
- 2025-04-03: Good Friday (výuka odpadá)
- 2025-04-10: Inovační týden (výuka odpadá) Termín odevzdání zprávy auditora
- 2025-04-17: Imputace chybějících pozorování, obohacování dat o externí datové zdroje, geocoding.
- 2025-04-24: Porovnávání a slučování záznamů, Master Data Management, Householding.
- 2025-05-01: Státní svátek (výuka odpadá)
- 2025-05-08: Státní svátek (výuka odpadá)
- 2025-05-15: Implementace monitoringu, kontinuální zvyšování kvality dat, Augmented Data Quality, specifické formy datové kvality (nestrukturovaná data, Linked Data, ...). Rozdíl mezi Data Qualitz Monitoring a Data Observability. Extrakce metadat z nestrukturovaných dat, deduplikace nestrukturovaných dat. Aktuální trendy a výzvy. Příprava na test.
- 18.5. - 26.6. zkouškový test, odevzdání nápravných opatření (alespoň týden před koncem)
- 10 otázek z teorie po 4 bodech, celkem 40% celkového hodnocení
- 60% celkového hodnocení
- Identifikujte relevantní právní normy a regulace
- Identifikujte klíčové datové elementy
- Technický profiling: s pomocí vybraného nástroje vytvořte profilaci dat (základní popisné statistiky, četnosti syntaktických vzorů, ...)
- Validace vybraných atributů pomocí regulárních výrazů, kontrolních součtů, lookup a business pravidel
- Spočtěte úroveň kvantitativních vlastností dat (správnost, úplnost, konzistentnost, ...)
- Identifikujte nesoulad s požadavky právních norem a regulací
- Identifikujte nedostatky ve stávajícím datovém modelu (chybějící atributy, zbytečné atributy, chybné datové typy, nekonzistentní názvy, nekonzistentní collations)
- Root-cause analýza zjištěných defektů
- Na příkladu modelové firmy odhadněte roční výši nákladů na nekvalitní data (v kontextu užití dat)
- Porovnejte možné přínosy nápravných opatření se souvisejícími náklady
- Proveďte prioritizaci nápravných opatření
- Navrhněte externí datové zroje pro obohacení dat
- Navrhněte strategii pro doplnění chybějících hodnot
- Odevzdání vypracované zprávy auditora + naměřené charakteristiky / náklady (Word / HTML / PDF / Jupyter Notebook dle šablony pro zprávu auditora)
- Optimalizace datového modelu
- Parsing adresy, standardizace, vytvoření porovnávacích kódů a zřetězení na adresní registr
- Nastavení příznaku doručitelnosti na adresu na základě pravidel
- Doplnění chybějících pozorování
- Unifikace dat klientů, adres, kontaktů
- Deduplikace klientů
- Identifikace domácnosti
- Návrh kontrol bránících dalšímu vzniku chyb v datech
- Odevzdání CSV souboru s vyčištěnými daty (viz instrukce ze cvičení) + PDF dokumentace provedených opatření
- 90 a více bodů = 1
- 75 - 89 bodů = 2
- 60 - 74 bodů = 3
- 50 - 59 bodů = 4+ (možnost dozkoušení)
- 0 - 49 bodů = nevyhověl
- 60% bodů lze získat z praktické úlohy
- 40% bodů lze získat z testu
- bonusové body z quizů na přednáškách
- bonusové body za inovativní přístup (což není napsání promptu pro Claude apod., ale skill pro AI agenta už to být může)
- Prezentace k přednáškám
- Články výslovně zmíněné přednášejícím
- Konfigurace MySQL MCP Server s Claude Desktop
- Egeria Project klasifikace metadat
- Článek IT Assurance Guide - díl 1.
- Článek IT Assurance Guide - díl 2.
- Článek IT Assurance Guide - díl 3.
- Návod na kakulaci nákladů na nekvalitu plynoucí z duplicitních záznamů
- McGILVRAY, D. Executing Data Quality Projects: Ten Steps to Quality Data and Trusted Information. Morgan Kaufmann, 2008. xviii, 325 s. ISBN 978-0-12-374369-5.
- MAYDANCHIK, Arkady. Data quality assessment. Bradley Beach: Technics Publications, LLC, [2007], ©2007. xiv, 321 stran. Data quality for practitioners series. ISBN 978-0-9771400-2-2.
- CHAPMAN, P., KHABAZA, T., SHEARER, C.: CRISP-DM 1.0 Step by step data mining guide. IBM, 2012. ftp://ftp.software.ibm.com/software/analytics/spss/support/Modeler/Documentation/14/UserManual/CRISP-DM.pdf
- Materiály dostupné na www.dataquality.cz
- PEJČOCH, D. Metody řešení problematiky neúplných dat [online]. 2011-01-13 Přednáška č. 4 v rámci Data Quality Tutorial. Dostupné pod odkazem: https://github.com/dpejcoch/4IZ562/tree/master/papers/Data_Imputation.pdf.
- PEJČOCH, D. Benchmark přístupů k Fuzzy Match / Merge. Sborník prací účastníků vědeckého semináře doktorského studia. Fakulta informatiky a statistiky VŠE. Praha 2009. ISBN 978-80-245-1524-3.
- LOSHIN, D. The Practitioner’s Guide to Data Quality Improvement. Burlington: Morgan Kaufmann as inprint of Elsevier, 2011. ISBN 978-0-12-373717-5.
- ENGLISH, Larry P. Improving Data Warehouse and Business Information Quality: Methods for Reducing Costs and Increasing Profits. Wiley & Sons, 1999. xxvi, 518 s. ISBN-10 0-471-25383-9.
- LEE, Yang W., PIPINO, Leo L., FUNK, James D., WANG, Richard Y. Journey to Data Quality. The MIT Press, 2006. 240 s. ISBN-10 02-621-2287-1.
- BATINI, Carlo, SCANNAPIECO, Monica. Data Quality: Concepts, Methodologies and Techniques. Berlin: Springer-Verlag, 2006. xix, 262 s. ISBN-10 3-540-33172-7.
- BERSON, Alex, DUBOV, Larry. Master Data Management and Customer Data Integration for a Global Enterprise. McGraw-Hill Companies, 2007. xxi, 393 s. ISBN-10 0-07-226349-0.
- DYCHÉ, Jill, LEVY, Evan. Customer data integration: Reaching a Single Version of the Truth. SAS Institute Inc., Wiley & Sons, 2006, xxiv, 294 s. ISBN-10 0-471-91697-8.
- REDMAN, T. Data Quality: The Field Guide. Boston: Butterworth-Heinemann MA, 2001. xviii, 241. ISBN-10 1-55558-251-6.
- DAMA International: The DAMA Guide to the Data Management Body of Knowledge (DAMA-DMBOK). Technics Publication, LLC, 2009. ISBN 978-1-9355040-2-3.
- Chaudhuri S., Ganjam K., Ganti V., Motwani R.: Robust and Efficient Fuzzy Match for Online Data Cleaning, SIGMOD 2003, June 9-12, 2003 San Diego, CA.
- D'Ambrosio A. Boosted Incremental Tree-based Imputation of Missing Data, PhD. thesis, Universitá degli Studi di Napoli Federico II. 2007.
- PEJČOCH, D. Audit datové kvality podle IT Assurance Guide: Using COBIT - 1. díl. In: Data Quality CZ [online]. 2012-03-07 07:14:52. Dostupné z: [URL].
- PEJČOCH, D. Audit datové kvality podle IT Assurance Guide: Using COBIT - 2. díl. In: Data Quality CZ [online]. 2012-03-07 07:14:52. Dostupné z: [URL].
- PEJČOCH, D. Audit datové kvality podle IT Assurance Guide: Using COBIT - 3. díl. In: Data Quality CZ [online]. 2012-03-07 07:14:52. Dostupné z: [URL].
- Dataversity: https://www.dataversity.net/
- DAMA: https://www.dama.org/cpages/home
- Larry English - guru informační kvality
- Jil Dyché - první dáma Data Governance
- Evan Levy - spoluzakladatel Baseline Consulting, autor řady publikací
- David Loshin - autor řady publikací pojednávajících o dopadu nekvalitních dat do byznysu
- prof. Richard Wang - vůdčí postava MIT Total Data Quality Management program
- prof. Carlo Batini - Università degli Studi di Milano-Bicocca
- Thomas C. Redman, Ph.D. - prezident Navesink Consulting Group
- Arkadyi Maydanchik – audit datové kvality
- Dannette McGilvray – metodika 10 steps
- Sunil Soares – Big Data Quality
- John Ladley – Data Governance
- Henrik Gabs Liliendahl - https://liliendahl.com/ (MDM, Data Quality)
- Alex Berson a Larry Dubov – Master Data Management
Pro vypracování semestrální práce potřebujete data modelové firmy dostupné jako SQL dump z MySQL / MariaDB databáze. SQL soubor je dostupný z Teams.
Na cvičeních budeme používat vlastní virtuální prostředí (VM/Docker) + Jupyter Notebook s MySQL kernelem (alternativně můžete používat VS Code s příslušnými pluginy)
- Windows + nechci si ušpinit ruce: předpřipravaný OVA pro VirtualBox
- Windows + chci si ušpinit ruce: vytvořit vlastní VM pro VirtualBox
- Mac M1+ (nejsnazší cesta): Docker Desktop + předpřipravené YAML pro docker compose
- Linux: VirtualBox nebo Docker + virtualenv nebo Jupyter container
- Validace dat (technické testy): Great Expectations (GX) (https://greatexpectations.io), DBT Tests (Pokud budete nahrávat csv soubory do DB modelu)
- Data Profiling: Ydata Profiling (Python library)
- Další free nástroje: OpenRafine, SODA Core (https://www.soda.io), MobyDQ, Deequ, Quadient DataCleaner, Apache Griffin, DataKitchen (https://datakitchen.io)
- Ataccama DQ Analyzer (stažitelný na www.ataccama.com) + Atacama ONE Profiler (online)
- DataCleaner Community Edition dostupný na https://datacleaner.github.io (data profiling, data wrangling, etc.)
- Open Source Data Quality and Profiling dostupný na https://sourceforge.net/projects/dataquality (profiling, metadata discovery, anomaly detection, deduplication, standardization, address correction, data masking)
- Vlastní nástroj napsaný v SQL + jakýkoliv jazyk (R, Java, Python, ...)
- Claude Pro + skills + MySQL MCP Server
- Python + HTML/JavaScript generovaný Claude