Technický manuál: Modul 02

Příprava a čištění dat pro AI systémy

Kritická fáze datového inženýrství zaměřená na eliminaci šumu, opravu nekonzistencí a strukturální transformaci surových vstupů před procesem trénování modelů.

80 %

Času projektu

Průměrná doba dedikovaná čištění a transformaci dat v enterprise AI projektech.

35 %

Zvýšení přesnosti

Průměrný nárůst preciznosti modelu po aplikaci pokročilé detekce odlehlých hodnot.

2.5x

Rychlost konvergence

Zrychlení trénovacího procesu při správné aplikaci normalizačních parametrů.

Standardizovaný pracovní postup čištění

Proces čištění dat není jednorázový úkon, ale iterativní technický postup vyžadující absolutní preciznost. Cílem je převést neuspořádané sady z fáze sběru do formátu, který minimalizuje zkreslení (bias) algoritmu. Každý chybný záznam, který pronikne do trénovací sady, přímo degraduje predikční schopnosti výsledného modelu.

Krok 1: Identifikace a ošetření chybějících hodnot

Prvním úkolem je detekce polí s hodnotou NULL nebo NaN. V závislosti na rozsahu chybějících dat volíme mezi odstraněním řádků (deletion) nebo imputací (imputation). U kritických parametrů doporučujeme použití mediánu nebo prediktivní imputace pomocí K-NN algoritmu.

  • Analýza distribuce chybějících dat (MCAR, MAR, MNAR).
  • Aplikace statistických metod pro doplňování hodnot.
  • Validace integrity po provedení imputace.

Krok 2: Odstranění duplicit a nekonzistencí

Duplicitní záznamy uměle zvyšují váhu určitých příznaků, což vede k přetrénování (overfitting). Je nutné provést deduplikaci na základě primárních klíčů nebo fuzzy matching algoritmů pro textová pole. Nekonzistence v jednotkách (např. metry vs. stopy) musí být sjednoceny v celém datasetu.

"Kvalita výstupu AI modelu je přímo úměrná čistotě vstupních dat. GIGO (Garbage In, Garbage Out) zůstává základním zákonem datové vědy."

Metody detekce odlehlých hodnot (Outliers)

01

Z-Score Metoda

Statistická technika měřící vzdálenost bodu od průměru v jednotkách směrodatné odchylky. Body s absolutní hodnotou Z-score vyšší než 3 jsou obvykle považovány za anomálie.

Diagnostika chyb
02

IQR (Interquartile Range)

Metoda založená na kvartilech, která je robustní vůči extrémním hodnotám. Definuje hranice jako Q1 - 1.5*IQR a Q3 + 1.5*IQR. Ideální pro data, která nemají normální rozdělení.

Vliv na modely
03

Isolation Forest

Algoritmus strojového učení určený přímo pro detekci anomálií. Funguje na principu izolace bodů v náhodných stromech; anomálie jsou izolovány dříve než běžné body.

Interpretace dat

Normalizace a škálování parametrů

Pokud mají různé příznaky (features) dramaticky odlišná měřítka (např. věk 0-100 a roční příjem 0-1 000 000), algoritmy založené na vzdálenosti (jako SVM nebo K-Means) budou dominovány příznaky s vyššími hodnotami. Proto je nezbytné provést škálování.

Metoda Vzorec / Princip Kdy použít
Min-Max Scaling (x - min) / (max - min) Když potřebujeme pevný rozsah [0, 1].
Standardizace (x - mean) / std_dev Pro algoritmy předpokládající Gaussovo rozdělení.
Robust Scaling (x - Q2) / IQR Pokud dataset obsahuje mnoho neodstranitelných outlierů.
Upozornění: Únik dat (Data Leakage)

Parametry pro normalizaci (průměr, odchylka) musí být vypočteny POUZE na trénovací sadě a následně aplikovány na testovací sadu. Výpočet na celém datasetu před rozdělením vede k nereálně optimistickým výsledkům validace.

Kontrolní seznam finální validace

Strukturální integrita

Ověřte, že všechny sloupce mají správné datové typy (int, float, datetime) a žádné textové řetězce neobsahují skryté netisknutelné znaky.

Rozsah hodnot

Zkontrolujte, zda se hodnoty nacházejí v logických mezích (např. věk nesmí být záporný, teplota v Kelvinech nesmí být pod nulou).

Kódování kategorických dat

Ujistěte se, že One-Hot Encoding nebo Label Encoding byl aplikován správně bez vzniku "dummy variable trap".

icon-decor

Balance datasetu

Prověřte distribuci cílové třídy. V případě výrazné nerovnováhy aplikujte techniky SMOTE nebo undersampling.

Data jsou připravena k modelování?

Po dokončení čištění a validace je dalším krokem definice architektury modelu a nastavení hyperparametrů pro trénování.