Distribučná analýza

Normálne rozdelenie

Väčšina štatistických analýz a metód predpokladá, že údaje, ktoré analyzujeme majú normálne rozdelenie. Pred, alebo v rámci skoro každej analýzy, overujeme často predpoklad normálneho rozdelenia početnosti jednotlivých vlastností a znakov. Normalita sa overuje na úrovni celého výberového súboru údajov, alebo v rámci jednotlivých triedení znakov (v rámci definovaných skupín hodnoteného údajového súboru).

Existuje niekoľko najčastejšie používaných spôsobov, ako skontrolovať normalitu rozdelenia početnosti:

• grafické zostavenie histogramov s jednoduchým vizuálnym posúdením normality (často využívané pri analýze biologických údajov),
• výpočet šikmosti (koeficient šikmosti je v skutočnosti mierou asymetrie rozloženia početnosti, ak je hodnota koeficienta šikmosti blízka číslu 0,znamená to, že údaje sú s najväčšou pravdepodobnosťou normálne,
• numerické testy normality údajov

Pozitívne skreslenie údajov znamená, že existuje niekoľko extrémne veľkých hodnôt, ktoré menia svoj priemer na kladné skreslenie. Nazýva sa tiež vpravo skosený (positive skewness) : Ak je šikmosť > 0, údaje sú pozitívne skreslené. Ďalší spôsob, ako vidieť pozitívnu šikmosť: Priemer je väčší ako medián a medián je väčší ako režim. Negatívne skreslené údaje znamenajú, že existuje niekoľko extrémne malých hodnôt, ktoré menia svoj priemer na negatívne skreslenie. Nazýva sa tiež vľavo skosený (negative skewness) : Ak je šikmosť < 0, údaje sú negatívne skreslené. Ďalší spôsob, ako vidieť negatívnu šikmosť: Priemer je menší ako medián a medián je menší ako modus. Ak je šikmosť < -1 alebo > +1, distribúcia je veľmi skreslená. Ak je šikmosť medzi -1 a -0,5 alebo medzi 0,5 a +1, distribúcia je mierne skreslená. Ak je šikmosť > -0,5 a < 0,5, rozdelenie je približne symetrické alebo normálne.

Uvádzame dva hlavné testy normality:

  1. Shapiro Wilk test (veľkosť vzorky <= 2000)
    Nulová hypotéza uvádza, že rozdelenie je normálne.
    Ak je hodnota p menšia ako 0,05 tak nulovú hypotézu zamietame. Znamená to, že distribúcia nie je normálna. Ak je p-hodnota > 0,05, znamená to, že rozdelenie je normálne. Tento test funguje dobre v malej vzorke do 2000 pozorovaní.
  1. Kolmogorov-Smirnovov test (veľkosť vzorky > 2000)
    V tomto teste nulová hypotéza uvádza, že údaje sú normálne rozdelené.
    Ak je p-hodnota > 0,05, údaje sú normálne. Rovnako aj v tomto prípade ak je p-hodnota menšia ako 0,05, údaje nie sú normálne. Test sa najčastejšie využíva vo vzorkách údajov väčších ako 2000 pozorovaní.

Vzorové údaje (zdroj: Databáza údajov projektu KEGA)

Údaje predstavujú záznamy mliekovej úžitkovosti kráv holštajnského plemena (denné kontrolné nádoje) spolu s počtom somatických buniek v kravskom mlieku.

Príklad 1.3.1

Zistite či ukazovateľ denný nádoj mlieka v kilogramoch (Mlieko) a ukazovateľ somatické bunky (SB) majú normálne rozdelenie početnosti. V prípade že niektorý s ukazovateľov nemá normálne rozdelenie početnosti uskutočnite logaritmickú transformáciu (normalizáciu) ukazovateľa.

Výsledky distribučnej analýzy (program SAS) – ukazovateľ mlieko

Testy normality

Testy normality jednoznačne potvrdili, že ukazovateľ mlieko má normálne rozdelenie početnosti (hodnoty p > 0,05).

Na základe grafického znázornenia distribučnej analýzy môžeme konštatovať, že hodnotený ukazovateľ Mlieko má normálne rozdelenie. Potvrdzuje to aj graf pravdepodobnosti normality percentíl. Jednotlivé body ležia v približnej priamke, čo naznačuje, že údaje sú s najväčšou pravdepodobnosťou normálne rozložené.

Výsledky distribučnej analýzy (program SAS) – ukazovateľ počet somatických buniek

Už základe základných štatistických charakteristík sa dá predpokladať, že ukazovateľ nemá normálne rozdelenie (koeficient šikmosti dosahuje hodnotu 3,73).

Grafické znázornenie rozdelenia početnosti ukazovateľa počet somatických buniek

Histogram aj graf pravdepodobnosti percentíl ukazujú, že ukazovateľ počet somatických buniek nemá normálne rozdelenie.

Testy normality

Testy normality potvrdzujú rovnaký výsledok, ktorý iba dokazuje výraznú odlišnosť rozdelenia početnosti od normálneho rozdelenia.

Postup transformácie (normalizácie) ukazovateľa počet somatických buniek

Jednou z možností transformácie ukazovateľov, ktoré nemajú normálne rozdelenie, je často krát používaná logaritmická transformácia údajov. Program SAS poskytuje možnosti veľmi efektívnej automatickej logaritmickej transformácie. Pre transformáciu údajov sme použili transformáciu na tzv. normálne skóre (Blom formula, vzorec). Transformáciou sa pôvodný hodnotený súbor údajov rozšíri o nový ukazovateľ, ktorý následne môžeme použiť pri opakovanej distribučnej analýze, aby sme overili, či uskutočnená transformácia údajov bola úspešná. Uvedený postup transformácie sa dá ale požiť aj prepočtom ukazovateľa počet somatických buniek podľa vhodne zvoleného logaritmického vzorca. V prípade hodnotenia somatických buniek v rámci kontroly mliekovej úžitkovosti hovädzieho dobytka v Slovenskej republike sa používa práve takýto postup. Využíva sa nasledovný vzorec na prepočet na skóre za somatické bunky: skóre = ln (SB/100)+3 (požitý prirodzený logaritmus).

Výsledky distribučnej analýzy (program SAS) – transformovaný ukazovateľ skóre za somatické bunky

Grafické znázornenie rozdelenia početnosti ukazovateľa skóre za počet somatických buniek

Grafické zobrazenia ukazujú jednoznačne, že transformovaný počet somatických buniek má priam ideálne normálne rozdelenie početnosti.

Testy normality

Normálne rozdelenie početnosti pre transformovaný počet somatických buniek potvrdzujú aj jednotlivé testy normality (p hodnoty sú výrazne väčšie ako je definovaná hraničná hodnota 0,05).

Praktické použitie programu R (R Studio)

     Príklad 1.9 (Program R)

            Zistite či ukazovateľ denný nádoj mlieka v kilogramoch (Mlieko) a ukazovateľ somatické bunky (SB) majú normálne rozdelenie početnosti. V prípade že niektorý s ukazovateľov nemá normálne rozdelenie početnosti uskutočnite logaritmickú transformáciu (normalizáciu) ukazovateľa.

Zdrojový kód potrebný na import a zobrazenie excelovského súboru „data_sb.xls“, ktorý je možné použiť priamo v programe R, alebo R Studio ako súbor s názvom data_sb: