Chytré Kalkulačky

Statistická kalkulačka

Průměr, medián, odchylka, kvartily, histogram

11 hodnot
Typ:
28,8182
Průměr
25
Medián
12,4163
Sm. odchylka

Histogram

3
4
2
2
123150

Základní statistiky

Počet hodnot (n)11
Součet317
Minimum12
Maximum50
Rozsah (max − min)38
Průměr (mean)28,8182
Medián25
Modus25

Rozptyl a odchylky

Rozptyl154,164
Sm. odchylka12,4163
Variační koeficient43,08 %

Kvartily a percentily

10. percentil (P10)15
1. kvartil (Q1 / P25)20
Medián (Q2 / P50)25
3. kvartil (Q3 / P75)37,5
90. percentil (P90)45
Mezikvartilové rozpětí (IQR)17,5

Průměr, medián nebo modus?

Všechny tři jsou míry středu, ale říkají různé věci:

  • Průměr (mean) — součet dělený počtem. Citlivý na extrémy: průměrná mzda v ČR je ~45 000 Kč, ale mediánová mzda je ~38 000 Kč — průměr táhnou nahoru extrémně vysoké platy.
  • Medián — středová hodnota seřazené řady. Polovina hodnot je nad ním, polovina pod. Odolný vůči extrémům.
  • Modus — nejčastěji se vyskytující hodnota. Použitelný pro kategorická data (nejoblíbenější barva).

Směrodatná odchylka — co nám říká

Směrodatná odchylka (σ nebo s) měří, jak moc jsou hodnoty rozptýleny kolem průměru. Nízká hodnota = data blízko průměru. Vysoká = data jsou roztažená.

Příklad: teploty v Praze vs. v Reykjavíku. Praha má průměr 8 °C, ale velkou odchylku (−20 °C v zimě, +35 °C v létě). Reykjavík má průměr 5 °C, ale malou odchylku — klima je rovnoměrnější díky oceánu.

Populační odchylka (σ) se používá pro celou populaci. Výběrová (s) pro vzorek — dělí se (n−1) pro korekci Besselovy chyby.

Normální rozdělení a pravidlo 68-95-99,7

Mnoho přírodních jevů má normální (Gaussovo) rozdělení — symetrické zvonovité rozložení. Pravidlo říká:

  • ±1σ od průměru: ~68 % hodnot
  • ±2σ od průměru: ~95 % hodnot
  • ±3σ od průměru: ~99,7 % hodnot

Ve výrobě se používá „6 sigma" (Six Sigma) — systém kvality, kde chybovost nepřekračuje 3,4 milionin.

Časté dotazy

Aritmetický průměr: součet hodnot / počet hodnot. Citlivý na extrémní hodnoty (outliery). Medián: prostřední hodnota seřazené řady. Neovlivňuje ho extrémy — vhodný pro mzdy, ceny nemovitostí. Modus: nejčastěji se vyskytující hodnota. Příklad mezd 25k, 30k, 35k, 40k, 200k: průměr 66k (zkresleno), medián 35k (reálnější), modus žádný (vše unikátní).

Směrodatná odchylka (σ) měří rozptyl hodnot kolem průměru. Nízká σ = hodnoty blízko průměru, vysoká σ = hodnoty rozprostřené. Výpočet: σ = √(Σ(xi − μ)² / n). U normálního rozdělení: 68 % hodnot leží do ±1σ od průměru, 95 % do ±2σ, 99,7 % do ±3σ („pravidlo 68-95-99,7"). Praktické využití: kontrola kvality, IQ skóre, finanční riziko (volatilita).

Rozptyl je druhá mocnina směrodatné odchylky (σ²). Výpočet: průměr čtverců odchylek od průměru. Rozptyl se používá ve výpočtech (snazší matematika než σ), ale má jiné jednotky než původní data (čtverce). Pokud měříme výšky v cm, rozptyl je v cm² — proto pro interpretaci používáme směrodatnou odchylku (zpět v cm).

Normální (Gaussovo) rozdělení je nejdůležitější rozdělení ve statistice. Tvar zvonu, symetrické kolem průměru. Většina jevů v přírodě se mu blíží: výška lidí, IQ skóre, chyby měření, šum. Plně popsané dvěma parametry: průměr (μ) a směrodatná odchylka (σ). Centrální limitní věta: součet/průměr velkého počtu nezávislých veličin má vždy normální rozdělení (i když jednotlivé veličiny ne).

Medián je vždy lepší u dat s asymetrickým rozdělením nebo extrémními hodnotami. Příklad: mzdy. Pár top managerů s 5 mil. ročně vychýlí průměr nahoru — typický zaměstnanec nedosáhne na „průměrnou" mzdu. Medián ukáže skutečný střed. ČSÚ publikuje mediánovou i průměrnou mzdu, mediánová je vždy nižší. Také u cen nemovitostí, příjmů domácností, doby dojezdu.

Korelace (Pearsonova r) měří lineární vztah dvou proměnných. Rozsah −1 až +1. r = 1: perfektní pozitivní korelace (X roste, Y roste). r = −1: perfektní negativní. r = 0: žádný vztah. |r| > 0,7: silná, 0,3–0,7: střední, < 0,3: slabá. POZOR: korelace ≠ kauzalita! Vysoká korelace mezi prodejem zmrzliny a počtem utonutí — obě závisí na teplotě (skrytá proměnná).

p-hodnota je pravděpodobnost, že byste pozorovali tento (nebo extrémnější) výsledek, kdyby NEEXISTOVAL skutečný efekt. Konvence: p < 0,05 = „statisticky významné" (5% riziko falešného pozitiva), p < 0,01 = silně významné. p > 0,05 neznamená „žádný efekt", jen že nemáme dost důkazů. POZOR: p-hacking (lov významnosti) je zneužití — testujte předem stanovené hypotézy.

Kvartily dělí data na 4 stejné části: Q1 (25 %), Q2 = medián (50 %), Q3 (75 %). Interkvartilové rozpětí (IQR = Q3 − Q1) měří rozptyl střední poloviny dat. Percentily dělí data na 100 částí. Příklad: pokud váš plat je v 80. percentilu, vyděláváte víc než 80 % lidí. Používá se v testování (IQ skóre), růstových grafech dětí (50. percentil = průměrná výška).