Slovo „data“ dnes slyšíme na každém kroku — od mobilních tarifů až po vědecké studie. Málokdo si ale uvědomí, že za tímto pojmem stojí konkrétní čísla, fakta a pozorování, která tvoří základ každého rozhodování. Tento průvodce vám ukáže, co data skutečně jsou, jak se dělí a jak s nimi pracovat v praxi.

Definice dat podle Merriam-Webster: informace faktické povahy (měření nebo statistiky) · Počet typů dat (základní dělení): 4 · Objem dat v roce 2023 (odhad): 120 zettabajtů · Podíl nestrukturovaných dat: 80 %

Rychlý přehled

1Potvrzená fakta
2Co není jasné
  • Přesný globální objem dat se liší podle metodiky měření.
  • Některé zdroje uvádějí 5 nebo 6 V velkých dat místo klasických 4.
3Časový signál
4Co bude dál
Základní fakta o datech v kostce
Ukazatel Hodnota
Nejstarší známé použití slova data 1646 v angličtině
Roční globální produkce dat (2024) 120 zettabajtů
Podíl nestrukturovaných dat v podnicích 80 %
Počet typů dat v klasickém dělení 4
Základní statistické dělení Nominální, ordinální, intervalová, poměrová
Čtyři typy datové analytiky Deskriptivní, diagnostická, prediktivní, preskriptivní
Podíl strukturovaných dat ve firmách Přibližně 20 %
Hlavní dělení v programování String, integer, float, boolean

Jaká je definice dat?

Definice podle odborných zdrojů

Tři různé zdroje, jedna podstata: data jsou surovina, ze které teprve vznikají informace a znalosti. Rozdíl je v tom, jak přesně tuto surovinu uchopíme — jestli jako čísla v tabulce, nebo jako text v dokumentu.

Data jako surovina pro informace

Důležitý je rozdíl mezi daty a informacemi. Data sama o sobě jsou holá fakta — například naměřená teplota 22 °C. Teprve když tato teplota zapadne do kontextu („venku je 22 °C, což je na únor neobvykle teplo“), stává se informací. Oxford Brookes University (akademická instituce) zdůrazňuje, že různé datové typy vyžadují různé metody shrnutí a analýzy — jinak se k informaci vůbec nedostaneme.

Proč to má význam

Firma, která sbírá data o zákaznících, ale neumí je analyzovat, má jen čísla — ne rozhodnutí. Podle IBM (technologická společnost) je klíčová právě schopnost data přeměnit na poznatky, jinak zůstávají jen pasivní surovinou v databázi.

Jaké jsou 4 typy dat?

Kvantitativní a kvalitativní data

Základní dělení pochází ze statistiky. Third Space Learning (vzdělávací platforma) uvádí dvě hlavní kategorie: kvantitativní (číselná) data, která lze měřit, a kvalitativní data, která popisují vlastnosti nebo atributy. Kvantitativní se dále dělí na diskrétní (spočetné hodnoty, např. počet studentů ve třídě) a spojitá (libovolná hodnota v rozmezí, např. výška). Kvalitativní data zahrnují nominální (kategorie bez pořadí, např. barva očí) a ordinální (kategorie s pořadím, např. známky ve škole).

Čtyři kategorie, jedna lekce: každý typ dat vyžaduje jiný přístup k analýze. S nominálními daty nelze počítat průměr, s ordinálními zase nelze měřit přesné rozdíly.

Strukturovaná a nestrukturovaná data

  • Strukturovaná data jsou organizovaná v tabulkách (např. Excel, SQL databáze) a snadno se vyhledávají (Multiverse (vzdělávací společnost)).
  • Nestrukturovaná data jsou volná — text, obrázky, videa — a tvoří podle odhadů až 80 % všech dat v podnicích.
  • Existuje také polo-strukturovaná data, hybrid mezi oběma formami (např. JSON nebo XML).

Důsledek: většina dat, se kterými se denně setkáváme (e-maily, fotky, videa), je nestrukturovaná. Právě tam leží největší potenciál i výzva pro firmy, které chtějí data využívat.

Paradox dat

Podle Multiverse (vzdělávací společnost) je strukturovaných dat jen asi 20 % — přesto se jim věnuje většina nástrojů a školení. Zbylých 80 % nestrukturovaných dat zůstává často nevyužito.

Jaké jsou příklady dat?

Příklady v každodenním životě

  • Teplota vzduchu naměřená meteorologickou stanicí.
  • Cena produktu v e-shopu.
  • Jméno a příjmení osoby v kontaktním formuláři.
  • Fotografie z dovolené (nestrukturovaná data).
  • Videozáznam z bezpečnostní kamery.

Každý z těchto příkladů má jiný formát, jinou strukturu a vyžaduje jiný nástroj pro zpracování. Spojuje je ale jedno: všechna jsou to vstupní surovina.

Příklady v informatice

  • Databázové záznamy v MySQL nebo PostgreSQL (strukturovaná data).
  • Logy serveru (timestamp, IP adresa, HTTP status).
  • Soubory ve formátu JSON, XML nebo CSV.
  • Binární data — obrázky, zvukové soubory, spustitelné soubory.

GeeksforGeeks (programátorská encyklopedie) upozorňuje, že v programování je datový typ atribut hodnoty, který určuje, jak ji systém interpretuje — string, integer, float a boolean patří mezi nejběžnější.

Shrnutí: Data nejsou abstraktní pojem — jsou to konkrétní čísla, texty a soubory, které nás obklopují. Pro začátečníka: začněte u strukturovaných dat v Excelu. Pro pokročilého: zaměřte se na nestrukturovaná data a jejich analýzu. Výsledek: bez ohledu na úroveň musíte porozumět formátu dat, jinak analýza selže.

Co jsou 4 V velkých dat?

Objem (Volume)

Objem označuje množství dat, která vznikají v reálném čase. Podle odhadů dosáhla globální produkce dat v roce 2024 přibližně 120 zettabajtů. Pro představu: jeden zettabajt je miliarda terabajtů.

Rychlost (Velocity)

Rychlost, jakou data vznikají a musí být zpracována. Sociální sítě, senzory nebo burzovní systémy generují data v reálném čase — zpoždění v řádu sekund může znamenat ztrátu hodnoty.

Různorodost (Variety)

Data přicházejí v různých formátech: čísla, text, obrázky, video, audio. Multiverse (vzdělávací společnost) zdůrazňuje, že právě různorodost je největší výzvou při integraci datových sad.

Pravdivost (Veracity)

Kvalita a důvěryhodnost dat. Pokud máte špatná vstupní data, výsledky analýzy jsou k ničemu. Merriam-Webster (jazykový slovník) připomíná, že data jsou základem pro uvažování — ale jen pokud jsou pravdivá.

Některé zdroje přidávají páté V — hodnotu (Value). Smysl velkých dat totiž nespočívá v objemu, ale v tom, jestli z nich dokážeme vytěžit skutečný přínos.

Co jsou strukturovaná a surová data?

Strukturovaná data

Strukturovaná data jsou uspořádaná do předem definovaných formátů — typicky tabulek s řádky a sloupci. Příkladem je databáze zákazníků v CRM systému nebo tabulka v Excelu. Multiverse (vzdělávací společnost) uvádí, že strukturovaná data se snadněji organizují a dotazují než nestrukturovaná.

Surová data

Surová data (raw data) jsou nezpracovaná, přímo z měření nebo sběru — bez jakýchkoli úprav. Třeba výstup z teplotního čidla nebo nefiltrovaný log serveru. University of Wisconsin–Madison (akademická instituce) doporučuje u surových dat vždy uvést zdroj a definici proměnných, jinak se jejich hodnota v čase ztrácí.

„Data jsou faktická informace — měření nebo statistiky — používaná jako základ pro uvažování.“ Pokud vás zajímá, kolik váží okurka, podívejte se na tento článek Kolik váží okurka.

Merriam-Webster (jazykový slovník)

„Data jsou kolekce diskrétních nebo spojitých hodnot, které nesou informaci.“

Wikipedia (otevřená encyklopedie)

„Různé datové typy vyžadují různé metody shrnutí, popisu a analýzy.“

Oxford Brookes University (akademická instituce)

„Data jsou sbírka faktů, čísel, slov, pozorování nebo jiných užitečných informací.“

IBM (technologická společnost)

Závěr: proč na typech dat záleží

Schopnost rozlišovat typy dat není akademická hříčka — má přímý dopad na kvalitu rozhodování. Firma, která zamění ordinální data za intervalová, může dojít k chybným závěrům. Stejně tak tým, který neoddělí strukturovaná data od nestrukturovaných, utopí čas v nástrojích, které na daný typ nejsou stavěné. University of Wisconsin–Madison (akademická instituce) doporučuje začít dokumentací dat. Pro každého, kdo v Česku pracuje s daty, je cesta jasná: pochopit typy dat znamená pochopit, co měříte, a teprve pak rozhodovat — jinak zůstanou data jen pasivní surovinou bez reálného dopadu.

Nejčastější dotazy

Co jsou data v informatice?

V informatice jsou data reprezentována jako posloupnosti bitů, které systém interpretuje podle datového typu. Mezi běžné typy patří celá čísla (integer), desetinná čísla (float), textové řetězce (string) a logické hodnoty (boolean) (W3Schools (výukový portál)).

Jaký je rozdíl mezi daty a informacemi?

Data jsou holá fakta bez kontextu (např. číslo 22). Informace jsou data zasazená do souvislostí („venku je 22 °C, tedy teplý den“). Bez kontextu zůstávají data jen surovinou.

Co jsou to metadata?

Metadata jsou data o datech — popisují strukturu, původ, formát nebo význam datové sady. Například autor fotografie, datum pořízení a rozlišení snímku jsou metadata.

K čemu slouží vizualizace dat?

Vizualizace převádí číselná data do grafické podoby (grafy, mapy, diagramy), aby byly vzorce a vztahy snáze pochopitelné. Pomáhá odhalit trendy, odlehlé hodnoty nebo korelace.

Jak se data ukládají?

Data se ukládají v databázích (relačních jako MySQL, NoSQL jako MongoDB), souborech (CSV, JSON, XML) nebo cloudových úložištích. Volba závisí na typu dat a požadavcích na rychlost přístupu (Multiverse (vzdělávací společnost)).

Co znamená, že data jsou strukturovaná?

Strukturovaná data jsou uspořádaná v předem definovaných formátech — typicky tabulky s řádky a sloupci. Jsou snadno vyhledatelná a analyzovatelná pomocí SQL dotazů (Multiverse (vzdělávací společnost)).

Co jsou surová data a k čemu se hodí?

Surová data jsou nezpracované výstupy přímo z měření nebo sběru. Jsou cenná jako výchozí bod pro analýzu, ale vyžadují čištění a dokumentaci, aby byla použitelná (University of Wisconsin–Madison (akademická instituce)).

Související čtení