
Data: definice, typy, příklady a zpracování (průvodce 2025)
Slovo „data“ dnes slyšíme na každém kroku — od mobilních tarifů až po vědecké studie. Málokdo si ale uvědomí, že za tímto pojmem stojí konkrétní čísla, fakta a pozorování, která tvoří základ každého rozhodování. Tento průvodce vám ukáže, co data skutečně jsou, jak se dělí a jak s nimi pracovat v praxi.
Definice dat podle Merriam-Webster: informace faktické povahy (měření nebo statistiky) · Počet typů dat (základní dělení): 4 · Objem dat v roce 2023 (odhad): 120 zettabajtů · Podíl nestrukturovaných dat: 80 %
Rychlý přehled
- Definice dat podle IBM (technologická společnost): sbírka faktů a informací.
- Čtyři základní typy dat: kvantitativní a kvalitativní, strukturovaná a nestrukturovaná (Oxford Brookes University).
- Přesný globální objem dat se liší podle metodiky měření.
- Některé zdroje uvádějí 5 nebo 6 V velkých dat místo klasických 4.
- První zaznamenané použití slova „data“ v angličtině: rok 1646 (Merriam-Webster (jazykový slovník)).
- Koncept databází vznikl v roce 1965. (Merriam-Webster (jazykový slovník))
- Roste důraz na datovou gramotnost a dokumentaci dat (University of Wisconsin–Madison (akademická instituce)).
- Více firem přechází na prediktivní a preskriptivní analytiku (Domo (platforma pro datovou analytiku)).
| Ukazatel | Hodnota |
|---|---|
| Nejstarší známé použití slova data | 1646 v angličtině |
| Roční globální produkce dat (2024) | 120 zettabajtů |
| Podíl nestrukturovaných dat v podnicích | 80 % |
| Počet typů dat v klasickém dělení | 4 |
| Základní statistické dělení | Nominální, ordinální, intervalová, poměrová |
| Čtyři typy datové analytiky | Deskriptivní, diagnostická, prediktivní, preskriptivní |
| Podíl strukturovaných dat ve firmách | Přibližně 20 % |
| Hlavní dělení v programování | String, integer, float, boolean |
Jaká je definice dat?
Definice podle odborných zdrojů
- IBM (technologická společnost) popisuje data jako sbírku faktů, čísel, slov, pozorování nebo jiných užitečných informací.
- Wikipedia (otevřená encyklopedie) uvádí, že data jsou kolekce diskrétních nebo spojitých hodnot, které nesou informaci.
- Merriam-Webster (jazykový slovník) definuje data jako faktickou informaci — měření nebo statistiky — používanou jako základ pro uvažování.
Tři různé zdroje, jedna podstata: data jsou surovina, ze které teprve vznikají informace a znalosti. Rozdíl je v tom, jak přesně tuto surovinu uchopíme — jestli jako čísla v tabulce, nebo jako text v dokumentu.
Data jako surovina pro informace
Důležitý je rozdíl mezi daty a informacemi. Data sama o sobě jsou holá fakta — například naměřená teplota 22 °C. Teprve když tato teplota zapadne do kontextu („venku je 22 °C, což je na únor neobvykle teplo“), stává se informací. Oxford Brookes University (akademická instituce) zdůrazňuje, že různé datové typy vyžadují různé metody shrnutí a analýzy — jinak se k informaci vůbec nedostaneme.
Firma, která sbírá data o zákaznících, ale neumí je analyzovat, má jen čísla — ne rozhodnutí. Podle IBM (technologická společnost) je klíčová právě schopnost data přeměnit na poznatky, jinak zůstávají jen pasivní surovinou v databázi.
Jaké jsou 4 typy dat?
Kvantitativní a kvalitativní data
Základní dělení pochází ze statistiky. Third Space Learning (vzdělávací platforma) uvádí dvě hlavní kategorie: kvantitativní (číselná) data, která lze měřit, a kvalitativní data, která popisují vlastnosti nebo atributy. Kvantitativní se dále dělí na diskrétní (spočetné hodnoty, např. počet studentů ve třídě) a spojitá (libovolná hodnota v rozmezí, např. výška). Kvalitativní data zahrnují nominální (kategorie bez pořadí, např. barva očí) a ordinální (kategorie s pořadím, např. známky ve škole).
Čtyři kategorie, jedna lekce: každý typ dat vyžaduje jiný přístup k analýze. S nominálními daty nelze počítat průměr, s ordinálními zase nelze měřit přesné rozdíly.
Strukturovaná a nestrukturovaná data
- Strukturovaná data jsou organizovaná v tabulkách (např. Excel, SQL databáze) a snadno se vyhledávají (Multiverse (vzdělávací společnost)).
- Nestrukturovaná data jsou volná — text, obrázky, videa — a tvoří podle odhadů až 80 % všech dat v podnicích.
- Existuje také polo-strukturovaná data, hybrid mezi oběma formami (např. JSON nebo XML).
Důsledek: většina dat, se kterými se denně setkáváme (e-maily, fotky, videa), je nestrukturovaná. Právě tam leží největší potenciál i výzva pro firmy, které chtějí data využívat.
Podle Multiverse (vzdělávací společnost) je strukturovaných dat jen asi 20 % — přesto se jim věnuje většina nástrojů a školení. Zbylých 80 % nestrukturovaných dat zůstává často nevyužito.
Jaké jsou příklady dat?
Příklady v každodenním životě
- Teplota vzduchu naměřená meteorologickou stanicí.
- Cena produktu v e-shopu.
- Jméno a příjmení osoby v kontaktním formuláři.
- Fotografie z dovolené (nestrukturovaná data).
- Videozáznam z bezpečnostní kamery.
Každý z těchto příkladů má jiný formát, jinou strukturu a vyžaduje jiný nástroj pro zpracování. Spojuje je ale jedno: všechna jsou to vstupní surovina.
Příklady v informatice
- Databázové záznamy v MySQL nebo PostgreSQL (strukturovaná data).
- Logy serveru (
timestamp,IP adresa,HTTP status). - Soubory ve formátu JSON, XML nebo CSV.
- Binární data — obrázky, zvukové soubory, spustitelné soubory.
GeeksforGeeks (programátorská encyklopedie) upozorňuje, že v programování je datový typ atribut hodnoty, který určuje, jak ji systém interpretuje — string, integer, float a boolean patří mezi nejběžnější.
Co jsou 4 V velkých dat?
Objem (Volume)
Objem označuje množství dat, která vznikají v reálném čase. Podle odhadů dosáhla globální produkce dat v roce 2024 přibližně 120 zettabajtů. Pro představu: jeden zettabajt je miliarda terabajtů.
Rychlost (Velocity)
Rychlost, jakou data vznikají a musí být zpracována. Sociální sítě, senzory nebo burzovní systémy generují data v reálném čase — zpoždění v řádu sekund může znamenat ztrátu hodnoty.
Různorodost (Variety)
Data přicházejí v různých formátech: čísla, text, obrázky, video, audio. Multiverse (vzdělávací společnost) zdůrazňuje, že právě různorodost je největší výzvou při integraci datových sad.
Pravdivost (Veracity)
Kvalita a důvěryhodnost dat. Pokud máte špatná vstupní data, výsledky analýzy jsou k ničemu. Merriam-Webster (jazykový slovník) připomíná, že data jsou základem pro uvažování — ale jen pokud jsou pravdivá.
Některé zdroje přidávají páté V — hodnotu (Value). Smysl velkých dat totiž nespočívá v objemu, ale v tom, jestli z nich dokážeme vytěžit skutečný přínos.
Co jsou strukturovaná a surová data?
Strukturovaná data
Strukturovaná data jsou uspořádaná do předem definovaných formátů — typicky tabulek s řádky a sloupci. Příkladem je databáze zákazníků v CRM systému nebo tabulka v Excelu. Multiverse (vzdělávací společnost) uvádí, že strukturovaná data se snadněji organizují a dotazují než nestrukturovaná.
Surová data
Surová data (raw data) jsou nezpracovaná, přímo z měření nebo sběru — bez jakýchkoli úprav. Třeba výstup z teplotního čidla nebo nefiltrovaný log serveru. University of Wisconsin–Madison (akademická instituce) doporučuje u surových dat vždy uvést zdroj a definici proměnných, jinak se jejich hodnota v čase ztrácí.
„Data jsou faktická informace — měření nebo statistiky — používaná jako základ pro uvažování.“ Pokud vás zajímá, kolik váží okurka, podívejte se na tento článek Kolik váží okurka.
Merriam-Webster (jazykový slovník)
„Data jsou kolekce diskrétních nebo spojitých hodnot, které nesou informaci.“
„Různé datové typy vyžadují různé metody shrnutí, popisu a analýzy.“
„Data jsou sbírka faktů, čísel, slov, pozorování nebo jiných užitečných informací.“
IBM (technologická společnost)
Závěr: proč na typech dat záleží
Schopnost rozlišovat typy dat není akademická hříčka — má přímý dopad na kvalitu rozhodování. Firma, která zamění ordinální data za intervalová, může dojít k chybným závěrům. Stejně tak tým, který neoddělí strukturovaná data od nestrukturovaných, utopí čas v nástrojích, které na daný typ nejsou stavěné. University of Wisconsin–Madison (akademická instituce) doporučuje začít dokumentací dat. Pro každého, kdo v Česku pracuje s daty, je cesta jasná: pochopit typy dat znamená pochopit, co měříte, a teprve pak rozhodovat — jinak zůstanou data jen pasivní surovinou bez reálného dopadu.
Nejčastější dotazy
Co jsou data v informatice?
V informatice jsou data reprezentována jako posloupnosti bitů, které systém interpretuje podle datového typu. Mezi běžné typy patří celá čísla (integer), desetinná čísla (float), textové řetězce (string) a logické hodnoty (boolean) (W3Schools (výukový portál)).
Jaký je rozdíl mezi daty a informacemi?
Data jsou holá fakta bez kontextu (např. číslo 22). Informace jsou data zasazená do souvislostí („venku je 22 °C, tedy teplý den“). Bez kontextu zůstávají data jen surovinou.
Co jsou to metadata?
Metadata jsou data o datech — popisují strukturu, původ, formát nebo význam datové sady. Například autor fotografie, datum pořízení a rozlišení snímku jsou metadata.
K čemu slouží vizualizace dat?
Vizualizace převádí číselná data do grafické podoby (grafy, mapy, diagramy), aby byly vzorce a vztahy snáze pochopitelné. Pomáhá odhalit trendy, odlehlé hodnoty nebo korelace.
Jak se data ukládají?
Data se ukládají v databázích (relačních jako MySQL, NoSQL jako MongoDB), souborech (CSV, JSON, XML) nebo cloudových úložištích. Volba závisí na typu dat a požadavcích na rychlost přístupu (Multiverse (vzdělávací společnost)).
Co znamená, že data jsou strukturovaná?
Strukturovaná data jsou uspořádaná v předem definovaných formátech — typicky tabulky s řádky a sloupci. Jsou snadno vyhledatelná a analyzovatelná pomocí SQL dotazů (Multiverse (vzdělávací společnost)).
Co jsou surová data a k čemu se hodí?
Surová data jsou nezpracované výstupy přímo z měření nebo sběru. Jsou cenná jako výchozí bod pro analýzu, ale vyžadují čištění a dokumentaci, aby byla použitelná (University of Wisconsin–Madison (akademická instituce)).
Související čtení
- Cassandra: databáze, mytologie a syndrom — jak databáze fungují v praxi
- 90minut.pl – průvodce fotbalovou databází — reálný příklad strukturovaných dat
amplitude.com, indeed.com, builtin.com, precisely.com, ituonline.com