AI v kanceláři (3): Jak pracovat s tabulkami a daty pomocí AI

Praktický návod, jak s AI čistit tabulky, hledat souvislosti, připravovat grafy a kontrolovat čísla bez falešné jistoty.

AI v kanceláři (3): Jak pracovat s tabulkami a daty pomocí AI

Tabulka začíná často nevinně. Jeden export z webu, druhý z účetnictví, třetí od obchodníka a k tomu několik ručně dopsaných poznámek. Každý soubor má jiné názvy sloupců, jiné datum a jiný způsob zaokrouhlení. Když se z nich pokusíte připravit report, nejdřív neanalyzujete. Nejdřív uklízíte.

AI může s úklidem výrazně pomoci. Umí navrhnout sjednocení názvů, najít duplicity, upozornit na prázdná pole a připravit první graf. Neměla by však sama měnit zdrojová data bez záznamu o změnách. V datech se totiž chyba často schová za přesně vypadající číslo.

Třetí díl série AI v kanceláři ukazuje, jak postupovat od neuspořádané tabulky k přehledu, kterému můžete věřit. Základem je rozlišit tři kroky: nejprve data pochopit, potom ověřit a teprve nakonec interpretovat.

AI není kalkulačka s názorem

AI dokáže vysvětlit vzorec, navrhnout kontingenční tabulku nebo popsat trend. Sama ale nemusí vědět, zda řádek znamená objednávku, storno nebo testovací záznam. Neví, zda částka obsahuje daň, zda je datum ve formátu den/měsíc nebo měsíc/den a zda jsou hodnoty v korunách, eurech nebo haléřích.

Nejprve proto popište význam dat. Kdo je zdroj, co představuje jeden řádek, jaká období obsahuje a jaké jsou známé výjimky. Bez tohoto kontextu může být výsledek matematicky správný, ale provozně nesmyslný.

Co může AI s tabulkami dobře dělat

  • popsat strukturu souboru a význam sloupců,
  • navrhnout datový slovník,
  • najít prázdné hodnoty, duplicity a podezřelé odlehlosti,
  • upozornit na různé formáty dat a jednotek,
  • navrhnout vzorce a kontrolní pravidla,
  • připravit souhrny podle období, produktů nebo zákaznických skupin,
  • vytvořit několik variant grafu,
  • převést zjištění na otázky a další úkoly.

U větších nebo citlivých dat pracujte raději s anonymizovaným vzorkem a schváleným nástrojem. Do veřejné služby nevkládejte osobní údaje, kompletní seznam zákazníků ani neveřejné finanční podklady.

První krok: popište zdroj

Než se zeptáte na trend, zjistěte, co tabulka skutečně obsahuje. Uveďte původ souboru, období, měnu, jednotky, význam řádku a případné filtry použití. Pokud data vznikla spojením více exportů, popište pravidlo spojení.

Popiš tuto tabulku bez analýzy. Uveď počet sloupců, typ každého sloupce, příklad hodnoty, pravděpodobný význam, prázdné hodnoty, duplicity, neobvyklé formáty a otázky, které musí potvrdit člověk. Nepřepisuj data a nepředpokládej význam sloupce pouze podle jeho názvu.

Datový slovník jako malá investice

Datový slovník je jednoduchý přehled, který vysvětluje, co jednotlivá pole znamenají. Uveďte název, popis, formát, jednotku, povolené hodnoty, zdroj a člověka odpovědného za potvrzení. Díky němu bude stejný report za měsíc čitelný i pro kolegu, který jej nevytvářel.

AI může první verzi slovníku navrhnout, ale význam musí potvrdit někdo, kdo procesu rozumí. Sloupec „tržba“ může v jedné firmě znamenat vystavené faktury, v jiné zaplacené objednávky.

Čištění dat bez ztráty původního souboru

Pracujte vždy s kopií. Zachovejte originál, vytvořte zpracovanou verzi a u změn si veďte protokol. Každá oprava by měla být dohledatelná: co se změnilo, proč, kdy a podle jakého pravidla.

Typické úpravy jsou sjednocení názvů, odstranění prázdných řádků, oprava formátu data, rozdělení jména a adresy nebo sjednocení měny. Automaticky neslučujte podobně vypadající hodnoty, pokud nemáte potvrzeno, že znamenají totéž.

Čištění a kontrola neuspořádaných dat pomocí AI
AI může navrhnout pořádek v datech, ale nejasné hodnoty a změny zdrojových řádků musí projít kontrolou.

Duplicity nejsou vždy chyba

Dvě stejné objednávky mohou být duplikát, ale také dvě legitimní položky stejné hodnoty. Před odstraněním potřebujete identifikátor, čas, zákazníka nebo jiný kontext. AI může připravit seznam podezřelých dvojic; člověk rozhoduje, zda jde o duplicitu.

Najdi možné duplicity, ale nemaž je. U každé dvojice uveď, které sloupce se shodují, které se liší a jaké další pole by pomohlo rozhodnout. Rozděl výsledek na pravděpodobný duplikát, možné legitimní opakování a nejasné případy.

Chybějící hodnota není nula

Prázdné pole může znamenat nulu, neznámou hodnotu, neaplikovatelný údaj nebo chybu exportu. Tyto významy nesměšujte. Nahrazení prázdných buněk nulou může dramaticky změnit průměry, konverzi i graf.

Nechte AI nejprve vyčíslit rozsah chybějících hodnot podle sloupce a skupiny. Potom určete pravidlo doplnění. U finančních nebo provozních údajů je často lepší hodnotu ponechat neznámou a označit ji k ověření.

Formáty dat a jednotky

Nejčastější tiché chyby vznikají u dat, desetinných oddělovačů, měn a jednotek. Hodnota 1.200 může být v českém zápisu tisíc dvě stě, nebo v jiném systému jedna celá dvě. Číslo 10 může znamenat kusy, procenta nebo tisíce korun.

Každé transformaci přidejte kontrolní vzorek. Porovnejte několik řádků před a po změně a ověřte součty. Pokud převádíte měnu, zaznamenejte kurz a datum použití.

Od čištění k otázce

Jakmile jsou data srozumitelná, formulujte otázku přesně. „Co se děje?“ je příliš široké. Lepší je: „Jak se změnil počet zaplacených objednávek po měsících v posledním roce, bez storen, a ve kterých třech měsících se odchylka nejvíce liší od průměru?“

U otázky vždy uveďte období, filtr, jednotku a způsob agregace. Jinak může AI vybrat jiný základ, než očekáváte.

Vzor zadání pro první analýzu

Analyzuj pouze záznamy z období [období] a použij filtr [filtr]. Nejprve vypiš, kolik řádků je do výpočtu zahrnuto a jaké předpoklady používáš. Potom spočítej [metrika] po [časová jednotka]. Odděl pozorování od možných vysvětlení. U každého výrazného rozdílu uveď zdrojové řádky nebo skupinu a označ, co musí ověřit člověk. Nevytvářej závěr o příčině, pokud jej data přímo nepodporují.

Průměr může klamat

Průměr několika velkých hodnot může zakrýt, že většina případů je výrazně nižší. U tržeb, dob dodání nebo hodnoty objednávky sledujte podle situace také medián, minimum, maximum, rozptyl a počet záznamů.

AI může nabídnout více pohledů, ale vy musíte vysvětlit, proč je pro rozhodnutí vhodný právě jeden. U malého vzorku používejte opatrný jazyk. Rozdíl mezi dvěma obdobími nemusí znamenat trend.

Korelace není příčina

Pokud dvě hodnoty rostou současně, neznamená to, že jedna způsobuje druhou. Může je ovlivňovat třetí faktor: sezóna, změna cen, marketingová kampaň nebo jiný způsob měření.

Nechte AI oddělit tři vrstvy: co je přímo vidět v datech, jaké jsou možné hypotézy a co by bylo potřeba změřit, aby se hypotéza ověřila. To je užitečnější než rychlý příběh, který z grafu udělá jistotu.

Graf není důkaz sám o sobě

Graf může zvýraznit zajímavý rozdíl, ale jeho čitelnost závisí na rozsahu osy, zvoleném období, filtrech a jednotkách. Zkontrolujte, zda osa nezačíná u hodnoty, která rozdíl opticky přehání. U procent sledujte absolutní základ. U měsíčních dat zkontrolujte neúplný poslední měsíc.

Ověření grafu a dat před vytvořením rozhodovacího přehledu
AI může navrhnout několik interpretací. Teprve po kontrole filtru, období, jednotek a vzorku vzniká použitelný přehled.

Vzor zadání pro graf

Navrhni tři vhodné typy grafu pro tuto otázku: [otázka]. U každého vysvětli, co ukáže a co může zkreslit. Uveď použité období, jednotku, filtr a počet záznamů. Navrhni název grafu, který popisuje obsah bez přehnaného závěru. Pokud data k odpovědi nestačí, řekni přesně, co chybí.

Kontrolní vzorek před reportem

Před zveřejněním reportu vyberte několik řádků z každé důležité skupiny a projděte výpočet ručně. Porovnejte zdrojový řádek, vyčištěnou hodnotu, vzorec a výsledek. Tato malá kontrola často odhalí špatný filtr, posunutý sloupec nebo smíchané jednotky.

Data a soukromí

Pro analýzu často nepotřebujete jména, e-maily ani přesné adresy. Nahraďte je identifikátorem nebo agregujte data. U zákaznických a zaměstnaneckých údajů je důležité znát účel zpracování, oprávnění a dobu uchování.

Pokud AI přistupuje k živému zdroji, měla by mít oprávnění pouze ke čtení, pokud zápis není skutečně nutný. Nástroj pro přehled tržeb nemusí umět měnit objednávky ani mazat záznamy.

Nejčastější chyby

  • analýza bez znalosti významu sloupců,
  • nahrazení prázdných hodnot nulou,
  • sloučení duplicit bez identifikátoru,
  • smíchání měn, jednotek nebo období,
  • graf bez informace o filtru a počtu záznamů,
  • zaměnění korelace za příčinu,
  • report z neúplného posledního období,
  • publikování výsledku bez ruční kontroly vzorku.

Praktické cvičení na jeden report

Vezměte malý anonymizovaný export, který znáte. Vytvořte kopii a postupujte v tomto pořadí:

  1. Popište řádky, sloupce, období, měnu a známé výjimky.
  2. Nechte vypsat chybějící hodnoty, duplicity a formátové nesrovnalosti.
  3. Vytvořte krátký datový slovník a potvrďte jej člověkem.
  4. Definujte jednu konkrétní otázku pro report.
  5. Nechte navrhnout dvě metriky a dva typy grafu.
  6. Projděte ručně kontrolní vzorek a porovnejte výsledek se zdrojem.
  7. Napište tři věty: co víme, co pouze předpokládáme a co musíme zjistit.

Kontrolní seznam před rozhodnutím

  • Víme, odkud data pocházejí a k jakému období patří?
  • Je jasné, co představuje jeden řádek?
  • Jsou měny, jednotky a formáty sjednocené?
  • Byly prázdné hodnoty a duplicity posouzeny podle kontextu?
  • Je výpočet dohledatelný a ověřený na vzorku?
  • Obsahuje graf filtr, období, jednotku a počet záznamů?
  • Oddělujeme pozorování od vysvětlení?
  • Je výsledek anonymizovaný a přístupově zabezpečený?

Krátký kvíz

1. Co uděláte s prázdnou hodnotou?

A) Vždy ji nahradíte nulou. B) Nejprve zjistíte, co prázdná hodnota znamená. C) Odstraníte celý sloupec.

2. AI našla růst prodejů po kampani. Co z toho lze říct?

A) Kampaň růst určitě způsobila. B) Data ukazují časovou souvislost, příčinu je třeba ověřit. C) Kampaň neměla žádný vliv.

3. Co má být součástí důležitého reportu?

A) Jen graf. B) Graf, popis filtru, období, jednotky a kontrolovatelný výpočet. C) Jen závěrečné doporučení.

Správné odpovědi: 1B, 2B, 3B.

Pravidlo, které si odnést

AI může zrychlit cestu od tabulky k přehledu, ale nemůže za vás rozhodnout, co data znamenají. Nejdříve popište zdroj, potom vyčistěte a ověřte podklady, nakonec teprve hledejte trend.

Dobré číslo není jen přesný výsledek. Je to výsledek, u kterého víte, z jakých dat vznikl, jaká pravidla se použila a kde jsou jeho hranice.

V příštím dílu série AI v kanceláři se podíváme na přípravu prezentací, zápisů a podkladů pro porady: jak z informací vytvořit jasný výstup bez toho, aby zmizel kontext.

Silicon Scribe

Potřebujete podobné řešení uvést do praxe?

Projdeme váš současný proces a navrhneme další krok bez zbytečné složitosti.
Popište nám svůj projekt

Související obsah

Trvalý odkaz na článekhttps://siliconscribe.cz/blog/ai-v-kancelari-3-jak-pracovat-s-tabulkami-a-daty-pomoci-ai/