ELT

    Extract, Load, Transform. Postup, kterým se data ze zdrojů, e-shopu, účetnictví nebo reklamy, nejdřív uloží do datového skladu syrová, beze změny, a teprve tam, uvnitř skladu, se transformují pomocí jeho vlastního výpočetního výkonu.

    Data se uloží syrová, transformují se až uvnitř skladu

    ELT je zkratka pro Extract, Load, Transform. Popisuje pořadí tří kroků, kterými data ze zdrojů, třeba e-shopu, účetnictví nebo reklamních účtů, projdou, než se dají použít v reportu nebo segmentaci.

    Extract: data se vytáhnou ze zdroje

    Objednávky z e-shopu, faktury z účetnictví nebo náklady z reklamních účtů se stáhnou ze zdrojového systému tak, jak v něm existují.

    Load: uloží se do skladu beze změny

    Data se hned nahrají do datového skladu, typicky BigQuery, v syrové podobě. Nic se předem nečistí, nespojuje ani nepřepočítává, do skladu jde přesně to, co přišlo ze zdroje.

    Transform: transformace proběhne až tam

    Teprve uvnitř skladu se syrová data spojí, vyčistí a přepočítají pomocí výpočetního výkonu samotného skladu, typicky přes verzované SQL transformace (viz pojem Dataform).

    Kde firmy pálí peníze

    ELT má svoje typické chyby, uložit data syrová sama o sobě nic nevyřeší.

    • Syrová data bez transformací jako datové jezero

      Bez verzovaných a testovaných transformací (viz pojem Dataform) se sklad naplní syrovými daty, kterým čím dál míň lidí rozumí. Tomu se říká datové jezero, sklad plný dat bez použitelné struktury nad nimi.

    • Podcenění, že i syrová data něco stojí

      Syrová data v BigQuery stojí peníze za úložiště a za skeny při každém dotazu, i dřív, než se z nich cokoli reálně postaví. Firma na to často zapomene, protože žádný report zatím neexistuje.

    • Transformace jako jednorázová akce, ne proces

      Data se do skladu naimportují a transformace se udělá jednou ručně. Když přibude nový zdroj nebo se změní struktura dat, nikdo neví, jestli se transformace ještě spustí správně.

    Proč se ELT stal dnes běžnou volbou

    Dokud byl výpočet pro transformace drahý, dávalo smysl transformovat data předem, mimo sklad. Cloudové sklady jako BigQuery mají výpočet lacinější a pružnější, takže se transformace vyplatí dělat rovnou uvnitř nich.

    Levný a pružný výpočet přímo ve skladu

    Sklad nepotřebuje samostatný transformační server navíc, výpočet, který transformace potřebují, se škáluje v rámci skladu podle toho, kolik dat se zrovna zpracovává.

    Syrová data zůstávají po ruce

    Protože se do skladu nejdřív uloží syrová podoba dat, jde se k ní kdykoli vrátit a přepočítat ji jinak, i kdyby se později ukázalo, že některá transformace byla nastavená chybně.

    Standard, na který Datimo staví u nových skladů

    U nových datových skladů je ELT výchozí přístup Datimo. Plné srovnání s ETL a důvody, proč tahle volba dává smysl konkrétně v BigQuery, jsou na stránce ETL vs. ELT.