K čemu propojení slouží
GA4 umí posílat data přímo do BigQuery jako nativní, zabudovanou funkci Google. Do Snowflake ale tahle nativní cesta nevede – žádný podobný export tam Google nenabízí. Data z GA4 do Snowflake proto musí jít jinudy, přes GA4 Data API, a tam začíná práce Datima.
Bez nativního exportu jde jen cesta přes API
Zatímco export do BigQuery si zapnete přímo v GA4 pár kliknutími, do Snowflake se stejná data musí natáhnout přes Google Analytics Data API. Je to jiná, náročnější technická cesta – ne export, který Google jen zapíná, ale integrace, kterou je potřeba postavit a udržovat.
Datimo staví pipeline i vrstvu nad daty
Data z GA4 API skládáme do struktury podle relací a objednávek, nahráváme do Snowflake přes externí stage a Snowpipe nebo dávkové COPY INTO a propojujeme s daty z e-shopu a účetnictví, se kterými se dá počítat v reportu nebo v atribuci.
Na co si dát pozor
Cesta GA4 do Snowflake má pár vlastností, které stojí za to znát dopředu, ne je objevit až při stavbě prvního reportu.
Neexistuje nativní export, na který by se dalo jen napojit
Na rozdíl od BigQuery, kam GA4 posílá syrová data sama, do Snowflake žádnou vestavěnou cestu Google nenabízí. Data se musí stahovat přes GA4 Data API, což je jiný rozsah práce a jiné limity (mimo jiné kvóty a granularita API) než u nativního exportu.
GA4 Data API má jiné limity než export do BigQuery
API má denní kvótu 200 000 tokenů na property (a 40 000 tokenů za hodinu), navíc maximálně 10 souběžných požadavků na property; spotřeba tokenů roste se složitostí dotazu, ne jen s počtem vrácených řádků. Je primárně určené pro agregované reporty, ne pro export syrových eventů v takovém objemu, v jakém je posílá nativní export do BigQuery. Rozsah a granularitu dat je potřeba navrhnout s ohledem na tohle omezení.
Nad určitým objemem dat API vzorkuje, export do BigQuery ne
Standardní GA4 property při dotazech nad 10 milionů eventů v daném období výsledek vzorkuje (sampling), u GA4 360 je práh až 1 miliarda eventů. Nativní export do BigQuery tomuhle omezení nepodléhá, protože posílá syrové eventy bez agregace – jenže ten do Snowflake nevede, takže data natažená přes API nemusí sedět 1:1 s tím, co by ukázal přímý export, kdyby existoval.
Atribuce z GA4 se nemusí shodovat s Google Ads ani s celkovým obratem
GA4 počítá atribuci podle vlastní logiky, ať už data čerpáte z nativního exportu do BigQuery nebo přes API do Snowflake. Číslo se proto typicky liší od toho, co ukazuje Google Ads nebo celkový obrat napříč kanály. Víc u pojmu Atribuční modelování.
Neuzavřený virtuální warehouse ve Snowflake běží a platí se dál
Snowflake účtuje výpočet zvlášť od úložiště, podle velikosti virtuálního warehousu a doby běhu, s minimem 60 sekund. Pokud warehouse nemá zapnuté auto-suspend, běží a čerpá kredity i ve chvíli, kdy nikdo nic nedotazuje. To je jiný model než BigQuery, kde se platí za proskenovaná data u jednotlivého dotazu, ne za čas běhu clusteru.
Jak to Datimo řeší
- 1
Postavení pipeline nad GA4 Data API
Napojení postavíme na GA4 Data API tak, aby pravidelně stahovalo data v rozsahu, který projekt reálně potřebuje, včetně e-commerce parametrů a vlastních událostí, s ohledem na kvóty API.
- 2
Nahrání dat do Snowflake přes externí stage
Data z API ukládáme do cloudového úložiště (podle toho, na kterém cloudu váš Snowflake účet běží – S3, ADLS Gen2 nebo GCS) jako externí stage a odtud je nahráváme do Snowflake přes Snowpipe nebo dávkové COPY INTO.
- 3
Transformace na použitelné tabulky
Data z API skládáme do relací a nákupních cest, aby se dalo dotazovat běžným SQL, ne řešit strukturu GA4 při každém reportu znovu.
- 4
Propojení s e-shopem, ERP a účetnictvím
Data z GA4 spojujeme s marží, objednávkami a náklady ze stejného datového skladu, aby atribuce a reporting počítaly se skutečným ziskem, ne jen s obratem, který GA4 samo o sobě nezná.
- 5
Správa napojení v ceně
Technickou správu pipeline, reakci na změny API i konfiguraci warehousu, včetně auto-suspend, aby se zbytečně nespaloval kredit, hlídáme za vás, v rámci ceny.
