Databricks

    Datová a AI platforma postavená na konceptu lakehouse, spojení pružnosti data lake se strukturou a výkonem datového skladu. Používá se pro datové inženýrství, strojové učení a analytiku nad velkými objemy dat na jedné platformě. Datimo s ní aktuálně nestaví integrace, standardem zůstává BigQuery.

    Lakehouse, tedy sklad a jezero v jednom

    Databricks je datová a AI platforma postavená na konceptu lakehouse, spojení pružnosti data lake (viz pojem Data lake) se strukturou a výkonem datového skladu. Data se ukládají v otevřeném formátu, se kterým ale zároveň jde počítat s rychlostí a spolehlivostí blízkou klasickému skladu, ne jen je tam odložit.

    Jedna platforma pro víc účelů

    Databricks se používá pro datové inženýrství (velké transformační joby), strojové učení a analytiku nad stejnými daty, bez nutnosti přesouvat je mezi samostatnými systémy pro každou z těchto úloh.

    Postavený nad Apache Spark

    Vznikl z projektu Apache Spark a zůstává na výpočet velkých objemů dat, typicky ve firmách, které kombinují klasické reportování se strojovým učením nad stejným datovým základem.

    Kde firmy pálí peníze

    Databricks se účtuje podle výpočetního výkonu, který se spotřebuje, ne podle uloženého objemu dat, což u něj vede k podobným rizikům jako u jiných cloudových platforem placených podle spotřeby.

    • Clustery běžící déle, než je potřeba

      Výpočetní cluster, který se po dokončení úlohy automaticky nevypne, dál běží a účtuje se, i když nic nepočítá. U větších týmů se tahle položka snadno ztratí v celkové faktuře.

    • Platforma navržená pro objem, který firma nemá

      Databricks dává největší smysl tam, kde je potřeba zpracovávat opravdu velké objemy dat nebo trénovat modely strojového učení. Menší e-shop, který potřebuje hlavně přehledný report o marži a PNO, si takovou platformou obvykle koupí výkon, který nevyužije.

    • Duplicitní infrastruktura vedle existujícího skladu

      Firma, která už má datový sklad jinde, a Databricks zavede jen kvůli jednomu projektu strojového učení, může skončit se dvěma paralelními místy pro data místo jednoho, s náklady na sladění obou.

    Jak se Databricks vztahuje k tomu, co staví Datimo

    Tahle stránka je neutrální vysvětlení pojmu, který firmy hledají, ne popis něčeho, co Datimo v Databricks reálně staví.

    1. 1

      Datimo standardně staví na BigQuery

      Výchozí volba Datimo pro datový sklad je Google BigQuery (viz pojem BigQuery), a to i pro firmy, které řeší podobné úlohy jako datové inženýrství a reporting nad e-commerce daty. Důvody, proč BigQuery a ne jiná platforma, popisujeme přímo u pojmu BigQuery.

    2. 2

      Databricks Datimo aktivně nenapojuje

      Na rozdíl od Microsoft Fabricu nebo Snowflake, kam Datimo staví konkrétní integrace (viz třeba integrace Pohoda a Snowflake), Databricks aktuálně součástí nabídky Datimo není. Tahle stránka slouží jako férové a přesné vysvětlení pojmu pro firmy, které si Databricks porovnávají s jinými platformami, ne jako tvrzení, že s ním má Datimo produkční zkušenost.

    3. 3

      Kdy dává smysl se ozvat

      Pokud firma zvažuje, jestli pro reporting a analytiku e-commerce dat potřebuje lakehouse platformu jako Databricks, nebo jí stačí standardní datový sklad, probereme s ní konkrétní zdroje dat a objem, se kterým reálně pracuje.