Druhá strana mince dbt: Bujení kódu, skryté náklady a cesta k automatizaci

dbt přineslo do SQL modularitu a Git, čímž posunulo analytické inženýrství. S růstem projektů se však projevují limity: provozní režie Core versus poplatky za vývojáře v Cloudu, absence ingestu a záplava ručně psaných modelů. Platforma řízená modelem tuto volbu překonává.

Druhá strana mince dbt: Bujení kódu, skryté náklady a cesta k automatizaci

Platforma pro automatizaci datových skladů, které důvěřují datové týmy napříč obory

Zní vám to povědomě?

  • Tým tráví více času laděním závislostí v grafu a optimalizací nákladných dotazů než odpovídáním na dotazy byznysu.
  • Transformační vrstva vyžaduje pro své fungování řadu dalších nástrojů: ingest, orchestraci, správu metadat a lineage.
  • Kombinované náklady na licence, mzdy platformních inženýrů a účty za výpočetní výkon ve skladu vytrvale stoupají.
  • Úprava zdánlivě jednoduchého obchodního pravidla vyžaduje projít a upravit řetězec několika navazujících SQL modelů.

Příchod dbt znamenal pro datovou komunitu významný posun kupředu. Vyvedl transformace z neprůhledných uložených procedur a proprietárních ETL nástrojů do éry moderního softwarového inženýrství: verzování v Gitu, modularita a automatizované testování.

Jakmile však projekty dospějí do produkční fáze v plném měřítku, organizace nevyhnutelně narážejí na odvrácenou stranu toho, že se veškerý SQL kód píše ručně.

Čtyři problémy životního cyklu s dbt

Přečtěte si podrobné rozbory jednotlivých symptomů:

  1. Dilema nákladů: Core versus Cloud. Volba mezi časem inženýrů na správu infrastruktury a rostoucími poplatky za licence na vývojáře v Cloudu. Přečtěte si článek o nákladech Core vs Cloud.
  2. Mezera v ingestu dat. dbt nepřipojuje zdroje ani nenačítá surová data; vyžaduje pořízení a správu samostatného konektoru. Přečtěte si článek o mezeře v ingestu.
  3. Nekontrolované bujení modelů. Grafy se stovkami mezilehlých modelů, které se nikdo neodvažuje upravit. Přečtěte si článek o bujení modelů.
  4. Rostoucí výpočetní náklady. Ruční modely, které přepočítávají celé tabulky namísto důsledného uplatňování přírůstkových dávek. Přečtěte si článek o výpočetních nákladech skladu.

Svoboda versus standardizace

Základní princip dbt dává vývojáři naprostou volnost: jakýkoli validní SQL dotaz může být modelem. V malém týmu to urychluje start. Ve velké organizaci tato volnost vede ke vzniku tolika různých stylů psaní, způsobů pojmenování a strategií materializace, kolik vývojářů projektem prošlo.

Odolný podnikový datový sklad však vyžaduje standardizaci a konzistenci. Obchodní entity, vazební tabulky i historické záznamy musí vznikat podle jednotných, ověřených principů. Jen tak zůstane sklad auditovatelný a jeho výkon předvídatelný.

Řešení s Datavault Builderem

Datavault Builder spojuje disciplínu správy verzí v Gitu s efektivitou automatizovaného generování kódu řízeného modelem:

  • Vizuální návrh zaměřený na byznys. Navrhujte entity, vztahy a satelity vizuálně. Platforma se postará o vygenerování optimalizovaného SQL pro vaši databázi.
  • Přírůstkové výpočty od základu. Každé nahrávání do Data Vaultu je ze své podstaty přírůstkové, což chrání databázi před zbytečným přepočítáváním a drží náklady pod kontrolou.
  • Ingest i transformace pod jednou střechou. Přímé napojení zdrojů i podnikové modelování probíhají v jediné platformě bez nutnosti propojovat další nástroje.
  • Automatická governance a lineage. Živá dokumentace a ověřitelná lineage vznikají samy přímo z modelu.

Podívejte se, jak to funguje na jednom z vašich zdrojů

Rezervujte si bezplatné demo a přineste konektor, který vás stojí nejvíce peněz nebo času.

Tři kroky k pipeline, kterou máte plně pod kontrolou

  1. Ocenit přínos dbt

    dbt etablovalo moderní standardy: správu verzí v Gitu, automatické testy a modularitu ve světě analytického SQL.

  2. Pojmenovat limity čistě ručního kódování

    Ruční psaní každé transformace, makra a mezilehlé tabulky přestává škálovat, jakmile sklad dosáhne většího rozsahu.

  3. Přejít k automatizaci řízené modelem

    Zvolte platformu, která generuje strukturální kód za vás a umožní týmu soustředit se na logiku podniku a tvorbu datových produktů.

Jak Datavault Builder odstraňuje třecí plochy při ingestu dat

  • Ingest dat je integrovaný

    Dávkové, delta i CDC nahrávání z databází, souborů, REST API, NoSQL a Python zdrojů, přičemž proudy jako Kafka přicházejí v micro-batches. Stejná platforma, která generuje datový sklad, bez dalších faktur za licence.

  • Vaše schéma, nikoli schéma dodavatele

    Zdrojové tabulky jsou namapovány na model Data Vault 2.0, který jste sami navrhli. Nový sloupec nebo přejmenovaná tabulka mění pouhé mapování, nikoli řetězec post-load skriptů.

  • Přenášejí se pouze delty

    Huby, linky a satelity nahrávají jen to, co se skutečně změnilo. Plná přenačtení zůstávají ve stagingu, místo aby se každou noc přepočítávala v celém skladu.

  • Historie se uchovává automaticky návrhem

    Každá změna je zachycena tak, jak dorazí, takže historický reporting funguje i tam, kde zdrojový systém přepisuje vlastní záznamy.

  • Kód, který nikdy nemusíte psát ručně

    Nahrávání, historizace a lineage se generují z modelu v reálném čase a běží nativně na Snowflake, Databricks, BigQuery, SQL Serveru, Fabricu, Oracle nebo PostgreSQL.

  • Jedna platforma, až o devět nástrojů méně

    Modelování, ETL, CI/CD, dokumentace a lineage na jednom místě. Právě to umožňuje přejít od zadání požadavku do produkce za 14,7 minuty.

Oceněno společností BARC v The Data Fabric Survey 26

Seznamte se s naším expertem

Dvacet minut s naším obchodním ředitelem a upřímná odpověď, zda se to hodí pro váš technologický stack.

Matt Collett

Matt Collett

Sales Director

Co hledáte?

Odesláním souhlasíte s našimi Zásadami ochrany osobních údajů.

Další problémy, které tato série řeší

  • Mezera v ingestu dat

    Proč vás dbt nutí hledat další nástroj dříve, než můžete začít modelovat?

    dbt transformuje data, která již leží ve vašem skladu. Nic ze zdrojových systémů samo neextrahuje, nepřipojuje ani nenahrává. Pro kompletní sklad potřebujete další nástroj na ingest, další na orchestraci a propojení mezi nimi. Platforma řízená modelem řeší ingest i transformaci na jednom místě.

  • Výpočetní náklady skladu

    Způsobují modely v dbt nárůst účtů za výpočetní výkon ve Snowflake nebo BigQuery?

    dbt spouští veškerý kód přímo uvnitř vašeho analytického skladu. Pokud jsou modely nastaveny jako kompletní přenačtení celých tabulek nebo využívají ručně psané inkrementální strategie, spotřeba kreditů stoupá s každým během. V Data Vaultu generovaném z modelu je přírůstkové nahrávání jediný způsob, jakým nahrávání vzniká.

  • Bujení modelů

    Proměnil se váš DAG v dbt v nepřehlednou síť, kterou nikdo nedokáže ladit?

    Vytvořit nový model v dbt je tak snadné, že repozitáře rychle zaplní stovky SQL souborů bez jasných pravidel správy. Změna obchodního klíče výše v řetězci pak znamená dohledat každý model, který jej zdědil. Řešením je strukturovaná architektura řízená modelem s jasnými pravidly odvozování.

Otázky a odpovědi