Druhá strana mince dbt: Bujení kódu, skryté náklady a cesta k automatizaci
dbt přineslo do SQL modularitu a Git, čímž posunulo analytické inženýrství. S růstem projektů se však projevují limity: provozní režie Core versus poplatky za vývojáře v Cloudu, absence ingestu a záplava ručně psaných modelů. Platforma řízená modelem tuto volbu překonává.
Zní vám to povědomě?
- Tým tráví více času laděním závislostí v grafu a optimalizací nákladných dotazů než odpovídáním na dotazy byznysu.
- Transformační vrstva vyžaduje pro své fungování řadu dalších nástrojů: ingest, orchestraci, správu metadat a lineage.
- Kombinované náklady na licence, mzdy platformních inženýrů a účty za výpočetní výkon ve skladu vytrvale stoupají.
- Úprava zdánlivě jednoduchého obchodního pravidla vyžaduje projít a upravit řetězec několika navazujících SQL modelů.
Příchod dbt znamenal pro datovou komunitu významný posun kupředu. Vyvedl transformace z neprůhledných uložených procedur a proprietárních ETL nástrojů do éry moderního softwarového inženýrství: verzování v Gitu, modularita a automatizované testování.
Jakmile však projekty dospějí do produkční fáze v plném měřítku, organizace nevyhnutelně narážejí na odvrácenou stranu toho, že se veškerý SQL kód píše ručně.
Čtyři problémy životního cyklu s dbt
Přečtěte si podrobné rozbory jednotlivých symptomů:
- Dilema nákladů: Core versus Cloud. Volba mezi časem inženýrů na správu infrastruktury a rostoucími poplatky za licence na vývojáře v Cloudu. Přečtěte si článek o nákladech Core vs Cloud.
- Mezera v ingestu dat. dbt nepřipojuje zdroje ani nenačítá surová data; vyžaduje pořízení a správu samostatného konektoru. Přečtěte si článek o mezeře v ingestu.
- Nekontrolované bujení modelů. Grafy se stovkami mezilehlých modelů, které se nikdo neodvažuje upravit. Přečtěte si článek o bujení modelů.
- Rostoucí výpočetní náklady. Ruční modely, které přepočítávají celé tabulky namísto důsledného uplatňování přírůstkových dávek. Přečtěte si článek o výpočetních nákladech skladu.
Svoboda versus standardizace
Základní princip dbt dává vývojáři naprostou volnost: jakýkoli validní SQL dotaz může být modelem. V malém týmu to urychluje start. Ve velké organizaci tato volnost vede ke vzniku tolika různých stylů psaní, způsobů pojmenování a strategií materializace, kolik vývojářů projektem prošlo.
Odolný podnikový datový sklad však vyžaduje standardizaci a konzistenci. Obchodní entity, vazební tabulky i historické záznamy musí vznikat podle jednotných, ověřených principů. Jen tak zůstane sklad auditovatelný a jeho výkon předvídatelný.
Řešení s Datavault Builderem
Datavault Builder spojuje disciplínu správy verzí v Gitu s efektivitou automatizovaného generování kódu řízeného modelem:
- Vizuální návrh zaměřený na byznys. Navrhujte entity, vztahy a satelity vizuálně. Platforma se postará o vygenerování optimalizovaného SQL pro vaši databázi.
- Přírůstkové výpočty od základu. Každé nahrávání do Data Vaultu je ze své podstaty přírůstkové, což chrání databázi před zbytečným přepočítáváním a drží náklady pod kontrolou.
- Ingest i transformace pod jednou střechou. Přímé napojení zdrojů i podnikové modelování probíhají v jediné platformě bez nutnosti propojovat další nástroje.
- Automatická governance a lineage. Živá dokumentace a ověřitelná lineage vznikají samy přímo z modelu.
Podívejte se, jak to funguje na jednom z vašich zdrojů
Rezervujte si bezplatné demo a přineste konektor, který vás stojí nejvíce peněz nebo času.
Tři kroky k pipeline, kterou máte plně pod kontrolou
-
Ocenit přínos dbt
dbt etablovalo moderní standardy: správu verzí v Gitu, automatické testy a modularitu ve světě analytického SQL.
-
Pojmenovat limity čistě ručního kódování
Ruční psaní každé transformace, makra a mezilehlé tabulky přestává škálovat, jakmile sklad dosáhne většího rozsahu.
-
Přejít k automatizaci řízené modelem
Zvolte platformu, která generuje strukturální kód za vás a umožní týmu soustředit se na logiku podniku a tvorbu datových produktů.
Jak Datavault Builder odstraňuje třecí plochy při ingestu dat
-
Ingest dat je integrovaný
Dávkové, delta i CDC nahrávání z databází, souborů, REST API, NoSQL a Python zdrojů, přičemž proudy jako Kafka přicházejí v micro-batches. Stejná platforma, která generuje datový sklad, bez dalších faktur za licence.
-
Vaše schéma, nikoli schéma dodavatele
Zdrojové tabulky jsou namapovány na model Data Vault 2.0, který jste sami navrhli. Nový sloupec nebo přejmenovaná tabulka mění pouhé mapování, nikoli řetězec post-load skriptů.
-
Přenášejí se pouze delty
Huby, linky a satelity nahrávají jen to, co se skutečně změnilo. Plná přenačtení zůstávají ve stagingu, místo aby se každou noc přepočítávala v celém skladu.
-
Historie se uchovává automaticky návrhem
Každá změna je zachycena tak, jak dorazí, takže historický reporting funguje i tam, kde zdrojový systém přepisuje vlastní záznamy.
-
Kód, který nikdy nemusíte psát ručně
Nahrávání, historizace a lineage se generují z modelu v reálném čase a běží nativně na Snowflake, Databricks, BigQuery, SQL Serveru, Fabricu, Oracle nebo PostgreSQL.
-
Jedna platforma, až o devět nástrojů méně
Modelování, ETL, CI/CD, dokumentace a lineage na jednom místě. Právě to umožňuje přejít od zadání požadavku do produkce za 14,7 minuty.
Seznamte se s naším expertem
Dvacet minut s naším obchodním ředitelem a upřímná odpověď, zda se to hodí pro váš technologický stack.
Matt Collett
Sales Director
Skvělé, vyberte si vyhovující termín:
Další problémy, které tato série řeší
-
Proč vás dbt nutí hledat další nástroj dříve, než můžete začít modelovat?
dbt transformuje data, která již leží ve vašem skladu. Nic ze zdrojových systémů samo neextrahuje, nepřipojuje ani nenahrává. Pro kompletní sklad potřebujete další nástroj na ingest, další na orchestraci a propojení mezi nimi. Platforma řízená modelem řeší ingest i transformaci na jednom místě.
-
Způsobují modely v dbt nárůst účtů za výpočetní výkon ve Snowflake nebo BigQuery?
dbt spouští veškerý kód přímo uvnitř vašeho analytického skladu. Pokud jsou modely nastaveny jako kompletní přenačtení celých tabulek nebo využívají ručně psané inkrementální strategie, spotřeba kreditů stoupá s každým během. V Data Vaultu generovaném z modelu je přírůstkové nahrávání jediný způsob, jakým nahrávání vzniká.
-
Proměnil se váš DAG v dbt v nepřehlednou síť, kterou nikdo nedokáže ladit?
Vytvořit nový model v dbt je tak snadné, že repozitáře rychle zaplní stovky SQL souborů bez jasných pravidel správy. Změna obchodního klíče výše v řetězci pak znamená dohledat každý model, který jej zdědil. Řešením je strukturovaná architektura řízená modelem s jasnými pravidly odvozování.
Otázky a odpovědi
- Nikoli. Poukazuje na to, že většina projektu v dbt sestává z technického strukturálního kódu, který by měl generovat software. Datavault Builder dokáže dbt plnohodnotně nahradit vizuálním modelováním, vizuálně sestavovanou vrstvou dodávky dat a nativní lineage. Pokud se organizace rozhodne dbt ponechat, protože obsluhuje i jiné procesy, platforma dokáže modely v dbt generovat sama, čímž zajistí proces řízený modelem v obou případech.
- dbt rozptyluje náklady mezi licence za uživatele, mzdy inženýrů spravujících orchestrátory a zbytečný výpočetní výkon daný přepočítáváním plných modelů. Datavault Builder nabízí předvídatelnou serverovou licenci, jejíž součástí je i podpora, eliminuje externí orchestrátory a generuje přírůstkový kód vyladěný pro cílový databázový stroj.
- Prostřednictvím Migration Vaultu. Jde o koncept a datový model zahrnující huby, linky, satelity, zdroje, obchodní klíče a atributy. Extrahujete metadata, která váš projekt obsahuje, namapujete je do tohoto modelu a Datavault Builder z tohoto mapování vygeneruje balíček pro nasazení k instalaci; postup opakujete podle postupu projektu. Projekt v AutomateDV již všechna tato metadata obsahuje a stejný postup funguje pro téměř jakékoli řešení se strukturou a pravidly.
- Od 1. června 2026 tvoří jednu společnost, v současnosti se dvěma produkty a oddělenou cenotvorbou, s oznámenou těsnější integrací do budoucna. dbt Core a engine Fusion zůstávají open source pod licencí Apache 2.0.