Potíže s náklady a nepružným schématem ve Fivetranu? Řešením je automatizace modelování
Plně spravovaný ELT je rychlý na rozjezd, ale náročný na řízení ve větším měřítku. Postupem času se vytrácejí dvě věci: kontrola nad náklady na pipeline a rozhodování o struktuře dat. Automatizovaná vrstva Data Vault vám obojí vrátí, aniž byste se museli vzdát fungujících konektorů.
Zní vám to povědomě?
- Faktura za Fivetran prudce vzrostla po migraci nebo hromadné aktualizaci ve zdrojovém systému kvůli účtování za Monthly Active Rows (MAR).
- Předdefinované schéma konektoru nutí tým psát a udržovat řadu následných SQL skriptů pro přizpůsobení klíčů logice podniku.
- Každá automatická změna struktury provedená konektorem hrozí rozbitím pohledů a analytických reportů v produkci.
- Tým kombinuje spravované konektory pro některé zdroje s ručními skripty pro jiné, aniž by měl jednotnou vrstvu řízení dat.
Nástroje pro spravovaný ingest dat, jako je Fivetran, zásadně zjednodušily napojování SaaS aplikací. Nabízejí zážitek typu plug-and-play: zadáte přihlašovací údaje a data máte krátce nato přichystaná v datovém skladu.
Toto počáteční pohodlí se však s růstem architektury často proměňuje v provozní a finanční zátěž.
Kompromis plně spravovaného ELT
Obě potíže rozebíráme podrobně v samostatných článcích:
- Nepředvídatelné účtování za Monthly Active Rows (MAR). Každá aktualizace ve zdroji nebo historický přepočet zvyšuje počet aktivních řádků a navyšuje měsíční fakturu. Přečtěte si článek o cenách MAR.
- Nepružná schémata a ztráta kontroly. Tabulky dorazí ve struktuře dané dodavatelem. Jejich přizpůsobení vašemu podnikovému modelu vyžaduje ruční psaní navazujících SQL skriptů. Přečtěte si článek o pevných schématech.
Výsledkem je paradox: přístup, který měl datové inženýrství eliminovat, často končí vytvořením rozsáhlé vrstvy ručních transformačních skriptů a fakturou za předplatné, kterou lze před vedením jen těžko obhájit.
Kde má ležet kontrola nad skladem
Odpovědnost za správu a architekturu datového skladu nenáleží transportnímu nástroji. Musí patřit vyhrazené vrstvě:
- Vlastní datové schéma. Návrh skladu musí odpovídat potřebám vaší organizace, nikoli specifikům API externího dodavatele.
- Historizace jako standard. Uchovávání historie nesmí záviset na tom, zda konektor nabízí proprietární historické tabulky; musí být standardní součástí vaultu.
- Transparentní a řiditelné náklady. Výpočetní výkon je dimenzován ve vaší vlastní databázi, bez variabilního zpoplatnění za každý přenesený řádek.
Co přináší Datavault Builder
Datavault Builder stávající konektory doplňuje nebo přímo nahrazuje a nabízí ucelené prostředí pro modelování i automatizaci:
- Přímý ingest bez poplatků za řádky. Nahrávejte relační databáze, soubory, API a zdroje NoSQL přímo do skladu v rámci stejné platformy, která z modelu generuje zbytek skladu.
- Ochrana před změnami schémat. Vstupní tabulky se mapují na model Data Vault 2.0. Změní-li konektor strukturu, upraví se vizuální mapování bez dopadu na výstupní marty.
- Vizuální modelování byznysu. Navrhujte datové produkty, dimenze a fakta v přehledném rozhraní s automaticky odvozenou lineage a dokumentací.
Podívejte se, jak to funguje na jednom z vašich zdrojů
Rezervujte si bezplatné demo a přineste konektor, který vás stojí nejvíce peněz nebo času.
Tři kroky k pipeline, kterou máte plně pod kontrolou
-
Pojmenovat faktory nákladů a nepružnosti
Oddělte pohodlí při přesunu dat od ztráty kontroly nad jejich strukturou a od variabilních poplatků za počet řádků.
-
Zařadit vrstvu Data Vault
Ukládejte data do stagingu a vizuálně je namapujte na huby, linky a satelity předtím, než je zpřístupníte byznysu.
-
Objemné zdroje nahrávat přímo
Využijte integrovaný přímý ingest pro velké databáze a ponechte placené konektory pouze pro složité SaaS aplikace.
Jak Datavault Builder odstraňuje třecí plochy při ingestu dat
-
Ingest dat je integrovaný
Dávkové, delta i CDC nahrávání z databází, souborů, REST API, NoSQL a Python zdrojů, přičemž proudy jako Kafka přicházejí v micro-batches. Stejná platforma, která generuje datový sklad, bez dalších faktur za licence.
-
Vaše schéma, nikoli schéma dodavatele
Zdrojové tabulky jsou namapovány na model Data Vault 2.0, který jste sami navrhli. Nový sloupec nebo přejmenovaná tabulka mění pouhé mapování, nikoli řetězec post-load skriptů.
-
Přenášejí se pouze delty
Huby, linky a satelity nahrávají jen to, co se skutečně změnilo. Plná přenačtení zůstávají ve stagingu, místo aby se každou noc přepočítávala v celém skladu.
-
Historie se uchovává automaticky návrhem
Každá změna je zachycena tak, jak dorazí, takže historický reporting funguje i tam, kde zdrojový systém přepisuje vlastní záznamy.
-
Kód, který nikdy nemusíte psát ručně
Nahrávání, historizace a lineage se generují z modelu v reálném čase a běží nativně na Snowflake, Databricks, BigQuery, SQL Serveru, Fabricu, Oracle nebo PostgreSQL.
-
Jedna platforma, až o devět nástrojů méně
Modelování, ETL, CI/CD, dokumentace a lineage na jednom místě. Právě to umožňuje přejít od zadání požadavku do produkce za 14,7 minuty.
Seznamte se s naším expertem
Dvacet minut s naším obchodním ředitelem a upřímná odpověď, zda se to hodí pro váš technologický stack.
Matt Collett
Sales Director
Skvělé, vyberte si vyhovující termín:
Další problémy, které tato série řeší
-
Čistíte v SQL ručně schémata, která Fivetran do skladu nahrál automaticky?
Fivetran ukládá každý zdroj do vlastního schématu předdefinovaného dodavatelem. Obchodní klíče, vlastní pole a historické struktury je pak nutné přetvářet v ručním SQL, které se rozbije při každé změně konektoru. Řešením není další skript, ale model, který strukturu řídí.
-
Způsobují Monthly Active Rows (MAR) ve Fivetranu nepříjemná překvapení v rozpočtu?
Fivetran účtuje podle Monthly Active Rows (MAR): řádků vložených či aktualizovaných v daném měsíci. Hromadná aktualizace ve zdroji, migrace nebo historické přenačtení znásobí počet řádků a vystřelí fakturu vzhůru. Přímý ingest do skladu spojený s vaultem, který přenáší pouze delty, udržuje náklady pod kontrolou.
Otázky a odpovědi
- Tabulky, které Fivetran již ukládá do vašeho skladu, poslouží jako staging vrstva pro Datavault Builder. Připojte nástroj k tomuto schématu, vizuálně přiřaďte tabulky k hubům, linkům a satelitům a začněte generovat řízené struktury bez přerušení stávajícího toku dat. Práce spočívá v modelování, nikoli v extrakci.
- Nikoli. Fivetran je velmi praktický pro stovky vedlejších SaaS nástrojů se složitými API. Doporučeným řešením je oddělit datový sklad od schémat dodavatele a převzít přímý ingest u objemných databází, kde poplatky za MAR narůstají nejvíce.