Mi az az adattárház?
Az adattárház (data warehouse) olyan digitális tárolórendszer, amely számos különböző forrásból származó nagy mennyiségű adatot kapcsol össze és harmonizál.
default
{}
default
{}
primary
default
{}
secondary
Adattárház áttekintése
Az adattárház (Data Warehouse, DW) olyan központosított repository, amely nagy mennyiségű aktuális és történeti adatot gyűjt, integrál és tárol több forrásból. Egyetlen, konzisztens adatforrás biztosításával támogatja az üzleti intelligenciát (BI), a jelentéskészítést és a fejlett analitikát. Az adatok konszolidálásával és szabványosításával a szervezetek megbízható elemzéseket készíthetnek, megfelelhetnek a szabályozási követelményeknek, és megalapozott, adatvezérelt döntéseket hozhatnak.
Az adatok jellemzően operatív rendszerekből (pl. ERP és CRM), belső adatbázisokból és külső forrásokból, például partnerplatformokból, IoT-eszközökből, időjáráscsatornákból és közösségi médiából kerülnek az adattárházba. Ahogy a felhőalapú számítástechnika kiforrott, az adattárolás a hagyományos helyszíni környezetekről rugalmas többfelhős és hibrid felhőarchitektúrákra tért át.
Modern adattárházak épülnek fel a strukturált és strukturálatlan adatok, például videók, képek és érzékelőfolyamok kezelésére. Sokan integrált elemzéseket és memórián belüli feldolgozást tartalmaznak a gyorsabb lekérdezések, a valós idejű adathozzáférés, valamint a hatékonyabb jelentéskészítési és BI-munkafolyamatok érdekében. Adattárház nélkül a szervezetek nehezen tudják kombinálni a heterogén adatforrásokat, megfelelően előkészíteni az adatokat az elemzésekhez, és fenntartani az adathalmazok láthatóságát.
1. ábra: Az adattárház áttekintése
Az adatraktározás előnyei
A jól megtervezett adattárház a sikeres üzleti intelligencia, jelentéskészítés és elemzések gerincét képezi. Az adatok egyetlen adatforrásba történő konszolidálásával felgyorsítja az elemzéseket a jobb és magabiztosabb döntéshozatal érdekében az egész vállalaton belül. A legfontosabb előnyök a következők:
- Jobb üzleti elemzések: Az adattárház egységesíti a több rendszerből származó adatokat az üzlet egyetlen, konzisztens nézetévé, lehetővé téve a vezetők számára a trendek könnyebb elemzését és az intelligensebb, adatvezérelt döntések meghozatalát.
- Gyorsabb lekérdezések és elemzések: Mivel az adattárházak elemzésre vannak optimalizálva – nem tranzakciókhoz –, a felhasználók sokkal gyorsabban futtathatnak komplex lekérdezéseket nagy adathalmazokon, ami felgyorsítja a jelentési ciklusokat és csökkenti az informatikai függőséget.
- Javított adatminőség és konzisztencia: Az adatokat a raktárba való belépést megelőzően megtisztítják, validálják és szabványosítják, biztosítva, hogy az elemzések jó minőségű, megbízható információkon alapuljanak. A jobb adatminőség közvetlenül jobb döntésekhez vezet.
- Mélyebb történeti rálátás: Az adattárház megőrzi a gazdag történeti adatokat, megkönnyítve a hosszú távú minták felismerését, a teljesítmény értékelését, és pontosabb előrejelzéseket hoz létre, amelyek erősítik a stratégiai tervezést.
2. ábra: Adattárház képernyőképe az adateredettel
Milyen típusú adatokat tárolhat egy adattárház?
Amikor az adattárházak először jelentek meg az 1980-as évek végén, strukturált adatokat – jól szervezett információkat, például vevőadatokat, terméklistákat és tranzakciórekordokat – építettek ki. Az üzleti igények bővülésével a vállalatok olyan strukturálatlan adatokkal is szerettek volna dolgozni, mint a dokumentumok, képek, videók, e-mailek, közösségimédia-bejegyzések, valamint a gépekből és IoT-eszközökből származó szenzorkimenet.
A modern adattárházak mind strukturált, mind strukturálatlan adatokat kezelhetnek, összekapcsolva őket, hogy teljesebb, integrált nézetet biztosítsanak a vállalkozások számára a jobb rálátás érdekében.
Alapfogalmak és összehasonlítások
Sok tanulnivaló van az adatraktározás világában. Íme néhány legfontosabb fogalom. Fedezzen fel további definíciókat és GYIK-eket a szójegyzékünkben.
Adattárház vs. adatbázis
Az adatbázisok és az adattárházak egyaránt tárolnak adatokat, de különböző szerepeket szolgálnak. Az adatbázis valós idejű információkat kezel egy adott üzleti területhez, míg az adattárház a teljes szervezetből származó aktuális és történeti adatokat kombinálja a jelentéskészítés és az elemzések támogatása érdekében. Bár adatbázis-technológiával működik, egy adattárház eszközöket ad hozzá az adatok integrálásához, modellezéséhez és kezeléséhez az idő múlásával.
Az adatbázisok a tranzakciók feldolgozásával és a rekordok gyors frissítésével tartják a napi működést. Az adattárházak támogatják az elemzéseket, segítenek a csapatoknak a trendek felismerésében, a teljesítmény összehasonlításában és a stratégiai döntések meghozatalában.
Adattárház vs. adattó
Az adattárházak és az adattavak egyaránt nagy mennyiségű adatot tárolnak, de eltérő céljuk van. Az adattárház strukturált, előkészített adatokat tartalmaz jelentésekhez és elemzésekhez, míg egy adattó olyan nyers, feldolgozatlan adatokat tárol, amelyek később felhasználhatók. Gyakran együtt dolgoznak: a nyers adatok a tóban élnek, és átalakulnak és átkerülnek a raktárba, amikor elemzésre van szükség.
Adattó használata a nyers adatok rugalmas, alacsony költségű tárolásához. Használjon adattárházat a strukturált adatok gyors, megbízható elemzéséhez. A legtöbb szervezet mindkettőből profitál; a tó mindent megragad, és a raktár betekintéssé teszi.
3. ábra: Adattárház és adattó összehasonlítása
Adattárház vs. adatpiac
Az adatpiac az adattárház egy alszakasza, amelyet kifejezetten egy részleg vagy üzletág (például értékesítés, marketing vagy pénzügy) számára particionálnak. Például az értékesítési adatpiac a leadekre, a pipeline-tevékenységre és a lezárt elnyert ügyletekre összpontosíthat, míg a pénzügyi adatpiac a költségkeretekre, az előrejelzésekre és a bevételi mérőszámokra összpontosít.
Egyes adatpiacok önálló működési célokra is létre vannak hozva. Míg az adattárház központi adattárolóként szolgál egy teljes vállalat számára, az adatpiac releváns adatokat szolgál ki egy kiválasztott felhasználócsoport számára. Ez leegyszerűsíti az adathozzáférést, felgyorsítja az elemzést, és lehetővé teszi számukra a saját adataik feletti ellenőrzést. Egy adattárházon belül gyakran több adattár van telepítve.
4. ábra: Az adatpiac működését bemutató ábra
Adattárház kulcskomponensei
A modern adattárház négy kulcsfontosságú összetevőt tartalmaz: egy központi adatbázist, adatintegrációs és betöltési eszközöket, metaadatokat és hozzáférési eszközöket. Együtt gyors, megbízható analitikát nyújtanak méretarányosan.
5. ábra: Az adattárház komponenseit megjelenítő diagram
- Központi adatbázis: A raktár központi tárolómotorja, hagyományosan relációs adatbázis, de egyre inkább memórián belüli vagy felhőnatív rendszer a nagyobb teljesítmény érdekében.
- Adatintegráció és -betöltés: Az adatok a forrásrendszerekből kerülnek be olyan kötegelt módszerekkel, mint az ETL és az ELT, valamint valós idejű opciókkal, például módosítási-adatrögzítési replikációval és streamingfolyamatokkal. Ezek a folyamatok az átalakítást, a minőség-ellenőrzéseket és a bővítést is kezelik.
- Metaadatok: Olyan információ, amely leírja az adatokat – eredetét, struktúráját, jelentését és felhasználási módját – mind üzleti, mind technikai kontextusban.
- Eszközök elérése: olyan eszközök, amelyek lehetővé teszik a felhasználók számára a raktári adatok lekérdezését, elemzését és az azokkal való interakciót, beleértve a jelentéskészítő eszközöket, irányítópultokat, elemzési platformokat és alkalmazásfejlesztési eszközöket.
Adattárház architektúra
Történelmileg az adattárházak rétegekbe rendeződtek, amelyek az adatok rendszeren keresztüli mozgásához igazodtak. Egy tipikus adattárház három rétegből áll. A modern platformok leegyszerűsítik az architektúrát a gyorsabb adatmozgás és -elemzés támogatása érdekében.
6. ábra: Az adattárház architektúrájának ábrája
- Adatréteg: Az adatokat forrásrendszerekből hívják le, majd átalakítják és betöltik a raktárba egy olyan beviteli módszerrel, mint az ETL. Ez a réteg magában foglalja a központi adatbázist, az adattérképeket és az adattavakat, valamint az adatok szabványosítására és előkészítésére szolgáló metaadatokat és integrációs eszközöket.
- Szemantikai réteg: Ez a réteg rendszerezi és modellezi az adatokat, így könnyen lekérdezhető és elemezhető, és olyan gondozott nézeteket és üzleti definíciókat kínál, amelyek támogatják a gyors, konzisztens elemzéseket.
- Elemzési réteg: A felső réteg a felhasználók által használt eszközöket biztosítja – irányítópultok, beszámolók, KPI-monitoring, bővített elemzések és homokozó terek az adatok feltárásához és új modellek összeállításához.
Az adattárházakat hagyományosan informatikai csapatok építették és kezelték, de a modern platformok egyre inkább lehetővé teszik az üzleti felhasználók számára, hogy közvetlenül dolgozzanak az adatokkal. A műszakot vezető legfontosabb képességek a következők:
- Egy üzletbarát szemantikai réteg, amely természetes nyelvet használ, tisztázza a kapcsolatokat, és lehetővé teszi a felhasználók számára az adatok új kontextussal való bővítését.
- Virtuális munkaterületek, amelyek adatmodelleket, logikát és együttműködést hoznak egyetlen szabályozott környezetbe.
- Felhőalapú eszközök, amelyek megkönnyítik az alkalmazottak számára az új adatforrások összekapcsolását, elemzések futtatását és elemzések készítését, sokkal kevesebb informatikai függőség mellett.
Hogyan működik az adattárház?
Az adattárház a teljes vállalatból szervezi az információkat, így azok könnyen felfedezhetők, megbízhatók és elemezhetők. A folyamat általában négy egyszerű lépést követ:
- Kinyerés: az adatokat a forrásrendszerekből, például alkalmazásokból, adatbázisokból és felhőszolgáltatásokból hívja le a rendszer. Ebben a szakaszban az adatok gyűjtése a jelenlegi formájában történik.
- Átalakítás: Az adatokat tisztítják, szabványosítják és úgy alakítják, hogy konzisztensek és használatra készek legyenek. Ez magában foglalhatja a hibák eltávolítását, a formátumok összehangolását vagy az üzleti szabályok alkalmazását.
- Betöltés: Az előkészített adatok tárolása a raktárban a gyors jelentéskészítéshez és elemzésekhez optimalizált strukturált formátumban történik.
- Elemzés: az adatok betöltését követően a csapatok irányítópultok, jelentések és bővített elemzések segítségével felfedezhetik azokat, hogy megalapozott döntéseket hozhassanak.
ETL vs. ELT: Mi a különbség?
ETL (Kivonat → Átalakítás → Betöltés): Az adatok átalakítása a raktárba való belépés előtt történik. Ez a megközelítés közös a korlátozott feldolgozási képességgel rendelkező hagyományos adattárházakkal.
ELT (Extract → Load → Transform): A nyersadatokat először a raktárba töltjük be, és a raktáron belül átalakítjuk. A modern felhőplatformok ezt a módszert részesítik előnyben, mivel hatékonyan tudják kezelni a nagy léptékű átalakításokat.
Melyek az adattárház négy fő jellemzője?
Az adattárház néhány alapelvre épül, amelyek biztosítják, hogy megbízható, konzisztens és elemezhető információkat szolgáltasson az egész vállalaton belül. A négy fő jellemző a következő:
- Alkatrész-orientált: fő üzleti témák köré szervezve – mint például az ügyfelek vagy az értékesítés – az elemzés támogatása céljából.
- Integrált: A különböző rendszerekből, például az ERP-ből és a CRM-ből származó adatok tisztításra és szabványosításra kerülnek, így következetesen illeszkednek egymáshoz.
- Időváltozat: A történeti adatokat hosszú periódusokon keresztül tárolja, lehetővé téve a trend- és teljesítményelemzést.
- Nem változékony: Az adatok a betöltés után stabilak – olvashatók, de nem frissíthetők vagy törölhetők – biztosítva a megbízható adatforrást.
A felhőalapú adattárház előnyei
A felhőalapú adattárházak egyre népszerűbbek, mert jelentős előnyöket kínálnak a hagyományos helyszíni rendszerekkel szemben. Az adattárház felhőbe történő áthelyezésének hét legfontosabb előnye:
- Gyors üzembe helyezés: Pörgesse fel a tárolót, a számítást és az új környezeteket, például az adattérképeket vagy a homokozókat percek alatt, bárhonnan.
- Alacsonyabb TCO: csak a használt erőforrásokért fizessen. Kerülje el a hardver-, létesítmény- és karbantartási költségeket, és csökkentse a kiadásokat a tárolás és a számítás elkülönítésével.
- Rugalmasság: Azonnali méretezés a változó munkaterhelések és nagy adatmennyiségek manuális erőfeszítés nélküli kezeléséhez.
- Biztonság és katasztrófa utáni helyreállítás: A felhőalapú platformok gyakran erősebb biztonsági ellenőrzéseket, titkosítást és automatikus biztonsági mentéseket biztosítanak az adatvesztés elleni védelem érdekében.
- Valós idejű teljesítmény: A memórián belüli és a felhőnatív motorok gyors feldolgozási sebességet biztosítanak a valós idejű elemzésekhez.
- Hozzáférés az új technológiákhoz: Könnyen integrálhatja az olyan funkciókat, mint a gépi tanulás, az automatizált elemzések és a fejlett elemzések.
- Támogatja az üzleti felhasználókat: Egységes képet ad a csapatoknak az adatokról, valamint intuitív eszközöket biztosít az információk elemzéséhez és új források összekapcsolásához komoly informatikai beavatkozás nélkül.
7. ábra: Az adatraktározás támogatja a költségek átfogó elemzését
Adattárház bevált gyakorlatai
Új adattárház építésekor vagy egy meglévő bővítésekor a bevált gyakorlatok segítségével elérheti céljait, miközben időt és költséget takarít meg. Egyes gyakorlatok az üzleti igényekre összpontosítanak, míg mások szélesebb körű informatikai iránymutatás hatálya alá tartoznak. Az alábbi lista egy szilárd kiindulási pont, és finomítani fogja, ahogy a technológiai és szolgáltatási partnereivel dolgozik.
Legjobb üzleti gyakorlatok
- Határozza meg a szükséges információkat. Először is azonosítsa a megválaszolni kívánt kérdéseket és azokat a döntéseket, amelyeket támogatni szeretne. Innen határozza meg, hogy mely adatforrásokra van szükség. Iparági csoportok, ügyfelek és szállítók is nyújthatnak útmutatást a hasznos adatokkal kapcsolatban.
- Az aktuális adatok állapotának dokumentálása. Rögzítse, hol élnek az adatai, hogyan vannak strukturálva, és milyen minőségben azonosítják a hiányosságokat, a szükséges átalakításokat és azokat az üzleti szabályokat, amelyekre a raktár támaszkodni fog.
- Építsd meg a megfelelő csapatot! Tartalmazza azokat a vezetői szponzorokat, üzleti menedzsereket és végfelhasználókat, akik az elemzésekre támaszkodnak. Ismerje meg a sikerükhöz szükséges standard jelentéseket, KPI-ket és mérőszámokat.
- Priorizálja az első projektjeit. Kezdjük egy vagy két pilótával, akik egyértelmű üzleti értéket és kezelhető hatókört kínálnak. A korai győzelmek segítenek felépíteni a lendületet.
- Válasszon erős technológiai partnert. Válasszon ki egy bevált tapasztalattal rendelkező szállítót, implementációs támogatást és platformot, amely megfelel a telepítési igényeinek.
- Valósághű projektterv készítése. Működjön együtt csapatával az egyértelmű ütemterv és idővonal kialakítása érdekében. A rendszeres kommunikáció és a státusfrissítések mindenkit összehangolnak.
Informatikai bevált gyakorlatok
- A teljesítmény, a hozzáférés és a biztonság figyelése. A raktárnak gyorsnak és védettnek kell lennie. Kövesse nyomon a rendszerhasználatot, a biztonsági eseményeket és a hozzáférési mintákat, hogy az adatok biztonságban maradjanak, miközben a jogosult felhasználók könnyen elérhetik őket.
- Adatminőség, metaadatok, struktúra és irányítás karbantartása. A raktárba belépő új adatoknak konzisztens szabályokat kell követniük. Szabványosítsa a tisztítást, a transzformációt, a metaadat-definíciókat és az adatirányítást, hogy a felhasználók megbízhassanak az eredményekben.
- Rugalmas architektúra biztosítása. Az üzlet növekedésével a csapatoknak új adatmodellekre, modellekre és munkaterhelésekre lesz szükségük. A méretezhető, moduláris architektúra jobban támogatja ezeket az igényeket, mint a merev vagy szorosan kapcsolt rendszerek.
- Automatizálja a karbantartást és a műveleteket. Az automatizálás és a gépi tanulás használatával egyszerűsítheti az olyan feladatokat, mint az indexelés, a felügyelet, az optimalizálás és a frissítések. Ez javítja a teljesítményt és csökkenti a működési költségeket.
- A felhő stratégiai használata. A különböző csapatokra eltérő követelmények vonatkoznak. Szükség esetén tároljon bizonyos munkaterheléseket a helyszínen, miközben felhőalapú adattárházakat használ a skálázhatóság, az alacsonyabb költségek és az eszközökön keresztüli könnyebb hozzáférés érdekében.
Összefoglalás
A modern adattárházak – különösen a felhőalapú raktárak – központi szerepet játszanak a digitális átalakulásban azáltal, hogy egységesítik a belső és külső forrásokból származó adatokat, hogy teljes, időszerű képet kapjanak az üzletről. Segítenek az irányítópultoknak, KPI-knek, riasztásoknak és beszámolóknak a teljes szervezetben, és támogatják a gyors, összetett elemzéseket anélkül, hogy hatással lennének az operatív rendszerekre.
Mivel könnyen el tudják kezdeni a kis- és a nagyméreteket, ezért a vállalati csapatok és az üzleti egységek is jobb döntéseket hozhatnak, és javíthatják a teljesítményt.
GYIK
- Vállalati adattárház: Az EDW egy központi, vállalati szintű adattárház, amely az összes aktuális és történeti adatot egy helyen tárolja. Egyetlen, konzisztens adatforrást biztosít az elemzésekhez, jelentéskészítéshez és KPI-khez a teljes szervezetben. A legtöbb modern EDW felhőalapú a skálázhatóság és a könnyebb hozzáférés érdekében.
- Operatív adattároló: Az ODS egy közel valós idejű adattároló, amelyet operatív jelentéskészítéshez és napi tevékenységekhez használnak. Tranzakciós rendszerek és az EDW között helyezkedik el, több forrásból származó adatokat kombinál egy áramvonalasabb, de nem teljesen történeti formában. Akkor hasznos, ha gyakran frissíteni kell az adatokat a gyors operatív döntések érdekében.
- Adatpiac: Az adatpiac egy kisebb, tárgyspecifikus adattárház szelet, amelyet egy adott csapatnak vagy üzleti egységnek terveztek, mint például pénzügy, értékesítés vagy marketing. Gyors hozzáférést biztosít azokhoz az adatokhoz, amelyek a legnagyobb jelentőséggel bírnak az adott csoport számára anélkül, hogy a teljes raktárat elérhetővé tennék.
- Központi adatbázis: Az elsődleges tárolóréteg, ahol strukturált, megtisztított és integrált adatok találhatók. Ez általában egy relációs, oszlop- vagy felhőnatív adatbázis, amely elemzésekre optimalizált.
- Adatintegrációs / beviteli eszközök: olyan eszközök és folyamatok – mint például az ETL (kinyerés, átalakítás, betöltés), ELT (kinyerés, betöltés, átalakítás), kötegelt betöltések és valós idejű replikáció –, amelyek adatokat hoznak a forrásrendszerekből a raktárba, és előkészítik azokat használatra.
- Metaadatok: Az adatokat leíró információ: honnan származik, hogyan épül fel, mit jelent, és hogyan kell használni. A metaadatok segítenek a felhasználóknak az adatok megértésében és megbízhatóságában.
- Hozzáférési eszközök: azok az alkalmazások és interfészek, amelyekkel a felhasználók lekérdezhetik, vizualizálhatják, felfedezhetik és elemezhetik az adatokat, például jelentéskészítő eszközök, irányítópultok, elemzési platformok és SQL-lekérdezési eszközök.
SAP-termék
SAP Business Data Cloud
Növelje a mesterséges intelligencia értékét a legjelentősebb adataival.