Что такое хранилище данных?
Хранилище данных (DW) — это цифровая система хранения, которая соединяет и гармонизирует большие объемы данных из разных источников.
default
{}
default
{}
primary
default
{}
secondary
Обзор хранилища данных
Хранилище данных (DW) — это централизованный репозитарий, который собирает, интегрирует и хранит большие объемы текущих и исторических данных из нескольких источников. Она поддерживает бизнес-аналитику (BI), отчетность и расширенную аналитику, предоставляя единый непротиворечивый источник достоверной информации. Консолидация и стандартизация данных позволяет организациям получать надежную аналитическую информацию, выполнять нормативные требования и принимать информированные решения на основе данных.
Обычно данные поступают в хранилище данных из операционных систем (таких как ERP и CRM), внутренних баз данных и внешних источников, таких как партнерские платформы, устройства Интернета вещей, метеоканалы и социальные сети. По мере развития облачных вычислений хранилище данных перешло от традиционных локальных сред к гибкой мультиоблачной и гибридной облачным архитектурам.
Современные хранилища данных предназначены для управления структурированными и неструктурированными данными, такими как видео, изображения и потоки датчиков. Многие из них используют интегрированную аналитику и обработку в оперативной памяти, что обеспечивает более быстрые запросы, доступ к данным в реальном времени и более эффективные потоки операций отчетности и бизнес-аналитики. Без хранилища данных организации сталкиваются с трудностями при объединении гетерогенных источников данных, надлежащей подготовке данных для аналитики и обеспечении прозрачности наборов данных.
Рисунок 1. Обзор хранилища данных
Преимущества хранилищ данных
Хорошо разработанное хранилище данных является основой успешной бизнес-аналитики, отчетности и аналитики. Консолидация данных в единый источник достоверной информации ускоряет получение ценной информации для принятия более взвешенных и взвешенных решений в масштабе всей компании. Основные преимущества:
- Улучшенная бизнес-аналитика. Хранилище данных объединяет данные из нескольких систем в единое, непротиворечивое представление о бизнесе, что позволяет руководителям быстрее анализировать тенденции и принимать более взвешенные решения на основе данных.
- Более быстрые запросы и аналитика. Поскольку хранилища данных оптимизированы для аналитики, а не для транзакций, пользователи могут выполнять сложные запросы по большим наборам данных гораздо быстрее, что ускоряет циклы отчетности и снижает зависимость от ИТ.
- Повышение качества и непротиворечивости данных. Перед поступлением в хранилище данные очищаются, проверяются и стандартизируются, что гарантирует, что аналитика основана на высококачественной и надежной информации. Повышение качества данных позволяет принимать более взвешенные решения.
- Более глубокое представление об истории. Хранилище данных сохраняет большие объемы исторических данных, что упрощает выявление долгосрочных закономерностей, оценку производительности и создание более точных прогнозов, укрепляющих стратегическое планирование.
Рисунок 2. Снимок экрана хранилища данных, демонстрирующий происхождение данных
Какие типы данных могут храниться в хранилище данных?
Когда хранилища данных впервые появились в конце 1980-х годов, они были созданы для хранения структурированных данных — хорошо организованной информации, такой как сведения о клиентах, списки продуктов и записи о транзакциях. По мере расширения бизнес-потребностей компании также хотели работать с неструктурированными данными, такими как документы, изображения, видеоролики, сообщения электронной почты, публикации в социальных сетях, а также вывод данных с датчиков с машин и устройств Интернета вещей.
Современные хранилища данных могут обрабатывать как структурированные, так и неструктурированные данные, объединяя их, чтобы предоставить компаниям более полное и интегрированное представление для более глубокого анализа.
Ключевые концепции и сравнения
В мире хранилищ данных есть чему поучиться. Вот некоторые из наиболее важных концепций. Дополнительные определения и часто задаваемые вопросы см. в нашем глоссарии.
Хранилище данных и база данных
Базы данных и хранилища данных хранят данные, но служат разным ролям. База данных управляет информацией в реальном времени для определенной бизнес-сферы, в то время как хранилище данных объединяет текущие и исторические данные по всей организации для поддержки отчетности и аналитики. Несмотря на то, что хранилище данных использует технологию базы данных, оно предоставляет инструменты для интеграции, моделирования и управления данными с течением времени.
Базы данных обеспечивают выполнение ежедневных операций за счет быстрой обработки транзакций и обновления записей. Хранилища данных поддерживают аналитику, помогая командам выявлять тенденции, сравнивать эффективность и принимать стратегические решения.
Хранилище данных и озеро данных
Хранилища и озера данных хранят большие объемы данных, но имеют разные цели. Хранилище данных содержит структурированные, подготовленные данные для отчетности и аналитики, в то время как озеро данных хранит необработанные, необработанные данные, которые можно использовать в дальнейшем. Они часто работают вместе: необработанные данные хранятся в озере, преобразуются и перемещаются в хранилище, когда это необходимо для анализа.
Используйте озеро данных для гибкого и экономичного хранения необработанных данных. Используйте хранилище данных для быстрой и надежной аналитики структурированных данных. Большинство организаций выигрывает от обоих. Озеро фиксирует все, и склад превращает его в ценную информацию.
Рисунок 3. Сравнение хранилища данных и озера данных
Хранилище данных и витрина данных
Информационная витрина — это подраздел хранилища данных, разделенный специально для отдела или направления бизнеса, таких как продажи, маркетинг или финансы. Например, информационная витрина продаж может сфокусироваться на потенциальных клиентах, активности пайплайна и сделках с закрытыми выигранными сделками, в то время как финансовая витрина данных будет фокусироваться на бюджетах, прогнозах и метриках выручки.
Некоторые инфо-витрины также создаются для автономных операционных целей. В то время как хранилище данных служит центральным хранилищем данных для всей компании, инфо-витрина служит релевантной информацией для выбранной группы пользователей. Это упрощает доступ к данным, ускоряет анализ и обеспечивает контроль над собственными данными. В хранилище данных часто развертывается несколько инфо-витрин.
Рис. 4. Диаграмма, показывающая, как работает инфо-витрина
Ключевые компоненты хранилища данных
Современное хранилище данных включает четыре ключевых компонента: централизованную базу данных, инструменты интеграции и приема данных, метаданные и инструменты доступа. Вместе они обеспечивают быструю и надежную аналитику в нужном масштабе.
Рис. 5. Диаграмма, показывающая компоненты хранилища данных
- Центральная база данных: ядро хранилища для хранилища, обычно реляционная база данных, но все чаще система in-memory или облачная система для повышения производительности.
- Интеграция и прием данных. Данные переносятся из исходных систем с помощью пакетных методов, таких как ETL и ELT, а также опций в реальном времени, таких как тиражирование и стриминговые пайплайны сбора данных изменений. Эти процессы также обрабатывают трансформацию, проверки качества и пополнение.
- Метаданные: информация, описывающая данные (их происхождение, структуру, значение и способ их использования), охватывающую как бизнес-контекст, так и технический контекст.
- Инструменты доступа: инструменты, позволяющие пользователям запрашивать, анализировать данные склада и взаимодействовать с ними, включая инструменты отчетности, инструментальные панели, аналитические платформы и инструменты разработки приложений.
Архитектура хранилища данных
Исторически хранилища данных были организованы в уровни, соответствующие перемещению данных в системе. Типичное хранилище данных состоит из трех уровней. Современные платформы упрощают архитектуру для ускорения перемещения данных и аналитики.
Рис. 6. Схема архитектуры хранилища данных
- Уровень данных: данные извлекаются из исходных систем, затем преобразуются и загружаются в хранилище с помощью метода приема, такого как ETL. Этот уровень включает базовую базу данных, инфо-витрины и озера данных, а также метаданные и инструменты интеграции, которые стандартизируют и подготавливают данные.
- Семантический уровень: этот уровень организует и моделирует данные, что упрощает запросы и анализ, предлагая курируемые ракурсы и бизнес-определения, поддерживающие быструю и непротиворечивую аналитику.
- Аналитический уровень: верхний уровень предоставляет инструменты, с которыми пользователи взаимодействуют: инструментальные панели, отчеты, мониторинг KPI, расширенный анализ и тестовые пространства для изучения данных и построения новых моделей.
Хранилища данных традиционно строились и управлялись ИТ-командами, но современные платформы все чаще позволяют бизнес-пользователям напрямую работать с данными. Основные возможности, лежащие в основе этой смены:
- Удобный для бизнеса семантический уровень, который использует естественный язык, уточняет отношения и позволяет пользователям пополнять данные новым контекстом.
- Виртуальные рабочие области, которые переносят модели данных, логику и сотрудничество в единую управляемую среду.
- Облачные инструменты, которые упрощают для сотрудников подключение новых источников данных, выполнение анализа и создание аналитических данных с гораздо меньшей зависимостью от ИТ.
Как работает хранилище данных?
Хранилище данных организует информацию по всей компании, чтобы ее можно было легко исследовать, доверять и анализировать. Как правило, процесс состоит из четырех простых шагов:
- Извлечение: данные извлекаются из исходных систем, таких как приложения, базы данных и облачные сервисы. На этом этапе данные собираются без изменений.
- Преобразование: данные очищены, стандартизированы и сформированы, поэтому они непротиворечивы и готовы к использованию. Это может включать удаление ошибок, согласование форматов или применение бизнес-правил.
- Загрузка: подготовленные данные хранятся в хранилище в структурированном формате, оптимизированном для быстрой отчетности и аналитики.
- Анализ: после загрузки данных группы могут изучать их с помощью инструментальных панелей, отчетов и расширенной аналитики для принятия обоснованных решений.
Сравнение ETL и ELT: в чем разница?
ETL (Extract → Transform → Load): данные преобразуются до поступления в хранилище. Этот подход является общим для традиционных хранилищ данных с ограниченными возможностями обработки.
ELT (Extract → Load → Transform): сначала необработанные данные загружаются в хранилище и преобразуются внутри склада. Современные облачные платформы предпочитают этот метод, потому что они могут эффективно обрабатывать масштабные трансформации.
Каковы четыре ключевых признака хранилища данных?
Хранилище данных основано на нескольких основных принципах, которые обеспечивают предоставление надежной, непротиворечивой и анализируемой информации в масштабе всей компании. Четыре ключевых признака:
- Субъект-ориентированный: организован вокруг основных бизнес-тем, таких как клиенты или продажи, для поддержки анализа.
- Интеграция: данные из различных систем, таких как ERP и CRM, очищены и стандартизированы, поэтому они согласованно совпадают.
- Вариант времени: сохраняет исторические данные за длительные периоды, обеспечивая анализ тенденций и производительности.
- Неизменность: данные стабильны после загрузки и считывания, но не обновляются и не удаляются, обеспечивая надежный источник достоверной информации.
Преимущества облачного хранилища данных
Облачные хранилища данных становятся все более популярными, поскольку имеют значительные преимущества по сравнению с традиционными локальными системами. Вот семь основных преимуществ переноса хранилища данных в облако:
- Быстрое развертывание: вращение памяти, вычислений и новых сред, таких как витрины данных или песочницы, за считанные минуты из любой точки мира.
- Снижение совокупной стоимости владения: оплата только за используемые ресурсы. Избегайте затрат на оборудование, оборудование и обслуживание, а также сократите затраты за счет разделения хранения и вычислений.
- Эластичность: мгновенное масштабирование для обработки изменяющихся рабочих нагрузок и больших объемов данных без ручного труда.
- Безопасность и аварийное восстановление. Облачные платформы часто обеспечивают более надежные средства контроля безопасности, шифрование и автоматическое резервное копирование для защиты от потери данных.
- Производительность в реальном времени. Встроенные в оперативной памяти и облачные механизмы обеспечивают быструю обработку данных в реальном времени.
- Доступ к новым технологиям: простая интеграция таких функций, как машинное обучение, автоматическая аналитика и расширенная аналитика.
- Расширение возможностей бизнес-пользователей. Предоставление командам единого представления данных и интуитивно понятных инструментов для анализа информации и подключения новых источников без привлечения ИТ-специалистов.
Рис. 7. Хранилище данных поддерживает комплексный анализ расходов
Передовые практики хранилища данных
При создании нового или расширении существующего хранилища данных применение проверенных практик поможет вам достичь поставленных целей, экономя время и затраты. Некоторые практики ориентированы на бизнес-потребности, в то время как другие относятся к более широкому руководству ИТ. Приведенный ниже список является надежной отправной точкой, и вы будете уточнять его по мере работы с партнерами по технологиям и услугам.
Передовой опыт для бизнеса
- Определите необходимую информацию. Начните с определения вопросов, на которые вы хотите ответить, и решений, которые вы хотите поддержать. Затем определите, какие источники данных требуются. Отраслевые группы, клиенты и поставщики также могут предлагать рекомендации по полезным данным.
- Документирование состояния текущих данных. Регистрируйте, где находятся ваши данные, как они структурированы, как они структурированы, и их качество для выявления расхождений, необходимых преобразований и бизнес-правил, на которые будет опираться хранилище.
- Создайте правильную команду. Включите исполнительных спонсоров, менеджеров бизнеса и конечных пользователей, которые будут полагаться на эту информацию. Изучите стандартные отчеты, KPI и метрики, необходимые для успеха.
- Определите приоритеты первых проектов. Начните с одного-двух пилотных программ, которые предлагают четкую бизнес-ценность и управляемый объем. Ранние победы помогают наращивать обороты.
- Выберите надежного партнера по технологиям. Выберите поставщика с проверенным опытом, поддержкой внедрения и платформой, соответствующей потребностям вашего развертывания.
- Создайте реалистичный план проекта. Сотрудничайте со своей командой, формируя четкую маршрутную карту и график. Регулярная коммуникация и обновление статуса обеспечивают согласованность действий всех сотрудников.
Лучшие ИТ-практики
- Мониторинг производительности, доступа и безопасности. Склад должен быть как быстрым, так и защищенным. Отслеживание использования системы, событий безопасности и шаблонов доступа для обеспечения безопасности данных и упрощения доступа авторизованных пользователей.
- Поддерживайте качество данных, метаданные, структуру и управление. Новые данные, поступающие на склад, должны соответствовать непротиворечивым правилам. Стандартизируйте очистку, преобразование, определения метаданных и управление данными, чтобы пользователи могли доверять результатам.
- Обеспечьте гибкую архитектуру. По мере роста бизнеса командам потребуются новые инфо-витрины, модели и рабочая нагрузка. Масштабируемая модульная архитектура поддерживает эти потребности лучше, чем жесткие или тесно связанные системы.
- Автоматизация технического обслуживания и эксплуатации. Используйте автоматизацию и машинное обучение для оптимизации таких задач, как индексация, мониторинг, оптимизация и обновления. Это повышает производительность и сокращает эксплуатационные затраты.
- Стратегически используйте облако. Разные группы имеют разные требования. При необходимости поддерживайте определенную рабочую нагрузку локально, используя облачные хранилища данных для масштабируемости, снижения затрат и упрощения доступа с устройств.
Заключение
Современные хранилища данных, особенно облачные, играют центральную роль в цифровой трансформации, объединяя данные из внутренних и внешних источников для получения полного и своевременного представления о бизнесе. Они предоставляют информационные панели, KPI, предупреждения и отчеты в масштабе всей организации и поддерживают быструю и сложную аналитику без влияния на операционные системы.
Поскольку они могут легко начать работу в небольших масштабах, они помогают как корпоративным командам, так и бизнес-подразделениям принимать более взвешенные решения и повышать производительность.
Часто задаваемые вопросы
- Хранилище данных предприятия. EDW — это центральное общекорпоративное хранилище данных, в котором хранятся все текущие и исторические данные в одном месте. Она предоставляет единый непротиворечивый источник достоверных данных для аналитики, отчетности и KPI по всей организации. Большинство современных EDW являются облачными для масштабируемости и упрощения доступа.
- Хранилище операционных данных. ODS — это хранилище данных почти в реальном времени, используемое для оперативной отчетности и повседневных операций. Он расположен между транзакционными системами и EDW, объединяя данные из нескольких источников в более актуальном, но не полностью историческом виде. Это удобно, когда необходимо часто обновлять данные для быстрого принятия операционных решений.
- Информационная витрина. Информационная витрина представляет собой небольшой, специфичный для субъекта срез хранилища данных, предназначенный для конкретной команды или бизнес-единицы, такой как финансы, продажи или маркетинг. Она обеспечивает быстрый доступ к наиболее важным для этой группы данным, не открывая хранилища в целом.
- Центральная база данных: основной уровень хранения структурированных, очищенных и интегрированных данных. Как правило, это реляционная, столбцовая или облачная база данных, оптимизированная для аналитики.
- Инструменты интеграции/приема данных: инструменты и процессы, такие как ETL (извлечение, преобразование, загрузка), ELT (извлечение, загрузка, преобразование), фоновая загрузка и репликация в реальном времени, которые переносят данные из исходных систем в хранилище и подготавливают их к использованию.
- Метаданные: информация, описывающая данные: откуда они взяты, как они структурированы, что это означает и как их следует использовать. Метаданные помогают пользователям понять данные и доверять им.
- Инструменты доступа: приложения и интерфейсы, позволяющие пользователям запрашивать, визуализировать, изучать и анализировать данные, такие как инструменты отчетности, инструментальные панели, аналитические платформы и инструменты SQL-запросов.
Продукт SAP
SAP Business Data Cloud
Раскройте потенциал ИИ с помощью ваших самых важных данных.