flex-height
text-black

Серверная комната в центре обработки данных

Что такое хранилище данных?

Хранилище данных (DW) — это цифровая система хранения, которая соединяет и гармонизирует большие объемы данных из разных источников.

default

{}

default

{}

primary

default

{}

secondary

Обзор хранилища данных

Хранилище данных (DW) — это централизованный репозитарий, который собирает, интегрирует и хранит большие объемы текущих и исторических данных из нескольких источников. Она поддерживает бизнес-аналитику (BI), отчетность и расширенную аналитику, предоставляя единый непротиворечивый источник достоверной информации. Консолидация и стандартизация данных позволяет организациям получать надежную аналитическую информацию, выполнять нормативные требования и принимать информированные решения на основе данных.

Обычно данные поступают в хранилище данных из операционных систем (таких как ERP и CRM), внутренних баз данных и внешних источников, таких как партнерские платформы, устройства Интернета вещей, метеоканалы и социальные сети. По мере развития облачных вычислений хранилище данных перешло от традиционных локальных сред к гибкой мультиоблачной и гибридной облачным архитектурам.

Современные хранилища данных предназначены для управления структурированными и неструктурированными данными, такими как видео, изображения и потоки датчиков. Многие из них используют интегрированную аналитику и обработку в оперативной памяти, что обеспечивает более быстрые запросы, доступ к данным в реальном времени и более эффективные потоки операций отчетности и бизнес-аналитики. Без хранилища данных организации сталкиваются с трудностями при объединении гетерогенных источников данных, надлежащей подготовке данных для аналитики и обеспечении прозрачности наборов данных.

Преимущества хранилищ данных

Хорошо разработанное хранилище данных является основой успешной бизнес-аналитики, отчетности и аналитики. Консолидация данных в единый источник достоверной информации ускоряет получение ценной информации для принятия более взвешенных и взвешенных решений в масштабе всей компании. Основные преимущества:

Какие типы данных могут храниться в хранилище данных?

Когда хранилища данных впервые появились в конце 1980-х годов, они были созданы для хранения структурированных данных — хорошо организованной информации, такой как сведения о клиентах, списки продуктов и записи о транзакциях. По мере расширения бизнес-потребностей компании также хотели работать с неструктурированными данными, такими как документы, изображения, видеоролики, сообщения электронной почты, публикации в социальных сетях, а также вывод данных с датчиков с машин и устройств Интернета вещей.

Современные хранилища данных могут обрабатывать как структурированные, так и неструктурированные данные, объединяя их, чтобы предоставить компаниям более полное и интегрированное представление для более глубокого анализа.

Ключевые концепции и сравнения

В мире хранилищ данных есть чему поучиться. Вот некоторые из наиболее важных концепций. Дополнительные определения и часто задаваемые вопросы см. в нашем глоссарии.

Хранилище данных и база данных

Базы данных и хранилища данных хранят данные, но служат разным ролям. База данных управляет информацией в реальном времени для определенной бизнес-сферы, в то время как хранилище данных объединяет текущие и исторические данные по всей организации для поддержки отчетности и аналитики. Несмотря на то, что хранилище данных использует технологию базы данных, оно предоставляет инструменты для интеграции, моделирования и управления данными с течением времени.

Базы данных обеспечивают выполнение ежедневных операций за счет быстрой обработки транзакций и обновления записей. Хранилища данных поддерживают аналитику, помогая командам выявлять тенденции, сравнивать эффективность и принимать стратегические решения.

Хранилище данных и озеро данных

Хранилища и озера данных хранят большие объемы данных, но имеют разные цели. Хранилище данных содержит структурированные, подготовленные данные для отчетности и аналитики, в то время как озеро данных хранит необработанные, необработанные данные, которые можно использовать в дальнейшем. Они часто работают вместе: необработанные данные хранятся в озере, преобразуются и перемещаются в хранилище, когда это необходимо для анализа.

Используйте озеро данных для гибкого и экономичного хранения необработанных данных. Используйте хранилище данных для быстрой и надежной аналитики структурированных данных. Большинство организаций выигрывает от обоих. Озеро фиксирует все, и склад превращает его в ценную информацию.

Хранилище данных и витрина данных

Информационная витрина — это подраздел хранилища данных, разделенный специально для отдела или направления бизнеса, таких как продажи, маркетинг или финансы. Например, информационная витрина продаж может сфокусироваться на потенциальных клиентах, активности пайплайна и сделках с закрытыми выигранными сделками, в то время как финансовая витрина данных будет фокусироваться на бюджетах, прогнозах и метриках выручки.

Некоторые инфо-витрины также создаются для автономных операционных целей. В то время как хранилище данных служит центральным хранилищем данных для всей компании, инфо-витрина служит релевантной информацией для выбранной группы пользователей. Это упрощает доступ к данным, ускоряет анализ и обеспечивает контроль над собственными данными. В хранилище данных часто развертывается несколько инфо-витрин.

Ключевые компоненты хранилища данных

Современное хранилище данных включает четыре ключевых компонента: централизованную базу данных, инструменты интеграции и приема данных, метаданные и инструменты доступа. Вместе они обеспечивают быструю и надежную аналитику в нужном масштабе.

  1. Центральная база данных: ядро хранилища для хранилища, обычно реляционная база данных, но все чаще система in-memory или облачная система для повышения производительности.
  2. Интеграция и прием данных. Данные переносятся из исходных систем с помощью пакетных методов, таких как ETL и ELT, а также опций в реальном времени, таких как тиражирование и стриминговые пайплайны сбора данных изменений. Эти процессы также обрабатывают трансформацию, проверки качества и пополнение.
  3. Метаданные: информация, описывающая данные (их происхождение, структуру, значение и способ их использования), охватывающую как бизнес-контекст, так и технический контекст.
  4. Инструменты доступа: инструменты, позволяющие пользователям запрашивать, анализировать данные склада и взаимодействовать с ними, включая инструменты отчетности, инструментальные панели, аналитические платформы и инструменты разработки приложений.

Архитектура хранилища данных

Исторически хранилища данных были организованы в уровни, соответствующие перемещению данных в системе. Типичное хранилище данных состоит из трех уровней. Современные платформы упрощают архитектуру для ускорения перемещения данных и аналитики.

Хранилища данных традиционно строились и управлялись ИТ-командами, но современные платформы все чаще позволяют бизнес-пользователям напрямую работать с данными. Основные возможности, лежащие в основе этой смены:

Как работает хранилище данных?

Хранилище данных организует информацию по всей компании, чтобы ее можно было легко исследовать, доверять и анализировать. Как правило, процесс состоит из четырех простых шагов:

  1. Извлечение: данные извлекаются из исходных систем, таких как приложения, базы данных и облачные сервисы. На этом этапе данные собираются без изменений.
  2. Преобразование: данные очищены, стандартизированы и сформированы, поэтому они непротиворечивы и готовы к использованию. Это может включать удаление ошибок, согласование форматов или применение бизнес-правил.
  3. Загрузка: подготовленные данные хранятся в хранилище в структурированном формате, оптимизированном для быстрой отчетности и аналитики.
  4. Анализ: после загрузки данных группы могут изучать их с помощью инструментальных панелей, отчетов и расширенной аналитики для принятия обоснованных решений.

Сравнение ETL и ELT: в чем разница?

ETL (Extract → Transform → Load): данные преобразуются до поступления в хранилище. Этот подход является общим для традиционных хранилищ данных с ограниченными возможностями обработки.

ELT (Extract → Load → Transform): сначала необработанные данные загружаются в хранилище и преобразуются внутри склада. Современные облачные платформы предпочитают этот метод, потому что они могут эффективно обрабатывать масштабные трансформации.

Каковы четыре ключевых признака хранилища данных?

Хранилище данных основано на нескольких основных принципах, которые обеспечивают предоставление надежной, непротиворечивой и анализируемой информации в масштабе всей компании. Четыре ключевых признака:

  1. Субъект-ориентированный: организован вокруг основных бизнес-тем, таких как клиенты или продажи, для поддержки анализа.
  2. Интеграция: данные из различных систем, таких как ERP и CRM, очищены и стандартизированы, поэтому они согласованно совпадают.
  3. Вариант времени: сохраняет исторические данные за длительные периоды, обеспечивая анализ тенденций и производительности.
  4. Неизменность: данные стабильны после загрузки и считывания, но не обновляются и не удаляются, обеспечивая надежный источник достоверной информации.

Преимущества облачного хранилища данных

Облачные хранилища данных становятся все более популярными, поскольку имеют значительные преимущества по сравнению с традиционными локальными системами. Вот семь основных преимуществ переноса хранилища данных в облако:

  1. Быстрое развертывание: вращение памяти, вычислений и новых сред, таких как витрины данных или песочницы, за считанные минуты из любой точки мира.
  2. Снижение совокупной стоимости владения: оплата только за используемые ресурсы. Избегайте затрат на оборудование, оборудование и обслуживание, а также сократите затраты за счет разделения хранения и вычислений.
  3. Эластичность: мгновенное масштабирование для обработки изменяющихся рабочих нагрузок и больших объемов данных без ручного труда.
  4. Безопасность и аварийное восстановление. Облачные платформы часто обеспечивают более надежные средства контроля безопасности, шифрование и автоматическое резервное копирование для защиты от потери данных.
  5. Производительность в реальном времени. Встроенные в оперативной памяти и облачные механизмы обеспечивают быструю обработку данных в реальном времени.
  6. Доступ к новым технологиям: простая интеграция таких функций, как машинное обучение, автоматическая аналитика и расширенная аналитика.
  7. Расширение возможностей бизнес-пользователей. Предоставление командам единого представления данных и интуитивно понятных инструментов для анализа информации и подключения новых источников без привлечения ИТ-специалистов.

Передовые практики хранилища данных

При создании нового или расширении существующего хранилища данных применение проверенных практик поможет вам достичь поставленных целей, экономя время и затраты. Некоторые практики ориентированы на бизнес-потребности, в то время как другие относятся к более широкому руководству ИТ. Приведенный ниже список является надежной отправной точкой, и вы будете уточнять его по мере работы с партнерами по технологиям и услугам.

Передовой опыт для бизнеса

Лучшие ИТ-практики

Заключение

Современные хранилища данных, особенно облачные, играют центральную роль в цифровой трансформации, объединяя данные из внутренних и внешних источников для получения полного и своевременного представления о бизнесе. Они предоставляют информационные панели, KPI, предупреждения и отчеты в масштабе всей организации и поддерживают быструю и сложную аналитику без влияния на операционные системы.

Поскольку они могут легко начать работу в небольших масштабах, они помогают как корпоративным командам, так и бизнес-подразделениям принимать более взвешенные решения и повышать производительность.

Часто задаваемые вопросы

Что такое озеро данных?
Озеро данных — это место для хранения всех видов больших данных, будь то структурированные данные из бизнес-приложений или неструктурированные данные из мобильных приложений, социальных сетей или устройств Интернета вещей (IoT). Поскольку данные хранятся в естественном формате — структурированном, неструктурированном, полуструктурированном или двоичном — преобразование, может потребоваться нормализация или другая обработка для обеспечения аналитики по нескольким типам данных. Большинство озер данных являются облачными из-за больших объемов данных, которые они хранят, потребности в высокоскоростных соединениях с распределенными источниками и необходимости масштабируемости. Возможность хранить огромные объемы необработанных данных делает их гибким и экономичным дополнением к хранилищу данных.
Что такое ETL и ELT?
ETL означает "извлечение, преобразование и загрузка". Под ним понимается процесс извлечения данных из исходной системы, их очистки и формирования в удобном для использования формате, а затем их загрузки в хранилище данных или другое хранилище данных. Многие современные системы также используют ELT — извлечение, загрузку и преобразование — там, где данные загружаются в первую очередь и преобразуются после этого. Оба подхода помогают превратить необработанные данные в то, что можно анализировать, будь то из транзакционных систем или более сложных, неструктурированных источников.
Что такое инфо-витрина?
Информационная витрина — это сфокусированный срез хранилища данных, предназначенный для определенной бизнес-сферы или команды, такой как финансы или маркетинг. Он предоставляет группе быстрый доступ к данным, наиболее релевантным для его работы, и позволяет управлять собственным контролируемым набором данных в более крупном хранилище. Например, информационная витрина финансовых данных может включать бюджеты, прогнозы и данные о выручке, адаптированные к потребностям финансового отдела в отчетности.
Что такое моделирование данных?
Моделирование данных — это процесс определения организации и соединения данных для их эффективного хранения и использования. Модель данных показывает, что представляют данные и как различные элементы связаны друг с другом, создавая концептуальный проект для непротиворечивой структуры во всех системах. Например, модель данных продаж может показать, как связываются клиенты, заказы и продукты для поддержки отчетности и анализа.
Что такое корпоративное хранилище данных (EDW)?
Хранилище данных предприятия (EDW) — это централизованная система, в которой хранятся все текущие и исторические данные компании в одном месте. Он предоставляет единый непротиворечивый источник информации для аналитики, отчетности и общекорпоративных KPI. Многие EDW работают в облаке для упрощения доступа, масштабируемости и управления.
Какие три типа хранилищ данных существуют?
  1. Хранилище данных предприятия. EDW — это центральное общекорпоративное хранилище данных, в котором хранятся все текущие и исторические данные в одном месте. Она предоставляет единый непротиворечивый источник достоверных данных для аналитики, отчетности и KPI по всей организации. Большинство современных EDW являются облачными для масштабируемости и упрощения доступа.
  2. Хранилище операционных данных. ODS — это хранилище данных почти в реальном времени, используемое для оперативной отчетности и повседневных операций. Он расположен между транзакционными системами и EDW, объединяя данные из нескольких источников в более актуальном, но не полностью историческом виде. Это удобно, когда необходимо часто обновлять данные для быстрого принятия операционных решений.
  3. Информационная витрина. Информационная витрина представляет собой небольшой, специфичный для субъекта срез хранилища данных, предназначенный для конкретной команды или бизнес-единицы, такой как финансы, продажи или маркетинг. Она обеспечивает быстрый доступ к наиболее важным для этой группы данным, не открывая хранилища в целом.
Назовите четыре компонента хранилища данных.
  1. Центральная база данных: основной уровень хранения структурированных, очищенных и интегрированных данных. Как правило, это реляционная, столбцовая или облачная база данных, оптимизированная для аналитики.
  2. Инструменты интеграции/приема данных: инструменты и процессы, такие как ETL (извлечение, преобразование, загрузка), ELT (извлечение, загрузка, преобразование), фоновая загрузка и репликация в реальном времени, которые переносят данные из исходных систем в хранилище и подготавливают их к использованию.
  3. Метаданные: информация, описывающая данные: откуда они взяты, как они структурированы, что это означает и как их следует использовать. Метаданные помогают пользователям понять данные и доверять им.
  4. Инструменты доступа: приложения и интерфейсы, позволяющие пользователям запрашивать, визуализировать, изучать и анализировать данные, такие как инструменты отчетности, инструментальные панели, аналитические платформы и инструменты SQL-запросов.
SQL является хранилищем данных?
Номер SQL — это язык, используемый для запросов и управления данными, в то время как хранилище данных — это система, в которой хранятся, организуются и обрабатываются большие объемы данных для анализа. SQL — это просто один из основных инструментов, используемых для работы с данными в хранилище данных.