Инициативы бизнес-аналитики часто получают существенные инвестиции в инструменты визуализации и панели мониторинга, в то время как лежащая в основе работа по качеству данных — дедупликация, валидация, согласованное форматирование и сверка между исходными системами — получает сравнительно мало внимания, несмотря на то, что именно она реально определяет, можно ли доверять итоговым отчётам.
Качество как свойство конвейера, а не проект разовой очистки
Отношение к качеству данных как к разовому проекту очистки, а не непрерывному свойству конвейера, гарантирует возврат проблемы, поскольку новые данные продолжают поступать по тем же непроверенным путям, которые создали исходный беспорядок. Автоматизированные проверки качества данных, встроенные непосредственно в конвейеры загрузки — валидация схемы, проверки диапазона, обнаружение дубликатов — выявляют проблемы у источника.
Проблемы качества данных проявляются быстрее всего, когда бизнес-пользователи теряют доверие к отчёту и тихо создают собственное обходное решение в электронной таблице.
JIG помогает организациям встраивать практики качества данных в свои конвейеры с самого начала.
