Проблема консолидации данных встает почти перед всеми крупными компаниями. В этом видео мы рассмотрим по шагам, как решить эту задачу без написания скриптов и программирования.
В крупных организациях обычно существует несколько прикладных систем, автоматизирующих различные бизнес-процессы. В каждой системе накапливается информация из определенных источников. Эта информация описывает одни и те же объекты – например, контрагентов или активы – с точки зрения разных бизнес-процессов. В результате сведения о каждом объекте, например контрагенте, в разных системах могут отличаться. Не существует "единой версии правды", нельзя определить, где информация более актуальна. Ценой этого является отсутствие возможности строить аналитику и принимать рациональные решения, основанные на данных.
Мы предлагаем комплексное решение проблемы консолидации и очистки данных на основе нашего продукта DataVera EKG Platform. Результатом ее внедрения будет объединение всей важной информации в единый корпоративный граф знаний. Структура информации в нем описывается моделью, в которую входят определения типов сущностей, их свойств и связей между ними. Такую модель легко изменять по мере изменения требований бизнеса.
Сначала нужно наладить механизм импорта данных из каждого источника в нашу платформу. Для этого необходимо описать правила соответствия между элементами структуры данных источников и элементами корпоративной модели. Правила бывают трех основных видов:
Возможны и более сложные варианты сопоставления, в том числе с преобразованием значений свойств.
Управлять правилами можно через интерфейс DataVera EKG Explorer. Здесь аналитик может просмотреть набор существующих правил, увидеть содержание каждого правила, изменить их или добавить новые. Управлять правилами можно в визуальном режиме, с помощью редактора мэппинга.
Когда все источники подключены к платформе и правила импорта данных настроены, можно запустить процедуру их загрузки. Информационные объекты из каждой системы-источника загружаются в специальные подклассы модели корпоративного графа. На этом этапе в графе создается отдельное отражение каждого объекта из каждого источника.
Затем запускаются правила консолидации объектов данных. Эти правила строятся в соответствии со спецификацией SHACL, их формулирует аналитик на уровне платформы. Важно, что правила консолидации, также как и правила сопоставления, сами являются элементами корпоративного графа знаний. Ими можно управлять через интерфейс приложения, как и любой другой информацией в платформе.
В некоторых случаях нужно применять правила нечеткого поиска дубликатов. Это позволяет найти даже те дубликаты, значения ключевых свойств которых отличаются написанием или допущенными опечатками.
К каждому объекту данных применяются правила форматно-логического контроля и контроля целостности. Эти правила тоже являются элементами модели. Если какие-либо свойства определенных объектов нарушают заданные правила, система формирует специальные объекты, описывающие нарушения.
Затем наступает этап формирования эталонных объектов данных. Из каждой группы дубликатов платформа создает один эталонный объект. Нужно определить, каким образом система будет выбирать одно из множества значений для каждого свойства эталонного объекта.
Значения свойств, нарушающих блокирующие правила валидации, игнорируются при консолидации.
При консолидации сохраняются сведения о происхождении всех элементов эталонных данных – информация о том, когда, из какого источника и на основе какого правила было получено то или иное значение свойства. Это позволяет определять степень доверия к эталонным данным.
Полученный набор эталонных данных можно просмотреть в интерфейсе DataVera EKG Explorer, а также получить через программный интерфейс – API. Доступна также вся информация о выявленных нарушениях и о том, как сформированы свойства эталонных объектов.
Консолидация данных – не разовый процесс, она выполняется непрерывно, по мере обновления информации в системах-источниках. При этом формируется и история значений свойств эталонных объектов. Результатом консолидации является создание единого, полного, достоверного и актуального массива данных, пригодного для поддержки принятия решений и использования в бизнес-процессах.