Data Quality Agent: Сценарії використання та доменні стандарти
Корпоративні архітектури даних вимагають надійних фреймворків валідації для забезпечення того, щоб аналітичні звіти, моделі машинного навчання та керівні дашборди працювали на основі точних та надійних даних. Data Quality Agent забезпечує довіру до даних шляхом узгодження правил валідації із сімома критичними вимірами якості даних та підтримки провідних корпоративних фреймворків валідації.

Підтримувані виміри якості даних
Data Quality Agent структурує кожну перевірку валідації навколо семи основних стовпів якості даних. Ці виміри гарантують, що ваші дані є структурно надійними, логічно правильними та достовірними:
1. INTEGRITY (Цілісність)
Правила цілісності гарантують, що зв'язки між таблицями залишаються недоторканими, а схеми відповідають структурним обмеженням.
- Referential Integrity: Перевіряє, що зовнішні ключі (такі як
customer_idабоproduct_id) існують у своїх відповідних батьківських таблицях вимірів. - Structural Consistency: Забезпечує дотримання визначень схем, обмежень довжини символів та відповідність типів даних у таблицях баз даних.
- Key Preservation: Підтверджує, що первинні ключі не перевизначаються та не стають осиротілими під час складних операцій об'єднання (merge).
2. TIMELINESS (Своєчасність)
Правила своєчасності моніторять операційну затримку вашіх конвеєрів, гарантуючи доступність даних у межах узгоджених угод про рівень обслуговування (SLA).
- Data Refresh Windows: Перевіряє, що пакетні файли або потокові записи надходять у межах вказаних інтервалів (наприклад, щоденний імпорт завершується до 06:00 AM UTC).
- Processing Latency: Відстежує тривалість між часовою міткою події запису (час створення) та часовою міткою його опрацювання.
- SLA Violations: Позначає затримки або відсутні оновлення в системах джерел для запобігання відображенню застарілих даних у дашбордах нижчого рівня.
3. COMPLETENESS (Повнота)
Правила повноти перевіряють, що набори даних не містять несподіваних відсутніх записів або порожніх значень (null).
- Nullability Verification: Забезпечує, що критичні стовпчики (такі як
transaction_id,user_idабоamount) ніколи не містять значень null. - Row Volume Monitoring: Оцінює, чи потрапляє кількість рядків, оброблених за прогон, у середняки історичні значення, позначаючи раптові падіння обсягів.
- Blank Value Checking: Ідентифікує поля, які технічно заповнені, але містять порожні рядки або пробіли.
4. ACCURACY (Точність)
Правила точності гарантують, що значення відповідають реальним бізнес-реаліям та логічним межам.
- Numeric Boundary Enforcement: Перевіряє, що числові стовпчики потрапляють у прийнятні логічні діапазони (наприклад,
transaction_amountмає бути більшим за нуль, аdiscount_percentне може перевищувати 100%). - Logic Checks: Зіставляє поля для забезпечення математичної правдивості (наприклад,
net_amountмає дорівнюватиgross_amountмінусtax_amount). - Statistical Outliers: Точно визначає записи зі значеннями, які значно відхиляються від стандартних відхилень, ідентифікуючи потенційні помилки введення.
5. CONSISTENCY (Узгодженість)
Правила узгодженості гарантують, що дані є однорідними в різних системах, таблицях та часових періодах.
- Cross-System Sync: Підтверджує, що загальні метрики продажів у цільовому сховищі відповідають необробленим транзакційним підрахункам із CRM-бази джерела.
- Internal Logic Consistency: Перевіряє, що якщо клієнт позначений як "Inactive", його
active_subscription_countмає дорівнювати нулю. - Format Standardization: Забезпечує, що перелічення (enums) та кодові значення (такі як коди країн або прапори статусів) відповідають зумовленим основним спискам (master lists).
6. UNIQUENESS (Унікальність)
Правила унікальності запобігають пошкодженню аналітичної звітності дубльованими записами та виникненню помилок подвійного підрахунку.
- Primary Key Integrity: Гарантує, що стовпчики первинних ключів, які містять ідентифікаційні значення (такі як
customer_idабоtransaction_id), містять нуль дубльованих значень. - Composite Key Validation: Забезпечує унікальність для комбінацій стовпчиків, які разом формують унікальний ідентифікатор (наприклад,
store_idу поєднанні зbusiness_date). - Deduplication Check: Позначає ідентичні рядки, які були зчитані кілька разів через повторні спроби у конвеєрах вищого рівня.
7. VALIDITY (Дійсність)
Правила дійсності підтверджують, що текстові шаблони та значення відповідають стандартним бізнес-форматам.
- Regular Expression Matching: Перевіряє правила форматування для структурованих рядків, включаючи адреси електронної пошти, номери телефонів, поштові індекси та номери кредитних карток.
- Date Format Verification: Підтверджує, що дати у вигляді рядків дотримуються стандартних форматів ISO 8601 (
YYYY-MM-DD). - List and Domain Validation: Гарантує, що значення стовпчиків належать до статичного набору дозволених значень (наприклад,
statusмає бути одним із 'PENDING', 'APPROVED' або 'REJECTED').
Основні корпоративні сценарії використання
Data Quality Agent вирішує критичні операційні, аналітичні та контрольні виклики шляхом застосування цих семи вимірів валідації.
1. Контроль на вході в конвеєри (Ingestion Pipeline Gatekeeping)
Запобігає пошкодженню аналітичних таблиць пошкодженими або неповними даними.
- Active Validation Gates: Вбудовуйте згенеровані агентом SQL-твердження або код Great Expectations безпосередньо після кроків первинного опрацювання.
- Pipeline Isolation: Якщо валідація зазнає невдачі за критичними вимірами, такими як UNIQUENESS або COMPLETENESS, прогон ізолюється, відправляються сповіщення, а обробка зупиняється до того, як таблиці нижчого рівня будуть пошкоджені.
- Переваги: Усуває цикл "сміття на вході — сміття на виході" шляхом блокування неякісних даних на вході.
2. Звітність з регуляторного комплаєнсу
Доводьте фінансовим органам або органам охорони здоров'я, що дані є абсолютно точними та аудитованими.
- Traceable Validation Logs: Запускайте перевірки валідації на всіх звітах комплаєнсу до публікації, фіксуючи результати перевірки (пройдено/не пройдено).
- Audit Trails: Ведіть профілі історії, що показують відповідність полів правилам ACCURACY та VALIDITY, спрощуючи регуляторні аудити.
- Переваги: Уникає штрафів за порушення комплаєнсу та накладних витрат на ручний аудит.
3. Регресії бізнес-логіки
Виявляйте зміни в системах джерел, які порушують очікування вищого рівня.
- Behavior Change Alerts: Коли CRM-система джерела змінює свій формат (наприклад, починає писати назви країн замість кодів країн), перевірки VALIDITY від агента миттєво фіксують цю зміну.
- Immediate Pinpointing: Точно визначає конкретні записи та атрибути, які порушують правила.
- Переваги: Дозволяє інженерам даних усувати зсуви API та схем до того, як вони вплинуть на клієнтські звіти.
Покроковий посібник з впровадження правил якості
Дотримуйтесь цього робочого процесу для налаштування та впровадження правил якості для ваших таблиць:
Крок 1: Підключіть схему даних
Вставте визначення вашої схеми (DDL або CSV-зразок) в інтерфейс агента. Агент профілює схему для ідентифікації типів стовпчиків, можливості використання null та кандидатів у первинні ключі.
Крок 2: Оберіть цільові виміри якості
Визначте, які виміри є критичними для вашого цільового набору даних. Для транзакційних таблиць ви зазвичай активуєте всі сім вимірів (INTEGRITY, TIMELINESS, COMPLETENESS, ACCURACY, CONSISTENCY, UNIQUENESS та VALIDITY).
Крок 3: Визначте цілі якості простою англійською або українською мовою
Інструктуйте агента, використовуючи просту бізнес-термінологію. Наприклад: "Забезпеч, щоб дати транзакцій ніколи не були в майбутньому, ID магазину мав існувати в довіднику магазинів, а ID транзакції мав бути унікальним."
Крок 4: Перевірте синтезовані правила
Агент скомпілює ваші підказки у структуровані правила, зіставляючи кожне обмеження з конкретною категорією валідації. Перевірте правила для підтвердження точного перекладу бізнес-логіки.
Крок 5: Експортуйте та запустіть
Згенеруйте код тестування (такий як оператори SQL або набори Great Expectations) та вставте його у ваш рушій виконання даних. Правила тепер перевірятимуть кожен рядок при наступних прогонах.
Переваги: Чому це ефективно?
- Повна структурна гарантія: Охоплює всі сім основних вимірів якості даних, запобігаючи прихованому пошкодженню даних у конвеєрах.
- Визначення правил без написання коду: Розширює можливості стюардів даних та аналітиків зі створення складних правил без написання складного коду Python або SQL.
- Захист від затримок та порушень SLA: Вбудована валідація TIMELINESS позначає проблеми із затримкою до того, як користувачі почнуть скаржитися на застарілі дашборди.
- Гнучке впровадження: Експортує логіку в кілька цілей виконання, вписуючись як у сучасні хмарні конвеєри, так і в застарілі скрипти баз даних.
