Skip to content

Synthetic Data Agent: Робочий процес і артефакти

Synthetic Data Agent є основним компонентом екосистеми Datapunkt, відповідальним за генерацію високоточних синтетичних наборів даних, що зберігають конфіденційність. Аналізуючи схеми джерел, вивчаючи статистичні розподіли та використовуючи розширені генеративні моделі машинного навчання, агент дозволяє командам за запитом надавати величезні обсяги тестових даних продакшен-рівня.

Цей посібник проведе вас через покроковий операційний робочий процес використання Synthetic Data Agent, визначить основні вихідні артефакти та деталізує переваги його впровадження у ваші конвеєри.

first

Підтримувані можливості

Synthetic Data Agent нативно інтегрує розширені техніки безпеки даних та синтезу, щоб гарантувати, що ваші цільові набори даних є безпечними, реалістичними та повністю сумісними:

  • PII DETECTION: Автоматично сканує вхідні схеми, назви стовпчиків та метадані зразків для ідентифікації стовпчиків, що містять персональні дані (такі як імена, адреси, кредитні картки, номери страхування та номери телефонів).
  • PRIVACY PRESERVING: Реалізує спеціалізоване впровадження шуму, хешування та токенізацію для забезпечення неможливості реконструкції будь-якої реальної особи із згенерованих записів.
  • GDPR/CCPA: Генерує сумісні набори даних, які повністю випадають із зони дії регуляторних обмежень, таких як GDPR та CCPA, забезпечуючи навчання та тестування без ризиків.
  • ML SYNTHESIS: Використовує глибокі генеративні архітектури, включаючи генеративно-змагальні мережі (GAN) та варіаційні автоенкодери, для фіксації нелінійних зв'язків та складних кореляційних матриць у багатовимірних наборах даних.
  • DIFFERENTIAL PRIVACY: Додає математичні гарантії шуму (диференціальна конфіденційність Epsilon-Delta), щоб переконатися, що жоден окремий продакшен-запис не може бути зворотно спроєктований або ізольований.
  • SCHEMA FIDELITY: Зберігає точні структурні обмеження, типи стовпчиків баз даних, зв'язки зовнішніх/первинних ключів, вимоги до можливості використання null та обмеження довжини полів вашої бази даних джерела.
  • DATA INTEGRITY: Забезпечує реляційну узгодженість між кількома пов'язаними таблицями, запобігаючи колізіям ключів, осиротілим рядкам та порушенням посилальної цілісності.
  • DATA PRIVACY & FIDELITY: Збалансовує абсолютну безпеку конфіденційності зі статистичною користю, гарантуючи, що синтетичні набори даних поводяться ідентично до продакшен-даних під час аналізу та моделювання.

Операційний робочий процес

Synthetic Data Agent використовує робочий простір з двома панелями, розроблений для спрощення конфігурації при захисті чутливих метаданих джерел.

Крок 1: Підписка на агента

Щоб почати використовувати агента, ви повинні отримати підписку через маркетплейс платформи:

  1. Увійдіть у свій акаунт платформи Agentpunkt.
  2. Знайдіть Synthetic Data Agent у каталозі маркетплейсу платформи.
  3. Оберіть відповідний план підписки (наприклад, тижневий, двотижневий або щомісячний).
  4. Отримайте доступ до агента через вашу сторінку Hired Agents.

Крок 2: Ініціалізація сесії робочого простору

Відкрийте нову сесію робочого простору для створення вашого ізольованого середовища (sandbox):

  1. Натисніть "Start Session" поруч із Synthetic Data Agent на сторінці Hired Agents.
  2. Інтерфейс користувача розділяється на дві основні панелі:
    • Ліва панель (Інтерактивний чат та логи): Тут ви спілкуєтеся з агентом простою мовою, визначаєте вимоги до генерації та моніторите логи покрокового прогресу.
    • Права панель (Робочий простір та попередній перегляд коду): Ця панель відображає макети схем, згенеровані YAML/JSON конфігурації, таблиці попереднього перегляду даних та готові до запуску скрипти ін'єкції.

Крок 3: Аналіз схеми джерела

Ознайомте агента з вашими структурами даних без передачі чутливих продакшен-записів:

  1. Скопіюйте та вставте DDL вашої бази даних (наприклад, скрипти CREATE TABLE) або JSON-представлення схеми у Ліву панель.
  2. Ви також можете надати безпечний, очищений CSV, що містить від 5 до 10 рядків тестових заголовків та прикладів форматів даних.
  3. Агент запускає сканування PII DETECTION для посилання чутливих стовпчиків та представляє візуальний мапінг схеми у Правій панелі.

Приклад підказки в Лівій панелі:

"Проаналізуй наступну схему нашої бази даних замовлень. Визнач будь-які стовпчики з PII та перевір зв'язки зовнішніх ключів: [Вставте SQL-оператор DDL сюди]"

Крок 4: Налаштування обмежень генерації

Вкажіть ваші вимоги до даних, статистичні очікування та цільові обсяги:

  1. Інструктуйте агента про необхідну кількість рядків (наприклад, "Згенеруй 50 000 замовлень та 10 000 клієнтів").
  2. Визначте цілі розподілу (наприклад, "Забезпеч, щоб вік клієнтів був нормально розподілений між 18 та 75 роками, і 15% транзакцій зазнавали невдачі або використовували промокоди").
  3. Встановіть ваші параметри конфіденційності, вказуючи рівень шуму DIFFERENTIAL PRIVACY (значення Epsilon) або запитуючи сувору анонімізацію GDPR/CCPA.
  4. Агент скомпілює ці правила у файл конфігурації синтезу, відображений у Правій панелі.

Крок 5: Високоточна генерація даних

Запустіть основну процедуру синтезу:

  1. Доручіть агенту виконати процес синтезу.
  2. Агент виконує моделі ML SYNTHESIS локально в оперативній пам'яті, зіставляючи статистичні кореляції та генеруючи рядки, що відповідають формі схеми.
  3. Перевірте логи выполнения у Лівій панелі. Після завершення попередній перегляд згенерованого набору даних з'явиться у Правій панелі.

Крок 6: Цільовий експорт або ін'єкція

Експортуйте ваш новостворений синтетичний набір даних або заплануйте пряму ін'єкцію в базу даних:

  1. Завантажте згенеровані дані у стандартних форматах, таких як CSV, Parquet або JSON.
  2. Або скопіюйте згенерований скрипт ін'єкції Python або оператори insert бази даних для завантаження даних безпосередньо у ваші staging-сховища або цільові таблиці.

Переваги: Чому це ефективно?

  • Прискорені цикли QA: Усуває залежності від ручного очищення, скриптів санітаризації баз даних або тривалих погоджень, дозволяючи розробникам розгортати тестові середовища за секунди.
  • Бездоганна відповідність схемі: Суворе забезпечення правил схем запобігає збоям завантаження, колізіям ключів та невідповідностям первинних і зовнішніх ключів.
  • Безкомпромісні гарантії конфіденційності: Нативне виявлення PII у поєднанні з гарантіями диференціального шуму гарантує, що розробники та тестові середовища нижчого рівня залишаються повністю захищеними з точки зору комплаєнсу.
  • Високоточна користь машинного навчання: Генерує складні математичні кореляції та крайні випадки (edge cases), гарантуючи, що аналітичні моделі, навчені на синтетичних даних, поводяться надійно при розгортанні на реальних системах.

Contact Us