+38/050/370-3627
+38/093/220-0872
+38/044/257-2444
Новини

AWS Glue 6.0 тепер доступний за ціною на 30% нижче та з повною підтримкою Apache Iceberg v3

AWS Glue 6.0 тепер доступний за ціною на 30% нижче та з повною підтримкою Apache Iceberg v3

AWS оголосив про вихід AWS Glue 6.0 , що пропонує на 30% нижчу ціну в порівнянні з попередніми версіями AWS Glue та повну підтримку функцій Apache Iceberg v3. AWS Glue 6.0 побудований на повністю модернізованому середовищі виконання, Apache Spark 4.1, Python 3.13 та Scala 2.13, що забезпечує більш високу продуктивність.

У цьому релізі AWS Glue надає найбільш повну реалізацію Iceberg v3 для будь-якого повністю безсерверного керованого сервісу Spark, а також нові можливості, які спрощують розробку ETL-процесів, підвищують продуктивність PySpark і забезпечують потокову передачу в реальному часі із затримкою в кілька мілісекунд.

Що нового в AWS Glue 6.0?
AWS Glue 6.0 надає повну специфікацію Apache Iceberg v3, побудовану на основі Iceberg 1.11.0. Головна особливість - це VARIANTтип даних з підтримкою подрібнення, який забезпечує більш високу швидкість читання запитів, порівняно з традиційними стовпцями рядкового типу даних для напівструктурованих даних.

Завдяки VARIANTфункції подрібнення даних ви можете зберігати та запитувати дані JSON, журнали та події без перетворення схем у плоскі, що виключає дублювання даних, необхідність в коді користувача для парсингу і збої в конвеєрі обробки при зміні схем. Ця можливість кардинально змінює підхід команд до роботи з напівструктурованими даними у великих масштабах.

Додаткові можливості Iceberg v3 включають:

  • Типи даних «Геометрія» та «Географія» : Забезпечують вбудовану просторову обробку для ГІС-аналітики, визначення місця розташування та конвеєрів обробки геопросторових даних безпосередньо в керованому Spark.
  • Тимчасові мітки з наносекундною точністю : Підтримка даних з датчиків IoT, наукових обчислень та високочастотних фінансових завдань, що потребують точності, що перевищує стандартні мілісекунди.
  • Обробка невідомих типів : обробка даних з несподіваними або змінними схемами без збоїв у конвеєрі, що забезпечує стійкість до змін схеми на вищому рівні.

В AWS Glue 6.0 також включено найбільш значне оновлення Spark 4.1, сучасного середовища виконання:

  • Декларативні конвеєри Spark : Декларативні конвеєри Spark пропонують спрощений підхід до розробки ETL-процесів. Інженери даних оголошують перетворення, вказуючи, як мають виглядати дані, тоді як механізм автоматично визначає порядок виконання та оптимізацію. Це знижує складність розробки конвеєрів та виключає ручне налаштування.
  • В AWS Glue 6.0 реалізовано виконання функцій користувача (UDF) та табличних функцій (UDTF) Python з підтримкою Arrow : це усуває накладні витрати на серіалізацію між Python і JVM, підвищуючи продуктивність PySpark при складних перетвореннях.
  • Режим потокової передачі в реальному часі : Для сценаріїв потокової передачі без збереження стану AWS Glue 6.0 є режим потокової передачі в реальному часі, що забезпечує затримку в кілька мілісекунд. Ця можливість, заснована на режимі реального часу Spark 4.1 з оптимізованим для Glue виконанням, підтримує обробку подій реального часу, конвеєри перетворення даних з низькою затримкою та маршрутизацію даних, чутливих до часу.

Початок роботи з AWS Glue 6.0.
Для використання AWS Glue 6.0 не потрібно вносити зміни до API. Ви можете вибрати нову версію, використовуючи існуючий --glue-versionпараметр в create-jobAPI update-jobчерез   інтерфейс командного рядка AWS (AWS CLI) ,   AWS SDK , AWS Glue Studio , Amazon SageMaker Unified Studio та вашу кращу IDE.

Щоб розпочати роботу з завданнями AWS Glue 6.0 у консолі AWS Glue Studio , відкрийте завдання AWS Glue та на вкладці «Подробиці завдання» виберіть версію Glue 6.0 — «Підтримує Spark 4.1, Scala 2, Python 3» . Ви можете створювати нові завдання AWS Glue у версії 6.0, щоб скористатися перевагами покращень, або перенести існуючі завдання AWS Glue.

Щоб розпочати використання AWS Glue 6.0 у блокноті AWS Glue Studio або в інтерактивній сесії через блокнот Jupyter, встановіть значення 6.0 у %glue_versionмагічному ключі. Ви також можете оновити існуючі завдання до Glue 6.0 за допомогою агента оновлення Spark в AWS Glue Studio або використовувати функцію автоматичного оновлення в існуючих завданнях Glue для автоматичного оновлення до Glue 6.0.

Для отримання більш детальної інформації відвідайте розділ «Детальніша інформація про версію AWS Glue 6.0» та «Міграція завдань AWS Glue для Spark на версію AWS Glue 6.0» у документації AWS.

AWS Glue 6.0 тепер доступний
у всіх регіонах AWS, де працює AWS Glue. Інформацію про регіональну доступність та плани на майбутнє можна знайти у розділі « Можливості AWS по регіонах» . Якщо ви хочете використовувати API, шукати документацію, дізнаватися про регіональну доступність та перевіряти інформацію щодо усунення несправностей, пов'язаних з цією новою функцією, спробуйте використовувати сервер AWS MCP та плагіни з вашим улюбленим інструментом штучного інтелекту.

За пошук даних (краулери) та виконання завдань вилучення, перетворення та завантаження (ETL) (обробка та завантаження даних) ви сплачуєте погодинну ставку з посекундною оплатою. За використання AWS Glue Data Catalog ви сплачуєте спрощену щомісячну плату за зберігання та доступ до метаданих. Перший мільйон об'єктів, що зберігаються, і перший мільйон звернень безкоштовні.

Інші новини

Найкраща ціна