Data Engineer в Macrometa
  • Як працює Spark під капотом і як створити ефективний Big Data пайплайн

    Я з вами цілком згідний якщо порівнювати пропускну здатність мережі відносно диску, то в багатьох випадках вона більше.
    В статті малося на увазі пропускна здатність Спарка в контексті wide залежностей, де передаються дані через мережу, але також накладується багато складових, таких як:
    — розгрупування даних, які займають суттєвий об’єм;
    — якщо не вистачає пам’яті, то частину даних зберігається на диск;
    — також робить резервну копію даних в разі неуспішносні наступного worker’a;
    — серіалізує;
    — відправляє через мережу кожному worker’у;
    — десеріалізує.
    Як видно із послідовності роботи wide залежності, можна сказати що вона використовує Disk I/O, Network I/O та Serialization I/O, тому затратність більша аніж інші операції.
    Дякую за коментар.

  • Як працює Spark під капотом і як створити ефективний Big Data пайплайн

    Дякую за розгорнутий відгук.
    п.с. описки виправлено.

    Підтримав: Ivan Prytula