Size: a a a

2022 February 10

DZ

Dmitry Zuev in Moscow Spark
В девопс чат форварднул?
источник

ПФ

Паша Финкельштейн... in Moscow Spark
Заказал услуги на всех, ну ты чего
источник

DZ

Dmitry Zuev in Moscow Spark
Найс, жена как раз уехала
источник

ПФ

Паша Финкельштейн... in Moscow Spark
Не всех в девопс чате
источник

DZ

Dmitry Zuev in Moscow Spark
Жаль меня там нет
источник

ПФ

Паша Финкельштейн... in Moscow Spark
Тебе нельзя, у тебя дела уже уснула
источник

I

Ivan in Moscow Spark
Всем доброе утро!
источник

I

Ivan in Moscow Spark
кто нибудь мб пробовал, есть ли вариант вставить код скалы в pyspark? мб обернуть как то или еще что. Мне надо использовать очень большую функцию на скале, мб ее даже как то можно вызвать в Pyspark/
источник

ПФ

Паша Финкельштейн... in Moscow Spark
И тебе не хворать, Айван
источник

ПФ

Паша Финкельштейн... in Moscow Spark
Можно зарегистрировать Scala UDF и его звать
источник

I

Ivan in Moscow Spark
тоже об этом подумал, но не пользовался ей в пайспарке, а в рамках udf можно вызывать библиотеки скалы?
источник

ПФ

Паша Финкельштейн... in Moscow Spark
Конечно
источник

MK

Mikhail Kuznetsov in Moscow Spark
YouTube
DE or DIE #5. Андрей Титов – Использование Scala UDF в PySpark
Материалы всех наших митапов: https://deordie.com
Наш чат в Telegram: https://t.me/deordie_chat
Новые события сообщества DE or DIE: https://deordie.timepad.ru/events/

Автор доклада: Андрей Титов, Senior Spark Engineer, NVIDIA

В своем докладе я поделюсь своим опытом использования пользовательских функций в высокопроизводительных PySpark приложениях.

При использовании PySpark часто забывают о возможности использования UDF, написанных на Scala/Java. А ведь это отличный способ увеличить производительность вашего приложения.

К сожалению, в официальной документации приводится самый базовый вариант их применения, который  имеет ряд ограничений и не раскрывает всех возможностей применения Scala/Java UDF в PySpark.

В своем докладе я расскажу, как:
– заставить PySpark автоматически выводить тип данных, возвращаемых в UDF;
– создать pyspark.sql.Column на базе UDF вместо использования spark.sql(…);
– использовать Singleton Pattern для сохранения данных между вызовами функций и работы с внешними источниками из UDF;
– избежать повторного вызова UDF на одних и тех же данных;
– настроить логирование с помощью встроенного log4j.
источник

I

Ivan in Moscow Spark
спасибо большое!)
источник

k

kvadratura in Moscow Spark
можно. например - spark._sc._jvm.org.hadoop.fs... через py4j дергаем жава / скала класс

но если такого становится много, проще выкинуть пуспарк чем страдать
источник

ПФ

Паша Финкельштейн... in Moscow Spark
Каждый такой колл очень дорогой :(
источник

MK

Mikhail Kuznetsov in Moscow Spark
хорошо выкинуть, если и вся тима его с тобой выкинет) иначе не поймут)
источник

k

kvadratura in Moscow Spark
пуспарковцы должны страдать
источник

k

kvadratura in Moscow Spark
выкинуть тиму  😁
источник

k

kvadratura in Moscow Spark
можете в двух словах описать, зачем в udf питонском дергать скалу, если можно сразу дергать питоном скала - udf?
источник