Size: a a a

2021 December 01

AK

Alena Korogodova in Moscow Spark
Не исключено, что этот чатик парсят, как и data engineers, и поэтому все вопросы увековечены)
источник

ИК

Иван Калининский... in Moscow Spark
ещё идея: нужен бот-отвечатель! Он будет по парсингу получать похожие вопросы и предлагать задавшим варианты по релевантности)) Заодно будет плюсовать популярные темы и отвечавших
источник

AK

Alena Korogodova in Moscow Spark
А на каких-то форумах были такие автоответы, что де есть похожие темы, мб ответ есть там
источник

R

R in Moscow Spark
Идея норм, при условии что аналогов нет) а так уже есть большая база знаний которую остаётся только пополнять
источник

R

R in Moscow Spark
Все равно костыль)
источник

N

Nikita Blagodarnyy in Moscow Spark
голосовой помошник Григорий.
источник

AK

Alena Korogodova in Moscow Spark
источник

VI

Vladimir Ilyushkin in Moscow Spark
Можно ли в спарке SQL запрос заставить использовать reduceByKey?
источник

ПФ

Паша Финкельштейн... in Moscow Spark
Разве это не просто explode + group by (key)?
источник

VI

Vladimir Ilyushkin in Moscow Spark
Не знаю. А есть примеры?
источник

ПФ

Паша Финкельштейн... in Moscow Spark
ну reduceByKey — операция, которая просто схлопывает значения при грппировке, разве нет?
источник

VI

Vladimir Ilyushkin in Moscow Spark
Да, но не просто а на каждой ноде а потом только шафлит
источник

PK

Pavel Klemenkov in Moscow Spark
Так у spark sql почти все агрегатные функции через partial считаются
источник

PK

Pavel Klemenkov in Moscow Spark
Посмотри план
источник

VI

Vladimir Ilyushkin in Moscow Spark
Hashpartition?
источник

VI

Vladimir Ilyushkin in Moscow Spark
Это оно ?
источник

SI

Sergey Ivanychev in Moscow Spark
спарк при group by + agg делает аггрегацию перед шаффлом
источник

SI

Sergey Ivanychev in Moscow Spark
Посмотри внимательно план, там обычно два раза увидишь HashAggregate — одну перед exchange, другую после
источник

VI

Vladimir Ilyushkin in Moscow Spark
Спасибо
источник
2021 December 02

SI

Sergey Ivanychev in Moscow Spark
Вы не в курсе почему операция


(df.repartition("product_id")
   .sortWithinPartitions("product_id", "effective_ts")
   .write …


в плане реально делает сначала shuffle, а потом sort на каждой партиции а не фокус из df.rdd.repartitionAndSortWithinPartitions где Spark обходится без этого?
источник