он внутри партиции пробегает и ставит, а сама партиция получается по маске override protected def evalInternal(input: InternalRow): Long = { val currentCount = count count += 1 partitionMask + currentCount }
Не будет, всё будет в тех партициях, в которых было изначально Кстати, нсли бы была возможность сделать группировку по spark_partition_id без шафла, я бы с удовольствием пользовался, есть пара мест, где прям нужно
Привет. Вы не сталкивались, что бы на стадии shuffle spark использовал из 200 ядер 13 и памяти по минимуму и висел по 4 -5 часов? Не пойму почему так происходит.