Size: a a a

2020 March 29

АЖ

Андрей Жуков... in Moscow Spark
KrivdaTheTriewe
55200 датафреймов(
ититская сила
источник

K

KrivdaTheTriewe in Moscow Spark
можно ядер побольше правда драйверу дать
источник

K

KrivdaTheTriewe in Moscow Spark
ладно, сча посмотрим
источник

K

KrivdaTheTriewe in Moscow Spark
попробую число датафреймов все таки уменьшить
источник

ИК

Иван Калининский... in Moscow Spark
Андрей Жуков
ититская сила
Так, я планирую сделать примерно то же самое на 150 - 300 тысяч. Опыт очень интересен, пиши, что получится, пожалуйста
источник

K

KrivdaTheTriewe in Moscow Spark
Иван Калининский
Так, я планирую сделать примерно то же самое на 150 - 300 тысяч. Опыт очень интересен, пиши, что получится, пожалуйста
в параллели мержить  нужно
источник

N

Nikolay in Moscow Spark
Как может возникнуть 5 тыс union?
источник

AK

Alena Korogodova in Moscow Spark
И тем более 300 тысяч
источник

ИК

Иван Калининский... in Moscow Spark
очень просто, чтение отдельных файлов, с попыткой получить статистики по ним. Подскажите, как получить имя конкретного файла в датафрейме без этой жуткой процедуры.
источник

K

KrivdaTheTriewe in Moscow Spark
Nikolay
Как может возникнуть 5 тыс union?
нарезка таблицы из базы своими руками
источник

K

KrivdaTheTriewe in Moscow Spark
когда spark.read.jdbc не хватает
источник

t

tenKe in Moscow Spark
Иван Калининский
очень просто, чтение отдельных файлов, с попыткой получить статистики по ним. Подскажите, как получить имя конкретного файла в датафрейме без этой жуткой процедуры.
input_file погугли в функциях
источник

N

Nikolay in Moscow Spark
KrivdaTheTriewe
нарезка таблицы из базы своими руками
А нельзяли нарезать так , что бы было 5 тыс партиции , а не датафрэймов. Например ходит в базу самому , а не использовать spark .read.jdbc
источник

N

Nikolay in Moscow Spark
У тебя будет условный список из 5k запросов. Ты его преобразуешь в rdd, например  и потом для каждого запроса сходишь в базу через ванильный jdbc.
источник

ИК

Иван Калининский... in Moscow Spark
tenKe
input_file погугли в функциях
input_file_name() есть, спасибо!  проверю корректность работы в используемой версии spark
источник

t

tenKe in Moscow Spark
Иван Калининский
input_file_name() есть, спасибо!  проверю корректность работы в используемой версии spark
ага, он
источник

t

tenKe in Moscow Spark
ток после .cache и возможно .repartition работать не будет
источник

t

tenKe in Moscow Spark
учти это)
источник

ИК

Иван Калининский... in Moscow Spark
tenKe
учти это)
Учту, а в моем случае, как раз нужно выполнить это на только что созданном датафрейма.
Прототип на нескольких сотнях файлов отработал очень хорошо и вот, я готовлю промышленную версию, а там сотни тысяч файлов!
источник

GP

Grigory Pomadchin in Moscow Spark
KrivdaTheTriewe
нарезка таблицы из базы своими руками
А напиши сразу сурс который будет читать и резать базу по твоей схеме партицировария
источник