Size: a a a

2021 December 02

SS

Sergey Sheremeta in Data Engineers
“udf можно и в вашем скрипте зарегистрировать” - можно пример?
источник

k

kvadratura in Data Engineers
источник

k

kvadratura in Data Engineers
в скале + - то же самое. если есть возможность выбора - лучше выбирать скалу, на ней удф лучше работают по многим причинам
источник

ЕГ

Евгений Глотов... in Data Engineers
Вот это норм решение
источник

ЕГ

Евгений Глотов... in Data Engineers
Делал такое по диплому до того, как это вписали в геоспарк)
источник

ЕГ

Евгений Глотов... in Data Engineers
И потом ещё раз в немножко спарк датафреймов
источник

ЕГ

Евгений Глотов... in Data Engineers
Только есть проблема, что соседи по координатам не обязательно будут в одном id
источник

ЕГ

Евгений Глотов... in Data Engineers
И надо делать explode соседних клеточек
источник

D

Dmitry Nechaev in Data Engineers
вероятно это то, что нужно http://datafu.apache.org/docs/spark/guide.html функция joinWithRange
источник

SS

Sergey Sheremeta in Data Engineers
а если у меня нет доступа к Spark DSL, только Spark SQL через ODBC/JDBC?
источник

UD

Uncel Duk in Data Engineers
а кто-нибудь уже затащил у себя push based шафлер в спарке?
источник

DZ

Dmitry Zuev in Data Engineers
Можно линк
источник

UD

Uncel Duk in Data Engineers
источник

DZ

Dmitry Zuev in Data Engineers
Если коротко, типа блоки мерджатся и сокращают random read io?
источник

UD

Uncel Duk in Data Engineers
Да
источник

UD

Uncel Duk in Data Engineers
Правда не только рид
источник

UD

Uncel Duk in Data Engineers
Обычный шафлер выносит шпиндели по случаной записи мелкими блоками
источник

UD

Uncel Duk in Data Engineers
типа десятки килобайт
источник

UD

Uncel Duk in Data Engineers
И еще статейка линка
источник

UD

Uncel Duk in Data Engineers
источник