Size: a a a

2022 February 03

Н

Никита in Moscow Spark
Хотел узнать, а как сделать так, чтобы при sql запросе в hive

у меня вывод таблиц был не в формате table_name.col_name. |   table_name.col_name  table_name.col_name , а просто col_name.  | col_name. | col_name ?
источник

GP

Grigory Pomadchin in Moscow Spark
интересно но у меня на эти даты  (вокруг) воркшопы пока ): @krivdathetriewe надо заставлять)
источник

GP

Grigory Pomadchin in Moscow Spark
а что имеешь ввиду?
источник

Н

Никита in Moscow Spark
В hue в sql окошке пишу select * from db.table

названия колонок выводятся в формате:
table.col1. | table.col2


Хочу загрузить эти результаты в csv  файл , но чтобы столбцы назывались нормально:
col1  | col2  и т.п
источник

DZ

Dmitry Zuev in Moscow Spark
у меня активная фаза отпуска 10, 12 могу и после >=14
источник

GP

Grigory Pomadchin in Moscow Spark
По-моему это hive.resultset.use.unique.column.names параметр который надо в фолс поставить
источник

OI

Oleg Ivchenko in Moscow Spark
Можешь пож. CV в личку прислать?
источник

DZ

Dmitry Zuev in Moscow Spark
закину ща
источник

I

Ivan in Moscow Spark
Добрый день!
Вопрос по партицированию, мы заранее можем знать на сколько файлов бить таблицу? Например, Если таблица партицирована по дате, то у нее в 15 году объем партиции 1мб, а сейчас 300гб есть способ проставить адекватный partitionCount?
Либо может есть какой то авторепартишн на количество файлов для записи самой таблицы
источник

MD

Michael Davydov in Moscow Spark
Не слышал, есть ли умный способ это делать, все, кого я знаю, перезаписывают файлы отдельной джобой через несколько дней после записи
источник

ЕГ

Евгений Глотов... in Moscow Spark
В 3 версии вроде как есть какой-то автомёрдж мелких файлов
источник

ЕГ

Евгений Глотов... in Moscow Spark
А так только руками и головой
источник

ЕГ

Евгений Глотов... in Moscow Spark
Мутить репартишен такой, чтоб в каждом таске было какое-то подмножество данных из итоговых партиций, которое запишется в подмножество файлов
источник

A

Alex in Moscow Spark
Причём даже норм работает вроде как
источник

A

Alex in Moscow Spark
источник

A

Alex in Moscow Spark
Наш чел на простых датасетах проверил, достаточно оптимальное количество выбралось
источник

K

KrivdaTheTriewe in Moscow Spark
хозяйке на заметку, делать  колонку артицирования лучше yyyy-mm-dd
источник

K

KrivdaTheTriewe in Moscow Spark
а не yyyymmdd
источник

K

KrivdaTheTriewe in Moscow Spark
)
источник

DZ

Dmitry Zuev in Moscow Spark
Поч?
источник