Size: a a a

2021 December 03

АЖ

Андрей Жуков... in Data Engineers
Да может быть и его, и моим, ща все с DR решили носиться
источник

AZ

Anton Zadorozhniy in Data Engineers
Это делается через написание (а чаще покупки) специального промежуточного слоя, чтобы ваш hbase, spark и все остальные друзья писали через него, а этот промежуточный слой уже занимается репликацией сразу всего
источник

t

tsla in Data Engineers
хз, вряд ли, я в мухосранске, до нас только хайп дошёл
источник

AZ

Anton Zadorozhniy in Data Engineers
Я думаю вы усложняете себе задачу если хотите чтобы весь кластер и приложения на нем сразу магически куда-то реплицировались.
Попробуйте решать задачу не для всей платформы сразу, а для каких-то решений, по моему опыту это проще (и дешевле)
источник

t

tsla in Data Engineers
ок, спасибо большое
источник

K

KrivdaTheTriewe in Data Engineers
Не , не мой
источник

AZ

Anton Zadorozhniy in Data Engineers
Ясно, видимо правда какое-то поветрие случилось
источник

Н

Никита in Data Engineers
Подскажите, пожалуйста, допустим у меня есть spark streaming скрипты и я хочу их поместить в прод, какие средствами их можно шедулить?
у меня задача раздавать данные из hive через message bus (RMQ)
источник

k

kvadratura in Data Engineers
можно и cron для этого, если ничего пока больше нет (airflow, luigi, etc)

если вы спарк запускаете в k8s - cronjob
источник

Н

Никита in Data Engineers
ну у меня етсь airflow, я подумал, что там streaming джобы, которые постоянно работают неправильно поднимать.
Вот изучаю NiFi, не уверен что подходящее решение
источник

N

Nikita Blagodarnyy in Data Engineers
почему неправильно? мы вон поднимаем. @SparkApplicationMaster налабал давеча.
источник

ЕГ

Евгений Глотов... in Data Engineers
Нужна отдельная очередь и отдельный воркер, который её обрабатывает, чтоб не влиять на остальные процессы
источник

Н

Никита in Data Engineers
@nblagodarnyy у вас получается таска в airflow бесконечно работает?
источник

ЕГ

Евгений Глотов... in Data Engineers
Да, при падении ретрай тоже до бесконечности
источник

ЕГ

Евгений Глотов... in Data Engineers
Желательно наверно exponential_backoff юзать
источник

ЕГ

Евгений Глотов... in Data Engineers
Если уж прям совсем-совсем падает - надо разбираться, чё там происходит
источник

NB

Nikita Bakanchev in Data Engineers
А смысл этого решения, чтобы иметь единый оркестратор ?
источник

ЕГ

Евгений Глотов... in Data Engineers
Чтоб смотреть на салатовые квадратики и радоваться)
источник

ЕГ

Евгений Глотов... in Data Engineers
Плюс получать алерты таким же способом, как и на батч задачи, и соответственно перезапуск
источник

N

Nikita Blagodarnyy in Data Engineers
основной смысл-не вставать ночью по звонку дежурной смены и не поднимать руками сриминги, которые упали потому что в зукипере кх протухла сессия или еще какая-то мелочевка, которая лечится рестартом.
источник