Это делается через написание (а чаще покупки) специального промежуточного слоя, чтобы ваш hbase, spark и все остальные друзья писали через него, а этот промежуточный слой уже занимается репликацией сразу всего
Я думаю вы усложняете себе задачу если хотите чтобы весь кластер и приложения на нем сразу магически куда-то реплицировались. Попробуйте решать задачу не для всей платформы сразу, а для каких-то решений, по моему опыту это проще (и дешевле)
Подскажите, пожалуйста, допустим у меня есть spark streaming скрипты и я хочу их поместить в прод, какие средствами их можно шедулить? у меня задача раздавать данные из hive через message bus (RMQ)
ну у меня етсь airflow, я подумал, что там streaming джобы, которые постоянно работают неправильно поднимать. Вот изучаю NiFi, не уверен что подходящее решение
основной смысл-не вставать ночью по звонку дежурной смены и не поднимать руками сриминги, которые упали потому что в зукипере кх протухла сессия или еще какая-то мелочевка, которая лечится рестартом.