У нас уж лет пять как альт-pve в ограниченном применении. Думаю, надо куда-то переползать. Конфигурация с gfs2 на fc с кластерным lvm имеет один нехороший нюанс.
В случае каких-либо проблем с ip, получаем перестрелку вачдогов с последующим перезапуском узлов. А кластер собирается только если кворум соберётся в течение 30 секунд. (если не ошибаюсь)
У меня тут свич 10G у кластера pve отключился по питанию. Pve как давай ноды пристреливать и ребутать несколько раз :) весело было. Зато когда сеть починил, надо отдать должное, pve самовосстановился
ну, кластерная система с одним свичом это такое, или бондинг с двумя свичами или интерконнект между узлами для второго кольца. Тогда перестрелки не будет.
Этот кластер pve даже если дня три пролежит, ничего страшного не произойдет. Так что второй свич для него жирно будет :) мы же обоснованно тратим, или не тратим, деньги :)
У меня прикол в том, что диски подключены по FC, а узлы, это лезвия HP в корзине. Соответственно, FC-то не падает, но если падает IP, то всё. И пофигу, что физически всё в одной корзине - всё равно падает. Именно поэтому gfs2 сильно напрягает.
ну тогда норм, помню в момент теста одного кластера спецально симулировал развал внутрянки и наблюдал в логах настоящий дезматч. Минут на 30 залип на это зрелище :)
У меня с этим выключением ещё интереснее получилось. Внутри свича Mellanox тоже Альт работает. Я давно сделал dist-upgrade, но не перегружал его. А тут после включения сеть не поднялась. Я хоть и мантейнер systemd в Альт, но не проассоциировал что udev в новой версии будет себя вести таким образом - поломался split 40G на 4x10G через udev rules. Пришлось ещё откатываться на предыдущий systemd