La X rossa (o i punti interrogativi grigi su tutto) di solito non significa "nodo morto": significa che il cluster ha perso il quorum e si è messo in sola lettura per proteggersi – le VM che giravano continuano a girare, ma niente start, stop o modifiche.
Diagnosi in due comandi: pvecm status (quanti voti ci sono, quanti ne servono) e un occhio a corosync (journalctl -u corosync): nove volte su dieci è la rete tra i nodi – uno switch riavviato, un cavo, un MTU cambiato, o la rete di corosync satura perché condivisa col traffico di storage. Sistemata la rete, il quorum torna da solo.
Se un nodo è morto davvero e siete rimasti in pari: il QDevice esiste per non trovarsi mai qui. E l'ultima spiaggia – pvecm expected 1 per sbloccare un nodo superstite – va usata sapendo cosa si sta facendo: con due nodi attivi e separati, quel comando è la ricetta dello split brain. Mai come routine, mai negli script.