Мониторинг набора реплик
Чтобы узнать, какие экземпляры входят в набор реплик, и получить статистику по всем этим экземплярам, выполните функцию box.info.replication. Ниже показан статус репликации для набора реплик, содержащего один мастер и две реплики:
На следующей схеме показаны соединения upstream и downstream при выполнении box.info.replication на экземпляре мастера
(instance001):

При выполнении функции box.info.replication на реплике instance002 соединения upstream и downstream выглядят следующим
образом:

Это означает, что статистика по репликам приводится относительно экземпляра, на котором выполняется box.info.replication.
Основные индикаторы работоспособности репликации:
-
idle: время (в секундах) с момента получения экземпляром последнего события от мастера. Если на мастере нет новых данных, требующих репликации, он отправляет на реплики сообщения контрольного сигнала каждые replication_timeout секунд. Мастер запрограммирован на отключение, если он не получает сообщения контрольного сигнала дольше
replication_timeout* 4 секунд.Таким образом, в работоспособном состоянии значение
idleникогда не должно превышать значениеreplication_timeout: в противном случае, либо репликация сильно отстает, поскольку мастер опережает реплику, либо отсутствует сетевое подключение между экземплярами. -
lag: разница между локальным временем экземпляра, зафиксированным при получении события, и локальным временем другого мастера, зафиксированным при записи события в журнал упреждающей записи (write-ahead log, WAL) на этом мастере. Поскольку при расчете
отставанияиспользуются часы операционной системы с двух разных машин, не удивляйтесь, получив отрицательное число: смещение времени может привести к тому, что время на удаленном мастере будет постоянно отставать от времени на локальном экземпляре.