Определите ответственность за replacement

При colocation клиент владеет hardware и принимает replacement/warranty решения. При dedicated rental действует согласованный service scope. Этот boundary нужно определить до инцидента.

Держите вероятные spare parts рядом

Drives, memory и PSU часто практично иметь в запасе. Необычные controllers, NICs и proprietary parts могут поставляться дольше. Spare inventory должен быть точно идентифицирован.

Заранее согласуйте authorization

Должно быть понятно, кто может разрешить shutdown, disk replacement, RAID changes и другие disruptive actions. Это сокращает задержки во время incident.

Используйте out-of-band management

IPMI/iLO/iDRAC помогает видеть power state, POST и hardware health при недоступной ОС. После replacement можно подтвердить boot и RAID state до application checks.

Определите verification criteria

Replacement успешен только после проверки согласованного результата: диск виден, RAID rebuilding, memory count верен, link up или system booted. Software validation может оставаться у remote team.

Не строите план на нереалистичной гарантии

Срок зависит от наличия spare, типа hardware и facility access. Resilience и backups должны соответствовать бизнес-риску, а не предположению, что любой компонент будет заменен мгновенно.

Связанные услугиHardware Support →Remote Hands →SLA →