Определите ответственность за replacement
При colocation клиент владеет hardware и принимает replacement/warranty решения. При dedicated rental действует согласованный service scope. Этот boundary нужно определить до инцидента.
Держите вероятные spare parts рядом
Drives, memory и PSU часто практично иметь в запасе. Необычные controllers, NICs и proprietary parts могут поставляться дольше. Spare inventory должен быть точно идентифицирован.
Заранее согласуйте authorization
Должно быть понятно, кто может разрешить shutdown, disk replacement, RAID changes и другие disruptive actions. Это сокращает задержки во время incident.
Используйте out-of-band management
IPMI/iLO/iDRAC помогает видеть power state, POST и hardware health при недоступной ОС. После replacement можно подтвердить boot и RAID state до application checks.
Определите verification criteria
Replacement успешен только после проверки согласованного результата: диск виден, RAID rebuilding, memory count верен, link up или system booted. Software validation может оставаться у remote team.
Не строите план на нереалистичной гарантии
Срок зависит от наличия spare, типа hardware и facility access. Resilience и backups должны соответствовать бизнес-риску, а не предположению, что любой компонент будет заменен мгновенно.
