18+
реклама
18+
Бургер менюБургер меню

Аркадий Глазырин-Уральский – «Необыкновенные похождения Аркадия из России». Том 3 (страница 35)

18

Креативнее подходите к делу. И будьте понастойчивее.

RAID и люди

ИТ-шное, грустное

Читать администратором серверов, пилотам, диспетчерам, капитанам и их помощникам.

Кратко, “по-простому”: RAID это такой способ организации данных на дисках, при котором один, два, три диска могут выйти из строя, но работоспособность сервера при этом не будет нарушена, данные не потеряются.

Сама история: Давным-давно, ещё 15 лет назад, продали мы серьёзный сервер Kraftway с 5-ю SCSI дисками одному Заказчику далеко-далеко на Север, аж в Белоярский, ХМАО, а те уже отвезли его на оленях ещё дальше, в тундру, за Казым.

При конфигурировании сервера выяснилось, что задача у него, в общем-то пустяшная, на неё вполне достаточно два диска по 72Gb в "зеркале". И тогда собрал я 1+1, а остальные сделал Hot Spare. Это такой режим, когда при разрушении одного диска в "зеркале", на его место автоматически встаёт диск Hot Spare. Без каких-либо действий Оператора.

И вот через 5 лет притаскивают к нам тот сервер с полной потерей данных. Начал смотреть — ВСЕ диски неисправные.

Все!!! Вообще! Как так? Все пять!

Связался с Заказчиком. Спрашиваю: — Как такое могло быть? Все диски одновременно не ломаются. Это исключено.

Оказалось, что где-то через год после начала эксплуатации сервер за ночь остудился от окна (в тех краях в серверных комнатах кондиционеров нет — там просто приоткрывают окно, а на улице — 35 °C, бесплатно) и один диск в "зеркале" умер, на его место тут же встал запасной, на неисправном диске появилась соответствующая индикация.

— Так чего же Вы его не вынули и не прислали нам для замены по гарантии? Регулярно ведь у нас бываете!

— Так работает ведь.

Через год у них вышел из строя очередной HDD, и он также автоматически был заменён на Hot Spare. Сервер при этом пищал и ругался.

— Ну вот, уже два неисправных. Диски там с "горячей заменой", надо было просто вынуть отказавшие и прислать их нам для замены. Мы бы выдали новые, Вы бы выставили их в те же гнёзда, прямо на ходу. И всё.

— А нафига? Работает ведь.

— Тьфу…

Через год сломался ещё один. Как вы уже догадываетесь — они снова не сделали ничего, “работает ведь”. Через год в RAID остался всего ОДИН рабочий диск из пяти. Четыре светят красными лампочками, сервер орёт.

— Ну Вы бы хоть в сервис позвонили и спросили!

— А на…зачем? Работает ведь!

И вот через пять лет, ровно по окончанию гарантийного срока тот сервер привезли нам.

— АААА…. Идиоты… АААА….

Но не могу же я им это сказать?

Разборки всевозможных транспортных и технических катастроф полны таких же описаний. Индикация была, оповещение голосом было, сирена аж орала. И… Ничего!

Ничего не было предпринято. Причем, если в случае с самолётом есть лимит по времени, паника, то тут всё на земле, времени в запасе годы, позвонить и спросить — не проблема.

Или другой случай: тоже сервер Kraftway, тоже в корпусе SC5300, тоже 5 дисков SCSI, тоже съёмные, “горячей замены”, OS Novell NetWare 5.1, Роль — чисто файловый сервер.

Диски собраны в массив уровня 5, который допускает поломку 1 (одного) любого диска. При этом ёмкость дисков суммирована и представлена как один.

И вот жарким летом 2005 нахожусь я в отпуске, меняю сантехнику и все такое. В это же время самый главный Админ второй конторы в этом повествовании собирается в отпуск. Жену с ребёнком уже отправил поездом в Анапу, а сам летит завтра.

Кстати, мне категорически не нравятся заявления некоторых личностей вроде того, что "лечу завтра", "прилетаю в среду в девять", "буду в Турции в апреле” (2020-го) и т. п.

Ибо человек смертный не может быть уверен даже в том, что он завтра и жить-то вообще будет. Тут же смелые утверждения касающиеся поездки в другую страну. А там в Турции в апреле 2020 жёсткий карантин, самолёты не летают, никого через границу не пропускают.

И вот Юрик стоит и смотрит на сервер, который до того работал совершенно без проблем. Вся индикация в норме. Всё работает без замечаний. Можно смело отчаливать. И тут рука Юрия сама потянулась вперёд и вытащила один диск.

Сервер запищал, сообщив о переходе в аварийный режим, о работе RAID режиме Degraded, без одного диска. Юрий проверил. Всё работает. Юрий знал, что в один момент времени может ломаться только 1 (один) диск, и, вообще-то Юрий не идиот. НО он зачем-то взял и вытащил ещё один. Удивительно, но всё продолжило работать. Дело в том, что у сервера большая оперативная память, а NetWare использует её всю под буфер. Получалось, что изменения писались в ОЗУ, а не на диск. И всё ВРОДЕ КАК нормально работало.

Тут Юрик разозлился и вытащил третий диск (!??)

Система сказала “ГАВ” и упала.

Дальше Юрий вставил все диски обратно, но сервер не завёлся. Илья обесточил его и включил снова. Не работает!

И тогда Юрий сделал гениальное действие — он поменял все диски местами. Включил. Не помогло!

И тогда он позвонил нам. Я был в отпуске, поэтому меня решили не беспокоить, и на Космонавтов, 13 поехал Андрей Ржавый. Приехал, спросил: — Что тут было?

Юрий ответил, что вообще ничего не было: — Работал, работал и вдруг выключился. Теперь диски не видит.

Андрей вспомнил чему его учили и предположил, что диски перешли в режим “Отключено” НЗ почему. В принципе, один может выпасть. Как правило это происходит из-за старения диска, когда он ещё “живой”, но уже в состоянии деменции.

Диск при этом не отвечает контроллеру в отведённый промежуток времени, и контроллер считает, что он уже таво.

Будь там я, я бы осмотрел диски, допросил бы Юрия с пристрастием. Я на всякий случай маркирую диски в RAID-массивах маркером. Одна чёрная точка — первый, — второй, … — третий, и так далее:…………. Так что я БЫ понял, что там у них произошло на самом деле. Некоторые Заказчики, кстати, не любят меня именно за то, что я им задаю уточнящие вопросы, будто бы зная, что у них на самом деле было. И этот Юра меня тоже за это не любил. Он чей-то там сыночек, попал на должность исключительно по родству и был о себе ооочень большого мнения. Но, увы, там был не я, а Андрей, и он поверил представителю Заказчика, повёлся на его речи, зашёл в BIOS RAID-контроллера, включил диски, вышел из меню и перезагрузил сервер. Дальше RAID-контроллер увидел в себе новые диски (если переставить исправный диск из гнезда в гнездо, то для контроллера он уже идёт как новый), и после этого сам, автоматически запустил процедуру Rebuild, создав идеально правильный, девственно чистый массив заново. Получилось, что сервер есть, но данных на нём нет. Совершенно.

В итоге Юрий Ильин полетел не в Анапу, в отпуск, а в Москву, в сервис восстановления данных с повреждённых RAID-массивов, оставил там 2300 вечнозелёных, но нужные базы ему всё же восстановили. Ибо диски были исправные.

На всякий случай: знайте, что на исправных носителях информация практически на 95 % восстановима. Даже после форматирования, удаления разделов, очистки SSD, флешки. Главное туда ничего больше не писать и не истерить. А ещё следует помнить, что производители серверов не отвечают за сохранность данных на них. И уж тем более, если виноват в потере данных сам же Пользователь, нарушивший Инструкцию.

Кстати, если верить Сноудену, то возвращаемые Производителю по гарантии диски вначале ремонтируются, после чего с них АНБ сливает себе всю инфу. Она ими собирается отовсюду. Так в 90-х 63 % валовых разведданных У НИХ получалось тупо с перехвата пейджерных сообщений (отовсюду)*.

* Это мне Боширов рассказал (прим. Автора).

Юрик тогда настаивал на нашей вине, вроде как сервер должен иметь щиток, чтобы в него нельзя было залезть и диски вытащить. Ага! Щаз. И помещён в бронированную камеру.

Пока писал, вспомнил как у одного Заказчика в сервере Kraftway EL20 жёсткие диски SATA регулярно "летели", и мы их меняли по гарантии. В конце-концов я скатался и посмотрел на условия эксплуатации. Оказалось, что сервер этот эксплуатировался в тумбочке (!!!), отчего диски были всегда в перегретом состоянии, существенно выше +50 °C, но если процессор Intel Pentium-4 сам себя спасал, снижая частоту по 100MHz, ступенчато, а вместе с тем и напряжение, и термопакет, то диски стабильно перегревались. И дохли. А ещё один сервер Kraftway EL20 упал. Там его эксплуатировали не В, а НА тумбочке, а у неё после прокатывания через порог, колёсико отвалилось. И её поставили к стенке тем местом, где колеса нет. Затем повернули тумбочку. Однако, поскольку дифферент у сервера был на корму, то тумбочка с сервером стояла на трёх колесах и не падала. Несколько месяцев стояла. Пока внутрь не положили пачки с бумагой. Тогда бумага победила железо, сервер сделал оверкиль и, в прямом смысле слова, упал, на пол.

А ещё что было! Летом 2005-го (будучи в отпуске) поехал я на рынок Парковый за смесителем, на автобусе 2К (это был коммерческий маршрут, ходивший по Крауля). Уселся в последнем ряду по центру. Еду и балдею. Чуток пьяненький. Буквально самую малость. На следующей остановке зашли и встали передо мной три девчёнки в мини-юбках, судя по разговорам, студентки-медички, ехавшие на экзамен. Щебечут о своём, медицинском, стоя ко мне спиной. Долго едем. Я даже пофантазировать успел, как бы мне с ними с тремя разом взять да и забуриться в отель с ночевой, а потом ещё, и ещё… Прикинул как мы разместимся вчетвером на одной большой кровати под одним гигантским одеялом. Одна слева, другая справа…