Odzyskiwanie danych z WD My Cloud EX4100 RAID 5 – uszkodzone dyski i niekontrolowana odbudowa macierzy
Do laboratorium Ram-serwis Odzyskiwanie Danych trafił serwer plików NAS WD My Cloud EX4100 wyposażony w cztery dyski WD Red WD40EFRX-68N32N0 o pojemności 4 TB, pracujące w macierzy RAID 5.
Awaria była złożona. Dwa dyski miały uszkodzenia mechaniczne związane z pracą głowic i powierzchnią magnetyczną, a dodatkowo przed przekazaniem serwera do laboratorium podejmowano wielokrotne próby jego uruchomienia. W pewnym momencie urządzenie rozpoczęło niekontrolowaną odbudowę macierzy.
W efekcie doszło nie tylko do dalszej degradacji dwóch uszkodzonych dysków, ale również do częściowego nadpisania danych na pozostałych nośnikach. Zniszczeniu uległa więc zarówno część danych fizycznych, jak i logiczna struktura RAID.
Konfiguracja serwera NAS
Serwer pracował w konfiguracji:
- WD My Cloud EX4100
- 4 × HDD SATA 3,5 cala
- WD Red WD40EFRX-68N32N0
- pojemność pojedynczego dysku: 4 TB
- macierz RAID 5
Dyski oznaczyliśmy zgodnie z ich pierwotnym położeniem w serwerze jako 1, 2, 3 i 4.

Dyski 1 i 2 wykazywały poważne problemy mechaniczne. Dyski 3 i 4 znajdowały się w znacznie lepszym stanie technicznym, jednak wcześniejsza próba odbudowy RAID spowodowała zmiany również w danych zapisanych na sprawnych nośnikach.
Wielokrotne próby uruchomienia pogorszyły stan macierzy
W przypadku macierzy RAID utrata jednego dysku nie zawsze oznacza utratę danych. RAID 5 wykorzystuje dane parzystości i w określonych warunkach może pracować po awarii pojedynczego nośnika.
Sytuacja zmienia się jednak, gdy problemy dotyczą więcej niż jednego dysku albo rozpocznie się odbudowa macierzy w niewłaściwym stanie zestawu.
W tym przypadku wielokrotne uruchamianie serwera doprowadziło do dalszej pracy dysków 1 i 2 mimo problemów z głowicami i powierzchnią magnetyczną. Zwiększyło to liczbę uszkodzonych obszarów i utrudniło późniejszy odczyt.
Dodatkowym problemem była rozpoczęta wcześniej odbudowa RAID. Proces ten częściowo zmienił zawartość dysków 2 i 3, przez co oryginalny stan logiczny macierzy został zaburzony.
Dopiero podczas późniejszej analizy udało się ustalić zakres tych zmian.
Pierwszy etap – zabezpieczenie dostępnych dysków
Pierwszym zadaniem było zabezpieczenie tych nośników, które można było jeszcze uruchomić bez ingerencji mechanicznej.
Wykonaliśmy kopie technologiczne dostępnych dysków, aby dalszą analizę prowadzić na kopiach, a nie na oryginalnych nośnikach.
Dopiero po zabezpieczeniu możliwych do odczytania danych rozpoczęliśmy prace nad dyskami wymagającymi ingerencji mechanicznej.
Wymiana głowic w dwóch dyskach WD Red
Stan dysków 1 i 2 wymagał wymiany zespołów głowic.
Dobór kompatybilnych podzespołów w dyskach pracujących wcześniej w jednej macierzy wymagał zachowania dużej ostrożności. Po wcześniejszym wykonaniu kopii możliwe było wykorzystanie odpowiednio dobranych dysków jako źródła kompatybilnych elementów potrzebnych do dalszych prac.
Po wymianie głowic oba uszkodzone dyski udało się ponownie uruchomić.
Nie oznaczało to jednak końca problemów.
Uszkodzenia powierzchni i problemy z oprogramowaniem układowym
Po uruchomieniu dysków ujawniły się liczne uszkodzenia powierzchni magnetycznej.
Odczyt nie mógł być prowadzony w sposób ciągły. Konieczne było wielokrotne omijanie problematycznych obszarów, zmiana kolejności odczytu oraz powracanie do części bloków w późniejszych etapach wykonywania kopii.
Dodatkowo w obu dyskach występowały problemy w obszarze oprogramowania układowego związane z modułami dostępnymi przez głowicę H0.

Diagnostyka w systemie PC-3000 Express potwierdziła błędy odczytu części modułów Service Area.

Naprawa dostępu do oprogramowania układowego wymagała dodatkowych prac, ale ostatecznie oba nośniki udało się ustabilizować na tyle, aby rozpocząć wykonywanie ich kopii technologicznych.
Prawie 90% sprawnych bloków w dwóch uszkodzonych dyskach
Oba dyski znajdowały się w bardzo złym stanie.
Mimo licznych błędów odczytu oraz uszkodzeń powierzchni w ciągu kilku dni udało się uzyskać prawie 90% bloków danych z każdego z problematycznych nośników.
Nie oznaczało to jednak automatycznie odzyskania 90% plików.
W macierzy RAID dane pojedynczego pliku mogą być rozłożone pomiędzy kilka dysków. Dlatego kolejnym etapem było ustalenie pierwotnej konfiguracji RAID oraz sprawdzenie, które fragmenty macierzy zostały zmienione podczas wcześniejszej odbudowy.
Ustalenie parametrów RAID 5
Mając kopie wszystkich czterech dysków, rozpoczęliśmy analizę konfiguracji macierzy.
Konieczne było ustalenie między innymi:
- właściwej kolejności dysków
- rozmiaru paska danych – stripe size
- sposobu rozmieszczenia danych
- algorytmu parzystości
- punktów rozpoczęcia struktur RAID
- zakresu zmian spowodowanych wcześniejszą odbudową
Po ustaleniu parametrów możliwe było przygotowanie wirtualnej rekonstrukcji macierzy w środowisku PC-3000 Express RAID.
Niekontrolowana odbudowa RAID jako dodatkowe uszkodzenie
Największym problemem nie były już same brakujące sektory.
Analiza wykazała, że wcześniejsza odbudowa RAID częściowo nadpisała zawartość dysków 2 i 3. Oznaczało to, że nie można było po prostu ustawić właściwej kolejności dysków i uruchomić standardowej rekonstrukcji RAID 5.
Część bloków reprezentowała stan macierzy sprzed awarii, część dane zapisane podczas odbudowy, a część była całkowicie niedostępna z powodu fizycznych uszkodzeń powierzchni.
Konieczne było więc wykorzystanie wielu etapów analizy i rekonstrukcji, aby możliwie dokładnie odtworzyć pierwotną strukturę logiczną danych.
Prace nad tym etapem trwały kilka kolejnych dni.
Odbudowa logicznej struktury danych
Po ustaleniu właściwych parametrów RAID i skorygowaniu skutków wcześniejszej odbudowy udało się odtworzyć logiczną strukturę serwera.
Widoczne stały się katalogi i pliki zapisane na macierzy przed awarią.

Ostatecznie możliwe było odzyskanie około 90% danych znajdujących się na serwerze przed wystąpieniem problemu.
Przy skali uszkodzeń mechanicznych dwóch dysków oraz częściowym nadpisaniu danych na kolejnych nośnikach był to bardzo dobry rezultat techniczny.
Dodatkowy problem – uszkodzona obudowa WD My Cloud EX4100
Po zakończeniu odzyskiwania danych przygotowaliśmy cztery nowe dyski przeznaczone do ponownego uruchomienia serwera.
Wtedy ujawnił się jeszcze jeden problem.
Obudowa WD My Cloud EX4100 nie pracowała prawidłowo również z nowymi, sprawnymi dyskami. Wszystko wskazywało na dodatkowe uszkodzenie samego urządzenia, prawdopodobnie w obszarze odpowiedzialnym za zasilanie dysków.
Oznaczało to, że awaria nie ograniczała się wyłącznie do nośników tworzących macierz RAID.
Dlaczego historia wcześniejszych działań ma znaczenie?
Podczas odzyskiwania danych z RAID bardzo ważna jest informacja o wszystkich działaniach wykonanych po wystąpieniu awarii.
W tym przypadku dopiero analiza kopii wykazała, że wcześniej podejmowano wielokrotne próby uruchomienia serwera i odbudowy macierzy.
Takie działania mogą zmienić zawartość sprawnych dysków, przez co późniejsza rekonstrukcja staje się znacznie trudniejsza.
Jeżeli serwer NAS zgłasza awarię więcej niż jednego dysku albo rozpoczyna nieoczekiwaną odbudowę macierzy, bezpieczniejszym rozwiązaniem jest jego wyłączenie i zabezpieczenie wszystkich nośników przed kolejnymi zapisami.
Wynik odzyskiwania danych
W ramach realizacji:
- wykonano kopie technologiczne czterech dysków
- wymieniono zespoły głowic w dwóch uszkodzonych nośnikach
- przywrócono możliwość pracy z dyskami mającymi problemy z firmware
- odczytano prawie 90% bloków z najbardziej uszkodzonych dysków
- ustalono konfigurację RAID 5
- odtworzono kolejność dysków, stripe size i algorytm parzystości
- zrekonstruowano macierz wirtualnie
- skorygowano część skutków wcześniejszej niekontrolowanej odbudowy
- odbudowano logiczną strukturę katalogów i plików
Ostatecznie odzyskano około 90% danych zapisanych na macierzy przed awarią.
Przypadek WD My Cloud EX4100 pokazuje, że przy awarii RAID problemem może być jednocześnie stan mechaniczny dysków, firmware, uszkodzenia powierzchni oraz zmiany logiczne powstałe podczas wcześniejszych prób odbudowy.
W takich sytuacjach kluczowe znaczenie ma wykonanie kopii poszczególnych nośników przed rozpoczęciem jakichkolwiek dalszych operacji na macierzy.
Odzyskiwanie danych z macierzy RAID
Odzyskiwanie danych z serwera NAS




