Nadmiarowość danych oznacza, że te same dane znajdują się w więcej niż jednym miejscu. Czasami jest to celowe. Kopie zapasowe są redundantne z założenia. Replikowane bazy danych przechowują kopie w wielu regionach, aby zapewnić dostępność. Macierze RAID duplikują dane na dyskach, dzięki czemu pojedyncza awaria nie powoduje utraty danych. Celowa redundancja chroni przed awarią. Niezamierzona redundancja powoduje problemy.
Gdy ten sam rekord klienta znajduje się w trzech systemach bez synchronizacji, rekordy dryfują. Jeden ma aktualny adres. Inny ma stary numer telefonu. Trzeci ma literówkę w e-mailu. Nikt nie wie, który jest poprawny. Raporty z różnych systemów są rozbieżne. Analitycy spędzają godziny na uzgadnianiu. Rozwiązaniem jest albo integracja, albo pojedyncze źródło prawdy. Zarządzanie danymi podstawowymi identyfikuje autorytatywny system dla każdej jednostki. Integracja utrzymuje kopie w synchronizacji. Oba kosztują pieniądze i wysiłek. Nadmiarowość nie zawsze jest zła. Pytanie brzmi, czy jest kontrolowana. Kontrolowana nadmiarowość poprawia niezawodność. Niekontrolowana nadmiarowość powoduje niespójność. Rozróżnienie jest ważniejsze niż obecność duplikatów. System bez nadmiarowości jest kruchy. System z chaotyczną nadmiarowością jest niewiarygodny. Celem jest celowa, zarządzana nadmiarowość, która służy celowi.
Typy redundancji
- Celowe — kopie zapasowe, replikacja, RAID
- Niezamierzone — duplikaty rekordów, niezsynchronizowane systemy
- Kontrolowane — zarządzane za pomocą integracji lub danych głównych
- Brak kontroli — kopie dryfują i nie zgadzają się
Redundancja to narzędzie. Dobrze użyta, chroni dane. Źle użyta, niszczy zaufanie.
Comments
No comments yet. Be the first to share a thought.
Leave a comment