Źródło danych to źródło, z którego pochodzą dane. Bazy danych, interfejsy API, pliki dziennika, czujniki, ankiety i rejestry publiczne stanowią źródła. Źródło określa strukturę, jakość i wiarygodność danych. Dobrze utrzymywana baza danych z ograniczeniami i walidacją generuje czystsze dane niż arkusz kalkulacyjny wypełniany ręcznie. Czujnik z dryftem kalibracji generuje obciążone odczyty. Publiczny zbiór danych może być niekompletny lub nieaktualny.
Znajomość źródła jest niezbędna do zaufania danym. Skąd pochodzą? Kto je zebrał? Kiedy? Jak? Jaka była metoda? Co zostało wykluczone? Te pytania określają, co dane mogą, a czego nie mogą potwierdzić. Dane z ankiety przeprowadzonej na 100 osobach nie mogą potwierdzić twierdzeń dotyczących populacji liczącej miliony. Dane z systemu, który rejestruje tylko udane transakcje, pomijają błędy. Dane od dostawcy mogą być dokładne dla jego celów, ale błędne dla Twoich. Źródło ma również wpływ na potok. Baza danych ze stabilnym schematem jest łatwiejsza do zintegrowania niż strona internetowa, która zmienia swój kod HTML co miesiąc. Interfejs API z limitami przepustowości ogranicza ilość danych, które można pobrać. Plik dostarczany ręcznie jest podatny na opóźnienia i błędy. Źródło jest fundamentem. Słaby fundament podważa wszystko, co zostało na nim zbudowane.
Typowe źródła danych
- Bazy danych — ustrukturyzowane rekordy z aplikacji
- API — programowy dostęp do systemów zewnętrznych
- Pliki dziennika — zdarzenia systemowe i aplikacyjne
- Czujniki — ciągłe pomiary fizyczne
- Ankiety — ustrukturyzowane odpowiedzi od ludzi
- Rejestry publiczne — rządowe i otwarte zbiory danych
Zanim zaufasz danym, zrozum ich źródło. Odpowiedzi często zdradzają więcej niż same dane.
Comments
No comments yet. Be the first to share a thought.
Leave a comment