En dataingeniør opbygger og vedligeholder den infrastruktur, der flytter og lagrer data. De skriver pipelines, administrerer databaser og sikrer, at data ankommer, hvor de skal være, til tiden og i brugbar form. Dataforskere og analytikere forbruger det, som ingeniører producerer. Hvis pipelinen går i stykker, stopper deres arbejde.
Rollen er vokset i takt med at datamængderne er steget. Tidlige dataingeniører administrerede relationsdatabaser og ETL-scripts. Moderne dataingeniører arbejder med cloudplatforme, distribuerede processing frameworks og streamingsystemer. De skriver kode i Python, Scala eller Java. De har en dyb forståelse af SQL. De ved, hvordan man designer skemaer, partitionstabeller og optimerer forespørgsler. De håndterer også operationer: overvågning, alarmering og gendannelse, når noget fejler klokken 3 om natten. Jobbet er delvist softwareudvikling, delvist databaseadministration, delvist VVS. Det er ikke glamourøst. Det er essentielt. En dataforsker, der bruger halvdelen af sin tid på at reparere ødelagte pipelines, laver ikke data science. En god dataingeniør får det problem til at forsvinde. Pipelinerne kører. Dataene er rene. Analytikerne og forskerne kan fokusere på deres egentlige arbejde.
Dataingeniørens ansvarsområder
- Byg pipelines — udtræk, transformér, indlæs data
- Administrer lagerplads — databaser, datasøer, lagre
- Sikre pålidelighed — overvågning, alarmering, genopretning
- Optimer ydeevne — forespørgselsjustering, partitionering
- Support forbrugere — analytikere, forskere, applikationer
Dataingeniører bygger vejene. Alle andre kører på dem. Når vejene er gode, er der ingen, der bemærker det.
Comments
No comments yet. Be the first to share a thought.
Leave a comment