Meld je aan voor de nieuwsbrief

Data-infrastructuur: onderdelen en processen in beeld

Een robuuste data-infrastructuur vormt de basis voor het verzamelen, opslaan, verwerken en uitwisselen van gegevens binnen een organisatie. Benieuwd naar de onderdelen en processen van een data-infrastructuur? Op deze pagina nemen we je mee door het schema van een robuste data-infrastructuur en lichten we stap voor stap elk onderdeel en proces toe.

Databronnen

Databronnen zorgen voor het produceren van data. Organisatie breed zijn er veel verschillende databronnen (bijvoorbeeld het elektronisch cliënten dossier, human resource management, rooster- en planningsystemen, en zorgdomotica). Deze kunnen ook weer veel verschillende type data produceren (bijvoorbeeld tekst, getallen, audio, video). Dit kan ruwe data zijn (hoe de data oorspronkelijk geproduceerd wordt), maar vaak is dit al een verwerkte vorm van de data. De verwerking die heeft plaatsgevonden is een service of analyse uitgevoerd door de databron of leverancier van het product.

Ontsluiting

Data ontsluiten is het ophalen van de data vanuit de bronsystemen. Data ontsluiting kan op verschillende manieren worden uitgevoerd. Wanneer data continue (real-time) wordt overgezet wordt dit streaming genoemd. Nadat de data geproduceerd is, kan het direct verwerkt en gebruikt worden. Data kan ook in porties overgezet worden, dit worden batches genoemd. Hierbij wordt een verzameling aan data in één keer overgezet (bijvoorbeeld elke dag om 23:00, of één keer per uur). Het ontsluiten van data kan geïnitieerd worden vanuit de databron, dit wordt push genoemd. Hierbij bepaald de databron wanneer en welke data overgezet wordt naar het dataplatform. Het kan ook andersom, waarbij het dataplatform data opvraagt uit de databron, dit wordt pull genoemd. De data die rechtstreeks uit de bron ontsloten wordt is vaak nog niet bewerkt en ongestructureerd.

Transformatie

Data transformatie is het omzetten van de data naar gewenste vorm voor opslag en/of gebruik. In deze stap wordt de data opgeschoond en gecontroleerd, waarmee fouten, kopieën en inconsistenties uit de data gehaald worden. Datatypes kunnen worden gestandaardiseerd, zodat bijvoorbeeld dezelfde structuur, eenheid of terminologie gebruikt wordt. Ook kunnen verschillende datasets aan elkaar worden gekoppeld. Net als bij de ontsluiting kunnen transformaties gedaan worden in de vorm van batches of streaming. In het schema lijken de transformaties misschien als één stap tussen de data ontsluiting en presentatie in te zitten, maar transformaties kunnen op verschillende plekken in het proces plaatsvinden. Er kunnen bijvoorbeeld al data transformaties plaatsvinden tijdens de ontsluiting. Er kunnen dan al aanpassingen aan de data gedaan worden, nog voordat het wordt opgeslagen in het dataplatform.

Opslag

Dataopslag vormt een cruciaal onderdeel van de data-infrastructuur en is met veel onderdelen ervan verbonden. Data wordt fysiek of virtueel opgeslagen in verschillende fases van verwerking. Fysieke dataopslag is een vorm van hardware waar de data daadwerkelijk opgeslagen wordt, dit zijn bijvoorbeeld servers of harde schijven. Deze kunnen lokaal staan, maar ook via cloudservices bereikt worden. Bij virtuele dataopslag wordt de data niet fysiek opgeslagen. In plaats daarvan wordt de instructie van een verwerkingsstap opgeslagen. Dit concept kan uitgelegd worden aan de hand van een simpel voorbeeld: iemands leeftijd. Als deze data virtueel wordt opgeslagen, wordt het daadwerkelijke leeftijdsgetal nergens bewaard. Wat wel is opgeslagen, is de berekening om tot iemands leeftijd te komen. Samen met de opgeslagen geboortedatum en de huidige datum kan iemands leeftijd berekend worden. De keuze voor een bepaald type opslag hangt af van het doel, maar ook van factoren zoals hoe vaak de data wordt ontsloten en gebruikt, de benodigde opslagcapaciteit en het type data. In het voorbeeld van leeftijd blijft de waarde altijd up‑to‑date wanneer je deze virtueel opslaat. Bij fysieke opslag zou je de leeftijd elk jaar handmatig moeten bijwerken. Daar tegenover staat de geboortedatum, deze veranderd niet en kan daarom fysiek opgeslagen worden.

Presentatie

De data worden klaargezet en aangeleverd aan de gebruikers. Voor verschillende toepassingen en gebruikers wordt toegang tot specifieke datasets ingericht. Deze toegang wordt alleen gegeven wanneer de gebruikers ook recht hebben tot het inzicht en gebruik van deze data.

Toepassing

Dit is het moment waarop de waarde van de gehele data-infrastructuur duidelijk wordt. Datasets kunnen worden gebruikt om inzichten te creëren met behulp van data-analyses, business intelligence, rapportages, visualisaties en/of dashboards. Ook kan het gebruikt worden voor operationele analyses, waarbij de data real-time gebruikt wordt om inzicht te geven, acties te initialiseren, en geautomatiseerde processen te ondersteunen. Data kan ook als input gebruikt worden voor modellen en voorspellingen, onder andere gebaseerd op machine learning. Voorspellende modellen kunnen bijvoorbeeld worden ingezet voor roosterplanning, waarbij de verwachte beschikbaarheid en behoefte direct worden gebruikt om de planning te maken.

Randvoorwaarden & faciliteiten

Er zijn verschillende randvoorwaarden en faciliterende onderdelen die nodig zijn om een dataplatform functioneel en veilig in te richten:

  • Data governance: Vormt een belangrijk fundament voor een robuuste data-infrastructuur. Door middel van afspraken is het gehele proces rondom data vastgelegd. Dit zorgt ervoor dat het datagebruik voldoet aan het beleid en dat data betrouwbaar en veilig wordt gebruikt. Maar ook dat het proces voldoet aan wet- en regelgeving en dat het duidelijk is bij wie welke verantwoordelijkheden liggen.
  • Datamanagement: Omvat het ontwikkelen, uitvoeren en controleren van plannen, beleid, en gebruik op het gebied van data en informatie. Er zijn verschillende aspecten die hierbij komen kijken zoals: gegevensbeheer, vindbaarheid, verantwoordelijkheid, kwaliteit, afkomst, integratie, ethiek, en privacy.
  • Beveiliging: Zorgt ervoor dat toegang tot data en systemen alleen op het juiste moment en aan de juiste persoon of het juiste systeem wordt gegeven. Verder moet de data worden beschermd voor ongewenste zichtbaarheid tijdens overdracht en opslag. Ook het zorgen voor een back up, zodat de data niet verloren gaat, valt onder de beveiliging.
  • Data architectuur: Het conceptuele ontwerp van de data-infrastructuur dat de behoefte en strategie van een organisatie op het gebied van data verzameling, opslag, transformatie en beschikbaarheid weergeeft, bepaalt welke tools er worden ingezet, en hoe deze aan elkaar gerelateerd zijn.
  • DataOps: Staat voor data operations en zorgt voor samenwerking tussen teams, rollen en functies waardoor betrouwbare en actuele data snel beschikbaar is voor het nemen van data-ondersteunde en data-gedreven beslissingen. Hier komen ook processen zoals automatisering, observatie en monitoring, en incident afhandeling bij kijken.
  • Software engineering: Zorgt voor de ontwikkeling en onderhoud van applicaties die nodig zijn voor de verschillende processen binnen de data-infrastructuur zoals de data generatie, transformatie, overdracht, testen, en opslag.
  • Orkestratie: Zorgt voor het inplannen en automatiseren van taken en dataverwerking.

Wil je zien hoe dit schema er in de praktijk uitziet? In het praktijkvoorbeeld Data‑ondersteund inzicht bij ADL‑ondersteuning worden de onderdelen en processen uit het schema toegepast op een realistische situatie.

Voor de informatie op deze pagina is gebruik gemaakt van dit boek: Joe Reis, Fundamentals of data engineering, 2022