P1 - Data Scientist (Senior)

Il y a 6 heures

Antwerp, Flanders, Belgique TiTANS Consulting Temps plein

De data scientist zal bijdragen aan het rijtijd-analyseproject bij de organisatie, met als doel de stiptheid van onze voertuigen aanzienlijk te verbeteren.

Dit project is gebaseerd op big data analytics en vervangt de traditionele methode voor het bepalen van rijtijden, waarbij rijtijden per lijn werden aangepast, door een moderne big data aanpak. Bij het project gebruiken we data van ons voorspellingsmodel van toekomstige rijtijden op basis van recente trends, met als doel de planning te optimaliseren.

De professional zal werken met Python en Apache Spark in Databricks om analyses uit te voeren op de voorspellingen van het huidige rijtijd-predictie model en zal dit model verder verbeteren.

De focus van de data scientist ligt op het verbeteren van het predictie model door middel van feature engineering, het toevoegen van variabelen, het optimaliseren van regularisatie,.... Hierbij zal de professional de bestaande aanpak kritisch evalueren en de code grondig reviewen. Daarnaast kan de data scientist nog aan nieuwe voorspellingsprojecten werken indien voldoende vordering bij rijtijd-analyses, zoals het voorspellen van de beschikbaarheid van voertuigen en chauffeurs.

Daarnaast gaat de professional meewerken aan een of enkele taken ter ondersteuning van de interne data specialist voor dit project. Deze taken omvatten onder andere:

  • Het voorstellen van optimalere tijdsblokken, met zo min mogelijk toename van de totale rijtijd, op basis van uitgebreide analyses.
  • Het kwantificeren van onproductieve rijtijden, waarbij systematisch te veel tijd wordt toegewezen.
  • Het ontwikkelen van een nieuwe planningsstructuur voor de "minimale layover" (op basis van de onzekerheid wanneer een voertuig aan de laatste halte toekomt).
  • Het valideren van de voorspelde rijtijden ten opzichte van zowel de oude historische data als de werkelijke rijtijden.

De Data Scientist zal zijn kennis en expertise rond machine learning inzetten voor meervoudige en accuratere output (rijtijden, op- en afstappers, etc…), rekening houdend met de run time en kost om het model te runnen.

Daarnaast zal de professional, samen met andere teamleden, de aanpak kritisch evalueren, code reviews uitvoeren, en gezamenlijk een statistisch rapport opstellen om de methodologie te documenteren, de resultaten te presenteren, en de huidige en toekomstige richting van het project te bespreken.

Vereiste vaardigheden en ervaring

  • Aantoonbare ervaring in het optimaliseren/tunen van databases en queries
  • Aantoonbare ervaring met het analyseren van datastromen
  • Aantoonbare ervaring met databanken (SQL, Oracle)
  • Aantoonbare ervaring met Apache Spark
  • Aantoonbare ervaring met het ontwikkelen en valideren van machine learning-modellen in een productieve omgeving
  • Aantoonbare ervaring met het verwerken en analyseren van datasets, inclusief data cleaning
  • Aantoonbare ervaring met Python en machine learning-bibliotheken: PyTorch
  • Aantoonbare kennis van datavisualisatietools: matplotlib en seaborn en PowerBI
  • Taalvereiste: Nederlandstalig op Europees CEFR - niveau C2
  • Aantoonbare expertise in gedistribueerde machine learning en het schalen van AI-modellen op grote datasets (aanbevolen)
  • Aantoonbare ervaring in sector van openbaar vervoer (aanbevolen)