Aangeboden stagetopics (geef duidelijk uw voorkeur aan in uw sollicitatie):
-
DevGPT: een GPT ter ondersteuning van het begrijpen en gebruiken van code-repositories
Deze stageopdracht richt zich op het ontwerp en de ontwikkeling van devGPT, een chatbot gebaseerd op Retrieval-Augmented Generation (RAG), met als doel de workflow van ontwikkelaars binnen GitLab te verbeteren. De tool zal projectrepositories automatisch analyseren en samenvatten, installatie- en gebruikershandleidingen genereren en gebruikers ondersteunen met instructies die specifiek zijn voor de gebruikte tools. Daarnaast zal devGPT ontwikkelaars helpen bij het oplossen van problemen door contextuele suggesties en ondersteunende aanbevelingen aan te bieden wanneer zich moeilijkheden voordoen.
Een belangrijk onderdeel van het project is de ontwikkeling van een gestandaardiseerd documentatiekader, waarop devGPT zal steunen om de consistentie, kwaliteit en duidelijkheid van alle gegenereerde documentatie te waarborgen.
-
Verkennende studie naar het gebruik van artificiële intelligentie en alternatieve data voor conjunctuuranalyse
Door de dalende responsgraad op enquêtes wordt het steeds belangrijker om aanvullende gegevensbronnen te verkennen. Dit project heeft als doel na te gaan hoe artificiële intelligentie (AI) kan worden toegepast in de analyse van de economische conjunctuur. De aanpak zal bewust datagedreven zijn en bestaat uit het verzamelen, harmoniseren en benutten van alternatieve gegevensbronnen ter aanvulling van onze bestaande analyses op basis van enquêtes. Mogelijke toepassingen omvatten onder meer tekst- en sentimentanalyse van persberichten en nieuwsgegevens. Deze technieken kunnen helpen om vroegtijdige signalen van keerpunten in het vertrouwen van bedrijven en consumenten te detecteren.
Het doel van deze studie is de haalbaarheid en meerwaarde te beoordelen van het integreren van alternatieve data in het instrumentarium voor conjunctuuranalyse. (Referentievoorbeeld:
Barbaglia et al. (2022), Testing big data in a big crisis: Nowcasting under Covid-19, International Journal of Forecasting.)
-
Verbetering van automatisch gegenereerde testvragen voor de evaluatie van RAG-systemen
Deze stageopdracht richt zich op de verdere ontwikkeling van een bestaande oplossing voor het automatisch genereren van testvragen, specifiek ontworpen voor de evaluatie van Retrieval-Augmented Generation (RAG)-systemen. Het doel is de kwaliteit, relevantie en diversiteit van de gegenereerde vragen te verbeteren, zodat RAG-modellen op een robuustere en schaalbaardere manier kunnen worden getest. De stagiair zal technieken onderzoeken om de vraaggeneratie beter af te stemmen op de opgehaalde context (retrieved context), evaluatiemaatstaven te optimaliseren en mogelijk human-in-the-loop-feedbackmechanismen te integreren om het systeem verder te verfijnen.
Dit project biedt de kans om te werken op het snijvlak van generatieve AI, informatieopvraging (information retrieval) en modelevaluatie, met als doel een betrouwbaarder kader te ontwikkelen voor het testen en verbeteren van RAG-systemen.
-
On-premises LLM's, chatbots en RAG-systemen
Naarmate AI-tools steeds meer ingang vinden, groeit ook de behoefte aan privacy en gegevensbescherming, vooral wanneer vertrouwelijke gegevens en interne werkprocessen betrokken zijn. De meeste huidige AI-oplossingen zijn gericht op de cloud en zijn daardoor niet altijd geschikt voor dergelijke toepassingen. Deze stageopdracht onderzoekt het gebruik van on-premises AI-oplossingen (AI-systemen die binnen de eigen IT-infrastructuur worden gehost) om de haalbaarheid van deze aanpak te evalueren. Daarbij zullen de voor- en nadelen van on-premises Large Language Models (LLM's), chatbots en Retrieval-Augmented Generation (RAG)-systemen worden geanalyseerd, evenals de technische, organisatorische en beveiligingsvereisten die nodig zijn voor een succesvolle implementatie.
Het doel van het project is inzicht te verkrijgen in de mate waarin on-premises AI-oplossingen een haalbaar en veilig alternatief vormen voor cloudgebaseerde toepassingen wanneer gevoelige informatie moet worden verwerkt.
-
Onderzoek naar de impact van Agentic AI op RAG-systemen
Deze stageopdracht onderzoekt hoe Agentic AI – AI-systemen die autonoom beslissingen kunnen nemen en taken kunnen uitvoeren – de prestaties, nauwkeurigheid en operationele kosten van Retrieval-Augmented Generation (RAG)-architecturen beïnvloedt. De studie omvat het vergelijken van RAG-systemen die zijn verrijkt met agentische capaciteiten met traditionele RAG-opstellingen. Daarbij zullen onder meer verbeteringen worden gemeten op het vlak van taakuitvoering, contextuele relevantie en reactietijd (latentie). Daarnaast zal de stagiair het resourceverbruik en de kostimpact van deze systemen analyseren. Op die manier kan worden geëvalueerd welke voordelen Agentic AI biedt en welke afwegingen moeten worden gemaakt wanneer dergelijke mogelijkheden worden geïntegreerd in retrieval-gebaseerde workflows.
Het doel van het project is inzicht te verschaffen in de potentiële meerwaarde van Agentic AI binnen RAG-systemen en de balans te onderzoeken tussen betere prestaties enerzijds en hogere complexiteit, resourcevereisten en kosten anderzijds.
-
Integratie van kennisgrafen in RAG-systemen
Deze stageopdracht onderzoekt de integratie van kennisgrafen (knowledge graphs) in een bestaand Retrieval-Augmented Generation (RAG)-systeem om de kwaliteit van informatieopvraging en het contextueel begrip te verbeteren. De stagiair zal een hybride architectuur ontwerpen en implementeren die vectorgebaseerde informatieopvraging combineert met gestructureerde kennisrepresentaties. Vervolgens zal de impact van deze aanpak op de nauwkeurigheid en relevantie van de gegenereerde antwoorden worden geëvalueerd. Daarnaast omvat het project de ontwikkeling van prestatiemaatstaven om de resultaten van verschillende systeemconfiguraties met elkaar te vergelijken. Er zal ook worden onderzocht voor welke toepassingen kennisgrafen duidelijke voordelen bieden ten opzichte van traditionele RAG-oplossingen.
Het doel van deze studie is inzicht te verkrijgen in de meerwaarde van het combineren van gestructureerde kennis met generatieve AI, en te bepalen in welke situaties kennisgrafen kunnen bijdragen aan betrouwbaardere, nauwkeurigere en contextueel rijkere resultaten binnen RAG-systemen.
-
Evaluatie van Small Language Models versus Large Language Models voor RAG-toepassingen
Deze stageopdracht onderzoekt de afwegingen tussen Small Language Models (SLM's) en Large Language Models (LLM's) binnen de context van Retrieval-Augmented Generation (RAG)-systemen.
Het doel is te analyseren hoe de grootte van een taalmodel de prestaties, nauwkeurigheid, reactietijd (latentie) en het verbruik van reken- en geheugenbronnen beïnvloedt in uiteenlopende toepassingsscenario’s.
De stagiair zal verschillende configuraties benchmarken, waaronder on-premises implementaties, en onderzoeken in welke mate SLM's vergelijkbare resultaten kunnen behalen als LLM's in omgevingen waar privacy, kostenbeheersing of infrastructuurbeperkingen een belangrijke rol spelen. Daarnaast zal het project de sterke en zwakke punten van beide modeltypes in kaart brengen en nagaan welke modelkeuze het meest geschikt is voor specifieke RAG-toepassingen. De resultaten van deze studie zullen helpen bij toekomstige beslissingen rond de selectie van taalmodellen voor schaalbare, efficiënte en kosteneffectieve RAG-implementaties, waarbij een evenwicht wordt gezocht tussen prestaties, operationele kosten en technische vereisten.
-
Methodologische ontwikkeling rond seizoenscorrectie en tijdreeksanalyse met JDemetra+
Seizoenscorrectie speelt een belangrijke rol bij de productie en interpretatie van kortetermijnstatistieken over de economie. Deze thesis zou zich richten op methodologische ontwikkeling rond seizoenscorrectie, met bijzondere aandacht voor de opensourcesoftware JDemetra+, die veel wordt gebruikt door statistische instellingen en centrale banken. Mogelijke onderwerpen zijn onder meer de detectie en behandeling van uitschieters, kalendereffecten, revisies, modelselectie, diagnostiek, of de robuustheid van seizoenscorrectieprocedures in aanwezigheid van structurele breuken en volatiele economische omstandigheden. Het project kan een methodologische literatuurstudie combineren met een empirische toepassing op reële economische tijdreeksen. Daarnaast kan ook worden onderzocht of bestaande tools binnen JDemetra+ kunnen worden uitgebreid of verbeterd.
Het doel is te beoordelen hoe methodologische keuzes de kwaliteit, stabiliteit en interpreteerbaarheid van seizoensgecorrigeerde reeksen beïnvloeden, en bij te dragen aan de verdere ontwikkeling van het instrumentarium voor seizoenscorrectie dat wordt gebruikt in officiële statistieken.
-
Verminderen van het risico op heridentificatie in interne datasets
Data speelt een cruciale rol in de dagelijkse besluitvorming binnen de NBB, zowel voor interne studies als voor extern onderzoek dat gebruikmaakt van onze gegevens. Hoewel directe identificerende gegevens vandaag reeds worden gepseudonimiseerd om bedrijfsgevoelige informatie te beschermen, zijn bijkomende maatregelen mogelijk om de privacy verder te versterken. Deze opdracht heeft als doel een kader te ontwikkelen – bijvoorbeeld in de vorm van een workflow, checklist of praktische richtlijnen – waarmee data-eigenaars kunnen identificeren welke datasets of gegevens een verhoogd risico op heridentificatie inhouden en daarom aanvullende Statistical Disclosure Control (SDC)-maatregelen vereisen.
De stagiair zal onderzoeken welke kenmerken een dataset gevoelig maken voor heridentificatie, bestaande methoden voor risicobeperking analyseren en een praktisch instrument uitwerken dat data-eigenaars ondersteunt bij het nemen van geïnformeerde beslissingen over gegevensbescherming.
Het uiteindelijke doel is de bescherming van vertrouwelijke informatie te versterken en ervoor te zorgen dat interne en externe gebruikers van NBB-gegevens kunnen werken met datasets die zowel bruikbaar als voldoende beschermd zijn tegen ongewenste identificatie van personen of organisaties.
-
Verbeteren van de classificatieprestaties voor de Regulatory Watchtower (JU)
De juridische dienst van de NBB moet dagelijks zowel het Belgisch Staatsblad als het Publicatieblad van de Europese Unie controleren op juridische publicaties die relevant kunnen zijn voor bepaalde stakeholders binnen de juridische afdeling. Er werd reeds een eerste classificatiemodel ontwikkeld op basis van een Large Language Model (LLM). Dit model is bovendien geëvalueerd aan de hand van een omvangrijke dataset die door menselijke experts werd geannoteerd.
Deze opdracht heeft als doel de nauwkeurigheid van de huidige classificator verder te verbeteren. Daarbij zal worden onderzocht hoe zowel promptoptimalisatie (bijvoorbeeld via dataminingtechnieken) als klassieke NLP-methoden (Natural Language Processing) kunnen bijdragen aan betere resultaten.
De stagiair zal verschillende benaderingen testen en vergelijken om te bepalen welke technieken de relevantie en betrouwbaarheid van de classificaties het meest verhogen. Het uiteindelijke doel is een efficiënter systeem te ontwikkelen dat juridische publicaties nauwkeuriger kan koppelen aan de juiste interne stakeholders, waardoor de opvolging van regelgeving verder kan worden geautomatiseerd en verbeterd.