Sujets de stage proposés (merci d’indiquer votre ordre de préférence dans votre candidature) :
-
DevGPT : un GPT pour soutenir la compréhension et l’utilisation des dépôts de code
Ce stage explorera la conception et le développement de devGPT, un chatbot fondé sur la génération augmentée par récupération (Retrieval-Augmented Generation, RAG), destiné à améliorer les flux de travail des développeurs dans GitLab. L’outil analysera et résumera automatiquement les dépôts de projets, générera des guides d’installation et d’utilisation, et aidera les utilisateurs avec des instructions spécifiques aux outils. En outre, devGPT soutiendra les développeurs dans la résolution de problèmes en proposant des suggestions contextuelles et une assistance de secours lorsque des difficultés surviennent. Un élément clé du projet sera la création d’un cadre de documentation standardisé, sur lequel devGPT s’appuiera afin de garantir la cohérence et la clarté de l’ensemble du contenu généré.
-
Étude exploratoire sur l’utilisation de l’IA et de données alternatives pour l’analyse conjoncturelle
Compte tenu de la baisse des taux de réponse aux enquêtes, il devient de plus en plus important d’explorer des sources de données complémentaires. Ce projet vise à examiner comment l’intelligence artificielle peut être appliquée à l’analyse conjoncturelle. L’approche serait délibérément axée sur les données : collecter, harmoniser et exploiter des sources de données alternatives afin de compléter nos analyses fondées sur les enquêtes existantes. Les applications possibles comprennent l’analyse textuelle et l’analyse de sentiment de communiqués de presse et de données d’actualité, qui pourraient contribuer à détecter précocement des signaux de retournement du climat des affaires et de la confiance des consommateurs. L’objectif est d’évaluer la faisabilité et la valeur ajoutée de l’intégration de données alternatives dans notre boîte à outils d’analyse conjoncturelle. (Référence d’exemple : Barbaglia et al. (2022). Testing big data in a big crisis: Nowcasting under Covid-19. International Journal of Forecasting.)
-
Amélioration de la génération automatique de questions de test pour l’évaluation des systèmes RAG
Ce stage se concentrera sur l’amélioration d’une solution existante de génération automatique de questions de test, conçue spécifiquement pour évaluer les systèmes de génération augmentée par récupération (RAG). L’objectif est d’améliorer la qualité, la pertinence et la diversité des questions générées, afin de permettre des tests plus robustes et plus évolutifs des modèles RAG. Le/la stagiaire explorera des techniques permettant d’aligner la génération de questions sur le contexte récupéré, d’optimiser les métriques d’évaluation et, éventuellement, d’intégrer des mécanismes de retour humain dans la boucle afin d’affiner le système.
-
LLM, chatbots et RAG sur site
À mesure que les outils d’IA se généralisent, le besoin de confidentialité, en particulier pour les données et les flux de travail confidentiels, devient plus important. La plupart des produits actuels sont axés sur le cloud et ne conviennent donc pas à ce cas d’utilisation. Ce stage explorera l’utilisation d’outils d’IA sur site afin d’analyser la faisabilité ainsi que les avantages et les inconvénients de cette approche, de même que les exigences nécessaires.
-
Exploration de l’impact de l’IA agentique sur les systèmes RAG
Ce stage examinera comment l’IA agentique — des systèmes capables de prendre des décisions et d’exécuter des tâches de manière autonome — influence la performance, la précision et le coût opérationnel des architectures RAG. L’étude comprendra une comparaison de systèmes RAG enrichis par des capacités agentiques avec des configurations traditionnelles, en mesurant les améliorations en matière d’exécution des tâches, de pertinence contextuelle et de latence. En outre, le/la stagiaire analysera la consommation de ressources et les implications en termes de coûts, fournissant ainsi des informations sur les compromis liés à l’intégration de capacités agentiques dans des flux de travail fondés sur la récupération d’information.
-
Intégration de graphes de connaissances dans les systèmes RAG
Ce stage explorera l’intégration de graphes de connaissances dans un système RAG existant afin d’améliorer la qualité de la récupération d’information et la compréhension contextuelle. Le/la stagiaire concevra et mettra en œuvre une architecture hybride combinant une récupération fondée sur des vecteurs avec des représentations structurées des connaissances, et évaluera son impact sur la précision et la pertinence. Le projet impliquera également le développement de métriques permettant de comparer les performances selon différentes configurations et d’identifier les cas d’utilisation dans lesquels les graphes de connaissances offrent des avantages clairs.
-
Évaluation des petits modèles de langage par rapport aux grands modèles de langage pour les applications RAG
Ce stage examinera les compromis entre les petits modèles de langage (Small Language Models, SLM) et les grands modèles de langage (Large Language Models, LLM) dans le contexte des systèmes de génération augmentée par récupération (RAG). L’objectif est d’évaluer l’impact de la taille du modèle sur la performance, la précision, la latence et la consommation de ressources dans différents cas d’utilisation. Le/la stagiaire comparera différentes configurations, y compris des déploiements sur site, et explorera si les SLM peuvent offrir des résultats compétitifs dans des environnements contraints où la confidentialité, les coûts ou les limitations d’infrastructure constituent des préoccupations essentielles. Le résultat aidera à orienter les futures décisions relatives au choix des modèles pour des implémentations RAG évolutives et efficaces.
-
Développement méthodologique en désaisonnalisation et analyse des séries temporelles avec JDemetra+
La désaisonnalisation joue un rôle clé dans la production et l’interprétation des statistiques économiques à court terme. Ce mémoire se concentrerait sur le développement méthodologique lié à la désaisonnalisation, avec une attention particulière portée au logiciel open source JDemetra+, largement utilisé par les institutions statistiques et les banques centrales. Les sujets possibles incluent la détection et le traitement des valeurs aberrantes, les effets calendaires, les révisions, la sélection de modèles, les diagnostics ou la robustesse des procédures de désaisonnalisation en présence de ruptures structurelles et de conditions économiques volatiles. Le projet pourrait combiner une revue méthodologique avec une application empirique à de véritables séries temporelles économiques, et pourrait également explorer d’éventuelles extensions ou améliorations des outils existants implémentés dans JDemetra+. L’objectif est d’évaluer comment les choix méthodologiques influencent la qualité, la stabilité et l’interprétabilité des séries désaisonnalisées, et de contribuer au développement ultérieur de la boîte à outils de désaisonnalisation utilisée dans les statistiques officielles.
-
Réduction du risque de réidentification dans les jeux de données internes
Les données jouent un rôle clé dans la prise de décision quotidienne à la BNB, sur la base d’études internes ou de recherches externes utilisant nos données. Bien que nous pseudonymisions déjà les identifiants directs afin de protéger les informations de l’entreprise, des actions supplémentaires sont possibles. Cette mission vise à développer un cadre, tel qu’un flux de travail ou une checklist, afin d’aider les propriétaires de données à identifier les données critiques nécessitant des contrôles SDC supplémentaires.
-
Amélioration des performances de classification pour le Regulatory Watchtower (JU)
Le département juridique de la BNB doit consulter quotidiennement le Moniteur belge et le Journal officiel de l’Union européenne afin d’identifier les publications juridiques correspondant à certains critères de pertinence pour des parties prenantes spécifiques au sein du département juridique. Nous avons déjà testé un classificateur de base fondé sur un LLM et l’avons évalué sur un vaste jeu de données annoté manuellement. Cette mission vise à améliorer la précision de notre classificateur actuel, à la fois au moyen d’améliorations des prompts (par exemple via l’exploration de données) et de techniques classiques de traitement automatique du langage naturel (NLP).