Recherche
ConversaETL et ConversaBench : planification typée et compilation déterministe pour un ETL conversationnel vérifiable
Comprendre en langage naturel. Exécuter de façon déterministe.

ConversaETL explore l'orchestration conversationnelle de flux d'intégration de données : un LLM interprète l'intention, un système déterministe l'exécute et la valide.
Statut
Sous revue par les pairs
Auteurs
Houcem Hammami, Karim Bettaieb
Résumé
Les agents de données fondés sur les grands modèles de langage (LLM) ne révèlent souvent les échecs de transformation qu'au moment de l'exécution. ConversaETL convertit plutôt les demandes ETL en langage naturel en une représentation intermédiaire typée et en opérateurs de transformation déterministes, vérifiés par contrat, en bornant le rôle du modèle à la planification et non à l'exécution. ConversaBench évalue cette conception sur ConversaBench-Full, un sous-ensemble à stress sémantique et une extension ETL inter-schémas. Sur ConversaBench-Full, le compilateur hybride (HC) améliore le score du compilateur seul (CO) de +0,274 point de justesse (IC 95 % [0,218, 0,332]), jusqu'à +0,356 sur le sous-ensemble à stress sémantique et +0,407 sur ses prompts les plus difficiles. Face à une base de génération directe de code LLM appariée par répétition, HC évite les erreurs courantes de dates, de clés, de plans invalides et de sécurité ; la base directe atteint 0,308 de justesse moyenne. Une ablation de l'architecture en six couches identifie la planification d'insights exploratoires comme le contributeur sémantique le plus important. Ces résultats soutiennent un ETL conversationnel vérifiable par une planification ancrée dans le schéma, une compilation déterministe et un package de benchmark reproductible. Les vérifications streaming, dashboard et fournisseur local sont rapportées uniquement comme validations complémentaires.
Manuscrit sous revue par les pairs. Aucun PDF ni statut de publication n'est revendiqué à ce stade.
