Analyser automatiquement la syntaxe du latin
THIVLVC est un système en deux étapes conçu pour la tâche d’analyse syntaxique d’EvaLatin 2026.
Le système part d’une analyse produite par UDPipe, recherche dans le treebank CIRCSE des phrases latines structurellement proches, puis demande à un grand modèle de langue de réviser l’analyse à partir de ces exemples et des conventions Universal Dependencies.
Deux configurations ont été évaluées : une version sans recherche documentaire et une version utilisant la génération augmentée par récupération, ou RAG. Le travail porte à la fois sur un corpus poétique de Sénèque et un corpus de prose de Thomas d’Aquin.
Synthèse établie à partir de la notice et de l’article publiés dans ACL Anthology.
Une analyse en trois opérations
Le dispositif combine un analyseur établi, une recherche structurale et une révision guidée par les conventions d’annotation.
Analyse initiale
UDPipe fournit une première analyse en dépendances pour chaque phrase latine.
Exemples proches
Le système interroge CIRCSE selon la longueur des phrases et la similarité des n-grammes de parties du discours.
Révision par LLM
Un grand modèle de langue affine l’analyse grâce aux exemples retrouvés et aux règles Universal Dependencies.
Résultats rapportés
Les résultats diffèrent selon le genre du corpus et la métrique d’évaluation ; ils sont donc présentés sans classement global simplificateur.
| Mesure | Corpus | Résultat rapporté |
|---|---|---|
| +17 points CLAS | Poésie · Sénèque | Gain par rapport à la baseline UDPipe. |
| +1,5 point CLAS | Prose · Thomas d’Aquin | Gain par rapport à la baseline UDPipe. |
| 53,3 % | 300 divergences analysées en aveugle | Part des décisions unanimes favorisant THIVLVC. |
Classements de la tâche partagée
Selon l’article d’évaluation des organisateurs, la configuration THIVLVC avec RAG arrive en tête sur le corpus poétique pour les quatre classements publiés : CLAS et LAS, avec ou sans sous-types. Sur le corpus de prose, elle obtient le meilleur LAS sans sous-types avec un score F1 de 87,93 ; les autres classements de prose sont menés par UppsalaNLP.
Citer la publication
Référence bibliographique fournie par ACL Anthology.
Luc Pommeret, Thibault Wagret et Jules Deret. 2026. « THIVLVC: Retrieval Augmented Dependency Parsing for Latin ». Dans Proceedings of the Fourth Workshop on Language Technologies for Historical and Ancient Languages (LT4HALA 2026) @ LREC 2026, p. 219–225. Palma de Majorque : ELRA Language Resources Association.
Sources primaires
Les faits, chiffres et métadonnées de cette page sont reliés aux publications scientifiques qui les établissent.