Publication · LT4HALA / LREC 2026

THIVLVC

Retrieval Augmented Dependency Parsing for Latin

Luc Pommeret, Thibault Wagret et Jules Deret.

Synthèse

Analyser automatiquement la syntaxe du latin

THIVLVC est un système en deux étapes conçu pour la tâche d’analyse syntaxique d’EvaLatin 2026.

Le système part d’une analyse produite par UDPipe, recherche dans le treebank CIRCSE des phrases latines structurellement proches, puis demande à un grand modèle de langue de réviser l’analyse à partir de ces exemples et des conventions Universal Dependencies.

Deux configurations ont été évaluées : une version sans recherche documentaire et une version utilisant la génération augmentée par récupération, ou RAG. Le travail porte à la fois sur un corpus poétique de Sénèque et un corpus de prose de Thomas d’Aquin.

Synthèse établie à partir de la notice et de l’article publiés dans ACL Anthology.

Méthode

Une analyse en trois opérations

Le dispositif combine un analyseur établi, une recherche structurale et une révision guidée par les conventions d’annotation.

  1. Étape 1

    Analyse initiale

    UDPipe fournit une première analyse en dépendances pour chaque phrase latine.

  2. Étape 2

    Exemples proches

    Le système interroge CIRCSE selon la longueur des phrases et la similarité des n-grammes de parties du discours.

  3. Étape 3

    Révision par LLM

    Un grand modèle de langue affine l’analyse grâce aux exemples retrouvés et aux règles Universal Dependencies.

Évaluation

Résultats rapportés

Les résultats diffèrent selon le genre du corpus et la métrique d’évaluation ; ils sont donc présentés sans classement global simplificateur.

MesureCorpusRésultat rapporté
+17 points CLASPoésie · SénèqueGain par rapport à la baseline UDPipe.
+1,5 point CLASProse · Thomas d’AquinGain par rapport à la baseline UDPipe.
53,3 %300 divergences analysées en aveuglePart des décisions unanimes favorisant THIVLVC.

Classements de la tâche partagée

Selon l’article d’évaluation des organisateurs, la configuration THIVLVC avec RAG arrive en tête sur le corpus poétique pour les quatre classements publiés : CLAS et LAS, avec ou sans sous-types. Sur le corpus de prose, elle obtient le meilleur LAS sans sous-types avec un score F1 de 87,93 ; les autres classements de prose sont menés par UppsalaNLP.

Consulter l’article d’évaluation officiel d’EvaLatin 2026.

Référence

Citer la publication

Référence bibliographique fournie par ACL Anthology.

Luc Pommeret, Thibault Wagret et Jules Deret. 2026. « THIVLVC: Retrieval Augmented Dependency Parsing for Latin ». Dans Proceedings of the Fourth Workshop on Language Technologies for Historical and Ancient Languages (LT4HALA 2026) @ LREC 2026, p. 219–225. Palma de Majorque : ELRA Language Resources Association.
Sources

Sources primaires

Les faits, chiffres et métadonnées de cette page sont reliés aux publications scientifiques qui les établissent.