Documento de conferencia
Acceso Abierto

Desambiguación y enlazado de entidades en la poesía de Catulo: hacia una edición digital enriquecida y un grafo de conocimiento

Resumen

Este trabajo se inscribe en un proyecto más amplio orientado al estudio del discurso amoroso mediante herramientas computacionales. En esta oportunidad, nos concentramos en un corpus de poesía latina del período clásico, la obra de Cayo Valerio Catulo, cuya densidad semántica e histórica vuelve especialmente relevante la identificación y desambiguación de referencias a personas, lugares y grupos. Dada la naturaleza de los textos poéticos, estas entidades suelen aparecer en contextos altamente alusivos, con variación morfológica, ambigüedad semántica y recursos estilísticos como el hipérbaton, lo que dificulta su tratamiento automático. Para abordar este problema, evaluamos comparativamente dos enfoques de entity linking sobre Wikidata: un pipeline modular basado en reconocimiento de entidades, generación de candidatos y ranking semántico, y un enfoque generativo basado en GPT-4.1, utilizado tanto para la detección de menciones como para la selección final de entidades. La evaluación se apoya en un ground truth manual y distingue entre reconocimiento de entidades y enlazado semántico. Los resultados muestran comportamientos complementarios: el pipeline tradicional ofrece mayor trazabilidad y mejor cobertura del espacio de candidatos, mientras que el enfoque generativo alcanza mayor precisión en detección y mejor desempeño en la selección final de entidades, aunque con una estrategia más conservadora. En conjunto, el trabajo aporta una evaluación comparativa de métodos para poesía latina y sienta las bases para el enriquecimiento de una edición digital en XML-TEI con identificadores auditables y el diseño de un grafo de conocimiento literario.

This work forms part of a broader project aimed at studying love discourse through computational methods. In this paper, we focus on a corpus of Classical Latin poetry, namely the works of Gaius Valerius Catullus, whose semantic and historical density makes the identification and disambiguation of references to people, places, and groups especially relevant. Given the nature of poetic texts, such entities often appear in highly allusive contexts, with morphological variation, semantic ambiguity, and stylistic devices such as hyperbaton, which make their automatic processing particularly challenging. To address this problem, we comparatively evaluate two entity linking approaches over Wikidata: a modular pipeline based on named entity recognition, candidate generation, and semantic ranking, and a generative approach based on GPT-4.1, used both for mention detection and for final entity selection. The evaluation relies on a manually curated ground truth and distinguishes between named entity recognition and semantic linking. The results show complementary behaviors: the traditional pipeline offers greater traceability and broader candidate-space coverage, whereas the generative approach achieves higher precision in mention detection and better performance in final entity selection, albeit with a more conservative strategy. Overall, the paper provides a comparative evaluation of methods for Latin poetry and lays the groundwork for enriching an XML-TEI digital edition with auditable identifiers and for Tdesigning a literary knowledge graph.v

Palabras clave
named entity recognition
entity linking
large language models
Latin poetry
Gaius Valerius Catullus
Wikidata
XML-TEI
knowledge graph
http://creativecommons.org/licenses/by-nc-sa/4.0/

Esta obra se publica con la licencia Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (BY-NC-SA 4.0)

item.page.license
Cargando...
Miniatura