Última hora |
|
Comunicados - 17/09/2026
La tesis de Julen Etxaniz, investigador del Centro de Investigación de la Universidad del País Vasco, demuestra que es posible mejorar la inteligencia artificial en lenguas con pocos recursos como el euskera, adaptando modelos existentes, sin entrenarlos desde cero desarrolla una estrategia abierta para adaptar modelos de lenguaje a lenguas con pocos recursos digitales
La investigación demuestra que los modelos de inteligencia artificial pueden mejorar significativamente su dominio del euskera y de la cultura vasca mediante la adaptación de modelos existentes, evitando el elevado coste de entrenarlos desde cero.
La tesis desarrolla Latxa, una familia de modelos de lenguaje abiertos específicamente adaptados al euskera y a la realidad cultural vasca, que ya se utiliza en herramientas de asistencia conversacional y traducción.
Los métodos desarrollados pueden aplicarse también a otras lenguas con pocos recursos, como el catalán, el gallego, el occitano o el maorí, contribuyendo a una inteligencia artificial más inclusiva y menos dependiente de las lenguas mayoritarias.
La inteligencia artificial no parte de las mismas condiciones para todas las lenguas. Los grandes modelos de lenguaje aprenden principalmente a partir de los textos disponibles en internet y, mientras que el inglés y el castellano cuentan con grandes cantidades de datos digitales, otras lenguas disponen de muchos menos corpus, modelos abiertos y herramientas para evaluar el rendimiento de la IA. Esta desigualdad hace que los sistemas de inteligencia artificial comprendan y generen peor estas lenguas y, además, tengan un conocimiento más limitado de la realidad cultural de sus hablantes.
Abordar este problema ha sido el objetivo de la tesis doctoral Hizkuntza-ereduak hobetzen baliabide gutxiko hizkuntzetan (Mejora de los modelos de lenguaje para lenguas con escasos recursos), presentada recientemente por Julen Etxaniz, investigador del Centro HiTZ de la Universidad del País Vasco (EHU).
La principal conclusión del trabajo es que no es necesario entrenar un gran modelo de inteligencia artificial desde cero para conseguir mejores resultados en una lengua con pocos recursos. La investigación demuestra que es posible aprovechar modelos de lenguaje existentes y adaptarlos a las necesidades específicas de cada comunidad lingüística: "Mi tesis demuestra que podemos mejorar la inteligencia artificial en lenguas con pocos recursos como el euskera adaptando modelos existentes, sin entrenarlos desde cero", explica Julen Etxaniz.
El trabajo plantea así una vía para que el avance de la inteligencia artificial no quede limitado a las lenguas que cuentan con grandes cantidades de datos digitales. La experiencia desarrollada en euskera demuestra que las comunidades lingüísticas con menos recursos pueden disponer también de modelos abiertos, competitivos y adaptados a su realidad, siempre que se combinen investigación específica, datos de calidad y sistemas adecuados de evaluación.
La investigación plantea una estrategia completa y abierta para mejorar la inteligencia artificial en este tipo de lenguas. Entre sus principales aportaciones se encuentra Latxa, una familia de modelos de lenguaje abiertos desarrollados para el euskera y adaptados también a la cultura y al contexto vasco.
La diferencia es especialmente relevante cuando se utilizan estos sistemas para interactuar en euskera. Un modelo entrenado fundamentalmente con contenidos en inglés o castellano puede ser capaz de generar texto en euskera, pero no necesariamente comprende la lengua con el mismo nivel de profundidad ni conoce adecuadamente las referencias culturales y el contexto local: "El objetivo no es solo que la IA traduzca o escriba en euskera. También debe desenvolverse de forma fiable en la lengua y conocer la realidad cultural de sus hablantes", señala el investigador.
De la investigación a la ciudadanía
Los resultados de la tesis tienen aplicaciones directas en algunos de los usos más habituales de la inteligencia artificial, como los asistentes conversacionales y la traducción automática. Por ejemplo, una persona que consulte en euskera a un asistente de IA sobre un aspecto concreto de la cultura vasca puede obtener, gracias a un modelo adaptado, una respuesta más natural y contextualizada, sin tener que recurrir al castellano. Del mismo modo, los avances en los modelos de lenguaje pueden contribuir a mejorar la calidad de las traducciones automáticas al euskera.
En este ámbito, Latxa ha mostrado mejores resultados como traductor que modelos especializados de traducción anteriores. Tanto el modelo como las herramientas desarrolladas a partir de esta investigación ya están disponibles para la ciudadanía a través de Latxa.
"La adaptación aporta un mejor dominio del euskera y más conocimiento sobre la cultura y el entorno local. Además, los recursos son abiertos, lo que permite que la comunidad pueda adaptarlos y evaluarlos de forma independiente", destaca Etxaniz.
Un método aplicable a otras lenguas
Aunque el euskera constituye uno de los principales casos de estudio de la tesis, la metodología desarrollada no está vinculada exclusivamente a esta lengua. El trabajo demuestra que el mismo planteamiento puede utilizarse para mejorar modelos de IA en otras lenguas con pocos recursos digitales, siempre que se realice un trabajo específico para cada comunidad.
De hecho, investigadores de Hitz ya han aplicado estos métodos a lenguas con características diferentes, entre ellas el catalán, el gallego, el occitano y el maorí.
"El euskera sirve como caso de estudio para desarrollar métodos útiles para muchas otras comunidades", explica Etxaniz. "Los resultados no son automáticos: cada lengua necesita corpus de calidad y pruebas que reflejen tanto sus características lingüísticas como su cultura".
Otro de los elementos destacados de la tesis es su apuesta por la ciencia abierta. Los modelos, datos, evaluaciones y programas desarrollados en el marco de la investigación están disponibles con licencias abiertas, de manera que otros investigadores y comunidades puedan reutilizarlos, comprobar los resultados y continuar desarrollándolos. De hecho, los desarrollos realizados ya están sirviendo de base para nuevas investigaciones relacionadas con el seguimiento de instrucciones, la veracidad de los modelos y la inteligencia artificial multimodal, y Latxa se ha incorporado a herramientas reales de asistencia y traducción.
Los tres trabajos principales que forman parte de la investigación fueron publicados en algunas de las principales conferencias internacionales del ámbito como NAACL, ACL y NeurIPS. El trabajo sobre Latxa recibió, además, el premio al mejor artículo de recursos en ACL 2024.
Centro HiTZ – Basque Center for Language Technology
El Centro HiTZ es un centro de investigación de la Universidad del País Vasco (EHU) especializado en tecnologías del lenguaje y procesamiento del lenguaje natural. Su actividad abarca áreas como la inteligencia artificial, los modelos de lenguaje, la traducción automática, el reconocimiento y síntesis del habla y las tecnologías multilingües, con especial atención al euskera y a otras lenguas con pocos recursos. El centro trabaja para desarrollar tecnologías lingüísticas avanzadas y ponerlas al servicio de la sociedad, impulsando al mismo tiempo la investigación abierta y la colaboración científica a nivel internacional.
Xavier Rius
El president reclama que Catalunya deixi de mirar-se el melic mentre proclama que serà l’avantgua...
Marta Martín García
La Administración vuelve a maltratar al enfermo
Desde el 1 de septiembre, quienes solicitan o perciben determinadas prestaciones por incapacidad est...