Evaluación de large language model en la generación de respuestas para preguntas sobre las leyes deportivas de ajedrez
Resumen
Los large language model (LLM) vienen demostrando un desempeño muy sobresaliente en tareas del procesamiento del lenguaje natural (NLP). Sin embargo, su rendimiento en tareas de preguntas y respuestas en dominios cerrados necesita un análisis más profundo. El manual deportivo de ajedrez representa un dominio cerrado y estructurado lo que hace pertinente la evaluación de los LLMs en este escenario. Este estudio plantea la evaluación de los LLMs considerando las arquitecturas encoder, encoder-decoder y decoder aplicando sobre ellos las métricas Strict Accuracy, Lenient Accuracy, Similitud Semántica y que fueron complementadas con evaluación humana que es indispensable en este tipo de tareas. Para ello se elabora un dataset basado en le manual deportivo de ajedrez considerando el contexto, la pregunta y la respuesta asociada a la misma. Los resultados muestran que los LLMs tienen un buen desempeño en responder preguntas donde la información se halla directamente en el contexto. Por otro lado, se observan limitaciones en las preguntas que necesitan un razonamiento adicional o la aplicación de varias reglas al mismo tiempo. Se concluye que los LLMs son de gran utilidad en tareas de preguntas y respuestas, su aplicación en dominios cerrados requiere de evaluaciones específicas, además que la elaboración de un dataset es un proceso complejo y necesario para una buena evaluación de los modelos.
Colecciones
- Tesis [116]

