Evaluación de modelos de reconocimiento de voz para traducción quechua-español en el ámbito médico en Cusco
Resumen
En el Perú, el quechua es idioma oficial junto con el español; pese a ello, la población quechuahablante enfrenta una barrera de comunicación en los servicios de salud. Esta investigación evalúa modelos de reconocimiento automático de voz para la traducción de audio en quechua a texto en español en el contexto de consultas médicas. Se recolectaron e integraron distintos conjuntos de datos de audio en quechua con sus traducciones al español, conformando un corpus orientado al entrenamiento y evaluación de modelos de Reconocimiento Automático del Habla (Automatic Speech Recognition) (ASR) y Traducción Automática (Machine Translation) (MT). Se compararon dos enfoques: sistemas en cascada, formados por un módulo de reconocimiento del habla y otro de traducción automática, y sistemas de traducción directa de voz a texto, evaluados con las métricas Bilingual Evaluation Understudy (BLEU) y Character n-gram F-score (ChrF). El mejor desempeño correspondió al sistema en cascada con los modelos Whisper y No Language Left Behind (NLLB) en su segunda configuración, que alcanzó 5,91 en BLEU y 24,66 en ChrF, superando al sistema de traducción directa basado en SpeechT5. Se concluye que, cuando se dispone de pocos datos de entrenamiento, los enfoques en cascada son una alternativa más efectiva para lenguas de bajos recursos como el quechua que la traducción directa con SpeechT5, la cual requiere mayor cantidad de datos para obtener resultados aceptables.
Colecciones
- Tesis [123]

