📚 TFG: Diseño de un sistema de evaluación de grandes modelos de lenguaje basado en técnicas de parafraseo de cuestionarios
Este repositorio contiene el código, datasets y resultados de experimentos realizados durante el TFG, cuyo objetivo es evaluar a los modelos de lenguaje de gran tamaño (LLM) utilizando técnicas de parafraseo de cuestionarios.
📦 TFG_Sandra
├── 📁 Datasets. Conjunto de datos utilizados en los experimentos
├── 📁Resultados. Resultados generados a partir de las pruebas con los modelos
└──── 📁MMLU
└──── 📁MMLU pro
├── 📁 Scripts. Código para preprocesamiento, evaluación y experimentos
└── README.md. Documentación del repositorio
El estudio se centra en evaluar cómo la información se ve afectada a través de un proceso de reformulación y parafraseo en modelos de lenguaje. Se analizan las tasas de aciertos antes y después del parafraseo y se analiza como se degrada la información.
- Se han realizado pruebas con preguntas del dataset MMLU y MMLU pro en diferentes categorías.
📍 Ver detalles en la carpeta Resultados/.
Los conjuntos de datos empleados en este estudio incluyen:
- MMLU: Conjunto de preguntas del Massive Multitask Language Understanding (MMLU).
- MMLU pro: Conjunto de preguntas del Massive Multitask Language Understanding pro(MMLU pro).
📍 Disponibles en la carpeta Datasets/.
✉ Contacto: Para dudas o colaboración, puedes abrir un issue en este repositorio.