Ro551/WikiCorrupted_spanish_to_GEC-GED
Viewer • Updated • 67.4k • 28
Este modelo está basado en mT5 y ha sido ajustado para realizar la deteccion de errores gramaticales en español.
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
model = AutoModelForSeq2SeqLM.from_pretrained("mt5-small_ForConditionalGenerationto_GED-es")
tokenizer = AutoTokenizer.from_pretrained("mt5-small_ForConditionalGenerationto_GED-es")
inputs = tokenizer("Texto con errores gramatical", return_tensors="pt")
outputs = model.generate(**inputs)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
| epoch | loss | wer |
|---|---|---|
| 1 | 0.2663 | 0.0648 |
| 2 | 0.0473 | 0.0416 |
| 3 | 0.0265 | 0.0349 |
La metrica utilizada es WER (Word Error Rate) sobre las secuencias generadas.

Este modelo fue entrenado utilizando Hugging Face Transformers, Datasets y Accelerate. El dataset fue generado sinteticamente para la tarea de correccion/deteccion de errores gramaticales (GEC) en español.
Base model
google/mt5-small