Optimización de la memoria y entrada/salida de GPU para acelerar el mecanismo de atención en modelos de lenguaje.