Técnica de otimização de kernels de atenção que reduz o tráfego de memória e acelera o treinamento de modelos de linguagem.