Ir para o conteúdo

Gradientes BF16 crescem no fim do treinamento

Um artigo relata aumento de 1.000 vezes na norma do gradiente após 25 bilhões de tokens em um transformer treinado com FlashAttention-3 em BF16.

Por Wendelmaques ·

Fonte: Gradientes de BF16 no FlashAttention-3 podem crescer no fim do treinamento (arxiv.org). Texto preparado com IA a partir dessa fonte.

O que aconteceu e o que fazer

Publicado em 4 de outubro de 2026, o artigo relata que um transformer de 450 milhões de parâmetros treinado com FlashAttention-3 em BF16 apresentou aumento de 1.000 vezes na norma do gradiente após 25 bilhões de tokens. O treinamento terminou com loss maior que na configuração com atenção FP32, sem ocorrência de NaNs. Recalcular em FP32 o backward da atenção de duas camadas removeu o problema relatado.

Empresas que treinam modelos com atenção fused em BF16 podem avaliar a estabilidade ao longo de execuções extensas, comparando normas de gradiente e loss com uma configuração FP32. Uma implementação prática pode registrar esses indicadores por etapa, alertar para desvios tardios e testar o recálculo seletivo do backward em FP32 antes de adotar a mitigação em produção.

Como a consultoria pode ajudar

A Wendelmaques pode diagnosticar a exposição do pipeline de treinamento, definir testes comparativos e implementar monitoramento de gradientes e loss, além de uma mitigação seletiva em FP32, com escopo e operação definidos para o ambiente do cliente.

Próximo passo

Envie uma breve descrição do modelo, da configuração de treinamento e do problema observado para receber uma proposta com escopo definido.

Consultoria para seu projeto

Diagnóstico, implantação e acompanhamento da infraestrutura, com escopo e investimento definidos na proposta.

Sob proposta

Solicitar proposta