Ir para o conteúdo

Roteamento de experts com eficiência de memória para treinamento distribuído de MoE

O artigo no arXiv propõe métodos para reduzir o pico de memória no treinamento distribuído de Mixture-of-Experts, em que o dispatch de experts domina o uso de memória.

Por Wendelmaques ·

Fonte: Roteamento de Experts com Eficiência de Memória para Treinamento Distribuído de MoE (arxiv.org). Texto preparado com IA a partir dessa fonte.

O que aconteceu e o que fazer

O artigo aponta que, no treinamento distribuído de modelos Mixture-of-Experts, o pipeline de dispatch do MoE é o principal responsável pelo pico de memória. O foco está no dispatcher all-to-all, que constrói de uma vez o buffer completo expandido por top-k, o que cresce com o número de tokens e de experts. Os autores propõem métodos para reduzir esse pico.

Na prática, uma equipe que treina MoE grande pode medir primeiro onde a memória é consumida, separando o custo do dispatch do custo dos experts e das ativações. Depois, é possível avaliar estratégias como dividir o dispatch em lotes menores, reduzir a materialização do buffer expandido e ajustar capacidade e roteamento por dispositivo. Um pipeline de métricas de memória por etapa, com alertas de pico, permite validar cada mudança antes de escalar o treinamento.

Como a consultoria pode ajudar

Diagnóstico do uso de memória no treinamento MoE da sua infraestrutura, identificando o peso do dispatch all-to-all no pico. Em seguida, desenho e implementação escopados de ajustes no pipeline de dispatch e de monitoramento de memória por etapa, com operação acompanhada.

Próximo passo

Se sua equipe treina modelos MoE e esbarra em limites de memória no dispatch entre dispositivos, envie uma descrição curta do seu caso: tamanho do modelo, número de experts, hardware e onde o pico ocorre. Respondemos com uma proposta escopada.

Consultoria para seu projeto

Diagnóstico, implantação e acompanhamento da infraestrutura, com escopo e investimento definidos na proposta.

Sob proposta

Solicitar proposta