Como dimensionar GPUs e custos de inferência de IA
Contexto, concorrência, fila e latência: critérios de medição para dimensionar a infraestrutura e os custos de um produto de IA.
Avalie a memória além dos pesos do modelo
A memória necessária para carregar o modelo é apenas o primeiro limite. A operação também precisa de espaço para cache e trabalho simultâneo. Contextos longos e mais requisições ativas alteram esse orçamento.
A capacidade por GPU depende do modelo, da configuração e da distribuição de entradas do produto. Um número de usuários sem essas condições não serve como referência de dimensionamento.
Prepare uma carga representativa
- Registre tamanhos de entrada e saída, horários de pico e volume esperado.
- Varie a concorrência e observe quando a fila cresce sem recuperar.
- Meça tempo até o primeiro token, tempo total e erros; avalie a distribuição, além da média.
- Declare se a latência inclui fila, rede e preparação da entrada.
Calcule o custo por resultado entregue
Divida o custo do período pelo trabalho concluído dentro das metas de qualidade e latência. Inclua tempo ocioso, armazenamento, transferência e esforço de operação que fizerem parte do contrato.
Compare infraestrutura própria, alugada e API gerenciada com a mesma carga. A alternativa de menor preço por hora pode apresentar um custo maior por resultado útil.
Avalie o compartilhamento de GPU
Alternar LLM, transcrição e síntese de voz pode permitir o uso do mesmo hardware. Entretanto, o carregamento de modelos leva tempo e pode afetar as requisições em espera. Meça esse impacto antes de adotar a arquitetura.
O diagnóstico pode incluir testes de carga, limites de concorrência, orçamento e critérios para ampliar ou separar a infraestrutura. Os entregáveis são definidos na proposta.
Consultoria para seu projeto
Diagnóstico, implantação e acompanhamento da infraestrutura, com escopo e investimento definidos na proposta.
Consultoria
Diagnóstico, implantação e gestão da infraestrutura de IA, conforme as necessidades da sua empresa.