Home » NVIDIA usa energia ociosa para elevar throughput de IA em teste

NVIDIA usa energia ociosa para elevar throughput de IA em teste

por Redação
0 comentários
Ilustração editorial de racks de GPUs ligados a um medidor de energia e a gráficos de capacidade.

A NVIDIA publicou em 27 de setembro um teste em que aumentou o throughput de IA ao instalar mais GPUs sem ampliar o orçamento elétrico provisionado. O experimento, realizado com a Nscale no campus da Verne na Islândia, comparou duas configurações sob o mesmo limite de 264,4 kW.

De acordo com o NVIDIA Developer Blog, a configuração de referência usou 140 GPUs, enquanto a segunda operou 192 GPUs com o sistema DSX MaxLPS. A empresa reportou aumento de 49,2% no throughput agregado e avanço de 4,10 para 6,12 na métrica de throughput por watt provisionado.

O que significa usar energia ociosa

Data centers dimensionam alimentação e refrigeração para limites que não são atingidos por todos os equipamentos ao mesmo tempo. Cargas de inferência variam, e uma GPU pode ficar abaixo do consumo máximo durante parte da operação. O DSX MaxLPS tenta coordenar potência entre sistemas para instalar mais capacidade física sem ultrapassar o teto elétrico definido para o ambiente.

Isso não cria energia. O mecanismo controla como o orçamento disponível é distribuído e limita picos para manter a instalação dentro da capacidade provisionada. O ganho de throughput de IA aparece quando a soma de mais GPUs operando com restrições supera o resultado de um conjunto menor configurado de forma convencional.

O cálculo é relevante porque ampliar entrada elétrica, subestações e refrigeração pode exigir obras e prazos maiores que a compra de aceleradores. O texto sobre o peso físico da infraestrutura de IA detalha como energia, rede e operação condicionam projetos de grande escala.

A comparação feita na Islândia

O teste manteve o orçamento em 264,4 kW e mudou a quantidade de GPUs de 140 para 192. A NVIDIA afirma que o throughput agregado aumentou 49,2%. Quando o resultado é dividido pela potência provisionada, a métrica publicada sobe de 4,10 para 6,12.

Esses valores medem a carga escolhida, o hardware, a configuração e o software usados no experimento. Não demonstram que qualquer cluster obterá o mesmo percentual. Modelos diferentes, tamanhos de lote, padrões de tráfego, rede, resfriamento e objetivos de latência alteram o ponto ótimo.

A relação entre potência e resultado também aparece em dispositivos menores. O artigo sobre chips mobile em computadores explica por que desempenho por watt precisa ser observado junto com compatibilidade e carga sustentada.

Mais throughput alterou a cauda de latência

O relatório informa que a mediana e o percentil 75 do tempo até o primeiro token permaneceram dentro de 5% da referência. No percentil 99, porém, o tempo até o primeiro token aumentou 17%. Isso indica que o ganho agregado veio acompanhado de piora nos casos mais lentos.

Para serviços interativos, a cauda importa porque uma parcela dos usuários percebe justamente essas respostas demoradas. Para lotes offline, a prioridade pode ser processar mais trabalho dentro da capacidade elétrica. A configuração precisa seguir o objetivo do serviço, não apenas a maior soma de tokens processados.

O limite elétrico não elimina o limite de latência

O teste documenta um resultado específico: 192 GPUs, 264,4 kW provisionados, 49,2% de ganho agregado e aumento de 17% no P99 de tempo até o primeiro token. A decisão de usar o método depende de repetir a medição com a carga real e definir previamente limites aceitáveis para throughput, consumo e latência de cauda.

Sem essa combinação de métricas, mais throughput de IA pode esconder degradação no atendimento. O dado elétrico precisa ser analisado ao lado da distribuição de latência e da estabilidade durante períodos prolongados.

Como as duas configurações foram montadas

A linha de base dividiu 140 GPUs entre três grupos: dois conjuntos de 52 GPUs voltados a alto throughput e um conjunto de 36 GPUs para baixa latência. A configuração com DSX manteve o grupo de baixa latência e acrescentou um terceiro conjunto de 52 GPUs de alto throughput, chegando a 192 aceleradores.

O detalhe é importante porque o ganho não veio de reduzir igualmente a potência de todas as cargas. O sistema explorou perfis diferentes e coordenou o orçamento. Cargas de alto throughput toleram lotes e limites distintos de um serviço interativo. Essa diversidade cria espaço para acomodar mais equipamentos sem assumir que todos atingirão o pico elétrico no mesmo instante.

O throughput agregado passou de 1.084.503 para 1.618.443 tokens por segundo. Nos grupos de alto throughput, o resultado por instância ficou praticamente estável, de 59.153 para 59.220 tokens por segundo. O grupo de baixa latência permaneceu em 2.265 tokens por segundo. Portanto, o aumento total veio principalmente da capacidade adicional, não de acelerar cada instância.

Potência provisionada e potência medida são números diferentes

O limite de 264,4 kW representa a capacidade reservada para a instalação avaliada. A potência média das GPUs subiu de 97,0 kW para 131,8 kW. Quando o relatório considera a potência total medida, o consumo foi de 166,2 kW na linha de base e 198,9 kW com DSX. A utilização do orçamento provisionado passou de 62,9% para 75,2%.

Essa separação explica a oportunidade. Cobrar, projetar e construir para 264,4 kW enquanto a carga consome bem menos deixa capacidade sem uso. Coordenar os limites pode aproximar a operação do teto sem ultrapassá-lo. A métrica de 4,10 para 6,12 tokens por segundo por watt usa o orçamento provisionado como denominador; não é a mesma coisa que dividir o throughput pela potência efetivamente medida.

As duas relações são úteis para perguntas diferentes. Throughput por watt provisionado mede aproveitamento da infraestrutura contratada. Throughput por watt medido aproxima eficiência operacional durante o ensaio. Custo total ainda inclui refrigeração, rede, CPUs, memória, armazenamento e perdas elétricas, elementos que não desaparecem quando mais GPUs cabem no mesmo envelope.

A latência de cauda define quem pode usar o ganho

Mediana e percentil 75 dentro de 5% indicam que a experiência comum permaneceu próxima da linha de base. O aumento de 17% no P99 do tempo até o primeiro token mostra, porém, que os pedidos mais lentos sofreram. O valor absoluto citado subiu a partir de 15,7 segundos, um patamar que já exige interpretação conforme o serviço testado.

Em processamento offline, gerar quase 50% mais tokens dentro do mesmo limite elétrico pode ser prioridade. Em chat, busca ou assistente interativo, um P99 maior pode violar acordo de serviço mesmo que a média permaneça boa. Filas, tamanho dos lotes, modelos e quantidade de requisições simultâneas alteram essa distribuição.

O critério precisa ser escrito antes do teste. Uma plataforma pode exigir que P99 não aumente mais de 5%, outra pode aceitar 20% se o trabalho for assíncrono. Sem limite previamente definido, é fácil escolher depois a métrica que favorece a configuração desejada.

Telemetria passa a controlar risco elétrico

Instalar equipamentos acima do que caberia pela soma das placas nominais exige confiança em medição e atuação. Sensores precisam informar potência com atraso e precisão conhecidos. O controlador deve reduzir consumo antes que um pico afete proteção, refrigeração ou estabilidade. Falha de telemetria não pode resultar em operação cega junto ao teto.

Uma implantação precisa definir comportamento conservador quando perde dados: reduzir limites, retirar grupos da fila ou voltar a um perfil seguro. Também deve registrar quando e por que houve limitação. Sem esse histórico, quedas de throughput podem parecer falha do modelo, embora tenham origem no controle elétrico.

A diversidade das cargas é outra dependência. Se todos os serviços passam a atingir pico ao mesmo tempo, a folga observada no ensaio desaparece. Mudanças de modelo, versão do runtime ou padrão de tráfego precisam disparar nova caracterização, porque o perfil elétrico anterior pode não representar a operação atual.

Como reproduzir o estudo em outro ambiente

O primeiro passo é medir por tempo suficiente a configuração atual, reunindo potência por grupo, consumo total, temperatura, throttling, throughput e latências P50, P75, P95 e P99. A carga deve representar modelos, tamanhos de contexto, lotes e concorrência reais. Um pico curto ou benchmark sintético não descreve a combinação diária.

Depois, a equipe define um orçamento elétrico fixo e critérios de aceitação. A capacidade adicional entra em etapas, com testes de falha de sensor, perda de nó, mudança de carga e período prolongado. O valor econômico compara GPUs extras e software de controle com obra elétrica adiada, energia consumida, refrigeração e efeito sobre o serviço.

O teste publicado pela NVIDIA demonstra que o método funcionou na configuração da Nscale e da Verne: 52 GPUs adicionais, 49,2% mais throughput de IA, maior uso do orçamento e degradação no P99. A decisão transferível não é copiar o percentual, mas verificar se uma carga heterogênea local oferece folga semelhante e se os limites de latência e segurança elétrica permanecem atendidos.

Você também pode gostar