Pular para o conteúdo

"'Architect of an Open World'" by dvanzuijlekom is licensed under CC BY-SA 2.0. To view a copy of this license, visit https://creativecommons.org/licenses/by-sa/2.0/.

ia

SageMaker HyperPod agora suporta topologia em nível de partição para clusters Slurm

Amazon SageMaker HyperPod permite configurar topologia de rede por partição em clusters orquestrados com Slurm, possibilitando usar diferentes topologias (tree, block) na mesma infraestrutura. Aumenta flexibilidade para cargas de trabalho de machine learning em larga escala.

17 de jul. de 2026 · AWS

A AWS habilitou configuração de topologia de rede por partição em clusters SageMaker HyperPod orquestrados com Slurm. Antes, a topologia era uma decisão do cluster inteiro; agora cada partição declara a sua, conforme a característica de interconexão das instâncias que a compõem. Pelo anúncio, topologia em blocos atende instâncias UltraServer (caso do ml.p6e-gb200.36xlarge) e topologia em árvore atende as famílias de interconexão hierárquica, como ml.p5.48xlarge, p5e e p5en. O escalonamento ciente de topologia vem ligado por padrão, exige cluster Slurm na versão 25.11 ou posterior, e a AWS afirma manter a configuração automaticamente conforme o cluster escala ou substitui nós. Disponível nas regiões onde o HyperPod já opera.

A leitura da mldata: o efeito prático é permitir cluster heterogêneo sem penalizar a comunicação coletiva. Quem hoje separa a frota por geração de GPU justamente para não misturar topologias pode consolidar em um cluster só e melhorar a ocupação — e é na ocupação, mais do que no preço por hora, que o orçamento de treinamento costuma vazar. O ponto a observar é a submissão: o ganho de throughput só se materializa se os jobs forem submetidos de forma que o escalonador consiga agrupar nós vizinhos; job mal dimensionado continua espalhado.

Ressalva: exigir Slurm 25.11 não é trivial em cluster de produção com dependências fixadas, e o benefício se concentra em treinamento distribuído sincronizado. Carga de inferência ou ajuste fino pequeno provavelmente não vê diferença mensurável.

Ler na fonte: AWS
Precisa disso rodando no seu ambiente?

A mldata aloca especialistas de dados e IA embarcados no seu time — selecionados, testados e com substituição em contrato.