Ai2 adota orçamento de horas e reformula escalonamento de GPUs contra abusos
Instituto de pesquisa substituiu filas por prioridade por cotas de tempo e regras de preempção em clusters com chips H100, B200 e B300 da Nvidia.
Por que importa. Clusters de treino de IA sofrem com reservas ociosas e filas infladas. O modelo do Ai2 mostra como regras de negócio e janelas de compensação evitam desperdício sem comprar mais hardware.
O Allen Institute for AI (Ai2) abandonou o escalonamento tradicional por níveis de prioridade em seus clusters de inteligência artificial e adotou um modelo de orçamentos hierárquicos de tempo de GPU. A organização opera milhares de aceleradores Nvidia H100, B200 e B300, divididos em grupos de 88 a 1024 placas, atendendo cerca de 150 pesquisadores internos.
Segundo a equipe de infraestrutura do instituto, a demanda contínua supera a capacidade em até três vezes. No sistema antigo, equipes recebiam limites de GPUs concorrentes imunes a interrupções forçadas. O desenho gerou distorções: pesquisadores mantinham tarefas fictícias em execução apenas para segurar placas para depuração em tempo real, enquanto a inflação de prioridades levou 100% das submissões a serem marcadas como urgentes, paralisando os demais projetos.
Orçamento de tempo e contratos de execução
Para solucionar a disputa, o instituto transferiu a decisão para a liderança técnica, que agora distribui fatias percentuais do tempo total do cluster em vez de fixar máquinas dedicadas. Cada projeto consome horas de uma cota definida pela gestão. Práticas como manter GPUs ocupadas sem trabalho real passaram a drenar o saldo do próprio grupo.
O sistema combina um algoritmo de divisão justa (fair-share) com uma janela retrospectiva padrão de sete dias e um contrato de execução. Os trabalhos declaram uma duração mínima protegida contra interrupções. Encerrado esse intervalo mínimo, a tarefa pode sofrer preempção e voltar para a fila caso outras equipes com saldo precisem de espaço. O pesquisador Chris Clark afirmou que a flexibilidade para compensar períodos ociosos com picos posteriores de uso trouxe uma sensação equivalente a ter 30% a mais de computação disponível.
O agendador também permite cargas sem reserva orçamentária para consumir ciclos ociosos, mas com risco de cancelamento imediato a qualquer momento. Com isso, o cluster mantém alta taxa de ocupação física sem travar tarefas prioritárias de modelos de linguagem, visão e robótica.
Fontes
- Hugging Face: Impactful scheduling for GPU clusters
Reportagem produzida pela redação do Flipters com apoio de inteligência artificial, a partir das fontes acima. Como trabalhamos.
