Preparando-se para a era GB300: Otimizando redes de armazenamento de dados de IA com Ethernet sem perdas de 200G
Publicado em:Sumário executivo: O NVIDIA GB300 NVL72 não é apenas mais uma atualização de GPU — é um sistema em escala de rack que redefine fundamentalmente a forma como as redes de data center devem ser projetadas. Com 72 GPUs Blackwell Ultra, que oferecem 1,080 PFLOPS de computação FP4, 130 TB/s de largura de banda NVLink no rack e 800 Gbps de conectividade escalável por GPU, o GB300 exige uma nova classe de estrutura sem perdas, de alta resolução e baixa latência para manter todas as GPUs alimentadas com dados.
Este guia detalha os pilares arquitetônicos de uma rede pronta para GB300: Ethernet sem perdas de 200G como backbone de expansão horizontal, topologia otimizada para trilhos para caminhos determinísticos de GPU para armazenamento, RoCEv2 com PFC e ECN para transporte RDMA sem perdas e a infraestrutura óptica — transceptores de 800G, cabeamento MTP/MPO de alta densidade e interconexões DAC — que torna tudo isso fisicamente viável. Seja você construindo um cluster com 7,000 GPUs ou um único rack NVL72, essas decisões de projeto determinam diretamente a produtividade e o custo por token da sua fábrica de IA.
Navegação Rápida
- 1 A revolução GB300 NVL72: o que muda para as redes de IA?
- 2 Ethernet sem perdas de 200G: a espinha dorsal escalável
- 3 Topologia otimizada para trilhos: projetando para conexão de GPU ao armazenamento.
- 4 Mecanismos sem perdas: análise detalhada do córtex pré-frontal, do núcleo coclear endotelial e do RoCEv2
- 5 Escalabilidade vertical versus escalabilidade horizontal: a fronteira entre NVLink e Ethernet
- 6 Otimização de Rede de Armazenamento com IA: NVMe-oF e Checkpointing
- 7 Infraestrutura óptica: Transceptores e cabeamento para GB300
- 8 Lista de verificação para migração: preparando seu data center para o GB300
- 9 Principais perguntas respondidas

O GB300 NVL72 integra 72 GPUs e 36 CPUs em um único rack com refrigeração líquida — cada GPU precisa de 800 Gbps de largura de banda de expansão para atingir seu potencial máximo.
1. A revolução GB300 NVL72: o que muda para as redes de IA?
O NVIDIA GB300 NVL72 representa um salto geracional em densidade de computação para IA. Um único rack integra 72 GPUs Blackwell Ultra e 36 CPUs Grace conectado via NVLink de 5ª geração, proporcionando 130 TB / s de largura de banda interna não bloqueante e até 1,080 PFLOPS Comparado ao HGX H100 baseado em Hopper, o GB300 NVL72 oferece 70 vezes mais FLOPS de IA, 1.5 vezes mais memória HBM3e (288 GB por GPU, 40 TB por rack) e o dobro da largura de banda de rede, com 14.4 TB/s.
O que torna a era GB300 fundamentalmente diferente para os arquitetos de rede é o Placa de rede ConnectX-8 SuperNIC, que provê 800 Gbps de conectividade escalável por GPUUm rack NVL72 completo requer, portanto, até 72 x 800G = 57.6 Tbps de largura de banda agregada para expansão horizontal — uma ordem de magnitude superior à capacidade das redes de data center tradicionais. Para organizações que constroem infraestrutura de IA, a compreensão desses requisitos é abordada em detalhes em nosso [link para o guia/documento/recurso específico]. Requisitos de cabeamento do data center da infraestrutura de IA guia.
| Especificação | GB300 NVL72 | GB200 NVL72 | HGX H100 |
|---|---|---|---|
| GPUs por rack | 72 (Blackwell Ultra) | 72 (Blackwell) | 8 (Hopper) |
| Largura de banda NVLink | 130 TB / s | 130 TB / s | 0.9 TB / s |
| Memória HBM3e | 288 GB / GPU (rack de 40 TB) | 192 GB / GPU (rack de 20 TB) | 80 GB / GPU |
| Escalabilidade horizontal por GPU | 800 Gbps (ConnectX-8) | 400 Gbps (ConnectX-7) | 400 Gbps |
| Computação FP4 (Esparsa) | 1,080 PFLOPS | 720 PFLOPS | N/D |
| Produção da Fábrica de IA vs. Funil | 50x | ~ 30x | 1x (linha de base) |
Implicações práticas: a NVIDIA informa que o GB300 NVL72 oferece 10 vezes mais capacidade de resposta do usuário (tokens por segundo por usuário) e 5 vezes mais capacidade de processamento por megawatt em comparação com o Hopper. Isso é alcançado não apenas por meio de melhorias no silício, mas também pelo projeto conjunto de computação, interconexão e rede — uma filosofia de projeto explorada em nossa análise de Diferenças no design de rede entre front-end e back-end de IA.
2. Ethernet sem perdas de 200G: a espinha dorsal escalável
Embora o NVLink lide com a comunicação GPU-para-GPU dentro do rack a 130 TB/s, a rede de expansão horizontal — que conecta vários racks NVL72, arrays de armazenamento e infraestrutura de gerenciamento — depende de Ethernet ou InfiniBand operando a 200G por canal. SerDes de 200G por faixa é o bloco de construção fundamental: uma porta 800G é construída a partir de quatro pistas 200G (4x200G) e uma porta 1.6T a partir de oito. Essa velocidade por pista é o que possibilita a conectividade de 800 Gbps por GPU que as SuperNICs ConnectX-8 oferecem.
Ethernet Spectrum-X vs. Ethernet Tradicional
da NVIDIA Ethernet Spectrum-X A plataforma foi desenvolvida especificamente para cargas de trabalho de IA, oferecendo roteamento adaptativo, gerenciamento de congestionamento por fluxo e suporte aprimorado para RoCEv2, recursos que os switches Ethernet padrão não possuem. Ao contrário do Ethernet tradicional de data center — projetado para tráfego de muitos para muitos com o princípio de melhor esforço — o Spectrum-X implementa... Semântica Ethernet sem perdas que garantem zero perda de pacotes para tráfego RDMA, tornando-o funcionalmente equivalente ao InfiniBand para treinamento de IA, mantendo as vantagens de custo e interoperabilidade do Ethernet.
De acordo com dados da indústria, as soluções Ethernet baseadas em RoCEv2 apresentaram Crescimento de 31% nas remessas Em 2025, em comparação com 19% para InfiniBand — sinalizando uma mudança estrutural em direção a redes de IA baseadas em Ethernet. O mercado global de interconexão óptica, avaliado em menos de US$ 20 bilhões em 2025, deverá atingir $ 92 bilhões até 2028 Com uma taxa de crescimento anual composta de 65%, impulsionada principalmente pela demanda por redes de IA em data centers. Para organizações que avaliam sua cadeia de suprimentos de conectividade, nosso Guia de seleção de fornecedores de cabos de fibra óptica Fornece uma estrutura de avaliação estruturada.

A topologia otimizada para trilhos atribui cada GPU a um switch leaf dedicado, eliminando os pontos de congestionamento que afetam os designs tradicionais de spine-leaf.
Por que 200G sem perdas, e não apenas 200G?
O Ethernet padrão é um protocolo de melhor esforço — ele descarta pacotes em caso de congestionamento e depende da retransmissão TCP para garantir confiabilidade. Para tráfego web, isso é aceitável. Para treinamento de IA, é catastrófico. Um único pacote descartado durante uma operação de sincronização de gradiente all-reduce pode paralisar todo o processo coletivo por milissegundos, desperdiçando milhares de segundos de computação da GPU. Ethernet sem perdas elimina esse problema garantindo que as classes de tráfego prioritário nunca sofram perda de pacotes, usando uma combinação de mecanismos de controle de fluxo e notificação de congestionamento descritos na Seção 4.
3. Topologia otimizada para trilhos: projetando para conexão de GPU ao armazenamento
As redes de data center tradicionais usam um Topologia Spin-Leaf onde todos os switches de borda se conectam a todos os switches de espinha dorsal, e o tráfego entre quaisquer dois pontos de extremidade pode percorrer vários saltos através de switches compartilhados. Isso funciona bem para cargas de trabalho corporativas com muitos fluxos pequenos, mas cria dois problemas críticos para o treinamento de IA: pontos críticos de congestionamento quando vários fluxos grandes competem pela mesma porta espinhal, e latência imprevisível que desestabiliza os padrões de comunicação coletiva.
A alternativa otimizada para trilhos
Topologia otimizada para trilhos — também chamada fixado ao trilho or alinhado com trilhos O design atribui cada posição de GPU em um rack a um switch leaf dedicado (um "trilho"). Em um NVL72 com 8 GPUs por bandeja de computação, existem 8 trilhos, cada um com seu próprio switch leaf e switch spine dedicados. O tráfego entre racks para operações tensor-parallel ou expert-parallel segue um único caminho determinístico através de um spine correspondente, garantindo que:
- A contagem de saltos é minimizada. — a maior parte do tráfego GPU-para-GPU atravessa, no máximo, um salto de spine
- O bloqueio na frente da fila é eliminado. — não há filas compartilhadas entre classes de tráfego não relacionadas
- O congestionamento é previsível. — a largura de banda de cada trilho é dedicada, não compartilhada
- Os domínios de falha são isolados. — uma única falha no trilho afeta apenas as GPUs atribuídas a ele
Na prática, um cluster GB300 com 8 racks NVL72 (576 GPUs) pode utilizar 8 switches de trilho, cada um gerenciando 72 links de 800G por rack — um total de 576 conexões de 800G por trilho. Isso exige switches de alta resolução (64+ portas de 800G) e painéis ópticos de alta densidade. Guia de gerenciamento de cabos de painel de conexão para data centers Abrange as estratégias de infraestrutura física necessárias para gerenciar essas quantidades de fibra.
Implantação no mundo real: Cluster GB300 de 7,000 GPUs da Global AI
Em 2025-2026, a Global AI implantou um dos maiores clusters GB300 NVL72 do mundo em suas instalações em Endicott, Nova York, começando com 7,000 GPUs GB300 e 16 MW de carga inicial de TI. O roteiro de implantação é escalável para 100 MW até 2026, 250 MW até 2027 e 1 GW até 2029., todas utilizando arquitetura de escala de rack com refrigeração líquida. A empresa também planeja implantar plataformas NVIDIA Vera Rubin NVL72, o que aumentará ainda mais as demandas de rede por rack. Essa implantação demonstra que a infraestrutura pronta para GB300 deve ser planejada em escala de gigawatts desde o início — a capacidade de energia, refrigeração e rede não pode ser adicionada posteriormente de forma incremental.
4. Mecanismos sem perdas: Análise detalhada do PFC, ECN e RoCEv2
Três mecanismos complementares transformam o Ethernet padrão em uma estrutura sem perdas adequada para cargas de trabalho de IA. Compreender a interação entre eles é essencial para qualquer arquiteto de rede que projete infraestrutura na escala GB300.
Controle de Fluxo Prioritário (PFC — IEEE 802.1Qbb)
O PFC estende os quadros de pausa Ethernet padrão para operar por classe de prioridade em vez de em todo o tráfego. O Ethernet define 8 classes de prioridade (0-7); em uma implementação típica de RoCEv2, a classe 3 é designada como a classe "sem perdas" para tráfego RDMA. Quando o buffer de recebimento de um switch para a classe 3 se aproxima da capacidade máxima, ele envia um quadro de pausa PFC para a porta upstream, que interrompe temporariamente a transmissão do tráfego da classe 3, permitindo que as outras classes fluam normalmente. Isso evita o estouro do buffer e a consequente perda de pacotes — mas somente se configurado corretamente.
As configurações incorretas mais comuns do PFC incluem habilitar o PFC em muitas classes de prioridade (o que anula o propósito do controle por classe), definir limites de pausa muito altos (causando quedas antes que a pausa entre em vigor) ou não configurar buffers de margem (o que pode levar à oscilação do quadro de pausa e ao colapso da taxa de transferência).
Notificação Explícita de Congestionamento (ECN — RFC 3168)
Enquanto o PFC reage à pressão do tampão de forma reativa, o ECN fornece sinalização proativa de congestionamentoOs switches marcam o campo ECN (bits DSCP do cabeçalho IP) em pacotes que passam por filas e excedem um limite configurado. Quando o endpoint receptor detecta pacotes marcados com ECN, ele sinaliza ao remetente para reduzir sua taxa de transmissão por meio de pacotes de Notificação de Congestionamento (CN) RoCEv2. Isso cria um sistema de feedback em circuito fechado que:
- Limita os remetentes antes Os buffers são preenchidos e as pausas do córtex pré-frontal são desencadeadas.
- Reduz a frequência e a duração das pausas no córtex pré-frontal.
- Garante a equidade entre fluxos que compartilham a mesma classe de prioridade.
- Permite o controle adaptativo da taxa de transferência para conexões RDMA de longa duração.
RoCEv2: RDMA sobre Ethernet Convergida
RoCEv2 (RDMA sobre Ethernet Convergida versão 2) permite acesso remoto à memória sem cópia e com bypass do kernel via Ethernet padrão. Uma GPU pode ler ou gravar diretamente na memória HBM3e de outra GPU através da rede, sem envolver a CPU ou o sistema operacional de nenhum dos sistemas — a mesma semântica que o NVLink oferece dentro de um rack. Isso é fundamental para:
- Sincronização de gradiente em treinamento paralelo de dados (todas as operações de redução)
- servidor de parâmetros comunicação no treinamento paralelo de modelos
- Armazenamento NVMe-oF Acesso para E/S de ponto de verificação e carregamento de conjunto de dados
- acesso ponto a ponto GPU-para-GPU para treinamento paralelo de pipeline em vários racks

PFC, ECN e RoCEv2 formam uma pilha de três camadas sem perdas — PFC evita descartes, ECN evita pausas e RoCEv2 permite acesso à memória GPU-para-GPU sem cópia.
5. Escalabilidade vertical versus escalabilidade horizontal: a fronteira NVLink-Ethernet
Uma das decisões arquitetônicas mais críticas na implementação do GB300 é entender onde o NVLink (escalonamento vertical) termina e o Ethernet (escalonamento horizontal) começa. Esse limite determina quais padrões de comunicação permanecem dentro de um rack a 130 TB/s e quais atravessam a rede a 800 Gbps por GPU.
Ampliação de escala: NVLink 5ª geração
Dentro do rack NVL72, NVLink de 5ª geração Oferece 1.8 TB/s de largura de banda por GPU, criando uma malha não bloqueante de 130 TB/s onde qualquer GPU pode alcançar qualquer outra GPU em um único salto. O NVLink opera com semântica de memória — As GPUs podem carregar e armazenar dados diretamente na memória HBM3e de pares através da malha, com reduções executadas dentro do hardware do switch durante a transmissão. Isso elimina a sobrecarga de movimentação de dados em nível de software e alcança latência próxima de zero para operações coletivas no rack.
Para cargas de trabalho de treinamento como DeepSeek-V3 671B, a NVIDIA relatou alcançar 1,648 TFLOPs por GPU Utilizando o Megatron Core em um GB300 NVL72 com 256 GPUs — um recorde mundial para pré-treinamento MoE. Esse desempenho só é possível porque a comunicação paralela de tensores e a comunicação paralela de especialistas permanecem no domínio NVLink, enquanto o tráfego paralelo de dados e o tráfego paralelo de pipeline atravessam o domínio Ethernet.
Expansão horizontal: Spectrum-X Ethernet ou Quantum-X800 InfiniBand
Quando as cargas de trabalho excedem um único rack NVL72 (72 GPUs), a rede de expansão horizontal entra em ação. Cada GPU se conecta à malha de expansão horizontal por meio de sua SuperNIC ConnectX-8 a 800 Gbps. As opções de malha são:
| tecido | Protocolo | Mais Adequada Para | Vantagem Chave |
|---|---|---|---|
| Ethernet Spectrum-X | RoCEv2 | Cargas de trabalho mistas de IA + empresariais | Ecossistema Ethernet, multivendedor |
| Quantum-X800 InfiniBand | IB RDMA | Clusters de treinamento de IA pura/HPC | Roteamento nativo adaptativo sem perdas |
Para a maioria das empresas, Spectrum-X Ethernet é a escolha pragmática. — oferece semântica sem perdas comparável ao InfiniBand, ao mesmo tempo que aproveita o ecossistema Ethernet mais amplo para interoperabilidade, custo-benefício e disponibilidade de talentos. Para organizações que precisam de informações mais detalhadas sobre as opções de protocolo de rede, nossa análise de Tendências do mercado de redes Fibre Channel Fornece contexto sobre como os protocolos de armazenamento estão convergindo.
Escalabilidade: Interconexão de Data Centers
Para fábricas de IA com múltiplas instalações, a rede escalável utiliza óptica coerente 400ZR/ZR+ sobre fibra escura ou sistemas DWDM. As compras diretas de sistemas WDM por provedores de serviços em nuvem aumentaram 60% em 2025, impulsionando as remessas de módulos plugáveis 400ZR/ZR+ em mais de 50% em relação ao trimestre anterior. Essa camada conecta clusters GB300 geograficamente distribuídos para recuperação de desastres, migração de cargas de trabalho e treinamento distribuído em distâncias metropolitanas e de longa distância.
6. Otimização de Rede de Armazenamento com IA: NVMe-oF e Checkpointing
As cargas de trabalho de treinamento de IA não são apenas limitadas pela computação da GPU — elas são cada vez mais... vinculado a armazenamento/E/SÀ medida que os modelos crescem de bilhões para trilhões de parâmetros, o checkpointing, o carregamento de conjuntos de dados e a distribuição de pesos impõem demandas enormes à rede de armazenamento. Um rack GB300 NVL72 com 40 TB de memória de GPU precisa realizar o checkpoint e restaurar esses dados em minutos, não em horas.
NVMe sobre Fabrics (NVMe-oF) sobre RoCEv2
O protocolo de armazenamento mais eficiente para cargas de trabalho de IA é NVMe-oF sobre RoCEv2, que estende a semântica de acesso direto à memória do NVMe por toda a estrutura Ethernet sem perdas. Isso permite que as GPUs leiam dados de treinamento e gravem pontos de verificação diretamente de arrays de SSD NVMe sem intervenção da CPU, atingindo latências de armazenamento tão baixas quanto 10 a 20 microssegundos em links de curto alcance.
A hierarquia de camadas de armazenamento para uma implementação GB300 normalmente segue a seguinte ordem:
| camada | Suporte: | Capacidade | Largura de Banda | Latência |
|---|---|---|---|---|
| L0 | GPU HBM3e | 288 GB / GPU | 8 TB/s / GPU | ~1 ns |
| L1 | CPU LPDDR5X | 14.3 TB/s / rack | 14.3 TB / s | ~100 ns |
| L2 | SSD NVMe (local) | Mais de 100 TB por nó | 14 GB/s por unidade | ~10 dólares |
| L3 | NVMe-oF (remoto) | PB+ (compartilhado) | 200G / link | ~20 dólares |
| L4 | Objeto/HDD frio | EB+ | 10-50GB/s | ~10ms |
Ponto de verificação de E/S na escala GB300
Fazer um checkpoint do estado da memória da GPU de 40 TB a 200G (25 GB/s) leva aproximadamente 27 minutos — período em que todas as 72 GPUs ficam ociosas. Com oito links NVMe-oF paralelos de 200G, esse valor cai para 3.4 minutosA 800G (100 GB/s) por enlace, o tempo teórico de checkpoint se aproxima de 51 segundos, embora as sobrecargas práticas (serialização, metadados do sistema de arquivos, verificações de consistência) estendam esse tempo para 2 a 5 minutos. É por isso que a largura de banda da rede de armazenamento deve ser planejada juntamente com a computação da GPU, e não como uma reflexão tardia. Para mais informações sobre cabeamento adjacente ao armazenamento, consulte nosso guia sobre Planejamento do comprimento dos cabos de conexão para racks limpos.
7. Infraestrutura Óptica: Transceptores e Cabeamento para GB300
A camada física de uma rede preparada para GB300 é onde a arquitetura encontra a realidade. Cada porta de expansão horizontal de 800G requer um transceptor óptico com cabeamento de fibra, um cabo de cobre de conexão direta (DAC) para curtas distâncias ou um cabo óptico ativo (AOC) para alcances moderados. As escolhas feitas aqui impactam diretamente o custo, o consumo de energia e a confiabilidade.
Seleção de transceptor em 200G/400G/800G
| Fator de Forma | Agilidade (Speed) | Configuração de faixa | Fale Connosco | Uso típico em GB300 |
|---|---|---|---|---|
| QSFP-DD / OSFP | 800G | 8x100G ou 4x200G | 100m-500m | Links de expansão horizontal GPU-para-spine |
| QSFP-DD | 400G | 4x100G ou 8x50G | 100m-2km | Rede de armazenamento, gerenciamento |
| QSFP56 | 200G | 4x50G | 100m-500m | Trilhos de baixa velocidade, da folha ao armazenamento. |
| DAC (passivo) | 400G / 800G | Cobre | Dentro do rack, de switch para switch | |
| AOC (ativo) | 400G / 800G | Ótica | 3m-30m | De prateleira para prateleira na mesma fileira |
Para obter orientações sobre como selecionar os formatos e a vida útil adequados dos transceptores, consulte nosso artigo sobre vida útil e substituição de transceptores ópticos Abrange modos de falha e estratégias de aquisição. Para cabeamento DAC dentro do rack, nosso Tipos de cabos DAC e casos de uso Este guia explica as vantagens e desvantagens das soluções de cobre passivo, cobre ativo e AOC.
Cabeamento de fibra óptica: MTP/MPO para expansão de alta densidade
Um único rack GB300 NVL72 com 72 GPUs a 800 Gbps cada requer 72 conexões ópticas de 800G. Com 8 fibras por porta de 800G (usando 100G/canal), isso é mínimo de 576 filamentos de fibra — uma densidade que exige conectores de alta densidade MTP/MPO ou MMC em vez de cabos de conexão LC duplex individuais. Um único painel MPO de 1U pode acomodar de 24 a 48 conectores MPO, cada um transportando 12 ou 16 fibras, para até 768 fibras em 1 unidade de rack.
Para os tipos de fibra utilizados nessas ligações, OM4 multimodo é o padrão para links SR8 de 800G com alcance de 100m, enquanto OS2 modo único É utilizado para enlaces 800G DR8 com alcance de 500 m e enlaces 800G FR4 com alcance de 2 km. Nossa abrangente rede. Guia de tipos de cabos de fibra óptica (OS2, OM3, OM4, OFNR, OFNP) e nossa visão geral de diferentes tipos de cabos de fibra óptica Forneça critérios de seleção detalhados para cada candidatura.

Um único rack GB300 pode exigir mais de 576 fibras ópticas — painéis de alta densidade MTP/MPO não são opcionais, são equipamentos de sobrevivência.
Contexto de mercado para aquisição de produtos ópticos
O mercado de componentes ópticos está passando por uma pressão de demanda sem precedentes. De acordo com uma pesquisa da Citi, as remessas globais de interconexões ópticas crescerão de 110 milhões de unidades em 2025 para 300 milhões de unidades em 2028, com cenários de data center representando 89% desse volume. A produção comercial em larga escala de CPO (óptica co-embalada) deverá começar em 2027, com 1.8 milhão de unidades enviadas naquele ano, chegando a 5.6 milhões em 2028. Organizações que planejam implantações de GB300 devem garantir o fornecimento de componentes ópticos com 12 a 18 meses de antecedência, visto que a capacidade de produção de chips ópticos avançados deverá ficar defasada em relação à demanda em 5 a 15% até 2026.
8. Lista de verificação para migração: Preparando seu data center para o GB300
A transição para uma infraestrutura compatível com GB300 não é uma simples atualização de rede, mas sim uma reformulação completa das instalações. A lista de verificação a seguir abrange os oito domínios que devem ser abordados antes da chegada do primeiro rack NVL72.
Lista de verificação de prontidão GB300
- Planejamento de energia: Um único rack NVL72 consome até 120 kW. Planeje uma capacidade inicial de 16 MW ou mais, com um plano de expansão para mais de 100 MW. Certifique-se de que as unidades de distribuição de energia (PDUs) e os barramentos sejam dimensionados para cargas de alta densidade com refrigeração líquida.
- Resfriamento líquido: O GB300 NVL72 possui refrigeração líquida completa. Verifique a capacidade da unidade de distribuição de líquido refrigerante (CDU), o projeto do circuito primário/secundário, as conexões de desconexão rápida e os sistemas de detecção de vazamentos antes da instalação no rack.
- Arquitetura de rede: Projetar topologia otimizada para trilhos com 8 trilhos dedicados. Adquirir switches spine com capacidade para 800G e switches leaf de 200G/400G com buffers profundos (12+ MB por porta) e suporte a RoCEv2.
- Configuração sem perdas: Configure o PFC na classe de prioridade 3, defina os limites de ECN em profundidades de fila de 150K e 300K, habilite a geração de CNP RoCEv2 e verifique se não há cenários de deadlock no PFC em todos os caminhos.
- Infraestrutura óptica: Instalar painéis MTP/MPO de alta densidade (mais de 24 conectores por 1U), pré-terminar troncos de fibra OS2 e OM4 e preparar transceptores 800G/400G e cabos DAC/AOC 90 dias antes da entrada em operação.
- Tecido para armazenamento: Implante NVMe-oF em alvos RoCEv2 com pelo menos 8 uplinks de 200G ou 4 uplinks de 400G. Planeje uma largura de banda de checkpoint que corresponda a 25% da capacidade agregada de HBM3e da GPU.
- Gerenciamento de cabos: Utilize padrões de cabeamento estruturado (TIA-942, ISO/IEC 11801) para a organização da camada física. Consulte nosso guia sobre Padrões de cabeamento estruturado TIA-568 versus ISO/IEC 11801 para fins de conformidade.
- Teste e validação: Realize verificação ponta a ponta sem perdas usando geradores de tráfego RoCEv2. Valide o comportamento do PFC sob microbursts sustentados, meça a largura de banda efetiva por trilho e verifique a latência de E/S do ponto de verificação sob carga.
Para organizações preocupadas com a qualidade da instalação e as armadilhas comuns na implantação de fibra óptica, nosso guia sobre problemas comuns de instalação de fibra óptica Fornece conselhos de resolução de problemas testados em campo que se aplicam diretamente a implantações em escala GB300.
Principais perguntas respondidas
P1: O que é o NVIDIA GB300 NVL72 e como ele impacta o projeto de rede de data center?
O NVIDIA GB300 NVL72 é um sistema de escala de rack com refrigeração líquida que integra 72 GPUs Blackwell Ultra e 36 CPUs Grace com 130 TB/s de largura de banda NVLink. Cada GPU recebe 800 Gbps de conectividade escalável por meio de SuperNICs ConnectX-8, exigindo Ethernet sem perdas de 200G ou superior para tráfego entre racks e entre racks e armazenamento. Isso redefine o design de redes de data center, exigindo switches de trilho dedicados, cabeamento óptico de alta densidade e transporte RoCEv2 sem perdas para cargas de trabalho de treinamento e inferência de IA.
P2: Por que o Ethernet sem perdas de 200G é fundamental para redes de armazenamento de IA?
A Ethernet sem perdas de 200G fornece a largura de banda por canal necessária para saturar a porta de expansão de 800 Gbps de cada GPU sem perda de pacotes. O transporte sem perdas via PFC e ECN garante que o tráfego de armazenamento NVMe-oF baseado em RDMA e os dados de sincronização de gradiente cheguem sem atrasos de retransmissão, que, de outra forma, interromperiam os pipelines de computação da GPU e degradariam o desempenho do treinamento.
Q3: Como a topologia otimizada para trilhos difere da topologia tradicional de espinha-folha?
A topologia otimizada para rails atribui cada GPU em um rack a um switch leaf dedicado (rail), garantindo que o tráfego entre racks para operações tensor-parallel ou expert-parallel seja feito com apenas um salto por meio de um switch spine correspondente. A topologia spine-leaf tradicional roteia o tráfego por meio de switches compartilhados, criando pontos de congestionamento e latência imprevisível. Os designs otimizados para rails reduzem o número de saltos, eliminam o bloqueio de cabeçalho de linha e simplificam o gerenciamento de congestionamento para cargas de trabalho de IA.
Q4: Qual é a diferença entre redes de escalabilidade vertical (scale-up) e horizontal (scale-out) em implementações GB300?
A rede de escalonamento vertical utiliza NVLink de 5ª geração dentro do rack GB300 NVL72, fornecendo 1.8 TB/s por GPU e 130 TB/s de largura de banda total sem bloqueio para comunicação GPU-para-GPU no mesmo rack. A rede de escalonamento horizontal estende a conectividade entre racks usando ConnectX-8 SuperNICs a 800 Gbps por GPU sobre Spectrum-X Ethernet ou Quantum-X800 InfiniBand. O escalonamento vertical lida com tráfego paralelo de tensores e tráfego paralelo de especialistas; o escalonamento horizontal lida com tráfego paralelo de dados, tráfego paralelo de pipeline e tráfego de armazenamento.
Q5: Como o PFC e o ECN permitem Ethernet sem perdas para cargas de trabalho de IA?
O Controle de Fluxo Prioritário (PFC, IEEE 802.1Qbb) pausa o tráfego em classes de prioridade específicas sem bloquear outras classes, evitando a perda de pacotes durante picos de congestionamento. A Notificação Explícita de Congestionamento (ECN, RFC 3168) marca os pacotes nas filas do switch quando estes se aproximam da capacidade, sinalizando aos endpoints para reduzirem proativamente as taxas de transmissão. Juntos, o PFC e o ECN criam uma estrutura sem perdas que suporta RoCEv2, permitindo transferências de dados sem cópia de GPU para GPU e de GPU para armazenamento, essenciais para o treinamento de IA.
Q6: Quais módulos ópticos e cabos são necessários para um cluster GB300?
Um cluster GB300 NVL72 normalmente utiliza transceptores QSFP-DD ou OSFP de 800G para conexões de expansão (configurações de 4x200G ou 8x100G), transceptores de 400G para links de rede de armazenamento e cabos DAC ou AOC para conexões de curto alcance dentro do rack, com menos de 3 metros. Painéis de fibra óptica de alta densidade MTP/MPO ou MMC são essenciais para gerenciar a enorme quantidade de fibras — um único rack GB300 com 72 GPUs a 800 Gbps cada requer até 72 links ópticos de 800G, o equivalente a, no mínimo, 1,152 fibras ópticas.
Q7: A infraestrutura existente de 100G ou 400G suporta cargas de trabalho GB300?
A infraestrutura existente de 100G não suporta nativamente o requisito de escalabilidade horizontal de 800 Gbps por GPU do GB300. A infraestrutura de 400G pode suportar parcialmente o GB300 agrupando vários links de 400G por GPU, mas isso aumenta a latência, complica o gerenciamento de congestionamento e desperdiça densidade de portas do switch. Uma abordagem de migração faseada — atualizando primeiro as camadas de spine para 800G, mantendo as camadas leaf de 400G — pode preencher essa lacuna, mas o desempenho total do GB300 exige 800G de ponta a ponta.
Q8: Qual é o custo total de propriedade para uma infraestrutura de rede preparada para GB300?
Uma infraestrutura de rede preparada para GB300 normalmente adiciona de 30% a 40% ao custo do rack de computação, abrangendo switches de 800G, transceptores de 200G/400G/800G, painéis de fibra MTP/MPO de alta densidade e cabos AOC/DAC. A infraestrutura de energia e refrigeração para um único rack GB300 NVL72 pode ultrapassar 120 kW, exigindo refrigeração líquida. No entanto, a melhoria de 50 vezes na produção de IA em comparação com plataformas baseadas em Hopper significa que o custo por token de inferência cai significativamente, proporcionando um custo total de propriedade (TCO) favorável para organizações que executam cargas de trabalho de IA contínuas.
Sobre a AMPCOM
A AMPCOM fornece a infraestrutura de camada física da qual dependem as redes de IA da era GB300. Nosso ecossistema de produtos abrange transceptores ópticos (QSFP-DD e OSFP de 200G/400G/800G), sistemas de fibra óptica (Painéis ODF, caixas de terminais, adaptadores) Cabos de fibra óptica de alta densidade MPO/MTP, Cabos AOC e DAC para interconexões de curto alcance, e cabos de patch de fibra em fibras monomodo OS2 e multimodo OM3/OM4/OM5. Para implantações de data centers de IA onde a contagem de fibras excede 576 filamentos por rack, a fabricação verticalmente integrada da AMPCOM — da montagem do conector à pré-terminação do painel — garante qualidade consistente e prazos de entrega previsíveis em grande escala.
Artigos Relacionados
- Requisitos de cabeamento para data center de infraestrutura de IA
- Redes de IA Frontend vs Backend: Principais Diferenças de Design
- Qual a vida útil real dos transceptores ópticos? Dicas de substituição e dicas reais.
- O que são cabos DAC? Tipos, latência e casos de uso.
- Fornecedor de Cabos de Fibra Óptica: Opções Confiáveis e Econômicas
- Visão geral do mercado de redes Fibre Channel
- Problemas comuns na instalação de fibra óptica e como evitá-los
Construindo sua rede preparada para GB300?
A AMPCOM fornece os transceptores ópticos, cabos de fibra MPO e painéis de alta densidade que as redes de IA de 800G exigem. Explore nosso catálogo de produtos ou entre em contato com nossa equipe de engenharia para obter preços para implantação em grande escala.
Explore os sistemas de fibra óptica