Las empresas modernas enfrentan importantes desafíos de infraestructura, ya que los grandes modelos de lenguaje (LLM) requieren procesar y mover grandes cantidades de datos tanto para capacitación como para inferencia. Incluso con los procesadores más avanzados limitados por las capacidades de su infraestructura de soporte, la necesidad de una red robusta y de gran ancho de banda se ha vuelto imperativa. Para las organizaciones que buscan aprovechar de manera eficiente las cargas de trabajo de IA de alto rendimiento, una red troncal escalable y de baja latencia es fundamental para maximizar la utilización del acelerador y minimizar los costosos recursos inactivos.
Switches Cisco Nexus serie 9000 para cargas de trabajo AI/ML
Los conmutadores Cisco Nexus serie 9000 ofrecen la estructura de conmutación de baja latencia y alto radio que exigen las cargas de trabajo de IA/ML. Para acelerador Intel® Gaudi® 3 AI1 implementaciones, Cisco ha validado configuraciones y conmutadores Nexus 9000 específicos para garantizar un rendimiento óptimo.
Por ejemplo, el Nexus 9364E-SG2 (Figura 1) es el conmutador de red de IA líder de Cisco, impulsado por el ASIC Silicon One G200. En un formato compacto de 2RU, ofrece:
- 64 puertos densos de 800 GbE (o 128 x 400 GbE / 256 x 200 GbE / 512 x 100 GbE mediante conexiones)
- 51,2 Tbps de ancho de banda total para tejidos de lomo de hojas que no bloquean
- Búfer de paquetes integrado compartido de 256 MBlo cual es esencial para absorber las ráfagas de tráfico sincronizadas características de las operaciones colectivas en el entrenamiento distribuido
- 512 arquitectura de base derecha que reduce la cantidad de niveles de conmutación necesarios, reduce la latencia y simplifica el diseño de la estructura
- Preparado para Ultra Ethernet: Cisco es miembro fundador del Ultra Ethernet Consortium (UEC) y los conmutadores Nexus 9000 son compatibles con las nuevas especificaciones UEC.

El acelerador de IA Intel Gaudi 3 aborda la necesidad de sistemas de IA abiertos y escalables. Está diseñado para ofrecer lo último en rendimiento de centros de datos para cargas de trabajo de IA, incluidas aplicaciones generativas como LLM, modelos de difusión y modelos multimodales. El acelerador Intel Gaudi 3 demuestra mejoras significativas con respecto a generaciones anteriores, ofreciendo un rendimiento informático de IA hasta 4 veces mayor para cargas de trabajo Brain Floating Point de 16 bits (BF16) y un aumento de 1,5 veces en el ancho de banda de la memoria en comparación con el procesador Intel Gaudi 2.
Un diferenciador clave es su infraestructura de red: cada acelerador Intel Gaudi 3 AI integra 24 puertos Ethernet de 200 GbE que admiten la expansión del sistema a gran escala con protocolos Ethernet estándar. Este enfoque elimina la dependencia de tecnologías de red patentadas y proporciona el doble de ancho de banda de red en comparación con el acelerador Intel Gaudi 2, lo que permite a las organizaciones construir clústeres desde unos pocos nodos hasta varios miles sin problemas.
Una solución integrada con alto rendimiento, escalabilidad y apertura
Los conmutadores Cisco Nexus 9364E-SG2 y los transceptores OSFP-800G-DR8 están certificados para admitir aceleradores de IA Intel Gaudi 3 en configuraciones escalables para cargas de trabajo de capacitación, inferencia y IA generativa de LLM.
Los aspectos técnicos clave de la arquitectura validada incluyen:
- Conexión de alta velocidad y sin bloqueo: Las interfaces de 256 x 200 Gbps en los conmutadores Cisco Nexus 9364E-SG2 permiten diseños de red de alta velocidad y sin bloqueo para interconectar aceleradores Intel Gaudi 3.
- Tejido sin pérdidas: La compatibilidad total con RDMA sobre Ethernet convergente versión 2 (RoCEv2) con control de flujo prioritario (PFC) evita la pérdida de paquetes debido a la congestión, mejorando así los tiempos de finalización de los trabajos distribuidos.
- Operaciones simplificadas: Nexus Dashboard permite configurar aceleradores Intel Gaudi 3 AI para la ampliación de la red utilizando el tipo de tejido AI incorporado. También ofrece plantillas para mayores personalizaciones y una única plataforma operativa para todas las redes que acceden a un clúster de IA.
Cisco Intelligent Packet Flow para optimizar el tráfico de IA
Las cargas de trabajo de IA generan patrones de tráfico a diferencia de las aplicaciones empresariales tradicionales: ráfagas masivas y sincronizadas, «flujos de elefante» y comunicaciones continuas de GPU a GPU que pueden abrumar los enfoques de red convencionales. Cisco aborda estos desafíos con Cisco Intelligent Packet Flow, un marco de gestión de tráfico avanzado integrado en NX-OS.
Intelligent Packet Flow incorpora varias estrategias de equilibrio de carga diseñadas para estructuras de IA:
- Equilibrio de carga dinámico (basado en flowlets): Distribución del tráfico en tiempo real basada en telemetría de utilización del enlace
- Equilibrio de carga por paquete: Pulverización de paquetes a través de múltiples rutas para una máxima eficiencia de rendimiento
- Ruta múltiple de costo ponderado (WCMP): Ponderación de ruta inteligente combinada con equilibrio de carga dinámico (DLB) para topologías asimétricas
- Equilibrio de carga basado en políticas: Asigna estrategias de gestión de tráfico específicas a cargas de trabajo mixtas basadas en ACL, marcas DHCP o encabezados RoCEv2, creando una eficiencia personalizada para diferentes necesidades.
Estas opciones trabajan juntas para minimizar tiempo de finalización del trabajo— la métrica crítica que determina qué tan rápido se entrenan sus modelos de IA y qué tan eficientemente responden sus canales de inferencia.
Funcionamiento general con Nexus Dashboard
Implementar y operar infraestructura de IA a escala requiere visibilidad y otras capacidades que van mucho más allá del monitoreo de red tradicional. Cisco Nexus Dashboard sirve como plataforma de gestión centralizada para estructuras de IA, proporcionando visibilidad RoCEv2 de extremo a extremo y plantillas integradas para el aprovisionamiento de estructuras de IA.
Las características clave del panel Cisco Nexus incluyen:
- Análisis de congestión: Puntuación de congestión en tiempo real, estadísticas de control de flujo prioritario y notificación explícita de congestión (PFC/ECN) y detección de microrráfagas
- Registro de anomalías: Identificación proactiva de obstáculos en el rendimiento con soluciones sugeridas
- Observabilidad del trabajo de IA: Visibilidad de extremo a extremo de las cargas de trabajo de IA, desde redes hasta GPU
- Perspectivas sobre la sostenibilidad: Recomendaciones de seguimiento y optimización del consumo energético
«La IA a escala requiere tanto eficiencia informática como una estructura de red de IA de alto rendimiento. El acelerador de IA Intel® Gaudi® 3 combinado con el conmutador Cisco Nexus 9000 proporciona una solución abierta y optimizada que permite a los clientes crear clústeres de inferencia LLM a escala con un rendimiento rentable sin concesiones».
—Anil Nanduri, vicepresidente de gestión de productos y llegada al mercado de IA, Intel
Una infraestructura escalable, compatible y preparada para el futuro
Los conmutadores Cisco Nexus 9000 combinados con aceleradores Intel Gaudi 3 AI brindan a las empresas un entorno informático y de redes seguro, abierto y preparado para el futuro. Esta combinación de tecnologías permite a las organizaciones implementar clústeres de IA escalables y de alto rendimiento que cumplan con los requisitos de carga de trabajo actuales y emergentes.
Para obtener más información o evaluar cómo esta arquitectura de referencia se puede adaptar a las necesidades de su organización, consulte las especificaciones de los conmutadores Cisco Nexus serie 9300 y los aceleradores Intel Gaudi 3 AI.
Recursos adicionales:
1 Intel, el logotipo de Intel y Gaudí son marcas comerciales de Intel Corporation o sus subsidiarias.

