La I+D automotriz europea está en una carrera: los programas de electrificación, los vehículos definidos por software, la validación de ADAS/AV y los gemelos digitales de fábrica impulsan las cargas de trabajo de simulación e IA hacia clústeres más grandes de GPU/CPU con ciclos de iteración más ajustados.
El limitador oculto ya no es la computación. Es la red de interconexión: mover gradientes, conjuntos de datos de sensores, mallas y mensajes MPI lo suficientemente rápido para que los equipos no se vean frenados por la latencia de cola, la congestión o un rendimiento impredecible bajo carga.
Ahí es donde encaja Cornelis Networks CN5000: una interconexión de extremo a extremo diseñada específicamente para tráfico sin pérdidas y sin congestión a 400G, con latencia MPI de sub-microsegundo y gestión de congestión a nivel de red, construida sobre la arquitectura Omni-Path.
Y combinado con las capacidades de distribución e integración centradas en Europa de Hammer’s, se convierte en un camino práctico para que las organizaciones automotrices implementen y soporten redes de alto rendimiento en equipos de ingeniería multi-sitio.
Por qué la innovación automotriz ahora depende de la red
Los flujos de trabajo de ingeniería automotriz están cada vez más acoplados e iterativos:
A medida que los clústeres escalan, un “buen ancho de banda promedio” ya no es suficiente. Los equipos automotrices necesitan:
El CN5000 en un minuto
CN5000 está posicionado como una red de expansión sin pérdidas y sin congestión para IA y HPC, diseñada para mantener un rendimiento estable a medida que crece.
De un vistazo:
Enrutamiento de múltiples rutas: el enrutamiento adaptativo de grano fino (FGAR) y el control de flujo consciente de incast se mencionan como parte del enfoque de gestión de congestión
Con más de 240 ingenieros y tecnólogos dedicados a impulsar la innovación en redes, Cornelis y Hammer se centran en desbloquear una mayor eficiencia en los centros de datos. Nuestra cartera completa de SuperNICs y conmutadores se basa en nuestro legado como inventores de Omni-Path, una arquitectura diseñada para ofrecer el rendimiento de red más alto en la era de la expansión horizontal y un conjunto de características fundamentales para Ultra Ethernet. Ofrecemos un rendimiento líder en la industria, que incluye latencia ultrabaja, altas tasas de mensajes y rendimiento de aplicaciones optimizado.
Ejemplo de impacto en el cliente:
Mejora del rendimiento de la simulación aerodinámica para equipos de automoción y mecánicos, logrando hasta un aumento de 2× en el rendimiento de iteración de diseño, al tiempo que se reduce la dependencia de costosos prototipos físicos y pruebas en túnel de viento.
Ancho de banda full duplex de 38.4T. Funciones de gestión que incluyen gestión basada en OpenBMC y soporte Redfish.Nota de implementación:
Cornelis describe CN5000 como una arquitectura de extremo a extremo—lo que significa que la intención de diseño “sin pérdidas y sin congestión” está ligada al uso de los elementos CN5000 –– switches, SuperNICs y software–– en lugar de mezclar y combinar arbitrariamente.
CN5000 vs InfiniBand vs RoCEv2 Ethernet (Comparación enfocada en automoción)
|
Lo que estás comparando |
Cornelis Networks CN5000 (Omni-Path) |
InfiniBand NDR 400 (p. ej., Quantum-2) |
Ethernet 400G con RoCEv2 |
|
Intención principal |
Tejido de escalado horizontal diseñado específicamente para IA + HPC con un enfoque de diseño sin pérdidas y sin congestión. |
Tejido HPC/AI con enrutamiento adaptativo y control de congestión como parte del valor de la plataforma. |
Ethernet de estándar abierto adaptado para IA/HPC de baja latencia mediante técnicas “sin pérdidas” (a menudo PFC + ECN + control de congestión de extremo a extremo como DCQCN). |
|
Clase de velocidad de enlace |
400G por puerto (opciones de Switch y SuperNIC). |
400 Gb/s por puerto (NDR 400). |
Comúnmente Ethernet de 400G; RoCEv2 utilizado para RDMA (dependiente del diseño/proveedor). |
|
Densidad de puertos de switch 1U (ejemplo) |
48 × 400G Switch; 38.4T full duplex. |
A menudo 64 × 400 Gb/s en 1U (según el modelo). |
Varía ampliamente; el comportamiento depende en gran medida del ASIC/fabricante y de sus elecciones de QoS/búfer/ECMP/telemetría y ajuste. |
|
Enfoque de congestión / sin pérdidas (alto nivel) |
Control de flujo basado en créditos, retransmisiones a nivel de enlace, gestión de congestión a nivel de tejido, enrutamiento de múltiples rutas—orientados a un rendimiento predecible y una latencia de cola reducida. |
Control de congestión a nivel de plataforma, QoS/carriles virtuales, enrutamiento adaptativo; puede incluir funciones de aceleración en la red (específicas de la plataforma). |
“Ethernet sin pérdidas” normalmente utiliza PFC para evitar caídas, además de ECN para marcar congestión y señalar la reducción de velocidad; el éxito operativo depende de la disciplina de configuración. |
|
Advertencias operativas |
Trátelo como un sistema de extremo a extremo (Switch + SuperNIC + software) para alinearse con la arquitectura prevista. |
Opción sólida donde el ecosistema/herramientas de IB y los flujos de trabajo existentes están arraigados. |
Los resultados de RoCEv2 dependen en gran medida de un diseño correcto de PFC/ECN y de una disciplina operativa continua; las configuraciones incorrectas pueden crear un comportamiento severo de congestión/latencia. |
Qué significa “Sin pérdidas y sin congestión” en los resultados de ingeniería cotidianos
Rotación de solucionador más rápida -
En simulaciones MPI grandes, el tiempo de trabajo puede estar dominado por las fases de comunicación (intercambio de halo, reducciones, sincronización). CN5000 enfatiza la optimización de la tasa de mensajes y la latencia junto con la gestión de congestión—orientado a un rendimiento predecible bajo carga.
Impacto: Menor tiempo de reloj por iteración de diseño, menos “ralentizaciones misteriosas” en la utilización máxima y mejor eficiencia de escalado a medida que se añaden nodos.
Mejor eficiencia de entrenamiento de IA distribuida (pilas de ADAS/AV y autonomía)
CN5000 se posiciona como una estructura diseñada para el entrenamiento e inferencia de IA que mantiene el rendimiento bajo carga al minimizar los eventos de congestión y la latencia de cola.
Dónde lo notará: mayor utilización de GPU (menos tiempo de espera en colectivos), tiempos de paso más estables, mejor tiempo de entrenamiento para nuevos dominios de sensores o variantes de modelos.
Control práctico mediante telemetría (no conjeturas)
Cuando varios equipos comparten la misma plataforma, los patrones de tráfico pueden cambiar de una hora a otra. CN5000 destaca la telemetría y la visibilidad en tiempo real para respaldar la gestión del tráfico consciente de la carga de trabajo.
Dónde lo notará: causa raíz más rápida para la variación de rendimiento y una planificación de capacidad más clara, especialmente en clústeres de uso mixto.
Diseñando CN5000 en clústeres reales de HPC automotriz e IA
Trate la congestión como el caso normal, no como un caso excepcional
Las plataformas de automoción casi siempre son de uso mixto: CAE por la mañana, entrenamiento por la tarde, pipelines de gemelos digitales en segundo plano, y todos empujando “una ejecución más” antes de un hito. CN5000 destaca la gestión de congestión a nivel de tejido, el control de flujo consciente de incast y el enrutamiento adaptativo para mantener el rendimiento bajo carga.
Mantén tu historia de “sin pérdidas” de extremo a extremo
Cornelis enmarca la “transmisión sin pérdidas y sin congestión” como una propiedad arquitectónica de CN5000 (Switch + SuperNIC + enrutamiento/control de flujo). En la práctica: especifíquelo como un sistema, valídelo como un sistema.
¿Quiere saber más?