Mejora la gestión de tu centro de datos con las soluciones de control y acceso remoto de Legrand. Accede y controla dispositivos de TI de forma segura y eficiente desde cualquier lugar, con tecnología avanzada y protección de datos.

Guía de solución

Mejores prácticas para implementar pods de IA

La infraestructura de IA carece de mejores prácticas

La IA está generando un cambio estratégico para las empresas modernas, al habilitar modelado financiero, detección de anomalías y procesamiento de modelos de lenguaje.

Pero, a medida que las organizaciones invierten cientos de millones en infraestructura de IA, la alta dirección debe preguntarse: ¿cuál es la forma más eficiente de operar equipos de IA y proteger una inversión multimillonaria?

La infraestructura de IA plantea tres desafíos principales:

  • Demoras: el despliegue de equipos de IA consume mucho tiempo y es propenso a errores.
  • Pérdida de ingresos: la recuperación ante fallas tarda demasiado y puede costar millones de dólares.
  • Mayor riesgo: operar equipos manualmente aumenta el riesgo de interrupciones causadas por errores y brechas de seguridad.
Lecciones de seguridad y resiliencia aprendidas de clientes operando pods de IA

Mientras Legrand, con su marca ZPE Systems, apoya la construcción de centros de datos para IA, observamos que los de hiperescala refinan sus mejores prácticas para abordar estos desafíos.

Estos centros de datos de hiperescala con su experiencia, ya están adoptando la infraestructura de administración aislada IAI (Isolated Management Infrastructure, IMI). La IAI crea un sistema dedicado para automatizar operaciones y recuperarse de interrupciones, a la vez que aísla la infraestructura de las vulnerabilidades de los enfoques tradicionales de administración.

ZPE Systems ha desarrollado IAI durante los últimos 10 años trabajando con centros de datos de hiperescala y empresas globales que tienen requisitos estrictos de disponibilidad y seguridad. Aunque el documento de referencia de diseño para lo SuperPODS de NVIDIA DGX es integral, omite la IAI.

Esta guía muestra las mejores prácticas para habilitar despliegues automatizados, recuperación rápida y mayor seguridad en pods de IA de NVIDIA DGX y de algunos otros mediante un enfoque de IAI.

Los problemas: desplegar y recuperar infraestructura de pods de IA

Consume demasiado tiempo: una vez que un pod está instalado físicamente y los cables están conectados, los ingenieros deben configurar manualmente cada componente. Los errores o la falta de personal pueden causar demoras e incumplimiento de plazos. A menudo se requieren semanas o meses para configurar los equipos de IA y poner el pod en línea.

Distancia geográfica: las herramientas tradicionales de administración son soluciones fragmentadas que requieren cierto grado de intervención manual en sitio. Para administrar infraestructura distribuida, los equipos terminan operando en modo de respuesta a incidentes: corrigen errores de configuración, solucionan servidores bloqueados y reconfiguran redes.

Demasiados componentes: administrar pods de IA a escala es extremadamente complejo debido al número de componentes requeridos. Estos son algunos componentes que los equipos deben operar como parte de un SuperPOD de IA:

  • Dispositivos de cómputo/GPU (servidores).
  • Dispositivos de almacenamiento.
  • Fabric de almacenamiento (InfiniBand de alta velocidad).
  • Fabric de red (InfiniBand de alta velocidad).
  • Fabric de administración (mediante un punto de entrada tipo jumpbox).
  • Sistemas de energía y enfriamiento (PDU Raritan PX3).
  • Monitoreo ambiental y de salud de dispositivos (temperatura, humedad, velocidad de ventiladores).

Además de esta complejidad, el SuperPOD exige que los equipos construyan cuatro redes distintas:

  1. Red InfiniBand de alta velocidad: conecta GPU con GPU de forma directa.
  2. Red InfiniBand de almacenamiento: conecta el nodo de cómputo con el arreglo de almacenamiento.
  3. Red Ethernet in-band: conecta los nodos de cómputo entre sí y con la red corporativa del cliente, Internet, etc.
  4. Red Ethernet fuera-de-la-banda: se usa para administración/IPMI, telemetría/observabilidad, automatización, etc.
Diagrama: Topología de administración de NVIDIA DGX SuperPOD

Resolver el problema requiere abordar tres áreas del ciclo de vida de la infraestructura:

  1. ¿Cómo se pueden desplegar pods de IA sin configuración manual de red?
  2. ¿Cómo se puede recuperar la infraestructura de IA si falla la red de producción?
  3. ¿Cómo pueden los equipos reducir el riesgo de causar interrupciones e incidentes de seguridad?

La solución es la infraestructura de administración aislada

1 ¿Cómo se pueden desplegar pods de IA sin configuración manual de red?

Problema

Configurar pods de IA requiere preparar componentes de red, como VLAN, direcciones IP y servidores de arranque PXE. Esto suele hacerse manualmente, lo que genera demoras de despliegue, errores e inconsistencias que aumentan los costos y la carga operativa.

Limitación

Las soluciones tradicionales de administración de infraestructura carecen de capacidades de configuración automatizada, también conocidas como aprovisionamiento sin intervención o zero-touch provisioning (ZTP). Esto obliga a los equipos a depender de procesos manuales y propensos a errores.

Mejor práctica

La infraestructura de administración aislada proporciona el entorno dedicado donde los equipos pueden crear, probar y desplegar automatización y orquestación. Esto les permite configurar automáticamente los componentes de red necesarios para preparar el resto del pod de IA. Sin embargo, esto requiere servidores adicionales para ejecutar VM/Docker y automatización.

Cómo ZPE mejora las mejores prácticas

  • IAI completa en un solo dispositivo: consolida más de 9 funciones de administración en un solo dispositivo, que sirve como punto de entrada tipo jumpbox y también como servidor de VM y automatización.
  • Zero-Touch Provisioning (ZTP): automatiza el despliegue de red y del resto del stack, incluidos cómputo, almacenamiento, IoT, energía y sensores.
  • Menor tiempo de puesta en marcha: reduce los plazos de despliegue y minimiza la intervención humana, disminuyendo el riesgo de errores de configuración.
  • Monitoreo ambiental automatizado: rastrea flujo de aire, calor y uso de energía para mejorar la eficiencia en las operaciones continuas.
  • Seguridad integrada y control de acceso: permite monitorear el control de acceso para mejorar la seguridad.
  • Conectividad confiable para administradores: asegura acceso y control remoto mediante enlaces de respaldo, incluidos 5G, Starlink, banda ancha y otros tipos de conexión.
IMI es un entorno dedicado para ejecutar automatización y configurar el pod DGX completo

2 ¿Cómo se puede recuperar la infraestructura de IA si falla la red de producción?

Problema

Si falla la red principal, restaurar clústeres de IA se vuelve imposible sin una ruta de recuperación independiente, lo que provoca tiempos de inactividad prolongados, pérdida de productividad e impacto en los ingresos.

Limitación

El diseño predeterminado de SuperPOD se enfoca en fuera-de-la-banda (OOB) mediante Ethernet. Esto ignora que muchos componentes del pod de IA, como nodos, equipos de red, almacenamiento y sistemas de energía, requieren interfaces seriales (RS-232), Ethernet, USB y virtualizadas para tener acceso completo de administración.

Mejor práctica

Como parte de IAI, una solución OOB adecuada proporciona acceso administrativo a todos los equipos de producción, pero no depende de ninguno de esos equipos. Sin embargo, implementar una solución OOB integral requiere dispositivos dedicados. Esto se suma al stack general de administración y, debido a que los entornos de IA están tan densamente ocupados, no hay espacio de rack ni energía disponible para alojar ese stack.

Cómo ZPE mejora las mejores prácticas

  • OOB integral: un dispositivo ZPE proporciona OOB para todo el pod mediante interfaces seriales RS-232, USB, Ethernet y virtualizadas (REST API, IPMI, Redfish).
  • Aislamiento de red y failover: proporciona una red de administración completamente aislada con failover LTE/5G, fibra o Wi-Fi, lo que asegura acceso incluso si la red principal está caída.
  • Control remoto granular: habilita acceso remoto completo a BIOS/UEFI, ciclos de energía y actualizaciones de firmware mediante servidores de consola, reduciendo la necesidad de intervenciones en sitio.
  • Recuperación ante ransomware: permite a los equipos desplegar un entorno de recuperación aislado donde la infraestructura puede aislarse, limpiarse y restaurarse incluso durante ataques activos.
  • Rollback automatizado: permite a los equipos recuperar rápidamente todo el pod mediante una imagen golden y zero-touch provisioning.
IMI mediante Nodegrid de ZPE Systems proporciona acceso remoto fuera-de-la-banda a todos los componentes del pod DGX mediante interfaces Ethernet, seriales, USB y virtualizadas

3 ¿Cómo pueden los equipos de TI reducir el riesgo de causar interrupciones e incidentes de seguridad?

Problema

El mantenimiento y la administración normal del sistema pueden provocar interrupciones causadas por errores, porque la administración tradicional otorga acceso directo a la infraestructura de producción. Las herramientas tradicionales conceden privilegios de acceso amplios, lo que también aumenta riesgos de seguridad, por ejemplo mediante credenciales robadas.

Limitación

Administrar la infraestructura directamente no deja margen de error al realizar cambios o desplegar automatizaciones. Este enfoque está prohibido por CISA. Las herramientas tradicionales también carecen de segmentación adecuada y control de acceso basado en roles (RBAC), lo que da a los usuarios acceso a entornos que están fuera de su área de experiencia.

Mejor práctica

Según las mejores prácticas de CISA (Cybersecurity and Infrastructure Security Agency), IAI separa la administración del tráfico de producción y también proporciona un entorno seguro para que los administradores prueben sus cambios y automatizaciones. IAI también habilita la separación de funciones, de modo que cada cambio o automatización deba pasar por varios niveles de aprobación antes de enviarse a producción. RBAC (Control de Acceso Basado en Roles) aplica el acceso; sin embargo, algunas soluciones pueden carecer de controles de autenticación o integración con proveedores de SSO (inicio de sesion unico).

Cómo ZPE mejora las mejores prácticas

  • Aislamiento completo: aísla completamente la administración del tráfico de producción para asegurar que los cambios y las automatizaciones puedan ejecutarse sin afectar los sistemas productivos.
  • Seguridad zero trust: RBAC y la aplicación de políticas permiten una segmentación adecuada y separación de funciones, alineadas con los principios de seguridad zero trust.
  • RBAC granular con MFA y SSO: aplica acceso de mínimo privilegio, con controles integrados para autenticación multifactor (MFA) e integración con los principales proveedores de SSO.
  • Acceso remoto cifrado: garantiza conectividad fuera-de-la-banda mediante túneles cifrados para prevenir entradas no autorizadas.
IMI separa la administración para que los equipos puedan probar cambios y automatizaciones antes de implementarlos

Blueprint para la infraestructura de administración aislada

Para desplegar IA según las mejores prácticas de los centros de datos hiperescala, las organizaciones deben construir IAI de la siguiente manera:

  • Conectar todo fuera-de-la-banda: conectar switches IP Ethernet, consolas seriales, servidores, rPDU, ruteadores y todo el stack de red a la red fuera-de-la-banda.
  • Construir un framework de automatización dedicado: asegurar que la automatización no vaya directamente a los equipos de producción, sino que deba pasar por la red de administración.
  • Seguir principios de seguridad zero trust: usar RBAC y otros controles para segmentar el acceso de administración, separar funciones y minimizar riesgos.

Para obtener más información o si quiere ser contactado por un asesor, puede llenar este formulario.