La inteligencia artificial no tiene por qué ejecutarse necesariamente en la nube. Para las empresas con elevados requisitos de protección de datos, especificaciones de cumplimiento o la necesidad de obtener el máximo rendimiento, la IA in situ ofrece una potente alternativa a la computación en la nube. Alojamiento en nube-solución. La decisión entre En las instalaciones y en la nube depende de los requisitos empresariales específicos, el entorno normativo y las características de la carga de trabajo.
La infraestructura in situ implica un control total sobre el hardware, los datos y el acceso, sin depender de proveedores en la nube. Esto permite la máxima soberanía de los datos y cumple estrictos requisitos de conformidad, pero requiere una inversión inicial y personal informático cualificado. Para cargas de trabajo constantes, esto puede ser más rentable que las soluciones basadas en la nube a largo plazo, mientras que las cargas variables se gestionan mejor con Estrategias multicloud ser servido.
Casos prácticos e impulsores
La protección y la soberanía de los datos son los principales impulsores de las implantaciones de IA in situ. Los documentos con información sensible no necesitan transferirse a proveedores en la nube, lo que descarta por completo el acceso teórico por parte de terceros. Los bancos procesan localmente las solicitudes de préstamos con datos financieros en virtud de los requisitos de cumplimiento BAIT, las compañías de seguros gestionan los datos sanitarios en las solicitudes de reclamaciones de acuerdo con el artículo 9 del GDPR, los bufetes de abogados protegen los archivos de los clientes mediante seguros de confidencialidad abogado-cliente, y las oficinas de patentes procesan patentes no publicadas sin exposición externa. Las aplicaciones militares y de defensa con documentos clasificados requieren despliegues obligatorios in situ sin conexión a Internet.
El cumplimiento de normativas y reglamentos obliga a menudo a utilizar soluciones in situ, independientemente de consideraciones económicas. Las empresas de KRITIS, como los proveedores de energía y las empresas de suministro de agua, están sujetas a la protección básica de TI de BSI con requisitos de espacio aéreo. El sector financiero sigue el apartado 9 de BAIT y MaRisk AT 9 con requisitos estrictos para la externalización, razón por la cual muchos bancos operan sistemas centrales in situ. Las organizaciones sanitarias protegen los datos de los pacientes de acuerdo con el artículo 203 del Código Penal alemán, y muchas clínicas tienen obligaciones locales para los historiales electrónicos de los pacientes.
El rendimiento y la latencia se benefician del procesamiento local a través del acceso directo a la GPU sin latencia de red. Las velocidades de intranet de diez gigabits por segundo y superiores permiten un procesamiento en tiempo real que no sería posible con conexiones a Internet. La carga de documentos y el procesamiento de OCR suelen ser entre un 30 y un 40 por ciento más rápidos que las alternativas en la nube gracias a la reducción de los tiempos de transferencia. Los escenarios de alto rendimiento, como las calles de escaneado de 10.000 páginas por hora, se benefician del acceso directo a la GPU sin cuellos de botella en el ancho de banda de Internet.
El ahorro de costes bajo carga constante representa una ventaja económica. Las instancias de GPU en la nube ocasionan costes mensuales considerables cuando se utilizan las 24 horas del día, los 7 días de la semana, mientras que el hardware instalado en las instalaciones genera principalmente costes de electricidad y mantenimiento tras alcanzar el umbral de rentabilidad. Una instalación de servidor de GPU de tamaño medio suele amortizarse tras diez o catorce meses de utilización constante. A lo largo de cinco años, esto suele suponer un ahorro de costes de entre el 60 y el 70% en comparación con implantaciones equivalentes en la nube, pero sólo si el uso es realmente constante sin grandes fluctuaciones de escala.
La independencia del proveedor evita la dependencia de la nube y ofrece previsibilidad a largo plazo. Los costes de hardware son fijos después de la amortización, y los aumentos de precio inesperados del proveedor no afectan a los costes operativos. El control total sobre las actualizaciones y los parches permite planificar según sus propias políticas de seguridad en lugar de las especificaciones del proveedor. La seguridad presupuestaria aumenta gracias a la previsibilidad del gasto sin facturación variable en la nube.
Hardware e infraestructura
El dimensionamiento del hardware depende de los volúmenes de carga de trabajo previstos. Las configuraciones mínimas con servidores de GPU individuales son adecuadas para entre 1.000 y 5.000 documentos al día y suelen costar entre 8.000 y 12.000 euros. Un procesador Xeon con 16 núcleos, 128 GB de RAM ECC y una NVIDIA RTX A4000 con 16 GB de VRAM en dos TB de almacenamiento SSD NVMe proporcionan capacidad suficiente para los casos de uso estándar. El rendimiento del OCR alcanza unas 1000 páginas por hora, y es posible el entrenamiento de modelos más pequeños, aunque limitado por la VRAM.
Las configuraciones de tamaño medio con clústeres redundantes sirven entre 5.000 y 20.000 documentos al día y garantizan una alta disponibilidad. Dos nodos GPU worker, cada uno con procesadores AMD EPYC de 24 núcleos, 256 GB de RAM y GPU NVIDIA A30 con 24 GB de VRAM, cuestan unos 15.000 euros por nodo. Un servidor de base de datos dedicado con 512 GB de RAM y diez TB de almacenamiento NVMe en configuración RAID 10 cuesta 12.000 euros más. Un NAS de almacenamiento con 50 TB de capacidad HDD en RAID 6 para copias de seguridad y archivado completa la infraestructura por 8.000 euros. Los conmutadores de red con diez Gigabit Ethernet conectan los componentes por otros 3.000 euros, con lo que la inversión total ronda los 53.000 euros. Esta configuración alcanza un rendimiento de OCR de 3.000 a 5.000 páginas por hora con conmutación automática en caso de fallo de los nodos.
Las configuraciones empresariales para más de 50.000 documentos al día requieren clusters multi-GPU con una inversión significativamente mayor. Cuatro nodos de trabajo de gama alta, cada uno con procesadores AMD EPYC de 64 núcleos, un TB de RAM y cuatro GPU NVIDIA A100 con 80 GB de VRAM, cuestan unos 80.000 euros por nodo, lo que suma un total de 320.000 euros. Las parejas de servidores de bases de datos de alta disponibilidad con replicación síncrona cuestan 30.000 euros más. Clusters de almacenamiento Ceph con una capacidad total de 200 TB y triple replicación por 60.000 euros y una red InfiniBand de 100 gigabits para la comunicación GPU a GPU por 40.000 euros completan la infraestructura. La inversión total alcanza los 450.000 euros, pero permite un rendimiento de OCR de más de 50.000 páginas por hora y el entrenamiento en paralelo de modelos de gran tamaño con marcos de entrenamiento distribuidos.
La selección de la GPU se basa en los requisitos específicos de la carga de trabajo. Para OCR e inferencia de extracciones, las NVIDIA RTX 4090 o A4000 son adecuadas para el nivel básico, la A30 ofrece la mejor relación precio-rendimiento para la inferencia de producción con diez TFLOPS en sólo seis kilojulios de TDP, y la A40 o la A100 sirven para escenarios de alto rendimiento. La formación de modelos personalizados requiere RTX A5000 para modelos pequeños de menos de 500 megabytes, A100 con 40 GB de VRAM para modelos medianos de entre 500 megabytes y dos gigabytes, y A100 con 80 GB de VRAM o varios A100 en un clúster para modelos grandes de más de dos gigabytes. Los escenarios multitenancy con varios equipos se benefician de A40 o A100 con gran VRAM para el paralelismo, mientras que la tecnología MIG en A100 y H100 garantiza el aislamiento entre cargas de trabajo.
La estrategia de almacenamiento suele implementar tres niveles. Los datos calientes en SSD NVMe para documentos activos, modelos y sistema operativo ofrecen más de 3000 MB por segundo con menos de un milisegundo de latencia a un coste de unos 0,20 euros por gigabyte. Los datos en caliente en SSD SATA para documentos de los últimos 30 días y conjuntos de datos de formación alcanzan los 500 MB por segundo con cinco milisegundos de latencia a 0,08 euros por gigabyte. Los datos en frío en HDD para archivos de más de 90 días y copias de seguridad ofrecen 150 MB por segundo con 15 milisegundos de latencia a 0,02 euros por gigabyte. Una configuración típica combina un TB NVMe, diez TB SSD y 50 TB HDD para una capacidad total de 61 TB a unos 2.300 euros.
Software y funcionamiento
La base de software suele ser Ubuntu Server 22.04 LTS debido a su disponibilidad gratuita, su gran comunidad y el mejor soporte de controladores NVIDIA. Los entornos empresariales a veces prefieren RHEL o CentOS por los contratos de soporte comercial. Los controladores NVIDIA y el kit de herramientas CUDA se instalan a través del gestor de paquetes, Docker con soporte de GPU permite implementaciones en contenedores, y Kubernetes opcional a través de K3s proporciona Orquestación de contenedores para clusters multiservidor.
Las plataformas de contenedores simplifican el despliegue y la gestión. Docker Compose es adecuado para configuraciones de un solo servidor, con una instalación rápida de menos de una hora y una configuración sencilla. Kubernetes es más adecuado para clústeres de varios servidores con capacidades de autoescalado y autorrecuperación, pero requiere una configuración más compleja con un tiempo de configuración de una a dos semanas. La elección depende del tamaño del clúster y de los requisitos de disponibilidad.
La supervisión y la capacidad de observación son esenciales para un funcionamiento productivo. La monitorización de la GPU a través de NVIDIA DCGM exporta métricas a Prometheus, Grafana visualiza paneles de carga, temperatura, uso de VRAM, rendimiento y longitudes de cola. Las métricas críticas incluyen la utilización de la GPU con un objetivo por encima del 70 por ciento para la formación y por encima del 50 por ciento para la inferencia, la temperatura de la GPU con alarma por encima de 85 grados Celsius, el uso de VRAM con alarma por encima del 90 por ciento y los documentos por hora para el seguimiento del rendimiento.
La optimización del rendimiento maximiza la utilización del hardware. El procesamiento por lotes procesa varios documentos simultáneamente en lugar de secuencialmente, lo que suele multiplicar por diez la velocidad. La precisión mixta con FP16 en lugar de FP32 duplica o triplica la velocidad con la mitad de consumo de VRAM. La optimización de TensorRT para modelos ONNX consigue acelerar la inferencia entre dos y cinco veces mediante la optimización de grafos y la fusión de núcleos. El entrenamiento multi-GPU con PyTorch DistributedDataParallel utiliza todas las GPU en paralelo con una aceleración casi lineal.
Las medidas de seguridad proporcionan una protección multicapa de la infraestructura in situ. La seguridad física implementa el control de acceso mediante sistemas de tarjetas de identificación o biométricos, videovigilancia 24/7, un sistema de alarma contra incendios con sistemas de extinción por gas y aire acondicionado para una temperatura constante de entre 18 y 22 grados centígrados a una humedad de entre el 40% y el 60%. La segmentación de la red separa la DMZ con equilibradores de carga, la zona de aplicaciones con servidores API, la zona de bases de datos con acceso restringido y un clúster de GPU con separación por aire opcional para la formación sin conexión a Internet. El cifrado en reposo mediante LUKS protege los discos, el cifrado en tránsito mediante TLS 1.3 asegura las transmisiones y el control de acceso basado en roles limita los derechos de acceso según el principio de mínimo privilegio.
Eficacia económica
El análisis del coste total de propiedad muestra un panorama complejo en función de los patrones de utilización. Las instancias de GPU en la nube cuestan unos 2.200 euros al mes para un funcionamiento 24/7 o 132.000 euros a lo largo de cinco años para una configuración equivalente a la NVIDIA V100. La compra de hardware local comparable cuesta 23.500 euros, más unos 2.600 euros al año en concepto de energía, refrigeración y mantenimiento, lo que arroja un coste total de propiedad de 36.700 euros en cinco años. Esto supone un ahorro de 95.000 euros, es decir, un 72%, pero sólo si la utilización de la capacidad se mantiene constante. El punto de equilibrio se alcanza al cabo de unos diez meses, tras lo cual la inversión se amortiza continuamente.
Con cargas de trabajo variables, el cálculo se desplaza significativamente a favor de la nube. El hardware local debe dimensionarse para los picos de carga e incurre en costes incluso cuando no se utiliza, mientras que los recursos en la nube se escalan según las necesidades y sólo se pagan cuando se utilizan. Los enfoques híbridos combinan la capacidad de base local con la explosión de la nube para los picos, como en infraestructura híbrida multicloud descrito.
Las configuraciones empresariales con una inversión de 450.000 euros se amortizan frente a unos costes equivalentes en la nube de más de 20 millones de euros en cinco años tras unos 14 meses a plena capacidad. Sin embargo, estos escenarios requieren los correspondientes volúmenes de carga de trabajo y personal cualificado para la gestión del hardware, normalmente uno o dos ETC adicionales.
Los costes ocultos incluyen el personal de mantenimiento del hardware, la infraestructura del centro de datos para la alimentación y refrigeración, que representa alrededor del 50% del consumo de energía de los servidores, las medidas de seguridad física y la renovación periódica del hardware cada tres o cinco años. Estos factores deben incluirse en los análisis completos del coste total de propiedad para que las comparaciones sean realistas.
Preguntas más frecuentes
¿Cuándo es económicamente viable la IA in situ?
La IA in situ se amortiza principalmente con una utilización elevada y constante de más del 80 por ciento para un funcionamiento ininterrumpido. El umbral de rentabilidad suele alcanzarse al cabo de diez o catorce meses, tras los cuales se reducen los costes de electricidad, refrigeración y mantenimiento. Las cargas de trabajo variables con fluctuaciones estacionales o uso esporádico siguen siendo más económicas en la nube gracias a los modelos de pago por uso. Los requisitos de cumplimiento de normativas pueden obligar al uso on-premise independientemente de consideraciones de eficiencia económica, por ejemplo en KRITIS o en el sector financiero con requisitos BAIT. Debe disponerse de un presupuesto para la inversión inicial de 50.000 a 500.000 euros sin causar problemas de liquidez.
¿Qué ventajas ofrece el cumplimiento de la normativa in situ?
La soberanía total de los datos permite controlar la ubicación del almacenamiento y el acceso sin la participación de terceros. El tratamiento de datos personales conforme al GDPR tiene lugar sin transferencias a terceros países ni cláusulas contractuales estándar. El cumplimiento de BAIT para los bancos se simplifica al evitar la externalización de la documentación para los proveedores de la nube. Los requisitos de KRITIS con escenarios de brecha de aire solo pueden implementarse en las instalaciones. Las normativas específicas del sector, como el seguro de responsabilidad profesional legal o la clasificación militar, a menudo exigen implantaciones obligatorias in situ. Los registros de auditoría y las pruebas de cumplimiento se simplifican mediante un control transparente de la infraestructura.
¿Hasta qué punto es compleja la gestión del hardware?
La complejidad operativa requiere personal informático cualificado con experiencia en hardware para el mantenimiento de servidores, la resolución de problemas de GPU y la gestión del almacenamiento. Esto suele suponer entre 0,3 y un ETC en función del tamaño del clúster y del grado de automatización. Los sistemas de monitorización reducen el esfuerzo manual mediante alertas automáticas en caso de anomalías. Los contratos de asistencia de los proveedores de hardware aceleran las reparaciones en caso de avería. Kubernetes o plataformas de orquestación similares automatizan los despliegues y actualizaciones de software. Sin embargo, las implantaciones en la nube, donde los proveedores se encargan de la gestión del hardware, son considerablemente más complejas.
¿Puedo combinar las instalaciones locales con la nube?
Los enfoques híbridos utilizan las instalaciones para los datos confidenciales y la carga base constante, mientras que los recursos en la nube se utilizan para los picos de carga, la recuperación de desastres o los usuarios distribuidos geográficamente. Los patrones de residencia de datos procesan los datos personales in situ, mientras que los datos anonimizados se utilizan para el entrenamiento de ML en la nube con potencia de GPU. Los escenarios Burst-to-cloud se escalan automáticamente a la nube cuando se sobrecarga la capacidad local. Esto combina las ventajas de cumplimiento de normativas y la rentabilidad de las instalaciones locales con la flexibilidad y escalabilidad de la nube, pero requiere una complejidad de gestión adicional.
¿Qué alternativas hay a la nube pública?
La nube privada, como término medio, ofrece una flexibilidad similar a la de la nube con una infraestructura dedicada, ya sea in situ o alojada por proveedores especializados. Los proveedores alemanes de nube soberana, como Open Telekom Cloud, cumplen estrictos requisitos de protección de datos para sectores regulados. Los proveedores de servicios gestionados operan el hardware en sus centros de datos bajo sus políticas de seguridad y acuerdos de nivel de servicio. La coubicación alquila espacio de rack en centros de datos profesionales con alimentación, refrigeración y seguridad física, mientras que usted posee y gestiona el hardware. Estas opciones combinan varias ventajas de las instalaciones locales y la nube en función de sus necesidades específicas.
¿Desea explotar la infraestructura de IA in situ? Póngase en contacto con nosotros Consulta inicial no vinculante.
