Compromiso CVE
Ejecute IA sobre sus datos más sensibles, sin que salgan nunca del edificio.
IA generativa en sus propias GPU, dentro de su propio perímetro
Infraestructura GPU, servidores de inferencia, modelos de lenguaje de pesos abiertos, recuperación sobre sus propios documentos y MLOps, entregados on-prem y, cuando se requiere, totalmente desconectados de internet.
- Infraestructura GPU
- vLLM
- Triton
- LLM de pesos abiertos
- RAG
- MLOps
Las tecnologías que cubrimos
Productos de esta familia
Infraestructura GPU
Nodos GPU NVIDIA en bare metal o Kubernetes con el GPU Operator, particionado MIG, planificación y monitorización, dimensionados para inferencia y fine-tuning.
Bare metalKubernetesNube privadaAir-gappedSoporte oficial

vLLM
Servidor de inferencia de LLM de alto rendimiento con paged attention, batching continuo y API compatible con OpenAI para chat, completado y embeddings.
KubernetesBare metalAir-gappedSoporte oficial
NVIDIA Triton Inference Server
Servidor de inferencia multi-framework para modelos de scoring, clasificación y anomalías (ONNX, TensorRT, PyTorch, XGBoost) con batching de baja latencia.
KubernetesBare metalAir-gappedSoporte oficial
LLM de pesos abiertos
Familias de modelos Llama, Mistral, Qwen y Gemma, seleccionadas, cuantizadas y evaluadas para su caso de uso, con licencias revisadas para uso comercial.
KubernetesBare metalAir-gappedSoporte oficial
RAG sobre datos propios
Generación aumentada por recuperación sobre documentos internos con OpenSearch k-NN o pgvector, con guardarraíles, citas y traza de auditoría completa de los prompts.
KubernetesNube privadaAir-gappedSoporte oficial
MLOps on-prem
MLflow y Kubeflow para seguimiento de experimentos, registro de modelos, pipelines y promoción controlada de staging a producción.
KubernetesNube privadaAir-gappedSoporte oficial
Por qué importa para la localización de datos
Dónde se cruza esta familia con la directiva del CBN
La directiva de localización de datos del CBN exige que el procesamiento primario, las bases de datos, las copias de seguridad, la gestión de identidades y accesos, las claves de cifrado y los logs de auditoría de los datos financieros nigerianos permanezcan en el país antes del 1 de enero de 2027, sin dependencia de una nube extranjera. La IA generativa choca frontalmente con ese requisito. Cada prompt enviado a una API de modelo alojada es procesamiento primario de lo que contenga: una reclamación de cliente, un expediente de préstamo, una política interna. Enviarlo al extranjero es una transferencia, y las condiciones de retención y entrenamiento del proveedor quedan fuera de su control. Para las cargas más sensibles, como los modelos de fraude o los datos de pago, algunas entidades concluyen que los datos no deben salir siquiera de la red, y mucho menos del país. Esta familia le permite usar la misma clase de modelos que ofrecen los hyperscalers, en GPU ubicadas en un centro de datos nigeriano, con recuperación sobre sus propios documentos y cada prompt y respuesta registrados para auditoría. En su forma air-gapped la plataforma no tiene ninguna ruta a internet, y los modelos llegan mediante una importación controlada con cadena de custodia documentada. Nada de esto constituye asesoramiento legal; su equipo de cumplimiento debe confirmar el alcance aplicable a su entidad.
El camino con NuxFamily
- 01Assess
- 02Design
- 03Build
- 04Migrate
- 05Operate
- 06Evolve
Cada familia se entrega con el mismo camino de seis etapas, con soporte oficial 24×7 y transferencia de conocimiento incluidos.
Nuestra experiencia
Credenciales, no adjetivos
Nuestra práctica de IA nació de dos décadas operando plataformas de datos sin GPU para bancos: las capas de Kubernetes, almacenamiento, streaming y búsqueda sobre las que se apoya una plataforma de IA privada ya estaban en producción. Desde 2022 hemos entregado plataformas de inferencia on-prem con vLLM y Triton, asistentes RAG privados sobre bibliotecas de políticas y procedimientos, y servicios de scoring de fraude integrados en flujos de pago. Dos de esos despliegues funcionan totalmente desconectados. Los mismos ingenieros que construyen la plataforma sostienen el contrato de soporte.
Sectores
- banca
- seguros
- retail
- industria
4+
Años con estas tecnologías
8+
Despliegues en producción
Clúster de inferencia de 32 GPU sirviendo un modelo de 70B parámetros a 2.000 usuarios internos
Mayor escala entregada
Soporte oficial de vendor
Niveles de soporte para esta familia
Essential
- Cobertura
- 8×5, horario laboral de Nigeria
- Respuesta P1
- 4 h
- Soporte correctivo para vLLM, Triton, GPU Operator y la pila de MLOps
- Parches de seguridad para las líneas de versión soportadas
- Acceso a la base de conocimiento y al portal de tickets
- Orientación sobre selección de modelos, cuantización y dimensionamiento de GPU
Business
- Cobertura
- 24×7
- Respuesta P1
- 1 h
- Todo lo incluido en Essential
- Monitorización proactiva de uso de GPU, latencia y profundidad de colas
- Health checks trimestrales y revisión de la evaluación de modelos
- Gestión de versiones de servidores de inferencia, drivers y CUDA
- Actualizaciones controladas de modelos, incluida la importación air-gapped
Mission Critical
El más elegido- Cobertura
- 24×7 con ingeniero asignado
- Respuesta P1
- 15 min
- Todo lo incluido en Business
- Ingeniero designado que conoce sus modelos y su parque de GPU
- Revisión de arquitectura dos veces al año
- Soporte en actualizaciones mayores (vLLM, Triton, pila GPU de Kubernetes)
- Acompañamiento en inspecciones del CBN y auditorías de gobierno de modelos
Política de versiones
Los tiempos de respuesta y los nombres de los niveles son orientativos y se confirman contractualmente.
Casos de uso
Cómo se usa en un banco regulado
Caso de uso 01
Asistente interno sobre documentación y normativa del banco (RAG privado)
El personal dedica horas a buscar en políticas, procedimientos, manuales de producto y circulares del CBN. Un asistente de IA público queda descartado porque los documentos son confidenciales y las preguntas revelan contexto de negocio. El banco quiere un asistente que responda desde su propia biblioteca con citas, íntegramente on-prem.
Tecnologías
- vLLM
- OpenSearch
- LLM de pesos abiertos
- MLflow
Resultado esperado
El personal obtiene respuestas con fuentes en segundos desde la propia biblioteca del banco, y ningún documento ni pregunta sale del perímetro. El índice de auditoría muestra exactamente qué vio y qué dijo el asistente.
Métrica: Precisión de citas superior al 90 % en el conjunto evaluado, tiempo de respuesta mediano inferior a 5 segundos
- 1Ingerir documentos. Políticas, procedimientos, circulares y manuales se extraen del repositorio documental, se parsean y se trocean con sus permisos de acceso adjuntos.
- 2Generar embeddings. Un modelo de embeddings de pesos abiertos ejecutado en vLLM convierte cada fragmento en un vector en las GPU locales.
- 3Indexar vectores. Vectores y metadatos se almacenan en OpenSearch k-NN, con filtros por departamento, estado del documento y fecha de vigencia.
- 4Recuperar con permisos. Cada pregunta recupera los fragmentos más relevantes que el usuario está autorizado a ver; nada fuera de sus permisos entra en el prompt.
- 5Generar con citas. Un modelo Llama o Qwen servido por vLLM responde a partir del contexto recuperado y cita los párrafos de origen.
- 6Proteger y registrar. Los guardarraíles bloquean la inyección de prompts y las peticiones fuera de alcance; cada prompt, contexto y respuesta se escribe en un índice de auditoría.
- 7Evaluar continuamente. Un conjunto de preguntas evaluado se vuelve a ejecutar con cada cambio de modelo o índice para seguir la calidad de las respuestas y la precisión de las citas.
Caso de uso 02
IA totalmente desconectada (air-gapped)
Caso de uso 03
Scoring y detección de anomalías embebidos en el flujo transaccional
Arquitectura de referencia
Cómo es un despliegue que cumple
Datos y modelos
Recuperación y orquestación
Inferencia en GPU
Consumidores
Ruta de migración
De donde está hoy a una plataforma que cumple
01
2-3 semanasEvaluar
Actividades
- Inventariar el uso actual de IA, incluidas las API alojadas y las herramientas no autorizadas
- Clasificar los datos que toca cada caso de uso y su alcance de localización
- Seleccionar dos o tres casos de uso con valor medible y un conjunto de evaluación definido
- Estimar la capacidad GPU y decidir entre despliegue conectado o air-gapped
02
4-6 semanasConstrucción de la plataforma
Actividades
- Desplegar nodos GPU con el GPU Operator sobre la plataforma Kubernetes
- Instalar vLLM, Triton, el índice vectorial y la pila de MLOps
- Configurar el registro de modelos, la firma y, si se requiere, el proceso de importación offline
- Integrar SSO, permisos y el índice de auditoría
03
4-6 semanasPiloto
Actividades
- Construir el primer caso de uso de extremo a extremo con un grupo de usuarios limitado
- Evaluar los modelos candidatos contra el conjunto evaluado y seleccionar
- Ajustar recuperación, guardarraíles y prompts a partir del uso real
- Documentar las fichas de modelo, las licencias y el registro de evaluación
04
3-4 semanasDespliegue y retirada de las API externas
Actividades
- Extender a todos los usuarios y a los casos de uso restantes
- Cortar las API de IA alojadas en el proxy y cerrar las cuentas
- Publicar la política de uso y formar a los usuarios
- Elaborar las evidencias de localización de la plataforma de IA
05
ContinuoOperar y evolucionar
Actividades
- Soporte 24×7 según el nivel acordado
- Actualizaciones mensuales de modelos y parches mediante el proceso controlado
- Monitorización de deriva y reevaluación periódica
- Transferencia de conocimiento para que el equipo del banco opere la plataforma
FAQ
Preguntas que nos hacen los arquitectos
Enviar datos de clientes, de pagos o internos en un prompt a un servicio alojado en el extranjero es procesar esos datos fuera de Nigeria, que es precisamente lo que la directiva pretende evitar. Que un uso concreto esté en el alcance depende de los datos implicados. Ejecutar el modelo en su propia infraestructura elimina la cuestión por completo. Esto no es asesoramiento legal; confirme la interpretación con su función de cumplimiento.
Para asistentes con recuperación aumentada, procesamiento documental, clasificación y resumen, los modelos de pesos abiertos actuales en el rango de 8B a 70B rinden al nivel requerido, y lo medimos sobre su propio conjunto de evaluación antes de comprometernos. Para scoring y detección de anomalías, los modelos son suyos y nunca dependieron de un LLM alojado. Donde un modelo alojado es realmente mejor, la diferencia suele ser menor que el coste de cumplimiento.
Un asistente privado para unos cientos de usuarios funciona con holgura en dos a cuatro GPU de centro de datos con un modelo cuantizado de 8B a 32B. Modelos mayores o miles de usuarios necesitan más; el scoring de fraude en Triton a menudo no necesita ninguna y funciona en CPU. Dimensionamos a partir del rendimiento de tokens medido y los objetivos de latencia, no de reglas generales, y MIG permite que una GPU sirva varias cargas pequeñas.
Los pesos, imágenes y parches nuevos se descargan en un host de staging conectado, se verifican por hash, se escanean y se firman, y después se transfieren en soportes cifrados al enclave, donde las firmas se comprueban de nuevo antes del registro. Cada importación queda registrada con quién la hizo y cuándo. Con cadencia mensual se convierte en rutina.
Cada modelo del registro lleva una ficha con su licencia, descripción de los datos de entrenamiento, resultados de evaluación y aprobador. Cada inferencia lleva la versión del modelo, y los prompts y respuestas se registran en un índice de auditoría. Para los modelos de scoring se generan informes de importancia de características y de deriva para la función de riesgo de modelo.
Los ingenieros de NuxFamily prestan el soporte directamente sobre los servidores de inferencia, la pila GPU, el índice vectorial y los componentes de MLOps, desde la primera respuesta hasta la causa raíz. La cobertura incluye parches de seguridad, gestión de versiones, actualizaciones controladas de modelos y, en el nivel Mission Critical, un ingeniero designado y acompañamiento en inspecciones del CBN y auditorías de gobierno de modelos. Los términos exactos del SLA se recogen en el contrato de soporte.
Sí. El mismo pool de GPU admite fine-tuning eficiente en parámetros (LoRA) para clasificación, extracción y estilo de dominio, con seguimiento en MLflow. Recomendamos empezar por la recuperación y el diseño de prompts, que resuelven la mayoría de los casos de uso de asistente, y hacer fine-tuning solo donde una evaluación muestre una mejora medible.
Más de dos décadas
Construido por el equipo detrás de las plataformas de Santander, ING, Bankinter, Mapfre e Inditex
Más de veinte años diseñando, construyendo y operando nubes privadas para instituciones que no pueden permitirse fallar, y un modelo de entrega en el que le acompañamos del assessment a la operación.
Ver nuestro track record20+
Años construyendo nubes privadas
40+
Nubes privadas entregadas
Hable con un arquitecto sobre esta familia
Cuéntenos dónde está hoy y le devolveremos una primera visión de la arquitectura objetivo y la ruta de migración.