Skip to content
Fecha límite del CBN, 1 ene 2027: 99d 00h 25m restantes.Hable con nosotros
NuxFamily

Ejecute IA sobre sus datos más sensibles, sin que salgan nunca del edificio.

IA generativa en sus propias GPU, dentro de su propio perímetro

Infraestructura GPU, servidores de inferencia, modelos de lenguaje de pesos abiertos, recuperación sobre sus propios documentos y MLOps, entregados on-prem y, cuando se requiere, totalmente desconectados de internet.

  • Infraestructura GPU
  • vLLM
  • Triton
  • LLM de pesos abiertos
  • RAG
  • MLOps

Las tecnologías que cubrimos

Productos de esta familia

  • Infraestructura GPU

    Nodos GPU NVIDIA en bare metal o Kubernetes con el GPU Operator, particionado MIG, planificación y monitorización, dimensionados para inferencia y fine-tuning.

    Bare metalKubernetesNube privadaAir-gapped

    Soporte oficial

  • vLLM

    Servidor de inferencia de LLM de alto rendimiento con paged attention, batching continuo y API compatible con OpenAI para chat, completado y embeddings.

    KubernetesBare metalAir-gapped

    Soporte oficial

  • NVIDIA Triton Inference Server

    Servidor de inferencia multi-framework para modelos de scoring, clasificación y anomalías (ONNX, TensorRT, PyTorch, XGBoost) con batching de baja latencia.

    KubernetesBare metalAir-gapped

    Soporte oficial

  • LLM de pesos abiertos

    Familias de modelos Llama, Mistral, Qwen y Gemma, seleccionadas, cuantizadas y evaluadas para su caso de uso, con licencias revisadas para uso comercial.

    KubernetesBare metalAir-gapped

    Soporte oficial

  • RAG sobre datos propios

    Generación aumentada por recuperación sobre documentos internos con OpenSearch k-NN o pgvector, con guardarraíles, citas y traza de auditoría completa de los prompts.

    KubernetesNube privadaAir-gapped

    Soporte oficial

  • MLOps on-prem

    MLflow y Kubeflow para seguimiento de experimentos, registro de modelos, pipelines y promoción controlada de staging a producción.

    KubernetesNube privadaAir-gapped

    Soporte oficial

Por qué importa para la localización de datos

Dónde se cruza esta familia con la directiva del CBN

La directiva de localización de datos del CBN exige que el procesamiento primario, las bases de datos, las copias de seguridad, la gestión de identidades y accesos, las claves de cifrado y los logs de auditoría de los datos financieros nigerianos permanezcan en el país antes del 1 de enero de 2027, sin dependencia de una nube extranjera. La IA generativa choca frontalmente con ese requisito.

El camino con NuxFamily

  1. 01Assess
  2. 02Design
  3. 03Build
  4. 04Migrate
  5. 05Operate
  6. 06Evolve

Cada familia se entrega con el mismo camino de seis etapas, con soporte oficial 24×7 y transferencia de conocimiento incluidos.

Nuestra experiencia

Credenciales, no adjetivos

Nuestra práctica de IA nació de dos décadas operando plataformas de datos sin GPU para bancos: las capas de Kubernetes, almacenamiento, streaming y búsqueda sobre las que se apoya una plataforma de IA privada ya estaban en producción. Desde 2022 hemos entregado plataformas de inferencia on-prem con vLLM y Triton, asistentes RAG privados sobre bibliotecas de políticas y procedimientos, y servicios de scoring de fraude integrados en flujos de pago. Dos de esos despliegues funcionan totalmente desconectados. Los mismos ingenieros que construyen la plataforma sostienen el contrato de soporte.

Sectores

  • banca
  • seguros
  • retail
  • industria

4+

Años con estas tecnologías

8+

Despliegues en producción

Clúster de inferencia de 32 GPU sirviendo un modelo de 70B parámetros a 2.000 usuarios internos

Mayor escala entregada

Soporte oficial de vendor

Niveles de soporte para esta familia

Essential

Cobertura
8×5, horario laboral de Nigeria
Respuesta P1
4 h
  • Soporte correctivo para vLLM, Triton, GPU Operator y la pila de MLOps
  • Parches de seguridad para las líneas de versión soportadas
  • Acceso a la base de conocimiento y al portal de tickets
  • Orientación sobre selección de modelos, cuantización y dimensionamiento de GPU

Business

Cobertura
24×7
Respuesta P1
1 h
  • Todo lo incluido en Essential
  • Monitorización proactiva de uso de GPU, latencia y profundidad de colas
  • Health checks trimestrales y revisión de la evaluación de modelos
  • Gestión de versiones de servidores de inferencia, drivers y CUDA
  • Actualizaciones controladas de modelos, incluida la importación air-gapped

Mission Critical

El más elegido
Cobertura
24×7 con ingeniero asignado
Respuesta P1
15 min
  • Todo lo incluido en Business
  • Ingeniero designado que conoce sus modelos y su parque de GPU
  • Revisión de arquitectura dos veces al año
  • Soporte en actualizaciones mayores (vLLM, Triton, pila GPU de Kubernetes)
  • Acompañamiento en inspecciones del CBN y auditorías de gobierno de modelos

Compromiso CVE

Política de versiones

Los tiempos de respuesta y los nombres de los niveles son orientativos y se confirman contractualmente.

Casos de uso

Cómo se usa en un banco regulado

Caso de uso 01

Asistente interno sobre documentación y normativa del banco (RAG privado)

El personal dedica horas a buscar en políticas, procedimientos, manuales de producto y circulares del CBN. Un asistente de IA público queda descartado porque los documentos son confidenciales y las preguntas revelan contexto de negocio. El banco quiere un asistente que responda desde su propia biblioteca con citas, íntegramente on-prem.

Tecnologías

  • vLLM
  • OpenSearch
  • LLM de pesos abiertos
  • MLflow

Resultado esperado

El personal obtiene respuestas con fuentes en segundos desde la propia biblioteca del banco, y ningún documento ni pregunta sale del perímetro. El índice de auditoría muestra exactamente qué vio y qué dijo el asistente.

Métrica: Precisión de citas superior al 90 % en el conjunto evaluado, tiempo de respuesta mediano inferior a 5 segundos

Asistente interno sobre documentación y normativa del banco (RAG privado)El personal dedica horas a buscar en políticas, procedimientos, manuales de producto y circulares del CBN. Un asistente de IA público queda descartado porque los documentos son confidenciales y las preguntas revelan contexto de negocio. El banco quiere un asistente que responda desde su propia biblioteca con citas, íntegramente on-prem. El personal obtiene respuestas con fuentes en segundos desde la propia biblioteca del banco, y ningún documento ni pregunta sale del perímetro. El índice de auditoría muestra exactamente qué vio y qué dijo el asistente.1Ingerir documentosPipeline de ingesta2Generar embeddingsvLLM3Indexar vectoresOpenSearch4Recuperar con permisosRecuperador5Generar con citasvLLM6Proteger y registrarGuardarraíles7Evaluar continuamenteMLflow
  1. 1Ingerir documentos. Políticas, procedimientos, circulares y manuales se extraen del repositorio documental, se parsean y se trocean con sus permisos de acceso adjuntos.
  2. 2Generar embeddings. Un modelo de embeddings de pesos abiertos ejecutado en vLLM convierte cada fragmento en un vector en las GPU locales.
  3. 3Indexar vectores. Vectores y metadatos se almacenan en OpenSearch k-NN, con filtros por departamento, estado del documento y fecha de vigencia.
  4. 4Recuperar con permisos. Cada pregunta recupera los fragmentos más relevantes que el usuario está autorizado a ver; nada fuera de sus permisos entra en el prompt.
  5. 5Generar con citas. Un modelo Llama o Qwen servido por vLLM responde a partir del contexto recuperado y cita los párrafos de origen.
  6. 6Proteger y registrar. Los guardarraíles bloquean la inyección de prompts y las peticiones fuera de alcance; cada prompt, contexto y respuesta se escribe en un índice de auditoría.
  7. 7Evaluar continuamente. Un conjunto de preguntas evaluado se vuelve a ejecutar con cada cambio de modelo o índice para seguir la calidad de las respuestas y la precisión de las citas.

Caso de uso 02

IA totalmente desconectada (air-gapped)

Caso de uso 03

Scoring y detección de anomalías embebidos en el flujo transaccional

Arquitectura de referencia

Cómo es un despliegue que cumple

Plataforma de IA privada con air-gap opcionalInferencia y orquestación soportadas por NuxFamilyDatos, pipelines y consumidoresOrigen externo fuera del perímetro

Ruta de migración

De donde está hoy a una plataforma que cumple

  1. 01

    2-3 semanas

    Evaluar

    Actividades

    • Inventariar el uso actual de IA, incluidas las API alojadas y las herramientas no autorizadas
    • Clasificar los datos que toca cada caso de uso y su alcance de localización
    • Seleccionar dos o tres casos de uso con valor medible y un conjunto de evaluación definido
    • Estimar la capacidad GPU y decidir entre despliegue conectado o air-gapped
  2. 02

    4-6 semanas

    Construcción de la plataforma

    Actividades

    • Desplegar nodos GPU con el GPU Operator sobre la plataforma Kubernetes
    • Instalar vLLM, Triton, el índice vectorial y la pila de MLOps
    • Configurar el registro de modelos, la firma y, si se requiere, el proceso de importación offline
    • Integrar SSO, permisos y el índice de auditoría
  3. 03

    4-6 semanas

    Piloto

    Actividades

    • Construir el primer caso de uso de extremo a extremo con un grupo de usuarios limitado
    • Evaluar los modelos candidatos contra el conjunto evaluado y seleccionar
    • Ajustar recuperación, guardarraíles y prompts a partir del uso real
    • Documentar las fichas de modelo, las licencias y el registro de evaluación
  4. 04

    3-4 semanas

    Despliegue y retirada de las API externas

    Actividades

    • Extender a todos los usuarios y a los casos de uso restantes
    • Cortar las API de IA alojadas en el proxy y cerrar las cuentas
    • Publicar la política de uso y formar a los usuarios
    • Elaborar las evidencias de localización de la plataforma de IA
  5. 05

    Continuo

    Operar y evolucionar

    Actividades

    • Soporte 24×7 según el nivel acordado
    • Actualizaciones mensuales de modelos y parches mediante el proceso controlado
    • Monitorización de deriva y reevaluación periódica
    • Transferencia de conocimiento para que el equipo del banco opere la plataforma

FAQ

Preguntas que nos hacen los arquitectos

Enviar datos de clientes, de pagos o internos en un prompt a un servicio alojado en el extranjero es procesar esos datos fuera de Nigeria, que es precisamente lo que la directiva pretende evitar. Que un uso concreto esté en el alcance depende de los datos implicados. Ejecutar el modelo en su propia infraestructura elimina la cuestión por completo. Esto no es asesoramiento legal; confirme la interpretación con su función de cumplimiento.

Más de dos décadas

Construido por el equipo detrás de las plataformas de Santander, ING, Bankinter, Mapfre e Inditex

Más de veinte años diseñando, construyendo y operando nubes privadas para instituciones que no pueden permitirse fallar, y un modelo de entrega en el que le acompañamos del assessment a la operación.

Ver nuestro track record

20+

Años construyendo nubes privadas

40+

Nubes privadas entregadas

Hable con un arquitecto sobre esta familia

Cuéntenos dónde está hoy y le devolveremos una primera visión de la arquitectura objetivo y la ruta de migración.

Sin listas de correo ni seguimientos automáticos. Respondemos personalmente en un día laborable.