Construir sobre una plataforma compartida como nuestro CONFÍA CORE es una decisión de apalancamiento radical. Permite a una nueva venture como Mental Wealth nacer con una infraestructura de IA de nivel mundial desde el día uno, algo que le tomaría años y millones de euros construir por su cuenta. Pero este apalancamiento viene con un riesgo inherente y sistémico: una debilidad en el núcleo puede comprometer a todo el holding. La velocidad de una venture no puede ser la causa de la inestabilidad de otra. La pregunta no es si centralizar, sino cómo hacerlo sin ahogar la innovación que se pretende fomentar.
La respuesta es un framework de AI Ops diseñado no como un departamento de control, sino como el sistema nervioso central del venture studio. No es una capa de burocracia, es una red de sensores, reflejos y mecanismos de aprendizaje que garantiza la salud del conjunto. Nuestra tesis es simple: en un venture studio de IA, la excelencia en AI Ops no es un lujo operativo, es la principal fuente de ventaja competitiva sostenible. Permite que NOKAI procese datos de atletas en tiempo real con la misma fiabilidad que VoltQai predice la demanda energética de una ciudad, todo sobre la misma base tecnológica. Este es el manual de operaciones de cómo gestionamos la calidad a escala.
§El Doble Filo de la Plataforma Central
CONFÍA CORE expone a nuestras ventures una serie de primitivas de alto nivel: orquestación de modelos, pipelines de datos vectorizados, APIs de inferencia unificadas y gestión de estado conversacional. Para PetMind.ai, esto significa poder pasar de una idea sobre el análisis de comportamiento canino a un prototipo funcional en semanas. El beneficio es evidente.
El riesgo, sin embargo, es más sutil. Un cambio en el orquestador de modelos para optimizar la latencia en las aplicaciones de Aurun podría, teóricamente, introducir un regresión en la precisión de los modelos de Bipolar Tracking, donde la fiabilidad es una cuestión de salud. Un pico de coste inesperado en un experimento de Educa Labs podría agotar el presupuesto de GPUs reservado para las operaciones críticas de VoltQai.
La confianza no se hereda, se evalúa. En nuestro holding, cada despliegue la revalida.
Afrontamos este desafío con un sistema que equilibra la autonomía con la gobernanza centralizada, basado en tres pilares integrados directamente en CONFÍA CORE. No se trata de pedir permiso, sino de operar dentro de un entorno inteligente que previene fallos por diseño.
§Los Tres Pilares de AI Ops en CONFÍA CORE
Nuestra estrategia de AI Ops no es un conjunto de herramientas dispares, sino un sistema cohesivo que cubre el ciclo de vida completo de nuestros modelos y aplicaciones de IA. Cada pilar refuerza a los otros, creando un bucle de retroalimentación constante.
1. Observabilidad Unificada, Contexto Específico
No puedes gestionar lo que no puedes ver. Pero en un entorno multi-venture, la telemetría genérica es solo ruido. Nuestra plataforma de observabilidad ingiere logs, trazas (OpenTelemetry) y métricas (Prometheus) de todas las operaciones de IA en un data lake centralizado. La clave, sin embargo, es el enriquecimiento de metadatos.
Cada evento (una llamada a un LLM, una ejecución de pipeline) se etiqueta automáticamente con venture_id, product_feature, user_cohort, model_version, y cost_center. Esto nos permite pasar de una vista de holding de 30.000 pies a la traza específica de una única sesión de usuario en Mental Wealth con un solo clic.
Esta arquitectura nos da lo mejor de ambos mundos: el equipo de plataforma puede monitorizar la salud global y los costes del sistema, mientras que el equipo de PetMind.ai tiene su propio dashboard enfocado exclusivamente en las métricas que definen el éxito de su producto, como la precisión en la clasificación de ladridos o el coste por análisis de vídeo.
2. Evaluación Continua como Servicio (Evals-as-a-Service)
La evaluación de modelos de IA es notoriamente compleja y específica del dominio. Forzar un único estándar de evaluación es inútil. En su lugar, CONFÍA CORE ofrece un framework de evaluación declarativa. Cada venture define sus criterios de éxito en un archivo de configuración evals.yml.
Este archivo puede incluir:
- Métricas objetivas:
accuracy,F1-score,ROUGEpara tareas de NLP. - Evaluadores basados en modelos: Usar
gpt-4ooclaude-3-opuscomo jueces para evaluar la coherencia, la relevancia o el tono de una respuesta, comparando la salida del modelo candidato con una respuesta de referencia. - Evaluadores heurísticos: Comprobar si una respuesta contiene alucinaciones (
hallucination_check) o si una recomendación de producto deAurunes un artículo que existe en el catálogo. - Hooks para evaluación humana: Integración con plataformas de etiquetado para que los expertos del dominio (veterinarios para
PetMind.ai, psiquiatras paraBipolar Tracking) validen los casos límite.
Cuando un desarrollador de NOKAI hace un git push a una rama de un nuevo modelo de análisis de rendimiento, se desencadena un pipeline de CI/CD que automáticamente ejecuta el set de evals.yml correspondiente. Si las puntuaciones caen por debajo de un umbral predefinido, el despliegue se bloquea. Esto convierte la calidad de la IA en una prueba unitaria más del proceso de desarrollo.
3. Guardrails y Gobernanza Activa
Los guardrails son los airbags de nuestro sistema de IA. Son políticas no negociables que se aplican a nivel de plataforma para proteger tanto a los usuarios como al holding. Se implementan como una capa de middleware en el gateway de inferencia de CONFÍA CORE.
Cada venture hereda un conjunto de guardrails base (seguridad, toxicidad, detección de PII básica) y puede optar por activar otros más específicos. Esto se gestiona de forma centralizada pero se aplica contextualmente.
| Venture | Guardrail Primario | Métrica Clave de AI Ops |
|---|---|---|
Bipolar Tracking | Redacción PII estricta (salud) | % de datos sensibles enmascarados |
VoltQai | Latencia de predicción (max 200ms) | P99 de latencia del modelo |
Mental Wealth | Filtro de toxicidad y auto-lesión | Tasa de falsos negativos (seguridad) |
Además, los guardrails son activos. Un cost_guardrail no solo alerta de un pico de gasto, sino que puede redirigir automáticamente el tráfico de un modelo caro (gpt-4o) a uno más económico (haiku) si el presupuesto de una feature específica está a punto de agotarse, degradando graciosamente el servicio en lugar de interrumpirlo o generar una factura astronómica.
Nuestros dashboards de AI Ops no son para apagar fuegos. Son el mapa para construir sistemas más resistentes.
§Implicación Operativa: AI Ops como Moat
Para los founders y operadores técnicos dentro y fuera de nuestro ecosistema, el mensaje es claro: dejen de tratar a AI Ops como una tarea de mantenimiento. Es una disciplina de producto. Un buen sistema de AI Ops no solo previene desastres; genera insights. Los datos de nuestros evaluadores y monitores de rendimiento son el input más valioso para el backlog de producto y la hoja de ruta de la plataforma. Nos dicen qué modelos funcionan, para qué casos de uso y a qué coste. Nos muestran dónde la IA está creando valor real y dónde es solo un adorno caro.
Para los inversores, la implicación es igualmente directa. En 2026, la defensibilidad de una compañía de IA rara vez reside en el modelo que utiliza, ya que la mayoría son commodities accesibles vía API. La verdadera ventaja competitiva, el 'moat', se encuentra en la fábrica que construye, despliega, monitoriza y mejora las aplicaciones sobre esos modelos. Al evaluar una inversión, pregunte por sus evals. Pida ver sus dashboards de observabilidad. Indague sobre sus guardrails. La madurez de su stack de AI Ops es el indicador más fiable de su capacidad para escalar de forma sostenible, segura y rentable.