MAXIQUEEN OS v2.0

Sistema Operativo Empresarial de Agentes Cognitivos. Manual técnico integrado y vivo — une el diseño fundacional v1.0 (navy #0A1931 / gold #C9A227) con la especificación completa v2.0.

Arquitectura por capas Kernel cognitivo Multi-tenant con RLS Economía de inferencia Observabilidad total
1

Manifiesto

MAXIQUEEN OS no es un chatbot. Es el sistema operativo que convierte tu empresa en un organismo autónomo donde los LLMs son herramientas, no empleados. Los empleados son agentes especializados dirigidos por directores, orquestados por un kernel y gobernados por memoria, políticas y costos.

  • Primero el negocio: cada agente nace con un KPI, un presupuesto y un SLA.
  • Gobierno por políticas: privacidad, costo y latencia deciden qué cerebro usar.
  • Memoria como activo: lo que aprende hoy, opera mañana sin reentrenar.
2

Visión

De SaaS a OS

Pasar de herramientas aisladas a un OS donde los procesos se ejecutan como hilos cognitivos orquestados, medibles y facturables.

Empresa Clonable

Blueprints versionados permiten replicar departamentos completos en minutos con memoria, políticas y métricas precargadas.

3

Arquitectura por Capas (5)

1. Interfaz

Control Center, APIs, Webhooks, SDK. Experiencia unificada para humanos y sistemas.

2. Orquestación (Kernel)

Scheduler DAG, Router de inferencia, Políticas, Seguridad.

3. Operacional

Directores y Agentes especializados con roles, memoria y herramientas.

4. Cognitiva

Proveedores abstractos A/B/C/Local. Los LLMs son herramientas.

5. Persistencia

Memoria jerárquica: RAM, corto plazo, vectorial, histórica.

4

Arquitectura Física y Topología de Red

Distribución edge-to-core con enrutamiento inteligente y observabilidad end-to-end.

Cloudflare EdgeWAF / CDN / DNS VercelFrontend / API Director OperacionesOrquestador Worker RuntimeJobs / Cron BalanceoPolíticas Inferencia NubeProv. A/B/C Inferencia LocalOllama / GPU PersistenciaMongo / Redis / PG ObservabilidadLogs / Métricas
Notas de despliegue

Edge termina TLS y aplica rate-limit. Vercel sirve UI y API routes stateless. El Director encola tareas en el Worker Runtime. El balanceador aplica la economía de inferencia antes de llamar a proveedores.

5

El Kernel del Sistema Operativo

El núcleo no ejecuta código binario tradicional; coordina hilos de ejecución cognitiva.

Scheduler (DAG)
Grafos de tareas

Planifica dependencias, paralelismo y reintentos con garantías idempotentes.

Agent Runtime
Ciclo de vida

Crea, hidrata memoria, ejecuta herramientas, guarda estado, duerme y reactiva.

Memory Manager
4 niveles

Enruta lecturas/escrituras entre RAM, corto plazo, vectorial e histórica.

6

Capa Operacional

Jerarquía operativa donde los LLMs son herramientas, no empleados:

CEO Director IA Director Comercial Director Financiero Director Técnico Agentes Especializados Herramientas LLMs

Los directores definen objetivos y presupuestos; los agentes ejecutan; las herramientas (incluidos LLMs) amplifican capacidades.

7

Proveedores Cognitivos Abstractos

Se eliminan nombres de marca del núcleo. El router ve:

AbstracciónPerfilUso típico
Proveedor AAlta capacidad razonamientoAnálisis complejo, auditoría
Proveedor BEquilibrio costo/latenciaOperación diaria, RAG
Proveedor CUltra económicoClasificación, extracción simple
LocalPrivacidad totalDatos sensibles, on-prem
Enrutamiento por políticas

El router evalúa: criticidad, privacidad, latencia máxima, presupuesto por tarea y calidad histórica. Si falla, hace failover automático.

8

Protocolos de Comunicación

JSON-RPC over WebSockets

Comunicación bidireccional tipada entre UI, kernel y agentes. Ideal para streaming de tokens y eventos.

 { "jsonrpc":"2.0", "method":"agent.run", "params":{ "id":"auditor", "task":"conciliar" }, "id": 42 }

MCP

Model Context Protocol para herramientas: descubrimiento, permisos y ejecución segura con esquemas.

Event-Driven

Bus de eventos para Signals → Events → Tasks. Desacopla productores y consumidores, habilita replay.

9

Jerarquía de Memoria

NivelTecnologíaContenidoTTL típico
1. RAM (contexto inmediato)Memoria de procesoVentana de conversación, scratchpadsegundos
2. Corto PlazoMongoDB / RedisEstado de tareas, sesiones, lockshoras–días
3. VectorialSupabase pgvectorEmbeddings, RAG, conocimientosemanas–meses
4. HistóricaMongoDB AtlasAuditoría, costos, trazas, aprendizajesaños
10

Sistema Nervioso

Signals Events Tasks Memory Actions

Cada señal (webhook, email, cambio de dato) se normaliza a evento, se convierte en tarea DAG, consulta/escribe memoria y ejecuta acciones con herramientas.

11

Ciclo de Vida del Agente

Crear Inicializar Cargar memoria Trabajar Guardar memoria Dormir Reactivarse Actualizar Eliminar
12

MAXIQUEEN CONTROL CENTER

Agentes activos
24
12 en ejecución
Costo / minuto
$0.18
Meta: < $0.20
Latencia p95
720 ms
SLA 800ms
Errores 1h
3
reintentos ok
Clientes conectados
187
WS activos
Tokens / min
42.3k
A:58% B:32% C:7% L:3%

Facturación

Wallet por workspace con prepago y alertas. Desglose por agente, proveedor y tarea.

Estado de Plataforma

Vercel ● operativo · Supabase ● operativo · Ollama ● degradado · Groq ● operativo

13

Arquitectura Multi-Tenant

Aislamiento por workspace_id con RLS en Postgres y particionamiento lógico en Mongo. Cada workspace tiene wallet, políticas y claves propias.

  • RLS: toda consulta filtra por workspace_id del JWT.
  • Cuotas: tokens/min, concurrencia y almacenamiento por plan.
  • Auditoría: traza inmutable por workspace.
14

Sistema de Blueprints y Clonación

Un blueprint es un JSON versionado que define rol, capacidades, memoria y políticas.

{
  "id": "auditor_financiero",
  "version": "2.0.3",
  "parent": "director_financiero",
  "rol": "Auditor Financiero",
  "capacidades": ["conciliacion", "deteccion_anomalias", "reportes_sat", "n8n_trigger"],
  "memoria": {
    "corto_plazo": { "ttl": "7d" },
    "vectorial": { "coleccion": "finanzas", "top_k": 8 },
    "historica": { "retencion": "7y" }
  },
  "proveedores": { "preferidos": ["A","B"], "fallback": ["C","Local"] },
  "politicas": { "privacidad": "alta", "costo_max_tarea_usd": 0.05, "latencia_p95_ms": 800 },
  "herramientas": ["postgres", "sheets", "email", "storage"],
  "kpis": { "precision_min": 0.97, "falsos_positivos_max": 0.02 }
}
15

Economía de Inferencia

Árbol de decisión

  • ¿Privacidad alta o datos sensibles? → Local
  • ¿Complejidad < 0.3 y costo crítico? → Proveedor C
  • ¿Necesita razonamiento profundo? → Proveedor A
  • Resto → Proveedor B con fallback

Algoritmo (JS)

function routeInference({tarea, complejidad, criticidad, presupuesto, privacidad}) {
  if (privacidad === 'alta') return 'Local';
  if (complejidad < 0.3 && presupuesto === 'bajo') return 'Proveedor C';
  if (criticidad >= 0.8 || complejidad >= 0.7) return 'Proveedor A';
  return 'Proveedor B'; // con fallback automático
}
// Uso:
const prov = routeInference({tarea:'conciliar', complejidad:0.65, criticidad:0.9, presupuesto:'medio', privacidad:'media'});
16

Separación Conceptual vs Implementación

Componente ConceptualImplementación Actual v2.0Notas
Gateway / EdgeCloudflare + VercelTLS, WAF, rate limit
Kernel / SchedulerVercel Functions + QueueDAG con reintentos
Memoria RAMProceso Nodecontext window
Memoria Corto PlazoMongoDB / Redissesiones y locks
Memoria VectorialSupabase pgvectorRAG multi-tenant
Memoria HistóricaMongoDB Atlasauditoría y costos
ProveedoresA/B/C/Localenrutado por políticas
ObservabilidadLogs centralizados + métricasControl Center
17

Organigrama

CEOMaxiqueen
Director IAModelos & RAG
Director ComercialVentas & CS
Director FinancieroFinanzas
Director TécnicoDevOps
Agentes EspecializadosAuditor, Closer, Soporte...
HerramientasMCP Tools
LLMsProveedor A/B/C/Local
18

Renombramiento

v1.0v2.0Razón
BotAgenteRol con memoria y KPI
ModeloProveedor CognitivoAbstracción multimarca
Base de conocimientoMemoria VectorialParte de jerarquía
FlujoDAG de TareasOrquestación explícita
19

Flujos

Onboarding Cliente

Signal (registro) → Event → Crear Workspace → Clonar Blueprints → Hidratar memoria → Activar agentes.

Conciliación Financiera

Job diario → Extraer movimientos → RAG políticas → Detectar anomalías → Reporte → Acción.

20

Escalabilidad

  • Horizontal: workers sin estado, colas particionadas por workspace.
  • Elástica: auto-scaling por backlog y latencia p95.
  • Económica: cache semántico y batching reduce tokens ~30%.
21

Catálogo

Auditor Financiero

Conciliación, SAT, anomalías. SLA 800ms.

Closer Comercial

Califica, propone, agenda, hace follow-up.

Soporte Técnico

RAG sobre docs, crea tickets, cierra L1/L2.

22

Monetización

PlanIncluyeDesde
Starter3 agentes, 1 workspace, 500k tokens$99/mes
Growth12 agentes, 3 workspaces, RLS, 5M tokens$499/mes
EnterpriseIlimitado, on-prem/Local, SSO, auditoríaCustom
23

Roadmap

Q3 2025 (v2.0) — Kernel DAG, Economía de Inferencia, Control Center.
Q4 2025 (v2.1) — Memoria vectorial multi-región, replay de eventos.
Q1 2026 (v2.5) — Blueprints marketplace, agentes auto-optimizables.
Q3 2026 (v3.0) — OS distribuido edge, inferencia local por defecto.
24

Manual Vivo

Este documento es la fuente de verdad operativa. Cada cambio de arquitectura actualiza el Control Center y versiona blueprints. Última actualización: Julio 2026.

Cómo proponer cambios

Abrir PR al repo del manual con diff de sección, impacto en costos/latencia y plan de rollback. Requiere aprobación de Director IA y Director Técnico.