Bluey Synapse/Plataforma/Multi-LLM
Capa 03 · Cerebros

El modelo correcto para cada tarea. Tú tienes el control.

Synapse no apuesta por un único proveedor de IA. Defines el modelo de cada agente una sola vez y todos los bloques y flujos heredan esa elección: precisión donde importa, ahorro donde no compromete. La recomendación automática de modelos está en el roadmap.

Por qué esto importa en el costo
−80% de costo promedio comparado con operar todo en un único modelo de punta.
Tarea ligera en el modelo ligero: respuesta en menos tiempo, por una fracción del precio.
Tarea crítica en el modelo profundo: acierto en el primer intento, sin retrabajo.
¿Sale un modelo mejor el mes que viene? Cambias la pieza, no la aplicación.
El enrutador en acción

Elige una tarea y mira quién la asume

La decisión ocurre antes de la llamada, a partir de lo que el bloque declara: naturaleza de la tarea, criticidad, formato de entrada y tamaño del contexto.

Multi-LLM por dentro

Una aplicación. Varios modelos trabajando juntos.

El enrutamiento no es por aplicación: es por bloque. Una misma aplicación puede activar cuatro modelos distintos en una sola ejecución.

Ejemplo · conciliación de facturas 4 BLOQUES · 4 MODELOS
Cada bloque guarda su propia elección de modelo, su propio límite de costo y su propio log. Cambiar uno no toca a los demás.
Especificación

Lo que el enrutador hace además de elegir

La parte que decide el modelo es la más visible. El resto es lo que hace que esto funcione en producción.

Fallback automático

Si el proveedor se cae, se pone lento o devuelve un error, la llamada pasa al siguiente modelo compatible. La aplicación no se detiene porque un proveedor tuvo un incidente.

Techo de costo por squad

Cada squad tiene presupuesto mensual. Al acercarse al límite, el enrutador baja a modelos más baratos en las tareas ligeras y avisa al responsable — en lugar de reventar la factura en silencio.

Caché de contexto

Fragmentos de política, catálogo y prompt de sistema que se repiten en cada llamada no se pagan de nuevo en cada ejecución.

Log por llamada

Modelo usado, tokens de entrada y salida, latencia, costo y el bloque que originó la llamada. Es lo que permite auditar una decisión meses después.

Cambio sin reescribir

El bloque declara la tarea, no el proveedor. Cuando un modelo nuevo entra a la plataforma, pasa a ser candidato en las tareas compatibles — sin tocar las aplicaciones que ya están en marcha.

Datos que no se fugan

Ninguna llamada autoriza entrenar con tus datos. Para contenido sensible, el enrutador puede restringirse a modelos abiertos alojados en tu entorno.

Señal que el bloque declara
Ligero
Profundo
Multimodal
Naturaleza de la tarea
Clasificar, resumir, responder FAQ
Analizar, conciliar, calcular, redactar
Leer imagen, audio, documento escaneado
Costo del error
Bajo, revisable
Alto, financiero o jurídico
Medio, con verificación humana
Contexto necesario
Corto
Largo, decenas de páginas
Archivo más texto
Qué prioriza el enrutador
Latencia y precio
Profundidad y consistencia
Calidad de lectura
Continúa por la pila

El enrutador elige el cerebro. La base decide lo que sabe.

Tu Base (RAG) → Gobernanza HitL →

¿Quieres ver el enrutamiento con tus tareas?

Trae tres tareas reales de tu operación. En la demo técnica mostramos qué modelo activaría cada una, el costo estimado por ejecución y cómo queda el log de auditoría.

Agendar demo técnica Volver a la plataforma