Bluey Synapse/Plataforma/Multi-LLM
Camada 03 · Cérebros

O modelo certo para cada tarefa. Você no controle.

A Synapse não aposta em um único fornecedor de IA. Você define o modelo de cada agente uma única vez e todos os blocos e fluxos herdam essa escolha: precisão onde importa, economia onde não compromete. A recomendação automática de modelos está no roadmap.

Por que isso importa no custo
−80% de custo médio comparado a operar tudo em um único modelo de ponta.
Tarefa leve no modelo leve: resposta em menos tempo, por uma fração do preço.
Tarefa crítica no modelo profundo: acerto na primeira tentativa, sem retrabalho.
Saiu um modelo melhor no mês que vem? Você troca a peça, não a aplicação.
O roteador em ação

Escolha uma tarefa e veja quem assume

A decisão acontece antes da chamada, a partir do que o bloco declara: natureza da tarefa, criticidade, formato de entrada e tamanho do contexto.

Multi-LLM por dentro

Uma aplicação. Vários modelos trabalhando juntos.

O roteamento não é por aplicação: é por bloco. Uma mesma aplicação pode acionar quatro modelos diferentes em uma única execução.

Exemplo · conciliação de notas fiscais 4 BLOCOS · 4 MODELOS
Cada bloco guarda a própria escolha de modelo, o próprio limite de custo e o próprio log. Trocar um não mexe nos outros.
Especificação

O que o roteador faz além de escolher

A parte que decide o modelo é a mais visível. O resto é o que faz isso funcionar em produção.

Fallback automático

Se o provedor cai, fica lento ou devolve erro, a chamada passa para o próximo modelo compatível. A aplicação não para porque um fornecedor teve incidente.

Teto de custo por squad

Cada squad tem orçamento mensal. Ao aproximar do limite, o roteador desce para modelos mais baratos nas tarefas leves e avisa o responsável — em vez de estourar a fatura em silêncio.

Cache de contexto

Trechos de política, catálogo e prompt de sistema que se repetem em toda chamada não são pagos de novo a cada execução.

Log por chamada

Modelo usado, tokens de entrada e saída, latência, custo e o bloco que originou a chamada. É o que permite auditar uma decisão meses depois.

Troca sem reescrever

O bloco declara a tarefa, não o fornecedor. Quando um modelo novo entra na plataforma, ele passa a ser candidato nas tarefas compatíveis — sem tocar nas aplicações que já rodam.

Dado que não vaza

Nenhuma chamada autoriza treinamento com os seus dados. Para conteúdo sensível, o roteador pode ser restrito a modelos abertos hospedados no seu ambiente.

Sinal que o bloco declara
Leve
Profundo
Multimodal
Natureza da tarefa
Classificar, resumir, responder FAQ
Analisar, conciliar, calcular, redigir
Ler imagem, áudio, documento escaneado
Custo do erro
Baixo, revisável
Alto, financeiro ou jurídico
Médio, com conferência humana
Contexto necessário
Curto
Longo, dezenas de páginas
Arquivo mais texto
O que o roteador prioriza
Latência e preço
Profundidade e consistência
Qualidade de leitura
Continue pela pilha

Você escolhe o cérebro. A base decide o que ele sabe.

Sua Base (RAG) → Governança HitL →

Quer ver o roteamento com as suas tarefas?

Traga três tarefas reais da sua operação. Na demo técnica mostramos qual modelo cada uma acionaria, o custo estimado por execução e como fica o log de auditoria.

Agendar demo técnica Voltar para a plataforma