Frontend → AI Gateway → Model Router
O app pede uma tarefa, nunca um modelo. Trocar de fornecedor é editar a tabela de roteamento — nenhuma tela muda.
O que a camada garante
Controle de custos
Teto de tokens e cadência por tarefa; tarefa barata não cai em modelo caro.
Logging
Cada chamada registra tarefa, modelo, tentativas, latência e resultado.
Rate limits
Limite por minuto definido por tarefa, não por tela.
Fallback
Cadeia de modelos; 429 e 5xx tentam o próximo, 400/402/403 param na hora.
Versionamento de prompts
Cada tarefa carrega a versão do prompt que gerou o resultado.
Políticas de segurança
Contexto mínimo, dado sensível protegido e confirmação obrigatória.
Model Router
Modelo rápido
Interpretação de comandos, classificação e resumos curtos
Interpretar comando de voz/texto
google/gemini-3.1-flash-litefallback: google/gemini-3.7-flash30/minaté 800 tokens- • Só interpreta — nunca executa
- • Sem dado clínico inventado
- • Contexto mínimo necessário
Resumir o briefing das 07:00
google/gemini-3.7-flashfallback: google/gemini-3.6-flash6/minaté 600 tokens- • Só dados já autorizados
- • Sem nomes completos em canal externo
Escrever mensagem para paciente
google/gemini-3.7-flashfallback: google/gemini-3.1-flash-lite20/minaté 500 tokens- • Gera e revisa — nunca envia
- • Sem resultado de exame no texto
Modelo reasoning
Relatórios, análises e decisões que exigem raciocínio
Gerar documento médico
google/gemini-3.1-pro-previewfallback: google/gemini-3.7-flash10/minaté 2000 tokens- • Revisão obrigatória antes de emitir
- • Linguagem clínica ética
- • Sem diagnóstico não informado
Modelo visão
Foto da agenda cirúrgica, documentos e imagens
Ler a foto da agenda cirúrgica
google/gemini-3.7-flashfallback: google/gemini-3.6-flash6/minaté 1500 tokens- • OCR não grava no banco
- • Confirmação obrigatória
- • Imagem não é retida
Modelo de voz (fala → texto)
Transcrição do áudio capturado no app
Transcrever áudio
openai/gpt-4o-mini-transcribefallback: openai/gpt-4o-transcribe20/min- • Áudio processado e descartado
- • Transcrição editável antes de confirmar
Modelo de voz (texto → fala)
Leitura das respostas e do briefing
Falar a resposta
openai/gpt-4o-mini-tts20/min- • Não lê dado sensível em ambiente compartilhado sem pedido explícito
Testar o roteamento
O log fica no servidor a cada chamada (tarefa, modelo, tentativas, latência). Só 429 e 5xx acionam o próximo modelo da cadeia; 400, 402 e 403 param na hora e a mensagem chega até você.