YOUbot

AI Gateway

Uma camada entre o app e qualquer modelo de IA

Frontend → AI Gateway → Model Router

O app pede uma tarefa, nunca um modelo. Trocar de fornecedor é editar a tabela de roteamento — nenhuma tela muda.

O que a camada garante

Controle de custos

Teto de tokens e cadência por tarefa; tarefa barata não cai em modelo caro.

Logging

Cada chamada registra tarefa, modelo, tentativas, latência e resultado.

Rate limits

Limite por minuto definido por tarefa, não por tela.

Fallback

Cadeia de modelos; 429 e 5xx tentam o próximo, 400/402/403 param na hora.

Versionamento de prompts

Cada tarefa carrega a versão do prompt que gerou o resultado.

Políticas de segurança

Contexto mínimo, dado sensível protegido e confirmação obrigatória.

Model Router

Modelo rápido

Interpretação de comandos, classificação e resumos curtos

Interpretar comando de voz/texto

interpret@3
google/gemini-3.1-flash-litefallback: google/gemini-3.7-flash30/minaté 800 tokens
  • Só interpreta — nunca executa
  • Sem dado clínico inventado
  • Contexto mínimo necessário

Resumir o briefing das 07:00

briefing@1
google/gemini-3.7-flashfallback: google/gemini-3.6-flash6/minaté 600 tokens
  • Só dados já autorizados
  • Sem nomes completos em canal externo

Escrever mensagem para paciente

mensagem@2
google/gemini-3.7-flashfallback: google/gemini-3.1-flash-lite20/minaté 500 tokens
  • Gera e revisa — nunca envia
  • Sem resultado de exame no texto

Modelo reasoning

Relatórios, análises e decisões que exigem raciocínio

Gerar documento médico

documento@2
google/gemini-3.1-pro-previewfallback: google/gemini-3.7-flash10/minaté 2000 tokens
  • Revisão obrigatória antes de emitir
  • Linguagem clínica ética
  • Sem diagnóstico não informado

Modelo visão

Foto da agenda cirúrgica, documentos e imagens

Ler a foto da agenda cirúrgica

ocr-agenda@2
google/gemini-3.7-flashfallback: google/gemini-3.6-flash6/minaté 1500 tokens
  • OCR não grava no banco
  • Confirmação obrigatória
  • Imagem não é retida

Modelo de voz (fala → texto)

Transcrição do áudio capturado no app

Transcrever áudio

stt@1
openai/gpt-4o-mini-transcribefallback: openai/gpt-4o-transcribe20/min
  • Áudio processado e descartado
  • Transcrição editável antes de confirmar

Modelo de voz (texto → fala)

Leitura das respostas e do briefing

Falar a resposta

tts@1
openai/gpt-4o-mini-tts20/min
  • Não lê dado sensível em ambiente compartilhado sem pedido explícito

Testar o roteamento

O log fica no servidor a cada chamada (tarefa, modelo, tentativas, latência). Só 429 e 5xx acionam o próximo modelo da cadeia; 400, 402 e 403 param na hora e a mensagem chega até você.