A voz nunca grava nada sozinha: ela transcreve, interpreta e devolve a resposta em áudio. O registro só acontece depois da sua confirmação na tela de captura.
Pipeline de voz
Microfone
Permissão do navegador e nível de entrada.
dispositivo
Captura de áudio
PCM pelo Web Audio, empacotado em WAV 16 kHz mono.
dispositivo
Speech-to-text
O áudio vai ao servidor e volta como texto.
servidor
Transcrição
Texto revisável antes de virar ação.
dispositivo
Assistant Orchestrator
Intenção, contexto, ferramentas e políticas.
servidor
Resposta
Recibo em português, sem inventar dado.
servidor
Text-to-speech
A resposta vira áudio no servidor.
servidor
Áudio
A assistente fala de volta.
dispositivo
Transcrição
A transcrição e a fala rodam no servidor com a identidade da sua conta; o áudio não é armazenado.