Leitor de Texto e Digitação por Voz

Ouça qualquer texto lido em voz alta com voz, velocidade e tom ajustáveis, ou dite para converter a sua fala diretamente em texto — tudo com a API Web Speech já integrada no seu navegador.

219 visualizações

Texto para Fala

Totalmente local: seu texto e o áudio resultante nunca saem deste dispositivo.


Digitação por Voz (Fala para Texto)

Pressione "Começar a Ouvir" e fale — suas palavras aparecerão aqui…

Atenção: diferente da maioria das ferramentas deste site, este recurso geralmente envia o áudio do seu microfone para um serviço de reconhecimento de voz na nuvem (geralmente o do Google no Chrome) para convertê-lo em texto.

Duas APIs de Voz Muito Diferentes numa Só Ferramenta

Esta ferramenta é construída sobre a Web Speech API, mas esse único nome cobre na verdade duas sub-APIs que se comportam de forma completamente diferente. SpeechSynthesis — a metade "leitora" — transforma o texto escrito em áudio usando o motor de voz já instalado no seu sistema operativo ou navegador. Corre inteiramente no seu dispositivo: nenhum texto é carregado, nenhum áudio é gerado remotamente e nada do que escreve sai alguma vez da sua máquina. SpeechRecognition — a metade da "digitação por voz" — faz o trabalho inverso, transformando a sua voz falada em texto, e funciona de forma muito diferente por baixo do capô, como se explica adiante.

A lista de vozes do leitor é preenchida ao chamar speechSynthesis.getVoices(), mas essa lista carrega frequentemente de forma assíncrona — no primeiro carregamento da página pode voltar vazia mesmo havendo vozes disponíveis, porque o navegador ainda está a enumerar as vozes instaladas no sistema operativo em segundo plano. Esta ferramenta escuta o evento onvoiceschanged e atualiza a lista suspensa assim que a lista real estiver pronta, que é a correção padrão para uma peculiaridade bem conhecida da Web Speech API que engana muitas implementações ingénuas.

Uma Nota sobre Privacidade que Vale a Pena Ler Antes de Ditar

A maioria das ferramentas deste site processa tudo localmente e nunca contacta um servidor — isso também é verdade para a metade de texto para fala aqui. A fala para texto é a exceção, e é importante ser transparente sobre isso: no Chrome e na maioria dos navegadores baseados em Chromium, o SpeechRecognition normalmente envia o seu áudio gravado para um serviço de reconhecimento de fala na nuvem (geralmente da Google) para ser transcrito, devolvendo depois o texto à página. A sua voz sai do seu dispositivo. Se isso importar para o que está a ditar, trate o microfone da mesma forma que trataria qualquer outro serviço de ditado na nuvem.

O suporte dos navegadores para o ditado também está fragmentado de uma forma que vale a pena conhecer. O Chrome e o Edge ainda exigem o construtor com prefixo de fornecedor webkitSpeechRecognition em vez de um construtor simples e padronizado. O Firefox tem apenas suporte parcial escondido atrás de uma flag experimental que vem desativada por padrão, e o suporte do Safari é limitado e inconsistente entre versões — é por isso que, se o seu navegador não expõe a API de todo, esta ferramenta esconde a secção de ditado em vez de mostrar um formulário que falharia silenciosamente.

  • Texto para fala (leitura): totalmente local, sem pedidos à rede, funciona praticamente em todos os navegadores modernos
  • Fala para texto (ditado): requer permissão de microfone, geralmente processado na nuvem, fiável sobretudo no Chrome/Edge
  • As vozes disponíveis dependem inteiramente do seu sistema operativo — Windows, macOS e Android usam cada um um motor de voz e uma lista de vozes diferentes

Perguntas Frequentes

O leitor de texto para fala envia o meu texto para um servidor?

Não. O SpeechSynthesis corre inteiramente dentro do seu navegador, usando o motor de voz já instalado no seu sistema operativo. Nada do que escreve é carregado para lado nenhum — nem o texto, nem o áudio resultante. Poderia até desligar-se da internet depois de a página carregar e o leitor continuaria a funcionar normalmente, já que não obtém nada remotamente para gerar a fala.

A funcionalidade de digitação por voz (fala para texto) envia a minha voz para um servidor?

Na maioria dos navegadores, sim — e vale a pena saber isto antes de a usar. A implementação do SpeechRecognition no Chrome normalmente transmite o áudio do seu microfone para um serviço de transcrição na nuvem (geralmente da Google) para o converter em texto, devolvendo depois o resultado à página. Isto é fundamentalmente diferente da metade leitora desta ferramenta, que nunca sai do seu dispositivo. Se estiver a ditar algo sensível, tenha isso em mente da mesma forma que teria com qualquer assistente de voz baseado na nuvem.

Por que a lista de vozes aparece vazia quando abro esta ferramenta pela primeira vez?

Esta é uma peculiaridade conhecida da Web Speech API, não um erro desta ferramenta. Os navegadores carregam a lista de vozes instaladas de forma assíncrona, pelo que chamar getVoices() imediatamente ao carregar a página pode devolver um array vazio mesmo havendo vozes disponíveis. Esta ferramenta escuta o evento onvoiceschanged e volta a preencher a lista suspensa automaticamente assim que a lista real estiver pronta, que é a solução padrão para este comportamento.

Por que não vejo a secção de digitação por voz no Firefox ou no Safari?

O suporte dos navegadores para o SpeechRecognition é desigual. O Chrome e o Edge suportam-no de forma fiável, ainda através do construtor com prefixo webkitSpeechRecognition. O Firefox oferece apenas suporte parcial atrás de uma flag experimental desativada por padrão, e o suporte do Safari é limitado e pouco fiável entre versões. Em vez de mostrar um formulário de ditado que falharia silenciosamente, esta ferramenta deteta se a API existe e esconde essa secção com uma mensagem honesta se não existir — experimente o Chrome ou o Edge para a experiência completa de digitação por voz.

Por que as vozes que posso escolher parecem diferentes noutro computador?

O leitor não traz as suas próprias vozes — usa o motor de voz que o seu sistema operativo e navegador fornecem, e isso varia bastante. Windows, macOS e Android incluem cada um motores de texto para fala diferentes, com nomes, idiomas e sotaques diferentes, pelo que a mesma página web pode oferecer uma lista de vozes completamente diferente em duas máquinas distintas. Não há forma de padronizar isto a partir de uma página web; depende inteiramente do que está instalado localmente.

Comentários

Ainda não há comentários — seja o primeiro a escrever um!

Ferramentas Semelhantes