O Polly transforma texto em voz (fala) com vozes bem naturais. Dá pra usar SSML pra controlar entonação, pausas e ênfase — a fala não soa robótica.
Dar voz a aplicações: leitores de tela pra acessibilidade, URA de telefonia ("digite 1 para..."), narração de artigos, assistentes que falam. Tudo por API, sem estúdio.
Cada um deles roda de verdade no terminal do CLImb, com a mesma saída e as mesmas mensagens de erro que a AWS devolve.
aws polly synthesize-speechUSO
aws polly synthesize-speech --text "Bem-vindo" --output-format mp3 --voice-id Camila fala.mp3
aws polly describe-voicesUSO
aws polly describe-voices --language-code pt-BR
aws polly put-lexiconUSO
aws polly put-lexicon --name marcas --content file://lexico.xml
aws polly list-lexiconsUSO
aws polly list-lexicons
aws polly get-lexiconUSO
aws polly get-lexicon --name marcas
aws polly start-speech-synthesis-taskUSO
aws polly start-speech-synthesis-task --text "..." --output-format mp3 \ --voice-id Camila --output-s3-bucket-name meu-bucket
aws polly list-speech-synthesis-tasksUSO
aws polly list-speech-synthesis-tasks
aws polly get-speech-synthesis-taskUSO
aws polly get-speech-synthesis-task --task-id <id>
aws polly delete-lexiconUSO
aws polly delete-lexicon --name marcas
Cada atividade é um pedido de trabalho, do jeito que ele chega no dia a dia — você resolve digitando os comandos, não escolhendo alternativa.
O Polly transforma texto em áudio com vozes naturais. Sintetize uma fala em MP3 com a voz Camila (pt-BR), salvando em fala.mp3.
Liste as vozes disponíveis em pt-BR.
A narração do treinamento está lendo AWS como se fosse uma palavra ("aus"), e o time de marketing reclamou. A correção é um léxico: um dicionário de pronúncia. Crie o léxico marcas-climb ensinando a leitura certa.
Antes de sintetizar, confira o que a conta tem. Liste os léxicos desta região. <small>(léxico é por região: o que existe em São Paulo não existe na Virgínia)</small>
A pronúncia continua saindo estranha e alguém suspeita do léxico. Antes de acusar a voz, veja o conteúdo do marcas-climb — é ele que diz o que o Polly vai ler.
Agora junte as peças: gere o áudio abertura.mp3 com a voz Camila aplicando o léxico marcas-climb. <small>(o léxico só vale se você pedir por ele na síntese — criar não basta)</small>
O time quer o artigo inteiro em áudio, e ele não cabe no synthesize-speech (que tem teto de caracteres). Use a síntese assíncrona: ela processa em segundo plano e entrega o áudio no bucket narracao-climb.<br><small>⚠️ Simplificado aqui: na AWS real a tarefa leva tempo e passa por scheduled → inProgress → completed; você consulta até terminar. Neste simulador ela fica pronta na hora, pra você não precisar esperar.</small>
Você perdeu o TaskId que o comando anterior devolveu — acontece. Liste as tarefas de síntese pra achar o id e ver o estado de cada uma.
Com o id em mãos, consulte a tarefa pra ver o status e pegar o OutputUri — o endereço do arquivo no S3. <small>(use o id da tarefa que você criou)</small>
A marca mudou de nome e o léxico marcas-climb ficou obsoleto. Apague ele. <small>(o áudio já gerado NÃO muda — apagar o léxico só afeta as próximas sínteses)</small>
Ler explica. Digitar fixa. No CLImb você roda os comandos de verdade num terminal AWS simulado — o estado persiste entre eles, como na nuvem real.
As 3 primeiras atividades desta trilha são abertas; o resto faz parte do plano Pro.
Começar — 3 atividades grátis