Visão Geral
O componente Converter Fala para Texto do Construtor de Bot permite transcrever áudios enviados pelo usuário, expandindo as interações do chatbot para além do texto.
Para utilizar os modelos da OpenAI ou da ElevenLabs, é necessário cadastrar o valor do token correspondente no Neppo Vault, utilizando os caminhos openai/token ou elevenLabs/token. Veja mais em Neppo Vault
Usabilidade
O componente Converter Fala para Texto transcreve um áudio enviado pelo usuário para texto. Para usá-lo, é necessário fornecer:
Modelo: qual modelo de transcrição utilizar (ex: Scribe V1, GPT-4o Mini Transcribe, GPT-4o Transcribe, Whisper-1)
Linguagem: linguagem falada no áudio (ex: Português, Inglês)
Url do áudio: URL acessível do arquivo de áudio para transcrição
Variável de armazenamento: variável onde será armazenado o texto transcrito
Formatos de áudio da plataforma
Origem do áudio |
Formato padrão |
|---|---|
Áudios enviados em chats de texto |
oga e ogg |
Chamadas de voz |
wav |
Modelos disponíveis
Modelo |
Provedor |
Formato de Entrada |
Particularidades |
Link da Documentação |
|---|---|---|---|---|
Whisper-1 |
OpenAI |
mp3, mp4, mpeg, oga, ogg, mpga, m4a, wav, e webm |
Suporte a áudios de no máximo 25 MB. |
|
GPT-4o-mini-transcribe |
OpenAI |
mp3, mp4, mpeg, mpga, m4a, wav, e webm |
Suporte a áudios de no máximo 25 MB. |
|
GPT-4o-transcribe |
OpenAI |
mp3, mp4, mpeg, mpga, m4a, wav, e webm |
Suporte a áudios de no máximo 25 MB. |
|
Scribe v1 |
Eleven Labs |
mp3, mp4, mpeg, oga, ogg, mpga, m4a, wav, e webm |
Suporte a áudios de no máximo 3GB |
Comentários
0 comentário
Escreva seu comentário aqui
Por favor, entre para comentar.