
A inteligência artificial de voz está avançando rápido, mas ainda precisa resolver problemas básicos antes de chegar ao nível de naturalidade esperado pelos usuários. Durante o HumanX Amsterdam 2026, o tema foi abordado por Shawn Wen, cofundador e CTO da PolyAI, e Alex Gay, CMO da Otter.ai.
Indo de agentes de voz, atendimento ao cliente e avatares digitais, até transcrição, reconhecimento de fala, idiomas, ruído, contexto e confiança, a conversa foi ampla. A tecnologia já funciona bem em vários cenários, mas ainda existe uma distância importante entre simplesmente reconhecer palavras e realmente entender o que uma pessoa está tentando dizer.
A busca pelo “momento ChatGPT”
Alex Gay destacou a velocidade das mudanças no setor e a necessidade de entender melhor o que a voz precisa entregar como interface. “Estou entusiasmado com o ritmo que estamos vendo no setor. A velocidade das mudanças é inacreditável, e acho que estamos apenas começando a entender o que a voz realmente precisa ser como resposta”.
Já Shawn Wen colocou a questão de maneira mais técnica. Para ele, a tecnologia avançou bastante nos últimos anos, mas ainda não chegou a um ponto equivalente ao impacto provocado pelo ChatGPT na interação com sistemas de IA. “Nós definitivamente fizemos muitas melhorias na tecnologia. E eu diria que a tecnologia de voz ainda não teve seu momento ‘ChatGPT’ por completo, mas estamos chegando lá”.
O próximo salto, segundo Wen, depende de uma combinação entre conversação em tempo real e velocidade de raciocínio. Não basta uma IA conseguir ouvir e responder. Ela precisa fazer isso sem deixar o usuário esperando enquanto processa tarefas em segundo plano. “Agora a questão é: como fazemos para tornar o raciocínio realmente rápido para que ela consiga responder em tempo real, em vez de você ter que esperar que ela abra pastas e execute várias tarefas em segundo plano?”, apontou Wen.
Voz humana não basta
Em atendimento ao cliente, a voz precisa soar suficientemente natural para que o usuário aceite continuar a conversa com um agente de IA. “O critério número um é que não pode soar robótico” Wen explicou. O problema é que naturalidade, sozinha, não resolve a experiência. Uma voz extremamente convincente pode perder toda a sua utilidade se não conseguir responder à pergunta feita pelo cliente.
Os dois elementos precisam caminhar juntos. A interação precisa transmitir confiança e permitir uma conversa que vá além de perguntas e respostas automáticas. Isso vale também para os chamados meeting avatars, capazes de representar pessoas em reuniões. Se o avatar tiver uma aparência e uma voz convincentes, mas não conseguir participar de uma discussão de verdade, a tecnologia rapidamente perde valor.
O problema está no contexto
A diferença entre transcrever uma conversa e entender o contexto é bem grande. Os modelos de reconhecimento automático de fala, ou ASR, evoluíram bastante, mas pequenos erros podem comprometer todo o processo. Uma palavra importante reconhecida de forma errada pode alterar a interpretação de uma frase e contaminar as ações realizadas posteriormente pela IA.
Wen chamou atenção para esse efeito em cadeia: “se essas palavras-chave forem importantes naquele contexto, o agente não será capaz de entender o contexto totalmente. Então, às vezes, a sensação de falta de contexto é causada por problemas no reconhecimento de fala”.
A questão fica ainda mais complexa quando a IA precisa lidar com diferentes idiomas ou com pessoas que misturam línguas na mesma conversa. É uma situação comum em ambientes corporativos e que pode desafiar modelos treinados para trabalhar com um idioma por vez.
Uma das estratégias discutidas pela Otter.ai é treinar modelos especificamente para determinados idiomas, em vez de depender apenas de uma camada de tradução sobre um modelo de linguagem. “Acho que é isso o que em última análise teremos que fazer para continuar escalando. Caso contrário, acho muito difícil que isso rode por cima de um modelo de linguagem (LLM) e te entregue o mesmo nível de precisão”, apontou Gay.
Da transcrição para a ação
A evolução da IA de voz também passa por uma mudança importante de arquitetura. A proposta é aproximar os modelos de áudio e linguagem, permitindo que o sistema saiba, por exemplo, que está em uma conversa sobre saúde e dê mais peso a determinados termos técnicos. Wen destacou que desta forma “você passa a fornecer o contexto não apenas para o modelo de linguagem, mas também para o modelo de fala”.
Isso muda o papel da voz dentro das plataformas de IA. Em vez de funcionar apenas como uma camada de entrada e saída, ela pode se tornar uma interface para acessar informações, executar tarefas e produzir resultados a partir de diferentes fontes corporativas.
Gay relacionou essa evolução a documentos, apresentações e bancos de dados. A voz, nesse desenho, passa a ser uma camada adicional para conectar diferentes informações disponíveis dentro das organizações.






Sem comentários registrados