Há uns três anos, esta pergunta aparecia uma vez por ano e vinha sempre com um sorriso, meio a brincar. Hoje aparece em quase todas as reuniões de orçamento: "e não dá para usar IA em vez de intérpretes?"
É uma pergunta legítima e merece uma resposta melhor do que um "não" defensivo. Também merece uma resposta melhor do que o entusiasmo de quem vende software. A resposta verdadeira é que depende, e o que decide não são as línguas nem o número de participantes. É o custo de um erro.
Temos um parceiro que compara inteligentemente a IA com uma criança de 7 anos: percebe-se o que diz, ela percebe-nos, mas não vamos falar com ela de finanças públicas, pois não?!
Primeiro, o que é de facto a interpretação automática
Quando alguém diz "interpretação com IA", está normalmente a falar de três sistemas encadeados:
- Reconhecimento de voz, que transforma o que o orador diz em texto.
- Tradução automática, que passa esse texto para a outra língua.
- Síntese de voz ou legendagem, que devolve o resultado ao participante, por auriculares ou no ecrã.
Cada passo tem a sua própria margem de erro e, o que é pior, os erros acumulam-se. Se o reconhecimento de voz acerta em 95% das palavras, a tradução vai trabalhar sobre uma frase que já está errada, e vai traduzi-la muito bem.
É aqui que está a diferença mais importante em relação a um intérprete. Um intérprete que não entende uma palavra hesita, generaliza, pede confirmação ou contorna a frase. O sistema automático não hesita nunca. Produz sempre uma frase completa, gramatical e segura de si, mesmo quando está a inventar. Numa sala, uma hesitação é um aviso. Uma frase perfeita e errada não é.
A latência é o detalhe que as demonstrações nunca mostram
Um intérprete humano trabalha com um atraso na ordem dos dois a quatro segundos e ajusta esse atraso ao discurso. Quando percebe que o orador está a construir uma frase longa, espera. Quando percebe que vem um número, antecipa.
Um sistema automático tem de esperar por palavras suficientes para traduzir com sentido, sobretudo entre línguas com ordens de frase diferentes. O resultado costuma ficar nos três a oito segundos, às vezes mais. Numa apresentação corrida, ninguém morre com isso. Numa sessão de perguntas, numa mesa redonda ou num momento em que alguém faz uma piada, o atraso é visível para toda a sala e o público ri-se a 2 tempos.
O som da sala é o teto de qualidade, e não há modelo que o levante
Este é o ponto que quase nunca entra na conversa. A qualidade da interpretação automática depende inteiramente da qualidade do áudio que lhe é entregue.
Com um microfone headset e um orador que fala pausadamente, num sistema de som bem montado, o resultado pode ser surpreendentemente bom. Com um microfone de mão que anda de pessoa em pessoa, quatro oradores num painel a interromper-se, ar condicionado audível e alguma reverberação na sala, o resultado desfaz-se. E não é uma degradação suave: passa de aceitável a inutilizável em poucos segundos.
Os intérpretes humanos sofrem com o mesmo problema, é verdade. A diferença é que compensam com contexto. Sabem o tema, leram os documentos, conhecem o nome do produto que foi mal captado e percebem, pela lógica da frase, o que falta. A máquina não tem essa rede.
Se há uma coisa a retirar deste artigo é esta: antes de investir em software de interpretação, invista em captação de som. É onde o dinheiro rende mais, e serve as duas soluções.
Onde a IA já compensa hoje
Não somos ideológicos sobre isto. Há contextos em que a interpretação automática já é a escolha racional, e recomendamo-la.
Reuniões internas e recorrentes
Comités semanais, reuniões de equipas distribuídas, pontos de situação. As pessoas conhecem-se, o vocabulário repete-se e, se algo não ficou claro, alguém pergunta outra vez. O custo de um erro é de trinta segundos.
Sessões unidirecionais e formação gravada
Webinars, módulos de formação, comunicações internas em vídeo. Há tempo, há guião e ninguém está a negociar nada. Com uma revisão humana das legendas antes de publicar, o resultado é bom.
Legendas ao vivo como apoio
Isto é, provavelmente, a utilização mais subestimada. Legendas na língua original ajudam participantes com sotaques diferentes do orador, participantes que leem melhor do que ouvem e salas com acústica difícil. Convém dizer que não substituem uma solução de acessibilidade formal, como um intérprete de Língua Gestual Portuguesa, mas melhoram a compreensão de muita gente sem custo logístico.
Depois do evento
Transcrições, legendagem dos vídeos em várias línguas, resumos por sessão, versões multilingues do conteúdo para o site. Aqui a IA poupa dias de trabalho e o risco é baixo, porque há tempo para alguém ler antes de publicar.
Línguas que ninguém tinha orçamentado
Faltam duas semanas, aparecem cinco convidados de um país que não estava previsto e não há cabine nem intérprete disponível para essa combinação. Uma legenda automática imperfeita é melhor do que nada, e é honesto apresentá-la como aquilo que é.
Preparação dos próprios intérpretes
Vale a pena dizer, porque se fala pouco: os intérpretes profissionais usam IA na preparação. Extração de terminologia de documentos, construção de glossários, leitura rápida de relatórios de cem páginas na véspera. A tecnologia entrou primeiro pela porta da preparação, não pela porta da cabine.
Onde ainda não vale o risco
E depois há os contextos em que não compensa, independentemente do preço.
- Negociação. Valores, prazos, condições, responsabilidades. Um número trocado ou um "não" que vira "talvez" é um problema comercial, não um problema linguístico.
- Contextos jurídicos, médicos e de auditoria. Aqui existe registo formal do que foi dito e consequências para quem o disse.
- Comunicação institucional e imprensa. A frase citada amanhã no jornal é a frase que saiu na tradução. Não há revisão possível depois.
- Painéis com vozes sobrepostas. É o pior cenário técnico possível e também o formato mais popular dos últimos anos.
- Humor, ironia, expressões idiomáticas e sotaques marcados. A IA traduz o que a frase diz, não o que a frase quer dizer.
- Eventos onde a imagem da empresa está em jogo à frente de convidados internacionais. Uma tradução estranha nos auriculares diz algo sobre quem organizou.
Reparou no padrão? Não é a dificuldade da língua que decide. É o preço a pagar pelo erro.
E a confidencialidade?
Esta parte costuma ser esquecida até ao momento em que o departamento jurídico faz a pergunta, normalmente tarde.
Num sistema automático, o áudio da sala sai da sala. Vai para servidores que processam, e frequentemente guardam, aquilo que foi dito. Vale a pena perguntar ao fornecedor, por escrito, quatro coisas: onde é processado o áudio, quanto tempo fica retido, se é usado para treinar modelos e se existe contrato de subcontratação nos termos do RGPD.
Com intérpretes, a confidencialidade é uma obrigação profissional e contratual de uma pessoa identificável, reforçada por acordo de confidencialidade quando o cliente quer. Não é por acaso que os eventos de alta confidencialidade continuam a usar distribuição por infravermelhos: o sinal não atravessa paredes. É difícil oferecer a mesma garantia quando o áudio atravessou três países.
O modelo que faz sentido hoje é híbrido
Na prática, os clientes que estão a lidar bem com isto não escolheram um lado. Combinaram.
- Intérpretes em cabine para a plenária e para os momentos que contam, IA nas sessões paralelas de menor risco.
- Interpretação humana nas duas ou três línguas principais, legendas automáticas nas restantes, apresentadas como apoio e não como serviço equivalente.
- Interpretação humana no dia, IA para legendar depois os vídeos em oito línguas por uma fração do custo.
- IA para as reuniões internas ao longo do ano, intérpretes para os dois eventos externos.
Vale a pena notar que a distribuição também já não é o obstáculo que era. Com tradução remota por QR Code, cada participante ouve no próprio telemóvel, o que significa que acrescentar uma língua deixou de implicar alugar mais trezentos recetores. Isso muda a matemática, e muda a favor de haver mais línguas disponíveis, não de haver menos intérpretes.
Se quiser testar, teste a sério
A maior parte das deceções com interpretação automática vem de testes feitos em condições que não têm nada a ver com o evento. Se vai avaliar uma solução, avalie assim:
- Teste com o áudio real da sala, saído da mesa de som, e não com um portátil num escritório silencioso.
- Teste com os sotaques dos oradores reais. Um orador indiano a falar inglês técnico e um orador português a falar inglês não são o mesmo desafio.
- Envie antes o glossário, os nomes próprios, as siglas internas e os nomes dos produtos. Faz mais diferença do que se imagina.
- Defina o que acontece quando falha. Quem percebe, em quanto tempo, e o que se faz a seguir.
- Diga aos participantes o que estão a ouvir. Quem sabe que está a ouvir uma máquina lê os erros de outra maneira. Quem pensa que está a ouvir um intérprete conclui que o intérprete é mau.
- Não estreie a solução no evento mais importante do ano. Estreie no comité de quinta-feira.
A regra de decisão, numa frase
Pergunte quanto custa um erro. Se um erro custa uma pergunta repetida, a IA serve e provavelmente é a escolha mais sensata. Se um erro custa um contrato, uma notícia, um registo legal ou a confiança de um convidado, ponha uma pessoa na cabine.
O que temos visto nos últimos dois anos não é a IA a substituir a cabine. É a IA a alargar o acesso: mais línguas disponíveis, mais conteúdo legendado, mais gente a conseguir acompanhar. A cabine continua onde sempre esteve, nos momentos em que a comunicação não pode falhar.
Na Turnip, trabalhamos com as duas soluções e não temos qualquer interesse em vender a mais cara quando a mais barata resolve. Se está a preparar um evento e não sabe qual das duas faz sentido, diga-nos as línguas, o formato das sessões e o que está em jogo. Ajudamos a decidir, mesmo quando a resposta é a que nos dá menos trabalho.