Como se testa uma IA de atendimento antes de soltar ela pra falar com cliente de verdade?
Testa com um QA de roleplay vivo: alguém (ou um modelo instruído pra isso) assume o papel de tipos reais de cliente e conversa de verdade, por WhatsApp, com o agente de IA de verdade — não com uma demonstração ensaiada. Cada etapa só avança se o agente passar num padrão mínimo de personas (a dor clara que quer terceirizar, o perdido que não sabe o que quer, quem já pede a oferta de entrada, quem pede preço na primeira mensagem, o curioso sem negócio nenhum) e num eval que vira nota — gate numérico, não achismo de "ficou bom". Só depois disso a IA encosta em cliente pagando pra ver.
Como funciona esse teste de roleplay, na prática?
Não é o desenvolvedor testando com mensagem fácil pra ver se a IA responde bonito. É um harness: de um lado, o agente real, com a configuração real, do jeito que vai ficar no ar. Do outro, um modelo instruído a bancar um dono de negócio específico — e a instrução literal é não ser prestativo: não entregar informação que não foi perguntada, não facilitar a vida do "vendedor", não inventar número que a pessoa daquele perfil não teria de cabeça. É gente difícil de verdade, não um cliente educado testando roteiro.
Depois da conversa, um segundo modelo julga — mas não dá nota de 1 a 5. Ele aplica uma taxonomia de falha: rotula cada erro por tipo (bajulação vazia, resposta em textão, dado inventado, pergunta que o cliente não sabe responder, conta que a IA fez sozinha e o cliente não confirmou). Nota de 1 a 5 diz que a conversa foi mediana. Taxonomia diz qual regra quebrou — e regra quebrada dá pra corrigir.
Quais tipos de cliente têm que estar nesse teste?
Tem um padrão mínimo de persona, porque cada perfil pega um jeito diferente de o agente falhar: a dor clara que quer terceirizar (decisor com número na cabeça, testa se a IA não empurra ele pro caminho errado), o perdido sem saber o que quer (testa se a IA não trava fazendo pergunta que ninguém sabe responder), quem já pede a oferta de entrada (testa se a IA responde os fatos em vez de interrogar quem já levantou a mão), quem pede preço logo na primeira mensagem, e o curioso sem negócio nenhum (testa se a IA não empurra venda pra quem não tem pra que comprar).
E duas coisas sempre entram no roteiro, além das personas: o pós-aceite — o cliente já disse sim, a IA para de vender ou fica insistindo em "loop de reforço"? — e o reengajamento — um lead frio que esfriou mostra interesse de novo, a IA retoma ou repete o "me chama quando quiser" pra sempre? Sobre esse segundo ponto, medir se a IA está atendendo bem (e não só rápido) é o assunto de outro artigo daqui — o roleplay é o teste antes de ir ao ar; a métrica é o acompanhamento depois.
O que um roleplay real pega que ninguém vê numa demo?
Uma demo é sempre conversa fácil — cliente educado, pergunta clara, sem pressa. O roleplay pega o que quebra na vida real: a IA que soa gentil demais com quem só quer resposta, a que despeja parágrafo grande quando bastava uma linha, a que inventa um dado que não estava configurado porque "parecia razoável". Esse tipo de falha some quando quem testa é cordial — e reaparece com o primeiro cliente impaciente de verdade. É por isso que um erro de resposta que sai errado custa muito mais caro depois de publicado do que corrigido antes.
O eval numérico muda o quê que o "ficou bom" não muda?
Roleplay pega comportamento de conversa. Eval set pega mecanismo — se a extração de sinal está funcionando, se a máquina de estado não trava, se o guardrail bloqueia o que devia bloquear. Juntos, viram gate por etapa: a etapa seguinte só libera se as duas coisas passarem, o QA determinístico (testes automáticos) e o QA de roleplay vivo. Sem esse gate numérico, "achei que ficou bom" é opinião de quem escreveu o prompt — e quem escreveu o prompt é sempre o pior juiz do próprio trabalho.
Depois que passa no teste, a IA para de ser testada?
Não. Toda melhoria depois que a IA está no ar continua vindo de conversa real revisada offline, com humano aprovando a mudança antes dela virar config nova — a IA não se reescreve sozinha em produção. O roleplay do início prova que ela pode começar; a revisão contínua é o que garante que ela continua merecendo confiança depois.
Testei assim o meu próprio agente de atendimento, em 10/07/2026, antes de deixar ele conversar com lead de verdade. Rodei o QA com 5 personas contra a configuração real — e o roleplay achou 1 problema de severidade alta, 1 média e 3 baixas. O alto: os fatos da minha mentoria (turma quarta às 19h30, início em 12/08) estavam só na camada de verificação, não no texto que o modelo usa pra responder — então, quando um lead perguntava a data direto, a IA respondia evasivo, tipo "depende da agenda", mesmo com a informação certa disponível no sistema. Corrigi colocando o mesmo fato nos dois lugares: na verificação e no prompt de geração. Também corrigi um lead frio que voltava a demonstrar interesse e caía num loop de "me chama quando quiser" em vez de retomar a conversa e fechar. Depois da correção, rodei um reteste focado com 2 personas — as que tinham pego os problemas — e as duas passaram limpo: a IA citou os fatos certos da mentoria, confirmou a cobertura de atendimento sem enrolar e não inventou dado de pagamento. Só depois desse reteste PASS a config foi pro tráfego.
Perguntas frequentes
Preciso de um time de QA pra fazer esse teste?
Não. O roleplay usa um modelo fazendo o papel do cliente e outro julgando a conversa — dá pra rodar sozinho, contra o agente real, antes de qualquer lead de verdade encostar nele.
Quantas personas são o mínimo pra confiar no teste?
Cinco perfis que cobrem os jeitos mais comuns de cliente errar a IA (dor clara, perdido, oferta de entrada, preço na primeira mensagem, curioso sem negócio), mais o teste específico de pós-aceite e de reengajamento.
Um eval set substitui o roleplay?
Não — são coisas diferentes. Eval set prova que o mecanismo funciona (extração, roteamento, guardrail); roleplay prova que a conversa funciona. Uma etapa só libera com as duas coisas passando.
Se o roleplay reprovar, o que acontece?
A etapa não vai pro ar. Corrige o que a taxonomia de falha apontou, roda um reteste focado nas personas que pegaram o problema e só libera com PASS limpo — foi exatamente o que aconteceu no QA de 10/07/2026.
Isso serve só pra agente de vendas (SDR) ou pra qualquer IA de atendimento?
Serve pra qualquer IA que conversa com cliente de verdade — SDR, suporte, agendamento. Muda o roteiro de persona conforme o negócio; o mecanismo de roleplay + eval como gate é o mesmo.