Estefani & Co. Blog

Como se testa uma IA de atendimento antes de soltar ela pra falar com cliente de verdade?

Resposta rápida

Testa com um QA de roleplay vivo: alguém (ou um modelo instruído pra isso) assume o papel de tipos reais de cliente e conversa de verdade, por WhatsApp, com o agente de IA de verdade — não com uma demonstração ensaiada. Cada etapa só avança se o agente passar num padrão mínimo de personas (a dor clara que quer terceirizar, o perdido que não sabe o que quer, quem já pede a oferta de entrada, quem pede preço na primeira mensagem, o curioso sem negócio nenhum) e num eval que vira nota — gate numérico, não achismo de "ficou bom". Só depois disso a IA encosta em cliente pagando pra ver.

Como funciona esse teste de roleplay, na prática?

Não é o desenvolvedor testando com mensagem fácil pra ver se a IA responde bonito. É um harness: de um lado, o agente real, com a configuração real, do jeito que vai ficar no ar. Do outro, um modelo instruído a bancar um dono de negócio específico — e a instrução literal é não ser prestativo: não entregar informação que não foi perguntada, não facilitar a vida do "vendedor", não inventar número que a pessoa daquele perfil não teria de cabeça. É gente difícil de verdade, não um cliente educado testando roteiro.

Depois da conversa, um segundo modelo julga — mas não dá nota de 1 a 5. Ele aplica uma taxonomia de falha: rotula cada erro por tipo (bajulação vazia, resposta em textão, dado inventado, pergunta que o cliente não sabe responder, conta que a IA fez sozinha e o cliente não confirmou). Nota de 1 a 5 diz que a conversa foi mediana. Taxonomia diz qual regra quebrou — e regra quebrada dá pra corrigir.

Quais tipos de cliente têm que estar nesse teste?

Tem um padrão mínimo de persona, porque cada perfil pega um jeito diferente de o agente falhar: a dor clara que quer terceirizar (decisor com número na cabeça, testa se a IA não empurra ele pro caminho errado), o perdido sem saber o que quer (testa se a IA não trava fazendo pergunta que ninguém sabe responder), quem já pede a oferta de entrada (testa se a IA responde os fatos em vez de interrogar quem já levantou a mão), quem pede preço logo na primeira mensagem, e o curioso sem negócio nenhum (testa se a IA não empurra venda pra quem não tem pra que comprar).

E duas coisas sempre entram no roteiro, além das personas: o pós-aceite — o cliente já disse sim, a IA para de vender ou fica insistindo em "loop de reforço"? — e o reengajamento — um lead frio que esfriou mostra interesse de novo, a IA retoma ou repete o "me chama quando quiser" pra sempre? Sobre esse segundo ponto, medir se a IA está atendendo bem (e não só rápido) é o assunto de outro artigo daqui — o roleplay é o teste antes de ir ao ar; a métrica é o acompanhamento depois.

O que um roleplay real pega que ninguém vê numa demo?

Uma demo é sempre conversa fácil — cliente educado, pergunta clara, sem pressa. O roleplay pega o que quebra na vida real: a IA que soa gentil demais com quem só quer resposta, a que despeja parágrafo grande quando bastava uma linha, a que inventa um dado que não estava configurado porque "parecia razoável". Esse tipo de falha some quando quem testa é cordial — e reaparece com o primeiro cliente impaciente de verdade. É por isso que um erro de resposta que sai errado custa muito mais caro depois de publicado do que corrigido antes.

O eval numérico muda o quê que o "ficou bom" não muda?

Roleplay pega comportamento de conversa. Eval set pega mecanismo — se a extração de sinal está funcionando, se a máquina de estado não trava, se o guardrail bloqueia o que devia bloquear. Juntos, viram gate por etapa: a etapa seguinte só libera se as duas coisas passarem, o QA determinístico (testes automáticos) e o QA de roleplay vivo. Sem esse gate numérico, "achei que ficou bom" é opinião de quem escreveu o prompt — e quem escreveu o prompt é sempre o pior juiz do próprio trabalho.

Depois que passa no teste, a IA para de ser testada?

Não. Toda melhoria depois que a IA está no ar continua vindo de conversa real revisada offline, com humano aprovando a mudança antes dela virar config nova — a IA não se reescreve sozinha em produção. O roleplay do início prova que ela pode começar; a revisão contínua é o que garante que ela continua merecendo confiança depois.

Caso real

Testei assim o meu próprio agente de atendimento, em 10/07/2026, antes de deixar ele conversar com lead de verdade. Rodei o QA com 5 personas contra a configuração real — e o roleplay achou 1 problema de severidade alta, 1 média e 3 baixas. O alto: os fatos da minha mentoria (turma quarta às 19h30, início em 12/08) estavam só na camada de verificação, não no texto que o modelo usa pra responder — então, quando um lead perguntava a data direto, a IA respondia evasivo, tipo "depende da agenda", mesmo com a informação certa disponível no sistema. Corrigi colocando o mesmo fato nos dois lugares: na verificação e no prompt de geração. Também corrigi um lead frio que voltava a demonstrar interesse e caía num loop de "me chama quando quiser" em vez de retomar a conversa e fechar. Depois da correção, rodei um reteste focado com 2 personas — as que tinham pego os problemas — e as duas passaram limpo: a IA citou os fatos certos da mentoria, confirmou a cobertura de atendimento sem enrolar e não inventou dado de pagamento. Só depois desse reteste PASS a config foi pro tráfego.

Perguntas frequentes

Preciso de um time de QA pra fazer esse teste?

Não. O roleplay usa um modelo fazendo o papel do cliente e outro julgando a conversa — dá pra rodar sozinho, contra o agente real, antes de qualquer lead de verdade encostar nele.

Quantas personas são o mínimo pra confiar no teste?

Cinco perfis que cobrem os jeitos mais comuns de cliente errar a IA (dor clara, perdido, oferta de entrada, preço na primeira mensagem, curioso sem negócio), mais o teste específico de pós-aceite e de reengajamento.

Um eval set substitui o roleplay?

Não — são coisas diferentes. Eval set prova que o mecanismo funciona (extração, roteamento, guardrail); roleplay prova que a conversa funciona. Uma etapa só libera com as duas coisas passando.

Se o roleplay reprovar, o que acontece?

A etapa não vai pro ar. Corrige o que a taxonomia de falha apontou, roda um reteste focado nas personas que pegaram o problema e só libera com PASS limpo — foi exatamente o que aconteceu no QA de 10/07/2026.

Isso serve só pra agente de vendas (SDR) ou pra qualquer IA de atendimento?

Serve pra qualquer IA que conversa com cliente de verdade — SDR, suporte, agendamento. Muda o roteiro de persona conforme o negócio; o mecanismo de roleplay + eval como gate é o mesmo.

Cristian de Estefani
Consultor de IA · ex-diretor de operações (mercado financeiro)

Cristian de Estefani estruturou operações de grande escala no mercado financeiro antes de fundar a Estefani & Co. Hoje implementa IA em empresas do interior de São Paulo — atendimento, automação e inteligência de dados — e ensina o empresário a operar a solução, mão na massa. Base em São Carlos; atendimento em São Carlos, Araraquara e Ribeirão Preto (diagnóstico presencial, implementação remota).

Quer ver isso rodando no seu negócio?
Chama no WhatsApp