Passar para o conteúdo principal

Como aumentar a confiança das respostas e calibrar o escalonamento

Por que a confiança sobe ou desce, como melhorar a KB e a configuração para aumentar a confiança das respostas e recuperar o threshold com segurança.

Threshold não é qualidade

A confiança mínima (padrão 0,70) é a régua para a IA responder sozinha — não a nota da resposta. Baixar para 0,50, por exemplo, não melhora as respostas; só deixa passar respostas mais incertas sem escalar. É um alívio válido durante a calibração, mas o ganho real é aumentar a confiança de fato para poder voltar a régua a um patamar seguro.

Antes de mexer no número: descubra o motivo

Cada escalonamento é auditado com o motivo (baixa confiança, regra, pedido do cliente, frustração…). "Escalava fácil" pode ser:

  • Baixa confiança → problema de base de conhecimento.

  • Regra determinística pegando conversa normal → ajuste de regra.

  • Frustração sensível demais → ajuste do termômetro.

Se a maioria for "baixa confiança", invista na base de conhecimento; se for "regra", ajuste as regras.

O que sobe e o que derruba a confiança

O juiz avalia 5 aspectos: fidelidade à fonte (maior peso), segurança, tom, completude e adequação do escalonamento.

  • Derruba: pergunta sem cobertura na base de conhecimento; artigos que se contradizem ou brigam com a Fonte da Verdade; resposta incompleta/ambígua; tema sensível (segurança); várias intenções na mesma pergunta; frustração alta.

  • Sobe: resposta ancorada num artigo ou numa consulta real; Fonte da Verdade cobrindo o número exato; escopo claro do que a IA pode afirmar.

Detalhe importante: o juiz enxerga apenas um trecho de cada fonte (cerca das primeiras linhas do artigo). Se a resposta está enterrada no meio de um artigo longo, ele pode "não ver" o embasamento e a confiança cai — mesmo a resposta estando certa. Por isso artigo curto, com a resposta nas primeiras frases, aumenta muito a confiança.

Melhorar a base de conhecimento (maior alavanca)

  • Cobrir lacunas reais: transforme as perguntas que escalaram por "baixa confiança" em novos artigos.

  • Resposta no topo: a informação-chave nas primeiras 2–3 frases.

  • Um tema por artigo, FAQ longa dividida em partes, título = a pergunta, com tags e sinônimos.

  • Zero conflito: alinhe todos os números à Fonte da Verdade.

  • Publicado, não rascunho; evite respostas vagas ("depende", "consulte").

  • Fonte da Verdade robusta: quanto mais número oficial a IA pode afirmar, menos ela cai no "não sei".

Melhorar a configuração do Martin

  • Escopo claro nos prompts: o que a IA pode afirmar e o que escala.

  • Ligue as tools que dão embasamento (Busca de produtos, Detalhe do produto, Pedidos/Tracking), respeitando a regra de estoque.

  • Use o meio-termo: em "Abaixo do threshold", além de Escalar, há "Tentar novamente" e "Sugerir ao atendente". Na faixa 0,5–0,7, "Sugerir ao atendente" (comentário interno) mantém o humano no circuito sem transferir o ticket inteiro.

  • Afine as regras determinísticas: revise termos que pegam conversa normal; aumente o N de "repete a mesma intenção" e "sem resolução"; calibre o "reembolso acima de X".

  • Calibre o termômetro de frustração se disparar cedo demais.

Como voltar a régua com segurança

  1. Melhore a base de conhecimento + Fonte da Verdade + escopo dos prompts.

  2. Na faixa incerta, troque "Escalar" por "Sugerir ao atendente".

  3. Suba o threshold em degraus (0,50 → 0,60 → 0,70), acompanhando as notas do juiz, a pesquisa "Resolveu?" e o feedback dos atendentes.

  4. Um departamento com base de conhecimento melhor pode rodar num threshold mais alto — dá para diferenciar por setor.

Em resumo: limite baixo é um curativo; a cura é embasamento. Melhore cobertura e estrutura da base de conhecimento e o escopo dos prompts. Use "Sugerir ao atendente" como amortecedor, e recupere a régua aos poucos.

Respondeu à sua pergunta?