Threshold não é qualidade
A confiança mínima (padrão 0,70) é a régua para a IA responder sozinha — não a nota da resposta. Baixar para 0,50, por exemplo, não melhora as respostas; só deixa passar respostas mais incertas sem escalar. É um alívio válido durante a calibração, mas o ganho real é aumentar a confiança de fato para poder voltar a régua a um patamar seguro.
Antes de mexer no número: descubra o motivo
Cada escalonamento é auditado com o motivo (baixa confiança, regra, pedido do cliente, frustração…). "Escalava fácil" pode ser:
Baixa confiança → problema de base de conhecimento.
Regra determinística pegando conversa normal → ajuste de regra.
Frustração sensível demais → ajuste do termômetro.
Se a maioria for "baixa confiança", invista na base de conhecimento; se for "regra", ajuste as regras.
O que sobe e o que derruba a confiança
O juiz avalia 5 aspectos: fidelidade à fonte (maior peso), segurança, tom, completude e adequação do escalonamento.
Derruba: pergunta sem cobertura na base de conhecimento; artigos que se contradizem ou brigam com a Fonte da Verdade; resposta incompleta/ambígua; tema sensível (segurança); várias intenções na mesma pergunta; frustração alta.
Sobe: resposta ancorada num artigo ou numa consulta real; Fonte da Verdade cobrindo o número exato; escopo claro do que a IA pode afirmar.
Detalhe importante: o juiz enxerga apenas um trecho de cada fonte (cerca das primeiras linhas do artigo). Se a resposta está enterrada no meio de um artigo longo, ele pode "não ver" o embasamento e a confiança cai — mesmo a resposta estando certa. Por isso artigo curto, com a resposta nas primeiras frases, aumenta muito a confiança.
Melhorar a base de conhecimento (maior alavanca)
Cobrir lacunas reais: transforme as perguntas que escalaram por "baixa confiança" em novos artigos.
Resposta no topo: a informação-chave nas primeiras 2–3 frases.
Um tema por artigo, FAQ longa dividida em partes, título = a pergunta, com tags e sinônimos.
Zero conflito: alinhe todos os números à Fonte da Verdade.
Publicado, não rascunho; evite respostas vagas ("depende", "consulte").
Fonte da Verdade robusta: quanto mais número oficial a IA pode afirmar, menos ela cai no "não sei".
Melhorar a configuração do Martin
Escopo claro nos prompts: o que a IA pode afirmar e o que escala.
Ligue as tools que dão embasamento (Busca de produtos, Detalhe do produto, Pedidos/Tracking), respeitando a regra de estoque.
Use o meio-termo: em "Abaixo do threshold", além de Escalar, há "Tentar novamente" e "Sugerir ao atendente". Na faixa 0,5–0,7, "Sugerir ao atendente" (comentário interno) mantém o humano no circuito sem transferir o ticket inteiro.
Afine as regras determinísticas: revise termos que pegam conversa normal; aumente o N de "repete a mesma intenção" e "sem resolução"; calibre o "reembolso acima de X".
Calibre o termômetro de frustração se disparar cedo demais.
Como voltar a régua com segurança
Melhore a base de conhecimento + Fonte da Verdade + escopo dos prompts.
Na faixa incerta, troque "Escalar" por "Sugerir ao atendente".
Suba o threshold em degraus (0,50 → 0,60 → 0,70), acompanhando as notas do juiz, a pesquisa "Resolveu?" e o feedback dos atendentes.
Um departamento com base de conhecimento melhor pode rodar num threshold mais alto — dá para diferenciar por setor.
Em resumo: limite baixo é um curativo; a cura é embasamento. Melhore cobertura e estrutura da base de conhecimento e o escopo dos prompts. Use "Sugerir ao atendente" como amortecedor, e recupere a régua aos poucos.