O sucesso funcional que esconde o risco não funcional

O assistente responde às perguntas, os usuários adotam a funcionalidade e os indicadores de produtividade sobem — atendimento mais rápido, menos tickets manuais, mais tarefas concluídas por sessão. Sob a ótica funcional, o lançamento foi um êxito.

O problema é que esses ganhos não dizem nada sobre como o sistema se comporta quando o uso cresce de forma abrupta. Produtividade é uma medida de "o que o sistema faz quando funciona"; resiliência é uma medida de "o que o sistema faz quando é pressionado". São dimensões independentes, e é perfeitamente possível ter uma sem a outra — inclusive, é comum que o próprio sucesso funcional acelere o volume de uso a um ritmo que a arquitetura não foi validada para suportar.

O que a IA generativa acrescenta ao perfil de carga

Um assistente de IA generativa acrescenta chamadas externas, processamento variável, consumo de tokens, recuperação de contexto e novas sessões concorrentes. Diferente de uma rota CRUD tradicional, o tempo de resposta de cada chamada é não determinístico e depende de um provedor terceiro — o que muda o comportamento do sistema sob pico de três formas específicas:

  • Latência variável acumulada: uma chamada ao modelo que leva 2s em vez de 400ms mantém conexões, threads e memória ocupadas por mais tempo, reduzindo o throughput efetivo da aplicação mesmo sem aumento de usuários.
  • Consumo de limites externos: rate limits e cotas de tokens do provedor são um gargalo que a aplicação não controla diretamente; um pico interno pode esbarrar em um teto externo antes mesmo de saturar a própria infraestrutura.
  • Efeito cascata em sessões concorrentes: contexto de conversa mantido em memória ou em cache multiplica o consumo de recursos por usuário ativo, o que penaliza desproporcionalmente picos de volume em relação a um aumento linear de tráfego.

Como investigar

Para investigar, separe o tempo do modelo, da rede, da aplicação e das ferramentas usadas pelo agente. Teste diferentes tamanhos de prompt, concorrência, duração de sessão e respostas de erro. Avalie filas, timeouts, circuit breakers e fallbacks.

Mas a investigação reativa não substitui a validação prévia de resiliência. Antes de expor o assistente a volume real, vale simular explicitamente os cenários que os testes funcionais não cobrem: pico repentino de sessões concorrentes, degradação do provedor de IA (latência alta ou indisponibilidade parcial), esgotamento de rate limit em produção e comportamento do sistema quando o fallback também falha. O objetivo não é provar que o assistente responde bem — isso os testes funcionais já mostraram — e sim provar que o sistema se degrada de forma controlada quando a IA não responde bem.

Como a FATTO aborda esse cenário

Como há variabilidade e dependências de terceiros, o playbook da FATTO direciona esse cenário ao pacote Custom, a partir de R$ 85.000, sob escopo definido. Transforme a data ou o incidente em um cronograma de diagnóstico, correção e reteste, mantendo margem para bloqueios de ambiente.


Próximo passo: separe a latência do modelo da latência da aplicação e identifique qual componente está causando a instabilidade — e simule o próximo pico antes que ele aconteça em produção.