O sucesso funcional que esconde o risco não funcional
O assistente responde às perguntas, os usuários adotam a funcionalidade e os indicadores de produtividade sobem — atendimento mais rápido, menos tickets manuais, mais tarefas concluídas por sessão. Sob a ótica funcional, o lançamento foi um êxito.
O problema é que esses ganhos não dizem nada sobre como o sistema se comporta quando o uso cresce de forma abrupta. Produtividade é uma medida de "o que o sistema faz quando funciona"; resiliência é uma medida de "o que o sistema faz quando é pressionado". São dimensões independentes, e é perfeitamente possível ter uma sem a outra — inclusive, é comum que o próprio sucesso funcional acelere o volume de uso a um ritmo que a arquitetura não foi validada para suportar.
O que a IA generativa acrescenta ao perfil de carga
Um assistente de IA generativa acrescenta chamadas externas, processamento variável, consumo de tokens, recuperação de contexto e novas sessões concorrentes. Diferente de uma rota CRUD tradicional, o tempo de resposta de cada chamada é não determinístico e depende de um provedor terceiro — o que muda o comportamento do sistema sob pico de três formas específicas:
- Latência variável acumulada: uma chamada ao modelo que leva 2s em vez de 400ms mantém conexões, threads e memória ocupadas por mais tempo, reduzindo o throughput efetivo da aplicação mesmo sem aumento de usuários.
- Consumo de limites externos: rate limits e cotas de tokens do provedor são um gargalo que a aplicação não controla diretamente; um pico interno pode esbarrar em um teto externo antes mesmo de saturar a própria infraestrutura.
- Efeito cascata em sessões concorrentes: contexto de conversa mantido em memória ou em cache multiplica o consumo de recursos por usuário ativo, o que penaliza desproporcionalmente picos de volume em relação a um aumento linear de tráfego.
Como investigar
Para investigar, separe o tempo do modelo, da rede, da aplicação e das ferramentas usadas pelo agente. Teste diferentes tamanhos de prompt, concorrência, duração de sessão e respostas de erro. Avalie filas, timeouts, circuit breakers e fallbacks.
Mas a investigação reativa não substitui a validação prévia de resiliência. Antes de expor o assistente a volume real, vale simular explicitamente os cenários que os testes funcionais não cobrem: pico repentino de sessões concorrentes, degradação do provedor de IA (latência alta ou indisponibilidade parcial), esgotamento de rate limit em produção e comportamento do sistema quando o fallback também falha. O objetivo não é provar que o assistente responde bem — isso os testes funcionais já mostraram — e sim provar que o sistema se degrada de forma controlada quando a IA não responde bem.
Como a FATTO aborda esse cenário
Como há variabilidade e dependências de terceiros, o playbook da FATTO direciona esse cenário ao pacote Custom, a partir de R$ 85.000, sob escopo definido. Transforme a data ou o incidente em um cronograma de diagnóstico, correção e reteste, mantendo margem para bloqueios de ambiente.
FATTO Consultoria e Sistemas
© 2026 FATTO Consultoria e Sistemas. Todos os direitos reservados.
