DEV Community

Francisco das Chagas
Francisco das Chagas

Posted on

Três ferramentas, nenhuma resposta

Mesa dividida: à esquerda, três telas com alertas críticos e anotações soltas; à direita, uma única plataforma de observabilidade com métricas, traces e logs

Hoje toda conversa de operação termina em "qual IA a gente coloca aqui?".

Vou começar esta série por outra pergunta: quantas das suas ferramentas você consegue provar que funcionam?

Nós tínhamos três. Logs numa, métricas em outra, APM numa terceira.

Quando alguma coisa quebrava, a resposta não estava em nenhuma delas.

Não faltava ferramenta. Faltava garantia:

  • a aplicação parava de mandar log para o cluster e ninguém percebia;
  • quando o log chegava, não trazia a informação necessária;
  • a retenção dependia de uma rotina de limpeza configurada à mão, e nem sempre funcionava: guardávamos meses de dados quando o combinado eram semanas.

Eram três lugares para procurar e nenhum dono. Em gestão de risco, isso tem nome: controle que só existe no papel. A auditoria marca "temos monitoramento", mas no dia do incidente ninguém confia nele.

A saída não foi comprar uma quarta ferramenta. Foi juntar logs, métricas e traces num lugar só (open source, com OpenTelemetry) e usar menos coisa, não mais.

Nos próximos posts, vou contar o que isso revelou, com números: o que funcionou, o que custou, onde a IA ajudou e onde errou.

Comece pela pergunta do início: das ferramentas de observabilidade que você paga hoje, quantas você já testou num incidente real?

Top comments (0)