Hoje toda conversa de operação termina em "qual IA a gente coloca aqui?".
Vou começar esta série por outra pergunta: quantas das suas ferramentas você consegue provar que funcionam?
Nós tínhamos três. Logs numa, métricas em outra, APM numa terceira.
Quando alguma coisa quebrava, a resposta não estava em nenhuma delas.
Não faltava ferramenta. Faltava garantia:
- a aplicação parava de mandar log para o cluster e ninguém percebia;
- quando o log chegava, não trazia a informação necessária;
- a retenção dependia de uma rotina de limpeza configurada à mão, e nem sempre funcionava: guardávamos meses de dados quando o combinado eram semanas.
Eram três lugares para procurar e nenhum dono. Em gestão de risco, isso tem nome: controle que só existe no papel. A auditoria marca "temos monitoramento", mas no dia do incidente ninguém confia nele.
A saída não foi comprar uma quarta ferramenta. Foi juntar logs, métricas e traces num lugar só (open source, com OpenTelemetry) e usar menos coisa, não mais.
Nos próximos posts, vou contar o que isso revelou, com números: o que funcionou, o que custou, onde a IA ajudou e onde errou.
Comece pela pergunta do início: das ferramentas de observabilidade que você paga hoje, quantas você já testou num incidente real?

Top comments (0)