DEV Community

Francisco das Chagas
Francisco das Chagas

Posted on

Antes de criar, eu apaguei

Uma pilha de dashboards genéricos, em cinza, voa para fora da mesa, enquanto cinco painéis essenciais brilham em teal: orçamento de erro dos 24 serviços, delta do lag de replicação, latência p99, visão do SLO e causa raiz por trace. No caderno aberto, o inventário inicial marca o que foi cortado.

Depois do incidente de 8h40, a tentação era criar dezenas de alertas e painéis.

Fiz o contrário. Comecei pelo inventário:

  • 10 dashboards, 8 deles templates importados no mesmo dia, e nenhum sobre os nossos serviços;
  • 15 "visões salvas" que ninguém abria;
  • 4 alertas.

A meta que escrevi foi cortar: 5 dashboards, 4 visões de investigação, uns 11 alertas.

Três regras saíram desse dia e valem para qualquer time:

  1. Uma regra bem agrupada cobre tudo. Um único alerta de taxa de erro, agrupado por serviço, cobre os 24 serviços. Não são necessários 24 alertas.
  2. Nunca suba o limite global para acomodar um serviço doente. Trate o doente.
  3. Alerta que disparou sem ninguém agir é ajustado ou apagado na mesma semana. Alerta ignorado duas vezes é apagado.

Antes de ligar qualquer coisa, testei com dado real. Se medisse por span, e não por requisição, 6 serviços teriam disparado no primeiro dia. Seria ruído desde a estreia.

E o registro honesto: um mês depois, 6 dos templates "consolidados" ainda estavam lá, duplicados. O custo de ter demais é esse: ninguém apaga.

Ferramenta rica em funcionalidade é convite para acumular. Gestão é dizer não.

Quantos dashboards o seu time tem, e quantos alguém abriu nos últimos 30 dias?

Top comments (0)