Depois do incidente de 8h40, a tentação era criar dezenas de alertas e painéis.
Fiz o contrário. Comecei pelo inventário:
- 10 dashboards, 8 deles templates importados no mesmo dia, e nenhum sobre os nossos serviços;
- 15 "visões salvas" que ninguém abria;
- 4 alertas.
A meta que escrevi foi cortar: 5 dashboards, 4 visões de investigação, uns 11 alertas.
Três regras saíram desse dia e valem para qualquer time:
- Uma regra bem agrupada cobre tudo. Um único alerta de taxa de erro, agrupado por serviço, cobre os 24 serviços. Não são necessários 24 alertas.
- Nunca suba o limite global para acomodar um serviço doente. Trate o doente.
- Alerta que disparou sem ninguém agir é ajustado ou apagado na mesma semana. Alerta ignorado duas vezes é apagado.
Antes de ligar qualquer coisa, testei com dado real. Se medisse por span, e não por requisição, 6 serviços teriam disparado no primeiro dia. Seria ruído desde a estreia.
E o registro honesto: um mês depois, 6 dos templates "consolidados" ainda estavam lá, duplicados. O custo de ter demais é esse: ninguém apaga.
Ferramenta rica em funcionalidade é convite para acumular. Gestão é dizer não.
Quantos dashboards o seu time tem, e quantos alguém abriu nos últimos 30 dias?

Top comments (0)