Ruído atual
27%
−9% vs semana anterior
Alertas suprimidos (7d)
3.182
Sugestões abertas
9
0 aplicadas
Impacto potencial
−80%
~524 alertas/semana
MTTA médio
8m 42s
Meta: < 5 min
Insights da IA
9 abertos
Threshold
CPU > 90% em web-prod cluster (9 hosts)· web-prod-*alta
Evidência
312 disparos em 30d · 0 incidentes gerados · P95 real de CPU = 94%
Ação proposta
Subir threshold para 95%
Aplicar em 9 hosts do cluster; manter alerta crítico em 98%
Ocorrências 14d
312 disparos · 0 incidentes
Impacto estimado
−12%
~68 alertas/semana
Janela temporal
"Job de relatório" — CPU High terças 09:00–11:00· web-prod clusteralta
Evidência
Padrão recorrente há 12 semanas · 100% dos disparos dentro da janela
Ação proposta
Criar janela de manutenção semanal
Ter 09:00→11:00 BRT · silence em regras de CPU do serviço
Ocorrências 14d
160 disparos · 0 incidentes
Impacto estimado
−9%
~40 alertas/semana
Deploy
Latência DNS interna pareada com restart de pods· kube-system / corednsmédia
Evidência
82 disparos · 100% dentro de janelas de deploy (últimos 30d)
Ação proposta
Suprimir durante changes ativos
Integrar com API de change · silence 5 min após rollout
Ocorrências 14d
82 disparos · 1 incidentes
Impacto estimado
−6%
~21 alertas/semana
Flapping
Health check timeout — auth-svc· auth-svc-3alta
Evidência
412 disparos oscilando OK↔ALARM em <5min · 0 incidentes
Ação proposta
Aumentar for duration para 3 min + histerese
Threshold OK a 2 checks consecutivos · reduz oscilação
Ocorrências 14d
412 disparos · 0 incidentes
Impacto estimado
−18%
~96 alertas/semana
Duplicado
Latência /api/checkout — Zabbix + Datadog· gw-pay-01média
Evidência
138 pares idênticos em 30d · janela média entre pares = 4s
Ação proposta
Eleger Datadog como fonte primária
Suprimir alerta Zabbix quando pair id coincidir em 30s
Ocorrências 14d
138 disparos · 4 incidentes
Impacto estimado
−5%
~32 alertas/semana
Órfão
47 recursos sem serviço/owner associado· inventáriobaixa
Evidência
Alertas gerados sem roteamento · vão para inbox geral
Ação proposta
Atribuir owner ou desativar coleta
Sugestão: usar tag `env` + `team` para auto-atribuir
Ocorrências 14d
73 disparos · 0 incidentes
Impacto estimado
−4%
~18 alertas/semana
Sazonalidade
Volume anômalo em API de câmbio nos fins de semana· api-fxmédia
Evidência
Baseline diferente sáb/dom · 88% dos alertas são falsos positivos
Ação proposta
Threshold dinâmico por dia da semana
Baseline móvel 7d segmentada · reavaliar a cada 24h
Ocorrências 14d
96 disparos · 2 incidentes
Impacto estimado
−7%
~24 alertas/semana
Topologia
5 apps disparam junto quando pgsql-core-1 cai· pgsql-core-1 → 5 dependentesalta
Evidência
Correlação 100% em 8 eventos · atraso médio 12s
Ação proposta
Agrupar em alerta-pai por dependência
Usar mapa de topologia · notificar apenas o root cause
Ocorrências 14d
140 disparos · 8 incidentes
Impacto estimado
−8%
~35 alertas/semana
Info-only
Eventos "backup concluído" tratados como alerta· backup-worker-*baixa
Evidência
820 eventos informativos poluindo inbox · nunca acionados
Ação proposta
Mover para timeline (não gera alerta)
Reclassificar severity=info para log-only
Ocorrências 14d
820 disparos · 0 incidentes
Impacto estimado
−11%
~190 alertas/semana
Regras ativas
RegraOrigemTipoAlvoEvitados 7dCriadaAção
Silence noturno — batch de faturamento
R-101
IA
Janelabilling-*−214há 12dativa
Threshold CPU 90→95 em web-front
R-102
IA
Thresholdweb-front-*−132há 6dativa
Dedup Zabbix↔Prometheus (memória)
R-103
Manual
Duplicadocluster prod−88há 21dativa
Suprimir liveness durante deploy
R-104
IA
Deployapi-core−46há 3dativa
Agrupar filhos de pgsql-core-1
R-105
IA
Topologiapgsql-core-1−24há 2dpausada
Top ofensores (7d)
AlertaHostVolumeAck rateMTTA
Health check timeoutauth-svc-34122%47m
CPU > 90%web-prod-0416811%22m
Backup concluídobackup-worker-21900%—
Latência DNS internacoredns8235%9m
Kafka lag > 1000kafka-025442%14m