Redução de Ruído

Storm Intelligence — insights, tuning e supressão inteligente

CS
Ruído atual
27%
−9% vs semana anterior
Alertas suprimidos (7d)
3.182
Sugestões abertas
9
0 aplicadas
Impacto potencial
−80%
~524 alertas/semana
MTTA médio
8m 42s
Meta: < 5 min
Insights da IA
9 abertos
Threshold
CPU > 90% em web-prod cluster (9 hosts)· web-prod-*
alta
Evidência

312 disparos em 30d · 0 incidentes gerados · P95 real de CPU = 94%

Ação proposta
Subir threshold para 95%
Aplicar em 9 hosts do cluster; manter alerta crítico em 98%
Ocorrências 14d
312 disparos · 0 incidentes
Impacto estimado
12%
~68 alertas/semana
Janela temporal
"Job de relatório" — CPU High terças 09:00–11:00· web-prod cluster
alta
Evidência

Padrão recorrente há 12 semanas · 100% dos disparos dentro da janela

Ação proposta
Criar janela de manutenção semanal
Ter 09:00→11:00 BRT · silence em regras de CPU do serviço
Ocorrências 14d
160 disparos · 0 incidentes
Impacto estimado
9%
~40 alertas/semana
Deploy
Latência DNS interna pareada com restart de pods· kube-system / coredns
média
Evidência

82 disparos · 100% dentro de janelas de deploy (últimos 30d)

Ação proposta
Suprimir durante changes ativos
Integrar com API de change · silence 5 min após rollout
Ocorrências 14d
82 disparos · 1 incidentes
Impacto estimado
6%
~21 alertas/semana
Flapping
Health check timeout — auth-svc· auth-svc-3
alta
Evidência

412 disparos oscilando OK↔ALARM em <5min · 0 incidentes

Ação proposta
Aumentar for duration para 3 min + histerese
Threshold OK a 2 checks consecutivos · reduz oscilação
Ocorrências 14d
412 disparos · 0 incidentes
Impacto estimado
18%
~96 alertas/semana
Duplicado
Latência /api/checkout — Zabbix + Datadog· gw-pay-01
média
Evidência

138 pares idênticos em 30d · janela média entre pares = 4s

Ação proposta
Eleger Datadog como fonte primária
Suprimir alerta Zabbix quando pair id coincidir em 30s
Ocorrências 14d
138 disparos · 4 incidentes
Impacto estimado
5%
~32 alertas/semana
Órfão
47 recursos sem serviço/owner associado· inventário
baixa
Evidência

Alertas gerados sem roteamento · vão para inbox geral

Ação proposta
Atribuir owner ou desativar coleta
Sugestão: usar tag `env` + `team` para auto-atribuir
Ocorrências 14d
73 disparos · 0 incidentes
Impacto estimado
4%
~18 alertas/semana
Sazonalidade
Volume anômalo em API de câmbio nos fins de semana· api-fx
média
Evidência

Baseline diferente sáb/dom · 88% dos alertas são falsos positivos

Ação proposta
Threshold dinâmico por dia da semana
Baseline móvel 7d segmentada · reavaliar a cada 24h
Ocorrências 14d
96 disparos · 2 incidentes
Impacto estimado
7%
~24 alertas/semana
Topologia
5 apps disparam junto quando pgsql-core-1 cai· pgsql-core-1 → 5 dependentes
alta
Evidência

Correlação 100% em 8 eventos · atraso médio 12s

Ação proposta
Agrupar em alerta-pai por dependência
Usar mapa de topologia · notificar apenas o root cause
Ocorrências 14d
140 disparos · 8 incidentes
Impacto estimado
8%
~35 alertas/semana
Info-only
Eventos "backup concluído" tratados como alerta· backup-worker-*
baixa
Evidência

820 eventos informativos poluindo inbox · nunca acionados

Ação proposta
Mover para timeline (não gera alerta)
Reclassificar severity=info para log-only
Ocorrências 14d
820 disparos · 0 incidentes
Impacto estimado
11%
~190 alertas/semana
Regras ativas
RegraOrigemTipoAlvoEvitados 7dCriadaAção
Silence noturno — batch de faturamento
R-101
IA
Janelabilling-*214há 12d
ativa
Threshold CPU 90→95 em web-front
R-102
IA
Thresholdweb-front-*132há 6d
ativa
Dedup Zabbix↔Prometheus (memória)
R-103
Manual
Duplicadocluster prod88há 21d
ativa
Suprimir liveness durante deploy
R-104
IA
Deployapi-core46há 3d
ativa
Agrupar filhos de pgsql-core-1
R-105
IA
Topologiapgsql-core-124há 2d
pausada
Top ofensores (7d)
AlertaHostVolumeAck rateMTTA
Health check timeoutauth-svc-34122%47m
CPU > 90%web-prod-0416811%22m
Backup concluídobackup-worker-21900%
Latência DNS internacoredns8235%9m
Kafka lag > 1000kafka-025442%14m