Instabilidade na plataforma Evolux
Resolved
Jun 18, 2026 at 12:58pm UTC
Post-Mortem — Instabilidade Plataforma Evolux Chat — 17/jun/2026
• Para: equipe de atendimento (compartilhamento com clientes)
• Período: 17/jun 11:19 – 19:00 BRT (~7h30 de instabilidade intermitente; ~30min de pico)
• Severidade: Alta — intermitência de acesso para parte dos usuários
Resumo
Durante o dia 17/jun a plataforma Evolux Chat apresentou intermitência de acesso para parte dos usuários — alguns conseguiam usar normalmente, outros recebiam erros de conexão. A aplicação em si nunca esteve indisponível: servidores, banco de dados e tempo real continuaram operacionais o tempo todo. O problema esteve na resolução de DNS do domínio evolux.cx junto ao registrador internacional.
A engenharia interveio, aplicou correções e a plataforma voltou ao funcionamento normal global. Nenhum dado de cliente foi afetado.
Cronologia
• ~10:15 BRT — Registrador internacional moveu evolux.cx para modo de "parking" automatizado durante processamento da renovação do domínio.
• 11:19 BRT — Sistema de monitoramento (Better Stack) começou a alertar erros de SSL/conexão em evolux.evolux.cx.
• 11:24 BRT — Equipe SRE iniciou investigação.
• ~12:00 BRT — Causa raiz identificada: subdomínios *.evolux.cx resolvendo para servidores de parking do registrador. CloudFront chegou a 73% de taxa de erro no pico.
• 13:07 BRT — Aplicada correção emergencial no CloudFront para contornar o DNS comprometido — taxa de erro caiu para 0% para usuários conectados via CDN.
• ~13:15 BRT — Servidores de nome (NS) reconfigurados.
• ~13:30–17:00 BRT — Propagação DNS global em curso. Diferentes resolvers de internet (Google, Cloudflare, OpenDNS, Quad9) refrescaram cache em tempos diferentes — daí a intermitência.
• 17:19 BRT — Aplicada correção definitiva no CloudFront para evitar dependência do DNS externo no futuro.
• 17:20 BRT — Plataforma estabilizada em 0% de erros para todos os usuários conectados via CloudFront.
O que foi feito
- Investigação técnica das camadas DNS, certificado SSL, CDN, balanceador de carga e aplicação.
- Identificação da causa real (estado do registrador internacional, não problema na nossa infraestrutura).
- Correção emergencial para que o tráfego não dependesse mais do DNS comprometido.
- Renovação com o registrador.
- Migração da gestão de DNS.
- Aceleração da propagação DNS global via purge dos caches em resolvers públicos principais.
- Correção definitiva na configuração do CloudFront para resiliência futura.
- Monitoramento contínuo até estabilidade global confirmada.
Impacto
• Aplicação (backend, banco, dados de cliente): sem impacto.
• Acesso de usuários (frontend): intermitente conforme o resolver DNS do cliente. Usuários em alguns provedores nunca sentiram problema; outros tiveram períodos de indisponibilidade ou erros de conexão.
• Mensagens em andamento, gravações, históricos: preservados normalmente.
• Tempo real (operadores): continuou processando em todo momento.
Affected services
Updated
Jun 17, 2026 at 4:15pm UTC
Identificamos a causa da instabilidade na infraestrutura e a equipe aplicou a correção. A plataforma já está operando normalmente e seguimos monitorando o ambiente para garantir a estabilidade. Agradecemos a compreensão durante o período de intermitência.
Affected services
Created
Jun 17, 2026 at 1:15pm UTC
Estamos enfrentando um problema de infraestrutura que está gerando intermitência no uso da plataforma. Nossa equipe já está atuando para solucionar a degradação do sistema o mais rápido possível e restabelecer a operação normal. Agradecemos a compreensão.
Affected services