Voltar para visão geral
Resolvido

Instabilidade na plataforma Evolux

Jun 17, 2026 at 1:15pm UTC
Serviços afetados
Evolux Chat - API

Resolvido
Jun 18, 2026 at 12:58pm UTC

Post-Mortem — Instabilidade Plataforma Evolux Chat — 17/jun/2026

• Para: equipe de atendimento (compartilhamento com clientes)
• Período: 17/jun 11:19 – 19:00 BRT (~7h30 de instabilidade intermitente; ~30min de pico)
• Severidade: Alta — intermitência de acesso para parte dos usuários

Resumo

Durante o dia 17/jun a plataforma Evolux Chat apresentou intermitência de acesso para parte dos usuários — alguns conseguiam usar normalmente, outros recebiam erros de conexão. A aplicação em si nunca esteve indisponível: servidores, banco de dados e tempo real continuaram operacionais o tempo todo. O problema esteve na resolução de DNS do domínio evolux.cx junto ao registrador internacional.

A engenharia interveio, aplicou correções e a plataforma voltou ao funcionamento normal global. Nenhum dado de cliente foi afetado.

Cronologia

• ~10:15 BRT — Registrador internacional moveu evolux.cx para modo de "parking" automatizado durante processamento da renovação do domínio.
• 11:19 BRT — Sistema de monitoramento (Better Stack) começou a alertar erros de SSL/conexão em evolux.evolux.cx.
• 11:24 BRT — Equipe SRE iniciou investigação.
• ~12:00 BRT — Causa raiz identificada: subdomínios *.evolux.cx resolvendo para servidores de parking do registrador. CloudFront chegou a 73% de taxa de erro no pico.
• 13:07 BRT — Aplicada correção emergencial no CloudFront para contornar o DNS comprometido — taxa de erro caiu para 0% para usuários conectados via CDN.
• ~13:15 BRT — Servidores de nome (NS) reconfigurados.
• ~13:30–17:00 BRT — Propagação DNS global em curso. Diferentes resolvers de internet (Google, Cloudflare, OpenDNS, Quad9) refrescaram cache em tempos diferentes — daí a intermitência.
• 17:19 BRT — Aplicada correção definitiva no CloudFront para evitar dependência do DNS externo no futuro.
• 17:20 BRT — Plataforma estabilizada em 0% de erros para todos os usuários conectados via CloudFront.

O que foi feito

  1. Investigação técnica das camadas DNS, certificado SSL, CDN, balanceador de carga e aplicação.
  2. Identificação da causa real (estado do registrador internacional, não problema na nossa infraestrutura).
  3. Correção emergencial para que o tráfego não dependesse mais do DNS comprometido.
  4. Renovação com o registrador.
  5. Migração da gestão de DNS.
  6. Aceleração da propagação DNS global via purge dos caches em resolvers públicos principais.
  7. Correção definitiva na configuração do CloudFront para resiliência futura.
  8. Monitoramento contínuo até estabilidade global confirmada.

Impacto

• Aplicação (backend, banco, dados de cliente): sem impacto.
• Acesso de usuários (frontend): intermitente conforme o resolver DNS do cliente. Usuários em alguns provedores nunca sentiram problema; outros tiveram períodos de indisponibilidade ou erros de conexão.
• Mensagens em andamento, gravações, históricos: preservados normalmente.
• Tempo real (operadores): continuou processando em todo momento.

Atualizado
Jun 17, 2026 at 4:15pm UTC

Identificamos a causa da instabilidade na infraestrutura e a equipe aplicou a correção. A plataforma já está operando normalmente e seguimos monitorando o ambiente para garantir a estabilidade. Agradecemos a compreensão durante o período de intermitência.

Criado
Jun 17, 2026 at 1:15pm UTC

Estamos enfrentando um problema de infraestrutura que está gerando intermitência no uso da plataforma. Nossa equipe já está atuando para solucionar a degradação do sistema o mais rápido possível e restabelecer a operação normal. Agradecemos a compreensão.