Sinais de que está na hora de olhar
- O deploy depende de um script que mora no notebook de uma pessoa só.
- A fatura da cloud sobe todo mês e ninguém aponta o motivo.
- Existe backup, mas ninguém nunca restaurou um para ver se funciona.
- Staging e produção divergem, e o bug só aparece em produção.
- Uma queda de madrugada depende de quem estiver com o celular por perto.
Por onde passamos
Começamos pelo que existe, não pelo que deveria existir. Diagrama de rede, contas e permissões, o caminho do código até produção, onde ficam os dados e quem consegue apagá-los.
- Topologia: regiões, redes, balanceadores, e o que está exposto na internet sem precisar.
- Infraestrutura como código: o que está versionado, o que foi criado à mão no console e o que já se afastou do repositório.
- Pipeline de deploy: quanto demora, onde costuma quebrar e como voltar uma versão ruim.
- Dados: rotina de backup, retenção e prova de que a restauração funciona.
- Kubernetes, quando houver: limites de recurso, autoscaling, upgrades atrasados e o que acontece quando um nó some.
Como o resultado chega
O resultado é um relatório escrito para quem decide e para quem executa. Cada achado traz o risco, o impacto no negócio e uma estimativa honesta de esforço. A primeira página diz o que atacar antes de todo o resto.
- Mapa da arquitetura atual, desenhado a partir do que está rodando e não do que a documentação diz.
- Lista priorizada, com o urgente separado da faxina.
- Plano que o seu time consegue tocar sozinho. Se quiser ajuda na execução, conversamos depois.
Quando o problema não é infraestrutura
Às vezes a lentidão está numa consulta mal escrita, e trocar de instância só empurra a conta para frente. Quando for esse o caso, o diagnóstico diz, e a conversa segue para performance ou refatoração.