9D0A: Engenheiro De Infraestrutura Sênior — Aws E Kubernetes
mazzatech
Score da Vaga
100 pontosMissão da posição
A missão dessa pessoa será garantir que a infraestrutura seja:
• Segura;
• Disponível;
• Escalável;
• Monitorada;
• Automatizada;
• Financeiramente eficiente;
• Preparada para o crescimento da operação;
• Recuperável em caso de falhas ou incidentes;
• Gerenciada por meio de processos e infraestrutura como código.
O profissional será uma das principais referências técnicas da empresa para AWS, Kubernetes, redes, segurança de infraestrutura, observabilidade e continuidade de negócio.
Principais desafios
• Manter e evoluir um ambiente AWS com aplicações críticas em produção.
• Identificar oportunidades reais de redução de custos sem comprometer a operação.
• Liderar tecnicamente a implementação e gestão do Kubernetes.
• Apoiar a evolução de aplicações executadas em ECS e Fargate para Amazon EKS.
• Melhorar a segurança de acessos, redes, credenciais e serviços.
• Reduzir intervenções manuais por meio de automação e infraestrutura como código.
• Estruturar monitoramento, alertas, logs e procedimentos de resposta a incidentes.
• Garantir que backups, restores, redundância e recuperação de desastre sejam testados.
• Trabalhar próximo às equipes de desenvolvimento, banco de dados, segurança e DevOps.
Ambiente tecnológico
A infraestrutura da empresa utiliza serviços como:
• Amazon ECS;
• AWS Fargate;
• Amazon EKS;
• Amazon EC2;
• Amazon RDS;
• Amazon ElastiCache;
• Elastic Load Balancing;
• Amazon ECR;
• AWS CodePipeline;
• AWS CodeBuild;
• Amazon CloudWatch;
• Amazon SQS e SNS;
• AWS Lambda;
• Amazon S3;
• Amazon DocumentDB;
• Amazon Route 53;
• AWS WAF;
• AWS Secrets Manager;
• AWS Key Management Service;
• Amazon VPC;
• AWS CloudTrail;
• AWS Database Migration Service;
• AWS Transfer Family;
• AWS Global Accelerator;
• AWS Certificate Manager;
• CloudFormation.
A maior parte das aplicações é desenvolvida em PHP/Laravel, com uso de containers, Nginx, PHP-FPM, Redis, filas e bancos MySQL.
Responsabilidades
Administração e evolução da AWS
• Administrar os ambientes de desenvolvimento, homologação e produção na AWS.
• Manter e evoluir recursos de computação, rede, armazenamento, banco de dados, cache, filas e segurança.
• Avaliar arquiteturas existentes e propor melhorias de disponibilidade, escalabilidade, segurança e custo.
• Identificar recursos ociosos, superdimensionados, mal configurados ou sem monitoramento.
• Planejar mudanças de infraestrutura com análise de impacto e estratégia de rollback.
• Garantir a padronização dos ambientes.
• Apoiar a criação e evolução de arquiteturas para novas aplicações e microsserviços.
• Documentar topologias, dependências, configurações e procedimentos operacionais.
• Atuar na sustentação de ambientes críticos e na resolução de incidentes.
Kubernetes e containers
• Liderar tecnicamente a implementação e evolução do Kubernetes na Hero.
• Participar do desenho, implantação e operação de clusters Amazon EKS.
• Planejar a migração gradual de aplicações executadas em ECS e Fargate para Kubernetes.
• Definir padrões para deployments, services, ingress, secrets, config maps, jobs e cron jobs.
• Criar e revisar manifestos Kubernetes e charts Helm.
• Definir padrões de namespaces, permissões, isolamento e organização dos clusters.
• Configurar requests, limits, autoscaling, readiness probes e liveness probes.
• Definir estratégias de rolling update, rollback, blue-green e canary deployment quando aplicável.
• Investigar pods com falhas, reinícios, problemas de memória, CPU, rede, DNS ou dependências.
• Gerenciar imagens Docker e repositórios no Amazon ECR.
• Revisar Dockerfiles quanto a segurança, tamanho, desempenho e boas práticas.
• Apoiar desenvolvedores na adequação de aplicações para execução em containers.
Redes e conectividade
• Administrar VPCs, subnets públicas e privadas, tabelas de rotas, gateways e NAT Gateways.
• Criar e revisar Security Groups e Network ACLs.
• Configurar conectividade segura entre aplicações, bancos, caches e serviços internos.
• Implementar restrições e liberações de acesso por IP.
• Administrar acessos por VPN e redes privadas.
• Apoiar integrações que exijam IP fixo de saída ou inclusão em listas de IP permitidos.
• Diagnosticar problemas de rede, DNS, rotas, portas, latência e resolução de nomes.
• Administrar Route 53, certificados digitais e AWS Certificate Manager.
• Configurar e revisar Application Load Balancers e Network Load Balancers.
• Garantir que bancos de dados, caches e serviços internos não sejam expostos desnecessariamente à internet.
• Avaliar conectividade entre regiões, contas e redes externas.
Segurança de infraestrutura
• Aplicar o princípio do menor privilégio em usuários, grupos, roles e policies do IAM.
• Revisar acessos humanos, acessos de aplicações e permissões concedidas a pipelines.
• Estruturar e revisar políticas de acesso aos ambientes de produção.
• Gerenciar segredos por meio do AWS Secrets Manager.
• Administrar chaves e criptografia utilizando AWS KMS.
• Garantir criptografia de dados em trânsito e em repouso.
• Configurar e revisar regras no AWS WAF.
• Analisar trilhas de auditoria no AWS CloudTrail.
• Identificar recursos públicos, portas abertas e configurações inseguras.
• Apoiar a rotação de credenciais, chaves, tokens e certificados.
• Participar da investigação de incidentes de segurança.
• Implementar controles para evitar alterações manuais não rastreadas.
• Apoiar requisitos relacionados à LGPD, governança e proteção de dados.
• Manter sistemas operacionais, imagens e componentes de infraestrutura atualizados.
Infraestrutura como código
• Criar e manter infraestrutura utilizando Terraform ou CloudFormation.
• Priorizar o Terraform como ferramenta de padronização e evolução do ambiente.
• Estruturar módulos reutilizáveis.
• Organizar estados, ambientes e variáveis de forma segura.
• Implementar validações, revisões e planos antes da aplicação de mudanças.
• Evitar criação manual de recursos sem rastreabilidade.
• Manter a infraestrutura versionada em Git.
• Criar padrões para desenvolvimento, homologação e produção.
• Documentar procedimentos de execução, rollback e recuperação do estado.
• Apoiar a implementação de políticas e controles automatizados sobre a infraestrutura.
Observabilidade e monitoramento
• Configurar e evoluir o Amazon CloudWatch.
• Criar dashboards técnicos e operacionais.
• Configurar métricas, logs, alarms e filters.
• Centralizar logs de aplicações, containers, load balancers e serviços AWS.
• Criar alertas para indisponibilidade, erros, latência e saturação.
• Monitorar CPU, memória, storage, rede, conexões, filas e health checks.
• Definir retenção adequada de logs, equilibrando necessidade operacional e custo.
• Criar alertas que sejam acionáveis e possuam responsáveis definidos.
• Apoiar a definição de indicadores de disponibilidade e desempenho.
• Investigar aumentos inesperados no volume de logs ou nos custos de observabilidade.
• Desenvolver runbooks para resposta a alertas e incidentes recorrentes.
• Avaliar a adoção de Prometheus, Grafana e OpenTelemetry quando necessário.
Gestão e otimização de custos AWS
• Analisar continuamente os custos da infraestrutura.
• Identificar anomalias de consumo e aumentos inesperados.
• Avaliar custos de EC2, ECS, EKS, RDS, ElastiCache, Load Balancers, VPC, CloudWatch e Data Transfer.
• Realizar rightsizing de instâncias, bancos e containers.
• Analisar a adoção de Savings Plans e Reserved Instances.
• Revisar custos de NAT Gateway, transferência de dados e tráfego entre regiões.
• Revisar retenção de logs, snapshots, volumes, imagens e arquivos.
• Criar rotinas de desligamento de ambientes não produtivos quando aplicável.
• Identificar recursos sem utilização ou sem proprietário definido.
• Criar dashboards, alertas e relatórios de custos.
• Avaliar o impacto financeiro antes da implantação de novas arquiteturas.
• Recomendar ações de redução de custos sem comprometer disponibilidade, segurança ou desempenho.
• Apoiar a criação de uma cultura de FinOps na empresa.
Bancos de dados e cache
A posição não substituirá o DBA, mas deverá possuir conhecimento suficiente para administrar e diagnosticar a infraestrutura desses serviços.
Será responsável por:
• Monitorar ambientes Amazon RDS.
• Analisar CPU, memória, storage, IOPS, conexões e latência.
• Apoiar o dimensionamento de instâncias MySQL e PostgreSQL.
• Analisar gargalos de infraestrutura que afetem o banco de dados.
• Apoiar configurações de backup, snapshots, read replicas e failover.
• Participar de testes de restore.
• Monitorar e administrar Amazon ElastiCache e Redis.
• Investigar consumo de memória, conexões, eviction e indisponibilidade do cache.
• Apoiar a análise de queries lentas e excesso de conexões em conjunto com desenvolvimento e DBA.
• Planejar manutenções e mudanças com menor impacto para as aplicações.
• Participar da definição de RTO e RPO para bancos e caches.
CI/CD e automação
• Criar e manter pipelines utilizando AWS CodePipeline e CodeBuild.
• Automatizar build, criação de imagens, publicação no ECR e deploy.
• Integrar pipelines com ECS, EKS e infraestrutura como código.
• Criar processos seguros de promoção entre desenvolvimento, homologação e produção.
• Implementar validações antes de alterações de infraestrutura.
• Criar scripts em Python ou Bash para automação de atividades operacionais.
• Utilizar Python e boto3 para inventário, monitoramento, segurança, custos e rotinas administrativas.
• Reduzir tarefas manuais e repetitivas.
• Apoiar a implementação de estratégias de rollback.
• Garantir rastreabilidade das mudanças executadas.
Continuidade e recuperação de desastre
• Definir e revisar políticas de backup.
• Garantir que recursos críticos estejam incluídos nas rotinas de backup.
• Realizar testes periódicos de restauração.
• Documentar procedimentos de recuperação.
• Apoiar a definição de RTO e RPO por sistema.
• Avaliar a necessidade de redundância entre zonas e regiões.
• Planejar a recuperação de aplicações, bancos, arquivos, configurações e segredos.
• Criar runbooks de disaster recovery.
• Participar de simulações de falha e indisponibilidade.
• Identificar pontos únicos de falha e propor correções.
Incidentes e suporte à produção
• Atuar diretamente na investigação de incidentes de infraestrutura.
• Identificar rapidamente se a origem está em rede, container, cluster, banco, cache, pipeline ou serviço AWS.
• Participar de salas de crise quando necessário.
• Comunicar impacto, diagnóstico e ações de maneira objetiva.
• Executar correções emergenciais com controle de risco.
• Registrar as mudanças realizadas durante o incidente.
• Conduzir ou participar de análises de causa raiz.
• Criar ações preventivas para evitar recorrência.
• Apoiar equipes de desenvolvimento durante incidentes relacionados às aplicações.
• Criar automações e documentação para problemas recorrentes.
Requisitos obrigatórios
• Experiência sólida como Engenheiro de Infraestrutura, Cloud Engineer, Platform Engineer ou função equivalente.
• Experiência prática e recente com AWS em ambientes críticos de produção.
• Conhecimento avançado de Amazon VPC.
• Conhecimento avançado de Security Groups, rotas, subnets e conectividade.
• Experiência sólida com IAM, roles, policies e princípio do menor privilégio.
• Experiência prática com Amazon ECS e AWS Fargate.
• Experiência com AWS CodePipeline e CodeBuild.
• Experiência com AWS Secrets Manager.
• Experiência avançada com Amazon CloudWatch.
• Experiência com configuração de alarms, metrics, logs e dashboards.
• Experiência prática com Docker.
• Experiência prática com Kubernetes em produção.
• Capacidade de implementar e administrar clusters Kubernetes.
• Experiência com Amazon EKS ou Kubernetes gerenciado equivalente.
• Experiência com Terraform ou CloudFormation.
• Experiência com criação e manutenção de pipelines de CI/CD.
• Domínio de Linux e troubleshooting.
• Conhecimento de redes, DNS, certificados, VPN e controle de acesso por IP.
• Conhecimento de Load Balancers e health checks.
• Experiência com investigação de incidentes de produção.
• Conhecimento de backup, restore, alta disponibilidade e disaster recovery.
• Conhecimento de segurança de infraestrutura em nuvem.
• Capacidade de analisar e otimizar custos AWS.
• Conhecimento operacional de bancos de dados relacionais e Redis.
• Experiência com Git e processos de revisão de mudanças.
• Capacidade de criar documentação técnica e runbooks.
• Disponibilidade para atuação presencial quatro vezes por semana em São Paulo.
Conhecimentos esperados de Kubernetes
Para esta posição, não será suficiente ter apenas realizado cursos ou laboratórios de Kubernetes.
O profissional deverá possuir experiência prática com:
• Arquitetura de clusters Kubernetes;
• Deployments;
• StatefulSets;
• DaemonSets;
• Services;
• Ingress;
• ConfigMaps;
• Secrets;
• Jobs e CronJobs;
• Requests e limits;
• Readiness e liveness probes;
• Horizontal Pod Autoscaler;
• Persistent Volumes;
• Helm;
• Namespaces;
• RBAC;
• Network Policies;
• Troubleshooting de pods;
• Diagnóstico de DNS e rede;
• Análise de consumo de CPU e memória;
• Estratégias de rollout e rollback;
• Gestão de logs e métricas;
• Atualização e manutenção de clusters.
Diferenciais
• Experiência com Python.
• Experiência com boto3.
• Criação de scripts para inventário e automação da AWS.
• Experiência com tuning de infraestrutura para MySQL.
• Experiência com tuning de infraestrutura para Redis.
• Experiência com Amazon RDS ou Aurora MySQL.
• Experiência com Amazon ElastiCache.
• Experiência com PHP-FPM, Nginx e aplicações Laravel.
• Experiência com ambientes de microsserviços.
• Experiência com AWS WAF, KMS e CloudTrail.
• Experiência com DocumentDB.
• Experiência com AWS Database Migration Service.
• Experiência com AWS Transfer Family.
• Experiência com Global Accelerator.
• Experiência com Prometheus, Grafana ou OpenTelemetry.
• Experiência com GitOps e Argo CD.
• Experiência com múltiplas contas AWS e AWS Organizations.
• Experiência com ambientes regulados.
• Experiência em seguradoras, fintechs, bancos ou meios de pagamento.
• Conhecimento de LGPD, ISO 27001, SOC 2 ou PCI DSS.
• Certificação AWS Solutions Architect.
• Certificação AWS SysOps Administrator.
• Certificação AWS DevOps Engineer.
• Certificação CKA ou CKAD.
• Experiência comprovada em projetos de otimização de custos AWS.
O que esperamos de uma pessoa sênior
Senioridade, para esta posição, não será avaliada apenas por tempo de experiência ou certificações.
Esperamos que essa pessoa seja capaz de:
• Assumir a investigação de um incidente sem depender de um roteiro pronto.
• Identificar riscos antes de executar uma mudança.
• Diferenciar problemas de rede, infraestrutura, aplicação, banco, cache e cluster.
• Planejar uma migração para Kubernetes com etapas, riscos e rollback.
• Criar infraestrutura por código sem depender do Console da AWS.
• Revisar uma arquitetura e identificar pontos únicos de falha.
• Avaliar o impacto financeiro de uma decisão de infraestrutura.
• Revisar permissões IAM e identificar acessos excessivos.
• Diagnosticar falhas de comunicação entre serviços privados.
• Investigar um pod reiniciando ou um serviço indisponível.
• Investigar crescimento repentino de CPU, memória, storage ou conexões.
• Analisar aumento inesperado nos custos AWS.
• Definir métricas, logs e alertas para um novo serviço.
• Criar um plano de backup, restore e disaster recovery.
• Executar mudanças críticas com segurança e rastreabilidade.
• Comunicar problemas técnicos para públicos técnicos e não técnicos.
• Orientar outros profissionais sem deixar de atuar diretamente na execução.
Perfil comportamental
Buscamos uma pessoa:
• Mão na massa;
• Ágil na investigação;
• Cuidadosa na execução;
• Organizada;
• Objetiva;
• Proativa;
• Orientada à automação;
• Comprometida com segurança;
• Atenta a custos;
• Capaz de trabalhar sob pressão durante incidentes;
• Disposta a assumir responsabilidade pelo ambiente;
• Capaz de documentar e compartilhar conhecimento;
• Que trabalhe bem com desenvolvimento, segurança e banco de dados;
• Que consiga priorizar problemas conforme o impacto para o negócio;
• Que não se limite a corrigir sintomas, buscando eliminar a causa raiz.
Sobre a área de Fullstack
Desenvolvedores Fullstack são profissionais versáteis capazes de atuar tanto no frontend quanto no backend de aplicações web e mobile. Eles dominam múltiplas tecnologias e são capazes de construir produtos completos do início ao fim, desde a interface do usuário até a infraestrutura do servidor.
As principais habilidades incluem domínio de pelo menos uma stack completa (React/Vue/Angular + Node.js/PHP/Python/Java), banco de dados (SQL e NoSQL), APIs REST/GraphQL, versionamento com Git, CI/CD e conhecimento básico de infraestrutura (Docker, cloud). Arquitetura limpa, DDD e testes são diferenciadores importantes.
Desenvolvedores Fullstack são muito valorizados em startups e empresas que precisam de profissionais versáteis e autônomos. A área oferece oportunidades desde desenvolvedor júnior até arquiteto de software, com foco em entrega completa, visão holística do produto e capacidade de trabalhar em múltiplas camadas da aplicação.
Sobre a área de Web Master
O Web Master é o profissional responsável pela manutenção, segurança e performance técnica de sites e aplicações web. Ele gerencia servidores, infraestrutura de hospedagem, monitoramento de uptime e garante que tudo funcione com rapidez e disponibilidade.
As principais habilidades incluem gestão de servidores (Apache, Nginx), hospedagem (AWS, Google Cloud, Azure), CDN (Cloudflare), SSL, DNS, segurança web (WAF, firewall), performance (Core Web Vitals, cache, compressão) e versionamento (Git, CI/CD). Conhecimento de Docker, WordPress, cPanel e monitoramento (Sentry, New Relic) é diferencial.
Web Masters em empresas de tecnologia são muito valorizados, especialmente aqueles que dominam DevOps, SRE e conseguem garantir uptime e performance em escala. A área oferece oportunidades desde webmaster júnior até SRE e infrastructure engineer, com foco em confiabilidade, segurança e velocidade.
Sobre a área de Cloud Solutions
A área de Cloud Solutions é responsável por projetar, implementar e gerenciar infraestrutura e serviços em nuvem (AWS, Azure, GCP) para empresas. Profissionais de cloud arquitetam soluções escaláveis, seguras e otimizadas em custo, desde migrações de data centers até arquiteturas serverless e multi-cloud.
As principais habilidades incluem IaC (Terraform, CloudFormation), containers (Docker, Kubernetes), serverless (Lambda, Cloud Functions), bancos de dados gerenciados (RDS, DynamoDB, BigQuery), redes cloud (VPC, CDN, load balancer) e segurança (IAM, WAF, KMS). Conhecimento de FinOps, cloud governance e certificações AWS/Azure/GCP é diferencial.
Profissionais de Cloud Solutions em empresas de tecnologia são muito valorizados, especialmente aqueles que dominam arquiteturas multi-cloud, FinOps e conseguem otimizar custos enquanto mantêm performance e segurança. A área oferece oportunidades desde cloud engineer até cloud solutions architect, head of cloud e chief cloud architect.
Conheça Outras Áreas
Entenda melhor o escopo de atuação, habilidades necessárias e ferramentas utilizadas em diferentes áreas de carreira.
Sobre a área de Relações Públicas
A área de Relações Públicas (RP) é focada na gestão da reputação, imagem e comunicação de uma organização com seus diversos públicos de interesse (como clientes, investidores, colaboradores, mídia e comunidade). Profissionais de RP desenvolvem estratégias de comunicação corporativa, gerenciam o relacionamento com a imprensa (assessoria de imprensa), organizam eventos institucionais e atuam na prevenção e gestão de crises de imagem.
Sobre a área de Analista de Automação
O Analista de Automação é o profissional responsável por identificar oportunidades de otimização de processos e desenvolver fluxos automatizados (RPA, scripts ou integrações). Ele mapeia atividades manuais e repetitivas em diversas áreas da empresa e constrói soluções de automação utilizando plataformas de low-code/no-code (como Zapier, Make, Power Automate, n8n) ou ferramentas de RPA (como UiPath), promovendo ganho de eficiência operacional e redução de erros.
Sobre a área de Content Manager
O Content Manager é o profissional responsável por liderar toda a estratégia, produção e gestão de conteúdo de uma organização. Ele define a estratégia editorial, coordena equipes de redação e garante que o conteúdo esteja alinhado com os objetivos de negócio e a identidade da marca.
As principais habilidades incluem estratégia de conteúdo, planejamento editorial, content audit, buyer persona, customer journey, content ops, governança de conteúdo, métricas de performance (ROI, engajamento, tráfego orgânico) e gestão de equipe. Conhecimento de WordPress, Contentful, Notion e ferramentas de analytics é diferencial.
Content Managers em empresas de tecnologia são muito valorizados, especialmente aqueles que conseguem alinhar conteúdo com funil de conversão, liderar equipes multidisciplinares e usar dados para otimizar estratégia editorial. A área oferece oportunidades desde content manager até diretor de conteúdo, com foco em estratégia, qualidade e escala.
Sobre a área de Redação
A área de Redação é responsável por criar textos persuasivos, criativos e estratégicos para diferentes canais de comunicação. Profissionais de redação transformam ideias em palavras que engajam, convertem e constroem a identidade de voz das marcas.
As principais habilidades incluem redação publicitária, copywriting, roteiro para vídeos e podcasts, escrita persuasiva, tom de voz e guidelines editoriais. Conhecimento de SEO writing, Grammarly e ferramentas de produtividade de texto é diferencial.
Profissionais de Redação em empresas de tecnologia são muito valorizados, especialmente aqueles que dominam copy para landing pages, e-mail sequences e conteúdo para funil de conversão. A área oferece oportunidades desde redator júnior até diretor de copy, com foco em criatividade, persuasão e performance.
Sobre a área de Agilidade
A área de Agilidade e Transformação Digital é fundamental para organizações que buscam eficiência e adaptação rápida. Profissionais de agile facilitam processos, eliminam gargalos e promovem cultura de melhoria contínua.
As principais certificações incluem CSM, PSM, SAFe, ICP e Kanban. Conhecimento de Scrum, Kanban, XP e frameworks ágeis é essencial, assim como soft skills de liderança e facilitação.
Agile coaches e Scrum Masters sênior são muito valorizados, especialmente em empresas de tecnologia que adotam metodologias ágeis em escala.