Sre De Plataforma De Ia
gruposrm
Score da Vaga
100 pontosSRE de Plataforma de IA
Missão da posição
Projetar, construir, automatizar e operar a Plataforma de Engenharia de IA, garantindo que aplicações, modelos, LLMs, agentes e serviços de IA possam ser desenvolvidos e executados com segurança, observabilidade, escalabilidade, confiabilidade e governança.
O profissional atuará na interseção entre SRE, Platform Engineering, DevOps, Cloud, Observabilidade e AI Engineering, construindo a camada de infraestrutura e automação necessária para transformar iniciativas de IA em serviços produtivos e sustentáveis.
A posição terá forte atuação em AWS, Kubernetes, GitOps, Infrastructure as Code, CI/CD, Observabilidade e AI Observability.
Principais responsabilidades
1. Plataforma AWS
Projetar, administrar e evoluir a infraestrutura AWS utilizada pela plataforma de IA.
Responsabilidades:
- Administração e evolução de ambientes AWS.
- Arquitetura de workloads distribuídos e altamente disponíveis.
- Administração de EKS.
- ECR para gerenciamento de imagens.
- S3 para datasets, artefatos, modelos e logs.
- IAM e políticas de acesso.
- Secrets Manager e Parameter Store.
- Load Balancers e networking.
- Route 53.
- CloudWatch.
- SQS/SNS/EventBridge para arquiteturas orientadas a eventos.
- RDS/Aurora e serviços de persistência quando necessários.
- ElastiCache/Redis.
- Integração com serviços de IA da AWS.
- Gestão de custos, capacidade e eficiência dos workloads.
O profissional deverá aplicar conceitos de:
High Availability, Disaster Recovery, Security by Design, FinOps e Well-Architected Framework.
2. Kubernetes e Plataforma de Containers
Construir e operar clusters Kubernetes utilizados pelos serviços e workloads de IA.
Principais atividades:
- Administração de clusters Amazon EKS.
- Helm.
- Kubernetes Operators.
- Ingress Controllers.
- Service Accounts e RBAC.
- Network Policies.
- Secrets.
- Persistent Volumes.
- Autoscaling.
- HPA.
- KEDA.
- Cluster Autoscaler/Karpenter.
- Troubleshooting de workloads Kubernetes.
- Capacity Planning.
Também será responsável por definir padrões de deployment para:
- APIs de IA;
- serviços Python;
- aplicações Java;
- agentes de IA;
- gateways;
- workers;
- pipelines assíncronos;
- aplicações de inferência;
- ferramentas internas da plataforma.
3. Infrastructure as Code
Toda infraestrutura deverá ser tratada como código.
Stack principal:
Terraform / OpenTofu + Terragrunt + Atlantis
Responsabilidades:
- desenvolvimento de módulos reutilizáveis;
- versionamento da infraestrutura;
- revisão de mudanças via Pull Request;
- execução automatizada de Plan;
- aprovação controlada de Apply;
- gestão de múltiplos ambientes;
- padronização de módulos;
- controle de drift;
- políticas de segurança;
- automação do ciclo de vida da infraestrutura.
O Atlantis deverá funcionar como camada de governança do processo de IaC.
Fluxo esperado:
Developer
↓
Pull Request
↓
GitHub
↓
Atlantis
↓
Terraform / OpenTofu
↓
AWS
4. GitOps e Continuous Delivery
Responsável pela implementação e evolução do modelo GitOps da plataforma.
Stack principal:
GitHub + GitHub Actions + ArgoCD + Helm
Fluxo esperado:
Developer
↓
GitHub
↓
GitHub Actions
↓
Build / Test / Security
↓
Container Image
↓
Amazon ECR
↓
GitOps Repository
↓
ArgoCD
↓
Amazon EKS
Responsabilidades:
- construção de pipelines CI/CD;
- criação de workflows reutilizáveis;
- gerenciamento de secrets;
- integração com ECR;
- deployment GitOps;
- estratégias de rollback;
- promoção entre ambientes;
- controle de versões;
- políticas de aprovação.
Desejável conhecimento de:
- Argo Rollouts;
- Blue/Green Deployment;
- Canary Deployment;
- Progressive Delivery.
5. Observabilidade da Plataforma
Responsável por implementar observabilidade completa dos workloads.
Stack principal:
OpenTelemetry + Datadog
A plataforma deverá coletar:
- Metrics
- Logs
- Traces
- Events
O OpenTelemetry deverá ser utilizado como camada de instrumentação e coleta independente de fornecedor.
Arquitetura esperada:
Applications
AI Services
AI Agents
Kubernetes
↓
OpenTelemetry SDK
↓
OpenTelemetry Collector
↓
Datadog
Responsabilidades:
- instrumentação OpenTelemetry;
- administração de OpenTelemetry Collectors;
- distributed tracing;
- dashboards;
- alertas;
- correlação entre logs, métricas e traces;
- definição de SLIs e SLOs;
- monitoração de disponibilidade;
- monitoração de performance;
- análise de incidentes;
- troubleshooting distribuído.
6. AI Observability / LLM Observability
Um dos diferenciais da posição será operar a camada de observabilidade específica para Inteligência Artificial.
Além da observabilidade tradicional, deverão ser acompanhados indicadores como:
- Latência de inferência.
- Time to First Token.
- Tokens de entrada.
- Tokens de saída.
- Custo por requisição.
- Custo por modelo.
- Custo por aplicação/agente.
- Taxa de erro.
- Falhas de ferramentas.
- Retries.
- Context size.
- Model/provider utilizado.
- Consumo por usuário ou aplicação.
- Qualidade das respostas.
- Avaliações de LLM.
- Traces de agentes.
Para arquiteturas Agentic AI:
User Request
↓
Agent
↓
LLM
↓
Tool
↓
Agent
↓
Another Agent
↓
LLM
↓
Response
O profissional deverá ser capaz de reconstruir e diagnosticar todo esse fluxo através de traces.
Conhecimentos desejáveis:
- OpenTelemetry GenAI Semantic Conventions;
- OpenLIT;
- Langfuse;
- Arize Phoenix;
- avaliação e tracing de aplicações LLM.
7. Plataforma de Engenharia de IA
O profissional participará da construção de uma Internal Developer Platform — IDP direcionada para workloads de IA.
Objetivo:
Permitir que desenvolvedores e times de IA publiquem serviços sem precisar conhecer toda a complexidade da infraestrutura.
Exemplo:
Developer
↓
Developer Portal
↓
Service Template
↓
GitHub Repository
↓
GitHub Actions
↓
ECR
↓
ArgoCD
↓
EKS
↓
OpenTelemetry
↓
Datadog
A plataforma deverá fornecer Golden Paths para criação de:
- APIs;
- microserviços;
- workers;
- aplicações Python;
- serviços Java;
- agentes de IA;
- aplicações RAG;
- serviços de inferência.
Cada Golden Path deverá entregar automaticamente:
- repositório;
- pipeline;
- Dockerfile;
- Helm Chart;
- deployment Kubernetes;
- observabilidade;
- health checks;
- secrets;
- dashboards;
- alertas;
- políticas básicas de segurança.
8. AI Gateway e acesso aos modelos
Participará da construção da camada de abstração entre aplicações e provedores/modelos de IA.
Arquitetura conceitual:
Applications
Agents
Services
↓
AI Gateway
↓
Model Router
↓
┌──────────────┬──────────────┬──────────────┐
│ AWS Bedrock │ External LLM │ Local Models │
└──────────────┴──────────────┴──────────────┘
Essa camada deverá permitir:
- autenticação;
- rate limiting;
- quotas;
- auditoria;
- observabilidade;
- controle de custos;
- roteamento de modelos;
- fallback entre modelos;
- políticas de utilização.
9. Confiabilidade e SRE
Aplicar princípios de Site Reliability Engineering em toda a plataforma.
Responsabilidades:
- definição de SLIs;
- definição de SLOs;
- Error Budgets;
- Incident Management;
- Capacity Planning;
- Performance Engineering;
- Chaos Engineering;
- Postmortems;
- Runbooks;
- automação de troubleshooting;
- redução de Toil.
Indicadores importantes:
Availability
Latency
Error Rate
Saturation
Throughput
MTTR
MTBF
Deployment Frequency
Change Failure Rate
10. Automação e Engenharia
O profissional deverá possuir capacidade de automação utilizando principalmente:
- Python;
- Shell Script;
- YAML;
- Terraform/OpenTofu.
Conhecimento de Java será considerado diferencial para troubleshooting de aplicações corporativas.
Deverá ser capaz de desenvolver:
- automações operacionais;
- ferramentas internas;
- APIs;
- integrações;
- health checks;
- collectors;
- scripts de troubleshooting;
- automações de incident response.
11. Segurança e Governança
Implementar práticas de segurança integradas à plataforma.
Principais conceitos:
- IAM Least Privilege;
- RBAC;
- Secrets Management;
- Workload Identity;
- OIDC;
- Supply Chain Security;
- Image Scanning;
- SAST;
- Dependency Scanning;
- IaC Scanning;
- Policy as Code;
- auditoria de alterações.
A plataforma deverá priorizar:
Zero Trust + Security by Design + Everything as Code.
Stack tecnológica principal
Cloud
AWS
Containers
Kubernetes
Amazon EKS
Docker
Helm
Infrastructure as Code
Terraform
OpenTofu
Terragrunt
Atlantis
CI/CD e GitOps
GitHub
GitHub Actions
ArgoCD
Argo Rollouts
Observabilidade
OpenTelemetry
Datadog
Prometheus
Grafana
AI Observability
OpenTelemetry GenAI
OpenLIT
Langfuse
Arize Phoenix
AI Platform
AWS Bedrock
LLM APIs
RAG
Vector Databases
AI Agents
Model Gateways
Automação
Python
Shell Script
Competências esperadas
O profissional deverá possuir forte capacidade de:
- troubleshooting;
- análise de sistemas distribuídos;
- automação;
- arquitetura cloud;
- Kubernetes;
- observabilidade;
- engenharia de confiabilidade;
- Infrastructure as Code;
- GitOps.
Mais importante que administrar ferramentas isoladamente será compreender como todo o ecossistema se relaciona.
Visão da posição
O objetivo final dessa função é transformar IA de um conjunto de experimentos isolados em uma capacidade corporativa de engenharia.
A plataforma deverá permitir que um desenvolvedor consiga sair de:
Código
para:
Código
↓
Pipeline
↓
Infraestrutura
↓
Deployment
↓
Observabilidade
↓
Segurança
↓
Operação
com o máximo possível desse processo automatizado.
O SRE de Plataforma de IA será responsável por construir e manter essa fundação.
Em resumo:
Developers constroem aplicações de IA.
AI Engineers constroem modelos, agentes e pipelines de IA.
O SRE / Platform Engineer de IA constrói a plataforma que permite que tudo isso chegue à produção de forma confiável, observável, segura e escalável.
Sobre a área de Inteligência Artificial
A área de Inteligência Artificial é atualmente a que mais cresce no mercado de tecnologia. A revolução dos modelos generativos (GPT, Claude, Gemini) criou uma demanda massiva por profissionais especializados em IA.
As principais áreas de atuação incluem Machine Learning Engineering, MLOps, Prompt Engineering, AI Research e Applied AI. Python, TensorFlow, PyTorch e conhecimento de LLMs são skills essenciais.
Salários na área de IA são os mais altos do setor de tecnologia, com muitas oportunidades de trabalho remoto para empresas internacionais.
Sobre a área de Web Master
O Web Master é o profissional responsável pela manutenção, segurança e performance técnica de sites e aplicações web. Ele gerencia servidores, infraestrutura de hospedagem, monitoramento de uptime e garante que tudo funcione com rapidez e disponibilidade.
As principais habilidades incluem gestão de servidores (Apache, Nginx), hospedagem (AWS, Google Cloud, Azure), CDN (Cloudflare), SSL, DNS, segurança web (WAF, firewall), performance (Core Web Vitals, cache, compressão) e versionamento (Git, CI/CD). Conhecimento de Docker, WordPress, cPanel e monitoramento (Sentry, New Relic) é diferencial.
Web Masters em empresas de tecnologia são muito valorizados, especialmente aqueles que dominam DevOps, SRE e conseguem garantir uptime e performance em escala. A área oferece oportunidades desde webmaster júnior até SRE e infrastructure engineer, com foco em confiabilidade, segurança e velocidade.
Conheça Outras Áreas
Entenda melhor o escopo de atuação, habilidades necessárias e ferramentas utilizadas em diferentes áreas de carreira.
Sobre a área de Atendimento
A área de Atendimento ao Cliente / Relacionamento é essencial para garantir a satisfação, retenção e o bom relacionamento com os clientes. Profissionais dessa área são a principal interface de comunicação, lidando com dúvidas, solicitações, feedback e garantindo uma experiência de alta qualidade no dia a dia. Habilidades em comunicação, resolução de problemas, empatia e paciência são indispensáveis.
Sobre a área de Social Mídia
A área de Social Mídia é uma das mais dinâmicas e em constante evolução do marketing digital. Profissionais de social media são responsáveis por criar, gerenciar e otimizar a presença de marcas nas plataformas digitais, construindo engajamento e comunidade com o público-alvo.
As principais habilidades incluem gestão de redes sociais (Instagram, TikTok, LinkedIn, Facebook, YouTube), criação de conteúdo para redes sociais, community management, mídia paga social (Meta Ads, LinkedIn Ads, TikTok Ads), análise de métricas e planejamento estratégico. Ferramentas como Hootsuite, Sprout Social, Buffer, Later e plataformas de analytics são essenciais.
Profissionais de social media em empresas de tecnologia são muito valorizados, especialmente aqueles que dominam paid social, social media analytics e estratégias de conteúdo para diferentes plataformas. A área oferece oportunidades desde analista até diretor de social media, com foco em crescimento, engajamento e retorno sobre investimento.
Sobre a área de Ecommerce Analyst
O Ecommerce Analyst é o profissional responsável por analisar dados de vendas online, comportamento do comprador e performance de lojas virtuais para guiar decisões estratégicas. Ele combina análise de dados com conhecimento de ecommerce para otimizar conversão, ticket médio e retorno sobre investimento.
As principais habilidades incluem Google Analytics (GA4), Hotjar, análise de funil de conversão, cohort analysis, segmentação de clientes, análise de pricing e métricas de ecommerce (CAC, CLV, AOV, taxa de conversão). Conhecimento de SQL, Power BI, Google Tag Manager e plataformas como Shopify e VTEX é diferencial.
Ecommerce Analysts em empresas de tecnologia são muito valorizados, especialmente aqueles que conseguem transformar dados de comportamento de compra em insights acionáveis para aumentar receita e reduzir abandono de carrinho. A área oferece oportunidades desde analista júnior até analytics manager de ecommerce.
Sobre a área de Web3
A área de Web3 representa a nova fase da internet descentralizada, baseada em tecnologia blockchain. Profissionais de Web3 criam aplicações descentralizadas (dApps), interagem com smart contracts, gerenciam ativos digitais (criptomoedas e NFTs), e utilizam protocolos DeFi (Finanças Descentralizadas), revolucionando a forma como dados, propriedade e finanças são geridos online.
Sobre a área de Engenheiro de Automação
O Engenheiro de Automação é o profissional responsável por projetar, desenvolver e implementar soluções que automatizam processos manuais e repetitivos em TI, infraestrutura, testes e operações. Ele combina conhecimento de programação com visão de DevOps e SRE para eliminar tarefas manuais e aumentar a eficiência operacional.
As principais habilidades incluem Infrastructure as Code (Terraform, Ansible, Pulumi), CI/CD (Jenkins, GitHub Actions, GitLab CI), automação de testes (Selenium, Cypress, Playwright), automação de rede (Netconf, SDN), RPA (UiPath, Power Automate) e scripting (Python, Bash, PowerShell). Conhecimento de Kubernetes, GitOps (ArgoCD, Flux) e plataforma de automação é diferencial.
Engenheiros de Automação em empresas de tecnologia são muito valorizados, especialmente aqueles que conseguem criar pipelines de deploy automatizados, infraestrutura auto-healing e plataformas internas de desenvolvimento (IDP). A área oferece oportunidades desde automation engineer júnior até automation architect e head of automation.
Comentários 0