Analista Pleno em Infraestrutura | SRE
🚀 Sobre a Oportunidade
Estamos em busca de um SRE Pleno para fazer parte do time de infraestrutura da XP Inc. — um dos maiores ecossistemas financeiros do país. Se você tem autonomia para operar ambientes críticos de média e alta complexidade, resolve problemas reais em Linux, Kubernetes e mensageria, e quer atuar como referência técnica para o time júnior enquanto conduz projetos de evolução da plataforma, essa vaga é para você. Aqui você vai lidar com troubleshooting de incidentes N2/N3, implementar automações, participar de war rooms e garantir que nossos sistemas continuem rodando com a confiabilidade que o mercado exige.
Saiba mais sobre nosso dia a dia no Instagram e no LinkedIn.
Confira nossas avaliações no Glassdoor.
🔍 O Que Procuramos
Pré-requisitos Essenciais:
Ensino superior completo em Ciência da Computação, Engenharia da Computação ou áreas correlatas
3 a 6 anos de experiência em infraestrutura de TI, SRE, DevOps ou administração de sistemas
Mínimo de 2 anos com Kubernetes em produção (RBAC, networking, storage, HPA, Helm)
Mínimo de 2 anos com Linux (RHEL) em produção (kernel tuning, performance profiling, troubleshooting avançado)
Mínimo de 1 ano com Apache Kafka em produção (tópicos, partições, replicação, consumer groups, Kafka Connect)
Mínimo de 1 ano com RabbitMQ em produção (clusters, mirroring, exchanges, dead letter queues)
Experiência com observabilidade (Grafana, Dynatrace, Loki, ELK Stack)
Automação com Ansible, Python e Shell Script avançado
Troubleshooting avançado de redes TCP/IP (tcpdump, Wireshark, análise de latência)
Experiência com CI/CD (GitLab CI, GitHub Actions ou Jenkins)
Git avançado (branching strategies, code review, GitOps)
Diferenciais:
Terraform (infraestrutura como código)
ArgoCD / Flux (GitOps)
Service Mesh (Istio, Linkerd)
Certificações: CKA, CKAD, RHCE, AWS SA Associate
Experiência com bancos de dados (PostgreSQL, MySQL, SQL Server)
Conhecimento de Vault (Hashicorp) ou CyberArk
Experiência em empresas de missão crítica (bancos, fintechs, telecom)
Já conduziu RCAs de incidentes Severity 1
Conhecimento de Chaos Engineering
Contribuições open source ou palestras em eventos técnicos
🎯 Desafios e Impacto
Garantir disponibilidade 24x7 de sistemas críticos em ambiente auditado (BACEN, CVM, LGPD), com janelas de manutenção restritas e tolerância a falhas próxima de zero
Conduzir troubleshooting de incidentes N2/N3 em ambientes multi-tecnologia (K8s + Kafka + RabbitMQ + redes + storage), atuando como escalation primário em war rooms
Reduzir TOIL através de automação, implementando soluções com Ansible, Python e Shell Script para eliminar tarefas repetitivas e ganhar eficiência operacional
Realizar análises de causa raiz (RCA/Postmortem) para incidentes críticos, garantindo que 100% dos Severity 1 e 2 tenham RCA concluída em até 5 dias úteis
Mentorear SREs juniores, revisando código, fazendo pair troubleshooting e promovendo treinamentos para desenvolver autonomia operacional no time
Participar de projetos de migração e evolução de infraestrutura, equilibrando a velocidade que os times de produto querem com a confiabilidade que a operação exige
⏳ Etapas do Processo
Triagem inicial: Análise do currículo para verificar a adequação às qualificações e requisitos da vaga.
Testes gerais: Avaliação do alinhamento cultural com o teste da Mindsight e teste de raciocínio lógico da Predictive Index.
Entrevista com a equipe de Recrutamento: Discussão sobre as expectativas em relação à vaga e aos objetivos profissionais.
Entrevista com a liderança: Uma conversa para discutir sua visão e como você pode contribuir para a equipe e a empresa.
Entrevista com colegas de trabalho: Interação com futuros pares para avaliar a sinergia e o trabalho em equipe.
Oferta: Apresentação da proposta de trabalho, incluindo detalhes sobre remuneração e benefícios.