Analista Pleno em Infraestrutura | SRE

Xpinc · São Paulo, SP · Engineering

Posted 2026-10-08

Apply for this role →

🚀 Sobre a Oportunidade

Estamos em busca de um SRE Pleno para fazer parte do time de infraestrutura da XP Inc. — um dos maiores ecossistemas financeiros do país. Se você tem autonomia para operar ambientes críticos de média e alta complexidade, resolve problemas reais em Linux, Kubernetes e mensageria, e quer atuar como referência técnica para o time júnior enquanto conduz projetos de evolução da plataforma, essa vaga é para você. Aqui você vai lidar com troubleshooting de incidentes N2/N3, implementar automações, participar de war rooms e garantir que nossos sistemas continuem rodando com a confiabilidade que o mercado exige.

Saiba mais sobre nosso dia a dia no Instagram e no LinkedIn.

Confira nossas avaliações no Glassdoor.

🔍 O Que Procuramos

Pré-requisitos Essenciais:

Ensino superior completo em Ciência da Computação, Engenharia da Computação ou áreas correlatas

3 a 6 anos de experiência em infraestrutura de TI, SRE, DevOps ou administração de sistemas

Mínimo de 2 anos com Kubernetes em produção (RBAC, networking, storage, HPA, Helm)

Mínimo de 2 anos com Linux (RHEL) em produção (kernel tuning, performance profiling, troubleshooting avançado)

Mínimo de 1 ano com Apache Kafka em produção (tópicos, partições, replicação, consumer groups, Kafka Connect)

Mínimo de 1 ano com RabbitMQ em produção (clusters, mirroring, exchanges, dead letter queues)

Experiência com observabilidade (Grafana, Dynatrace, Loki, ELK Stack)

Automação com Ansible, Python e Shell Script avançado

Troubleshooting avançado de redes TCP/IP (tcpdump, Wireshark, análise de latência)

Experiência com CI/CD (GitLab CI, GitHub Actions ou Jenkins)

Git avançado (branching strategies, code review, GitOps)

Diferenciais:

Terraform (infraestrutura como código)

ArgoCD / Flux (GitOps)

Service Mesh (Istio, Linkerd)

Certificações: CKA, CKAD, RHCE, AWS SA Associate

Experiência com bancos de dados (PostgreSQL, MySQL, SQL Server)

Conhecimento de Vault (Hashicorp) ou CyberArk

Experiência em empresas de missão crítica (bancos, fintechs, telecom)

Já conduziu RCAs de incidentes Severity 1

Conhecimento de Chaos Engineering

Contribuições open source ou palestras em eventos técnicos

🎯 Desafios e Impacto

Garantir disponibilidade 24x7 de sistemas críticos em ambiente auditado (BACEN, CVM, LGPD), com janelas de manutenção restritas e tolerância a falhas próxima de zero

Conduzir troubleshooting de incidentes N2/N3 em ambientes multi-tecnologia (K8s + Kafka + RabbitMQ + redes + storage), atuando como escalation primário em war rooms

Reduzir TOIL através de automação, implementando soluções com Ansible, Python e Shell Script para eliminar tarefas repetitivas e ganhar eficiência operacional

Realizar análises de causa raiz (RCA/Postmortem) para incidentes críticos, garantindo que 100% dos Severity 1 e 2 tenham RCA concluída em até 5 dias úteis

Mentorear SREs juniores, revisando código, fazendo pair troubleshooting e promovendo treinamentos para desenvolver autonomia operacional no time

Participar de projetos de migração e evolução de infraestrutura, equilibrando a velocidade que os times de produto querem com a confiabilidade que a operação exige

⏳ Etapas do Processo

Triagem inicial: Análise do currículo para verificar a adequação às qualificações e requisitos da vaga.

Testes gerais: Avaliação do alinhamento cultural com o teste da Mindsight e teste de raciocínio lógico da Predictive Index.

Entrevista com a equipe de Recrutamento: Discussão sobre as expectativas em relação à vaga e aos objetivos profissionais.

Entrevista com a liderança: Uma conversa para discutir sua visão e como você pode contribuir para a equipe e a empresa.

Entrevista com colegas de trabalho: Interação com futuros pares para avaliar a sinergia e o trabalho em equipe.

Oferta: Apresentação da proposta de trabalho, incluindo detalhes sobre remuneração e benefícios.

Apply for this role →

← Back to all jobs