Sr. DevOps - HÍBRIDO CDMX
Sr. DevOps
Modalidad: Híbrida (ir 3 días a oficina en Torre MAPFRE, Reforma CDMX)
Responsabilidades Principales:
· Responsable de optimizar y alinear nuestras aplicaciones a los procesos internos de la empresa y de esta manera cumplir con la modernización.
· Liderar las aplicaciones nuevas que se están heredando de otras áreas y que se tienen que alinear a la nueva arquitectura.
· Diseñar un plan de modernización transparente para los usuarios finales.
· Coordinar la solución con el equipo para llevar a cabo la actualización de las tecnologías.
· Asegurar cumplimiento de objetivos.
· Monitorear KPIs y resultados.
Requisitos:
Formación Académica: Ingeniería en sistemas y/o en informática o a fin.
Experiencia:2 años en AWS o cualquier otro tipo de nube, Azure, GCP.
Inglés AVANZADO
Conocimientos Técnicos:
Cloud Products & Services
· Networking & Content Delivery — Diseño y administración de redes en la nube: VPC, subnets, Transit Gateway, Load Balancers (ALB/NLB), Route 53, CloudFront y conectividad híbrida (VPN, Direct Connect).
· CI/CD Pipelines — Construcción y mantenimiento de pipelines de integración y entrega continua con herramientas como CodePipeline, GitHub Actions, GitLab CI, Jenkins o ArgoCD.
· Containerization (Docker) — Creación, optimización y gestión de imágenes de contenedores, multi-stage builds, registries privados y mejores prácticas de seguridad en imágenes.
· Artifact Management — Administración de repositorios de artefactos (ECR, Nexus, JFrog Artifactory, CodeArtifact) para versionado y distribución de paquetes, librerías e imágenes.
· Container Orchestration (Kubernetes/EKS) — Despliegue, escalamiento y operación de clusters de Kubernetes en producción: Helm charts, service mesh, observabilidad, auto-scaling y gestión de recursos.
· NoSQL Databases — Diseño y operación de bases de datos no relacionales como DynamoDB, MongoDB, Redis o ElastiCache: modelado de datos, particionamiento, capacidad y estrategias de respaldo.
Organización de repositorios.
IA:
· Prompt Engineering — Diseño y optimización de prompts para obtener resultados precisos de LLMs aplicados a operaciones, troubleshooting y generación de código de infraestructura.
· AI-Assisted Development — Uso avanzado de herramientas como Amazon Q Developer, GitHub Copilot o Kiro para acelerar creación de IaC, pipelines y scripts de automatización.
· Custom AI Agents & Skills — Creación de agentes personalizados con instrucciones especializadas (system prompts, skills, steering files) que resuelven tareas operativas de forma autónoma.
· AIOps & Anomaly Detection — Implementación de detección inteligente de anomalías en métricas y logs con CloudWatch Amazon DevOps Agent o herramientas similares.
· LLM Integration & Orchestration — Integración de modelos de lenguaje (OpenAI) en flujos operativos: análisis de incidentes, generación de runbooks, remediación automatizada.
· MCP (Model Context Protocol) — Configuración y uso de servidores MCP para conectar agentes de IA con APIs internas, herramientas de infraestructura y fuentes de datos en tiempo real.
· Intelligent Automation Workflows — Diseño de workflows que combinan IA con Step Functions y Lambda para toma de decisiones y remediación autónoma de incidentes.
· RAG (Retrieval-Augmented Generation) — Construcción de sistemas que enriquecen respuestas de LLMs con documentación interna, runbooks y conocimiento operativo específico de la organización.
Version Control & Branching Strategies
· Git — Dominio avanzado de Git: rebasing, cherry-pick, resolución de conflictos, hooks, submodules y gestión de monorepos.
· Branching Strategies (Gitflow / Trunk-Based) — Experiencia implementando y definiendo estrategias de branching como Gitflow, GitHub Flow o Trunk-Based Development según las necesidades del equipo y la cadencia de releases.
· Pull Request Workflows — Diseño de flujos de revisión de código con PRs: políticas de aprobación, checks automatizados (linting, tests, security scans) y merge strategies (squash, rebase, merge commit).
· Release Management — Gestión de versionado semántico (SemVer), tagging, changelogs automatizados y coordinación de releases entre múltiples servicios.
· Repository Management — Administración de repositorios en GitHub/GitLab: protección de ramas, CODEOWNERS, templates de PR/issues y políticas de acceso por equipo.
Herramientas:
Certificaciones Deseables:
· Cloud (cualquier proveedor, al menos una):
· AWS Solutions Architect / DevOps Engineer – Professional
· Azure Solutions Architect Expert / DevOps Engineer Expert
· Google Cloud Professional Cloud Architect / DevOps Engineer
Kubernetes & Containers:
· CKA (Certified Kubernetes Administrator) — Administración, troubleshooting y operación de clusters en cualquier entorno.
· CKAD (Certified Kubernetes Application Developer) — Diseño y despliegue de aplicaciones containerizadas.
· CKS (Certified Kubernetes Security Specialist) — Seguridad en clusters, supply chain y runtime protection.
Infrastructure as Code:
· HashiCorp Terraform Associate / Engineer — Provisión y gestión de infraestructura multi-cloud como código.
· HashiCorp Vault Associate — Gestión de secretos, cifrado y control de acceso en entornos cloud-agnostic.
Competencias técnicas y blandas:
· Infrastructure as Code (IaC) — Capacidad para diseñar, escribir y mantener infraestructura declarativa con Terraform, CloudFormation o Pulumi, aplicando modularidad, reutilización y buenas prácticas de versionado.
· Troubleshooting & Root Cause Analysis — Habilidad para diagnosticar problemas complejos en entornos distribuidos: análisis de logs, trazas, métricas y correlación de eventos para identificar la causa raíz de incidentes.
· Automation Mindset — Mentalidad orientada a eliminar tareas manuales repetitivas mediante scripting (Bash, Python), pipelines y workflows automatizados.
· Security-First Approach — Aplicación de principios de seguridad desde el diseño: least privilege, cifrado en tránsito y reposo, gestión de secretos, hardening y cumplimiento normativo (PCI DSS, SOC2).
· System Design & Architecture — Capacidad para diseñar arquitecturas resilientes, escalables y costo-eficientes: alta disponibilidad, disaster recovery, multi-región y patrones cloud-native.
· Observability & Monitoring — Implementación de estrategias de observabilidad completas: métricas, logs, trazas distribuidas, dashboards y alertas accionables.
· Performance Optimization — Identificación de cuellos de botella y optimización de recursos: right-sizing, caching strategies, auto-scaling y análisis de costos.
· Ownership & Accountability — Sentido de responsabilidad sobre los sistemas que administra; no espera a que le asignen un problema, lo detecta y lo resuelve.
· Comunicación técnica efectiva — Capacidad para explicar problemas complejos de forma clara a audiencias técnicas y no técnicas: post-mortems, documentación y presentaciones a stakeholders.
· Colaboración cross-funcional — Trabajo efectivo con equipos de desarrollo, seguridad, QA y producto para alinear objetivos y entregar soluciones de forma ágil.
· Mentoría y liderazgo técnico — Disposición para guiar a ingenieros junior, compartir conocimiento, establecer estándares y elevar la madurez técnica del equipo.
· Gestión de incidentes bajo presión — Capacidad para mantener la calma, priorizar acciones y comunicar estatus durante incidentes de alta severidad en producción.
· Pensamiento crítico y toma de decisiones — Evaluación objetiva de trade-offs técnicos (costo vs performance, velocidad vs seguridad) para tomar decisiones informadas.
· Adaptabilidad y aprendizaje continuo — Capacidad para adoptar nuevas tecnologías, herramientas y metodologías rápidamente en un entorno que evoluciona constantemente.
· Documentación y knowledge sharing — Disciplina para documentar procesos, runbooks y decisiones arquitectónicas que faciliten la operación y el onboarding del equipo.