Job Closed
This listing is no longer active.
Tecnologia de Sistemas
SRE – Site Reliability Engineering, Pleno
Location
Brazil
Posted
88 days ago
Salary
0
Seniority
Senior
Job Description
SRE – Site Reliability Engineering, Pleno
Develcode
• Implementar e manter infraestrutura como código utilizando Terraform, seguindo padrões e boas práticas já estabelecidos pelo time. • Operar e dar manutenção em clusters Kubernetes, utilizando Helm e práticas de GitOps para suporte à entrega contínua de aplicações. • Atuar na operação do dia a dia de ambientes AWS, contribuindo para a disponibilidade e estabilidade das plataformas. • Apoiar o diagnóstico de problemas de rede em cloud providers, atuando em conjunto com membros mais sêniores do time em cenários mais complexos. • Manter pipelines de CI/CD com GitLab, colaborando com times de desenvolvimento e dados. • Acompanhar e utilizar ferramentas de monitoramento e observabilidade (Prometheus, Grafana, Datadog) para identificar anomalias e apoiar a resposta a incidentes. • Participar de processos de resposta a incidentes e post-mortems, contribuindo com análises e implementação de melhorias. • Apoiar iniciativas de FinOps, auxiliando na identificação de oportunidades de otimização de custos na nuvem.
Job Requirements
- Experiência prática com Terraform para gerenciamento de infraestrutura como código.
- Conhecimento sólido em AWS.
- Conhecimento intermediário em Kubernetes, incluindo uso de Helm e fluxos GitOps.
- Conhecimento intermediário em GitLab (pipelines, CI/CD, repositórios).
- Capacidade de diagnóstico em redes em ambientes cloud (VPC, security groups, DNS, load balancers, etc.).
- Bom domínio de Linux e administração de sistemas.
- Familiaridade com ferramentas de observabilidade: Prometheus, Grafana e Datadog.
Benefits
- Alimentação/Refeição – com liberdade de escolha, no cartão Swile.
- Plano de Saúde Unimed Nacional ou Incentivo Saúde – porque sua saúde vem em primeiro lugar
- Auxílio Home Office – equipamento de trabalho disponibilizado pela empresa + benefício financeiro
- Auxílio Creche – apoio para quem tem filhos pequenos
- Inglês In Company – desenvolva seu idioma sem sair da empresa
- Benefício Educação – plataformas de cursos, benefício financeiro e incentivo a certificações: aprendizado contínuo para sua carreira
- TotalPass – acesso a academias e bem-estar físico
- Programa de saúde mental – apoio psicológico e acesso a plataforma Vittude
- Swile Shop – descontos exclusivos em produtos e serviços
- Day off de aniversário – aproveite o seu dia como quiser!
- Convênio com SESC – uma vasta gama de benefícios voltados a cultura, esportes, lazer, saúde e educação
- Benefícios Flexíveis – escolha o que faz sentido para você!
Related Guides
Related Categories
Related Job Pages
More DevOps Engineer Jobs
• Design and implement scalable, reliable, and fault-tolerant systems across cloud environments. • Develop and maintain observability tools, including monitoring, logging, and alerting (e.g., Prometheus, Grafana, Datadog, ELK). • Automate infrastructure provisioning, deployment, and incident response using Infrastructure as Code (IaC) tools like Terraform or CloudFormation. • Optimize system performance, scalability, and incident response workflows to improve uptime. • Work closely with development and DevOps teams to improve system design for reliability. • Conduct root cause analysis (RCA) and implement preventative measures to minimize failures. • Ensure high availability by designing and maintaining load balancing, failover, and disaster recovery strategies. • Improve CI/CD pipelines to enhance deployment speed while maintaining stability. • Optimize cloud cost and resource utilization for AWS, Azure, or Google Cloud Platform (GCP). • Participate in on-call rotations to quickly address system failures and minimize downtime.
• Design and implement scalable, reliable, and fault-tolerant systems across cloud environments. • Develop and maintain observability tools, including monitoring, logging, and alerting (e.g., Prometheus, Grafana, Datadog, ELK). • Automate infrastructure provisioning, deployment, and incident response using Infrastructure as Code (IaC) tools like Terraform or CloudFormation. • Optimize system performance, scalability, and incident response workflows to improve uptime. • Work closely with development and DevOps teams to improve system design for reliability. • Conduct root cause analysis (RCA) and implement preventative measures to minimize failures. • Ensure high availability by designing and maintaining load balancing, failover, and disaster recovery strategies. • Improve CI/CD pipelines to enhance deployment speed while maintaining stability. • Optimize cloud cost and resource utilization for AWS, Azure, or Google Cloud Platform (GCP). • Participate in on-call rotations to quickly address system failures and minimize downtime.
• Manage and optimize release pipelines to ensure smooth deployment of software updates. • Define and maintain versioning strategies, ensuring consistency across multiple environments. • Coordinate with engineering, QA, and DevOps teams to ensure timely and stable releases. • Automate and improve build, release, and deployment processes for efficiency and reliability. • Monitor and troubleshoot release-related issues, ensuring minimal downtime. • Maintain documentation for release workflows, rollback plans, and deployment strategies. • Ensure compliance with security, performance, and quality standards in all releases. • Work with CI/CD tools (e.g., Jenkins, GitHub Actions, GitLab CI, CircleCI) to manage automated releases. • Implement and maintain feature flagging strategies to enable controlled rollouts. • Analyze release performance and drive continuous improvements in deployment processes.
• Design, implement, and maintain CI/CD pipelines to automate build, test, and deployment processes. • Manage and optimize cloud infrastructure on AWS, Azure, or Google Cloud Platform (GCP). • Implement Infrastructure as Code (IaC) using tools like Terraform, CloudFormation, or Pulumi. • Deploy and manage containerized applications using Docker and Kubernetes. • Monitor system performance, identify bottlenecks, and improve infrastructure reliability. • Establish and enforce security best practices, including identity management, logging, and vulnerability management. • Work with development teams to improve deployment efficiency and troubleshoot infrastructure issues. • Optimize cloud resource utilization to ensure cost-effectiveness and scalability. • Automate infrastructure provisioning, configuration management, and system maintenance. • Stay up-to-date with emerging DevOps technologies, tools, and best practices.

