Site Reliability Engineer (SRE) - Network Focus |AWS Remote Work Full-time employee

USA (Remote)

Salary Not AvailableSenior LevelFull time

Posted 2 months ago

Top 1% of applicants do these two things.

The other 99% submit and hope. You're about to do something different.

Job Summary

Own end-to-end reliability and performance of distributed system connectivity, combining network visibility, incident response, and scalable infrastructure while advancing observability, automation, and secure, cloud-native operations.

  • Turn complex network and service interactions into reliable, low-latency connectivity with proactive monitoring, incident response, and performance tuning across cloud and on-premises environments.
  • Build and evolve scalable pipelines, tooling, and runbooks (SRE culture, CI/CD, security/Governance) to reduce toil and enable rapid recovery and continuous improvement.

Job Description

Responsibilities

  • Garantir a confiabilidade, performance e disponibilidade da conectividade entre sistemas, atuando na operação, diagnĂłstico e evolução de redes em ambientes distribuĂ­dos, hĂ­bridos e cloud, com foco em análise de tráfego, troubleshooting avançado e arquitetura de comunicação entre serviços.
  • GestĂŁo EstratĂ©gica De Ambientes AWS
  • Operar e evoluir ambientes complexos e replicáveis com alta disponibilidade, performance e escalabilidade horizontal, utilizando serviços como EC2, ECS, Lambda, RDS e S3.
  • Confiabilidade e Observabilidade
  • Definir, implementar e evoluir práticas de observabilidade de ponta a ponta (SLIs, SLOs, SLAs) com ferramentas como New Relic, CloudWatch e dashboards customizados;
  • Atuar proativamente na identificação de gargalos e incidentes.
  • Conectividade e Performance De Rede
  • Diagnosticar e resolver problemas de latĂŞncia, packet loss e throughput em ambientes distribuĂ­dos;
  • Atuar em troubleshooting de DNS, VPN, firewalls e balanceadores de carga (L4/L7);
  • Analisar fluxos de comunicação entre serviços (cloud, on-premise e integrações externas);
  • Apoiar definição e evolução da arquitetura de conectividade entre sistemas.
  • Automação e CI/CD
  • Projetar, manter e otimizar pipelines robustos e seguros (Jenkins, Bitbucket, GitOps) para entregas contĂ­nuas de microserviços e workloads serverless.
  • Cultura De SRE e Melhoria ContĂ­nua
  • Promover post-mortems blameless, chaos engineering e automação de tarefas operacionais para reduzir toil e elevar a eficiĂŞncia do time.
  • Segurança e Governança (DevSecOps)
  • Integrar boas práticas de IAM, redes seguras, criptografia, controle de tráfego, monitoramento de vulnerabilidades e conformidade ao ciclo de vida das aplicações, incluindo troubleshooting de conectividade e análise de comunicação entre serviços.
  • Documentação e Compartilhamento De Conhecimento
  • Criar e manter documentação clara sobre arquitetura, automações, incidentes e runbooks, impulsionando autonomia e onboarding.

Requirements

  • ExperiĂŞncia com redes em ambientes corporativos ou distribuĂ­dos
  • Atuação prática em troubleshooting de rede em ambientes de produção
  • ExperiĂŞncia com análise de tráfego, identificação de gargalos e resolução de incidentes crĂ­ticos
  • Conhecimento avançado em protocolos de rede (TCP/IP, DNS, BGP, OSPF, NAT)
  • ExperiĂŞncia com VPNs, firewalls, load balancers e segmentação de rede
  • ExperiĂŞncia com redes em cloud (AWS VPC, subnets, routing tables, NAT Gateway, etc.)
  • VivĂŞncia com ambientes hĂ­bridos (integração cloud + on-premise)

Preferred

  • ExperiĂŞncia com CDN e edge (Cloudflare, Akamai etc.)
  • ExperiĂŞncia com Direct Connect ou soluções equivalentes
  • Conhecimento em automação de rede (Infraestrutura como CĂłdigo, scripts)
  • ExperiĂŞncia com ferramentas de observabilidade de rede
  • Noções de SRE (SLI/SLO, disponibilidade, resiliĂŞncia)
  • CompetĂŞncias Comportamentais - Proatividade, iniciativa e senso de dono.
  • Comunicação clara com diferentes stakeholders e colaboração multifuncional.
  • Orientação a resultados e melhoria contĂ­nua.
  • Cultura blameless, capacidade de priorização e tomada de decisĂŁo em incidentes.
  • Certificações Desejáveis - AWS Certified Advanced Networking

Benefits

  • Vale Refeição/Vale Alimentação
  • AssistĂŞncia mĂ©dica
  • AssistĂŞncia odontolĂłgica
  • Day Off
  • Gympass/ Totalpass
  • AuxĂ­lio Creche
  • AssistĂŞncia Pet
  • AuxĂ­lio CombustĂ­vel
  • AuxĂ­lio Home Office
  • Reembolso Educacional
Gauge logo

Gauge

Criamos experiências novas, consistentes e verdadeiras que reinventam a relação das pessoas com o mundo, com marcas e com outras pessoas.Nosso ponto de partida é o usuário. E o que nos permite explorar ao máximo as possibilidades de entrega é a combinação de diferentes especialidades: estratégia digital, planejamento de marca, pesquisa, arquitetura de informação, design de interação, desenvolvimento de interface, tecnologia e mensuração.

Founded in 2009
SĂŁo Paulo, SĂŁo Paulo, BRA
284 employees (55 in marketing)

Traffic Signals

Monthly Visitors
1.8B
Traffic Source Mix
Search
29.7%
Direct
66.9%
Referral
2.8%
Social
0.2%
Paid
0.2%

Headcount Trend

Current headcount: ~284

Marketing Team

Marketing Team Size
19 (7% of company)