Site Reliability Engineer (SRE) - Network Focus |AWS Remote Work Full-time employee

USA (Remote)

Salary Not AvailableSenior LevelFull time

Posted 2 months ago

Top 1% of applicants do these two things.

The other 99% submit and hope. You're about to do something different.

Job Summary

Own end-to-end reliability and performance of distributed system connectivity, combining network visibility, incident response, and scalable infrastructure while advancing observability, automation, and secure, cloud-native operations.

  • Turn complex network and service interactions into reliable, low-latency connectivity with proactive monitoring, incident response, and performance tuning across cloud and on-premises environments.
  • Build and evolve scalable pipelines, tooling, and runbooks (SRE culture, CI/CD, security/Governance) to reduce toil and enable rapid recovery and continuous improvement.

Job Description

Responsibilities

  • Garantir a confiabilidade, performance e disponibilidade da conectividade entre sistemas, atuando na operação, diagnóstico e evolução de redes em ambientes distribuídos, híbridos e cloud, com foco em análise de tráfego, troubleshooting avançado e arquitetura de comunicação entre serviços.
  • Gestão Estratégica De Ambientes AWS
  • Operar e evoluir ambientes complexos e replicáveis com alta disponibilidade, performance e escalabilidade horizontal, utilizando serviços como EC2, ECS, Lambda, RDS e S3.
  • Confiabilidade e Observabilidade
  • Definir, implementar e evoluir práticas de observabilidade de ponta a ponta (SLIs, SLOs, SLAs) com ferramentas como New Relic, CloudWatch e dashboards customizados;
  • Atuar proativamente na identificação de gargalos e incidentes.
  • Conectividade e Performance De Rede
  • Diagnosticar e resolver problemas de latência, packet loss e throughput em ambientes distribuídos;
  • Atuar em troubleshooting de DNS, VPN, firewalls e balanceadores de carga (L4/L7);
  • Analisar fluxos de comunicação entre serviços (cloud, on-premise e integrações externas);
  • Apoiar definição e evolução da arquitetura de conectividade entre sistemas.
  • Automação e CI/CD
  • Projetar, manter e otimizar pipelines robustos e seguros (Jenkins, Bitbucket, GitOps) para entregas contínuas de microserviços e workloads serverless.
  • Cultura De SRE e Melhoria Contínua
  • Promover post-mortems blameless, chaos engineering e automação de tarefas operacionais para reduzir toil e elevar a eficiência do time.
  • Segurança e Governança (DevSecOps)
  • Integrar boas práticas de IAM, redes seguras, criptografia, controle de tráfego, monitoramento de vulnerabilidades e conformidade ao ciclo de vida das aplicações, incluindo troubleshooting de conectividade e análise de comunicação entre serviços.
  • Documentação e Compartilhamento De Conhecimento
  • Criar e manter documentação clara sobre arquitetura, automações, incidentes e runbooks, impulsionando autonomia e onboarding.

Requirements

  • Experiência com redes em ambientes corporativos ou distribuídos
  • Atuação prática em troubleshooting de rede em ambientes de produção
  • Experiência com análise de tráfego, identificação de gargalos e resolução de incidentes críticos
  • Conhecimento avançado em protocolos de rede (TCP/IP, DNS, BGP, OSPF, NAT)
  • Experiência com VPNs, firewalls, load balancers e segmentação de rede
  • Experiência com redes em cloud (AWS VPC, subnets, routing tables, NAT Gateway, etc.)
  • Vivência com ambientes híbridos (integração cloud + on-premise)

Preferred

  • Experiência com CDN e edge (Cloudflare, Akamai etc.)
  • Experiência com Direct Connect ou soluções equivalentes
  • Conhecimento em automação de rede (Infraestrutura como Código, scripts)
  • Experiência com ferramentas de observabilidade de rede
  • Noções de SRE (SLI/SLO, disponibilidade, resiliência)
  • Competências Comportamentais - Proatividade, iniciativa e senso de dono.
  • Comunicação clara com diferentes stakeholders e colaboração multifuncional.
  • Orientação a resultados e melhoria contínua.
  • Cultura blameless, capacidade de priorização e tomada de decisão em incidentes.
  • Certificações Desejáveis - AWS Certified Advanced Networking

Benefits

  • Vale Refeição/Vale Alimentação
  • Assistência médica
  • Assistência odontológica
  • Day Off
  • Gympass/ Totalpass
  • Auxílio Creche
  • Assistência Pet
  • Auxílio Combustível
  • Auxílio Home Office
  • Reembolso Educacional
Gauge logo

Gauge

Criamos experiências novas, consistentes e verdadeiras que reinventam a relação das pessoas com o mundo, com marcas e com outras pessoas.Nosso ponto de partida é o usuário. E o que nos permite explorar ao máximo as possibilidades de entrega é a combinação de diferentes especialidades: estratégia digital, planejamento de marca, pesquisa, arquitetura de informação, design de interação, desenvolvimento de interface, tecnologia e mensuração.

Founded in 2009
São Paulo, São Paulo, BRA
284 employees (55 in marketing)

Traffic Signals

Monthly Visitors
1.8B
Traffic Source Mix
Search
29.7%
Direct
66.9%
Referral
2.8%
Social
0.2%
Paid
0.2%

Headcount Trend

Current headcount: ~284

Marketing Team

Marketing Team Size
19 (7% of company)