Similar Jobs
See allSite Reliability Engineer
Glia
Canada
AWS
Kubernetes
Python
Staff Site Reliability Engineer
Unknown
US
Kubernetes
Python
Go
Site Reliability Engineer
Runpod
Global
Linux
Python
Go
Site Reliability Engineer
Sporty Group
Europe
Kubernetes
AWS
Terraform
Senior Platform Engineer
WeightWatchers
US
SRE
Observability
AWS
Key Responsibilities:
- Design, build, and maintain software, APIs, integrations, and automation supporting platform reliability and observability.
- Configure dashboards, alerts, application performance monitoring, tracing, metrics, and logging across Kubernetes and microservices environments.
- Drive proactive maintenance and platform improvements focusing on reliability, scalability, and performance.
Must-Have Skills:
- Strong proficiency in Python, JavaScript (Node.js), or Java with hands-on API integration experience.
- Extensive Kubernetes experience covering deployment, operations, and monitoring.
- Hands-on experience with Datadog or comparable observability platforms like Prometheus or Grafana.
Nice-to-Have Skills:
- Experience owning and operating an internal engineering platform with reliability and scalability outcomes.
- Familiarity with Go, New Relic, Dynatrace, Elastic, or Splunk Observability.
- Proactive leadership in maintenance efforts, not just reactive support.
Additional Information:
- Remote contract opportunity requiring APAC location and overlap with Japan Standard Time.
- Full-time allocation of 40 hours per week through March 31, 2027.