Job Summary
Senior SRE / Observability Engineer
Role Type: Contractor
Level: Senior / Lead
Primary Focus: Core observability architecture, runtime health, alerting, SLOs, and runbooks
Role Summary
The Senior SRE / Observability Engineer will lead the technical implementation of core observability patterns for AI/ML services and supporting platforms. This role owns runtime health, service health, monitoring standards, alerting patterns, SLO definitions, and operational runbooks, with strong emphasis on Datadog, GCP, GKE/Cloud Run, logs, metrics, traces, SQL, Python, and production operations.
Key Responsibilities
- Define and implement runtime/service health observability patterns
- Establish Datadog monitor, dashboard, tagging, and naming standards
- Build reusable alerting, SLO, and runbook examples
- Implement logs, metrics, and traces patterns across priority services
- Partner with Platform Observability Engineer on Datadog implementation
- Support AI/model and data observability workstreams where production operations patterns are needed
- Document implementation patterns for handoff to ML Ops, AI Ops, Infra, and app teams
Required Skills
- Lead: SRE/observability/monitoring, alerting, SLOs, runbooks, runtime health
- Strong: Datadog, GCP, GKE/Cloud Run, logs, metrics, traces, SQL, Python, Bash
- Working Knowledge: BigQuery, Databricks, AI/ML model performance metrics, data quality concepts
Key Responsibilities
Senior SRE / Observability Engineer
Role Type: Contractor
Level: Senior / Lead
Primary Focus: Core observability architecture, runtime health, alerting, SLOs, and runbooks
Role Summary
The Senior SRE / Observability Engineer will lead the technical implementation of core observability patterns for AI/ML services and supporting platforms. This role owns runtime health, service health, monitoring standards, alerting patterns, SLO definitions, and operational runbooks, with strong emphasis on Datadog, GCP, GKE/Cloud Run, logs, metrics, traces, SQL, Python, and production operations.
Key Responsibilities
- Define and implement runtime/service health observability patterns
- Establish Datadog monitor, dashboard, tagging, and naming standards
- Build reusable alerting, SLO, and runbook examples
- Implement logs, metrics, and traces patterns across priority services
- Partner with Platform Observability Engineer on Datadog implementation
- Support AI/model and data observability workstreams where production operations patterns are needed
- Document implementation patterns for handoff to ML Ops, AI Ops, Infra, and app teams
Required Skills
- Lead: SRE/observability/monitoring, alerting, SLOs, runbooks, runtime health
- Strong: Datadog, GCP, GKE/Cloud Run, logs, metrics, traces, SQL, Python, Bash
- Working Knowledge: BigQuery, Databricks, AI/ML model performance metrics, data quality concepts