Operational Data & Observability Engineer
Nscale · US · United States · On-site
Pay: USD 145,000 – 180,000 a year
Posted Jul 9, 2026
Sign up free: we match you to jobs like this, tailor your application and fill the form. 2 free applications every day.
.
Operational Data & Observability Engineer
About the Role
We're looking for an Operational Data & Observability Engineer to build and evolve the monitoring, logging, and observability capabilities that power our production environments. In this role, you'll help ensure our infrastructure and applications remain reliable, scalable, and performant by providing engineering teams with actionable operational insights.
You'll partner closely with DevOps, Site Reliability Engineering (SRE), platform, and software engineering teams to develop modern observability solutions, improve incident response, and enable data-driven operational excellence.
What You'll Do
Design & Build Observability Solutions
Design and implement enterprise observability strategies across infrastructure, services, and applications.
Develop monitoring dashboards, alerts, and Service Level Objectives (SLOs) that provide meaningful operational visibility.
Build and maintain centralized logging and log analysis pipelines.
Implement distributed tracing to improve visibility across microservices and complex application workflows.
Establish performance baselines and develop anomaly detection strategies.
Operational Data Engineering
Deploy, configure, and maintain metrics, logs, events, and telemetry collection systems.
Design and manage operational data pipelines that support monitoring and analytics.
Develop APIs and integrations that enable operational data consumption across teams.
Ensure data quality, consistency, retention, and cost-efficient storage practices.
Reliability & Operations
Troubleshoot production issues using monitoring, logging, and tracing data.
Participate in an on-call rotation and support incident response activities.
Create and maintain operational documentation, runbooks, and troubleshooting guides.
Partner with engineering teams to improve platform reliability, scalability, and operational readiness.
Continuously optimize observability infrastructure for performance and resilience.
Platform & Tool Administration
Administer and enhance observability platforms such as Datadog, Grafana, Prometheus, ELK Stack, New Relic, or similar technologies.
Evaluate emerging observability tools and recommend improvements.
Automate monitoring deployments, instrumentation, and platform configuration.
Perform ongoing maintenance, upgrades, and lifecycle management of observability infrastructure.
What You'll Bring
Required Qualifications
3+ years of experience in DevOps, Site Reliability Engineering (SRE), Operations Engineering, Platform Engineering, or Observability Engineering.
Hands-on experience with modern monitoring platforms such as Prometheus, Grafana, Datadog, New Relic, or equivalent.
Experience working with centralized logging platforms including ELK/Elastic Stack, Splunk, CloudWatch, or similar solutions.
Proficiency with scripting or programming languages such as Python, Go, Bash, or equivalent.
…