About . Tata Consultancy Services
London, UK
Job description
Your Responsibilities - Define and implement enterprise observability strategies, standards, and governance frameworks.
- Design and manage observability solutions covering metrics, logs, traces, and application telemetry.
- Establish monitoring, alerting, and diagnostics best practices across cloud-native platforms and microservices.
- Design and implement distributed tracing solutions using OpenTelemetry and modern observability tools.
- Develop and maintain Grafana dashboards for engineering, operations, business, and leadership stakeholders.
- Monitor platform performance, availability, reliability, and service health across Azure services.
- Define Service Level Indicators (SLIs), Service Level Objectives (SLOs), and operational KPIs.
- Collaborate with development, platform engineering, and SRE teams to improve system observability and resilience.
- Drive root cause analysis, incident investigations, and continuous service improvement initiatives.
- Champion operational excellence through proactive monitoring, automation, and reliability engineering practices.
Your Profile Essential Skills/Knowledge/Experience - Strong experience in enterprise observability, monitoring, and operational support.
- Expertise in Grafana dashboard development and observability platform management.
- Hands-on experience with OpenTelemetry, Distributed Tracing, and telemetry frameworks.
- Strong understanding of Site Reliability Engineering (SRE) principles and practices.
- Experience monitoring cloud-native applications, microservices, and distributed systems.
- Knowledge of Azure monitoring services, diagnostics, and observability ecosystems.
- Experience implementing alerting strategies, incident management, and performance monitoring solutions.
- Strong understanding of Event-Driven Architecture and asynchronous application behaviour.
Project Support
Durham, UK
posted 3 weeks ago
Other
Leatherhead, UK
posted 1 month ago
. Tata Consultancy Services
false