Search by job, company or skills

Senior Manager, Observability Architect

  • Posted 3 hours ago
  • Be among the first 10 applicants

Job Description

Skills:

  • 10+ years relevant experience in Cloud Architecture, Infrastructure, Operations, Observability, or Application Performance Management.
  • 5+ years practical experience designing and governing enterprise observability platforms.
  • Strong hands-on experience with Dynatrace, including APM, infrastructure monitoring, Kubernetes monitoring, dashboards, management zones, service mapping, and Davis AI capabilities.
  • Experience integrating observability platforms with ServiceNow ITOM / Event Management / ITSM processes.
  • Strong experience with logging platforms such as Elastic Stack, OpenSearch, or equivalent enterprise log analytics solutions.
  • Experience with open-source monitoring and visualization platforms such as Prometheus, Grafana, and OpenTelemetry.
  • Hands-on experience with Azure native monitoring services including Azure Monitor, Log Analytics, Application Insights, Network Watcher, Azure Managed Prometheus, and Azure Managed Grafana.
  • Hands-on experience with Alibaba Cloud native monitoring services including CloudMonitor, Log Service (SLS), ActionTrail, ARMS, Managed Service for Prometheus, and related observability services.
  • Strong understanding of Kubernetes, containers, microservices, APIs, network monitoring, distributed tracing, cloud networking, IAM, and security principles.
  • Experience implementing AIOps, event correlation, anomaly detection, automated remediation, and self-healing operations.
  • Experience working in enterprise or regulated environments is highly desirable.
  • Relevant professional certifications such as Dynatrace Associate/Professional, Microsoft Azure Solutions Architect Expert, Alibaba Cloud Professional Architect, CKA, ITIL, SRE Foundation, or TOGAF will be an advantage.
  • Sound understanding of IT partner ecosystem and partner collaboration in a multinational corporation.
  • Experience in top-tier multinational corporation will be an advantage.
  • Strong problem-solving and analytical skills.
  • Excellent communication, stakeholder management, and collaboration skills.
  • Ability to translate complex operational telemetry into actionable service reliability insights.
  • Ability to operationalize disruptive technology services, including building implementation roadmaps for observability, AIOps, and self-healing automation.

Roles and Responsibilities:

Observability Architecture & Design

  • Define and maintain enterprise observability reference architecture, standards, patterns, and governance across Group and Business Units.
  • Design end-to-end observability for infrastructure monitoring, application performance monitoring, distributed tracing, logging, digital experience monitoring, network observability, and service health dashboards.
  • Establish observability KPIs, SLOs, SLIs, error budgets, alerting principles, and service reliability reporting standards.
  • Review solution designs and ensure observability requirements are embedded from architecture and delivery stages.

Dynatrace Platform Architecture

  • Lead architecture and governance of Dynatrace as the enterprise observability platform.
  • Design monitoring standards for applications, Kubernetes, virtual machines, databases, middleware, APIs, network services, and cloud-native services.
  • Define Dynatrace tagging standards, management zones, dashboard patterns, service mapping, synthetic monitoring, real user monitoring, and Davis AI adoption.
  • Drive platform configuration, onboarding patterns, operational dashboards, reporting, and observability data retention standards.

ServiceNow ITOM Integration

  • Architect integration between Dynatrace and ServiceNow ITOM Event Management / ITOM Health capabilities.
  • Design event correlation, alert enrichment, topology-aware service impact analysis, and automated incident creation workflows.
  • Define noise reduction, deduplication, priority mapping, escalation, and operational ownership models.
  • Support integration of observability insights into ITSM processes, command center dashboards, and operational reporting.

AIOps & Auto-Healing Automation

  • Define and implement AIOps operating patterns for anomaly detection, predictive alerting, root cause identification, and closed-loop remediation.
  • Design auto-healing workflows integrated with Dynatrace, ServiceNow ITOM, automation platforms, and cloud-native services.
  • Identify repeatable operational failure patterns and convert them into automated remediation runbooks where appropriate.
  • Drive continuous improvement to reduce manual intervention, alert fatigue, incident recurrence, MTTD, and MTTR.

Logging & Observability Data Platforms

  • Architect centralized logging and log analytics solutions using Elastic, OpenSearch, cloud-native log services, and enterprise logging standards.
  • Define log collection, normalization, enrichment, indexing, retention, access control, and cost governance standards.
  • Establish patterns for correlation across logs, metrics, traces, events, configuration, and service topology.
  • Ensure logging platforms support operational troubleshooting, security visibility, auditability, and compliance requirements.

Open Source Monitoring & Cloud Native Observability

  • Design monitoring and visualization solutions using Prometheus, Grafana, OpenTelemetry, and related open-source monitoring platforms.
  • Define observability patterns for AKS, Alibaba Cloud ACK, containers, microservices, APIs, service mesh, and DevOps pipelines.
  • Establish metrics federation, dashboarding, alerting, and integration approaches with Dynatrace and enterprise platforms.
  • Promote consistent instrumentation and telemetry standards across modern application architectures.

Azure & Alibaba Cloud Native Monitoring

  • Define monitoring standards for Azure platform services including Azure Monitor, Log Analytics, Application Insights, Network Watcher, Azure Managed Prometheus, Azure Managed Grafana, Azure Advisor, and Azure Resource Health.
  • Define monitoring standards for Alibaba Cloud services including CloudMonitor, Log Service (SLS), ActionTrail, ARMS, Managed Service for Prometheus, Security Center, and related observability and alarm services.
  • Ensure cloud-native monitoring capabilities are integrated with enterprise observability, ITOM, incident, and reporting processes.
  • Drive cost-aware telemetry design across Azure and Alibaba Cloud environments.

Security, Governance & Compliance

  • Embed security-by-design, least-privilege access, data protection, and compliance requirements into observability architecture.
  • Support audits, risk assessments, regulatory reviews, and evidence requirements related to monitoring, logging, and service reliability.
  • Define guardrails for observability platform access, retention, data classification, dashboard sharing, and operational reporting.
  • Maintain observability documentation, runbooks, standards, design patterns, and operational controls.

Stakeholder & Technical Leadership

  • Act as the enterprise subject matter expert for observability, monitoring, logging, AIOps, and self-healing automation.
  • Collaborate with Cloud Architecture, Cloud Engineering, Operations, Security, DevOps, Application, Service Management, and Business Unit teams.
  • Mentor engineering and operations teams on observability best practices, platform onboarding, dashboarding, and incident reduction techniques.
  • Drive observability transformation initiatives and promote SRE-aligned operational practices across the organization.

Financial and Non-Financial Measures:

  • Monitor and optimize observability platform cost, telemetry ingestion, data retention, dashboard usage, and cloud-native monitoring spend.
  • Improve monitoring return on investment by rationalizing tools, removing duplication, and improving platform adoption.
  • Reduce operational cost through AIOps, automation, event correlation, and self-healing remediation.
  • Define and report KPIs for service reliability, alert noise reduction, MTTD, MTTR, incident recurrence, platform availability, and automation coverage.
  • Improve end-user experience, application performance visibility, service health transparency, and operational resilience.
  • Ensure observability capabilities support business objectives, regulatory expectations, service quality, and operational risk reduction.
  • Support vendor and partner engagement to maximize platform value, improve supportability, and reduce operational risk.

Communication Requirements Internal/External

Excellent communication skills both in writing and verbal – English essential

Internal:

  • Collaborate with Cloud Architecture, Cloud Engineering, Operations, Security & Compliance, DevOps, Application, and Service Management teams.
  • Engage with Finance, Procurement, IT Governance, and Business Units for cost, policy, platform adoption, and operational alignment.
  • Provide regular updates to senior leadership on observability maturity, service reliability, AIOps adoption, automation coverage, and operational performance.

External:

  • Liaise with Dynatrace, ServiceNow, Microsoft Azure, Alibaba Cloud, Elastic/OpenSearch, and strategic partner technical teams.
  • Coordinate with vendors, managed service providers, and system integrators for solution delivery, platform integration, and operational improvements.
  • Represent the organization in observability, AIOps, cloud operations, and industry best-practice discussions.

More Info

Job Type:
Industry:
Employment Type:

About Company

Job ID: 151790503

Similar Jobs

Malaysia, Kuala Lumpur

Skills:

PrometheusGrafanaDynatraceAIOps automationAzure Managed GrafanaKubernetes AKSLog AnalyticsOpenSearchElasticServiceNow ITOMevent correlationOpenTelemetryAzure Managed PrometheusApplication InsightsAzure Monitorself-healing

Malaysia, Kuala Lumpur

Skills:

PrometheusGrafanaDynatraceActionTrailARMSNetwork WatcherAzure Managed GrafanaLog AnalyticsOpenSearchElastic StackCloudMonitorServiceNow ITOMOpenTelemetryAzure Managed PrometheusSLSAzure MonitorApplication InsightsLog Service

Kuala Lumpur

Skills:

workflow management AWSAzureApiscloud cost optimization techniquesAWS Cost Explorerfinancial reportingmonitoring and reporting toolscloud management platformscapacity forecasting

Malaysia, Kuala Lumpur

Skills:

cloud networkingIamTerraformAnsibleGitHub ActionsSecurityGitHub EnterpriseAlibaba Cloud

Malaysia, Kuala Lumpur

Skills:

JavaReactAerospikeScalaKafkaBig DataJavascriptKotlinMicroservicesC Sharpclean architecture

Beware of Scammers

We don’t charge money for job offers