Site Reliability Engineering Architect
OracleAbout the role
Oracle Cloud Infrastructure is designing, standardizing, and operating mission-critical data center electrical infrastructure at extraordinary scale. We are hiring a Reliability & Quality Engineering leader to strengthen the design quality, system reliability, and availability of large-scale data center electrical distribution architectures.
Early in the role, the priority will be evaluating the full data center electrical distribution system, identifying potential failure points, assessing how those risks could impact availability, and developing system-level resiliency concepts such as failure isolation, fault containment, and blast radius reduction. This role requires someone who can look beyond component-level reliability and understand how the overall electrical architecture behaves under credible failure scenarios.
The ideal candidate will bring deep reliability and quality engineering capability across mission-critical power infrastructure, electrical equipment, or standardized data center design products. This person will partner closely with design engineering, construction, commissioning, operations, equipment suppliers, and executive stakeholders to convert reliability analysis into durable design standards, product improvements, risk mitigations, and measurable availability outcomes.
What you’ll do
Evaluate end-to-end data center electrical distribution architectures, including utility or behind-the-meter interfaces, substations, medium-voltage distribution, switchgear, UPS systems, generators, BESS where applicable, protection systems, controls, and downstream power delivery.
Identify design-level failure points, single points of failure, common-mode risks, hidden dependencies, protection coordination concerns, and failure modes that could materially impact availability.
Assess how electrical systems perform under credible failure scenarios, including equipment faults, transfer events, protection operations, control-system failures, degraded-mode operation, maintenance conditions, and abnormal grid or generation events.
Develop system-level resiliency concepts and design recommendations that improve fault isolation, recoverability, maintainability, failure containment, and blast radius reduction.
Partner with electrical design engineering, commissioning, operations, construction, supply chain, and equipment vendors to translate reliability findings into design standards, product requirements, test expectations, acceptance criteria, and corrective action plans.
Apply quality and reliability engineering methods such as FMEA, fault-tree analysis, reliability block diagrams, root-cause analysis, design-for-reliability reviews, lessons-learned integration, and field-performance trend analysis.
Evaluate product quality and reliability across power infrastructure, electrical equipment, standardized electrical products, and repeatable data center design platforms.
Apply for this role
Generate a tailored application kit with a matched cover letter, interview prep, and CV highlights — in under 60 seconds.
Apply Now →Generate Application KitFree account required — sign up in 30s