Job description for AI Infrastructure Hardware Support Engineer (L1, L2, L3) at PIZI
Role Purpose:
Memberikan dukungan teknis dan penanganan masalah (troubleshooting) perangkat keras (hardware) secara langsung (hands-on) untuk infrastruktur AI dan HPC berbasis NVIDIA, termasuk platform A100, H100, B200, B300, GB200, dan GB300.
Tanggung Jawab Utama:
- Mendiagnosis dan menyelesaikan gangguan/kerusakan hardware pada server GPU dan cluster AI.
- Melakukan troubleshooting komponen GPU, CPU, memori, system board, NVLink/NVSwitch, NIC, DPU, penyimpanan (storage), serta komponen daya (power) dan pendingin (cooling).
- Menganalisis log BMC, error NVIDIA Xid/ECC, dan telemetri hardware menggunakan utilitas diagnosis seperti NVIDIA SMI, DCGM, IPMI, dan tools bawaan OEM.
- Melakukan troubleshooting pada jaringan InfiniBand, Ethernet, RoCE, kabel, dan transceiver.
- Melakukan pemeriksaan kesehatan hardware (health check), penggantian komponen, uji ketahanan (burn-in testing), serta validasi pasca-perbaikan.
- Menyelesaikan masalah kompatibilitas BIOS, firmware, BMC, driver, dan hardware; serta mengoordinasikan penggantian unit maupun eskalasi teknis ke pihak OEM dan NVIDIA.
- Mengelola catatan insiden, runbook panduan penanganan masalah, dan laporan analisis akar masalah (root-cause report).
- Berpartisipasi dalam jadwal kerja sistem shift atau dukungan siaga (on-call) sesuai kebutuhan.
Persyaratan Skill & Pengalaman:
- Kemampuan mendalam dalam penanganan masalah (troubleshooting) server enterprise dan komponennya.
- Pemahaman yang baik mengenai arsitektur GPU NVIDIA dan sistem multi-GPU.
- Pengalaman praktis (working knowledge) dalam pengoperasian Linux, tools manajemen server, dan log hardware.
- Memahami konsep jaringan kecepatan tinggi (high-speed networking), storage, sistem daya rak (rack power), dan sistem pendingin.
- Pengalaman minimal 3 tahun di bidang hardware support untuk Data Center, server, atau HPC. Pengalaman pada infrastruktur GPU/AI sangat diutamakan.
- Memiliki kemampuan analisis isolasi kerusakan (fault-isolation), dokumentasi, dan manajemen insiden yang kuat.
Penjenjangan Tingkat Kerjaan (Level Positioning):
L1: Melakukan pemeriksaan kesehatan hardware rutin, isolasi kerusakan tingkat dasar, penggantian komponen standar, serta penanganan dan eskalasi insiden.
L2: Penanganan masalah hardware tingkat lanjut, analisis log/error, penanganan isu firmware/BMC/driver, troubleshooting konektivitas jaringan, dan koordinasi dengan OEM.
L3: Penanganan masalah kompleks pada GPU/server, NVLink/NVSwitch, isu kompatibilitas hardware, dan masalah infrastruktur berulang, termasuk eskalasi teknis langsung ke pihak NVIDIA/OEM.

