Pachet Salarial
14.000 RON – 18.000 RON net
Net lunar, negociabil în funcție de experiență.
Beneficii
- Asigurare medicală privată
- Beneficii de wellness/abonament sală
- Concediu flexibil
- Program de lucru flexibil
- Finanțare pentru dezvoltare profesională formală și informală
Detalii Rol
Departament
Inginerie software
Program
Full-time
Mod de lucru
Hibrid
Descrierea Jobului
În timpul orelor de lucru, veți fi responsabil de gestionarea incidentelor active: răspunsul la alerte, coordonarea răspunsului între echipele de inginerie, diagnosticarea problemelor de producție, restabilirea rapidă a serviciilor și comunicarea clară până la rezolvare. Răspunsul la incidente și pregătirea operațională sunt esențiale pentru acest rol, nu responsabilități ocazionale. Acesta este un rol de senior individual contributor și lider de echipă, responsabil cu stabilirea standardelor SRE, mentoratul altor SRE pe măsură ce funcția crește, deblocarea echipelor de inginerie și îmbunătățirea sistemelor, pipeline-urilor și practicilor care mențin produsele Yes Energy fiabile la scară.
Responsabilități
- Răspundeți la alertele din toate liniile de produs și conduceți răspunsul la incidente, de la detectarea inițială până la atenuare și recuperare, conducând în același timp remedierea cauzelor fundamentale pentru a reduce incidentele repetate, a preveni alertele similare viitoare și a îmbunătăți fiabilitatea generală a serviciilor.
- Acționați ca proprietar al incidentului atunci când sunteți online, coordonând respondenții interfuncționali și luând decizii clare sub presiune pentru a restabili rapid serviciile.
- Construiți și îmbunătățiți monitorizarea, alertarea, tablourile de bord, obiectivele de nivel de serviciu (SLO), manualele de operare și procesele de escaladare, astfel încât problemele să fie detectate rapid, iar respondenții să aibă context util.
- Operați și depanați sisteme Linux și Windows în medii AWS, Azure, OCI și hibride sau multi-cloud conexe.
- Susțineți aplicațiile web de producție, containerele și sarcinile de lucru Kubernetes, cu accent pe fiabilitate, scalabilitate și disponibilitate.
- Lucrați cu echilibratoare de sarcină, proxy-uri directe și inverse, DNS, rețele, firewall-uri, grupuri de securitate și modele de direcționare a traficului pentru a diagnostica și rezolva problemele de disponibilitate și performanță.
- Deblocați echipele de inginerie prin diagnosticarea și remedierea joburilor Jenkins, pipeline-urilor CI/CD, eșecurilor de implementare, problemelor de mediu și blocajelor de lansare.
- Colaborați cu echipele de Inginerie, Securitate, DBA și Product Technology Services pentru a îmbunătăți pregătirea operațională, modelele de suport pentru producție și practicile de fiabilitate.
- Mentorați membrii echipelor SRE și Systems, stabiliți standarde practice și contribuiți la dezvoltarea unei funcții de fiabilitate mai puternice.
Cerințe
- Diplomă de licență sau master în Informatică, Tehnologia Informației sau un domeniu conex; sau experiență practică echivalentă.
- Minim cinci ani de experiență în suportul infrastructurii critice de producție, platforme SaaS, aplicații web sau sisteme orientate pe servicii.
- Experiență profundă practică cu AWS, incluzând operațiuni de producție pentru calcul, rețelistică, IAM, stocare, echilibrare a sarcinii, monitorizare și depanare; experiența mai aprofundată este foarte apreciată.
- Experiență dovedită în managementul incidentelor, inclusiv răspunsul la alerte, conducerea incidentelor de mare severitate, coordonarea respondenților, redactarea rapoartelor post-mortem și RCA și implementarea acțiunilor corective.
- Experiență cu containere și Kubernetes, sisteme de monitorizare și alertare, unelte CI/CD precum Jenkins și Bitbucket, și automatizare operațională sau scripting.
- Comunicator și colaborator puternic, capabil să ofere leadership tehnic, să delegate eficient, să mentoreze ingineri și să deblocheze echipe în timpul lucrărilor operaționale sub presiune.
- Cunoștințe practice de scripting și automatizare cu unelte precum Python, PowerShell, Bash, Terraform, CloudFormation, Azure CLI sau AWS CLI.
- Experiență solidă în administrarea și depanarea sistemelor Linux și Windows în medii de producție.
Nice to have
- Rezolvarea problemelor: structurează și rezolvă probleme complexe și ambigue de producție; identifică moduri de defectare transversale sau sistemice.
- Gândirea sistemică: adoptă o viziune largă și holistică asupra modului în care software-ul, infrastructura și fluxurile de date în timp real interacționează.
- Proiectarea și întreținerea sistemelor: abilitate expertă de a construi și susține infrastructură scalabilă, aplicând standarde stricte de fiabilitate.
- Securitate și conformitate: asigură că configurațiile sistemului respectă controale de acces robuste, criptare și politici de conformitate a datelor.
- Comunicare eficientă: traduce detaliile incidentelor de mare presiune în actualizări clare, calme și acționabile pentru părțile interesate.
- Prioritizare și gestionarea timpului: echilibrează răspunsul rapid la incidente de urgență cu proiecte strategice de fiabilitate pe termen lung.
- Orientare spre echipă: promovează un mediu incluziv bazat pe o cultură a rapoartelor post-mortem fără vină și pe partajarea colaborativă a cunoștințelor.
Competențe
Despre Yes Energy
Angajator VerificatJoburi similare
Vezi toateInginer de Fiabilitate a Site-urilor
14.000 RON – 18.000 RON net