SENIOR SITE RELIABILITY ENGINEER (AZURE, MONITORING & OBSERVABILITY)
Itlt
Contractsenior
Job description
W ITLT pomagamy naszym zaprzyjaźnionym firmom przekształcać ambitne pomysły w cyfrową rzeczywistość. Z nastawieniem na wyzwania, ciekawość technologii i zwinność współtworzymy wyjątkowe rozwiązania IT i zapewniamy doświadczone osoby eksperckie, które pomagają przyspieszać cyfrową transformację.
Aktualnie poszukujemy profilu na stanowisko: Senior Site Reliability Engineer (Azure, Monitoring & Observability)
Budujemy niewielki, 2–3-osobowy zespół odpowiedzialny za stworzenie i rozwój platformy Monitoring & Observability (M&O) oraz Data Quality dla całej organizacji.
Jako Senior Site Reliability Engineer będziesz odpowiadać za projektowanie, budowę i rozwój platformy M&O w środowisku Azure i data platform. Twoim zadaniem będzie rozwój monitoringu aplikacji, infrastruktury i danych, proaktywne wykrywanie problemów, alerting, analiza metryk, logów i trace’ów oraz automatyzacja procesów operacyjnych.
Informacje organizacyjne:
• Tryb realizacji usług: 100% zdalnie
• Start: ASAP
• Forma współpracy: kontrakt b2b, zaangażowanie stabilne, długofalowe
• Język angielski: wymagany na poziomie zaawansowanym (C1) - codzienna współpraca w międzynarodowym środowisku
• Sektor: FMCG
Zakres zadań:
• Projektowanie i rozwój platformy Monitoring & Observability dla środowiska Azure/data platform
• Monitoring aplikacji, infrastruktury i Kubernetes/AKS oraz konfiguracja alertingu
• Analiza metryk, logów i trace’ów, troubleshooting oraz root cause analysis
• Budowanie mechanizmów proaktywnego wykrywania problemów i anomalii
• Dbanie o reliability, availability, stability i performance środowisk produkcyjnych
• Automatyzacja procesów operacyjnych oraz rozwój Infrastructure as Code i CI/CD
• Udział w incident management oraz wdrażaniu praktyk Site Reliability Engineering
• Optymalizacja wykorzystania zasobów i kosztów Azure (FinOps)
Oczekiwania:
• Min. 5 lat doświadczenia w obszarze Site Reliability Engineering / DevOps / Cloud Engineering (w tym doświadczenie na stanowisku SRE)
• Bardzo dobra znajomość Microsoft Azure oraz doświadczenie w pracy z infrastrukturą produkcyjną
• Praktyczna znajomość Kubernetes, w szczególności Azure Kubernetes Service (AKS)
• Doświadczenie z Kafka, w szczególności Kafka on AKS
• Bardzo dobra znajomość narzędzi Monitoring & Observability, w szczególności Grafana Enterprise / Grafana Cloud, Prometheus, Loki i Thanos
• Doświadczenie w pracy z metrics, logs & traces, tworzeniu dashboardów oraz konfiguracji alertingu
• Dobra znajomość praktyk SRE, w tym incident management, troubleshooting, root cause analysis oraz performance monitoring i optimization
• Doświadczenie z Infrastructure as Code, w szczególności Terraform
• Praktyczna znajomość CI/CD, w szczególności GitHub Actions i/lub Azure DevOps / ADO Pipelines
• Umiejętność automatyzacji z wykorzystaniem Python i Shell scripting
Mile widziane:
• Znajomość Databricks
• Doświadczenie z Azure SQL Server
• Znajomość Fivetran
• Znajomość Apache Flink
Oferujemy:
• Długofalowa, stabilna współpraca w oparciu o kontrakt B2B
• Szansa na rozwój w dużej strukturze, bezpośredni kontakt z Managerem zespołu
• Współpraca z ekspertami w firmie, w której IT jest dojrzałe i globalne, a metodyki zwinne są respektowane
• Dopłata do karty MultiSport oraz ubezpieczenia
• Sprawny proces rekrutacyjny (wideokonferencja), maksymalnie 2 spotkania online (pierwsze z kimś z zespołu, drugie z Managerem)
Agencja zatrudnienia - nr certyfikatu 14181
Skills
Microsoft AzureKubernetesAzure Kubernetes Service (AKS)KafkaGrafana EnterpriseGrafana CloudPrometheusLokiThanosTerraformGitHub ActionsAzure DevOpsAzure DevOps PipelinesPythonShell scriptingDatabricksAzure SQL ServerFivetranApache Flink