ارسل في ١٨ أغسطس ٢٠٢٦
AYRADE recrute un(e) Ingénieur Plateforme Cloud pour concevoir, déployer et exploiter AYRADE CloudOS Ghayma, une plateforme cloud complète intégrant calcul, stockage, réseau, PaaS et gestion multi-locataires.
🎯 Missions principales :
Mission N°01 : Posséder le plan de contrôle Ghayma : amorçage et cycle de vie du cluster, ajout et remplacement de nœuds, mises à niveau, quorum et reprise après sinistre
Mission N°02 : Posséder le calcul : orchestration de conteneurs (Kubernetes) et machines virtuelles (KubeVirt/libvirt), ordonnancement, migration à chaud et isolation des ressources
Mission N°03 : Posséder le stockage : stockage bloc et objet distribué (Ceph, Longhorn ou équivalent), politique de réplication, points de terminaison compatibles S3, instantanés et sauvegarde
Mission N°04 : Posséder le réseau : CNI, réseau overlay et underlay, répartition de charge (MetalLB ou BGP), entrée (Traefik), DNS, automatisation TLS et isolation réseau par locataire
Mission N°05 : Posséder la couche PaaS et la multi-location : déploiement applicatif depuis Git, buildpacks/Nixpacks, bases de données managées, identité, projets, quotas, RBAC, métrologie et garanties d'isolation
Mission N°06 : Posséder les opérations de deuxième jour et l'architecture matérielle de référence : supervision, alerte, capacité, chemins de mise à niveau sans reconstruction, configuration minimale à trois nœuds et topologie de croissance
Bac+5 — Ingénieur d’État ou Master en Informatique, Systèmes distribués, Réseaux ou équivalent.
5 à 8 ans d’expérience dans la conception, le déploiement ou l’exploitation de clouds privés sur infrastructure physique.
\
Compétences requises pour le poste :
- Kubernetes en profondeur : composants du plan de contrôle, etcd, CRD et opérateurs, ordonnancement, interfaces réseau et stockage (CNI/CSI)
- Construction ou exploitation de clouds sur infrastructure physique — avoir installé la plateforme, pas seulement l'avoir consommée
- Stockage distribué en production (Ceph, Longhorn ou équivalent), y compris une récupération après incident réelle
- Virtualisation : KVM/QEMU, libvirt, KubeVirt, SR-IOV, passage de périphériques, migration à chaud
- Go, ainsi qu'une automatisation d'infrastructure solide (Terraform, Ansible, Cluster API)
- Jugement en systèmes distribués : consensus, partition de cluster, défaillance partielle, compromis CAP assumés
- Couche PaaS : déploiement depuis Git, buildpacks/Nixpacks, bases de données managées (PostgreSQL, MySQL/MariaDB, MongoDB, Redis) avec sauvegarde, haute disponibilité et mise à niveau
Qualités Humaines et aptitudes
- Sang-froid opérationnel et sens de la fiabilité
- Honnêteté technique sur les limites et les compromis
- Capacité à simplifier une plateforme complexe pour le client
- Autonomie et rigueur documentaire