Описание должности
Должность: Старший инженер облачной инфраструктуры и SRE
Как старший инженер облачной инфраструктуры и SRE, вы будете играть ключевую роль в обеспечении стабильности и надежности наших основных торговых систем. Эта должность требует проактивного подхода к управлению производственными средами, оптимизации облачной инфраструктуры и внедрению лучших практик для наблюдаемости и автоматизации.
Ключевые обязанности
- Обеспечение круглосуточной стабильности работы основных торговых сервисов, включая торговые системы, сервисы рыночных данных и связанную инфраструктуру. Участие в реагировании на крупные инциденты, устранении неполадок, снижении рисков, восстановлении сервисов и посмертном анализе для гарантии непрерывности торговли и безопасности активов пользователей.
- Проектирование, внедрение и постоянная оптимизация производственной инфраструктуры AWS и EKS/Kubernetes, включая облачную архитектуру, сетевые решения, высокую доступность, планирование мощности и аварийное восстановление. Управление обновлениями кластеров Kubernetes, жизненным циклом узлов, планированием, управлением ресурсами, Ingress/балансировкой нагрузки, DNS, хранением данных и автоматическим масштабированием.
- Разработка и улучшение систем наблюдаемости и стабильности производства (Metrics, Logs, Tracing, Alerting, SLI/SLO, Incident Response, Postmortem) для повышения эффективности обнаружения, диагностики и устранения проблем. Сотрудничество с командами разработки для решения узких мест системы, единых точек отказа и долгосрочных проблем архитектурной стабильности.
- Продвижение инициатив Infrastructure as Code (IaC), CI/CD и автоматизации (Terraform/Terragrunt, GitHub Actions, Ansible) для стандартизации и автоматизации инфраструктуры и доставки приложений. Внедрение надежных процессов управления изменениями, включая механизмы проверки, развертывания, верификации и отката для минимизации производственных рисков.
- Управление производственной эксплуатацией основных сервисов данных и middleware, включая MySQL, Redis и Kafka, обеспечивая высокую доступность, мониторинг, планирование мощности, резервное копирование/восстановление, оптимизацию производительности и устранение инцидентов.
- Руководство вопросами безопасности AWS, Kubernetes и производственной среды, внедрение принципа минимальных привилегий (IAM/RBAC), сегментации сети, безопасности контейнеров/образов, управления секретами (Secrets/KMS), управления уязвимостями и аудитов безопасности. Координация реагирования на инциденты безопасности с соответствующими командами.
Требования к должности
- Степень бакалавра или выше в области компьютерных наук или смежных дисциплин и 5+ лет опыта работы в DevOps, SRE или облачной инфраструктуре. Подтвержденный опыт работы в эксплуатации крупномасштабных производственных сред, управлении изменениями и устранении сложных инцидентов. Сильные навыки проектирования и внедрения инфраструктуры с отличным пониманием рисков и способностью к межкомандному сотрудничеству.
- Прочная база знаний в Linux, сетевых технологиях и контейнерах с практическим опытом работы с Kubernetes/EKS. Способность самостоятельно управлять настройкой, обновлением, настройкой и устранением неполадок кластеров на уровне Pod, Node, сети и кластера. Знание сред Java/Go и базовых методов устранения неполадок.
- Практический опыт работы с производственными средами AWS и основными сервисами (IAM, VPC, EC2, EKS, ALB/NLB, Route 53, S3, CloudWatch). Понимание принципов мульти-AZ, высокой доступности, сетевой изоляции, минимальных привилегий, автоматического масштабирования, планирования мощности и оптимизации затрат. Способность проектировать инфраструктуру, оценивать риски и устранять инциденты.
- Сильные навыки в IaC, CI/CD и автоматизации с опытом работы с Terraform/Terragrunt, GitHub Actions, Ansible. Владение скриптами (Bash, Python) для повышения надежности инфраструктуры и доставки приложений.
- Опыт управления наблюдаемостью и стабильностью производства с использованием Prometheus, Grafana, ELK/Loki, OpenTelemetry. Понимание Metrics, Logs, Tracing, SLI/SLO, управления оповещениями, планирования мощности и механизмов аварийного восстановления.
- Знание эксплуатации MySQL, Redis, Kafka и опыт в безопасности/DevSecOps (AWS IAM, Kubernetes RBAC, безопасность сети/контейнеров, Secrets/KMS, управление уязвимостями, аудиты безопасности). Способность выявлять и устранять риски безопасности в производственной среде.
- Предпочтителен опыт работы в индустрии Web3/Crypto, понимание основ блокчейна и способность решать проблемы стабильности/безопасности, характерные для торговли цифровыми активами.
Предпочтительные квалификации
- Опыт работы с биржами цифровых активов, ценными бумагами, финансовыми торговыми или платежными системами с требованиями высокой доступности.
- Опыт управления крупномасштабными/высоконагруженными средами Kubernetes/EKS, мультиаккаунтовым управлением AWS, кросс-региональным аварийным восстановлением или учениями по аварийному восстановлению.
- Продвинутый опыт работы с облачными технологиями, облачной безопасностью или оптимизацией затрат (Karpenter, Argo CD/Flux, OpenTelemetry, eBPF, FinOps).
Преимущества
- Высококонкурентный компенсационный пакет
- Спонсорство рабочей визы в Сингапур
- Плоская организационная структура с разнообразной и инклюзивной корпоративной культурой
- Щедрая политика ежегодных/медицинских отпусков с выходными и отличные условия работы
Подать заявку напрямую: https://davionlabs.bamboohr.com/careers/75?source=aWQ9MzM%3D