Описание вакансии
Должность: Старший инженер облачной инфраструктуры и SRE
Основные обязанности:
- Обеспечение круглосуточной стабильности работы основных торговых систем, включая торговые связи, сервисы рыночных данных и сопутствующую инфраструктуру. Участие в реагировании на критические инциденты: диагностика проблем, снижение рисков, восстановление сервисов и послемортемный анализ для гарантии непрерывности торгов и безопасности активов пользователей.
- Проектирование и оптимизация производственной инфраструктуры AWS/EKS/Kubernetes, включая облачную архитектуру, сетевые решения, высокую доступность, планирование мощностей, аварийное восстановление, обновления кластеров, управление жизненным циклом узлов, распределение ресурсов, Ingress/LB, DNS, хранилища и автоматическое масштабирование. Постоянное повышение эффективности использования облачных ресурсов и их экономической целесообразности при участии в архитектурном проектировании с точки зрения стабильности, безопасности и удобства эксплуатации.
- Создание и развитие систем наблюдаемости и стабильности (Metrics, Logs, Tracing, Alerting, SLI/SLO, Incident Response, Postmortem) для ускорения выявления, диагностики и устранения проблем. Совместная работа с R&D над устранением системных узких мест, единых точек отказа и долгосрочных проблем архитектурной стабильности.
- Реализация инициатив IaC, CI/CD и автоматизации (Terraform/Terragrunt, GitHub Actions, Ansible) для стандартизации поставки инфраструктуры и приложений. Улучшение процессов управления изменениями, включая проверку, развертывание, верификацию и откат, чтобы минимизировать производственные риски.
- Управление эксплуатацией ключевых сервисов данных/мидлваров (MySQL, Redis, Kafka), включая высокую доступность, мониторинг, планирование мощностей, резервное копирование/восстановление, настройку производительности и обработку инцидентов.
- Внедрение политик безопасности AWS/Kubernetes, включая минимальные привилегии доступа (IAM/RBAC), сегментацию сети, безопасность контейнеров/образов, управление секретами (Secrets/KMS), управление уязвимостями и аудиты безопасности. Координация реагирования на инциденты безопасности с соответствующими командами.
Требования к кандидату
- Степень бакалавра в области компьютерных наук или смежных дисциплин и 5+ лет опыта в ролях DevOps/SRE/облачной инфраструктуры. Подтвержденный опыт работы с крупномасштабными производственными системами, управлением изменениями и сложным устранением неисправностей. Навыки проектирования/реализации инфраструктуры с осознанием рисков и способностью к межкомандному взаимодействию.
- Глубокие знания Linux, сетевых технологий и контейнеризации. Практический опыт работы с Kubernetes/EKS, включая развертывание кластеров, обновления, настройку и устранение неполадок на уровне pod/node/сети. Знакомство со средами Java/Go и базовой отладкой приложений.
- Опыт эксплуатации AWS с основными сервисами (IAM, VPC, EC2, EKS, ALB/NLB, Route53, S3, CloudWatch). Понимание принципов multi-AZ, высокой доступности, сетевой изоляции, минимальных привилегий, автоматического масштабирования, планирования мощностей и оптимизации затрат.
- Навыки работы с IaC/CI/CD/автоматизацией с использованием Terraform/Terragrunt, GitHub Actions, Ansible. Уверенное владение скриптами (Bash/Python) для повышения надежности поставки инфраструктуры/приложений.
- Экспертиза в области наблюдаемости/стабильности с использованием Prometheus, Grafana, ELK/Loki, OpenTelemetry. Глубокое понимание Metrics/Logs/Tracing, SLI/SLO, управления алертами, планирования мощностей и механизмов аварийного восстановления.
- Опыт эксплуатации MySQL/Redis/Kafka в production. Знания в области безопасности/DevSecOps, включая IAM/RBAC, безопасность сети/хостов/контейнеров, управление секретами, обработку уязвимостей и аудиты безопасности.
- Предпочтителен опыт в Web3/Crypto индустрии с пониманием основ блокчейна и способностью решать проблемы стабильности/безопасности в системах торговли цифровыми активами.
Дополнительные преимущества:
- Опыт работы в биржах цифровых активов, ценных бумагах, финансовых торговых или платежных системах с требованиями высокой доступности.
- Работа в крупномасштабных Kubernetes/EKS средах с высокой нагрузкой, управление multi-account AWS, кросс-регионным аварийным восстановлением или учениями по DR.
- Продвинутые знания в cloud-native/безопасности/оптимизации затрат (Karpenter, ArgoCD/Flux, OpenTelemetry, eBPF, FinOps).
Условия
- Высококонкурентный компенсационный пакет
- Оформление рабочей визы в Сингапур
- Плоская организационная структура с разнообразной и инклюзивной культурой
- Щедрый ежегодный/медицинский отпуск, выходные дни и отличные условия работы
Подать заявку напрямую: https://davionlabs.bamboohr.com/careers/75?source=aWQ9MzM%3D