Описание вакансии
Должность: Старший инженер облачной инфраструктуры и SRE
Мы ищем высококвалифицированного старшего инженера облачной инфраструктуры и SRE для присоединения к нашей команде. Эта роль играет ключевую роль в обеспечении стабильности, безопасности и эффективности нашей основной торговой инфраструктуры и сервисов.
Ключевые обязанности
- Обеспечение круглосуточной стабильности работы основных торговых сервисов, включая торговые системы, сервисы рыночных данных и связанную инфраструктуру. Участие в аварийном реагировании на критические инциденты, проведение анализа первопричин и внедрение профилактических мер для гарантии непрерывности торговли и безопасности активов пользователей.
- Проектирование, внедрение и оптимизация производственной инфраструктуры AWS и EKS/Kubernetes, включая облачную архитектуру, сетевые решения, высокую доступность, планирование ресурсов и аварийное восстановление. Управление обновлениями кластеров Kubernetes, жизненным циклом узлов, планированием, управлением ресурсами, Ingress/балансировкой нагрузки, DNS, хранилищами и автоматическим масштабированием.
- Разработка и улучшение систем наблюдаемости и стабильности производства (Metrics, Logs, Tracing, Alerting, SLI/SLO, Incident Response, Postmortem) для повышения эффективности обнаружения, диагностики и устранения проблем. Сотрудничество с командами разработки для решения узких мест системы и проблем архитектурной стабильности.
- Продвижение инициатив Infrastructure as Code (IaC), CI/CD и автоматизации (Terraform/Terragrunt, GitHub Actions, Ansible) для стандартизации и автоматизации инфраструктуры и доставки приложений. Внедрение надежных процессов управления изменениями, включая механизмы проверки, развертывания, верификации и отката.
- Управление эксплуатацией основных сервисов данных и промежуточного ПО, включая MySQL, Redis, Kafka, с акцентом на высокую доступность, мониторинг, планирование ресурсов, резервное копирование/восстановление, настройку производительности и устранение неисправностей.
- Реализация политик безопасности AWS и Kubernetes, включая минимальные привилегии доступа (IAM/RBAC), сегментацию сети, безопасность контейнеров/образов, управление секретами (Secrets/KMS), управление уязвимостями и аудиты безопасности. Координация реагирования на инциденты безопасности с соответствующими командами.
Требования к кандидату
- Диплом бакалавра или выше в области компьютерных наук или смежной области с 5+ годами опыта в DevOps, SRE или облачной инфраструктуре. Подтвержденный опыт работы в крупномасштабных производственных средах, управлении изменениями и разрешении сложных инцидентов.
- Глубокие знания Linux, сетевых технологий и контейнерных решений с практическим опытом работы с Kubernetes/EKS, включая настройку кластеров, обновления, оптимизацию и устранение неисправностей на уровне подов, узлов и сети.
- Значительный опыт работы с производственными сервисами AWS (IAM, VPC, EC2, EKS, ALB/NLB, Route 53, S3, CloudWatch). Понимание принципов мульти-AZ, высокой доступности, сетевой изоляции, минимальных привилегий, автоматического масштабирования, планирования ресурсов и оптимизации затрат.
- Владение инструментами IaC, CI/CD и автоматизации (Terraform/Terragrunt, GitHub Actions, Ansible). Навыки написания скриптов (Bash, Python) для повышения надежности инфраструктуры и доставки приложений.
- Опыт работы с инструментами наблюдаемости и стабильности производства (Prometheus, Grafana, ELK/Loki, OpenTelemetry), включая Metrics, Logs, Tracing, SLI/SLO, управление оповещениями, планирование ресурсов и механизмы аварийного восстановления.
- Знание эксплуатации MySQL, Redis, Kafka и практик безопасности (AWS IAM, Kubernetes RBAC, сетевая безопасность, безопасность контейнеров, Secrets/KMS, управление уязвимостями, аудиты безопасности).
- Понимание операций в индустрии Web3/Crypto и основ блокчейна, способность выявлять и минимизировать риски стабильности и безопасности в среде торговли цифровыми активами.
Предпочтительные квалификации
- Опыт работы с биржами цифровых активов, ценными бумагами, финансовыми торговыми или платежными системами с требованиями высокой доступности.
- Практический опыт работы с крупномасштабными/высоконагруженными средами Kubernetes/EKS, управлением мультиаккаунтами AWS, кросс-региональным аварийным восстановлением или учениями по DR.
- Продвинутый опыт работы с облачными решениями, безопасностью облака или оптимизацией затрат (Karpenter, Argo CD/Flux, OpenTelemetry, eBPF, FinOps).
Преимущества
- Высококонкурентный компенсационный пакет
- Спонсорство рабочей визы в Сингапур
- Плоская организационная структура с разнообразной и инклюзивной корпоративной культурой
- Щедрая политика ежегодных/медицинских отпусков с отличным балансом работы и личной жизни
Подать заявку можно напрямую по ссылке: https://davionlabs.bamboohr.com/careers/75?source=aWQ9MzM%3D