Mô tả Công việc
Vị trí dành cho Kỹ sư Cơ sở Hạ tầng Đám mây & SRE Cấp cao chịu trách nhiệm đảm bảo tính ổn định và độ tin cậy của các hệ thống giao dịch cốt lõi. Vai trò này bao gồm quản lý cơ sở hạ tầng AWS và Kubernetes, triển khai hệ thống quan sát và thúc đẩy tự động hóa để nâng cao hiệu quả vận hành.
Trách Nhiệm Chính
- Đảm bảo tính ổn định 24/7 của các hệ thống giao dịch cốt lõi, bao gồm chuỗi giao dịch, dịch vụ dữ liệu thị trường và cơ sở hạ tầng liên quan. Tham gia ứng phó sự cố, khắc phục sự cố và phân tích hậu sự cố để đảm bảo tính liên tục của dịch vụ và an toàn tài sản.
- Thiết kế, xây dựng và tối ưu hóa cơ sở hạ tầng sản xuất AWS và EKS/Kubernetes, bao gồm kiến trúc đám mây, mạng, tính khả dụng cao, lập kế hoạch dung lượng và phục hồi sau thảm họa. Quản lý cụm Kubernetes, bao gồm nâng cấp, vòng đời nút, lập lịch, quản lý tài nguyên, Ingress/LB, DNS, lưu trữ và tự động mở rộng.
- Phát triển và nâng cao khung quan sát và ổn định (Metrics, Logs, Tracing, Alerting, SLI/SLO, Incident Response, Postmortem) để cải thiện phát hiện, chẩn đoán và khôi phục sự cố. Hợp tác với các nhóm phát triển để giải quyết các nút thắt hệ thống và rủi ro kiến trúc.
- Thúc đẩy Cơ sở hạ tầng dưới dạng Mã (IaC), CI/CD và tự động hóa (Terraform/Terragrunt, GitHub Actions, Ansible) để chuẩn hóa và tự động hóa cơ sở hạ tầng và phân phối ứng dụng. Cải thiện quản lý thay đổi, phát hành, xác thực và quy trình hoàn tác.
- Quản lý vận hành sản xuất cho các dịch vụ dữ liệu và middleware cốt lõi như MySQL, Redis và Kafka, bao gồm HA, giám sát, lập kế hoạch dung lượng, sao lưu/khôi phục, điều chỉnh hiệu suất và khắc phục sự cố.
- Thúc đẩy quản trị bảo mật AWS và Kubernetes, bao gồm IAM/RBAC, cách ly mạng, bảo mật container/hình ảnh, quản lý bí mật (Secrets/KMS), quản lý lỗ hổng và kiểm toán bảo mật. Phối hợp ứng phó sự cố bảo mật với các nhóm liên quan.
Yêu Cầu Công Việc
- Bằng cử nhân về Khoa học Máy tính hoặc lĩnh vực liên quan; 5+ năm kinh nghiệm DevOps/SRE/cơ sở hạ tầng đám mây. Kinh nghiệm thực tế trong môi trường sản xuất quy mô lớn, thiết kế cơ sở hạ tầng và giải quyết sự cố phức tạp. Nhận thức rủi ro mạnh mẽ và kỹ năng hợp tác liên nhóm.
- Nền tảng vững chắc về Linux, mạng và công nghệ container. Chuyên môn được chứng minh trong thiết lập, nâng cấp, điều chỉnh và khắc phục sự cố cụm Kubernetes/EKS (Pod/Node/mức mạng). Quen thuộc với môi trường ứng dụng Java/Go và gỡ lỗi.
- Kinh nghiệm sản xuất AWS với các dịch vụ cốt lõi (IAM, VPC, EC2, EKS, ALB/NLB, Route 53, S3, CloudWatch). Hiểu biết về multi-AZ, HA, cách ly mạng, quyền tối thiểu, tự động mở rộng, lập kế hoạch dung lượng và tối ưu hóa chi phí. Khả năng thiết kế cơ sở hạ tầng, đánh giá rủi ro và giải quyết vấn đề.
- Kỹ năng IaC/CI/CD/tự động hóa mạnh mẽ (Terraform/Terragrunt, GitHub Actions, Ansible). Thành thạo kịch bản (Bash/Python) để nâng cao độ tin cậy cơ sở hạ tầng và triển khai.
- Chuyên môn về quản trị quan sát và ổn định (Prometheus, Grafana, ELK/Loki, OpenTelemetry). Kiến thức về Metrics/Logs/Tracing, SLI/SLO, cảnh báo, lập kế hoạch dung lượng và phục hồi sau thảm họa.
- Kinh nghiệm vận hành sản xuất với MySQL/Redis/Kafka. Nền tảng bảo mật/DevSecOps (IAM, RBAC, bảo mật mạng/container, Secrets/KMS, quản lý lỗ hổng, kiểm toán). Khả năng xác định và giảm thiểu rủi ro bảo mật.
- Ưu tiên kinh nghiệm ngành Web3/Crypto, với hiểu biết về cơ chế blockchain và rủi ro giao dịch tài sản kỹ thuật số.
Ưu Tiên
- Kinh nghiệm trong hệ thống thời gian thực có tính khả dụng cao (ví dụ: sàn giao dịch tiền mã hóa, tài chính, thanh toán).
- Môi trường Kubernetes/EKS quy mô lớn/lưu lượng cao, quản trị đa tài khoản AWS, DR đa vùng hoặc diễn tập phục hồi sau thảm họa.
- Thực hành tối ưu hóa đám mây/bảo mật/chi phí tiên tiến (Karpenter, Argo CD/Flux, OpenTelemetry, eBPF, FinOps).
Phúc Lợi
- Mức lương cạnh tranh cao.
- Bảo lãnh visa làm việc Singapore.
- Cơ cấu phẳng với văn hóa nhóm đa dạng, bao trùm.
- Chính sách nghỉ phép hào phóng (năm/ốm), nghỉ cuối tuần và môi trường làm việc tuyệt vời.
Ứng tuyển trực tiếp: https://davionlabs.bamboohr.com/careers/75?source=aWQ9MzM%3D