Kỹ sư nền tảng dữ liệu lớn - Khối Công nghệ thông tin
Mô tả công việc
- Có kinh nghiệm Data Lake/Lakehouse, Object Storage, Spark/Trino/Presto, Iceberg/Delta/Hudi, NoSQL/GraphDB, security/access control, monitoring và troubleshooting production. Ưu tiên kinh nghiệm ngân hàng/tài chính, dữ liệu khách hàng, giao dịch lớn, BI/AI/ML hoặc nền tảng on-prem/hybrid cloud.
- Kinh nghiệm: 5-10 năm ở vị trí tương đương
- Kỹ năng mềm: Chủ động chịu trách nhiệm từ thiết kế, triển khai, vận hành, tối ưu đến xử lý sự cố, tư duy SLA, phân tích và xử lý sự cố, phối hợp liên nhóm, tài liệu hóa/runbook, mentoring, quản lý stakeholder/vendor và chủ động đề xuất cải tiến liên tục để tối ưu chi phí, hiệu năng và nâng cao ổn định của nền tảng.
Yêu cầu ứng viên
- Có kinh nghiệm Data Lake/Lakehouse, Object Storage, Spark/Trino/Presto, Iceberg/Delta/Hudi, NoSQL/GraphDB, security/access control, monitoring và troubleshooting production. Ưu tiên kinh nghiệm ngân hàng/tài chính, dữ liệu khách hàng, giao dịch lớn, BI/AI/ML hoặc nền tảng on-prem/hybrid cloud.
- Kinh nghiệm: 5-10 năm ở vị trí tương đương
- Kỹ năng mềm: Chủ động chịu trách nhiệm từ thiết kế, triển khai, vận hành, tối ưu đến xử lý sự cố, tư duy SLA, phân tích và xử lý sự cố, phối hợp liên nhóm, tài liệu hóa/runbook, mentoring, quản lý stakeholder/vendor và chủ động đề xuất cải tiến liên tục để tối ưu chi phí, hiệu năng và nâng cao ổn định của nền tảng.
Phân tích kỹ năng cần có
Phân tích kỹ năng yêu cầu — Kỹ sư nền tảng dữ liệu lớn tại TPBank
🎯 Tổng quan vị trí
Đây là vị trí cấp cao (Senior đến Lead) trong Khối Công nghệ thông tin của TPBank, tập trung vào xây dựng và vận hành nền tảng dữ liệu lớn phục vụ cho nghiệp vụ ngân hàng. Vị trí này không chỉ làm kỹ thuật thuần mà còn đòi hỏi tư duy sản phẩm, vận hành production và khả năng phối hợp đa nhóm.
---
🛠️ Hard Skills — Kỹ năng kỹ thuật cốt lõi
1. Kiến trúc dữ liệu hiện đại
| Công nghệ | Mức độ yêu cầu | Ghi chú cho ứng viên |
|---|---|---|
| Data Lake / Lakehouse | Bắt buộc | Hiểu rõ sự khác biệt giữa Data Lake truyền thống và kiến trúc Lakehouse (kết hợp ưu điểm của Data Warehouse + Data Lake) |
| Object Storage (MinIO, S3, HDFS) | Bắt buộc | Kinh nghiệm thiết kế, tối ưu chi phí lưu trữ, lifecycle policy |
| Spark (batch + streaming) | Bắt buộc | Hiểu sâu về Spark Core, Spark SQL, Structured Streaming; tuning performance, memory management |
| Trino/Presto | Bắt buộc | Distributed SQL query engine cho phép truy vấn trực tiếp trên Data Lake |
| Iceberg / Delta / Hudi | Bắt buộc | Open table formats — ít nhất phải thành thạo 1 trong 3, hiểu ACID transaction, schema evolution, time travel |
| NoSQL (Cassandra, MongoDB, HBase) | Cần thiết | Thiết kế schema, sharding, replication |
| GraphDB (Neo4j, JanusGraph, TigerGraph) | Ưu cầu | Ứng dụng trong phân tích quan hệ khách hàng, phát hiện gian lận |
2. Bảo mật và kiểm soát truy cập
- Authentication/Authorization: LDAP, Kerberos, OAuth2, SAML
- Authorization models: RBAC, ABAC, ACL cho Hadoop ecosystem
- Data encryption: at-rest, in-transit
- Audit logging cho tuân thủ quy định ngân hàng (NHNN)
- Data masking/tokenization cho dữ liệu nhạy cảm
3. Giám sát và vận hành Production
- Monitoring stack: Prometheus, Grafana, ELK/EFK, OpenTelemetry
- Alerting: PagerDuty, OpsGenie hoặc tương đương
- Logging & Tracing: distributed tracing (Jaeger, Zipkin)
- Incident management: quy trình on-call, post-mortem
4. Cloud & Hybrid
- Hybrid cloud architecture: on-prem (Hadoop cluster) + cloud (AWS/Azure/GCP)
- Data migration giữa các môi trường
- Cost optimization cho cloud
5. Hệ sinh thái phụ trợ
| Danh mục | Công nghệ |
|---|---|
| Orchestration | Apache Airflow, Dagster, Oozie |
| Container | Docker, Kubernetes |
| CI/CD | Jenkins, GitLab CI, ArgoCD |
| Infrastructure as Code | Terraform, Ansible |
| Version control | Git, GitFlow |
---
🤝 Soft Skills — Kỹ năng mềm quan trọng
1. Ownership mindset: Chủ động chịu trách nhiệm từ A-Z (thiết kế → triển khai → vận hành → tối ưu → xử lý sự cố)
2. SLA thinking: Tư duy cam kết chất lượng dịch vụ (uptime, latency, throughput)
3. Incident analysis: Phân týt nguyên nhân gốc (RCA), blameless post-mortem
4. Cross-team collaboration: Phối hợp với Data Engineer, Data Analyst, DevOps, BA, nghiệp vụ
5. Documentation: Viết runbook, playbook, kiến trúc tài liệu rõ ràng
6. Mentoring: Đào tạo junior, review code, chia sẻ kiến thức
7. Stakeholder management: Quản lý kỳ vọng của các bên liên quan
8. Vendor management: Làm việc với nhà cung cấp phần mềm/hardware
9. Continuous improvement mindset: Đề xuất cải tiến tối ưu chi phí, hiệu năng, ổn định
---
📜 Chứng chỉ gợi ý
| Chứng chỉ | Mức độ phù hợp | Ghi chú |
|---|---|---|
| Databricks Certified Data Engineer Professional | ⭐⭐⭐⭐⭐ | Rất liên quan với Spark + Delta Lake |
| Google Professional Data Engineer | ⭐⭐⭐⭐ | Uy tín quốc tế |
| AWS Certified Data Analytics — Specialty | ⭐⭐⭐⭐ | Phù hợp nếu dùng AWS cho hybrid cloud |
| Cloudera / Confluent (Kafka) certification | ⭐⭐⭐ | Tùy môi trường cụ thể |
| Kubernetes (CKA/CKAD) | ⭐⭐⭐⭐ | Cho phần container orchestration |
| ITIL Foundation | ⭐⭐⭐ | Liên quan đến quản lý dịch vụ IT |
---
📊 Bảng đánh giá mức độ sẵn sàng
| Bạn có kinh nghiệm | Mức độ sẵn sàng |
|---|---|
| 5 năm Spark + Hadoop + Data Lake | ✅ Đủ cơ sở ứng tuyển |
| 7+ năm, đã từng thiết kế Lakehouse, làm production | ✅ Phù hợp cao |
| 10+ năm, có kinh nghiệm ngân hàng, mentoring team | ✅ Mức Lead |
| Mới ra trường hoặc <3 năm | ❌ Chưa phù hợp, cần tích lũy thêm |
| Background DBA/DevOps muốn chuyển sang Data Platform | ⚠️ Cần bổ sung thêm kiến thức về Spark và data ecosystem |
Chuẩn bị phỏng vấn
Hướng dẫn phỏng vấn — Kỹ sư nền tảng dữ liệu lớn TPBank
📋 Quy trình tuyển dụng dự kiến (3-5 vòng)
Tại TPBank và các ngân hàng lớn tương đương, quy trình thường diễn ra như sau:
1. Vòng 1 — HR Screening (30-45 phút)
- Xác nhận thông tin cá nhân, mức lương mong muốn
- Kiểm tra sơ bộ kinh nghiệm và mục tiêu nghề nghiệp
- Hỏi về lý do ứng tuyển TPBank
2. Vòng 2 — Technical Interview Round 1 (60-90 phút)
- Phỏng vấn với Senior Engineer / Tech Lead
- Câu hỏi sâu về Spark, Data Lake/Lakehouse, table formats
- Câu hỏi thiết kế hệ thống
3. Vòng 3 — Technical Interview Round 2 / System Design (60-90 phút)
- Phỏng vấn với Engineering Manager / Solution Architect
- System design: thiết kế data platform cho ngân hàng
- Case study thực tế về xử lý sự cố
4. Vòng 4 — Manager / Director Interview (45-60 phút)
- Đánh giá tư duy chiến lược, leadership
- Thảo luận về tầm nhìn nghề nghiệp
5. Vòng 5 — Offer & Background Check
- Đàm phán lương, phúc lợi
- Xác minh thông tin, tham chiếu
---
❓ Câu hỏi phỏng vấn hay gặp theo từng vòng
Vòng Technical — Spark & Data Processing
1. Spark: Phân biệt `transformations` và `actions`? Tại sao Spark chậm hơn khi xử lý dữ liệu nhỏ?
2. Spark: Giải thích cơ chế lazy evaluation và DAG. Khi nào nên dùng `persist()` / `cache()`?
3. Spark: Cách xử lý data skew? Bạn đã từng gặp và giải quyết như thế nào?
4. Spark vs Trino: Khi nào chọn Spark batch, khi nào chọn Trino cho truy vấn tương tác?
5. Streaming: So sánh Spark Structured Streaming với Kafka Streams và Flink?
Vòng Technical — Data Lake/Lakehouse & Table Formats
6. Data Lake vs Data Warehouse vs Lakehouse: Ưu/nhược điểm của từng kiến trúc?
7. Iceberg vs Delta vs Hudi: So sánh chi tiết? Bạn đã dùng cái nào? Tại sao chọn?
8. ACID trên Data Lake: Làm thế nào Iceberg/Delta đảm bảo ACID khi dữ liệu trên object storage?
9. Schema evolution: Xử lý khi schema thay đổi (thêm/xóa cột, đổi kiểu dữ liệu)?
10. Time travel: Khi nào cần dùng time travel? Chi phí lưu trữ?
Vòng Technical — NoSQL & GraphDB
11. CAP theorem: Trade-off giữa Consistency, Availability, Partition tolerance trong hệ thống NoSQL?
12. Cassandra: Cơ chế eventual consistency? Khi nào KHÔNG nên dùng Cassandra?
13. GraphDB use case: Khi nào nên dùng GraphDB trong ngân hàng (fraud detection, customer 360)?
Vòng Technical — Security & Monitoring
14. Access control: Thiết kế RBAC cho data platform như thế nào? Apache Ranger vs Apache Atlas?
15. Encryption: Cách mã hóa dữ liệu nhạy cảm (số tài khoản, CCCD) tuân thủ quy định NHNN?
16. Monitoring: Metrics quan trọng nhất cần theo dõi cho Spark cluster?
17. Incident: Bạn đã xử lý incident nghiêm trọng nào? Quy trình RCA như thế nào?
Vòng System Design
18. Thiết kế data platform cho ngân hàng với 10TB dữ liệu giao dịch/ngày, cần real-time fraud detection và batch report cho NHNN?
19. Hybrid cloud: Chiến lược di chuyển data warehouse on-prem sang cloud?
20. Data governance: Thiết kế data catalog và data lineage cho hệ thống?
Vòng Soft Skills & Behavioral
21. Mô tả lần bạn đề xuất cải tiến hệ thống giúp tiết kiệm chi phí hoặc tăng hiệu năng?
22. Bạn xử lý xung đột ưu tiên giữa các stakeholder như thế nào?
23. Kinh nghiệm mentoring junior engineer?
---
💡 Tips chuẩn bị phỏng vấn
Trước phỏng vấn (1-2 tuần)
- ✅ Đọc kỹ về TPBank: sản phẩm LiveBank, công nghệ TPFusion, chiến lược chuyển đổi số
- ✅ Research trên LinkedIn về team/người phỏng vấn (nếu biết)
- ✅ Ôn lại kiến thức nền tảng, đặc biệt là Iceberg/Delta (xu hướng hiện tại)
- ✅ Chuẩn bị 2-3 case study thực tế: thiết kế hệ thống, xử lý sự cố, tối ưu chi phí
- ✅ Chuẩn bị câu hỏi ngược cho interviewer (xem danh sách cuối)
Trong phỏng vấn
- ✅ Nguyên tắc STAR: Situation → Task → Action → Result khi trả lời behavioral
- ✅ Nói rõ trade-off: Không có giải pháp hoàn hảo, luôn có trade-off
- ✅ Thể hiện ownership: "Tôi đã làm X, kết quả Y, bài học Z"
- ✅ Hỏi câu thông minh: thể hiện tư duy sâu
- ❌ Đừng bịa kinh nghiệm: Ngân hàng kiểm tra rất kỹ, dễ bị "bắt thóp"
Câu hỏi nên hỏi ngược interviewer
1. Hiện tại team đang dùng tech stack nào? On-prem hay hybrid cloud?
2. Thách thức lớn nhất của data platform hiện tại là gì?
3. Văn hóa on-call và work-life balance như thế nào?
4. Cơ hội phát triển lên Lead/Architect?
5. Ngân sách cho R&D và công nghệ mới?
---
👔 Dress Code
- Vòng HR/Manager: Sơ mi + quần tây, có thể không cần vest
- Vòng Technical: Smart casual hoặc business casual được chấp nhận
- Lưu ý: TPBank là ngân hàng, nên ăn mặc gọn gàng, chuyên nghiệp. Tránh quần jeans, áo thun có hình ảnh
Lộ trình ôn thi
Lộ trình ôn tập & chuẩn bị trong 1-2 tuần
📚 Kiến thức nền tảng cần ôn lại
Tuần 1 — Củng cố nền tảng kỹ thuật
Ngày 1-2: Apache Spark chuyên sâu
- Đọc lại Spark: The Definitive Guide (chương Architecture, Spark SQL, Structured Streaming)
- Thực hành: data skew, broadcast join, adaptive query execution
- Tài liệu: [spark.apache.org/docs/latest](https://spark.apache.org/docs/latest/)
Ngày 3-4: Data Lakehouse & Table Formats
- Đọc whitepaper Apache Iceberg, Delta Lake
- So sánh Iceberg vs Delta vs Hudi (bảng comparison)
- Tài liệu:
- [iceberg.apache.org](https://iceberg.apache.org/)
- [delta.io](https://delta.io/)
- [hudi.apache.org](https://hudi.apache.org/)
Ngày 5-6: Trino/Presto
- Kiến trúc Trino: coordinator, worker, connector
- Tài liệu: [trino.io/docs/current](https://trino.io/docs/current/)
Ngày 7: Object Storage & Hybrid Cloud
- MinIO, S3, HDFS — design pattern
- Hybrid cloud architecture best practices
Tuần 2 — Mở rộng & thực hành
Ngày 8-9: NoSQL & GraphDB
- Cassandra Data Modeling
- Neo4j / GraphDB use case trong banking (fraud ring, customer 360)
- CAP theorem, eventual consistency
Ngày 10-11: Security & Monitoring
- Apache Ranger, Apache Atlas cho data governance
- Prometheus + Grafana cho monitoring
- ELK/EFK stack cho logging
- OpenTelemetry cho distributed tracing
Ngày 12-13: System Design Practice
- Vẽ kiến trúc data platform cho ngân hàng
- Tính toán capacity planning: 10TB/ngày cần bao nhiêu node?
- Backup, disaster recovery, multi-region
Ngày 14: Mock Interview & Behavioral
- Luyện trả lời theo STAR
- Chuẩn bị 3 case study thực tế
- Luyện giải thích bằng tiếng Anh (nếu phỏng vấn bằng tiếng Anh)
---
📖 Tài liệu tham khảo
Sách (ưu tiên)
| Sách | Tác giả | Mức độ cần thiết |
|---|---|---|
| Spark: The Definitive Guide | Bill Chambers, Matei Zaharia | ⭐⭐⭐⭐⭐ |
| Designing Data-Intensive Applications | Martin Kleppmann | ⭐⭐⭐⭐⭐ |
| Data Pipelines Pocket Reference | James Densmore | ⭐⭐⭐⭐ |
| Fundamentals of Data Engineering | Joe Reis, Matt Housley | ⭐⭐⭐⭐ |
| Streaming Systems | Tyler Akidau et al. | ⭐⭐⭐ |
| Data Mesh | Zhamak Dehghani | ⭐⭐⭐ |
Tài liệu online miễn phí
- [Spark Documentation](https://spark.apache.org/docs/latest/)
- [Iceberg Documentation](https://iceberg.apache.org/docs/latest/)
- [Delta Lake Documentation](https://docs.delta.io/)
- [Trino Documentation](https://trino.io/docs/current/)
- [Confluent Kafka Documentation](https://docs.confluent.io/)
- [CNCF Landscape](https://landscape.cncf.io/)
Blog & Conference
- [Databricks Blog](https://www.databricks.com/blog)
- [Netflix Tech Blog](https://netflixtechblog.com/) — case study production
- [Uber Engineering](https://www.uber.com/blog/engineering/)
- [AWS Big Data Blog](https://aws.amazon.com/blogs/big-data/)
- [Conference: Data + AI Summit, Kafka Summit](https://www.databricks.com/dataaisummit)
YouTube channels
- Databricks
- The Coding Bee (Spark)
- Hussein Nasser (Backend/Data Engineering)
- Seattle Data Guy
---
🎯 Lộ trình học cấp tốc 7 ngày (nếu đã có kinh nghiệm)
| Ngày | Chủ đề | Hoạt động |
|---|---|---|
| 1 | Spark Architecture & Optimization | Đọc + lab |
| 2 | Iceberg/Delta/Hudi | So sánh + hands-on |
| 3 | Trino + Object Storage | Đọc tài liệu |
| 4 | NoSQL + GraphDB use case | Nghiên cứu case banking |
| 5 | Security & Monitoring | Ranger, Prometheus |
| 6 | System Design | Vẽ kiến trúc ngân hàng |
| 7 | Mock interview + Behavioral | Luyện STAR, case study |
---
✅ Checklist trước ngày phỏng vấn
- [ ] Đã ôn xong kiến thức Spark, Lakehouse, Table formats
- [ ] Đã chuẩn bị 3 case study thực tế (incident, optimization, design)
- [ ] Đã research về TPBank (sản phẩm, chiến lược, văn hóa)
- [ ] Đã chuẩn bị 5 câu hỏi thông minh cho interviewer
- [ ] Đã chuẩn bị trang phục phù hợp
- [ ] Đã in 3-5 bản CV (một số vòng vẫn yêu cầu bản cứng)
- [ ] Đã đến sớm 10-15 phút
Tư vấn nghề nghiệp
Lời khuyên sự nghiệp — Kỹ sư nền tảng dữ liệu lớn ngân hàng
🛤️ Lộ trình thăng tiến
```
Data Engineer (1-3 năm)
↓
Senior Data Engineer / Data Platform Engineer (3-7 năm) ← Bạn đang ở đây
↓
Lead Data Platform Engineer / Data Architect (7-10 năm)
↓
Principal Engineer / Head of Data Platform (10+ năm)
↓
VP of Data / Chief Data Officer (CDO)
```
💰 Mức lương tham khảo theo cấp bậc (ước lượng)
> ⚠️ Lưu ý: Mức lương có thể thay đổi tùy ngân hàng và thời điểm. Số liệu dưới đây chỉ mang tính tham khảo dựa trên thị trường Việt Nam 2024-2025.
| Cấp bậc | Kinh nghiệm | Mức lương Gross/Tháng | Ghi chú |
|---|---|---|---|
| Junior Data Engineer | 0-2 năm | 18-30 triệu | Ngân hàng trả cao hơn fintech 10-20% |
| Data Engineer | 2-4 năm | 30-50 triệu | |
| Senior Data Engineer | 4-7 năm | 50-80 triệu | Đây là range của vị trí này |
| Lead / Staff Engineer | 7-10 năm | 80-130 triệu | Có thể +ESOP/thưởng cuối năm |
| Principal / Architect | 10-15 năm | 130-200 triệu | Hiếm, thường Big 4 ngân hàng hoặc VPBank, Techcombank, MB |
| Director / Head of Data | 15+ năm | 200-400 triệu+ | Cấp C-level |
TPBank cụ thể (ước lượng):
- Senior Engineer (5-7 năm): 60-90 triệu gross
- Lead Engineer (7-10 năm): 90-130 triệu gross
- Cộng thưởng Tết, thưởng KPIs, phúc lợi ngân hàng
🎯 Kỹ năng cần phát triển thêm
Ngắn hạn (3-6 tháng)
1. Iceberg hoặc Delta Lake — trở thành chuyên gia về 1 trong 2
2. Kubernetes — cho hybrid cloud
3. Terraform — Infrastructure as Code
4. Streaming: Kafka, Flink (nếu chưa mạnh)
5. DataOps/Data Quality: Great Expectations, Monte Carlo
Trung hạn (6-18 tháng)
1. MLOps: MLflow, Kubeflow — cho AI/ML use case
2. Data Governance: Apache Atlas, DataHub
3. Cloud certification: AWS/Azure/GCP Data specialty
4. Cost optimization: FinOps cho data platform
5. Soft skills: presentation, stakeholder management
Dài hạn (1-3 năm)
1. Data Mesh architecture — xu hướng mới
2. Real-time analytics: ClickHouse, Apache Pinot, Druid
3. Lakehouse Federation: query across multiple sources
4. AI/LLM integration: dùng LLM cho data discovery, query generation
5. Leadership: mentoring, technical writing, public speaking
📌 Lời khuyên thực tế
Nếu bạn đã có 5-10 năm kinh nghiệm:
- Đừng nhảy việc quá nhanh (dưới 1.5 năm/lần) — ngân hàng coi trọng sự ổn định
- Tích lũy case study thực tế để kể trong phỏng vấn (incident, optimization, design)
- Xây dựng personal brand: viết blog, talk tại meetup, đóng góp open-source
- Mạng lưới quan trọng: tham gia cộng đồng Data Engineering Vietnam, VNBigData
- Cân nhắc cả nhóm ngân hàng: Techcombank, MB, VPBank, ACB, Vietcombank đều có chương trình chuyển đổi số lớn
Nếu bạn muốn chuyển ngành sang Data Platform:
- Bắt đầu từ Data Engineer trước (1-2 năm) rồi mới nhảy sang Platform
- Học Spark + Hadoop là nền tảng bắt buộc
- Lấy Databricks Certified Data Engineer để chứng minh năng lực
- Làm side project với dữ liệu banking (open dataset trên Kaggle)
Nếu bạn là sinh viên mới ra trường:
- Vị trí này chưa phù hợp, cần tích lũy 3-5 năm trước
- Tìm vị trí Data Engineer Junior tại ngân hàng hoặc fintech
- Học chắc SQL, Python, Spark trước
- Làm internship tại các ngân hàng có chương trình Fresher: Techcombank (Marathon), VPBank (HIPO), MB
🚀 Xu hướng ngành 2024-2026
1. Lakehouse thay thế Data Warehouse truyền thống — Iceberg/Delta là tương lai
2. AI/ML trên Data Platform — không thể tách rời
3. Real-time everything — streaming là mặc định, không phải nice-to-have
4. Cost optimization — FinOps trở thành kỹ năng quan trọng
5. Data Governance & Privacy — quan trọng hơn bao giờ hết với quy định NHNN
6. Data Mesh — xu hướng cho tổ chức lớn có nhiều domain
🏦 Vì sao nên chọn ngân hàng thay vì Big Tech?
| Tiêu chí | Ngân hàng | Big Tech/Foreign |
|---|---|---|
| Mức lương | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| Work-life balance | ⭐⭐⭐ | ⭐⭐⭐⭐ |
| Tính chất công việc | Business-critical, regulated | Product-focused |
| Cơ hội leadership | ⭐⭐⭐⭐⭐ (ít người, nhanh lên) | ⭐⭐⭐ (cạnh tranh cao) |
| Học hỏi | Domain knowledge banking | Engineering best practice |
| Phúc lợi | BHXH, BHYT, thưởng Tết | Stock, remote |
Kết luận: Nếu bạn thích ổn định, muốn làm việc với dữ liệu lớn có tính critical, và muốn lên vị trí cao nhanh trong 3-5 năm tới, ngân hàng là lựa chọn tuyệt vời.
Câu hỏi thường gặp
Em mới ra trường ngành CNTT, muốn apply vị trí này thì có cơ hội không?
Chào bạn, vị trí này yêu cầu 5-10 năm kinh nghiệm nên thực tế là chưa phù hợp cho người mới ra trường. Tuy nhiên, đây cũng là cơ hội để bạn xác định lộ trình: Bắt đầu với vị trí Junior Data Engineer tại ngân hàng (Techcombank, MB, VPBank đều có chương trình Fresher), học chắc Spark + Hadoop + SQL + Python trong 1-2 năm đầu, sau đó phát triển lên Senior. Nếu kiên trì, 5-7 năm sau bạn hoàn toàn có thể apply lại vị trí tương đương. Trong thời gian này, bạn nên lấy chứng chỉ Databricks Data Engineer và tích lũy kinh nghiệm production thực tế.
Mức lương cho vị trí Senior Data Platform Engineer tại TPBank khoảng bao nhiêu?
Mức lương tin đăng ghi 'Thỏa thuận', tức là sẽ thương lượng dựa trên năng lực thực tế. Theo tham khảo thị trường (lưu ý mức lương có thể thay đổi tùy ngân hàng và thời điểm), Senior Data Platform Engineer 5-7 năm tại ngân hàng lớn thường dao động 60-90 triệu gross/tháng. Nếu bạn có kinh nghiệm banking + mentoring + 7-10 năm thì có thể đàm phán 90-130 triệu. Ngoài lương còn có thưởng Tết (1-3 tháng), thưởng KPIs, phúc lợi ngân hàng (BHXH full, khám sức khỏe, du lịch). Khi đàm phán, bạn nên đề xuất mức total compensation, đừng chỉ nhìn vào lương gross.
Tôi đang làm DevOps 3 năm, muốn chuyển sang Data Platform có khả thi không?
Hoàn toàn khả thi vì nhiều kỹ năng DevOps sẽ là lợi thế: Kubernetes, Terraform, CI/CD, monitoring, incident handling đều rất cần cho Data Platform. Tuy nhiên bạn cần bổ sung kiến thức chuyên ngành Data: Spark (rất quan trọng), Data Lake/Lakehouse architecture, Iceberg/Delta, SQL nâng cao, NoSQL. Lộ trình gợi ý: 3-6 tháng tự học + làm side project với dữ liệu lớn, lấy chứng chỉ Databricks Data Engineer, sau đó apply vị trí Data Platform Engineer. Bạn có thể apply vị trí Senior DevOps tại team Data Platform trước, rồi chuyển dần. Kinh nghiệm 3 năm DevOps + thêm 2-3 năm Data sẽ cho bạn hồ sơ rất mạnh.
On-call ở vị trí này có nhiều không? Work-life balance thế nào?
Vị trí vận hành production data platform tại ngân hàng thường có on-call rotation. Thông thường là 1 tuần/ca (trong team 5-7 người), khi on-call cần phản hồi alert trong 15-30 phút. Tuy nhiên nếu hệ thống được thiết kế tốt và monitoring mature thì số lần bị đánh thức giữa đêm không nhiều (1-2 lần/tháng). Work-life balance ở ngân hàng tốt hơn Big Tech: thường là 8h-17h30, ít OT cuối tuần, nghỉ lễ Tết đầy đủ. TPBank là một trong những ngân hàng có văn hóa đổi mới khá tốt, nhưng vẫn là ngân hàng nên tuân thủ giờ giấc và quy trình chặt chẽ.
KPI của vị trí này được đo lường như thế nào?
KPI của Data Platform Engineer thường chia làm 3 nhóm: (1) SLA nền tảng: uptime 99.9%+, latency truy vấn, số incident P1/P2 mỗi quý; (2) Delivery: số project hoàn thành đúng hạn, adoption rate của platform (bao nhiêu team dùng); (3) Cải tiến: cost optimization (% giảm chi phí cloud/infra), performance improvement, sáng kiến mới. Ngoài ra còn có các KPI mềm: mentor junior, viết documentation, đóng góp cộng đồng. KPI ngân hàng thường rõ ràng và ổn định hơn fintech, nhưng có thể ít đột phá hơn.
Nên chọn TPBank hay các ngân hàng khác như Techcombank, MB để làm Data Platform?
Mỗi ngân hàng có thế mạnh riêng. Techcombank có hệ thống core banking hiện đại (đầu tư bởi McKinsey, AWS), văn hóa công nghệ cao, lương tốt nhưng áp lực lớn. MB có quy trình chuẩn hóa, môi trường chuyên nghiệp, đang đẩy mạnh chuyển đổi số. VPBank chú trọng data-driven, nhiều project AI/ML lớn. TPBank nổi bật với LiveBank (mobile-first), TPFusion (fintech), văn hóa đổi mới. Gợi ý: nếu bạn thích startup vibe trong ngân hàng, chọn TPBank. Nếu muốn học best practice chuẩn quốc tế, chọn Techcombank. Nếu muốn cơ hội thăng tiến nhanh, VPBank. Quan trọng là team và dự án cụ thể hơn thương hiệu ngân hàng.
Iceberg, Delta, Hudi nên học cái nào trước?
Theo xu hướng 2024-2026, mình gợi ý ưu tiên: (1) Delta Lake trước — vì Databricks phổ biến nhất, tài liệu tiếng Việt/Anh nhiều, job market rộng; (2) Apache Iceberg — đang tăng trưởng mạnh, được Netflix, Apple, LinkedIn sử dụng, hệ sinh thái rộng (Spark, Trino, Flink, Snowflake, Athena đều hỗ trợ); (3) Apache Hudi — vẫn phổ biến ở Uber, mạnh về streaming ingest. Nếu bạn apply vào TPBank, hãy xem JD của họ có nhắc cụ thể đến công nghệ nào không. Nếu không thì chọn Iceberg hoặc Delta, sau đó học thêm cái còn lại. Hai công nghệ này đủ tương đồng để chuyển đổi dễ dàng.
Tôi có 7 năm kinh nghiệm Data Engineer tại công ty product, chưa làm ngân hàng. Cơ hội được không?
Hoàn toàn có cơ hội. 7 năm Data Engineer là profile rất tốt. Tuy nhiên bạn cần chuẩn bị thêm: (1) Tìm hiểu đặc thù dữ liệu ngân hàng: giao dịch, KYC, tuân thủ NHNN, fraud detection; (2) Nhấn mạnh kinh nghiệm Spark + Lakehouse + production scale; (3) Chuẩn bị câu trả lời cho câu hỏi 'Tại sao muốn chuyển sang ngân hàng?' — gợi ý: muốn làm việc với dữ liệu critical, muốn hiểu domain finance, muốn cơ hội mentoring và leadership; (4) Trong phỏng vấn thể hiện bạn hiểu rủi ro ngân hàng khác với product (data quality, compliance, downtime cost). Nếu bạn đã từng làm fintech thì càng tốt vì gần với banking.