Bài viết liên quan
API Monitoring & Observability
API Monitoring and Observability
API Monitoring & Observability là gì?
Là tập hợp kỹ thuật giám sát liên tục, thu thập và phân tích trạng thái hệ thống API thông qua 3 trụ cột: Metrics (chỉ số định lượng), Logs (nhật ký sự kiện) và Traces (luồng xử lý phân tán). Đây là yêu cầu bắt buộc trong vận hành API Gateway ngân hàng theo mô hình SRE, giúp phát hiện sự cố trước khi ảnh hưởng khách hàng.
Chỉ số SLI/SLO chính
- Latency: p50, p95, p99 thời gian phản hồi mỗi endpoint
- Error rate: tỷ lệ HTTP 4xx (lỗi client) và 5xx (lỗi server)
- Throughput: số request/giây (RPS), peak load theo giờ cao điểm
- Availability: uptime %, tính bằng (1 - downtime/total time)
Ví dụ thực tế
Ngân hàng Techcombank vận hành API chuyển tiền 24/7 với cam kết SLA 99.99% và p99 latency dưới 200ms cho API truy vấn số dư. Hệ thống tích hợp Prometheus + Grafana cho metrics dashboard, ELK Stack (Elasticsearch-Logstash-Kibana) cho log tập trung, Jaeger/Zipkin cho distributed tracing xuyên suốt kiến trúc microservices (auth → fraud → core banking → notification). Mỗi request được gán trace_id duy nhất, giúp truy vết transaction trong tích tắc khi sự cố. Theo Thông tư 17/2024/TT-NHNN về hệ thống CNTT, tổ chức tín dụng phải giám sát 24/7, có cảnh báo sớm (alerting) và lưu trữ log tối thiểu 5 năm phục vụ kiểm toán NHNN và điều tra khi cần.