Vận hành
Kiểm tra hằng ngày. Tooling sâu hơn (K9s, scaling, DB ops) ở Infrastructure → Operations.
Kiểm tra sức khỏe
| Kiểm tra | Cách |
|---|---|
| Services | kubectl get pods -n nx-backend - tất cả Running / Ready? |
| Queue (BullMQ) | Kafka UI / Redis - backlog confirmation/scheduler có rút không? |
| Database | pooler tới được; số connection không bão hòa (data-layer) |
| Cache (Redis) | tới được; memory không chạm maxmemory |
| Search (Typesense) | collection khỏe; CDC connector (Debezium) lag thấp |
| WebSocket (signal) | client kết nối được; Redis pub/sub thông |
| Version | khớp giữa các môi trường - Platform Facts → versions (drift alpha vs staging được flag ở đó) |
Tác vụ thường lệ
- Restart service:
kubectl rollout restart deploy/<svc> -n nx-backend. - Scale:
kubectl scale deploy/<svc> --replicas=<n>- hướng dẫn ở infra → Scaling. - Log: infra → Logs (K9s /
kubectl logs). - DB operations: infra → Database Operations.
Backup & restore
Kiểm chứng câu chuyện backup
Staging hiện chưa có backup DB ngoài cluster trong khi doc deploy ngụ ý CNPG đang chạy - cần hòa giải trước khi dựa vào restore. Mục tiêu RPO ≤ 15 phút (xem SLO).
SOP restore (khi đã xác nhận backup): dừng writer → restore base backup mới nhất + WAL tới điểm đích → re-point pooler → verify → resume. Tập trước khi cần.