Skip to content

Runbook

Hướng dẫn vận hành nội bộ BANA - cho developer, ops/SRE và support. Cơ chế sâu nằm ở Infrastructure; runbook này là lớp "làm gì ngay bây giờ" bên trên.

Chỉ dùng nội bộ

Quy trình vận hành, playbook sự cố, luồng hỗ trợ. Không chia sẻ ra ngoài NEXPANDO.

Các phần

PhầnMục đíchĐối tượng chính
Triển khaiDeploy, rollback, migrationDev, Ops
Vận hànhKiểm tra hằng ngày: service, queue, DB, cache, logOps, On-call
Sự cốTriage + playbook outageOn-call, Ops
Hỗ trợTriage khách hàng + fix thường gặpSupport

Mức độ nghiêm trọng & on-call

MứcNghĩaMục tiêu phản hồiĐường
S0Outage toàn bộ - API chết, mất DB, thanh toán hỏng toàn cụcxác nhận ≤ 15 phút, all-handsOn-call → Incident Commander → Eng lead
S1Suy giảm lớn - một service chết, lỗi caoxác nhận ≤ 30 phútOn-call → chủ service
S2Nhỏ - một tính năng suy giảm, không ảnh hưởng tiềnngày làm việc kếchủ service
S3Mỹ phẩmbacklog-

Escalation: On-call → Incident Commander (luân phiên) → Eng lead → CTO.

Lịch on-call, pager và roster IC do đội sở hữu, track ngoài wiki (không để contact trong repo).

Mức dịch vụ (đề xuất - chờ chốt)

Đề xuất, chưa cam kết

BANA chưa có SLO nội bộ được chốt. Các mục tiêu dưới là đề xuất khởi điểm để đội thống nhất - không phải cam kết.

Mục tiêuĐề xuấtGhi chú
Availability API99.5% / thángtrừ bảo trì có kế hoạch
Latency (p95)< 500 msđường đọc/ghi lõi
RTO (thời gian phục hồi)≤ 1 giờkhôi phục service sau S0
RPO (mất dữ liệu)≤ 15 phútnhịp backup DB phải đạt mức này

Quy ước

  • Mức S0/S1/S2/S3 (ở trên). Lệnh copy-paste được; placeholder dùng <ngoặc-nhọn>.
  • Viết ngắn, dạng recipe; link Infrastructure cho chi tiết.

Proprietary and Confidential. Unauthorized copying, distribution, or use of this software is strictly prohibited.