ไม่มีระบบไหนในโลกที่ "ไม่มีทางล่ม" — แม้แต่เว็บยักษ์ใหญ่ก็เคยล่ม. คำถามไม่ใช่ "จะล่มไหม" แต่คือ "ล่มแล้วเราพร้อมแค่ไหน"
สำหรับเจ้าของธุรกิจที่ระบบเริ่มสำคัญต่อรายได้ — จะได้เข้าใจความเสี่ยงและเตรียมแผนไว้ก่อนเกิดเหตุจริง
ระบบล่มได้จากหลายเหตุ — คนเข้าเยอะเกินรับ, server มีปัญหา, อัปเดตแล้วพลาด, ไฟดับ/เน็ตล่มที่ศูนย์ข้อมูล. บางอย่างคุมได้ บางอย่างคุมไม่ได้ เลยต้อง "เตรียมรับ" มากกว่า "หวังว่าจะไม่เกิด"
ระบบสมัยนี้ พึ่งบริการของคนอื่นเยอะ — ระบบจ่ายเงิน, ส่ง SMS, แผนที่, cloud. ถ้าของเจ้าพวกนั้นล่ม ระบบเราก็ทำงานส่วนนั้นไม่ได้ตามไปด้วย แม้โค้ดเราไม่ผิดเลย. นี่เป็นความเสี่ยงที่หลีกเลี่ยงยาก
Uptime คือสัดส่วนเวลาที่ระบบใช้งานได้ (เช่น 99.9%). SLA คือข้อตกลงว่าผู้ให้บริการรับประกัน uptime แค่ไหน. ดูตารางขวาจะเห็นว่า "เลขสวย ๆ ก็ยังล่มได้" — แต่ละ 9 ที่เพิ่มแปลว่าเวลาล่มลดลง ~10 เท่า และค่าใช้จ่ายเพิ่มขึ้นมาก. สำหรับธุรกิจส่วนใหญ่ 99.9% พอ ไม่ต้องไล่ล่า 100% ที่ไม่มีจริง
| Uptime | ล่มได้ / เดือน | ล่มได้ / ปี |
|---|---|---|
| 99% | ~7.2 ชม. | ~3.6 วัน |
| 99.9% | ~43 นาที | ~8.8 ชม. |
| 99.99% | ~4.3 นาที | ~53 นาที |
สิ่งที่เจ้าของธุรกิจทำได้คือ มีแผนสำรอง — รู้ล่วงหน้าว่าระบบล่มแล้วจะทำยังไง ก่อนที่มันจะล่มจริง. เช็กลิสต์ข้างล่างคือสิ่งที่ควรเตรียมไว้ ติ๊กให้ครบก่อนวันที่ระบบเริ่มสำคัญต่อรายได้
| ทำไมล่ม | คนเยอะ/server/อัปเดต/เหตุสุดวิสัย |
| Dependency | ของคนอื่นล่ม เรากระทบตาม |
| Uptime | ไม่มี 100% — 99.9% ยังล่มได้บ้าง |
| เตรียม | Backup + ช่องทางสำรอง + Monitoring |