หลังได้ของ · ความเสี่ยง

ระบบล่มได้เสมอ — เตรียมแผนไว้

ไม่มีระบบไหนในโลกที่ "ไม่มีทางล่ม" — แม้แต่เว็บยักษ์ใหญ่ก็เคยล่ม. คำถามไม่ใช่ "จะล่มไหม" แต่คือ "ล่มแล้วเราพร้อมแค่ไหน"

หน้านี้สำหรับใคร

สำหรับเจ้าของธุรกิจที่ระบบเริ่มสำคัญต่อรายได้ — จะได้เข้าใจความเสี่ยงและเตรียมแผนไว้ก่อนเกิดเหตุจริง

⏱️
อ่าน 20 วินาที: ไม่มีระบบไหนไม่มีทางล่ม — โฟกัสที่ ‘ล่มแล้วพร้อมแค่ไหน’ มี Backup, ช่องทางสำรอง และระบบเตือนไหม
ทำไมล่มได้ของคนอื่นพังเราพังด้วยUptime & SLAเตรียมแผน
ทำไมระบบถึงล่มได้ why systems fail

ระบบล่มได้จากหลายเหตุ — คนเข้าเยอะเกินรับ, server มีปัญหา, อัปเดตแล้วพลาด, ไฟดับ/เน็ตล่มที่ศูนย์ข้อมูล. บางอย่างคุมได้ บางอย่างคุมไม่ได้ เลยต้อง "เตรียมรับ" มากกว่า "หวังว่าจะไม่เกิด"

ตัวอย่างจริงวันโปรโมชั่นใหญ่ คนแห่เข้าพร้อมกันหมื่นคน — ระบบที่ปกติไหวกลับรับไม่ทันแล้วล่มตอนพีคที่สุด ทั้งที่วันธรรมดาไม่เคยมีปัญหา
ของคนอื่นพัง เราพังด้วย dependencies

ระบบสมัยนี้ พึ่งบริการของคนอื่นเยอะ — ระบบจ่ายเงิน, ส่ง SMS, แผนที่, cloud. ถ้าของเจ้าพวกนั้นล่ม ระบบเราก็ทำงานส่วนนั้นไม่ได้ตามไปด้วย แม้โค้ดเราไม่ผิดเลย. นี่เป็นความเสี่ยงที่หลีกเลี่ยงยาก

ความจริง
เราพึ่งของคนอื่น = รับความเสี่ยงของเขามาด้วยส่วนหนึ่ง — ทางออกคือออกแบบให้ "ส่วนที่พังกระทบเฉพาะส่วนนั้น" ไม่ใช่ล่มทั้งระบบ
Uptime & SLA คืออะไร uptime & sla

Uptime คือสัดส่วนเวลาที่ระบบใช้งานได้ (เช่น 99.9%). SLA คือข้อตกลงว่าผู้ให้บริการรับประกัน uptime แค่ไหน. ดูตารางขวาจะเห็นว่า "เลขสวย ๆ ก็ยังล่มได้" — แต่ละ 9 ที่เพิ่มแปลว่าเวลาล่มลดลง ~10 เท่า และค่าใช้จ่ายเพิ่มขึ้นมาก. สำหรับธุรกิจส่วนใหญ่ 99.9% พอ ไม่ต้องไล่ล่า 100% ที่ไม่มีจริง

99.9% แปลว่าล่มได้แค่ไหน
Uptimeล่มได้ / เดือนล่มได้ / ปี
99%~7.2 ชม.~3.6 วัน
99.9%~43 นาที~8.8 ชม.
99.99%~4.3 นาที~53 นาที
แถวฟ้าคือระดับที่ผู้ให้บริการ cloud ทั่วไปรับประกัน — ดีพอสำหรับ SME ส่วนใหญ่
เตรียมแผนรับมือ have a plan

สิ่งที่เจ้าของธุรกิจทำได้คือ มีแผนสำรอง — รู้ล่วงหน้าว่าระบบล่มแล้วจะทำยังไง ก่อนที่มันจะล่มจริง. เช็กลิสต์ข้างล่างคือสิ่งที่ควรเตรียมไว้ ติ๊กให้ครบก่อนวันที่ระบบเริ่มสำคัญต่อรายได้

  • Backup อัตโนมัติ + เคยลองกู้คืนจริงbackup ที่ไม่เคยทดสอบกู้ = ยังไม่นับว่ามี backup
  • ช่องทางสำรองรับออเดอร์แชท / โทร / ฟอร์มกระดาษ ใช้ชั่วคราวตอนเว็บล่ม
  • เบอร์ติดต่อผู้ให้บริการอยู่ในมือcloud / payment / โดเมน — รู้ว่าโทรหาใคร ไม่ใช่มานั่งหาตอนไฟไหม้
  • Monitoring เตือนเข้ามือถือรู้เองว่าระบบล่ม ไม่ใช่รู้ตอนลูกค้าโทรมาด่า
  • หน้า "ขออภัยระบบขัดข้อง" เตรียมไว้ดีกว่าปล่อยจอขาว/error ดิบ ๆ ให้ลูกค้าเห็น
  • รู้ว่าใครเป็นคนแก้ และติดต่อได้นอกเวลางานไหมระบบมักล่มตอนกลางคืน/วันหยุดที่คนใช้เยอะ

สรุปสั้น ๆ

ทำไมล่มคนเยอะ/server/อัปเดต/เหตุสุดวิสัย
Dependencyของคนอื่นล่ม เรากระทบตาม
Uptimeไม่มี 100% — 99.9% ยังล่มได้บ้าง
เตรียมBackup + ช่องทางสำรอง + Monitoring
กลับห้องสมุด
พี่ปุ้ย ปริวรรตน์ อรุโณทยานันท์ ผู้สอนสร้างระบบธุรกิจด้วย AI
คิด เขียน และเป็นเจ้าของไอเดียเว็บนี้โดย พี่ปุ้ย ปริวรรตน์ อรุโณทยานันท์
ผู้เชี่ยวชาญวางระบบองค์กร & AI — สอนเจ้าของกิจการสร้างระบบของตัวเองมากกว่า 400 คน
ประวัติพี่ปุ้ย ·  ดูคอร์ส →