CSP Networks

שני קישורים ושני מתגים עדיין לא מבטיחים שרידות

איך לזהות נקודות כשל משותפות ברשת ארגונית גם כאשר הציוד כפול: תוואים, חשמל, Routing, DNS, זהויות, Firewall, ספקי תקשורת ותפעול.

שרידות אמיתית אינה נמדדת במספר הרכיבים הכפולים אלא במספר נקודות הכשל שנותרו משותפות. ארגון יכול להחזיק שני מתגים, שני Firewalls ושני קישורים ועדיין להיות תלוי באותו תוואי, אותו חשמל, אותו Routing Domain או אותו רכיב ניהול.

שירותים הקשורים לנושא

העיקרון: Redundancy אינה זהה ל-Resilience

Redundancy מוסיפה רכיב חלופי. Resilience בודקת האם השירות ממשיך לפעול כאשר כשל אמיתי מתרחש. ההבדל ביניהם נמצא בדרך כלל בתלויות המשותפות שאינן נראות בתרשים ברמת הציוד.

לכן בדיקת שרידות צריכה להתחיל מהשירות העסקי ולנוע אחורה דרך האפליקציה, השרתים, הרשת, האבטחה, ה-DNS, ספקי התקשורת והמתקן.

1. בודקים תוואי פיזי ולא רק ספק

שני ספקי תקשורת יכולים לעבור באותה תעלה, אותו פיר או אותו אתר ביניים. מבחינה מסחרית קיימים שני חוזים, אבל מבחינה פיזית עדיין קיימת נקודת כשל אחת.

באתרים קריטיים נכון להבין את מסלול הכניסה למבנה, נקודות המעבר, חדרי התקשורת והאם קיימת הפרדה אמיתית בין התוואים.

2. בודקים את ה-Control Plane

כפילות חומרה אינה מספיקה אם שני הרכיבים תלויים באותו Control Plane, אותו Controller, אותו Cluster או אותה מערכת ניהול. כשל תוכנה, שינוי תצורה שגוי או תקלה לוגית עלולים להשפיע על שני הצדדים יחד.

נדרש להבין כיצד מתבצעים Failover, סנכרון, עדכונים ושינויים, ואילו תרחישים עלולים להפוך את הכפילות לתלות משותפת.

3. DNS, Identity ו-Security Services הם חלק מהשרידות

שירותים רבים תלויים ב-DNS, Active Directory, PKI, NAC, Firewall, Proxy או שירותי אימות. אם אחד מהם אינו זמין, הרשת יכולה להיות פעילה פיזית אך השירות העסקי עדיין אינו נגיש.

לכן תכנון שרידות חייב לכלול גם שירותי תשתית משותפים ולא רק Switching ו-Routing.

4. בודקים Maintenance Failure ולא רק Hardware Failure

חלק גדול מההשבתות נגרם במהלך שינוי, שדרוג או תחזוקה. אם שני צדדי המערכת מתעדכנים באותו חלון או תלויים באותה פעולה ידנית, הכפילות אינה מגינה מפני טעות תפעולית.

שרידות טובה כוללת Rollback, שינוי מדורג, הפרדת חלונות תחזוקה ובדיקות שמוודאות שהצד החלופי באמת מסוגל לשאת את השירות.

5. Failover שלא תורגל הוא הנחה

מנגנון יתירות שלא נבדק בתנאי אמת נשאר תכנון תיאורטי. בדיקה טובה כוללת ניתוק מבוקר של קישור, רכיב, ספק או אתר ובדיקה שהשירות נשאר זמין בזמן ובאיכות הנדרשים.

יש למדוד לא רק אם החיבור חזר, אלא גם זמן מעבר, אובדן Sessions, השפעה על יישומים ונראות תפעולית בזמן האירוע.

מסגרת הבדיקה של CSP Networks

  • תוואי פיזי וספקי תקשורת
  • חשמל, UPS וחדרי תקשורת
  • Switching, Routing ו-Control Plane
  • Firewalls ושירותי אבטחה
  • DNS, DHCP, Identity ו-PKI
  • Controllers ומערכות ניהול
  • תהליכי שינוי, שדרוג ו-Rollback
  • תרגול Failover מקצה לקצה

השורה התחתונה

שני רכיבים אינם בהכרח שתי מערכות בלתי תלויות. השרידות האמיתית נקבעת לפי התלות המשותפת החלשה ביותר שנשארה בשרשרת השירות.

המטרה בתכנון רשת אינה להכפיל כל רכיב, אלא לזהות אילו כשלים באמת יכולים להשבית שירות ולבנות עבורם חלופה שנבדקה בפועל.

להעמקה ולקבלת החלטה

מקורות מקצועיים