CSP Networks
שני קישורים ושני מתגים עדיין לא מבטיחים שרידות
איך לזהות נקודות כשל משותפות ברשת ארגונית גם כאשר הציוד כפול: תוואים, חשמל, Routing, DNS, זהויות, Firewall, ספקי תקשורת ותפעול.
שרידות אמיתית אינה נמדדת במספר הרכיבים הכפולים אלא במספר נקודות הכשל שנותרו משותפות. ארגון יכול להחזיק שני מתגים, שני Firewalls ושני קישורים ועדיין להיות תלוי באותו תוואי, אותו חשמל, אותו Routing Domain או אותו רכיב ניהול.
שירותים הקשורים לנושא
- רשתות תקשורת ארגוניות - ארכיטקטורה לרשתות LAN, WAN, SD-WAN ו-Wi-Fi - ביצועים, סגמנטציה, שרידות ואבטחה על בסיס דרישות מדידות.
- ארכיטקטורת סייבר ואבטחת תשתיות - ארכיטקטורת סייבר המשלבת בקרת גישה, סגמנטציה, זהויות, ניטור, גישה מרחוק ושרידות בתכנון המערכת.
- ייעוץ אסטרטגי וארכיטקטורה טכנולוגית - ארכיטקטורת יעד, מפת דרכים, ניתוח חלופות, סיכונים והצדקת השקעה לפני פרויקט משמעותי.
העיקרון: Redundancy אינה זהה ל-Resilience
Redundancy מוסיפה רכיב חלופי. Resilience בודקת האם השירות ממשיך לפעול כאשר כשל אמיתי מתרחש. ההבדל ביניהם נמצא בדרך כלל בתלויות המשותפות שאינן נראות בתרשים ברמת הציוד.
לכן בדיקת שרידות צריכה להתחיל מהשירות העסקי ולנוע אחורה דרך האפליקציה, השרתים, הרשת, האבטחה, ה-DNS, ספקי התקשורת והמתקן.
1. בודקים תוואי פיזי ולא רק ספק
שני ספקי תקשורת יכולים לעבור באותה תעלה, אותו פיר או אותו אתר ביניים. מבחינה מסחרית קיימים שני חוזים, אבל מבחינה פיזית עדיין קיימת נקודת כשל אחת.
באתרים קריטיים נכון להבין את מסלול הכניסה למבנה, נקודות המעבר, חדרי התקשורת והאם קיימת הפרדה אמיתית בין התוואים.
2. בודקים את ה-Control Plane
כפילות חומרה אינה מספיקה אם שני הרכיבים תלויים באותו Control Plane, אותו Controller, אותו Cluster או אותה מערכת ניהול. כשל תוכנה, שינוי תצורה שגוי או תקלה לוגית עלולים להשפיע על שני הצדדים יחד.
נדרש להבין כיצד מתבצעים Failover, סנכרון, עדכונים ושינויים, ואילו תרחישים עלולים להפוך את הכפילות לתלות משותפת.
3. DNS, Identity ו-Security Services הם חלק מהשרידות
שירותים רבים תלויים ב-DNS, Active Directory, PKI, NAC, Firewall, Proxy או שירותי אימות. אם אחד מהם אינו זמין, הרשת יכולה להיות פעילה פיזית אך השירות העסקי עדיין אינו נגיש.
לכן תכנון שרידות חייב לכלול גם שירותי תשתית משותפים ולא רק Switching ו-Routing.
4. בודקים Maintenance Failure ולא רק Hardware Failure
חלק גדול מההשבתות נגרם במהלך שינוי, שדרוג או תחזוקה. אם שני צדדי המערכת מתעדכנים באותו חלון או תלויים באותה פעולה ידנית, הכפילות אינה מגינה מפני טעות תפעולית.
שרידות טובה כוללת Rollback, שינוי מדורג, הפרדת חלונות תחזוקה ובדיקות שמוודאות שהצד החלופי באמת מסוגל לשאת את השירות.
5. Failover שלא תורגל הוא הנחה
מנגנון יתירות שלא נבדק בתנאי אמת נשאר תכנון תיאורטי. בדיקה טובה כוללת ניתוק מבוקר של קישור, רכיב, ספק או אתר ובדיקה שהשירות נשאר זמין בזמן ובאיכות הנדרשים.
יש למדוד לא רק אם החיבור חזר, אלא גם זמן מעבר, אובדן Sessions, השפעה על יישומים ונראות תפעולית בזמן האירוע.
מסגרת הבדיקה של CSP Networks
- תוואי פיזי וספקי תקשורת
- חשמל, UPS וחדרי תקשורת
- Switching, Routing ו-Control Plane
- Firewalls ושירותי אבטחה
- DNS, DHCP, Identity ו-PKI
- Controllers ומערכות ניהול
- תהליכי שינוי, שדרוג ו-Rollback
- תרגול Failover מקצה לקצה
השורה התחתונה
שני רכיבים אינם בהכרח שתי מערכות בלתי תלויות. השרידות האמיתית נקבעת לפי התלות המשותפת החלשה ביותר שנשארה בשרשרת השירות.
המטרה בתכנון רשת אינה להכפיל כל רכיב, אלא לזהות אילו כשלים באמת יכולים להשבית שירות ולבנות עבורם חלופה שנבדקה בפועל.
להעמקה ולקבלת החלטה
- 10 בדיקות לפני החלפת רשת התקשורת - Checklist לתכנון רשת חדשה לפני בחירת ציוד.
- רשתות תקשורת ארגוניות - תכנון ארכיטקטורה, שרידות, סגמנטציה וקישוריות.
מקורות מקצועיים
- NIST SP 800-160 Vol. 2 Rev. 1 - Developing Cyber-Resilient Systems - עקרונות לתכנון מערכות עמידות, שמירה על פונקציות קריטיות והתאוששות מכשל.