Ceph, Lustre, NVMe-oF, tiering
GPU שמחכה לנתונים הוא GPU שאתם משלמים עליו בחינם
אחסון הוא צוואר הבקבוק הכי מוערך בחסר בתשתיות AI ו-HPC. אנחנו מתכננים חוות אחסון שהתפוקה שלהן נמדדת לפי המשימות שלכם, לא לפי דף מפרט.
מקרי שימוש
- הזנת אשכולות GPU: מערכי נתונים, shuffling, checkpoints מסיביים
- Scratch מקבילי לקמפיינים HPC עתירי I/O
- Data lake מקומי: קליטה, ארכיון ותאימות
- גיבוי והתאוששות מאסון עם שכפול רב-אתרי
ארכיטקטורת ייחוס
- שכבה חמה
- NVMe מקומי או NVMe-oF ל-scratch ו-checkpoints: השהיה מזערית, הכי קרוב ל-compute.
- מקבילי
- Lustre או BeeGFS לתפוקה מצטברת רב-צמתית: מאות GB/s מתמשכים.
- קיבולת
- Ceph (בלוק, אובייקט S3, קובץ) לקיבולת עמידה ו-tiering אוטומטי.
- הגנה
- Erasure coding, snapshots, שכפול אסינכרוני רב-אתרי והצפנה במנוחה.
מה תקבלו
- 01
מחקר I/O על המשימות האמיתיות שלכם: פרופילי קריאה / כתיבה, יעדי תפוקה
- 02
חווה פרוסה ונבדקת (fio, IOR, mdtest)
- 03
מדיניות tiering, snapshots ושמירה מוגדרת
- 04
Runbook תפעולי והדרכה
שאלות נפוצות
- Ceph או Lustre ל-AI?
- Lustre מנצח בתפוקה מקבילית גולמית לאימון בקנה מידה גדול; Ceph מנצח בגמישות (S3, בלוק, קובץ) ובעמידות תפעולית. חוות רבות משלבות את שניהם בשכבות. מחקר ה-I/O מכריע עם המספרים שלכם.
- מה הנפח המינימלי שהופך את זה לרלוונטי?
- מכמה מאות טרה-בייט פעילים, או ברגע שאחסון בענן עולה על כמה אלפי אירו בחודש, כדאי לתמחר חווה ייעודית. עמלות egress של הענן מטות את הכף מוקדם מהצפוי.