YAPIO
בית
אינטגרציות
שיטה
בלוג
צור קשר
בקשת אבחון טכני
חזרה לבלוג

אחסון AI

חוות אחסון ל-AI: Ceph, Lustre ו-NVMe, איך לבחור

GPU מורעבים הם החומרה הבטלה היקרה ביותר במרכז הנתונים שלכם. שכבת האחסון קובעת אם המאיצים מחשבים או מחכים.

שרתי אחסון עם מערכי דיסקים

נכתב על ידי

YAPIO

פורסם ב־

19 ביולי 2026

𝕏

תוכן עניינים

  • התחילו מפרופילי I/O, לא מעלוני שיווק
  • Ceph, Lustre, NVMe-oF: לבחור לפי תפקיד
  • כללי תכנון שמונעים חרטה

התחילו מפרופילי I/O, לא מעלוני שיווק

אחסון AI נכשל כשמתכננים אותו לפי קיבולת במקום לפי התנהגות. אפוקים של אימון קוראים מיליוני קבצים קטנים או shards רציפים גדולים, תלוי ב-data loader. checkpoint של מודל גדול כותב בפרץ עשרות עד מאות ג׳יגה-בייט, מכל הצמתים בבת אחת, במרווח קבוע. הסקה רוצה קריאות בהשהיה נמוכה של משקולות באתחול וכמעט אפס I/O אחר כך. שלושה פרופילים, שלוש ארכיטקטורות מנצחות שונות.

מדדו לפני שקונים: לכדו דפוסי קריאה מריצת אימון אמיתית, רשמו גודל ותדירות checkpoints, וקבעו יעד ניצול GPU בזמן טעינת נתונים. חווה שבה המאיצים מחכים לאחסון 20 אחוז מהזמן איבדה בשקט חמישית מהתקציב.

Ceph, Lustre, NVMe-oF: לבחור לפי תפקיד

Lustre הוא מערכת הקבצים המקבילית המובילה לתפוקה רציפה גדולה: מאות ג׳יגה-בייט לשנייה על פני לקוחות רבים, אידאלי ל-shards גדולים של אימון ולפרצי checkpoints. המחיר שלו: מומחיות תפעולית ופחות נוחות בסערות מטא-נתונים של קבצים קטנים. Ceph הוא החנות הכללית הרב-תכליתית: אובייקט (תואם S3), בלוק וקובץ מאשכול אחד, מרפא את עצמו, מוכר היטב לצוותי פלטפורמה. הוא מצוין ל-data lakes ולניהול גרסאות של datasets, אבל דורש תכנון קפדני (OSD על NVMe, erasure coding נכון) כדי להאכיל צמתי אימון רעבים.

NVMe-oF אינו מערכת קבצים אלא שכבת תעבורה: הוא חושף flash מרוחק בהשהיה כמעט מקומית. השתמשו בו כשכבה חמה: scratch מקומי לאפוק הפעיל, אזור נחיתה ל-checkpoints לפני ניקוז אסינכרוני ל-Ceph או Lustre. הדפוס הבוגר הוא מדורג: NVMe חם, FS מקבילי פושר, אחסון אובייקטים קר, עם אוטומציית מחזור חיים שמזיזה נתונים במקום מהנדסים.

כללי תכנון שמונעים חרטה

שלושה כללים מהשטח. ראשית, תכננו רוחב פס לפרצי checkpoint, לא לעומס ממוצע: אם 64 צמתים מרוקנים כל אחד 4 GB בחלון ה-checkpoint, נתיב הכתיבה חייב לספוג זאת, אחרת האימון נתקע בכל האשכול. שנית, אל תתנו לקיבולת לעבור 70 אחוז בשכבה החמה; איזון מחדש ושחזור צריכים מרווח בדיוק כשאין לכם. שלישית, תכננו את סיפור הצמיחה מהיום הראשון: datasets משתלשים מהר יותר ממחזורי רכש, אז בחרו מערכות שגדלות בהוספת צמתים, לא בהחלפה מלאה.

חוות אחסון שמתוכננת כך אינה מרכז עלות שמוצמד לתקציב ה-GPU. היא מה ששומר על תקציב ה-GPU כן. YAPIO מתכננת את שכבת האחסון מעקבות ה-I/O האמיתיות שלכם, באותה ביקורת שמתכננת חישוב ו-fabric.

YAPIO Logo

תשתית מחשוב ריבונית: מאבחון ועד תפעול, עם העברת ידע מלאה.

© 2026 YAPIO. כל הזכויות שמורות

Yapio AI Installation

  • חוות GPU
  • חוות AI
  • אשכול HPC
  • חוות אחסון
  • חוות Kubernetes
  • חווה היברידית
  • contact@yapio.io
  • לינקדאין
מדיניות פרטיותתנאי שימוש