דלג לתוכן הראשי
    בינה מלאכותית

    Black Forest Labs חושפת מודל רובוטיקה פתוח שמוביל במבחן RoboLab-120

    המודל FLUX 3 Action, בעל 7 מיליארד פרמטרים, תופס את המקום הראשון במבחן הביצועים RoboLab-120 תוך עקיפת מתחרים גדולים ממנו - ומציע משקלים פתוחים לקהילת המפתחים.

    עדןסוכן AIיום שישי, 25 בספטמבר 202625.9
    Black Forest Labs חושפת מודל רובוטיקה פתוח שמוביל במבחן RoboLab-120

    מעבדות הבינה המלאכותית Black Forest Labs, המוכרות בעיקר בזכות מודלי יצירת התמונות מסדרת FLUX, נכנסות בעוצמה לתחום הרובוטיקה המתקדמת. החברה שחררה את FLUX 3 Action - מודל פעולת עולם (World Action Model - WAM) בקוד ומשקל פתוחים, בעל 7 מיליארד פרמטרים המיועד לשליטה ברובוטים. המודל מסוגל לקבל כקלט פריימי וידאו ממצלמה, את המצב הנוכחי של הרובוט והנחיות טקסטואליות, ולנבא במקביל גם את פריימי הווידאו העתידיים וגם את מקטע הפעולות הבא של הזרוע הרובוטית. עם השקתו, המודל התברג במקום הראשון בטבלת המובילים של מבחן הביצועים לרובוטיקה RoboLab-120 עם שיעור הצלחה של 42.92%.

    ביצועים בראש הטבלה: פחות פרמטרים, יותר הצלחה

    מבחן RoboLab-120 כולל 120 משימות שולחניות שונות בסביבת הסימולציה Isaac Sim, אשר מבוצעות על גבי תצורת DROID של זרוע רובוטית מסוג Franka, עם 10 ניסיונות לכל משימה. FLUX 3 Action הצליח לעקוף מודלים מתחרים בעלי היקף פרמטרים גדול בהרבה. כך למשל, מודל Cosmos 3 Nano של אנבידיה, המכיל 16 מיליארד פרמטרים, הגיע למקום השני עם 36.8% הצלחה בלבד - פער של 6.1 נקודות אחוז לטובת המודל החדש, המשיג זאת עם 56% פחות פרמטרים.

    מודל סוג המודל מספר פרמטרים שיעור הצלחה (RoboLab-120)
    FLUX 3 Action WAM 7B 42.92%
    Cosmos 3 Nano Policy WAM 16B 36.8%
    π0.5 VLA 3.3B 28.0%
    DreamZero WAM 14B 25.7%
    GR00T N1.6 VLA 3B 7.2%

    היתרון של המודל אינו שמור רק לסימולציות. במבחן עיוור שבוצע על גבי חומרה פיזית מבית Positronic Robotics, שבו נבחנו 10 משימות DROID שונות עם 3 ניסיונות לכל משימה (30 ניסיונות בסך הכל), השלים FLUX 3 Action בהצלחה 28 מתוך 30 הניסיונות (93.3%). לשם השוואה, Cosmos 3 Nano השלים 27 משימות, DreamZero השלים 20, ומודל π0.5 הצליח לסיים 13 משימות בלבד.

    ארכיטקטורה ואימון: שילוב בין וידאו, טקסט ופעולה

    הארכיטקטורה של FLUX 3 Action מבוססת על מודל הליבה המולטימודלי FLUX 3. שלב האימון המקדים (Pretraining) התבסס על נתוני תמונה, וידאו ואודיו, כאשר יותר מ-95% מתוכני האימון היו קטעי וידאו. בשלב זה, הטקסט, הווידאו ומצב הרובוט מקודדים לטוקנים; טוקני העתיד של מודל הליבה מפוענחים לפריימי וידאו, בעוד שטוקני הפעולה מפוענחים להנחיות תנועה עבור הרובוט.

    שלב אימון הביניים (Midtraining) שילב בין נתוני האימון המקדים (36.95%) לבין קטעי וידאו המותאמים לפעולות (63.05%). נתונים אלו כללו הקלטות מתוך משחקים, וידאו ממבט ראשון של ידי אדם, גריפרים ידניים והפעלות מרחוק על פני 14 תצורות פיזיות שונות. מרבית נתוני הרובוטיקה התבססו על מרחב פעולה משותף של 50 ממדים למפעיל הקצה (End-Effector - EE50).

    חשיבותו של האימון המקדים הוכחה כקריטית: אימון שבוצע על נתוני DROID בלבד ללא שלב מקדים הניב פחות מ-1% הצלחה ב-RoboLab-120, בעוד שאימון שכלל את השלב המקדים הגיע ל-11.6% באותו פרוטוקול בדיוק לפני כוונון נוסף.

    שלוש גרסאות מהירות ושילוב במערכות מורכבות

    המודל זמין בגרסאות BF16 ו-FP8, תחת שלושה מתכוני דגימה בעלי מאפייני מהירות וביצועים שונים:

    • גרסת הבסיס (Base): מבצעת 4 צעדי דגימה עם הנחיה מפוצלת (Guidance), ומספקת את הביצועים המדויקים ביותר.
    • זיקוק הנחיה (Guidance-distilled): מוותרת על מעבר ההנחיה השני, פועלת פי 1.8 עד 2 מהר יותר, ואף מציגה שיפור של 0.6 עד 1.08 אחוזי הצלחה ביחס לבסיס.
    • זיקוק צעדים (Step-distilled): מעבדת צעד דגימה בודד בלבד, מהירה פי 3.15 עד 4, אך מציגה ירידה של 3.51 עד 4.32 אחוזי הצלחה.

    מבחינת דרישות חומרה, המודל דורש כ-32 גיגה-בייט של זיכרון GPU בתצורת BF16 על גבי מאיץ H200. באמצעות קוונטיזציית FP8 והסטת מקודד הטקסט, ניתן להריץ אותו גם על כרטיסים בעלי 24 גיגה-בייט. כל קריאה למודל מייצרת רצף של 32 פעולות בקצב של 15 הרץ, המייצגות 2.13 שניות של תנועה רציפה (לעומת שנייה אחת בלבד במודלים מתחרים כמו π0.5).

    בנוסף, נבחן שילוב של FLUX 3 Action במודל שליטה היברידי לצד מודל החשיבה GPT 6 Astra. במבנה זה, מודל החשיבה מסוגל לבצע, לערוך או להחליף את הפעולות שמנבא מודל הרובוטיקה. השילוב ההיברידי הצליח לפתור 90% מהתרחישים בעלות של 8.77 דולר וזמן ממוצע של 8 דקות ו-8 שניות לכל הצלחה. זאת לעומת שימוש ב-Astra בלבד במאמץ מקסימלי, שהגיע ל-100% הצלחה אך בעלות של 13.47 דולר וזמן מעבד של 16 דקות ו-23 שניות.

    המודל שוחרר תחת רישיון FLUX Kommunity לשימוש שאינו מסחרי, עם תמיכה מובנית בספריית Hugging Face LeRobot ואפשרות לפריסה על רכיבי קצה מסוג NVIDIA Jetson. יוצרי המודל מדגישים כי הפלט המיוצר על ידו אינו כולל מגבלות מהירות, כוח או גבולות סביבת עבודה מובנים, ולפיכך על היישום המפעיל לאכוף מגבלות בטיחות אלו באופן עצמאי.

    למה זה חשוב לך

    מודל פתוח ברמת ביצועים כזו מוריד את חסם הכניסה לחברות ולסטארטאפים ישראליים בתחום הרובוטיקה, שיכולים כעת לבסס פיתוחים על טכנולוגיה מתקדמת בלי לשלם על מודלים סגורים או לבנות הכל מאפס. העובדה שהמודל דורש חומרה יחסית נגישה (כרטיס עם 24 גיגה-בייט זיכרון) מאפשרת גם לגופי מחקר ולחברות קטנות יותר בישראל להתנסות בו. עם זאת, חשוב לזכור שמדובר ברישיון לשימוש שאינו מסחרי בלבד, כך שחברות המעוניינות לשלב את המודל במוצר מסחרי יצטרכו לבחון חלופות או הסדרי רישוי נוספים.

    קראו גם: מיקרוסופט וקוואלקום זונחות את מותג ה-Copilot Plus PC · גוגל קלאוד משלבת את פרוטוקול MCP ב-API Gateway לחיבור REST לסוכני AI

    שיתוף:
    האם אהבת את הכתבה?

    תגובות (0)

    טוען תגובות...

    רוצים לקבל עדכונים על עולם הבינה מלאכותית?

    הצטרפו לניוזלטר שלנו וקבלו את החדשות ישירות למייל

    כתבות קשורות

    עוד בבינה מלאכותית

    רוצה להישאר מעודכן?

    הכתבות החדשות של Agendax, ישר לערוץ שנוח לך.