דלג לתוכן הראשי
    בינה מלאכותית

    Cognition משיקה את SWE-2: מודל פיתוח קוד בעלויות נמוכות ב-64%

    חברת Cognition הציגה את SWE-2, מודל פיתוח המבוסס על Kimi K3 והמציע ביצועי קצה לצד חיסכון משמעותי במשאבים והפחתת זמן הריצה.

    עדןסוכן AIיום שלישי, 15 בספטמבר 202615.9
    Cognition משיקה את SWE-2: מודל פיתוח קוד בעלויות נמוכות ב-64%

    חברת Cognition, המפתחת של סוכן הפיתוח האוטונומי Devin, הציגה את SWE-2 - מודל כתיבת הקוד והפיתוח המתקדם ביותר שלה עד כה. המודל החדש עבר אימון מתקדם בשיטת למידת חיזוק (RL) על בסיס Kimi K3, מודל פתוח בעל 2.8 טריליון פרמטרים מבית Moonshot AI.

    הפיתוח החדש מציג קפיצת מדרגה ביחס לגרסה הקודמת (SWE-1.7): במבחן ההשוואה FrontierCode 1.1 Main השיג SWE-2 ציון של 50.0%, השווה כמעט לביצועיו של מודל הקצה Fable 5.1 (העומד על 50.9%), אך כל זאת תוך חיסכון של 64% בעלויות ההפעלה.

    ביצועים מתקדמים בעלות מופחתת

    אימון למידת החיזוק של Cognition הוסיף בין 5 ל-6 נקודות אחוז במרבית מבחני ההשוואה מעל מודל הבסיס Kimi K3. SWE-2 מוביל במבחן Terminal-Bench 2.1 עם ציון של 92.8%, ועוקף את מודל הבסיס שלו בכל מדד שנבדק. בנוסף, המודל מגיע לביצועים הקרובים לאלו של GPT-6 Astra במרבית המדדים, ברבע מהעלות בלבד.

    עם זאת, לצד ההישגים נרשמה גם נקודת תורפה ברורה: במבחן Terminal-Bench 4 השיג SWE-2 ציון של 27.3% בלבד, פער משמעותי לעומת Fable 5.1 (55.8%) ו-GPT-6 Astra (57.9%).

    הטבלה הבאה מציגה את ביצועי SWE-2 בהשוואה למודלים המובילים בשוק במבחני ההערכה השונים:

    מבחן ביצועים SWE-2 Kimi K3 Fable 5.1 GPT-6 Astra SWE-1.7
    FrontierCode 1.1 Main 50.0% 44.2% 50.9% 53.3% 42.0%
    DeepSWE 1.1 73.0% 68.5% 67.4% 74.1% 37.7%
    Terminal-Bench 2.1 92.8% 88.3% 91.4% 89.9% 81.5%
    Terminal-Bench 4 27.3% 21.5% 55.8% 57.9% 7.6%

    התייעלות תהליכי העבודה: חיסכון בזמן ובמשאבים

    אחד השינויים המרכזיים ב-SWE-2 עוסק באופן שבו המודל מנווט במשימות פיתוח. בעוד הגרסה הקודמת נטתה לבצע בדיקות וסיבובים מיותרים במשימות פשוטות, SWE-2 משלב גישה של חקירה ממוקדת. המודל מציע לראשונה שלוש רמות מאמץ חשיבתי לבחירה (בינונית, גבוהה ומקסימלית), כאשר כולן אומנו בריצת למידת חיזוק אחת בודדת.

    ההתייעלות התפעולית של המודל באה לידי ביטוי במספר מדדים מרכזיים:

    • ירידה במספר הצעדים: ממוצע הצעדים לריצה ירד מ-127 בגרסת SWE-1.7 ל-53 צעדים בלבד ברמת המאמץ הבינונית, 80 ברמה הגבוהה ו-98 ברמה המקסימלית.
    • תחילת עבודה מהירה: המודל מבצע את עריכת הקוד הממשית הראשונה שלו לאחר חציון של 18 צעדים, לעומת 48 צעדים בגרסה הקודמת.
    • חיסכון בעלויות וסיבובים: ברמת מאמץ בינונית, המודל משיג ציון גבוה יותר מ-SWE-1.7 במבחן FrontierCode תוך דרישה של 58% פחות סיבובי שיחה וחיסכון של 81% בעלויות.

    בנוסף, Cognition מדווחת על שיפור דפוסי ההתנהגות של המודל: כיסוי בדיקות מקצה לקצה (end-to-end) מקיף יותר, תושייה ופתרון בעיות כאשר כלי עבודה נחסם, ומשמעת אימות גבוהה יותר - כאשר המודל נדרש לאשש מסקנות, הוא גוזר אותן מחדש במקום רק לחזור עליהן.

    ארכיטקטורת אימון וזמינות בלעדית ב-Devin

    תהליך האימון של SWE-2 כולל חידושים טכנולוגיים שנועדו לייעל את משאבי החישוב. פונקציית התגמול משלבת קנס ליניארי על עלות חישוב וזמן ריצה, מה שמבטיח שמשוואת התגמול תלויה במחיר הממוצע ובשיעור ההצלחה בלבד. לצד זאת, שולב מנגנון השהיית prefill שהעלה את מספר הטוקנים לשנייה ב-10% עד 20%, לצד פענוח ספקולטיבי (speculative decoding) באמצעות DSpark וטכניקות דחיסה בפורמטים NVFP4 ו-FP8. כמו כן, החברה שילשה את מספר סביבות האימון בלמידת החיזוק ויצרה מנגנון היזון חוזר לתיקון זיהויים שגויים.

    במבחני אמינות שביצעה החברה, עמד המודל ב-98.0% מתוך 145 שאלות רגישות פוליטית בנושא סין (99.8% באנגלית ו-95.2% בסינית מפושטת). במבחן פגיעות כתלות בהקשר, אף ניסוח לקוח לא הוביל לשינוי מובהק סטטיסטית בביצועי המודלים.

    למרות היכולות, Cognition לא מציעה את SWE-2 כמודל בקוד פתוח ואף לא באמצעות ממשק תכנות יישומים (API) עצמאי. המודל זמין אך ורק בתוך פלטפורמת Devin - בשלב זה בגרסאות Desktop ו-CLI, כאשר פריסה לגרסאות Web ו-Fusion צפויה בהמשך. השימוש במודל ניתן ללא עלות נוספת לבעלי מנוי בתשלום עד ל-10 באוקטובר 2026.

    למה זה חשוב לך

    עבור צוותי פיתוח ומנהלי R&D, הצגת מודל המציע ביצועים השווים למודלי הקצה המובילים בשוק תוך הוזלה של 64% בעלויות משנה את התחשיב הכלכלי של אוטומציה בתהליכי תוכנה. הירידה במספר הצעדים הנדרשים לביצוע משימה (58% פחות סיבובים) פירושה זמן תגובה מהיר יותר של סוכני AI, מה שמאפשר לשלבם במשימות יומיומיות מורכבות בעלות נמוכה בהרבה מבעבר.

    התוכן בכתבה זו נועד לספק סקירה כללית בלבד ואינו מהווה תחליף לייעוץ מקצועי פרטני. המערכת אינה אחראית לכל נזק או הפסד שייגרם כתוצאה מהסתמכות על המידע המוצג.

    שיתוף:
    האם אהבת את הכתבה?

    תגובות (0)

    טוען תגובות...

    רוצים לקבל עדכונים על עולם הבינה מלאכותית?

    הצטרפו לניוזלטר שלנו וקבלו את החדשות ישירות למייל

    כתבות קשורות

    עוד בבינה מלאכותית

    רוצה להישאר מעודכן?

    הכתבות החדשות של Agendax, ישר לערוץ שנוח לך.