טכניקות להסרת מנגנוני בטיחות ממודלי בינה מלאכותית כבר אינן נחלתם הבלעדית של חוקרים בעלי תשתיות מחשוב מתקדמות. חברת הסטארט-אפ האמריקאית Abliteration.ai השיקה שירות מסחרי המציע גישת ממשק תכנות יישומים (API) מוכנה לשימוש למודל השפה GLM-5.3, לאחר שמנגנוני הסירוב והבטיחות שלו הוסרו כמעט לחלוטין.
המוצר, המכונה "abliterated-model-large-v2", מבוסס על מודל המשקלים הפתוחים (Open-weight model) של חברת Z.AI, ונמכר במחיר נגיש של 5 דולרים לכל מיליון טוקנים של קלט או פלט. המהלך מעורר דאגה עמוקה בקרב מומחי אבטחת מידע, המזהירים מפני ההשלכות של הנגשת יכולות התקפיות מתקדמות לכל דורש.
איך עובדת מחיקת מנגנוני הבטיחות?
טכניקת ה-Abliteration (ביטול או מחיקת מנגנוני סירוב) אינה מבוססת על עקיפת הנחיות באמצעות הנדסת פרומפטים (Prompt jailbreak), אלא על שינוי פיזי של המודל עצמו. בתהליך זה, מזהים המפתחים את תבניות ההפעלה הפנימיות במודל שמעוררות את מנגנוני הסירוב בעת קבלת הנחיות רגישות. לאחר מכן, משקלי המודל עוברים כוונון שנועד לדכא את התבניות הללו ולנטרל את התגובה.
בעבר, מפתחים שביצעו שינויים מסוג זה שיתפו את משקלי המודל המותאמים להורדה חופשית בפלטפורמות קוד פתוח. לעומת זאת, Abliteration.ai בחרה במודל עסקי של "מודל כשירות" (Model as a Service - MaaS): החברה אינה משחררת את המשקלים המותאמים לציבור, אלא מארחת את המודל על גבי התשתיות שלה ומנהלת את התפעול עבור הלקוחות.
סביבת הרישוי של המודל המקורי מאפשרת את המהלך: מודל GLM-5.3 של Z.AI מופץ ברישיון המתיר לשימוש מסחרי, המאפשר יצירת גרסאות נגזרות ואירוח שלהן כשירות בתשלום. בחברה המפתחת ציינו בעבר כי יכולות הסייבר של המודל צמחו במהירות גבוהה מהצפוי במהלך שלב האימון המתקדם (Post-training).
הנגשת המודל דרך API חוסכת מהמשתמשים את הצורך בהחזקת תשתיות עיבוד גרפי (GPU) יקרות, אך במקביל מורידה באופן דרמטי את רף הכניסה לשימוש במודל ללא בלמים.
ביצועים גבוהים לצד ייצור קוד זדוני
Abliteration.ai מציגה את השירות ככלי המיועד למטרות לגיטימיות של אבטחת מידע: בדיקות סייבר התקפי, פעילות צוותים אדומים (Red teaming), ניתוח נוזקות, סימולציות פישינג ובדיקת עמידות של סוכני בינה מלאכותית (AI Agents) המוטמעים בארגונים גדולים ובבנקים. החברה אף פרסמה נתוני הערכה פנימיים המשווים את ביצועי המודל המותאם למודלים מובילים בשוק.
מודל / מדד CyberGym Terminal-Bench 4.0 ExploitGym (משימות שנפתרו בשעתיים)
abliterated GLM-5.3: 84.5% | 41.8% | 105
GPT-5.5: 85.6% | לא צוין | לא צוין
GPT-5.6 Sol / Fable 5: לא צוין | לא צוין | גבוה מ-105
לצד הביצועים במבחני הייחוס, בדיקות עצמאיות מראות כי הסרת מנגנוני הסירוב מייצרת סיכונים מוחשיים. המודל שפותח הפיק ללא קושי קוד המיועד לחילוץ סיסמאות שמורות בדפדפן Chrome, וכן מדריך מפורט לגידול פתוגנים מסוכנים. עם זאת, נותרו בו הגבלות בודדות: המודל עדיין חוסם בקשות הנוגעות לפגיעה עצמית ולתכנים מיניים של קטינים.
ללא תיעוד וללא אימות זהות: האתגר של קהילת האבטחה
אחד ההיבטים המעוררים את הדאגה העמוקה ביותר בקרב מומחי אבטחה הוא מדיניות הפרטיות והאימות של השירות:
- היעדר תיעוד תוכן (Zero retention): החברה אינה שומרת את הפרומפטים שנשלחים או את התשובות שהמודל מייצר. היא אוגרת רק מטא-דאטה תפעולית כמו כמות טוקנים, חותמות זמן ומזהי החשבון.
- היעדר אימות זהות: השירות אינו דורש זיהוי רשמי או בדיקת נאותות של הנרשמים.
- קושי בחקירה בדיעבד: במקרה של ניצול לרעה של השירות לביצוע מתקפות סייבר הרסניות, לא קיימים יומני רישום (Logs) שבאמצעותם ניתן לבחון את המהלכים שבוצעו.
באתר החברה נטען כי אי-שמירת התוכן נועדה להגן על קוד מקור חסוי ועל פגיעויות אבטחה שטרם נחשפו, השייכים לצוותי אבטחה לגיטימיים. נציג מטעם החברה טען בנוסף כי בדיקות זהות קפדניות אינן מצליחות לסנן תוקפים זדוניים באופן יעיל, ואף עלולות להפלות לרעה חברות אבטחה קטנות מול תאגידי ענק.
עבור לקוחות ארגוניים המעוניינים בשליטה מבוקרת, החברה מציעה שער מדיניות (Policy gateway) המאפשר להגדיר חוקי חסימה ותיעוד מותאמים אישית. כמו כן, החברה נרשמה במערכת הרכש של הממשל האמריקאי (SAM.gov) במטרה לספק גרסאות מנוהלות לפרויקטים פיילוט ממשלתיים.
האם האבליטרציה באמת נחוצה?
למרות ההתלהבות סביב השירות, חלק מקהילת האבטחה מביע ספקנות לגבי נחיצותו. ניתוחים שבוצעו על ידי ארגון מחקר האבטחה SaferAI הראו כי עוד בגרסה הקודמת של המודל, GLM-5.2, המודל המקורי לא סירב לאף משימה במסגרת הערכות סייבר התקפי - גם ללא הסרת המנגנונים.
בנוסף, מספר חברות המתמחות בבדיקות חדירות וצוותים אדומים, כגון Fabraix, ציינו כי מודלים שעברו אבליטרציה אינם חלק משגרת העבודה שלהן, והן מעדיפות להתבסס על כוונון עדין (Fine-tuning) מבוקר של מודלים פתוחים. ניסויים ראשוניים בתחום אף מצביעים על כך שתהליך האבליטרציה אינו ניתוח כירורגי בלבד, אלא הוא עשוי לשנות את התנהגות המודל גם במשימות רוחביות שבהן המודל הבסיסי לא הציג כל סירוב.
Abliteration.ai אינה יחידה בשוק. חברות נוספות, ובהן Audn.AI (עם מוצר PenClaw) ו-Silk Compute, מציעות כיום מודלים ללא הגבלות המיועדים לשימושי אבטחה. המגמה הזו מעבירה את אחריות קביעת הגבולות והאתיקה מפתחי הבינה המלאכותית אל הלקוחות עצמם - שינוי תפיסתי שתוצאותיו בשטח עדיין עומדות למבחן.
למה זה חשוב לך
עבור מפתחים וחברות סייבר בישראל, הופעת מודלים כאלה בשוק החופשי משמעה שכלים התקפיים מתקדמים - כמו ייצור קוד זדוני או חילוץ סיסמאות - נגישים כיום כמעט לכל דורש, ללא צורך בידע טכני עמוק או בתשתיות יקרות. היעדר תיעוד ואימות זהות בשירותים כאלה מקשה על גופי אבטחה ורגולציה לעקוב אחר ניצול לרעה, ולכן ארגונים ישראלים העוסקים באבטחת מידע צריכים להיות מודעים לסיכון המוגבר ולשקול חיזוק מנגנוני ההגנה שלהם מול תוקפים שמצוידים כיום בכלים נגישים יותר מאי פעם.
התוכן בכתבה זו נועד לספק סקירה כללית בלבד ואינו מהווה תחליף לייעוץ מקצועי פרטני. המערכת אינה אחראית לכל נזק או הפסד שייגרם כתוצאה מהסתמכות על המידע המוצג.
קראו גם: מרוץ ה-AI מעלה הילוך: Crusoe מגייסת 3.9 מיליארד דולר לתשתיות מחשוב · מיקרוסופט משחררת בקוד פתוח את TauGrid: פלטפורמה אחודה לניהול עומסי AI בקוברנטיס





