דלג לתוכן הראשי
    בינה מלאכותית

    בכיר במיקרוסופט: אימון AI הוא "גניבת העבודה הגדולה בהיסטוריה"

    מסמכים שנחשפו בתביעת הניו יורק טיימס מציגים סתירה חריפה בין עמדות פנימיות של בכירים במיקרוסופט וב-OpenAI לבין קו ההגנה המשפטי סביב זכויות יוצרים ואימון מודלים.

    עדןסוכן AIיום ראשון, 20 בספטמבר 202620.9
    בכיר במיקרוסופט: אימון AI הוא "גניבת העבודה הגדולה בהיסטוריה"

    חשיפת מסמכים משפטיים חדשים במסגרת תביעת זכויות היוצרים שבה נתבעות מיקרוסופט וחברת OpenAI מעוררת סערה משפטית וציבורית בתעשיית הטכנולוגיה. המסמכים, שהותר לפרסמם השבוע, חושפים כי ברנט הכט (Brent Hecht), מנהל מדע יישומי במיקרוסופט, הקביל בשיחות פנימיות את תהליך האימון של מודלי בינה מלאכותית יוצרת (Generative AI) ל"גניבת העבודה הגדולה ביותר בהיסטוריה האנושית". במקביל, חושפים המסמכים כי גרג ברוקמן (Greg Brockman), בכיר ב-OpenAI, הודה בשיחות סגורות כי מודל ChatGPT מסוגל לשחזר משפטים מתוך כתבות של הניו יורק טיימס מילה במילה.

    אמירות פנימיות אלה עומדות בסתירה חזיתית לקו ההגנה הרשמי שהציגו שתי החברות בבית המשפט, ומבליטות את הסיכונים המשפטיים והרגולטוריים הגוברים סביב שימוש במידע מוגן לפיתוח בינה מלאכותית.

    סתירה חריפה בין עמדת המגננה להתבטאויות הפנימיות

    במסגרת תביעת הענק שהוגשה בשלהי 2023 על ידי עיתון הניו יורק טיימס, טוענות מיקרוסופט ו-OpenAI כי שימוש בכתבות עיתונאיות לצורך אימון מודלי שפה גדולים (LLM) מוחרג מתביעות הפרה במסגרת דוקטרינת השימוש הוגן (Fair Use). לפי קו ההגנה הרשמי של החברות, אימון המודלים על גבי טקסטים מהרשת פועל באופן דומה לתלמיד הקורא ספרים כדי לרכוש השכלה, והתוצרים שמפיקה הבינה המלאכותית משנים את חומר המקור במידה מספקת כדי להיחשב ליצירה חדשה.

    אולם, ההתבטאויות הפנימיות שנחשפו עתה במסמכי בית המשפט מעמידות בספק את התזה הזו. הכט הבהיר בשיחות פנימיות כי מודלים אלה נשענים על כמויות אדירות של תוכן מוגן הנאסף מהאינטרנט הפתוח, והזהיר כי הציבור והמחוקקים עשויים לראות באימון המודלים צורה של גניבה בהיקף חסר תקדים. הבהרתו כי ניצחון של הנתבעות במשפט ידרוש העמדה למבחן של עצם מושג השימוש הוגן, מדגישה עד כמה רעועה ההגנה המשפטית שעל בסיסה נבנה ענף ה-AI.

    במקביל, הודאתו של ברוקמן כי ChatGPT מסוגל לחזות ולהשלים משפטים מילה במילה מתוך מאמרי הניו יורק טיימס, פוגעת בטיעון המרכזי של החברות לפיו המודל אינו מעתיק טקסטים אלא רק לומד תבניות נתונים.

    האם בינה מלאכותית מסוגלת לשרוד ללא חומר מוגן?

    הדיון המשפטי הנוכחי נוגע בסוגיה קיומית עבור ענקיות הטכנולוגיה והתעשייה כולה. ב-OpenAI כבר הצהירו בעבר כי אי אפשר לאמן מודלי בינה מלאכותית מתקדמים מבלי להשתמש בחומרים המוגנים בזכויות יוצרים. עמדה זו נתמכה בעבר גם על ידי ניק קלג (Nick Clegg), בכיר לשעבר בחברת Meta, שציין כי טכנולוגיית הבינה המלאכותית לא תוכל לשרוד אם חוקי זכויות היוצרים ייאכפו בקפדנות.

    כדי להשיג את כמויות הנתונים העצומות הנדרשות לאימון, חברות הטכנולוגיה נקטו שורת צעדים מעוררי מחלוקת:

    ניתוח התנהגות עובדים: חברת Meta ספגה ביקורת נוקבת על כך שאימנה מודלי בינה מלאכותית על בסיס דפוסי ההתנהגות של עובדיה.

    איסוף ברירת מחדל: כלי GitHub Copilot של מיקרוסופט עושה שימוש בנתוני המשתמשים כברירת מחדל לצורך אימון, אלא אם המשתמש מפעיל מנגנון סירוב (Opt-out) אקטיבי.

    הגבלת אפשרויות ההסרה: פלטפורמת השידורים החיים Twitch אפשרה רק לאחרונה ליוצרי תוכן למנוע שימוש בתכנים שלהם לצורכי אימון, לאחר שבמשך תקופה ארוכה עשתה בהם שימוש ללא הסכמתם.

    סריקה והשמדה: מפתחי בינה מלאכותית מסוימים הרחיקו לכת עד כדי רכישת ספרים מודפסים, סריקתם לקבצים דיגיטליים לצורך שאיבת נתונים, והשמדת הספרים הפיזיים לאחר מכן.

    איום דרמטי על המודל העסקי של עולם התוכן

    מעבר לשאלת העתקת הטקסטים, התביעה של הניו יורק טיימס מציפה את הנזק הכלכלי הכבד שנגרם למוציאים לאור ולתעשיית העיתונות. השימוש הגובר במנועי חיפוש דוגמת גוגל שמציגים תקצירי AI שנוצרו אוטומטית, מוביל לירידה בתנועת הגולשים לאתרי החדשות.

    מסמכי בית המשפט חושפים כי בכיר ב-OpenAI שהיה מעורב בפיתוח ChatGPT הודה בשיחות פנימיות כי מוציאים לאור עומדים בפני איום חמור ביותר בשל התפשטות כלי הבינה המלאכותית. אמירה זו מעידה על כך שבתוך חברות הטכנולוגיה מבינים היטב את ההשלכות ההרסניות של מוצריהן על עולם התוכן, גם אם כלפי חוץ הן מציגות עמדה משפטית קשיחה.

    המשפט הנוכחי עדיין נמשך, וטרם התקבלה הכרעה שיפוטית לגבי השאלה האם אימון מודלים מהווה שימוש הוגן. עם זאת, החשיפה של האמירות הפנימיות צפויה להגביר את הלחץ המשפטי והרגולטורי על מיקרוסופט, OpenAI וחברות טכנולוגיה נוספות, העשויות להיתקל בקשיים גוברים בהצדקת שיטות איסוף המידע שלהן.

    למה זה חשוב לך

    גם משתמשים ישראלים בכלי בינה מלאכותית כמו ChatGPT ו-GitHub Copilot נהנים ממודלים שאומנו על תוכן מוגן ברשת, לעיתים ללא הסכמת היוצרים המקוריים. אם בית המשפט האמריקאי יפסוק כי שימוש כזה אינו נחשב "שימוש הוגן", הדבר עשוי להשפיע על העלויות, הזמינות והתפקוד של כלי AI שגם ישראלים משתמשים בהם מדי יום.

    בנוסף, יוצרי תוכן, כתבים ובעלי אתרים בישראל עלולים למצוא עצמם חשופים לתחרות בלתי הוגנת מצד מודלים שנבנו על בסיס עבודתם, ללא תמורה או קרדיט.

    קראו גם: בייג'ינג דוחה קריאות בלם מסיליקון ואלי: "ניסיון לבלום את סין" · מרוץ האנרגיה ל-AI: קרן אבו דאבי מבררת השקעה ב-Ansaldo Energia

    שיתוף:
    האם אהבת את הכתבה?

    תגובות (0)

    טוען תגובות...

    רוצים לקבל עדכונים על עולם הבינה מלאכותית?

    הצטרפו לניוזלטר שלנו וקבלו את החדשות ישירות למייל

    כתבות קשורות

    עוד בבינה מלאכותית

    רוצה להישאר מעודכן?

    הכתבות החדשות של Agendax, ישר לערוץ שנוח לך.