מסמכים משפטיים שהותרו לפרסום במסגרת התביעה שניהל העיתון "ניו יורק טיימס" (New York Times) נגד OpenAI ומיקרוסופט (Microsoft) חושפים תמונה קודרת מעולמות הפיתוח הפנימיים של ענקיות הבינה המלאכותית. מתוך המסמכים, המשתרעים על פני 92 עמודים, עולה כי עובדים ובכירים בשתי החברות היו מודעים היטב לכך ששאיבת המידע ההמונית (Scraping) מיוצרי תוכן ומוציאים לאור לצורך אימון מודלי שפה גדולים (LLM) מחסלת את המודל הכלכלי של הרשת הפתוחה.
לפי התכתבויות ומסמכים פנימיים שנכללו בהליך, בחברות לא רק הבינו את גודל הפגיעה ביוצרים ובאמצעי התקשורת, אלא אף הפיצו אזהרות פנימיות שלפיהן האסטרטגיה הזו מייצרת "לולאת הרס" (Doom Loop) שתפגע בסופו של דבר גם במודלים עצמם - עקב השמדת התשתית שמספקת להם נתוני אימון איכותיים.
"צחוק מוחלט מרעיון השימוש ההוגן"
אחד הציטוטים החריפים ביותר במסמך שייך לברנט הכט (Brent Hecht), מנהל מדע יישומי במיקרוסופט. הכט תיאר את קציר הנתונים ההמוני שבוצע עבור ChatGPT ו-Copilot כ"גניבת העבודה הגדולה ביותר בהיסטוריה האנושית". הוא אף הוסיף כי קו ההגנה המשפטי שאימצה מיקרוסופט עושה "צחוק מוחלט מרעיון השימוש ההוגן" (Fair Use).
במיקרוסופט מיהרו להתנער מטענותיו של הכט. דובר החברה, אלכס האורק (Alex Haurek), מסר כי הדברים מייצגים נקודת מבט אישית של עובד יחיד, אינם מהווים ניתוח משפטי ואינם משקפים את עמדת התאגיד. ג'ורדן עסדאן (Jordan Usdan), מנהל אסטרטגיית דאטה ותפעול ב-Microsoft AI, טען בתצהיר משפטי נפרד כי תפקידו של הכט בחברה הוא להציג תפיסות אקדמיות ועתידניות, וכי עמדותיו אינן מייצגות את החברה בהיבטי זכויות יוצרים.
עם זאת, המסמכים מראים כי האזהרות לא הגיעו מגורם יחיד. ג'ק קלארק (Jack Clark), מנהל המדיניות ב-OpenAI, ציין פנימית כי החברה בונה מערכות ש"מהוות תחליף לעבודת האנשים שמגדירים את תרבות החברה". מנגד, גרג ברוקמן (Greg Brockman), ממייסדי OpenAI, התמקד פנימית בפוטנציאל המסחרי העצום והפנה את תשומת הלב לרווחי עתק פוטנציאליים שניתן להפיק מהטכנולוגיה.
מודל שמחסל את שרשרת האספקה של עצמו
החשש המרכזי שעולה מן התכתובות הוא הפגיעה המתמשכת בשרשרת האספקה של המידע. במסמך פנימי של מיקרוסופט נכתב במפורש: "אסטרטגיית התוכן שלנו החלה 'לולאת הרס' שתפגע בביצועי המודלים שלנו וברשת כולה בו-זמנית. זהו מצב יוצא דופן שבו מוצר קצה מאיים על היסודות הכלכליים של ספקיו החיוניים, אך זהו המצב שיצרנו עבור עסקי מודלי השפה הגדולים שלנו ביחס ל'שרשרת הספקת התוכן' שלהם."
גם מנכ"ל מיקרוסופט, סאטיה נאדלה (Satya Nadella), הודה בדיונים כי צ'אטבוטים תפסו את מקומם של מנועי החיפוש ומסירים את הצורך של המשתמשים להגיע ישירות למקור המידע. אף שנאדלה טען כי "כל דבר שנמצא מאחורי חומת תשלום צריך להימכר ברישיון", נציג מטעם OpenAI הודה במסגרת התיק כי לא היה מודע למאמץ כלשהו לזהות או להסיר תוכן המוגן בחומת תשלום מתוך נתוני האימון של המודלים.
ירידה של עד 60% בתנועת הגולשים
ב-OpenAI היו מודעים היטב גם לתופעת השכפול (Regurgitation). אף שהחברה הצהירה על חשיבות מניעת שינון טקסטים כדי לצמצם הפרות זכויות יוצרים, עובדים הודו פנימית כי מודל GPT-4 "שינן כמות עצומה של נתונים ולכן יהיה טוב באופן מטורף בשחזור". במסמכי התביעה נכללו דוגמאות שבהן ChatGPT פלט פסקאות ארוכות ומדויקות מתוך כתבות של הניו יורק טיימס וכלי תקשורת נוספים, כמו Denver Post, Mercury News, LifeHacker ו-Eurogamer.
ניק טרלי (Nick Turley), מנהל מוצר ChatGPT ב-OpenAI, הבהיר בדיונים פנימיים את הבעייתיות שנוצרת עבור המוציאים לאור: ברגע שהמשתמש מקבל תשובה ישירה מהצ'אטבוט, "אין שום סיבה טובה ללחוץ" על הקישור לאתר המקור. מומחי כלכלה ומדיה מטעם OpenAI אף העריכו פנימית כי סיכומי בינה מלאכותית הובילו לירידה בתנועת ההפניות לאתרים - ירידה שהגיעה לפי הערכותיהם לעד 60%.
| אמירה / ממצא פנימי | הגורם המצוטט | משמעות פנימית |
|---|---|---|
| "גניבת העבודה הגדולה בהיסטוריה" | ברנט הכט (מיקרוסופט) | ביקורת פנימית על היקף שאיבת התוכן ללא פיצוי |
| "לולאת הרס" (Doom Loop) | מסמך פנימי (מיקרוסופט) | פגיעה הדדית ברשת ובאיכות נתוני האימון של המודלים |
| ירידה של עד 60% בהפניות | מומחי מדיה (OpenAI) | צניחה חדה בתנועת גולשים לאתרי חדשות ותוכן |
| "אין סיבה ללחוץ על הקישור" | ניק טרלי (OpenAI) | ייתור הגעה למקור המידע לאחר קבלת תשובה |
| GPT-4 "מעולה בשחזור" | עובדי OpenAI | הודאה בשינון והעתקת טקסטים מוגנים מילה במילה |
הגילויים החדשים ממחישים כי שתי החברות נכנסו למרוץ הפיתוח מתוך הבנה מלאה של הנזקים הפוטנציאליים לתעשיית התוכן והעיתונות. למרות האזהרות הפנימיות על פגיעה בלתי הפיכה ביוצרים ובשרשרת האספקה של המידע, העדיפו בכיריהן להמשיך בשאיבת התוכן כדי להשיג יתרון תחרותי בשוק הבינה המלאכותית.
למה זה חשוב לך
גם אתרי תוכן וחדשות ישראליים חשופים לאותה תופעה: כלי בינה מלאכותית שואבים מהם מידע ומספקים תשובות ישירות למשתמשים, מה שעלול לצמצם משמעותית את התנועה למקור ולפגוע בהכנסות מפרסום. ככל שהתחום יוסדר בעולם, ייתכן שגם בישראל יידרשו הסדרי רישוי ותשלום דומים בין ענקיות הבינה המלאכותית למפרסמים מקומיים. כקוראים, כדאי להיות מודעים לכך שתשובות מצ'אטבוטים מסתמכות לעיתים על תוכן שנלקח ללא פיצוי ליוצריו המקוריים.
התוכן בכתבה זו נועד לספק סקירה כללית בלבד ואינו מהווה תחליף לייעוץ מקצועי פרטני. המערכת אינה אחראית לכל נזק או הפסד שייגרם כתוצאה מהסתמכות על המידע המוצג.
קראו גם: מרוץ ה-AI מעלה הילוך: Crusoe מגייסת 3.9 מיליארד דולר לתשתיות מחשוב · מיקרוסופט משחררת בקוד פתוח את TauGrid: פלטפורמה אחודה לניהול עומסי AI בקוברנטיס





