ענקית הענן אמזון (AWS) הודיעה על הרחבה משמעותית של זמינות מודלי הבינה המלאכותית מבית OpenAI בפלטפורמת Amazon Bedrock. במסגרת עדכון חדש, הושק מנגנון הסקת מסקנות בין-אזורי (Cross-Region Inference) עבור סדרת מודלי GPT-5.6, המאפשר לארגונים ולמפתחים לנתב בקשות עיבוד בזמן אמת על פני יותר מ-25 אזורי ענן (AWS Regions) ברחבי העולם. העדכון נועד לייעל את כושר העיבוד (Throughput), לשמור על ביצועים יציבים בעת עומסים גבוהים ולהעניק גמישות מרבית בניהול משאבי המחשוב.
שלוש גרסאות מותאמות וחלון הקשר של מיליון טוקנים
על פי הדיווח בבלוג הרשמי של AWS, העדכון כולל תמיכה בשלושה דגמים כלליים מסדרת GPT-5.6:
- Sol: גרסה המותאמת לביצועים מרביים ויכולות מורכבות.
- Terra: גרסה המציעה איזון אופטימלי בין ביצועים גבוהים לעלויות עיבוד.
- Luna: גרסה מותאמת ליישומים בעלי דרישות תקציביות חסכוניות.
כל שלוש הגרסאות תומכות בקלט משולב של טקסט ותמונות (Multimodal) ומחזירות פלט טקסטואלי. בנוסף, הדגמים מצוידים בחלון הקשר (Context Window) נרחב של 1 מיליון טוקנים, ותומכים במצב חשיבה (Reasoning mode), בקריאות לכלי צד-שרת (Server-side tool calling) ובאחסון פרומפטים במטמון (Prompt caching) לחיסכון בזמני תגובה ובעלויות.
| מודל | סוג קלט / פלט | חלון הקשר | תכונות מרכזיות |
|---|---|---|---|
| GPT-5.6 Sol | טקסט ותמונה / טקסט | 1 מיליון טוקנים | ביצועים גבוהים, מצב חשיבה, Prompt Caching |
| GPT-5.6 Terra | טקסט ותמונה / טקסט | 1 מיליון טוקנים | איזון ביצועים ועמוסי עבודה, מצב חשיבה, Prompt Caching |
| GPT-5.6 Luna | טקסט ותמונה / טקסט | 1 מיליון טוקנים | יעילות כלכלית, מצב חשיבה, Prompt Caching |
איך עובד מנגנון Cross-Region Inference?
מנגנון הסקת המסקנות הבין-אזורי של Amazon Bedrock מבוסס על פרופילי הסקה (Inference Profiles) – מזהים לוגיים המופעלים במקום מזהה מודל ישיר. בעת שליחת בקשה מאזור מקור (Source Region), המערכת מנתבת את הפנייה באופן אוטומטי לאזור יעד (Destination Region) שבו קיימים משאבי מחשוב זמינים באותו רגע.
אמזון מציעה שני סוגים מרכזיים של פרופילי הסקה:
- פרופיל גיאוגרפי (Geographic Profile): מנתב בקשות אך ורק בין אזורי ענן בתוך גבול גיאוגרפי מוגדר (למשל, תחת הקידומת
us.עבור ארה"ב). מנגנון זה מיועד לארגונים הכפופים לדרישות תאימות ורגולציה של תושבות נתונים (Data Residency), המבטיחות כי עיבוד המידע יישאר במתחם הגיאוגרפי המוגדר. - פרופיל גלובלי (Global Profile): מנתב בקשות לכל אזור מסחרי נתמך של AWS בעולם (תחת הקידומת
global.) בהתאם לקיבולת בזמן אמת. פרופיל זה מספק את מאגר המחשוב הרחב ביותר ומתאים לארגונים ללא מגבלות מיקום גיאוגרפי.
"על ידי אפשרות לבקשות להסתמך על מאגר מחשוב רחב יותר במקום להיות כבולות לקיבולת הזמינה של אזור בודד, המנגנון משפר את קצב העיבוד ומסייע לשמור על ביצועים עקביים תחת עומס", נכתב בפרסום של AWS.
מבחינת תמחור וניהול משאבים, החיוב הכספי וצריכת מכסות השימוש נרשמים באופן מרוכז בחשבון המקור של המשתמש, ללא קשר לאזור הפיזי שביצע את עיבוד הבקשה בפועל.
אבטחה, אינטגרציה והזווית הישראלית
מהלך זה נושא בשורה משמעותית גם עבור שוק ההייטק הישראלי. ברשימת אזורי הענן המסחריים הכלולים בפריסה הגלובלית של הניתוב הבין-אזורי נכלל גם אזור ישראל (תל אביב - il-central-1), לצד אזורים נוספים באירופה, אסיה, אמריקה והמזרח התיכון. הדבר מאפשר לחברות פיתוח ולמרכזי מחקר ופיתוח בישראל להשתמש בתשתיות הענן המקומיות כנקודת מוצא לשימוש במודלי GPT-5.6, תוך ניצול זמינות המחשוב העולמית של AWS.
במישור האבטחה, המנגנון פועל תחת מודל Zero-Operator Access (ZOA) המופעל ברמת השבב, כך שלעובדי AWS אין גישה לבקשות או לתוצרים של המשתמשים. הבקשות מאומתות באמצעות הרשאות IAM של AWS, וניתן לחברן באופן פרטי מתוך רשת VPC של הארגון. נוסף על כך, כל פעילות נרשמת בשירות הניטור AWS CloudTrail, המציין בשדה מיוחד (inferenceRegion) באיזה אזור פיזי פוענחה כל בקשה.
מפתחים יכולים לשלב את המודלים באפליקציות קיימות ישירות באמצעות API המותאם ל-OpenAI (הן ב-Responses API והן ב-Chat Completions API), או לעבוד עם ה-Converse API של Amazon Bedrock, תוך תמיכה מלאה בהזרמת תשובות בזמן אמת (Streaming).

