חברת OpenAI מכריזה על סדרת מודלי ה-GPT-5.6 עם שמות חדשים וחשיבה משופרת

GPT 5.6 (מקור OpenAI) GPT 5.6 (מקור OpenAI)

⭐ נקודות עיקריות

  • סדרת GPT-5.6 היא הדור החדש של מודלי הבינה המלאכותית מבית OpenAI המציע שלוש דרגות של ביצועים ועלויות.
  • הדגמים החדשים מציגים שיפור ביכולת הטיפול העצמאי במשימות מורכבות בתחומי התכנות, המחקר הביולוגי ואבטחת המידע.
  • מערך האבטחה שודרג באמצעות מסווגי הפעלה בזמן אמת המנטרים את תהליכי החשיבה הפנימיים של המודל במהלך הפקת התשובה.
  • ההשקה מתחילה בגרסת תצוגה מקדימה מוגבלת עבור קבוצה מצומצמת של שותפים בתיאום עם הממשל האמריקאי.

חברת OpenAI הכריזה על השקת סדרת מודלי הבינה המלאכותית החדשה שלה, GPT-5.6, המציגה שינוי במבנה המיתוג לצד יכולות חשיבה עמוקות.

משפחת המודלים החדשה מורכבת משלושה דגמים המותאמים לצרכים שונים של משתמשים וארגונים: דגם הדגל Sol ("שמש") המיועד למשימות המורכבות ביותר, הדגם המאוזן Terra ("אדמה") המיועד לעבודה ארגונית שוטפת, והדגם המהיר והמוזל Luna  ("ירח") המיועד לעבודה יומיומית.

סדרת GPT-5.6 היא פלטפורמת מודלים מתקדמת המבוססת על טכנולוגיית למידת חיזוק, המאפשרת למודל לבצע תהליך חשיבה פנימי ממושך (chain of thought) לפני הפקת התשובה הסופית למשתמש.

עבור הקהל הכללי, החשיבות של עדכון זה טמונה ביכולת של המודלים לפעול כסוכנים עצמאיים המסוגלים לפתור בעיות רב-שלביות ארוכות טווח, תוך הפחתת שגיאות עובדתיות בהשוואה לדורות הקודמים.

OpenAI מציגה שמות חדשים ל-GPT

אחד השינויים המרכזיים בסדרת המודלים החדשה נוגע למעבר למערכת שמות קבועה המגדירה דרגות יכולת קבועות, במקום השימוש בכינויים משתנים שהיו נהוגים בעבר.

לפי שיטה זו, המספר מגדיר את דור המודל, בעוד השמות Sol, Terra ו-Luna מייצגים רמות ביצועים אשר צפויות להתקדם באופן עצמאי לאורך זמן.

לצד שינוי השמות, החברה מציגה הגדרה ייעודית המאפשרת למודל להקצות זמן חשיבה מרבי (max reasoning effort) לבעיות קשות במיוחד.

חידוש נוסף נוגע למצב האולטרה (ultra mode), המאפשר לדגם Sol לעבור את מגבלות הזרימה של סוכן יחיד על ידי הפעלת סוכני-משנה (subagents) עצמאיים קטנים יותר שמחלקים ביניהם את העבודה ומאיצים את פתרונם של פרויקטים מורכבים במקביל.

ביצועים

על פי נתוני החברה ומבחני הביצועים הרשמיים, סדרת GPT-5.6 מציגה התקדמות במגוון תרחישים המדמים עבודה בעולם האמיתי. במבחן TerminalBench 2.1, הבוחן תהליכי עבודה ותכנון של פקודות בשורת הפקודה, דגם Sol הגיע לציון של 88.76% במצב הרגיל, ועד לציון של 91.91% בשימוש במצב ה-ultra mode החדש, זאת לעומת ציון של 83.4% שהשיג דגם GPT-5.5.

בתחום הרפואה והמדע, המודלים מציגים שיפור ברמת הדיוק ובהבנת תרחישים מורכבים. במבחן המדעי HealthBench Professional, המעריך רמת ביצוע ובטיחות בתרחישים קליניים, דגם Sol רשם ציון מותאם של 60.5 נקודות לעומת 51.8 נקודות של הדור הקודם, תוך הפקת תשובות ממוקדות יותר המקלות על השימוש הלגיטימי. במבחנים גנומיים כגון GeneBench v1, הדגם משיג רמת דיוק גבוהה יותר תוך צריכת פחות משאבים דיגיטליים.

בתחום אבטחת המידע, כל שלושת דגמי הסדרה הוגדרו על ידי החברה כבעלי רמת סיכון גבוהה בשל היכולת המוגברת שלהם לזהות חולשות בקוד ולבודד רכיבי פגיעות במערכות תוכנה. במבחני הסמכה פנימיים (Capture-The-Flag), השיג דגם Sol ציון של 96.7%, דגם Terra הגיע ל-91.84% ודגם Luna השיג 85.19%.

מבחן ביצועים TerminalBench 2.1 (מקור OpenAI)
מבחן ביצועים TerminalBench 2.1 (מקור OpenAI)

יכולות נוספות

לצורך התמודדות עם סיכוני בטיחות, OpenAI משלבת בסדרת המודלים מערך אבטחה מרובד (layered safeguard stack) הפועל בזמן אמת.

דגמי Sol ו-Terra כוללים מסווגי הפעלה (activation classifiers) המנטרים את האותות הפנימיים של המודל במהלך יצירת התשובה בתחומי הסייבר והביולוגיה.

אם המערכת מזהה פעילות אסורה, הזרמת הפלט מושהית והשיחה מועברת לבחינה של מודל חשיבה גדול יותר כדי לחסום את המידע לפני הגעתו למשתמש.

עבור ארגונים ומפתחים, ממשק התכנות מציג מנגנון ניהול זיכרון מטמון של הנחיות (Prompt Caching) עם נקודות שמירה מפורשות (cache breakpoints) וזמן חיים מינימלי של 30 דקות.

כתיבה ראשונית לזיכרון המטמון מחוייבת בתעריף של פי 1.25 ממחיר הקלט הרגיל, אך קריאות חוזרות מאותו זיכרון זוכות להנחה של 90%, מה שמאפשר הפחתת עלויות בעיבוד נפחי קוד גדולים והקשרים קבועים.

זמינות

בשל רמת היכולת של המודלים ותיאום מוקדם מול הרשויות, סדרת GPT-5.6 מושקת בשלב זה במתכונת של תצוגה מקדימה מוגבלת (Limited Preview) עבור קבוצה מצומצמת של כ-20 ארגונים ושותפים עסקיים מהימנים שפרטיהם שותפו עם ממשל ארצות הברית.

הגישה הרחבה לכלל המשתמשים בשירות ChatGPT, בממשק התכנות למפתחים (API) ובשירות המפתחים Codex צפויה להיפתח במהלך השבועות הקרובים.

השוואת מפרטים