⭐ נקודות עיקריות
- חברת OpenAI השיקה את GPT-Live, דור חדש של מודלים המיועדים לתקשורת קולית טבעית.
- המערכת מבוססת על ארכיטקטורת דו-כיווניות מלאה (Full-Duplex) המאפשרת הקשבה ודיבור במקביל ללא עצירות.
- המודל הקולי משלב ברקע את מודל הדגל GPT-5.5 לצורך ביצוע משימות מורכבות וחיפוש ברשת.
- העדכון זמין החל מהיום למשתמשי ChatGPT ברחבי העולם באפליקציות ובאתר.
חברת OpenAI הכריזה על השקת GPT-Live, דור חדש של מודלים קוליים המיועדים להפוך את התקשורת עם בינה מלאכותית לחוויה הדומה לשיחה אנושית רגילה.
במסגרת ההכרזה משיקה החברה שתי גרסאות של המודל – דגם ה-GPT-Live-1 אשר ישמש כמודל ברירת המחדל למשתמשים בתשלום, ודגם ה-GPT-Live-1 mini המיועד למסלול החינמי.
הטכנולוגיה החדשה מחליפה את המודלים הקוליים הקודמים ומפעילה החל מהיום את שירות ה-ChatGPT Voice המשודרג עבור משתמשי הפלטפורמה ברחבי העולם.
המערכת החדשה מהווה פתרון קולי מבוסס בינה מלאכותית המאפשר לנהל אינטראקציה קולית רציפה ודינמית. השינוי משמעותי עבור המשתמשים מאחר שהוא מבטל את הצורך להמתין לסיום התשובה של המודל, מאפשר לקטוע אותו באמצע המשפט, ומונע הפרעות הנגרמות מרעשי רקע או מהססנות במהלך הדיבור.
ארכיטקטורת Full-Duplex ושיחה רציפה
אחד השינויים המרכזיים ב-GPT-Live נוגע למעבר לארכיטקטורת דו-כיווניות מלאה (Full-Duplex). בניגוד למערכות קוליות קודמות שפעלו בצורה של תורות קבועים ודרשו מהמודל להמתין לשתיקה מוחלטת מצד המשתמש, המודל החדש מסוגל להקשיב ולדבר במקביל.
המערכת מעבדת את קלט האודיו ומייצרת פלט ברצף, מה שמאפשר לה לקבל החלטות רבות בכל שנייה – האם להמשיך לדבר, לעצור, להקשיב או להפעיל כלי חיצוני.
יכולת זו מאפשרת ל-GPT-Live להגיב בצורה טבעית יותר וליצור קשר רציף עם המשתמש. המודל מסוגל לשלב בשיחה קולות אישור קצרים כמו "מממ" או "הבנתי" כדי לאותת שהוא קשוב, ואף לבצע תרגום בזמן אמת תוך כדי שהמשתמש מדבר, ללא צורך בהמתנה לסיום המשפט.
בנוסף, המשתמשים יכולים לבקש מהמודל להישאר בשקט ולהקשיב עד שיפנו אליו שוב, תכונה שלא הייתה קיימת בגרסאות קודמות.
ביזור משימות ושילוב GPT-5.5 ברקע
החידוש הבולט ביותר במבנה התוכנה הוא ההפרדה שביצעה OpenAI בין ניהול האינטראקציה הקולית הרציפה לבין ביצוע משימות עיבוד מורכבות.
כאשר המשתמש מציג שאלה הדורשת חיפוש ברשת או חשיבה מעמיקה, GPT-Live מעביר את המשימה ברקע למודל הדגל העדכני של החברה, שבשלב ההשקה הוא GPT-5.5.
בזמן שמודל הרקע מעבד את הנתונים ומבצע את המחקר, GPT-Live מסוגל להמשיך לשוחח עם המשתמש ולשמור על זרימת השיחה מבלי ליצור הפסקות ממושכות ומביכות.
לדברי החברה, החלוקה הזו מאפשרת לשפר את רמת התשובות ורמת המורכבות שלהן, כאשר בעתיד יעודכן מודל הרקע באופן רציף עם השקתם של מודלים מתקדמים יותר.
משתמשי השירות יוכלו לבחור בין שלוש רמות חשיבה שונות בהתאם לצורך: Instant לקבלת תשובות מהירות, ורמות Medium או High למצבים שבהם נדרש מהבינה המלאכותית להקדיש זמן רב יותר לחשיבה וניתוח המתבסס על מודלי ה-Thinking של החברה.
כרטיסים ויזואליים ומבחני ביצועים
במסגרת השדרוג של ChatGPT Voice, המערכת תתמוך מעתה גם בהצגת כרטיסים ויזואליים על גבי המסך במהלך השיחה הקולית.
עבור נושאים מסוימים שבהם המידע המרכזי נוח יותר לצפייה, כגון נתוני מזג אוויר, מדדי מניות ותוצאות ספורט, המודל יציג רכיבים גרפיים המשלבים את המידע העדכני לצד הפירוט הקולי.
במבחנים אנושיים שערכה OpenAI להערכת זרימת השיחה, זכו המודלים GPT-Live-1 ו-GPT-Live-1 mini להעדפה ברורה של 75.7% ו-69.2%, בהתאמה, על פני מצב הקול הקודם (Advanced Voice Mode).
במבחני חשיבה מדעיים דוגמת GPQA, השיג מודל ה-GPT-Live-1 בדיוק של 84.2%, לעומת 45.3% בלבד שהשיג מצב הקול הקודם.

מנגנוני בטיחות מובנים
החברה שילבה ב-GPT-Live מערכות הגנה ייעודיות הפועלות בזמן אמת תוך כדי הדיבור של המודל. כאשר המערכת מזהה פלט שעלול להיות מסוכן, היא מסוגלת לנתב את המודל לתשובה בטוחה יותר, להציג משאבי סיוע או לסיים את השיחה הקולית לחלוטין במקרי סיכון גבוה, כגון תכנים הקשורים לפגיעה עצמית.
עבור משתמשים צעירים, אומנו דפוסי התנהגות מותאמי גיל ישירות בתוך המודל, וההורים יוכלו לשלוט בגישה לשירות באמצעות בקרת הורים קיימת.
בנוסף, החברה מדגישה כי המודל נועד לשימוש באמצעות תשעה קולות מוגדרים מראש שעברו עיבוד מחדש, וכולל חסמים מובנים שנועדו למנוע ממנו לחקות או לזייף קולות של אנשים אמיתיים.
זמינות
המודלים החדשים מתחילים להגיע בהדרגה מהיום לכלל משתמשי ChatGPT.
מודל ה-GPT-Live-1 יהפוך לברירת המחדל עבור מנויים בתשלום (Plus, Pro ו-Go), בעוד שמודל ה-GPT-Live-1 mini ישרת את המשתמשים במסלול החינמי.