⭐ נקודות עיקריות
- גוגל חשפה את SL2T, מודל בינה מלאכותית המתרגם שפת סימנים לטקסט כתוב בזמן אמת.
- התכונה מגיעה לראשונה למכשירי ה-Pixel 11 דרך המקלדת Gboard ואפליקציית Live Transcribe, בתמיכה בשפת הסימנים האמריקאית.
- המודל מתרגם ישירות מנקודות ציון של הגוף לטקסט, ללא שלב תיווך מילולי, ומזהה גם הבעות פנים ומבנים מרחביים.
- צילום המצלמה מעובד במכשיר עצמו ונמחק מיידית, ורק הקואורדינטות הגיאומטריות נשלחות לתרגום.
גוגל (Google) הכריזה על השקת SL2T (או Sign-Language-to-Text), מודל בינה מלאכותית חדש המציע תרגום שפת סימנים לטקסט בזמן אמת.
המודל משולב לראשונה במכשירי ה-Pixel 11 ביישומים Gboard ו-Live Transcribe, ומאפשר תרגום משפת הסימנים האמריקאית (ASL) לאנגלית.
מדובר במודל בינה מלאכותית רב-לשוני הממיר תנועות גוף ופנים לטקסט זורם ללא צורך בהקלדה. הפיתוח מעניק לקהילת חירשים וכבדי שמיעה אפשרות לתקשר באופן טבעי ומהיר יותר בנייד, ומגשר על פער התקשורת מול אנשים שומעים.
הכירו את SL2T
תקשורת בשפת סימנים כוללת שילוב מורכב של תנועות ידיים, זרועות, גוף ותווי פנים בתדירות גבוהה. בשונה מתקשורת קולית, המודל אינו מבצע העתקה רציפה של מילים אלא תרגום מכונה (Machine Translation) מלא בין שפות בעלות דקדוק ואוצר מילים שונים לחלוטין.
כדי לשמור על פרטיות המשתמשים, הנייד מעבד את צילום המצלמה באופן מקומי באמצעות כלי המעקב MediaPipe Holistic ומחלץ נקודות ציון (Pose Landmarks) של גוף המשתמש. הקואורדינטות הגיאומטריות בלבד נשלחות לתרגום, בעוד הווידאו המקורי נמחק מיד מהמכשיר.
מערכות תרגום קודמות המירו כל סימן תחילה לתווית מילולית כתובה (Gloss), ורק ממנה הרכיבו משפט שלם. SL2T מדלג על שלב הביניים הזה ומתרגם את נתוני נקודות הציון ישירות לטקסט כתוב.
גישה זו מאפשרת למודל לזהות הבעות פנים ומבנים מרחביים שנוטים לאבוד בתהליך התיוג, ולהגדיל את מדד הדיוק ככל שנוספים נתוני אימון.
ביצועים
לדברי גוגל, המודל הוכשר על נתונים מגוונים הכוללים דיאלקטים ורמות מיומנות שונות, דבר המשפר את ביצועיו בהשוואה למודלים המיועדים לשפה יחידה.
במבחן FLEURS-ASL השיג המודל ציון של 70 נקודות במדד BLEURT, המודד עד כמה תרגום מכונה קרוב לתרגום אנושי. לדברי גוגל זהו הנתון הגבוה ביותר שנרשם עד כה בתחום.
החברה התאימה את המודל לשימוש מעשי ביום-יום, כולל הפחתת השהיית הזרמת הטקסט ומניעת הזיות (Hallucinations) בזמן שהמשתמש אינו מסמן. המודל מציע תמיכה מלאה במשתמשים שמאליים ובסימון ביד אחת בזמן החזקת הסמארטפון.
יכולות נוספות
שילוב המודל ב-Gboard מאפשר למשתמשים לסמן מול המצלמה בכל מקום שבו נדרשת הקלדה, כמו חיפוש ברשת, כתיבת הודעות או פנייה ל-Gemini. באפליקציית Live Transcribe, משתמשים יכולים להשיב בשפת סימנים במהלך שיחה במקום להקליד מענה.
הפיתוח הובל בשיתוף פעולה עם קהילת החירשים ולווה על ידי ועדה מייעצת (AISLAC) המאגדת ארגונים גלובליים. הגישה השיתופית נועדה להבטיח את התאמת הטכנולוגיה לצרכים הטרמינולוגיים והתרבותיים של המשתמשים.
זמינות
התכונה זמינה ללא עלות נוספת במכשירי ה-Pixel 11 עבור שפת הסימנים האמריקאית (ASL) לאנגלית. בחברה צופים להרחיב את התמיכה למכשירים נוספים ולשפות סימנים נוספות בהמשך.
המודל אינו תומך כרגע בשפת הסימנים הישראלית (שס"י), ששונה מ-ASL באוצר הסימנים, בדקדוק ובאלפבית האיות באצבעות.
הרחבת התמיכה לשפות נוספות תלויה בקיומם של מאגרי וידאו מתויגים בהיקף גדול, ולכן צפויה להגיע קודם לשפות סימנים בעלות קהילות דוברים גדולות.