גוגל מציגה את EmbeddingGemma 2 להרצה מקומית בסלולר

EmbeddingGemm2 (מקור גוגל)

נקודות עיקריות

  • •גוגל השיקה את EmbeddingGemma 2, מודל קל משקל שמאפשר חיפוש לפי משמעות בטקסט, בתמונות, בשמע ובווידאו ישירות על המכשיר.
  • •המודל מותאם במיוחד לסמארטפונים ודורש החל מ-191MB זיכרון פעיל בלבד במכשירים דוגמת Pixel 11 Pro.
  • •הוא מאפשר חיפוש תמונות מיידי בזמן הקלדה ואיתור רגעים מדויקים בווידאו ללא צורך בתמלול או בחיבור לרשת.
  • •משקלי המודל שוחררו להורדה חופשית לשימוש מסחרי תחת רישיון הקוד הפתוח Apache 2.0.

גוגל (Google) הכריזה על EmbeddingGemma 2, מודל הטמעה (Embedding) פתוח וקל משקל בנפח של 740 מיליון פרמטרים שנועד לרוץ באופן מקומי על מכשירים. המודל החדש מרחיב את יכולות הדור הקודם ומוסיף לצד תמיכה בטקסט גם קוד, תמונות, שמע ווידאו.

מודל הטמעה לא מייצר תוכן כמו צ'אטבוט, אלא ממיר טקסט, תמונה או קטע שמע לייצוג מספרי (וקטור) שמשקף את המשמעות שלהם. תכנים דומים במשמעות מקבלים ייצוגים קרובים, וככה אפשר למצוא תמונה או רגע בסרטון לפי תיאור חופשי, גם בלי התאמה מדויקת של מילים.

התאמה מלאה לסמארטפונים ומכשירי קצה

EmbeddingGemma 2 נבנה על בסיס ארכיטקטורת Gemma 4 ומותאם במיוחד לפעולה תחת מגבלות הזיכרון של מכשירים ניידים. באמצעות כימות (Quantization), על גבי סמארטפון דוגמת Google Pixel 11 Pro, המודל צורך כ-191MB של זיכרון פעיל בלבד עבור משקלי הטקסט, וכ-567MB עבור המערך הרב-מודאלי המלא.

המבנה המלא של המודל כולל 740 מיליון פרמטרים, אך התכנון המודולרי שלו מאפשר לטעון רק את המקודדים הדרושים. מפתחים יכולים להסתפק במודל הטקסט הבסיסי ולהוסיף מקודד ראייה או שמע לפי צורכי היישום.

רכיב פרמטרים זיכרון פעיל (Pixel 11 Pro)
מודל טקסט (בסיס) 270 מיליון כ-191MB
מקודד ראייה 170 מיליון –
מקודד שמע 300 מיליון –
מודל מלא (רב-מודאלי) 740 מיליון כ-567MB

המודל מציע חלון הקשר של 8,000 טוקנים (8K), המאפשר לעבד מקומית על גבי המכשיר עד 5.5 דקות שמע, 29 תמונות או 58 פריימים של וידאו.

דוגמאות שימוש באפליקציות מקומיות

גוגל הציגה מספר הדגמות מעשיות ליכולות המודל באפליקציית Google AI Edge Gallery לסמארטפונים:

  • כלי Instant Media Search מאפשר חיפוש תמונות מקומי תוך כדי הקלדה. לדוגמה, הקלדת המילה "חתול" מציגה מיידית את כל תמונות החתולים בגלריה, והמשך הקלדה ל-"חתול ישן על מקלדת" מדרג מחדש ומציג בזמן אמת את התמונה הספציפית, ואף מאפשר חיפוש תמונות דומות באמצעות צילום חי במצלמה.
  • כלי Video Moments Finder מאפשר לאתר רגעים ויזואליים מדויקים בתוך סרטונים מקומיים ללא צורך בתמלול אודיו או יצירת כתוביות מקדימות. חיפוש שאילתות בשפה טבעית כמו "ילדים צוחקים", "כלב תופס פריזבי" או "אדם מכבה נרות יום הולדת" מסמן מיידית את נקודת הזמן המדויקת שבה מופיע הרגע המבוקש בווידאו.

מה מפתחים יכולים לבנות עם המודל

מעבר להדגמות של גוגל, מודל הטמעה שרץ באופן מקומי על המכשיר פותח למפתחי אפליקציות שורה של אפשרויות שעד היום חייבו שליחת מידע לשרת.

אפליקציית פתקים או מסמכים, למשל, תוכל לאפשר חיפוש לפי נושא ולא לפי מילה מדויקת. הקלדת "מה סיכמנו עם הקבלן" תמצא את הפתק הרלוונטי גם אם המילה "קבלן" לא מופיעה בו.

השימוש המשמעותי ביותר הוא ככל הנראה שילוב עם מודל שפה מקומי, בשיטה המכונה אחזור מבוסס הקשר (RAG). מודל ההטמעה מאתר במכשיר את המסמכים, ההודעות או המיילים הרלוונטיים לשאלה, ומודל השפה מנסח תשובה על בסיסם. ככה אפשר לבנות עוזר אישי שמכיר את המידע של המשתמש בלי שהמידע עוזב את הטלפון.

בזכות התמיכה בשמע ובווידאו, אפשר לחשוב גם על אפליקציית הקלטות שמאתרת קטע בהרצאה או בפגישה לפי תיאור, או על אפליקציית מצלמת אבטחה ביתית שמוצאת את "הרגע שבו השליח הגיע" בלי להעלות את הצילומים לענן.

היתרון המשותף לכל הדוגמאות האלו הוא הפרטיות. אפליקציות שמטפלות במידע רגיש, כמו מסמכים אישיים, תמונות משפחתיות או הקלטות, יכולות להציע חיפוש חכם בלי לבקש מהמשתמש לסמוך על שרת חיצוני.

ביצועים ומנוע החלטות מהיר

לדברי החברה, המודל מציג זינוק של 9.92 נקודות בביצועי קוד במבחן MTEB Code, שבו הגיע לציון של 78.68 נקודות, ומוביל במבחן השמע MAEB בקרב מודלים בקטגוריה של מתחת למיליארד פרמטרים.

בנוסף לחיפוש, המודל משמש כמנוע קבלת החלטות מקומי בזמן אמת (Zero-shot) ללא צורך באימון מוקדם. בניסוי שהציגה גוגל במסגרת משחק שחמט, המודל העריך 500 אפשרויות בכל תור בזמן תגובה של פחות מ-100 מילי-שניות ישירות על גבי המכשיר.

ביצועי EmbeddingGemma 2 (מקור גוגל)
ביצועי EmbeddingGemma 2 (מקור גוגל)

זמינות

משקלי EmbeddingGemma 2 שוחררו תחת רישיון הקוד הפתוח Apache 2.0 וזמינים להורדה בפלטפורמות Hugging Face ו-Kaggle.

השוואת מפרטים