סימן מים בטקסט: כך עובדת טכנולוגיית הזיהוי במודלי Claude

אופן פעולת סימן המים בטקסט (מקור anthropic) אופן פעולת סימן המים בטקסט (מקור anthropic)

⭐ נקודות עיקריות

  • הסימון פועל בשלב בחירת המילים: במקום מחולל מספרים אקראיים, המודל מכריע בין חלופות שקולות באמצעות מפתח סודי והמילים שקדמו להן.
  • לטקסט עצמו לא מתווסף דבר – אין תווים נסתרים ואין טוקנים נוספים, ולכן אין השפעה על מהירות התגובה או על עלות השימוש.
  • עוצמת הסימון תלויה בכמות המילים שהמודל בחר בעצמו: בתרגום מלא הוא חזק, ובהגהה, בטקסט עובדתי ובקוד הוא דליל או נעדר.
  • השיטה מבוססת על SynthID-Text של גוגל, וספקיות AI נוספות שחתמו על קוד ההתנהגות האירופי מיישמות סימון משלהן.

אנתרופיק (Anthropic) מספקת הסבר על אופן פעולת סימן המים שישולב בטקסטים שנוצרו או עובדו על ידי מודלי Claude של החברה.

המהלך נועד לאפשר זיהוי מהימן של מעורבות המודל בכתיבת הטקסט, בהתאם לדרישות השקיפות של חוק הבינה המלאכותית האירופי (EU AI Act).

סימן מים בטקסט (Text Watermarking) הוא חתימה סטטיסטית סמויה המוטמעת ישירות ברצף המילים בזמן היצירה.

הטכנולוגיה מאפשרת לאמת האם טקסט נוצר על ידי בינה מלאכותית, מבלי לפגוע בקריאות עבור המשתמש ומבלי להוסיף תווים נסתרים או עלויות עיבוד.

במקרה של אנתרופיק, החברה יכולה לנתח טקסט ולהסיק ממנו האם הוא עובד על ידי Claude באמצעות בדיקת דפוסי בחירת המילים.

איך עובד סימן מים בטקסט?

מודלי שפה גדולים יוצרים טקסט על ידי חיזוי המילה הבאה בכל שלב מתוך רשימת אפשרויות סבירות. כאשר ישנן מספר מילים נרדפות המתאימות באותה מידה להקשר, מודל רגיל בוחר ביניהן בעזרת מחולל מספרים אקראיים.

במקום הגרלה אקראית רגילה, מנגנון סימן המים משתמש במפתח הצפנה סודי יחד עם המילים הקודמות במשפט כדי להכריע בבחירה.

התוצאה היא תבנית סטטיסטית עקבית שאינה מורגשת כלל לקורא האנושי, אך ניתנת לזיהוי מיידי על ידי מי שמחזיק במפתח הפענוח המתאים.

השיטה אינה כופה על המודל מילים חריגות או שגיאות, אלא פועלת אך ורק כאשר קיימות חלופות שוות ערך מבחינה לשונית. בדיקות שערכה החברה הראו כי איכות הניסוח, היצירתיות ובהירות הטקסט נשמרות במלואן.

אופן פעולת סימן המים בטקסט
תמונה באמצעות Gemini

שילוב טכנולוגיית SynthID-Text של גוגל

הפתרון של Anthropic מבוסס על טכנולוגיית SynthID-Text, שפותחה על ידי גוגל (Google) ופורסמה בכתב העת Nature.

הטכנולוגיה עושה שימוש באלגוריתם דגימת טורניר (Tournament Sampling), אשר משווה בין מספר מועמדים לכל מילה ובוחר את האפשרות בעלת הציון הגבוה ביותר תחת פונקציית סימון אקראית.

המחקר של גוגל, שהקיף כ-20 מיליון אינטראקציות חיות עם Gemini, הוכיח כי השיטה אינה גורמת לפגיעה באיכות התשובות ואינה מאיטה את מהירות ההפקה. המנגנון מאפשר בדיקת אימות מהירה מבלי להריץ מחדש את מודל השפה המקורי.

מגבלות ושימושים מעשיים

יכולת הזיהוי של סימן המים תלויה באורך הטקסט ובמידת הגיוון הלשוני שלו. בקטעים קצרים, בטקסטים עובדתיים קשיחים או במקטעי קוד שבהם יש רק בחירה תחבירית אחת נכונה, הסימן יהיה דליל יותר כדי לא לפגוע בדיוק המידע.

סימן המים אינו כולל פרטים אישיים, אינו מאפשר מעקב אחר משתמשים ואינו משנה את זכויות היוצרים על התוכן.

במקביל, החברה אישרה כי קובצי תמונה שיופקו יכללו תגית מטא-דאטה בתקן C2PA הפתוח לצורך זיהוי מקור הקובץ.

זמינות ויישום

הטמעת סימני המים תוחל באופן גלובלי על כלל המודלים החדשים של Claude, לצד הוספה הדרגתית של המנגנון למודלים קיימים במהלך החודשים הקרובים.

בנוסף, אנתרופיק מתכננת לשחרר ממשק ייעודי (API) שיאפשר לארגונים ולמפתחים לבדוק האם טקסט מסוים נוצר או נערך על ידי המודל.

השוואת מפרטים