אנתרופיק משיקה מחדש את מודלי ה-Claude Fable 5 וה-Claude Mythos 5

Anthropic Anthropic

⭐ נקודות עיקריות

  • אנתרופיק משיקה מחדש את מודלי ה-Claude Fable 5 וה-Claude Mythos 5 לאחר שהממשל האמריקאי הסיר את מגבלות היצוא.
  • החברה הטמיעה מסווג הגנה משופר במודל ה-Fable 5 שחוסם את טכניקת מעקף האבטחה שנתגלתה על ידי חוקרי אמזון.
  • אנתרופיק חוברת לענקיות טכנולוגיה לפיתוח מסגרת מוסכמת להערכת חומרת פריצות אבטחה במודלי בינה מלאכותית.
  • מודל ה-Fable 5 יהיה זמין בהדרגה החל מ-1 ביולי למשתמשים ברחבי העולם, בעוד הגישה ל-Mythos 5 תוגבל לגופים אמריקאיים מאושרים.

אנתרופיק (Anthropic) הודיעה על הסרת מגבלות היצוא והחזרתם לפעילות של מודלי הבינה המלאכותית Claude Fable 5 ו-Claude Mythos 5.

מודלים אלו, המהווים את הכלים המתקדמים ביותר של החברה, נחסמו לגישה גלובלית באופן גורף לפני כשבועיים בעקבות צו חירום של הממשל האמריקאי, וכעת משיקה אותם החברה מחדש לאחר שהגיעה להסדר מול מחלקת המסחר של ארצות הברית ותחת מגבלות אבטחה מעודכנות.

החזרת המודלים לשוק היא מהלך מרכזי עבור אנתרופיק ועבור תעשיית הבינה המלאכותית בארצות הברית לאור התחרות המתגברת מצד מודלים סיניים.

החסימה המקורית, שהוטלה ב-12 ביוני, נבעה מחשש ממשלתי מפני יכולות הגנת הסייבר והתקפת הסייבר של מודלי Claude, אך היישום המיידי שלה אילץ את החברה לחסום את השירות לחלוטין לכלל המשתמשים בשל חוסר יכולת לאמת אזרחות של משתמשים בזמן אמת.

פרשת אמזון ומסווגי האבטחה המשופרים

שני המודלים מבוססים על ארכיטקטורה זהה, אך Fable 5 הושק במקור עם חסמי אבטחה מחמירים לשימוש כללי, בעוד ה-Mythos 5 כולל פחות מגבלות והופץ לקבוצה מצומצמת של שותפים במסגרת פרויקט Glasswing לטובת הגנת סייבר.

צו החסימה הממשלתי הופעל לאחר שחוקרי אמזון גילו שיטה לעקוף את מנגנוני ההגנה של ה-Fable 5, שגרמה למודל לזהות פגיעויות תוכנה ואף לייצר קוד המדגים ניצול של פגיעות ספציפית.

לפי אנתרופיק, בדיקות שביצעה החברה העלו כי מודלים פחות מתקדמים – ובהם Claude Opus 4.8, GPT-5.5 ו-Kimi K2.7 – הצליחו אף הם לזהות את אותן פגיעויות תוכנה שזיהה Fable 5 בדוח של אמזון.

מעבר מכך, כאשר נבדקה היכולת לייצר הדגמת ניצול (Exploit) לפגיעות הבודדת שצוינה בדוח, כל המודלים שנבדקו – כולל Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7 ו-Opus 4.8, לצד GPT-5.4, GPT-5.5 ו-Kimi K2.7 – הצליחו לייצר תוצאה זהה.

בהתאם לכך, טוענת אנתרופיק כי הטכניקה שדווחה לא חשפה יכולת סייבר ייחודית ברמת Mythos, אלא שיקפה מקרה גבולי בהגדרות הזהירות של Fable 5.

כדי לפתור את המשבר, פיתחה אנתרופיק בשבועיים האחרונים מסווג אבטחה (Safety Classifier) משופר, אשר מיועד לחסום את השיטה שתוארה בדוח של אמזון. לדברי החברה, המסווג החדש מצליח לחסום את טכניקת המעקף הזו בלמעלה מ-99% מהמקרים.

עם זאת, החברה מציינת כי השימוש במסווג המחמיר צפוי להוביל לעלייה בשיעור חסימות השווא (False Positives) של בקשות לגיטימיות במהלך משימות תכנות שגרתיות וניקוי שגיאות (Debugging). במקרה שבו בקשה למודל ה-Fable 5 תיחסם, המערכת תעביר את המשתמש באופן אוטומטי למודל ה-Opus 4.8.

שיפורים בסיווג האבטחה (מקור anthropic)
שיפורים בסיווג האבטחה (מקור anthropic)

מסגרת תעשייתית להערכת פריצות בינה מלאכותית

בעקבות האירועים, הכריזה אנתרופיק על שיתוף פעולה עם אמזון, גוגל ומיקרוסופט ושותפים נוספים בפרויקט Glasswing, במטרה לגבש מסגרת עבודה מוסכמת להערכת החומרה של פריצות אבטחה ומעקפים במודלי בינה מלאכותית (Jailbreaks).

נכון להיום, לא קיים תקן אחיד בתעשייה המאפשר להגדיר באילו מקרים נדרשת התערבות מיידית של מפתחי המודל או של רשויות הממשל.

ההצעה הנוכחית של החברה מבוססת על דירוג פריצות לפי ארבעה קריטריונים מרכזיים:

  • תוספת יכולת (Capability gain): מידת היכולת שהפריצה מעניקה למשתמש מעבר לכלים קיימים ונגישים בשוק.
  • רוחב היכולת (Breadth of capability gain): מספר משימות התקפיות שונות שניתן לבצע באמצעות אותה טכניקת פריצה.
  • קלות הפיכה לנשק (Ease of weaponization): היקף המאמץ והתחכום הנדרשים כדי להפוך את הפריצה להתקפה בפועל.
  • יכולת גילוי (Discoverability): רמת המורכבות והידע המקצועי הנדרשים על מנת לאתר את הפרצה.

זמינות

הגישה הציבורית למודל ה-Fable 5 תחל להתחדש בהדרגה היום (1 ביולי). המודל יהיה זמין למשתמשים גלובליים דרך פלטפורמת קלוד (Claude Platform), באתר Claude.ai, ובכלים Claude Code ו-Claude Cowork.

בנוגע למודל ה-Claude Mythos 5, הממשל האמריקאי אישר בסוף השבוע שעבר את החזרת הגישה עבור קבוצה מוגדרת של ארגונים בארצות הברית בלבד ואין בשלב זה צפי להתרת הגישה שלו לקהל הרחב.

השוואת מפרטים