האם מרוץ החימוש של ה-AI הוכרע? המסקנות של מאט שומר מ-GPT-5.6 ו-Claude Fable
בזמן שכולנו מנסים לעמוד בקצב של השקות המודלים, מאט שומר (Matt Shumer), מהחוקרים והיזמים המוערכים בתעשייה, לקח את GPT-5.6 החדש של OpenAI למבחן מאמץ קיצוני. התוצאות שלו מציירות תמונה מרתקת: מצד אחד, פיצ'ר שמשנה את הדרך שבה אנחנו חושבים על סוכני AI, ומצד שני – תזכורת לכך שביצועים בסינתטיים לא תמיד מתרגמים לחוכמה בשטח.
ה-Goal Mode: כשהמודל מפסיק לבקש אישור ומתחיל לעבוד
הבשורה המשמעותית ביותר ב-GPT-5.6 היא ללא ספק ה-Goal Mode. אם עד היום היינו רגילים לעבודה בשיטת "פינג-פונג" (אנחנו נותנים הנחיה, המודל מבצע, אנחנו מתקנים), ה-Goal Mode מעביר את ההגה למודל.
שומר הציב למודל יעד שאפתני: בניית סימולציה תלת-ממדית של מנהטן, כולל מערכת רכבת תחתית מתפקדת לחלוטין. במקום לכתוב קוד ולחכות למשוב, המודל פעל בצורה אוטונומית במשך ימים. הוא בנה את התשתית, זיהה באגים בקוד של עצמו, ביצע "Self-Correction" (תיקון עצמי) והמשיך עד שהיעד הושג. כל זה קרה כמעט ללא התערבות אנושית.
זהו מעבר מ-AI ככלי עבודה ל-AI כשותף למשימה. היכולת של מודל לשפוט את הפלט של עצמו ולתקן טעויות בזמן אמת היא קפיצת מדרגה משמעותית עבור מפתחים שבונים מערכות מורכבות.
המהפך של אנתרופיק: למה Claude Fable ניצח בסיבוב הזה?
למרות ההתלהבות מהיכולות האוטונומיות של GPT-5.6, שומר הפתיע כשהצהיר שברגע ש-Claude Fable של אנתרופיק (Anthropic) שוחרר, הוא כמעט זנח את המודל של OpenAI.
הסיבה לכך נוגעת בבעיה שרבים מאיתנו מרגישים בשטח: אופטימיזציית יתר למבחנים (Benchmarks). לפי שומר, GPT-5.6 מרגיש לעיתים כמו מודל שעבר אימון אינטנסיבי כדי לנצח במבחני ביצועים רשמיים, מה שגורם לו להיראות מרשים על הנייר אך פחות גמיש בסיטואציות יצירתיות או מורכבות באמת.
ניתן לעקוב אחרי העדכונים של מאט שומר בטוויטר כאן
לעומתו, Claude Fable מפגין מה שנראה כ"אינטליגנציה עמוקה" יותר. הוא דורש הרבה פחות השגחה (Hand-holding) בכתיבת קוד מורכב ומציע פתרונות יצירתיים שלא מרגישים כמו תבניות מוכנות מראש. כשמדובר בפיתוח מוצרים מאפס, התחושה היא שקלווד פשוט "מבין" את ההקשר הרחב טוב יותר.
חלוקת עבודה חדשה: אבטחה מול יצירה
אז האם GPT-5.6 הפך למיותר? ממש לא. שומר מציע אסטרטגיה מעניינת של ניהול משאבים:
- •Claude Fable: משמש למשימות הליבה – תכנון ארכיטקטורה, כתיבת קוד יצירתי ופתרון בעיות לוגיות סבוכות.
- •GPT-5.6: מנוצל לבדיקות אבטחת מידע (Security Audits) ולביצוע משימות פשוטות ואוטומטיות שבהן הוא מצטיין ביעילות ובעלות נמוכה יחסית.
השימוש ב-GPT למשימות ספציפיות מאפשר לחסוך בעלויות מבלי להתפשר על איכות התוצר הסופי, בעוד שהכוח המחשבתי ה"יקר" יותר מופנה לקלווד.
שורה תחתונה: המקום השני מעולם לא היה טוב יותר
התחרות בין OpenAI לאנתרופיק מייצרת עבורנו, המשתמשים והמפתחים, תקופת שפע חסרת תקדים. GPT-5.6 הוא כלי עבודה עוצמתי, במיוחד עם יכולות ה-Goal Mode שפותחות דלת לאוטומציה מלאה של תהליכי פיתוח.
עם זאת, הניסיון של שומר מוכיח שוב שאי אפשר להסתמך רק על טבלאות ביצועים. בסופו של יום, היכולת של מודל להיות "חכם" באמת – כזה שמבין ניואנסים ולא רק משחזר תבניות – היא זו שקובעת את הערך שלו בשוק. כרגע, נראה שאנתרופיק מחזיקה ביתרון האיכותי, אבל בעולם הזה, הכל יכול להשתנות בגרסה הבאה.
למידע נוסף על המודלים של Anthropic לעדכונים האחרונים מ-OpenAI