לא רק וידאו יפה: אנבידיה משחררת את Cosmos 3 וטורפת את הקלפים ברובוטיקה
העולם הפיזי הוא המגרש החדש של הבינה המלאכותית, ואנבידיה (NVIDIA) בדיוק הניחה עליו פצצה של 14 מיליארד פרמטרים. הכירו את Cosmos 3 – מודל ה-World Model הפתוח שמשנה את הדרך שבה רובוטים, רכבים אוטונומיים ומפתחי AI מבינים את המציאות.
עד היום, כשדיברנו על מודלי וידאו כמו Sora של OpenAI, התפעלנו מהאסתטיקה. אבל עבור מפתח שבונה זרוע רובוטית או רכב שצריך להחליט אם לעקוף מכשול, וידאו "יפה" זה לא מספיק. הוא צריך להבין פיזיקה. הוא צריך לדעת שאם כדור נופל, הוא יקפץ, ואם כוס נשברת, המים יישפכו בצורה מסוימת.
כאן נכנסת לתמונה NVIDIA Cosmos 3. זהו לא סתם מודל גנרטיבי, אלא מערכת שלמה שמכונה "World Foundation Model" (מודל בסיס עולמי), והבשורה הגדולה ביותר? היא מגיעה בקוד פתוח מלא (Open Weights).
מה זה בכלל World Model ולמה זה קריטי?
הבעיה הגדולה ביותר של בינה מלאכותית פיזית (Physical AI) היא איסוף נתונים. כדי לאמן רובוט ללכת, אי אפשר פשוט לתת לו ליפול אלפי פעמים בעולם האמיתי – זה יקר, מסוכן ואיטי. Cosmos 3 פותר את זה על ידי יצירת "תאום דיגיטלי" של העולם.
המודל לא רק "מצייר" וידאו, הוא מסמלץ חוקי פיזיקה, תנועה ואינטראקציות בין אובייקטים. מפתחים יכולים להשתמש בו כדי לייצר אינסוף נתוני אימון (Synthetic Data) ריאליסטיים לחלוטין. במקום לחכות חודשים לאיסוף דאטה מהשטח, אפשר לסכם את התהליך בימים בודדים בתוך הסימולציה.
הארכיטקטורה שמאחורי הקסם: Mixture-of-Transformers
אנבידיה הציגה ב-Cosmos 3 ארכיטקטורה פורצת דרך שמשלבת שני עולמות:
- •Reasoning Transformer: רכיב שמתמקד בהבנה, היגיון פיזיקלי ותכנון.
- •Generation Transformer: רכיב שמתמקד ביצירת הוידאו, הסאונד והתמונה.
השילוב הזה מאפשר למודל לבצע משימות שהיו נחשבות למדע בדיוני עד לא מזמן: לקחת תמונת סטילס אחת ולהפוך אותה לסרטון של 30 שניות שמציית לחוקי הכבידה, או להפוך תיאור טקסטואלי לפעולות רובוטיות ממשיות (כמו זוויות מפרקים של זרוע רובוטית).
למה המפתחים חוגגים? (רמז: זה בחינם וזה פתוח)
ההחלטה של ג'נסן הואנג לשחרר את Cosmos 3 תחת רישיון פתוח היא מהלך אסטרטגי מבריק. בעוד שחברות כמו OpenAI או Runway שומרות את המודלים שלהן מאחורי חומות תשלום ו-API סגור, אנבידיה נותנת למפתחים את המפתחות לצוללת.
- •חיסכון בעלויות: אין צורך לשלם על כל "טוקן" של וידאו. מריצים את המודל על התשתית שלכם (RTX 6000 או שרתי Blackwell).
- •פרטיות דאטה: חברות תעשייה ורובוטיקה יכולות לאמן את המודלים שלהן על נתונים רגישים בלי שהם ייצאו לענן של חברה חיצונית.
- •ורסטיליות: המודל מגיע בגרסאות שונות – מ-Cosmos 3 Nano המיועד למכשירי קצה (Edge) ועד גרסאות Super למשימות מורכבות במיוחד.
מהשטח: מי כבר משתמש בזה?
חברות ענק כבר אימצו את הפלטפורמה. סמסונג ו-LG משתמשות ב-Cosmos כדי לאמן את הדור הבא של הרובוטים הביתיים שלהן. חברות כמו Li Auto ו-Waymo נעזרות בו כדי לסמלץ תרחישי קצה בכביש (Long-tail scenarios) שקשה מאוד לתעד במציאות, כמו תאונות נדירות או תנאי מזג אוויר קיצוניים.
על פי מדדי הביצועים האחרונים (כמו VANTAGE-Bench), המודל מדורג במקום הראשון בהבנת סביבות תעשייתיות וערים חכמות, כשהוא עוקף מודלים סגורים ויקרים בהרבה.
שורה תחתונה: העתיד הוא פיזי
אנחנו עוברים מהעידן שבו AI רק "מדברת" (צ'אטבוטים) לעידן שבו AI "פועלת" בעולם. Cosmos 3 הוא התשתית שתאפשר לסטארטאפים קטנים לבנות רובוטים חכמים שבעבר רק גוגל או אמזון יכלו להרשות לעצמם לפתח.
אם אתם מפתחים, זה הזמן להפשיל שרוולים. המודלים, הקוד והתיעוד כבר זמינים ב-Hugging Face וב-GitHub של אנבידיה.
רוצים להישאר מעודכנים בכל מה שחדש בעולם ה-AI והקלאוד? 📢 לערוץ הטלגרם שלי | 🟢 עקבו בוואטסאפ | 📸 Instagram
מקורות להעמקה: