חזרה לכתבות

Gemini Robotics 2: המהפכה הבאה של גוגל ברובוטיקה

02 באוגוסט 2026344

המוח שהרובוטים חיכו לו: Gemini Robotics 2 משנה את כללי המשחק

כבר לא מדובר רק בביצוע פקודות, אלא בהבנה אמיתית של המציאות הפיזית. גוגל דיפמיינד לוקחת את ה-AI מהמסך אל העולם האמיתי.

במשך עשורים, רובוטיקה הייתה תחום של תכנות קשיח. אם רצית שרובוט ירים כוס, היית צריך להגדיר לו קואורדינטות מדויקות, כוח לחיצה ספציפי ומה לעשות אם הכוס מחליקה. ברגע שמשהו קטן השתנה בסביבה – למשל, הכוס זזה בסנטימטר – המערכת פשוט קרסה.

ההכרזה האחרונה של Google DeepMind על Gemini Robotics 2 מסמנת את סוף העידן הזה. אנחנו עוברים מרובוטים שמבצעים פקודות (Action-based) לרובוטים שחושבים ומסיקים מסקנות (Reasoning-based). זהו שינוי פרדיגמה שמשלב בין מודלי השפה הענקיים (LLMs) לבין עולם האוטומציה הפיזית.

מה זה בעצם Gemini Robotics 2?

בלב המערכת נמצא מודל VLA (Vision-Language-Action) מתקדם. בניגוד למודלים קודמים שרק ידעו לזהות חפצים או לענות על שאלות, הגרסה החדשה של Gemini לוקחת את יכולות ההסקה של מודלי ה-Gemini המוכרים ומטמיעה אותם ישירות בתוך ה"גוף" של הרובוט.

החידוש המרכזי הוא מודל החשיבה (Reasoning Model). הרובוט לא רק רואה תמונה, הוא מבין הקשר. אם תגידו לו "תנקה את השאריות של ארוחת הבוקר", הוא לא צריך שתגדירו לו מה זה צלחת מלוכלכת או איפה הפח. הוא מסוגל לתכנן רצף פעולות מורכב: לאסוף את הכלים, לפתוח את המדיח, ולזהות אם יש כוס שעלולה להישבר.

היכולת לתקן תוך כדי תנועה

אחד האתגרים הגדולים ברובוטיקה הוא הטיפול בשגיאות. ברוב המערכות הקיימות, כשהרובוט נתקל במכשול שהוא לא תוכנת אליו, הוא פשוט נעצר.

ב-Gemini Robotics 2, גוגל הטמיעה מנגנון של Self-Correction. המודל מריץ סימולציה פנימית של הפעולה תוך כדי הביצוע. אם הרובוט ניסה להרים קופסה והיא החליקה לו מהיד, הוא לא ימשיך ב"תנועה באוויר" כאילו כלום לא קרה. הוא יזהה את הכישלון בזמן אמת, ינתח למה זה קרה (למשל, אחיזה לא מספיק חזקה), וינסה שוב בטכניקה אחרת.

למה זה קריטי לעולם ה-Cloud וה-AI?

עבורנו, כאנשי טכנולוגיה ופיתוח, המשמעות היא אדירה:

  1. Generalization (הכללה): הרובוט מסוגל לבצע משימות בתוך סביבות שהוא מעולם לא ביקר בהן. זהו שלב ה-Zero-shot האמיתי בעולם הפיזי.
  2. שיתוף פעולה בין-רובוטי: המודל מאפשר לרובוטים שונים לתקשר ביניהם בשפה טבעית (או ייצוגים שלה) כדי לחלק משימות. רובוט אחד יכול להחזיק דלת בזמן שהשני מעביר ציוד כבד.
  3. פיתוח ללא קוד (Low-Code/No-Code): אם בעבר היינו צריכים מהנדסי רובוטיקה שיכתבו אלפי שורות קוד ב-C++ או ROS, היום אנחנו מתקרבים למצב שבו פקודה קולית או טקסטואלית פשוטה מתורגמת ישירות לביצוע פיזי.

נתונים מהשטח

בניסויים שערכה דיפמיינד, המערכת הציגה שיפור של מעל 40% ביכולת להתמודד עם משימות שלא נראו בשלב האימון, בהשוואה לדור הקודם (RT-2). בנוסף, זמן התגובה של המודל (Latency) ירד משמעותית הודות לאופטימיזציה של ה-TPU (יחידות עיבוד הטנזורים) של גוגל בענן, מה שמאפשר קבלת החלטות כמעט מיידית.

ניתן לקרוא עוד על המחקר המקורי בבלוג הרשמי של Google DeepMind ולראות את ההדגמות של מודלי ה-RT ב-GitHub של הפרויקט.

שורה תחתונה

אנחנו נמצאים בנקודת מפנה שבה ה-AI מפסיק להיות "כלוא" בתוך מסכים ושרתים. Gemini Robotics 2 הוא הוכחה לכך שבינה מלאכותית יוצרת (Generative AI) היא הרבה יותר מכתיבת מיילים או יצירת תמונות. היא הכוח המניע של הדור הבא של האוטומציה התעשייתית והביתית.

היכולת של מכונה להבין את העולם, לתכנן קדימה ולתקן את עצמה היא הצעד הגדול ביותר שנעשה לכיוון AGI (בינה מלאכותית כללית) שפועלת במציאות הפיזית שלנו.

📢 רוצים להישאר מעודכנים בחדשות הכי חמות בעולמות ה-AI והענן? לעדיכונים בטלגרם | עקבו בוואטסאפ | Instagram

תודה לערוץ Spotlight by Daniel Trabelsi של דניאל טרבלסי על השיתוף ועל ההשראה לכתבה הזו.

הצטרפו לערוץ
#גוגל#בינה מלאכותית#רובוטיקה#ג'מיני#Gemini Robotics 2#DeepMind#למידת מכונה#אוטומציה