חזרה לכתבות

מהפכת ה-Agentic Video: גוגל מפחיתה עלויות ניתוח ב-88%

02 בספטמבר 2026204

מהפכת ה-Agentic Video: גוגל חותכת את עלויות ניתוח הווידאו ב-88%

במקום לסרוק כל פריים בצורה עיוורת, המודלים החדשים של Gemini יודעים "לדלג" לחלקים החשובים באמת. כך תשתמשו בזה כדי לבנות מוצרים חכמים, מדויקים וזולים משמעותית.

וידאו נחשב מאז ומתמיד ל"בוס האחרון" של עולם הבינה המלאכותית. הוא כבד, הוא עמוס במידע לא רלוונטי, והוא יקר להחריד לעיבוד. עד היום, כשביקשנו ממודל שפה לנתח סרטון, הוא נאלץ לעבוד בשיטה הסטטית: דגימה של פריים אחד בכל שנייה (1 FPS) והזנה של כל המידע הזה לתוך חלון ההקשר (Context Window). התוצאה? בזבוז עצום של טוקנים ועלויות שמרקיעות שחקים.

גוגל משנה כעת את כללי המשחק עם השקת ה-Agentic Video Understanding ב-Gemini API. זהו לא סתם שיפור טכני, אלא שינוי תפיסתי באופן שבו המודל "צופה" בתוכן.

מה זה בכלל Agentic Video?

בניגוד לשיטה הסטטית, שבה המודל מקבל את כל הפריימים מראש בצורה אחידה, בשיטה האג'נטית המודל פועל כ"סוכן" (Agent). הוא מקבל את השאלה שלכם, ועל בסיסה הוא מחליט אילו חלקים בווידאו דורשים בדיקה מעמיקה.

הוא יכול לסרוק את התמלול (Transcript), להבין היכן נמצא המידע הרלוונטי, ורק אז "לגשת" לפריימים הספציפיים או לאודיו באותן נקודות זמן. לפי התיעוד הרשמי של Google AI for Developers, המודל מנווט באופן דינמי על ציר הזמן ומתאים את קצב דגימת הפריימים והרזולוציה לפי הצורך.

המספרים שמאחורי המהפכה

המעבר לשיטה האג'נטית מביא איתו שני יתרונות דרמטיים:

  1. חיסכון של עד 88% בטוקנים: עבור סרטונים ארוכים, המודל טוען רק את מה שצריך. במקום לשלם על אלפי פריימים מיותרים, אתם משלמים רק על המידע ששימש להפקת התשובה. זהו גורם קריטי לכל מי שמפתח אפליקציות מבוססות וידאו ורוצה לשמור על רווחיות.
  2. שיפור של כ-7% באיכות הניתוח: באופן מפתיע (או שלא), כשממקדים את המודל בעיקר ולא בטפל, הוא טועה פחות. היכולת להתמקד בפרטים ברזולוציה גבוהה רק כשזה נחוץ, משפרת את הדיוק של התשובות הסופיות.

איך מטמיעים את זה בפועל?

הפיצ'ר זמין כעת דרך ה-Gemini API עבור מודלים נבחרים, ובראשם Gemini 3.7 Flash (המודל המהיר והיעיל ביותר של גוגל כיום).

כדי להפעיל את היכולת הזו, כל מה שצריך לעשות הוא להוסיף פרמטר פשוט בקריאת ה-API. בשימוש ב-GenerateContent API, יש להגדיר את השדה

media_processing
לערך
AGENTIC
.

חשוב לשים לב: עבור סרטונים קצרים מאוד (פחות מ-5 דקות), השיטה הסטטית עשויה להיות מהירה יותר מבחינת זמן תגובה ראשוני (TTFT), כיוון שהשיטה האג'נטית דורשת מהמודל לבצע סבב של "חשיבה" ותכנון לפני שהוא מתחיל להפיק תשובה. אבל ברגע שמדובר בהרצאות, הקלטות זום או סרטים מלאים – אין בכלל תחרות.

מקרי בוחן: איפה זה נותן ערך אמיתי?

  • ניתוח הקלטות פגישות וזום: במקום לסרוק שעה של וידאו כדי למצוא מתי דובר על תקציב, המודל קופץ ישירות לנקודה הנכונה וחוסך הון בעלויות ענן.
  • למידה מרחוק: סטודנטים יכולים לשאול שאלות על נושא ספציפי בתוך הרצאה של שלוש שעות, וה-AI ימצא את ההסבר המדויק מבלי לעבד את כל הסרטון מחדש.
  • אבטחה ובטיחות: חיפוש אירועים ספציפיים בתוך שעות של צילומי אבטחה הופך למהיר וזול משמעותית.

שורה תחתונה

גוגל ממשיכה להוביל בפתרונות לווידאו ארוך (Long-context), וה-Agentic Video הוא צעד ענק קדימה. עבור מפתחים, מדובר בהזדמנות להוזיל עלויות תפעוליות בצורה דרמטית מבלי להתפשר על האיכות. אם אתם עובדים עם וידאו ב-Gemini, זה הזמן לעדכן את הקוד שלכם.

לפרטים נוספים על תמחור וטוקנים, מומלץ לבקר בדף התמחור של Gemini API.

תודה לערוץ Spotlight by Daniel Trabelsi של דניאל טרבלסי על השיתוף ועל ההשראה לכתבה הזו.

הצטרפו לערוץ
#בינה מלאכותית#גוגל#Gemini#ניתוח וידאו#Agentic Video#פיתוח תוכנה#למידת מכונה