להקליד בלי לגעת במסך: גוגל משיקה את מהפכת שפת הסימנים ב-Pixel 11
מודל ה-SL2T החדש של DeepMind מאפשר למשתמשים לסמן מול המצלמה ולהפוך תנועות לטקסט בזמן אמת – ישירות בתוך המקלדת.
במשך שנים, טכנולוגיות ה-Speech-to-Text (הפיכת דיבור לטקסט) שינו את הדרך שבה אנחנו מתקשרים עם המכשירים שלנו. אבל עבור קהילה של כ-70 מיליון חירשים וכבדי שמיעה ברחבי העולם, המהפכה הזו נשארה ברובה מחוץ לתחום. עם השקת סדרת ה-Pixel 11, גוגל מנסה לסגור את הפער הזה בעזרת טכנולוגיה חדשה שנקראת SL2T (Sign-Language-to-Text).
הפיתוח החדש, מבית מעבדת הבינה המלאכותית Google DeepMind, מאפשר למשתמשים להשתמש בשפת סימנים כדי להקליד הודעות, לחפש בגוגל או לשוחח עם Gemini, מבלי להקיש תו אחד על המסך.
איך זה עובד מאחורי הקלעים?
המודל SL2T הוא לא סתם עוד כלי לזיהוי תמונה. הוא אומן על מאגר נתונים עצום של מעל 100,000 שעות של שפת סימנים רב-לשונית. בניגוד לניסיונות קודמים שהתמקדו רק בתנועות הידיים, המודל הזה מסתכל על התמונה המלאה:
- •תנועות גוף וכתפיים: הבנת ההקשר הרחב של הסימון.
- •הבעות פנים: חלק בלתי נפרד מהדקדוק והמשמעות בשפות סימנים.
- •סימון ביד אחת: גוגל הבינה שבחיים האמיתיים, אנשים לעיתים קרובות מחזיקים את הטלפון ביד אחת ומסמנים ביד השנייה. המודל עבר אופטימיזציה מיוחדת כדי לעבוד בצורה מדויקת גם במצבים האלו.
לפי הדיווחים ב-Digital Trends, המערכת משולבת ישירות בתוך Gboard (המקלדת של גוגל) ובאפליקציית Live Transcribe. ברגע שהמצלמה מזהה סימון, הטקסט מופיע בשדה ההקלדה כאילו הוכתב בקול.
פרטיות וביצועים
אחד האתגרים הגדולים בפיתוח כזה הוא השמירה על הפרטיות. גוגל בחרה בגישה היברידית: המכשיר מבצע מעקב אחרי "נקודות ציון" (Pose Tracking) של הגוף באופן מקומי על המעבד של ה-Pixel 11, ורק נתוני התנועה האנונימיים נשלחים לענן לצורך תרגום הטקסט. זה מונע שליחת סרטוני וידאו מלאים של המשתמש לשרתים.
בשלב ההשקה, המערכת תומכת ב-ASL (שפת הסימנים האמריקאית) ומתרגמת אותה לאנגלית. עם זאת, בבלוג הרשמי של Google DeepMind צוין כי המודל נבנה מראש כרב-לשוני, וגוגל כבר עובדת על הרחבת התמיכה לשפות סימנים נוספות ולמכשירים נוספים בעתיד.
למה זה משנה לנו?
מעבר לערך הנגישות הברור, מדובר בפריצת דרך טכנולוגית שמראה לאן עולם ה-AI הולך. אנחנו עוברים מממשקים מבוססי טקסט וקול לממשקים רב-חושיים (Multimodal). היכולת של טלפון להבין שפה מורכבת שאינה מדוברת, ברמת דיוק גבוהה מספיק לשימוש יומיומי, היא הישג מרשים.
עבור משתמשי ה-Pixel 11, זה אומר שהטלפון הופך מכלי שרק "מקשיב" לכלי שבאמת "רואה" ומבין את המשתמש. זה מקצר את זמן התגובה בשיחות פנים אל פנים והופך את האינטראקציה עם הדיגיטל להרבה יותר טבעית עבור קהילת החירשים.
שורה תחתונה
גוגל לא רק השיקה פיצ'ר נגישות, היא הגדירה מחדש מהי "הקלדה". למרות שכרגע זה מוגבל ל-ASL ולמכשירי הדגל החדשים, הכיוון ברור: בעתיד הקרוב, השפה שבה אנחנו בוחרים לתקשר – בין אם בדיבור, בכתיבה או בסימון – לא תהווה יותר חסום טכנולוגי.
רוצים להישאר מעודכנים בכל מה שחדש בבינה מלאכותית וקלאוד? 📢 לעודכונים בטלגרם | 🟢 עקבו בוואטסאפ | 📸 Instagram