חזרה לכתבות

המהפכה של מיקרוסופט: תמלול איכותי ב-10 סנט לשעה

03 בספטמבר 2026451

המהפכה השקטה של מיקרוסופט: תמלול איכותי ב-10 סנט לשעה

מודל ה-MAI-Transcribe-2 החדש לא רק זול יותר מכל מה שהכרנו, הוא גם מהיר פי 10 ומשאיר אבק למתחרים הגדולים.

תמלול אודיו לטקסט הוא אחד הכלים הכי שימושיים בארגז הכלים של כל מפתח, מנהל מוצר או מומחה אוטומציה. בין אם מדובר בסיכום פגישות, ניתוח שיחות שירות לקוחות או הנגשת תוכן וידאו, הצורך בטכנולוגיה מדויקת, מהירה וזולה הוא קריטי. עד היום, השוק נשלט על ידי מודלים כמו Whisper של OpenAI או שירותים ייעודיים יקרים, אבל ההכרזה האחרונה של מיקרוסופט על MAI-Transcribe-2 משנה את כללי המשחק לחלוטין.

מיקרוסופט לא רק שיפרה את הביצועים; היא יצאה למלחמת מחירים חזיתית מול גוגל ו-OpenAI, כשהיא מציעה מודל עוצמתי בשבריר מהעלות המקובלת בשוק.

ביצועים שמשאירים אבק למתחרים

הנתון המרשים ביותר ב-MAI-Transcribe-2 הוא המהירות. לפי הפרסומים הרשמיים של Microsoft AI, המודל מסוגל לעבד שעה שלמה של אודיו בתוך 10 שניות בלבד. מדובר בשיפור של פי 10 לעומת מודלים קודמים כמו GPT-Transcribe, מה שהופך אותו לפתרון אידיאלי עבור מערכות שדורשות עיבוד בזמן אמת או כמויות אדירות של נתונים.

מבחינת דיוק, המודל מציג תוצאות מרשימות במדד ה-WER (Word Error Rate). בבדיקות על בנצ'מרק FLEURS ב-60 שפות, המודל השיג שיעור שגיאה ממוצע של 5.2%, ובשפות המובילות הוא יורד אפילו ל-3.4%. זה מציב אותו מעל Whisper-Large-V3 ו-Gemini 3.5 Transcribe ברוב הפרמטרים של דיוק ומהירות.

לא רק טקסט: תכונות מתקדמות מובנות

אחד האתגרים הגדולים בתמלול הוא לא רק להבין מה נאמר, אלא מי אמר את זה ובאיזה הקשר. MAI-Transcribe-2 מגיע עם חבילת תכונות מובנית שחוסכת למפתחים עבודה רבה:

  • הפרדת דוברים (Diarization): המודל מזהה באופן אוטומטי מתי דובר מתחלף ומסמן זאת בטקסט.
  • זיהוי החלפת שפות (Language Switching): בשיחות רבות, במיוחד בישראל, אנחנו נוטים לערבב עברית ואנגלית. המודל יודע לזהות את המעבר בין השפות תוך כדי שיחה ולתמלל בהתאם.
  • חותמות זמן (Timestamps): הוספת חותמת זמן לכל מילה, מה שמאפשר סנכרון מושלם לווידאו או חיפוש מהיר בתוך קבצי אודיו.
  • הטיית הקשר (Contextual Biasing): אפשרות להזין למודל מונחים מקצועיים או שמות ספציפיים כדי לשפר את הדיוק בתחומים כמו רפואה, משפטים או טכנולוגיה.

מלחמת המחירים: 10 סנט לשעה

הבשורה האמיתית כאן היא המחיר. מיקרוסופט מציעה את המודל ב-10 סנט בלבד לשעת אודיו (כחלק מהצעת השקה מוגבלת בזמן). לשם השוואה, הגרסה הקודמת (MAI-Transcribe-1.5) עלתה כ-36 סנט לשעה. כפי שדווח ב-VentureBeat, המחיר הזה מציב לחץ אדיר על חברות מתמחות כמו Deepgram ו-AssemblyAI, שעד היום נחשבו למובילות בתחום היעילות הכלכלית.

עבור עסקים שמריצים אלפי שעות תמלול בחודש, המעבר ל-MAI-Transcribe-2 יכול לחסוך אלפי דולרים מבלי להתפשר על האיכות.

איך מתחילים לעבוד עם זה?

המודל זמין כבר עכשיו בשתי פלטפורמות מרכזיות:

  1. MAI Playground: סביבת בדיקות נוחה שמאפשרת להעלות קבצים או להקליט אודיו ישירות מהדפדפן ולראות את התוצאות בזמן אמת.
  2. Microsoft Foundry (לשעבר Azure AI Studio): הפלטפורמה המלאה למפתחים, שמאפשרת להטמיע את המודל בתוך אפליקציות באמצעות API, לנהל הרשאות ולבצע אופטימיזציה של ביצועים.

שורה תחתונה

מיקרוסופט מוכיחה שהיא כבר לא מסתמכת רק על השותפות עם OpenAI. הפיתוח של מודלים פנימיים (In-house) כמו סדרת MAI מאפשר לה להציע ביצועים טובים יותר במחירים ששום ספק אחר לא יכול להשתוות אליהם כרגע.

אם אתם בונים מוצר שמבוסס על קול, או אם אתם מחפשים דרך לייעל את תהליכי התמלול בארגון שלכם, MAI-Transcribe-2 הוא כנראה הפתרון המשתלם ביותר בשוק היום. השילוב בין מחיר אפסי, מהירות מטורפת ותמיכה ב-60 שפות הופך אותו לסטנדרט החדש בתחום.

למידע נוסף ועיון במסמכים הטכניים, כדאי לבקר ב-דף המודל הרשמי ב-Microsoft Learn.

תודה לערוץ Spotlight by Daniel Trabelsi של דניאל טרבלסי על השיתוף ועל ההשראה לכתבה הזו.

הצטרפו לערוץ
#תמלול אודיו#מיקרוסופט#MAI-Transcribe-2#בינה מלאכותית#זיהוי דיבור#אוטומציה#עיבוד שפה טבעית