דמיינו שאתם יכולים להקליט את עצמכם במשך חצי דקה בלבד, ומאותו הרגע המחשב שלכם מסוגל להקריא כל טקסט בקולכם המדויק כולל הניואנסים הקטנים, הלחישות והצחוק שלכם.
זה אולי נשמע כמו מדע בדיוני, אבל גוגל הופכת את זה למציאות ומביאה את מהפכת הבינה המלאכותית ישירות אל מיתרי הקול שלנו. השינוי הזה עומד לשנות לחלוטין את הדרך שבה אנחנו מייצרים ומקשיבים לתוכן קולי ביומיום.

איך זה עובד בפועל?
גוגל משיקה את מודלי הבינה המלאכותית החדשים שלה, Gemini 3.8 Flash TTS וגרסת הלייט שלו, שנועדו להפוך טקסט לדיבור אנושי ומרגש. המודל החדש מסוגל לשכפל קול מאושר מתוך דגימה של 30 שניות בלבד.
עוד באותו הנושא
בניגוד לכלים הישנים שהקריאו טקסט בצורה מונוטונית, המודל הזה יודע ממש 'לשחק' את הטקסט, לשלוט במבטא, בקצב הדיבור, להוסיף אנחות, לחישות ואפילו לנהל שיחה בין שני דוברים שונים מאותו התסריט.

היכולות החדשות הללו תומכות ביותר מ-100 שפות ודיאלקטים ומציעות מעל 2,000 קולות מוכנים לשימוש. המשתמשים הרגילים יוכלו לפגוש את הטכנולוגיה הזו כבר עכשיו, כאשר מודל ה-Flash TTS משולב בתוך Gemini Notebook, ומודל הלייט מגיע אל כלי יצירת הווידאו Google Vids.
מפתחים יוכלו לגשת לשני המודלים דרך ממשק ה-API של גוגל ופלטפורמת AI Studio כדי לשלב אותם באפליקציות ובשירותים שלהם.
איך גוגל שומרת על הבטיחות?
כדי למנוע שימוש לרעה וזיופי קול זדוניים, גוגל מציבה מגבלות אבטחה קשוחות. החברה דורשת אימות הסכמה מפורש לפני שכפול קול, ומוסיפה סימני מים דיגיטליים בטכנולוגיית SynthID ותעודות C2PA כדי לזהות שמדובר בקול שנוצר בבינה מלאכותית.
בנוסף, האפשרות לשכפול קול ב-AI Studio חסומה כרגע באזורים מסוימים בעולם, בהם בריטניה, האיחוד האירופי, הודו, טקסס ואילינוי.

למרות שחברות מתחרות כמו ElevenLabs עדיין מובילות במדדי איכות מסוימים, המודלים החדשים של גוגל מציגים ביצועים מרשימים במיוחד במבחני השוואה.
עבורנו, המשתמשים, מדובר בצעד ענק קדימה לקראת עולם שבו קולות דיגיטליים נשמעים אנושיים לחלוטין. כעת נותר רק לראות אילו שימושים יצירתיים נמצא לטכנולוגיה הזו בחיי היומיום שלנו.