أضافت شركة غوغل قدرات صوتية جديدة إلى نماذج جيميناي.. تتيح للذكاء الاصطناعي إنتاج أصوات أكثر واقعية وتنفيذ النصوص بأسلوب يحاكي الأداء التمثيلي.. مع إمكانية التحكم في النبرة واللهجة وسرعة الكلام والمشاعر والتوقفات وحتى الهمس والضحك والتنهدات.
وتأتي إمكانات جيميناي الجديدة ضمن توسع غوغل في تقنيات تحويل النص إلى كلام.. مع طرح نماذج Gemini 3.8 Flash TTS وFlash-Lite TTS.. التي تستهدف تقديم صوت مولد بالذكاء الاصطناعي بدرجة أكبر من الطبيعية والمرونة.
ولا تقتصر الميزة الجديدة على قراءة النصوص بصوت آلي، بل تمنح المستخدم قدرة أوسع على تحديد الطريقة التي يتم بها إلقاء الجمل.. وهو ما يجعلها مناسبة لمجموعة من الاستخدامات التي تعتمد على المحتوى الصوتي.
جيميناي يتحكم في طريقة إلقاء النصوص
تعتمد الميزة الجديدة في جيميناي على منح المستخدم تحكمًا تفصيليًا في الأداء الصوتي.
ويمكن للنموذج تنفيذ تعليمات مكتوبة باللغة الطبيعية لتحديد الطريقة التي ينبغي أن يتم بها نطق النص.
ويشمل ذلك التحكم في نبرة الصوت وسرعة الحديث واللهجة، إلى جانب مؤثرات صوتية وأداءات مثل الهمس والضحك والتنهدات والتوقفات أثناء الكلام.
وبذلك يصبح النص المكتوب بمثابة تعليمات يمكن من خلالها توجيه الذكاء الاصطناعي إلى تقديم أداء صوتي يتناسب مع طبيعة المحتوى.. بدلًا من الاكتفاء بتحويل الكلمات إلى تسجيل صوتي تقليدي.
وتدعم نماذج جيميناي الجديدة أكثر من 100 لغة ولهجة، ما يوسع نطاق استخدامها في إنتاج المحتوى الصوتي بلغات مختلفة.
استنساخ الأصوات باستخدام عينة مدتها 30 ثانية
من أبرز الإمكانات التي يقدمها التحديث دعم استنساخ الأصوات.
ووفق المعلومات المعلنة، يستطيع جيميناي الحفاظ على صوت متسق بالاعتماد على عينة صوتية تبلغ مدتها نحو 30 ثانية.
كما توفر غوغل أكثر من 2000 صوت جاهز للاستخدام في الإنتاج، إلى جانب إمكانية إنشاء صوت جديد بالكامل من خلال وصف مكتوب باللغة الطبيعية.
وتضع هذه الإمكانات جيميناي في نطاق أوسع من أدوات تحويل النص إلى كلام.. لأنها تسمح للمستخدم بالتحكم ليس فقط في الصوت، وإنما في أسلوب تقديم المحتوى أيضًا.
ومع ذلك، ترتبط ميزة استنساخ الصوت بشرط الحصول على الإذن اللازم لاستخدام الصوت.. في ظل المخاوف المتعلقة بإمكانية استخدام هذه التقنيات لانتحال أصوات أشخاص آخرين أو إنتاج محتوى دون موافقتهم.
محادثات بين شخصين بصوت ثابت
يمكن للنماذج الجديدة أيضًا إنتاج حوارات بين شخصين انطلاقًا من نص واحد.. مع الحفاظ على ثبات أصوات الشخصيات خلال التسجيلات الصوتية التي قد تمتد لساعات.
وتتيح هذه الخاصية إنشاء محتوى صوتي أكثر تنوعًا، خصوصًا في الحالات التي تتطلب وجود أكثر من شخصية أو متحدث داخل التسجيل نفسه.
ومن بين الاستخدامات المحتملة لهذه التقنية إنتاج البودكاست والكتب الصوتية والدبلجة والمحتوى المرئي الذي يعتمد على السرد.. بالإضافة إلى تطوير الوكلاء الصوتيين.
وتستهدف غوغل من خلال هذه الإمكانات تقليل الطابع الآلي الذي ارتبط لفترة طويلة بالأصوات التي ينتجها الذكاء الاصطناعي.. من خلال إضافة تفاصيل أكثر إلى طريقة النطق والتعبير.
نتائج جيميناي في اختبارات جودة الصوت
وأشارت غوغل إلى نتائج قوية حققتها النماذج الجديدة في عدد من اختبارات جودة الأصوات.
وبحسب البيانات التي أعلنتها الشركة، تصدر Gemini 3.8 Flash TTS الترتيب العام في اختبار Voice Design Benchmark التابع لشركة Hume AI.. كما سجل 60.8 نقطة في فئة اللهجات.
كما حصل نموذجا Flash وFlash-Lite على المركزين الأول والثاني في مؤشر الجودة العام لدى Hume.. بينما أظهرت اختبارات Voice Arena نتائج وضعت النموذجين في المراكز المتقدمة عبر عدد من اللغات.
لكن النتائج لم تكن متفوقة في جميع الفئات.
فقد سجلت ElevenLabs نتائج أعلى في اختبارات Hume الخاصة بجودة الصوت الفردي ومدى التنوع الذي يحاكي الأصوات البشرية.
وتوضح هذه النتائج أن المنافسة في مجال توليد الأصوات بالذكاء الاصطناعي لا تزال مستمرة بين عدد من النماذج والشركات.. مع اختلاف مستوى الأداء بحسب نوع الاختبار والمقياس المستخدم.
جيميناي يصل إلى أدوات غوغل
لا تقتصر تقنية جيميناي الصوتية الجديدة على أدوات المطورين، إذ بدأت غوغل طرح Flash TTS داخل تطبيق Gemini Notebook.
كما يصل نموذج Flash-Lite TTS إلى خدمة Google Vids، بالتزامن مع توسيع نطاق إتاحة مولد الفيديو Omni داخل الخدمة أمام عدد أكبر من المستخدمين.
أما المطورون، فيمكنهم الوصول إلى النموذجين من خلال Gemini API وAI Studio، بما يسمح بدمج قدرات تحويل النص إلى كلام داخل تطبيقات وخدمات مختلفة.
ويعكس هذا التوسع توجه غوغل إلى جعل تقنيات جيميناي الصوتية متاحة في أكثر من منتج، بدلًا من حصرها في تجربة واحدة للمستخدم النهائي.
غوغل تضع قيودًا على استنساخ الأصوات
ومع تطور تقنيات استنساخ الصوت، تزداد أهمية إجراءات الحماية لمنع استخدامها بصورة غير مصرح بها.
وتتطلب غوغل التحقق من امتلاك المستخدم الإذن اللازم لاستخدام الصوت قبل إجراء عملية الاستنساخ.. كما تعتمد على تقنية SynthID لإضافة علامات مائية إلى المحتوى المولد بالذكاء الاصطناعي.
وتستخدم الشركة أيضًا بيانات اعتماد C2PA للمساعدة في تحديد المحتوى الذي تم إنشاؤه أو تعديله باستخدام تقنيات الذكاء الاصطناعي.
كما تفرض غوغل قيودًا جغرافية على ميزة استنساخ الأصوات داخل AI Studio.. حيث لا تتوفر الميزة في عدد من المناطق، من بينها المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند
إضافة إلى ولايتي تكساس وإلينوي في الولايات المتحدة.
وتأتي هذه الإجراءات في وقت تتوسع فيه تقنيات الذكاء الاصطناعي التوليدي بسرعة.. خصوصًا في إنتاج الصوت والفيديو، وهو ما يجعل آليات التحقق من مصدر المحتوى والحصول على الموافقة عوامل مهمة عند استخدام تقنيات استنساخ الأصوات.
جيميناي يوسع استخدامات الذكاء الاصطناعي الصوتي
تكشف إمكانات جيميناي الجديدة عن تحول واضح في طريقة تعامل نماذج الذكاء الاصطناعي مع الصوت.
فبدلًا من الاقتصار على تحويل النص المكتوب إلى كلام، أصبح بإمكان المستخدم تحديد طريقة الأداء وتفاصيل الإلقاء بدرجة أكبر.
وتفتح هذه القدرات المجال أمام تطبيقات في البودكاست والكتب الصوتية والدبلجة والفيديوهات التعليمية والمحتوى المروي.. إلى جانب التطبيقات التي تعتمد على التفاعل الصوتي.
وفي الوقت نفسه، تظل تقنية استنساخ الأصوات مرتبطة بتحديات تتعلق بالموافقة والخصوصية وإمكانية إساءة استخدام الأصوات.. وهو ما يفسر الإجراءات التي أعلنتها غوغل لتقييد بعض الاستخدامات وإضافة وسائل تساعد في التعرف على المحتوى المولد بالذكاء الاصطناعي.
وبهذه الخطوة، توسع غوغل نطاق استخدام جيميناي في مجال الصوت، مع التركيز على تقديم أصوات أكثر مرونة وتحكمًا، إلى جانب توفير أدوات للمطورين والمستخدمين لإنتاج محتوى صوتي أكثر تنوعًا.










