يحول الصوت إلى نص أكثر دقة، جوجل يطلق Gemini 3.5 Transcribe - النيل نيوز

بوابة فيتو 0 تعليق ارسل طباعة تبليغ حذف

نعرض لكم زوارنا أهم وأحدث الأخبار فى المقال الاتي:
يحول الصوت إلى نص أكثر دقة، جوجل يطلق Gemini 3.5 Transcribe - النيل نيوز, اليوم الأربعاء 26 أغسطس 2026 10:53 مساءً

أعلنت شركة جوجل إطلاق نموذجها الجديد Gemini 3.5 Transcribe، المخصص لتحويل الكلام إلى نص، في خطوة تستهدف تطوير تجربة التفاعل الصوتي مع تطبيقات وأدوات الذكاء الاصطناعي.

وتراهن جوجل على النموذج الجديد لتقديم تجربة تتجاوز مجرد تسجيل الكلمات المنطوقة، إذ يستطيع فهم سياق الحديث، التعامل مع التصحيحات أثناء الكلام، التخلص من العبارات الزائدة، وإخراج النص بصورة منظمة.

ويعمل Gemini 3.5 Transcribe بالفعل ضمن مجموعة من خدمات جوجل، أبرزها ميزة Rambler في لوحة مفاتيح Gboard على هواتف أندرويد  بينما تستعد الشركة لإطلاقه قريبًا داخل متصفح الكروم.

Gemini 3.5 Transcribe.. نقلة جديدة في تحويل الصوت إلى نص

تقول جوجل إن النموذج الجديد صُمم لفهم الطريقة الطبيعية التي يتحدث بها المستخدم، بما يساعده على استنتاج المقصود بدلًا من نقل كل كلمة مسموعة بشكل حرفي.

ويستطيع Gemini 3.5 Transcribe التعامل مع المواقف التي يغير فيها المستخدم رأيه أثناء الحديث، فعلى سبيل المثال إذا قال: «سنلتقي الثلاثاء، لا الأربعاء»، يمكن للنموذج تقديم النص النهائي بعد تصحيح المعلومة.

كما يتخلص تلقائيًا من كلمات التردد والحشو مثل «آه» و«أمم»، ويعيد ترتيب النص وتنسيقه ليصبح أكثر ملاءمة للقراءة والاستخدام المباشر.

— Google (@Google) This is a Twitter Status

دقة Gemini 3.5 Transcribe تصل إلى مستويات جديدة

تستند جوجل في تقييم أداء النموذج إلى اختبارات أجرتها التحليل الاصطناعي، والتي أظهرت معدل خطأ في الكلمات (WER) عند 4% في عمليات النسخ المباشر، مقابل 2.6% في معالجة التسجيلات غير المباشرة.

وتبرز أهمية هذه النتائج في قدرة النموذج على التعامل مع التسجيلات التي تحتوي على ضوضاء أو ظروف صوتية غير مثالية، إلى جانب التعرف على البيانات التي تتضمن حروفًا وأرقامًا، مثل أرقام الطلبات والرموز البريدية.

وترى جوجل أن هذه القدرات تمنح النموذج أفضلية مقارنة بأدوات التعرف التقليدية على الكلام، خصوصًا في الاستخدامات التي تتطلب نصًا جاهزًا للاستخدام بدلًا من تفريغ صوتي خام.

أكثر من 85 لغة ولهجة

لا يقتصر Gemini 3.5 Transcribe على لغة واحدة، إذ يدعم أكثر من 85 لغة مع إمكانية اكتشاف اللغة تلقائيًا.

وتشير جوجل إلى أن النموذج قادر على التعامل مع اللهجات المختلفة وأنماط النطق الإقليمية، ما يعزز فرص استخدامه في تطبيقات الصوت العالمية.

كما يتضمن النظام تقنية للتعرف على المتحدثين داخل الملفات الصوتية المسجلة مسبقًا، مع دعم تحديد ما يصل إلى ثلاثة متحدثين وإضافة توقيتات إلى الكلام.

Rambler على لوحة المفاتيح: يحول الصوت إلى كتابة ذكية

بدأت جوجل بالفعل استخدام Gemini 3.5 Transcribe في ميزة Rambler على لوحة مفاتيح Gboard لأجهزة إندوريد.

وتمنح الميزة المستخدم إمكانية التحدث بدلًا من الكتابة، مع تحويل كلامه إلى نص منظم وإزالة العبارات غير الضرورية.

ولا تتوقف الوظيفة عند الإملاء، إذ يمكن للمستخدم إصدار تعليمات صوتية لتصحيح الكلمات أو تغيير صياغة النص أو تعديل أسلوب الكتابة.

وبذلك يصبح الصوت وسيلة للتحرير أيضًا، وليس مجرد طريقة لإدخال النص.

متصفح الكروم يحصل على ميزة الكتابة بالصوت

تخطط جوجل لتوسيع نطاق Gemini 3.5 Transcribe بإطلاقه داخل متصفح الكروم.

ومن خلال الميزة المرتقبة، سيتمكن المستخدم من استخدام صوته للكتابة مباشرة داخل حقول النص على مواقع الإنترنت، سواء لكتابة الردود أو إعداد المنشورات أو إدخال الأوامر إلى جيمنياي.

وتأتي هذه الخطوة في إطار توجه جوجل نحو جعل التفاعل الصوتي أكثر حضورًا في تجربة استخدام الإنترنت.

النموذج يتجاوز النسخ إلى تنفيذ المهام

من أبرز الجوانب التي تميز Gemini 3.5 Transcribe إمكانية ربطه بأدوات ونماذج ذكاء اصطناعي أخرى لتنفيذ مهام مختلفة.

وتتيح خاصية Function Calling للنموذج تفويض عمليات أكثر تعقيدًا إلى نماذج Gemini الأخرى، مثل تحليل الملفات أو إنشاء الصور.

وتظهر هذه الإمكانيات في تطبيق جيمنياي على أجهزة macOS، حيث يمكن للمستخدم إعطاء تعليمات صوتية، بينما يستفيد النظام من سياق الشاشة والملفات المفتوحة لتنفيذ المطلوب.

جوجل أنتي جرافيتي يستفيد من فهم السياق

أصبح النموذج متاحًا أيضًا داخل مربع الأوامر الصوتية في جوجل أنتي جرافيتي (Google Antigravity).

وبعد الحصول على إذن المستخدم، يستطيع النظام الاستفادة من محتوى الشاشة وسجل المحادثة لتحسين دقة النسخ، خصوصًا عند التعامل مع أسماء الملفات والمستندات المفتوحة والمعلومات المتعلقة بالمهام الجارية.

وتوفر جوجل كذلك Gemini 3.5 Transcribe في استوديو جوجل للذكاء الاصطناعي بما يسمح للمطورين باستخدام الصوت أثناء بناء التطبيقات وتنفيذ بعض مهام البرمجة.

Gemini 3.5 Transcribe أسرع من Chirp 3

لم تركز جول على دقة النسخ فقط، بل أجرت تحسينات على سرعة الاستجابة مقارنة بنموذج Chirp 3 السابق.

وبحسب أرقام الشركة، تحسن الوقت اللازم للوصول إلى النص النهائي بنسبة 70%، وهو ما يعزز استخدام Gemini 3.5 Transcribe في التطبيقات التي تعتمد على المحادثات الصوتية الفورية.

وعلى اختبار FLEURS، سجل النموذج معدل خطأ قدره 5.50% في وضع البث المباشر و5.04% في معالجة الصوت غير المباشرة عبر مجموعة من اللغات والمناطق.

كيف يمكن للمطورين استخدام Gemini 3.5 Transcribe؟

أتاحت جوجل النموذج للمطورين ضمن مرحلة معاينة عامة عبر واجهة برمجة تطبيقات جيمنياي، من خلال استوديو جوجل للذكاء الاصطناعي، وجوجل أنتي جرافيتي

ويعمل النموذج عبر مسارين رئيسيين؛ الأول مخصص للتعامل مع الصوت المباشر والبث المتواصل بزمن استجابة منخفض، بينما يركز الثاني على الملفات الصوتية المسجلة والاجتماعات وسجلات المكالمات، مع إمكانيات تحديد المتحدثين وإضافة التوقيتات.

أما قطاع الأعمال، فأصبح بإمكانه تجربة النموذج عبر منصة وكلاء جيميناي إنتربرايز، على أن يصل لاحقًا إلى جيميناي إنتربرايز لتجربة العملاء.

أخبار ذات صلة

0 تعليق