جيميني 3.5 ترانسكرايب: نموذج جوجل الجديد لتحويل الصوت إلى نص

  • كشفت جوجل عن Gemini 3.5 Transcribe، وهو نموذجها الأكثر دقة لتحويل الكلام إلى نص حتى الآن.
  • يوفر البرنامج خاصية النسخ الذكي التي تصحح الأخطاء التلقائية، وتزيل الكلمات الحشو، وتقوم بتنسيق النص تلقائيًا.
  • يدعم البرنامج أكثر من 85 لغة، ويتعرف على ما يصل إلى ثلاثة متحدثين، ويقلل وقت النسخ بنسبة 70% مقارنة ببرنامج Chirp 3.
  • متوفر بالفعل على Gboard و Gemini لنظام macOS وللمطورين؛ ومن المخطط إطلاقه على Chrome.

جيميني 3.5 نسخ

كشفت جوجل النقاب عن "جيميني 3.5 ترانسكرايب"، نموذجها الجديد للذكاء الاصطناعي المتخصص في تحويل الكلام إلى نص. وتصفه الشركة بأنه نظامها الأكثر دقة حتى الآن، والمصمم خصيصًا للتفاعلات الصوتية الذكية. وعلى عكس الأنظمة التقليدية، لا يقتصر هذا النموذج على نسخ الكلام فحسب، بل يفسر أيضًا نية المتحدث، ويصحح الأخطاء فورًا، وينتج نصًا واضحًا ومنسقًا.

صُمم هذا النموذج للاستخدام الفوري والمسجل، ويُتوقع أن يُقدم أداءً ممتازًا في البيئات الصاخبة، ومع اللهجات القوية، أو المصطلحات التقنية. علاوة على ذلك، فهو يكتشف تلقائيًا أكثر من 85 لغة، ويتعرف على ما يصل إلى ثلاثة متحدثين، ويُضيف طوابع زمنية لكل كلمة. كل هذا يتم بمعدل خطأ منخفض للغاية، وفقًا لاختبارات مستقلة.

النسخ الذكي: أكثر من مجرد إملاء

جيميني 3.5 نسخ

من أبرز ميزات برنامج Gemini 3.5 Transcribe قدرته على فهم التصحيحات الذاتية. فعلى سبيل المثال، إذا قال المتحدث: "لنلتقي يوم الثلاثاء... لا، يوم الأربعاء"، سيستخدم البرنامج الخيار الثاني. كما أنه يتخلص من الكلمات الحشو مثل "أمم" و"همم"، ويطبق علامات الترقيم والتنسيق تلقائيًا. علاوة على ذلك، يتيح لك إضافة مفردات مخصصة للتعرف على الأسماء العلمية والمصطلحات التقنية والكلمات غير الشائعة. ووفقًا لبيانات جوجل، يبلغ معدل الخطأ لكل كلمة 4% للصوت المتدفق و2,6% للصوت المسجل مسبقًا، وذلك وفقًا لقياسات التحليل الاصطناعي.

ومن أبرز ميزاته الأخرى السرعة. فمقارنةً بسابقه، Chirp 3، تدّعي جوجل أن وقت الحصول على النص النهائي قد انخفض بنسبة 70%. وفي البث المباشر، يكون زمن الاستجابة أقل من ثانية واحدة، مما يتيح استخدامه في الترجمة الفورية أو المساعدين الصوتيين.

الاندماج في منظومة جوجل

جيميني 3.5 نسخ

تم دمج ميزة "النسخ" في Gemini 3.5 في العديد من منتجات جوجل. على نظام أندرويد، تستخدم ميزة "رامبلر" في Gboard هذه الميزة لتحويل الصوت إلى نص. كما أنها متوفرة في تطبيق Gemini لنظام macOS، مما يتيح للمستخدمين استخدام الأوامر الصوتية مع سياق الشاشة لتلخيص الملفات، وإنشاء الصور، أو إعادة استخدام النصوص. بالإضافة إلى ذلك، يدمج تطبيق Google Antigravity هذه الميزة لدمج سياق الشاشة وسجل المحادثات.

أعلنت الشركة أيضًا أن هذه الميزة ستتوفر قريبًا في متصفح كروم. ستتيح هذه الميزة للمستخدمين إمكانية إملاء النصوص في أي حقل ويب، مثل رسائل البريد الإلكتروني، والنماذج، والمنشورات، دون الحاجة إلى الكتابة. ورغم عدم تحديد موعد محدد، يُتوقع أن تُسهم هذه الميزة في توسيع نطاق استخدام ميزة تحويل النصوص إلى صوت في المتصفح.

التوافر للمطورين

جيميني 3.5 نسخ

بالنسبة للمطورين، يتوفر Gemini 3.5 Transcribe بنسخة تجريبية عامة عبر واجهة برمجة تطبيقات Gemini، وفي Google AI Studio، ومنصة Gemini Enterprise Agent. يُقدم إصداران: واجهة برمجة تطبيقات Live للبث المباشر ثنائي الاتجاه بزمن استجابة أقل من ثانية واحدة، وواجهة برمجة تطبيقات Interactions لمعالجة الصوت المسجل مسبقًا مع تحديد هوية المتحدث والطوابع الزمنية. صُممت الأولى لوكلاء الصوت والترجمة الفورية، بينما تُعد الثانية مفيدة للاجتماعات والمقابلات وتحليلات المكالمات.

يمكن للنموذج أيضًا تفويض المهام المعقدة إلى نماذج Gemini أخرى، مثل إنشاء الصور أو تحليل الملفات، من خلال استدعاءات الدوال. هذه الميزة متوفرة حاليًا في تطبيق Gemini لنظام macOS.

يتجلى التزام جوجل بالصوت كواجهة أساسية مع إطلاق Gemini 3.5 Transcribe. فمزيجه من الدقة والسرعة والميزات الذكية يجعله أداةً رئيسيةً للمستخدمين والمطورين على حدٍ سواء. ومع اقتراب إطلاقه في متصفح Chrome، قد يصبح الإملاء الصوتي شائعًا على الإنترنت. ويبقى أن نرى كيف سيتكيف مع حالات الاستخدام الأكثر تطلبًا، لكن البيانات الأولية واعدة.


أضف كمصدر مفضل في جوجل