OpenAI تطلق نماذج صوتية من الجيل القادم

النماذج الجديدة تمكّن المطورين من إنشاء وكلاء صوت متطورين قادرين على فهم الكلام بدقة والرد بشكل مخصص.
OpenAI تطلق نماذج صوتية من الجيل القادم

أعلنت شركة OpenAI، المطورة لمحادثات GPT، عن إطلاق جيل جديد من نماذج الصوت كجزء من واجهة برمجة التطبيقات الخاصة بها (API)، والتي توفر قدرات متقدمة جداً في التعرف على الكلام وإنتاج الصوت الاصطناعي. تهدف هذه النماذج إلى تحسين التفاعلات الصوتية بشكل ملحوظ بين الأنظمة الرقمية والمستخدمين البشريين، وهي متاحة الآن للمطورين حول العالم.

نماذج متقدمة للتعرف على الكلام

تتضمن الإطلاق نموذجين جديدين هما gpt-4o-transcribe وgpt-4o-mini-transcribe. تعرض هذه النماذج تحسينات كبيرة في جودة ودقة التعرف مقارنة بالنماذج السابقة مثل Whisper. وتظهر البيانات التجريبية أن النماذج الجديدة تحقق معدلات خطأ منخفضة للغاية (WER)، ما يعني أخطاء أقل في التعرف على الكلام، خصوصاً في البيئات الصاخبة وعند التحدث بلهجات مختلفة.

تعتمد التقنية الجديدة على التعلم العميق وتدريب مكثف على مجموعة واسعة من الأصوات وأساليب التحدث، ما يمكّنها من التعرف بشكل أكثر فعالية ودقة على الكلام الطبيعي مقارنة بالحلول الموجودة حالياً في السوق.

الصوت الاصطناعي المخصص

بالإضافة إلى التعرف على الكلام، أطلقت OpenAI نموذج gpt-4o-mini-tts، الذي يسمح للمطورين بتخصيص أسلوب النطق ونبرة الصوت الاصطناعي لأول مرة. يمكن الآن توجيه النموذج ليبدو بطريقة معينة، مثل "التحدث مثل ممثل خدمة عملاء متعاطف"، وبالتالي خلق تجربة مستخدم مخصصة تماماً لخدمة العملاء والقصص التفاعلية والتطبيقات الإبداعية الأخرى.

يفتح هذا النموذج أبوابًا عديدة لتطبيقات تهدف إلى خلق تجربة طبيعية وأكثر سلاسة بين المستخدم والوكيل الافتراضي بشكل لم يكن ممكنًا في السابق.

تقنيات متطورة وراء الكواليس

تحققت هذه الإنجازات المميزة بفضل عدة ابتكارات تقنية رئيسية. من بينها، استثمرت OpenAI بشكل كبير في تحسين منهجيات تدريب النماذج، بما في ذلك استخدام مجموعات بيانات صوتية أصلية وتقنيات تقطير متقدمة، واستراتيجيات تعلم التعزيز (Reinforcement Learning). ونتيجة لذلك، وصلت النماذج إلى مستويات دقة واستجابة لم تُر سابقاً.

توفر النماذج للمطورين

النماذج الجديدة متاحة الآن عبر واجهة برمجيات OpenAI، ووفقاً للشركة، توفر هذه النماذج طريقة سهلة وبسيطة لإضافة تفاعلات صوتية إلى الأنظمة القائمة. بالإضافة إلى ذلك، أعلنت OpenAI عن دمج مريح مع منصة Agents SDK، ما يسهّل تطوير تجارب محادثة صوتية بديهية أكثر.

أصوات مخصصة وتطبيقات جديدة

تعتزم OpenAI مستقبلاً مواصلة تحسين أداء نماذجها الصوتية، بما في ذلك إتاحة الفرصة للمطورين لإنشاء أصوات مخصصة. كما تخطط الشركة لتوسيع استثماراتها في نماذج متعددة الوسائط تشمل الفيديو مستقبلاً، بهدف إثراء تجارب المستخدم وجعل التفاعلات الافتراضية أكثر تقدماً.

تؤكد OpenAI التزامها بمعايير صارمة للسلامة والأخلاق، مع التعاون المستمر مع مجتمعات البحث وصناع السياسات لضمان تطبيق هذه التقنيات الجديدة بطريقة مسؤولة وآمنة.