دراسة حالة الذكاء الاصطناعي للموسيقى
جمع بيانات صوت الغناء
مجموعة صوتية للغناء تعتمد على الصوت للتدريب على خوارزمية المعادلة والضغط: التقاط التنوع اللغوي والموسيقي
نظرة عامة على المشروع
تعاونت شركة شايب مع شركة رائدة في مجال التكنولوجيا لجمع تسجيلات صوتية غنائية متنوعة بأربع لغات ذات أولوية: الصينية والعربية والإسبانية والروسية. ويهدف المشروع إلى توفير بيانات عالية الجودة لتدريب خوارزميات الضغط ومعادلات الذكاء الاصطناعي، والتي تعد ضرورية لتحسين معالجة الصوت الآلية.
وتضمنت المجموعة 40 مشاركًا (10 لكل لغة) من مختلف الأنواع، مع التركيز على التسجيلات عالية الجودة في الاستوديو باستخدام ميكروفونات وبيئات متنوعة.
إحصائيات أساسية
أربع لغات: الصينية، العربية، الإسبانية، الروسية
10 مغنيين إلى
اللغة (40 المجموع)
خلال 20 ساعة of
صوت الغناء
صيغة الصوت: PCM بتردد 48 كيلوهرتز، أحادي، WAV
نسخ الصوت باللغات الأصلية
مدة المشروع:
اسبوعين
نطاق المشروع
جمع البيانات
شمل النطاق جمع الصوت الغنائي بأربع لغات مستهدفة، سجلها فنانون حقيقيون من مختلف الأنواع الموسيقية. وتم استخدام بيئة الاستوديو لضمان تسجيلات عالية الجودة مناسبة لتدريب نماذج الذكاء الاصطناعي.
المتطلبات الرئيسية
- المشاركون: 10 مغنيين لكل لغة، مع توزيع متوازن بين الجنسين (50% ذكور، 50% إناث).
- الأنواع: مجموعة متنوعة من الأنواع، تم تحديدها ذاتيًا من قبل الفنان، وتم التحقق من صحتها من أجل الاتساق.
- بيئة التسجيل: جودة الاستوديو، مع إعدادات ميكروفون متعددة (ديناميكي، مكثف).
- تنسيق الصوت: 48 كيلو هرتز PCM، أحادي، ملفات WAV، بدون معالجة (على سبيل المثال، بدون ضغط، معادل، صدى).
- نص: الأغاني التي سيتم نسخها باللغة التي يتم غنائها، مع قواعد خاصة للأغاني ثنائية اللغة.
- اللغات: الصينية والعربية والإسبانية والروسية
- نسخ
- ينبغي توفير النصوص المكتوبة بلغة التسجيل (على سبيل المثال، السطور الهندية باللغة الديفاناغارية، متبوعة باللغة الإنجليزية).
- تأكد من أن كل مقطع لا يتجاوز 15 ثانية من أجل الوضوح والدقة.
- متطلبات التسجيل الصوتي
- حد أدنى 3 إعدادات للميكروفون لكل جلسة تسجيل.
- 3 دقائق لكل أغنية، مع 3 لقطات لكل أغنية، مما يضمن تسجيلات ميكروفون متنوعة لكل مشارك.
- بيئة صوتية بجودة الاستوديو بدون ضوضاء في الخلفية.
التحديات
تنوع المشاركين
كان ضمان توزيع متوازن للمطربين حسب الجنس ونبرة الصوت/الطبقة والنوع الموسيقي تحديًا معقدًا.
تناسق البيانات
الحفاظ على إعدادات الميكروفون والبيئة الثابتة أثناء التقاط العروض الصوتية المتنوعة بالعديد من اللغات.
مراقبة جودة الصوت
ضمان جودة الصوت في الاستوديو دون ضوضاء خارجية، ونسخ دقيق في لغات متعددة.
الحلول
قدم شايب حلاً شاملاً لتلبية متطلبات المشروع من خلال:
- استقطاب 40 مغنيًا من أربع لغات وضمان التمثيل المتنوع من حيث الجنس والمستوى والأسلوب الموسيقي.
- إجراء تسجيلات بجودة الاستوديو باستخدام أنواع مختلفة من الميكروفون (ديناميكي، مكثف) لالتقاط مجموعة واسعة من البيانات الصوتية.
- نسخ التسجيلات الصوتية بدقة باللغات المستخدمة، مع اتباع قواعد محددة للأغاني ثنائية اللغة.
- الموافقة: سيتم جمع نماذج الموافقة من جميع المشاركين قبل التسجيل.
نتيجة
سمحت البيانات الصوتية المتنوعة التي تم جمعها للعميل بتطوير مجموعة تدريب قوية لخوارزميات الضغط والمعادلات الآلية، مما أدى إلى تحسين جودة معالجة الصوت. ضمنت التسجيلات عالية الجودة والبيانات الوصفية التفصيلية أن نماذج الذكاء الاصطناعي يمكنها التعامل مع الأنواع الموسيقية المختلفة والتعقيدات اللغوية. النتائج الرئيسية:
- بيانات صوتية عالية الجودة ومتنوعة لتدريب أنظمة الذكاء الاصطناعي.
- نسخ دقيق وبيانات وصفية للتحليل.
- أساس أقوى لأدوات معالجة الصوت المعتمدة على الذكاء الاصطناعي.
التسليمات
- 20 ساعة من التسجيلات الصوتية بجودة الاستوديو (48 كيلو هرتز PCM، ملفات WAV أحادية).
- النصوص المكتوبة باللغة التي تم التسجيل بها.
- البيانات الوصفية: طراز/ماركة الميكروفون، واجهة DAC/الصوت، ملف تعريف المغني، معلومات النوع.
- تنسيق JSON للنسخ مع البيانات الوصفية.
لقد كانت قدرة شايب على استيعاب تنوع المواهب الموسيقية والثراء اللغوي ذات قيمة لا تُقدر لتطوير خوارزميات معادلة الصوت والضغط لدينا. حرص فريقهم على التعامل بدقة متناهية مع كل جانب، بدءًا من اختيار الفنانين وصولًا إلى جودة التسجيل، مما جعل هذه الخطوة أساسية في تحسين أنظمة معالجة الصوت الآلية لدينا. نحن ممتنون حقًا للثقة والتعاون الذي أبدته شايب طوال هذه العملية. على الرغم من متطلباتنا التقنية الصارمة والصعبة، إلا أن تفانيهم وعملهم الجاد واهتمامهم بالتفاصيل كان استثنائيًا. لقد كان من دواعي سرورنا العمل مع فريق ملتزم بتقديم التميز.