المستخلص
التعرف على العواطف من الصوت (Speech Emotion Recognition – SER) يُعد أحد المجالات المحورية في ميدان التفاعل بين الإنسان والحاسوب (Human–Computer Interaction – HCI)، حيث يُمكّن الأنظمة الذكية من فهم وتحليل العواطف البشرية المنقولة عبر الإشارات الصوتية.
تتناول هذه الدراسة استخدام نماذج حاسوبية متقدمة تشمل: الشبكات العصبية الالتفافية (CNNs)، والشبكات العصبية النبضية (SNNs)، وآليات الانتباه الزمني (Temporal Attention Mechanisms)، والمشفّرات المحوّلة (Transformer Encoders)، وذلك بدعم من تقنيات معالجة الإشارات الرقمية (DSP) في مرحلة المعالجة المسبقة واستخراج الخصائص. يتم تمثيل المعلومات العاطفية في الصوت باستخدام معاملات التردد الميل القياسية (MFCCs)، وخصائص الكروما(Chroma features)، والتباين الطيفي (Spectral Contrast)، ومعدل عبور الصفر (Zero Crossing Rate – ZCR). ولتعزيز متانة النموذج وقدرته على التعميم في البيئات الصوتية الواقعية، تم تطبيق تقنيات زيادة البيانات (Data Augmentation) مثل إضافة الضوضاء، وتغيير النغمة، وتغيير الزمن.
تقدم هذه الدراسة تطوير وتنفيذ نظام يعتمد على التعلم العميق للتعرف على العواطف من الصوت، قادر على تصنيف سبع حالات عاطفية بدقة وتشمل: الغضب، الاشمئزاز، الخوف، السعادة، المفاجأة، الحزن، والحياد.
تم تدريب النموذج وتقييمه باستخدام أربع مجموعات بيانات هي:TESS، SAVEE، RAVDESS، وCREMA-D، بمجموع 12.162 عينة صوتية. تم استخدام خوارزمية التحسين AdamW مع آلية الإيقاف المبكر (Early Stopping) وجدولة معدل التعلم (Learning Rate Scheduling) خلال 100 حقبة تدريبة (epochs) . أظهرت النتائج التجريبية أداءً متميزًا، حيث تم تحقيق دقة بلغت99.5٪ على بيانات الاختبار و98.67٪ في الاختبارات الواقعية. كما أكّد التحليل المقارن مع النماذج السابقة تفوق الدقة والقدرة على التعميم في الهيكلية الهجينة المقترحة (CNN،SNN، Attention،Transformer) .
تُقدّم هذه الدراسة إطار عمل قابل للتوسّع وموفّر للطاقة وذو دقة عالية لنظام التعرف على المشاعر من الصوت، مناسب للتطبيقات الزمن الحقيقي في مجالات الرعاية الصحية، التعليم والحوسبة العاطفية.
