سیستم های تشخیص بلندگو به طور گسترده ای در برنامه های مختلف برای شناسایی شخص با صدای خود استفاده می شود. با این حال ، درجه بالای تنوع در سیگنال های گفتار ، این کار را به یک کار چالش برانگیز تبدیل می کند. برخورد با تغییرات عاطفی بسیار دشوار است زیرا احساسات ویژگی های صوتی یک شخص را تغییر می دهد. بنابراین ، ویژگی های آکوستیک با مواردی که برای آموزش مدل ها در یک محیط خنثی استفاده می شود ، متفاوت است. بنابراین ، مدل های تشخیص بلندگو که در گفتار خنثی آموزش دیده اند ، نمی توانند به درستی بلندگوها را تحت استرس عاطفی شناسایی کنند. اگرچه پیشرفت های قابل توجهی در شناسایی بلندگو با استفاده از شبکه های عصبی حلقوی (CNN) انجام شده است ، CNN ها نمی توانند از ارتباط مکانی بین ویژگی های سطح پایین سوء استفاده کنند. با الهام از معرفی اخیر شبکه های کپسول (CapSnets) ، که مبتنی بر یادگیری عمیق برای غلبه بر عدم کفایت CNN ها در حفظ رابطه مطرح بین ویژگی های سطح پایین با تکنیک استخر آنها است ، این مطالعه به بررسی عملکرد استفاده از کپست ها در شناسایی بلندگوها می پردازد. از ضبط گفتار عاطفی. یک مدل شناسایی بلندگو مبتنی بر CAPSNET با استفاده از سه پایگاه داده گفتار مجزا ، یعنی پایگاه داده گفتار اماراتی ، مجموعه داده Susas و Ravdess (دسترسی آزاد) ارائه و ارزیابی شده است. مدل پیشنهادی نیز با سیستم های پایه مقایسه می شود. نتایج تجربی نشان می دهد که مدل CapSnet پیشنهادی رمان سریعتر آموزش می دهد و نتایج بهتری را در مورد طرح های پیشرفته فعلی ارائه می دهد. تأثیر الگوریتم مسیریابی بر عملکرد شناسایی بلندگو نیز با تغییر تعداد تکرارها ، چه با و چه بدون شبکه رمزگشایی مورد بررسی قرار گرفت.
معرفی
شناخت بلندگو اخیراً با افزایش تقاضا در برنامه های مختلف ، به عنوان مثال ، سیستم های امنیتی ، احراز هویت بیومتریک ، تحقیقات جنایی و مراقبت از مشتری ، توجه فزاینده ای را به خود جلب کرده است (Alsharhan & Ramsay ، 2019 ؛ B. Chen and Chen ، 2013 ، Jahangir et al. ، 2021)بشراگرچه ما به توانایی انسان در مورد تبعیض بلندگوها با استفاده از صدای آنها به تنهایی توجه قابل توجهی نداریم ، اما ثابت شده است که بخشی جدایی ناپذیر از تعامل انسان و رایانه است و به طور مداوم مورد مطالعه قرار گرفته است (شاهین و همکاران ، 2021 ، شاهین و همکاران.، 2022).
روشهای تشخیص بلندگو می توانند وابسته به متن باشند ، جایی که بلندگو همان متن را برای آموزش و آزمایش یا مستقل از متن بیان می کند ، که شامل محدودیت هایی در متن گفته شده در طول آموزش و آزمایش نمی شود. تکنیک های تشخیص بلندگو می توانند به طور گسترده ای به عنوان تأیید بلندگو (SV) و شناسایی بلندگو (SI) طبقه بندی شوند (شاهین و همکاران ، 2021). مشابه یک سیستم ورود به سیستم رمز عبور ، از تأیید بلندگو برای تعیین هویت بلندگو ادعا شده (به عنوان درست یا نادرست) با استفاده از یک نمونه صوتی استفاده می شود (شاهین و ناصف ، 2019 ؛ دبلیو وو و همکاران ، 2006). در مقابل ، با توجه به یک نمونه صوتی ، شناسایی بلندگو تلاش می کند تا بلندگو را از استخر بلندگوها شناسایی کند. اگر گوینده ای که هویتش مشخص شود از مجموعه بلندگوهای شناخته شده است ، گفته می شود که یک سناریوی "مجموعه بسته" است. در غیر این صورت ، به یک سناریوی "مجموعه باز" تبدیل می شود.
مطالعات متعددی تکنیک های شناسایی بلندگو را ارائه داده اند که سهم قابل توجهی در این زمینه داشته اند (فارل و همکاران ، 1994 ، Praveen Kumar و همکاران ، 2018). با این حال ، شرایط مختلف ، به عنوان مثال ، محیط های پر سر و صدا یا عاطفی بلندگو ، می تواند بر عملکرد چنین تکنیک هایی تأثیر بگذارد (Bashirpour & Geravanchizadeh ، 2018). عملکرد این رویکردها به طور قابل توجهی کاهش می یابد که نمونه های گفتار در شرایط زیر حد متوسط بدست می آیند ، به عنوان مثال ، یک محیط عاطفی (J. H. L. Hansen & Patil ، 2007) ، که در آن نمونه های گفتار عاطفی یا بسیار صریح هستند (Ghiurcau et al. ، 2011 ، Parthasarathyو همکاران ، 2017). نمونه های گفتار به دست آمده در شرایطی که گوینده تحت تأثیر هیچ نوع احساسی قرار نگیرد ، به عنوان نمونه گفتار "خنثی" گفته می شود ، در حالی که آنهایی که تحت هر نوع احساسات (مانند شاد ، غمگین ، عصبانیت و غیره قرار دارند) به عنوان احساسی گفته می شودسخن، گفتار. گفتار عاطفی ویژگی های صوتی استخراج شده از نمونه ها را متفاوت می کند.
مدل های شناسایی بلندگو اغلب با استفاده از گفتار خنثی آموزش داده می شوند و هنگام آزمایش روی نمونه های گفتار در یک محیط خنثی ، اما در نمونه های گفتار ثبت شده در شرایط عاطفی ، عملکرد خوبی دارند. با این حال ، گفتار انسان بیشتر عاطفی یا بیانگر است ، که ویژگی های گفتار یک گوینده را تغییر می دهد. این انحرافات در خصوصیات گفتار از گفتار خنثی بر عملکرد مدل در حضور چنین احساسات تأثیر منفی می گذارد (D. Li et al. ، 2005 ، Nassif et al. ، 2021). به طور خلاصه ، یک محیط صحبت خنثی ، که در آن گوینده تحت استرس یا احساسات قرار نمی گیرد ، عملکرد بهتر بلندگو را در مقایسه با یک محیط عاطفی (به عنوان مثال ، وقتی گوینده عصبانی ، ترسیده ، خوشحال یا ترس است) عملکرد بهتری را به دست می آورد.
با این وجود ، شناخت جنبه عاطفی با اظهارات زبانی برای ایجاد یک پیوند ارتباطی مناسب در رابط های انسانی و رایانه ضروری است (پیکارد ، 1999). با این حال ، این یک مشکل دشوار است که انسان نیز می تواند در یک نمونه گفتار به طور دقیق احساسات را تشخیص دهد. بنابراین ، شناسایی بلندگو در شرایط استرس زا یا عاطفی یک منطقه چالش برانگیز است.
CNN از یک عملیات جمع آوری استفاده می کند ، که باعث می شود آنها نسبت به اطلاعات مکانی ویژگی های ورودی ، یعنی اطلاعات موقعیت ویژگی های موجود در محور زمان و فرکانس حساس شوند. عملکرد استخر باعث می شود CNN ثابت شود و منجر به از دست دادن ویژگی های خاص شود. معماری عصبی کپسول برای غلبه بر این اشکالات تصور شد (هینتون و همکاران ، 2011). علاوه بر این ، شبکه های کپسول از ویژگی های استخراج شده مانند MFCC برای مدل سازی احساسات استفاده می کنند. علاوه بر این ، مدل ها فقط روی خنثی آموزش می یابند اما در محیط عاطفی آزمایش می شوند و این باعث می شود دقت در خنثی بیشتر شود.
شناسایی یک بلندگو عاطفی کاربردهای بی شماری دارد ، به عنوان مثال ، شناسایی شخص از نمونه های گفتار عاطفی (عصبانیت یا وحشت) در طی تحقیقات جرم ، شناسایی و کمک به افراد در وحشت در مراکز اضطراری و ارزیابی استرس یا ناامیدی تماس گیرندگان در مراکز مشتری. مطالعات قبلی بر تجزیه و تحلیل شناسایی بلندگوها در محیط های مختلف عاطفی و استرس زا برای تحقق عملکرد بهینه در تعامل قوی انسان و رایانه متمرکز شده است (Alluri et al. ، 2017 ، Fragopanagos and Taylor ، 2005 ، Senthil Raja and Dandapat ، 2010 ، Wu et al. 2011). برخی از مطالعات (Scherer et al. ، 2000 ، Wu et al. ، 2005) از نمونه های گفتار عاطفی از بلندگوها برای آموزش مدل برای بهبود عملکرد شناسایی بلندگو استفاده کرده اند. با این حال ، این یک راه حل عملی برای برنامه های عملی نیست.
بیشتر مدلهای شناسایی بلندگوهای پیشرفته در ادبیات با عملکرد شناسایی بیشتر از 90 ٪ از سخنان طولانی مبتنی بر شرکتهای گفتار بزرگ که شامل بخشهای گفتار است که تقریباً 2. 5 دقیقه طول دارند ، استفاده می کنند (گونزالز-رودریگز ، 2011). با این حال ، جمع آوری نمونه های گفتار طولانی از بلندگوها غیر واقعی است ، اما نتایج با نمونه های گفتار کوتاه تر به طور قابل توجهی کاهش می یابد. بنابراین ، سیستم های شناسایی بلندگو مبتنی بر سخنان کوتاه (Elnaggar & Arelhi ، 2019 ؛ L. Li et al. ، 2016 ، Liu et al. ، 2018) در سالهای اخیر توجه فزاینده ای را به خود جلب کرده اند. علاوه بر این ، تحقیقات شناسایی سخنران در درجه اول با توجه به اندکی توجه به عربی به زبان انگلیسی متمرکز شده است (Saeed & Nammous ، 2007).
سیستم های شناسایی بلندگو معمولی شامل استخراج ویژگی ها از نمونه های گفتار و به دنبال طبقه بندی برای شناسایی بلندگو هستند. محبوبیت روزافزون تکنیک های مبتنی بر یادگیری عمیق (J. ، L. ، I. Tashev ، Lee ، J. ، Tashev ، I. ، 2015 ، Nassif et al. ، 2019 ، Variani et al. ، 2014) در پردازش گفتار انگیزه داردمحققان برای استفاده از شبکه های عصبی Convolutional (CNN) برای SI (Lukic et al. ، 2016). با این حال ، CNN از یک عملیات جمع آوری استفاده می کند ، که باعث می شود آنها نسبت به اطلاعات مکانی ویژگی های ورودی ، یعنی اطلاعات موقعیت ویژگی های موجود در محور زمان و فرکانس حساس شوند. عملکرد جمع آوری باعث می شود CNN متغیر باشد و منجر به از دست دادن ویژگی های خاص شود که منجر به نیاز به مقدار گسترده ای از داده های آموزشی برای جبران خسارت می شود. با این حال ، دستیابی به مقادیر کافی از داده های آموزشی می تواند در کاربرد عملی دشوار باشد (Kwabena Patrick et al. ، 2019). معماری عصبی کپسول برای غلبه بر این اشکالات تصور شد (هینتون و همکاران ، 2011) ، که بعداً با معرفی یک الگوریتم مسیریابی پویا (Sabour et al. ، 2017) اصلاح شد تا شبکه های کپسول (CapSnets) تشکیل شود (پایان به پایانتشخیص فرمان گفتار با شبکه کپسول ، 2018).
کاربردهای گسترده در شناسایی بلندگوها در محیط های استرس یا عاطفی ، محققان را ترغیب کرده است تا علت را از دیدگاه های مختلف ، به عنوان مثال ، مدل های استخراج و طبقه بندی ، بررسی کنند. به عنوان مثال ، Jawarkar و همکاران.(Jawarkar et al. ، 2012) یک مطالعه گسترده را شامل می شود که شامل عملکرد ویژگی های مختلف ، یعنی MFCC ها ، فرکانس های طیفی خط ، ضرایب CEPSTRAL فرکانس مبتنی بر Teagerenergy و انرژی موقتی ضرایب زیر باند و ترکیب آنها بر روی ترکیب آنها بر رویطبقه بندی کننده ترکیبی بر اساس GMM. آنها همچنین نتایج را با نتایج به دست آمده توسط طبقه بندی کننده های جداگانه برای SI برای پنج احساسات مختلف شامل 34 بلندگو به زبان هندی مقایسه کردند. آنها نتیجه گرفتند که طبقه بندی کننده های فیوز نتیجه بهتری برای SI برای داده های گفتار خنثی و عاطفی می دهد. بائو و همکاران.(بائو و همکاران ، 2007) از روشهای جبران خسارت کانال برای جلوگیری از اثرات احساسات در کار SI پس از در نظر گرفتن شباهتی که با اثر کانال برخوردار است ، استفاده کرد. آنها روش طرح ریزی ویژگی احساسات را پیشنهاد کردند ، که EER را 11. 7 ٪ کاهش داد و روش همجوشی خطی بر اساس GMM-UBM و SVM-AP ، که باعث کاهش بیشتر EER شد. لی و همکاران.(D. Li et al. ، 2005) ویژگی های نمونه گفتار را در یک محیط خنثی با توجه به پارامترهای prosodic نمونه های گفتار در یک محیط عاطفی برای تقویت عملکرد تغییر داد. علاوه بر این ، Koolagudi و همکاران..
Ghiurcau و همکاران.(Ghiurcau و همکاران ، 2011) تأثیر منفی وضعیت عاطفی یک بلندگو در عملکرد سیستم های SI با استفاده از GMM را مورد بررسی قرار داد. در یک مطالعه بعدی ، آنها نتایج را با نتایج به دست آمده با استفاده از طبقه بندی کننده SVM در پایگاه داده گفتار برلین مقایسه کردند و نتیجه گرفتند که مدل های آموزش دیده بر روی گفتار خنثی نتایج ضعیفی را در نمونه های گفتار جمع آوری شده در یک محیط عاطفی ایجاد می کنند. نتایج به دست آمده با احساسات متفاوت است (با عصبانیت و خوشبختی کمترین امتیاز را دارد). هنگامی که گفتار عاطفی در آموزش گنجانده شد ، نتایج به بهبود بخشیده شد ، اگرچه این راه حل عملی نیست. وو و همکاران.(ژاوهوی و همکاران ، 2006) با مطالعه تکنیک ها برای تغییر ویژگی های prosodic و استفاده از همان برای تطبیق ویژگی ها از گفتار عاطفی ، روشهای تقویت شناسایی بلندگو را مورد بررسی قرار داد. نویسندگان از پایگاه داده EPST استفاده کردند که شامل 14 احساسات مختلف توسط هشت بلندگو است. چن و یانگ (L. Chen & Yang ، 2013) اصلاح وزن GMM را برای تقویت شناسایی بلندگو بررسی کردند و شبکه عصبی عملکرد شعاعی و روشهای بازنمایی پراکنده مبتنی بر مثال را برای سنتز GMM های عاطفی ارائه دادند. علاوه بر این ، Raja و Dandapat (Senthil Raja & Dandapat ، 2010) تغییر در نتایج حاصل از ویژگی های مختلف با استفاده از کمیت بردار و GMM را به عنوان طبقه بندی کننده ارزیابی کردند ، و آنها چهار روش جبران خسارت را برای کاهش اثرات منفی گفتار عاطفی یا صریح در SI توصیه کردندبشرپارتاساراتی و بوسسو (پارتاساراتی و بوسسو ، 2017) تأثیرات شناسایی بلندگو را از نظر برانگیختگی و ظرفیت مورد مطالعه قرار دادند و آنها مناطق قابل اعتماد را در گفتار عاطفی برای بهبود عملکرد تشخیص بلندگو پیش بینی کردند.
Tirumala و همکاران.(Tirumala و همکاران ، 2017) تکنیک های استخراج ویژگی موجود را برای SI مورد بررسی قرار داد و نتیجه گرفت که رویکردهای مبتنی بر ضرایب CEPSTRAL MEL فرکانس (MFCC) بیشترین استفاده را دارند. از MFCC به عنوان ورودی های ویژگی به معماری CNN برای SV در محیط های خنثی استفاده شده است (Salehghaffari ، 2018). یک معماری یادگیری عمیق مبتنی بر یک CNN 1D با لایه های MaxPooling و متراکم که با استفاده از MFCC آموزش داده شده است ، برای تشخیص احساسات (د پینتو و همکاران ، 2020) در مجموعه داده رادس استفاده شده است. علاوه بر این ، علی و همکاران.(علی و همکاران ، 2018) هنگامی که MFCC ها با ویژگی های آموخته شده با استفاده از مجموعه داده URDU گروه بندی می شوند ، عملکرد مدل های تشخیص بلندگو را در صدای متغیر با طول متغیر ارزیابی کردند. مکف و همکاران.. از MFCC ها ، انرژی ورود به سیستم و مشتقات مرتبه اول و دوم به عنوان ویژگی استفاده شد و دقت کلی 80 ٪ به دست آمد. تأثیر انتخاب ویژگی های مختلف برای رویکرد I-Vector نیز در ادبیات مورد مطالعه قرار گرفته است (مکواوا و همکاران ، 2015). LPC ، MFCC و LPCC برای پردازش جلوی آن در استخراج Vectors I استفاده شد. عملکرد مربوطه مورد بررسی قرار گرفت و دقت کلی 80. 33 ٪ ، 72 ٪ و 30 ٪ 66. 30 برای MFCC ، LPC و LPCC مشاهده شد. شناخت بلندگوهای عاطفی در شرایط واقعی در ادبیات (Mansour و همکاران ، 2019) با استفاده از ویژگی های مختلف گفتاری (از جمله MFCC ، LPCC ، RASTA-PLP و MFCC-SDC) با مدل سازی I-Vector در iemocap در هر دو تمیز مورد بررسی قرار گرفت. و محیط های پر سر و صدا با سطح SNR مختلف. MFCC-SDC با دقت متوسط تقریباً 90 ٪ در یک محیط تمیز ، بهترین نتیجه را به دست می آورد.
مفتاه و همکاران.(Meftah et al. ، 2020) از طیف سنجی های خطی فاصله گرفته شده برای تمایز بلندگوهای عاطفی به زبان عربی و انگلیسی با استفاده از تلفیقی از یک شبکه عصبی حلقوی و معماری حافظه کوتاه مدت بلند مدت بهره برداری کرد و آنها مطالعه خود را بر اساس احساسات KSU ، EPST ، West برپا کردند. پایگاه داده های Point و Timit. به تازگی ، از وکتورهای X (Pappagari و همکاران ، 2020) برای تجزیه و تحلیل تأثیر احساسات در تأیید بلندگوها در مجموعه داده های IEMOCAP ، MSP-Podcast و CREAM-D استفاده شده است. نتایج نشان داد که عملکرد سیستم ها وقتی شرایط عاطفی در طول آموزش مدل و آزمایشات ناسازگار باشد ، به طور قابل توجهی تخریب می شود ، آنها دریافتند که عصبانیت بدترین عملکرد را در هر سه مجموعه داده نشان می دهد.
علیرغم محبوبیت استفاده از CNN برای استخراج ویژگی های سطح بالا ، مشخص شده است که عملیات حلقوی مبتنی بر هسته در یک CNN می تواند نتواند ویژگی های خاصی یا اطلاعات مکانی آن را ضبط کند (Kwabena Patrick et al. ، 2019). علاوه بر این ، عملیات جمع آوری آنها را قادر به شناخت سلسله مراتب مکانی بین ویژگی ها نمی کند. Capsnets ، که آخرین افزودنی برای خانواده مدلهای یادگیری عمیق است ، قول داده اند که بر این اشکالاتی غلبه کنند.
CapSnets قبلاً در پردازش گفتار (تشخیص فرمان گفتار پایان به پایان با شبکه کپسول ، 2018) و تشخیص احساسات (X. Wu et al. ، 2019) به کار رفته است. به عنوان مثال ، یک مطالعه قبلی (به رسمیت شناختن فرمان گفتار پایان به پایان با شبکه کپسول ، 2018) ادعا کرد که موقعیت و رابطه بین ویژگی های موجود در محور فرکانس ، که طیف سنجی های مربوط به نمونه های گفتاری مختلف را متمایز می کند ، توسط CNN ها نادیده گرفته می شودو آنها مشاهده کردند که عملکرد سیستم های تشخیص گفتار در دستورات گفتاری 1-S با استفاده از کپست ها در مقایسه با یک CNN پایه بهبود یافته است. از کپست های متوالی نیز استفاده شده است (X. Wu et al. ، 2019) برای تشخیص احساسات گفتار برای شناسایی چهار احساس (خنثی ، شاد ، عصبانی و غمگین) بر روی معیار Corpus Iemocap ، و نتایج به دست آمده از CNN-LSTM بهتر استمدل ها.
این هدف از این مطالعه ، ارزیابی عملکرد یک معماری اصلاح شده CAPSNET برای شناسایی بلندگوهای عاطفی با استفاده از سخنان کوتاه مستقل از متن و مقایسه نتایج با سیستم های پایه است. این ارزیابی با بررسی نتایج به دست آمده در مجموعه داده گفتار اماراتی ، مجموعه داده های انگلیسی Susas و Ravdess (انگلیسی) انجام شد. این مدل ها با استفاده از نمونه های گفتار خنثی آموزش داده شدند و سپس با استفاده از سخنان که متون در جایی که برای آموزش استفاده نمی شوند ، در گفتار عاطفی ارزیابی شدند.
این تحقیق با هدف پیشنهاد یک مدل جدید CapSnets برای شناسایی بلندگوها در یک محیط عاطفی انجام شده است. به بهترین دانش ما ، هیچ مطالعه ای برای ارزیابی عملکرد کپست ها برای شناسایی بلندگو مستقل از متن با استفاده از گفتار عاطفی انجام نشده است. کار ما عملکرد معماری خالص کپسول اصلاح شده ما را با استفاده از سه مجموعه داده-پایگاه داده گفتار عربی اماراتی ، گفتار انگلیسی تحت مجموعه داده های شبیه سازی شده و استرس (SUSAS) و بانک اطلاعاتی صوتی و تصویری Ryerson از گفتار و ترانه عاطفی (Ravdess) ارزیابی می کند.
مشارکتهای اصلی ما به شرح زیر خلاصه می شود.•
این اولین کاری است که برای شناسایی بلندگوهای مستقل از متن در یک محیط عاطفی با استفاده از سخنان کوتاه به کار می رود.
عملکرد معماری CapSnet پیشنهادی با CNN در شناسایی بلندگوها با استفاده از نمونه گفتار عاطفی با MFCC به عنوان تنها ویژگی ورودی مقایسه می شود.
آزمایش های گسترده ای برای ارزیابی عملکرد معماری CapSnet پیشنهادی بر اساس سه پایگاه داده مجزا (انگلیسی و عربی) در مقایسه با سیستم های پایه انجام می شود.
تجزیه و تحلیل تجربی نشان می دهد که مدل CAPSNET سریعتر آموزش می دهد و نتایج بهتری نسبت به سیستم های پایه ارائه می دهد.
باقیمانده این مقاله به شرح زیر سازماندهی شده است. بخش دوم توضیح مفصلی در مورد Capsnets ارائه می دهد. اطلاعات مربوط به مجموعه داده های مورد استفاده در این مطالعه در بخش III آورده شده است. مدل شناسایی بلندگو مبتنی بر CAPSNET در بخش IV مورد بحث قرار گرفته است ، و بخش V تجزیه و تحلیل تجربی ما را توصیف می کند و نتایج را ارائه می دهد. سرانجام ، مقاله در بخش VI نتیجه گیری می شود.
قطعه قطعه
شبکه های کپسول
CNN ها تا حدودی مسئول افزایش علاقه به مدلهای یادگیری عمیق در سالهای اخیر هستند (Bunrit et al. ، 2019 ، Lukic et al. ، 2016). لایه های حلقوی ، که اولین لایه های یک CNN کلاسیک را تشکیل می دهند ، با استفاده از فیلترهای با اندازه متغیر در ورودی ، استخراج ویژگی ها را تسهیل می کنند تا نقشه های ویژگی را با استفاده از فرآیند حلق آویز کنند. هسته یا فیلترهای مختلف Convolution اغلب اعمال می شود و ممکن است با عمل استخر دنبال شود ، که به اطمینان از معنایی کمک می کند
مجموعه داده ها
ما بر ارزیابی توانایی کپست ها در شناخت بلندگوها از گفتار عاطفی و مقایسه نتایج با مدل های پایه در سه مجموعه داده گفتاری مختلف تمرکز می کنیم. این سه مجموعه داده به شرح زیر خلاصه می شود.
مدل شناسایی بلندگو عمارت مبتنی بر Capsnet
ما عملکرد معماری CapSnet پیشنهادی را با استفاده از MFCCs بررسی کردیم. نمای کلی از مدل شناسایی بلندگو عاطفی پیشنهادی در شکل 1 نشان داده شده است. زیرمجموعه های بعدی به طور خلاصه هر یک از بلوک های موجود در شکل را کشف می کنند.
تجزیه و تحلیل تجربی و نتایج
ارزیابی مدل CAPSNET-M پیشنهادی در طبقه بندی بلندگوها با استفاده از نمونه های صوتی رنگی با احساسات در چندین آزمایش انجام شد و نتایج با سیستم های پایه مقایسه شد. در تمام آزمایشات ، مدل ها با استفاده از نمونه های گفتار خنثی آموزش داده شدند.
آزمایش 1: عملکرد شناسایی بلندگو از مدل CAPSNET-M پیشنهادی با سیستم های پایه Random Forest ، SVM و CNN و CAPS-9 ، CAPS-15 و CAPS-19 در ESD مقایسه شد. نتایج نیز بود
نتیجه گیری و محدودیت ها
نمونه های گفتار که در شرایط بسیار عاطفی تهیه شده است ، عملکرد مدل های شناسایی بلندگو را تخریب می کند و مدل های آموزش با استفاده از نمونه های گفتار با محتوای عاطفی متفاوت می تواند عملکرد را بهبود بخشد اما یک راه حل مناسب نیست. بنابراین ، در این مقاله ، ما یک مدل شناسایی بلندگو مستقل از متن را بر اساس معماری شبکه کپسول پیشنهاد کرده ایم. معماری پیشنهادی در پایگاه داده ESD عربی ESD ، انگلیسی Susas و بانک اطلاعاتی انگلیسی Ravdess ، و
رعایت استانداردهای اخلاقی
نویسندگان از دانشگاه شارجه بخاطر حمایت از این کار از طریق گروه تحقیقاتی ماشین و پردازش زبان عربی تشکر می کنند. دکتر آدی اللهودایف از فعالیت تحقیقات علمی در دانشگاه پرنس ساتام بن عبدالعزیز ، الخارج ، عربستان سعودی سپاسگزار است.
رضایت آگاهانه
این مطالعه شامل هیچ آزمایشی در مورد حیوانات نیست.
اعلام علاقه رقیب
نویسندگان اعلام می كنند كه آنها هیچ منافع مالی رقیب یا روابط شخصی را كه به نظر می رسد بر اثر گزارش شده در این مقاله تأثیر می گذارد ، ندارند. نویسندگان همچنین می خواهند از دانشگاه شارجه بخاطر تأمین بودجه این پروژه تشکر کنند.
فارکس به زبان ساده...
ما را در سایت فارکس به زبان ساده دنبال می کنید
برچسب :
نویسنده : طاهره ایرانی
بازدید : <-PostHit->
تاريخ : سه
شنبه
6 تير
1402 ساعت: 17:07