<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.2 20120330//EN"
        "http://jats.nlm.nih.gov/publishing/1.2/JATS-journalpublishing1.dtd">
<!--<?xml-stylesheet type="text/xsl" href="article.xsl"?>-->
<article article-type="research-article" dtd-version="1.2" xml:lang="en" xmlns:mml="http://www.w3.org/1998/Math/MathML"
         xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance">
    <front>
        <journal-meta>
            <journal-id journal-id-type="issn">2303-9868</journal-id>
            <journal-id journal-id-type="eissn">2227-6017</journal-id>
            <journal-title-group>
                <journal-title>Международный научно-исследовательский журнал</journal-title>
            </journal-title-group>
            <issn pub-type="epub">2303-9868</issn>
            <publisher>
                <publisher-name>ООО Цифра</publisher-name>
            </publisher>
        </journal-meta>
        <article-meta>
            <article-id pub-id-type="doi">10.60797/IRJ.2024.147.30</article-id>
            <article-categories>
                <subj-group>
                    <subject>Brief communication</subject>
                </subj-group>
            </article-categories>
            <title-group>
                <article-title>Эффективность применения различных спектральных признаков для классификации эмоций с помощью сверточной нейронной сети
                </article-title>
            </title-group>
            <contrib-group>
                <contrib contrib-type="author">
                    
                    <name>
                        <surname>Гофман</surname>
                        <given-names>Евгений Викторович</given-names>
                    </name>
                    <email>dellta79@mail.ru</email>
                    <xref ref-type="aff" rid="aff-1">1</xref>

                </contrib><contrib contrib-type="author" corresp="yes">
                    
                    <name>
                        <surname>Байков</surname>
                        <given-names>Станислав Эдуардович</given-names>
                    </name>
                    <email>st.rnd@mail.ru</email>
                    
                </contrib><contrib contrib-type="author">
                    
                    <name>
                        <surname>Васильев</surname>
                        <given-names>Павел Владимирович</given-names>
                    </name>
                    <email>lyftzeigen@mail.ru</email>
                    
                </contrib><contrib contrib-type="author">
                    
                    <name>
                        <surname>Соболь</surname>
                        <given-names>Борис Владимирович</given-names>
                    </name>
                    <email>b.sobol@mail.ru</email>
                    
                </contrib>
            </contrib-group>
            <aff id="aff-1"><label>1</label>Донской государственный технический университет</aff>
            
        <pub-date publication-format="electronic" date-type="pub" iso-8601-date="2024-09-17">
            <day>17</day>
            <month>09</month>
            <year>2024</year>
        </pub-date>
        
            
        <pub-date pub-type="collection">
            <year>2024</year>
        </pub-date>
        
            <volume>8</volume>
            <issue>147</issue>
            <fpage>1</fpage>
            <lpage>8</lpage>
            <history>
                
        <date date-type="received" iso-8601-date="2024-06-25">
            <day>25</day>
            <month>06</month>
            <year>2024</year>
        </date>
        
                
        <date date-type="accepted" iso-8601-date="2024-08-24">
            <day>24</day>
            <month>08</month>
            <year>2024</year>
        </date>
        
            </history>
            <permissions>
                <copyright-statement>Copyright: &#x00A9; 2022 The Author(s)</copyright-statement>
                <copyright-year>2022</copyright-year>
                <license license-type="open-access" xlink:href="http://creativecommons.org/licenses/by/4.0/">
                    <license-p>This is an open-access article distributed under the terms of the Creative Commons
                        Attribution 4.0 International License (CC-BY 4.0), which permits unrestricted use, distribution,
                        and reproduction in any medium, provided the original author and source are credited. See <uri
                                xlink:href="http://creativecommons.org/licenses/by/4.0/">
                            http://creativecommons.org/licenses/by/4.0/</uri>.
                    </license-p>
                </license>
            </permissions>
            <self-uri xlink:href="https://research-journal.org/archive/9-147-2024-september/10.60797/IRJ.2024.147.30"/>
            <abstract>
                <p>В последние годы классификация эмоций в разговорной речи привлекла значительное внимание благодаря её применению в виртуальных ассистентах, обучении и анализе настроений. Несмотря на успехи в англоязычных исследованиях, русскоязычные данные, такие как Dusha и RESD, остаются недостаточно изученными. В этом исследовании анализируются спектральные признаки (MFCC, мел-спектрограмма, хромаграмма, спектральный контраст) для классификации эмоций с использованием сверточной нейронной сети. Эксперименты на наборах данных показали наибольшую точность при использовании мел-спектрограмм. Для набора данных RAVDESS точность составила 78%, для Dusha 62%, для RESD 73%. Комбинация признаков не улучшила результаты. Современные методы, такие как самообучение и трансформеры, эффективны, но требовательны к ресурсам. Предложена упрощенная нейросетевая модель для устройств с ограниченной производительностью, что расширяет её применение на смартфоны, умные часы и системы умного дома, обеспечивая высокую точность при низком энергопотреблении.</p>
            </abstract>
            <kwd-group>
                <kwd>классификация эмоций</kwd>
<kwd> мел-частотные кепстральные коэффициенты</kwd>
<kwd> мел-спектрограмма</kwd>
<kwd> хромограмма</kwd>
<kwd> спектральный контраст</kwd>
<kwd> нейросетевой классификатор</kwd>
<kwd> самообучение</kwd>
<kwd> архитектура трансформеров</kwd>
<kwd> русскоязычные данные</kwd>
<kwd> искусственный интеллект</kwd>
<kwd> машинное обучение</kwd>
</kwd-group>
        </article-meta>
    </front>
    <body> 
        
 
        
<sec>
	<title>HTML-content</title>
	<p>1. Введение</p>
	<p>В последние годы классификация эмоций в разговорной речи получила значительное внимание со стороны исследователей, поскольку она находит широкое применение в различных областях, включая виртуальных ассистентов, системы обучения и анализа потребительских настроений. Несмотря на существенные успехи в этой области, большинство исследований проводилось на англоязычных данных, что оставляет заметный пробел в применении этих технологий к русскоязычным данным.</p>
	<p>Анализ и интерпретация эмоций является сложной задачей </p>
	<p>[1]</p>
	<p>Эмоциональное состояние человека предоставляет важные данные о его здоровье и психическом благополучии. Например, изменения в эмоциональном состоянии, вызванные болезнью Паркинсона, могут быть выявлены через анализ мимики, речи и ЭЭГ-сигналов </p>
	<p>[2][3][4][5]</p>
	<p>Развитие искусственного интеллекта стимулирует создание систем, моделирующих человеческое поведение, но многие современные виртуальные помощники игнорируют эмоциональные аспекты, полагаясь только на транскрипцию речи.</p>
	<p>Большая часть исследований в области распознавания эмоций основана на анализе эмоциональной составляющей по расшифрованному тексту, что неудивительно, так как анализ настроений в письменном виде сопровождается значительно большим объемом работ </p>
	<p>[6]</p>
	<p>Для развития систем классификации эмоций в русскоязычном сегменте были созданы специализированные наборы данных, такие как Dusha и RESD, которые позволяют исследователям проводить эксперименты и разрабатывать алгоритмы для распознавания эмоций в русскоязычной речи. Набор данных Dusha, разработанный компанией SberDevices, является на данный момент крупнейшим ресурсом такого рода на русском языке </p>
	<p>[15]</p>
	<p>Другой значимый набор данных, Russian EmotionalSpeechDialogs (RESD), представлен в открытой библиотеке Aniemore и предназначен для анализа эмоциональной окраски разговорной и письменной речи </p>
	<p>[16]</p>
	<p>Также был использован популярный набор данных Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS). В этот набор входят 1440 аудиофайлов, записанных с участием 24 профессиональных актеров (12 мужчин и 12 женщин), которые произносили два одинаковых высказывания с нейтральным североамериканским акцентом. Каждый актер воспроизводил фразы, выражая восемь различных эмоций с разной степенью интенсивности: спокойствие, радость, печаль, гнев, страх, удивление, отвращение и нейтральность. Этот набор данных был сбалансирован, выделяя шесть основных эмоций: гнев, отвращение, страх, радость, печаль и нейтральность </p>
	<p>[7]</p>
	<p>2. Обзор современных технологий
классификации эмоций</p>
	<p>В последние годы значительное внимание привлекает метод самообучения (Self-Supervised Learning, SSL), ставший ведущим в обработке данных. Этот метод позволяет алгоритмам автоматически обнаруживать закономерности в исходных данных, значительно улучшая результаты анализа. Важную роль в успехе SSL сыграло развитие архитектуры трансформеров, которая, в отличие от традиционных нейронных сетей, обеспечивает параллельную обработку больших объемов данных, ускоряя процесс обучения. Это позволило использовать огромные объемы интернет-данных для создания моделей, которые демонстрируют высокую эффективность даже с минимальной доработкой на специализированных наборах данных </p>
	<p>[17]</p>
	<p>Одной из самых известных моделей самообучения, созданных на основе архитектуры трансформеров, является BERT, разработанный компанией Google для обработки письменного текста. BERT широко используется в различных приложениях, таких как обработка запросов в поисковых системах. Однако для задач, связанных с обработкой звуковой речи, BERT не столь эффективен. Это связано с необходимостью предварительной токенизации звуковых данных, что может вносить шум и снижать качество анализа. Для обработки разговорной речи были разработаны специализированные модели, такие как Wav2vec 2.0, HuBERT и WavLM </p>
	<p>[18][19][20]</p>
	<p>Тем не менее, авторы данной работы предлагают упрощенную версию нейросетевого классификатора, рассчитанного на внедрение в устройства с ограниченной производительностью.</p>
	<p>Это существенно расширит спектр устройств для применения данной модели, например:</p>
	<p>- устройства, такие как смартфоны, умные часы и фитнес-браслеты, часто имеют ограниченные вычислительные ресурсы. Упрощенная нейросетевая модель может быть эффективно использована для распознавания эмоций на таких устройствах, улучшая пользовательский опыт без значительного увеличения энергопотребления;</p>
	<p>- в системе умного дома или умного офиса устройства с ограниченной вычислительной мощностью могут использовать данный классификатор для распознавания эмоций и адаптации окружающей среды (например, освещения или температуры) в зависимости от настроения пользователя;</p>
	<p>-</p>
	<p>Если проводить сравнение предлагаемого подхода с существующими методами классификации эмоциональной составляющей в аудиоданных, то можно выделить следующее:</p>
	<p>- трансформеры (например, BERT, Wav2vec 2.0) обеспечивают высокую точность за счет обработки больших объемов данных параллельно. Однако они требуют значительных вычислительных ресурсов и памяти, что ограничивает их применение на устройствах с ограниченными ресурсами;</p>
	<p>- классические модели машинного обучения, такие как SVM и деревья решений, также могут быть применены для распознавания эмоций, но они часто требуют тщательной настройки и предварительной обработки данных. Упрощенные нейросетевые модели могут предложить более высокую гибкость и способность к обучению на разнообразных данных;</p>
	<p>- глубокие нейронные сети (DNN) предлагают высокую точность и способность обрабатывать сложные данные, но они также требуют значительных вычислительных ресурсов.</p>
	<p>В целом, упрощенная версия нейросетевого классификатора предлагает компромисс между точностью и вычислительной эффективностью. Упрощенные модели могут быть легко адаптированы и переобучены на новых данных, что позволяет быстро интегрировать их в новые приложения или устройства. За счет снижения требований к вычислительным ресурсам, предложенная модель может быть внедрена в устройства с ограниченной производительностью, не снижая при этом качество распознавания эмоций. Уменьшение сложности модели способствует снижению энергопотребления, что особенно важно для носимых устройств и IoT. Модель может быть адаптирована для различных задач и настроек, что делает ее универсальным инструментом для распознавания эмоций в различных приложениях.</p>
	<p>3. Анализ спектральных признаков и
их визуализация</p>
	<p>В контексте задачи распознавания эмоций по аудиоданным можно выделить несколько спектральных признаков, используемых для анализа. Одними из наиболее распространенных являются мел-спектрограммы и мел-частотные кепстральные коэффициенты (MFCC). В более редких случаях используются хромограммы и спектральный контраст. Цель данного исследования состоит в сравнении эффективности этих признаков при использовании их для обучения сверточной нейронной сети (CNN).</p>
	<p>Мел-спектрограмма представляет собой графическое изображение частотного спектра сигнала, изменяющегося во времени, которое широко применяется для анализа речи </p>
	<p>[8][9]</p>
	<p>MFCC представляет собой кратковременное спектральное представление мощности звука, основанное на линейном косинусном преобразовании логарифмического спектра мощности, измеренного по нелинейной шкале частот мела. </p>
	<fig id="F1">
		<label>Figure 1</label>
		<caption>
			<p>Мел-спектрограмма аудиосигнала (слева), MFCC аудиосигнала (справа)</p>
		</caption>
		<alt-text>Мел-спектрограмма аудиосигнала (слева), MFCC аудиосигнала (справа)</alt-text>
		<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="/media/images/2024-08-26/77a9a527-f734-44bd-96a6-bf5623d48a1f.png"/>
	</fig>
	<p>[10]</p>
	<p>1. Метод, использующий кратковременное преобразование Фурье (STFT) для расчета хромаграммы, который обеспечивает высокое временное разрешение. Это полезно для анализа быстропеременных музыкальных структур. Хромаграмма, построенная с использованием STFT, позволяет детально рассматривать изменения в интенсивности нот во времени. Назовем его ChromaSTFT.</p>
	<p>2. Метод, основанный на постоянной Q-преобразовании (Constant-Q Transform, CQT), который позволяет лучше захватывать музыкальные свойства сигнала за счет логарифмически равномерного распределения частотных полос, соответствующих музыкальным нотам. Это делает его особенно полезным для анализа гармонических и мелодических содержаний. Назовем его ChromaCQT.</p>
	<p>3. Метод, который использует вариативное Q-преобразование (Variable-Q Transform, VQT), являющееся обобщением постоянной Q-преобразования (CQT). VQT позволяет динамически изменять разрешение в зависимости от частоты, обеспечивая более гибкое и точное представление частотных компонентов музыкального сигнала. Назовем его ChromaVQT.</p>
	<p>4. Метод, который использует энергонезависимые хроматические признаки (Chroma Energy NormalizedStatistics, CENS). Этот метод включает дополнительные шаги нормализации и сглаживания, что делает его устойчивым к динамическим изменениям в аудиосигнале и более надежным для задач классификации и сравнения музыкальных фрагментов. Назовем его ChromaCENS.</p>
	<p>На графике хромаграммы ось абсцисс представляет время в секундах, ось ординат обозначает 12 хроматических нотили классов высоты тона, цветовая шкала указывает интенсивность каждой ноты. Графики STFT и CENS приведены на рисунке 2. Графики CQT и VQT, приведены на рисунке 3.</p>
	<fig id="F2">
		<label>Figure 2</label>
		<caption>
			<p>Графики STFT, CENS для аудиосигнала</p>
		</caption>
		<alt-text>Графики STFT, CENS для аудиосигнала</alt-text>
		<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="/media/images/2024-08-26/ed5ba7ee-6002-45db-81ee-f0b554a9da0e.png"/>
	</fig>
	<fig id="F3">
		<label>Figure 3</label>
		<caption>
			<p>Графики CQT, VQT для аудиосигнала</p>
		</caption>
		<alt-text>Графики CQT, VQT для аудиосигнала</alt-text>
		<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="/media/images/2024-08-26/e266b85f-6c55-42c0-8ce9-44bd7bf18b76.png"/>
	</fig>
	<p>Спектральный контраст представляет собой разницу между амплитудами пиков и впадин звуковой энергии в частотном спектре [11]. Этот признак особенно полезен для различения музыкальных инструментов, голосов и определения эмоциональных состояний в речи [12]. График спектрального контраста обычно представляет собой матрицу, где по оси абсцисс откладывается время, а по оси ординат – номера частотных полос. Каждая ячейка матрицы отображает значение спектрального контраста для соответствующего временного окна и частотной полосы. Цветовая шкала показывает значение спектрального контраста. Более яркие цвета указывают на более высокий контраст. График спектрального контраста представлен на рисунке 4.</p>
	<fig id="F4">
		<label>Figure 4</label>
		<caption>
			<p>Спектральный контраст аудиосигнала</p>
		</caption>
		<alt-text>Спектральный контраст аудиосигнала</alt-text>
		<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="/media/images/2024-08-26/b2b16c50-9902-42d9-8483-3fd96d9dc067.png"/>
	</fig>
	<p>4. Модель сверточного классификатора</p>
	<p>Для проведения классификации эмоциональной окраски аудио фрагментов на основе извлеченных признаков, была разработана модель сверточной нейронной сети, которая представлена на рисунке 5.</p>
	<fig id="F5">
		<label>Figure 5</label>
		<caption>
			<p>Модель сверточного классификатора</p>
		</caption>
		<alt-text>Модель сверточного классификатора</alt-text>
		<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="/media/images/2024-08-26/f3686be2-aaf6-4254-946a-c96fc96bcfbb.png"/>
	</fig>
	<p>Сверточные слои выполняют функцию извлечения основных характеристик из входного изображения путем применения фильтров. Сверточные операции помогают выделить важные особенности, такие как края, углы и текстуры. Размер фильтров составляет 3x3, с использованием шага (stride) 1 для перемещения фильтра по изображению и padding 1 для сохранения размеров карты признаков.</p>
	<p>Слои подвыборки выполняют функцию уменьшения размеров карт признаков для снижения вычислительной сложности и предотвращения переобучения. Они используют операции максимальной подвыборки с окном, 2x2, для уменьшения размерности карт признаков.</p>
	<p>Полносвязные слои преобразуют двумерные карты признаков в один вектор признаков для последующей классификации. Каждый нейрон в полносвязном слое соединен с каждым нейроном предыдущего слоя, что позволяет объединить все выявленные признаки и выполнить классификацию.</p>
	<p>Слой регуляризации (Dropout Layer) предотвращает переобучение за счет случайного отключения некоторых нейронов во время обучения. Определенный процент нейронов (25%) отключается на каждой итерации обучения, что способствует обобщению модели.</p>
	<p>Выходной слой осуществляет классификацию входного изображения по одному из возможных классов. Применяется функция активации softmax для получения вероятностей принадлежности к каждому классу. Количество нейронов на выходном слое равно количеству классов для классификации (в данном случае, 6 классов эмоций).</p>
	<p>5. Результаты исследований</p>
	<p>Для оценки эффективности классификации эмоций с использованием различных спектральных признаков применялись изображения размером 256 на 512 пикселей. Нейронная сеть обучалась на каждом спектральном признаке в течение 200 эпох с размером пакета 32. Результаты классификации, достигнутые каждой моделью, приведены в таблице 1.</p>
	<table-wrap id="T1">
		<label>Table 1</label>
		<caption>
			<p>Результаты распознавания эмоций с применением различных спектральных признаков</p>
		</caption>
		<table>
			<tr>
				<td>Спектральный признак</td>
				<td>RAVDESS, %</td>
				<td>RESD, %</td>
				<td>Dusha, %</td>
			</tr>
			<tr>
				<td>Мел-спектрограмма</td>
				<td>78</td>
				<td>73</td>
				<td>62</td>
			</tr>
			<tr>
				<td>MFCC</td>
				<td>75</td>
				<td>70</td>
				<td>58</td>
			</tr>
			<tr>
				<td>Chroma STFT</td>
				<td>55</td>
				<td>50</td>
				<td>44</td>
			</tr>
			<tr>
				<td>Chroma CQT</td>
				<td>55</td>
				<td>50</td>
				<td>44</td>
			</tr>
			<tr>
				<td>Chroma VQT</td>
				<td>60</td>
				<td>57</td>
				<td>49</td>
			</tr>
			<tr>
				<td>Chroma CENS</td>
				<td>51</td>
				<td>48</td>
				<td>39</td>
			</tr>
			<tr>
				<td>Спектральный контраст</td>
				<td>52</td>
				<td>49</td>
				<td>37</td>
			</tr>
		</table>
	</table-wrap>
	<p>Анализ данных выявил, что наилучшие результаты были достигнуты при использовании мел-спектрограмм и MFCC, демонстрируя точность 78% и 75% соответственно, что подтверждается в статье [13]. Среди хромаграмм наибольшую точность показала Chroma VQT, достигнув 60%.</p>
	<p>В работе [14] авторы отмечают положительное влияние использования мел-спектрограмм с MFCC и других спектральных признаков для улучшения классификации эмоций. В данном исследовании комбинация различных признаков путем добавления их в модель в качестве отдельных каналов не дала значительного прироста точности. Наибольшая точность для комбинаций признаков (69%) была достигнута при использовании изображений мел-спектрограмм, MFCC и Chroma VQT, что не превосходит результаты, полученные при использовании только мел-спектрограмм или MFCC. Похожей точности достигла модель, которая дополнительно содержала изображения спектрального контраста. Результаты классификации с использованием комбинации признаков, достигнутые каждой моделью, приведены в таблице 2.</p>
	<table-wrap id="T2">
		<label>Table 2</label>
		<caption>
			<p>Результаты распознавания эмоций с применением комбинаций спектральных признаков</p>
		</caption>
		<table>
			<tr>
				<td>Спектральный признак</td>
				<td>RAVDESS, %</td>
				<td>RESD, %</td>
				<td>Dusha, %</td>
			</tr>
			<tr>
				<td>Мел-спектрограмма, MFCC</td>
				<td>65</td>
				<td>61</td>
				<td>48</td>
			</tr>
			<tr>
				<td>Мел-спектрограмма, MFCC, ChromaVQT</td>
				<td>69</td>
				<td>65</td>
				<td>51</td>
			</tr>
			<tr>
				<td>Мел-спектрограмма, MFCC, ChromaVQT, Спектральный контраст</td>
				<td>68</td>
				<td>63</td>
				<td>49</td>
			</tr>
		</table>
	</table-wrap>
	<p>6. Заключение</p>
	<p>Мел-спектрограммы и MFCC продемонстрировали наилучшие результаты в классификации эмоций, что подтверждает их значимость и надежность в анализе аудиосигналов. Среди хромаграмм, Chroma VQT показала высшую точность, указывая на её потенциальную ценность в данной области. Использование нескольких каналов для добавления различных спектральных признаков в модель не привело к значительным улучшениям. Точность комбинаций оказалась ниже, чем при использовании отдельных мел-спектрограмм или MFCC, что может указывать на необходимость более тщательного подбора и обработки признаков для повышения эффективности.</p>
	<p>Исследование подчеркивает критическую важность выбора правильных спектральных признаков для распознавания эмоций, демонстрируя, что эффективность комбинирования признаков может варьироваться в зависимости от конкретных условий и методов обработки данных, несмотря на их потенциальные преимущества.</p>
</sec>
        <sec sec-type="supplementary-material">
            <title>Additional File</title>
            <p>The additional file for this article can be found as follows:</p>
            <supplementary-material id="S1" xmlns:xlink="http://www.w3.org/1999/xlink"
                                    xlink:href="https://doi.org/10.5334/cpsy.78.s1">
                <!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://research-journal.org/media/articles/14129.docx">14129.docx</inline-supplementary-material>]-->
                <!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://research-journal.org/media/articles/14129.pdf">14129.pdf</inline-supplementary-material>]-->
                <label>Online Supplementary Material</label>
                <caption>
                    <p>Further description of analytic pipeline and patient demographic information. DOI:
                        <italic>
                            <uri>https://doi.org/10.60797/IRJ.2024.147.30</uri>
                        </italic>
                    </p>
                </caption>
            </supplementary-material>
        </sec>
    </body>
    <back>
        <ack>
            <title>Acknowledgements</title>
            <p></p>
        </ack>
        <sec>
            <title>Competing Interests</title>
            <p>None</p>
        </sec>
        <ref-list>
            <ref id="B1">
                    <label>1</label>
                    <mixed-citation publication-type="confproc">
                        Milner R. A Cross-Corpus Study on Speech Emotion Recognition / R. Milner, M.D. Jalal, R.W.M. Ng [et al.]. — 2019. — DOI: 10.1109/ASRU46091.2019.9003838.
                    </mixed-citation>
                </ref><ref id="B2">
                    <label>2</label>
                    <mixed-citation publication-type="confproc">
                        Dar N.M. EEG-based emotion charting for Parkinson's disease patients using Convolutional Recurrent Neural Networks and cross dataset learning / N.M. Dar, M.U. Akram, R. Yuvaraj [et al.] // Computers in Biology and Medicine. — 2022. — № 144. — DOI: 105327.10.1016/j.compbiomed.2022.105327.
                    </mixed-citation>
                </ref><ref id="B3">
                    <label>3</label>
                    <mixed-citation publication-type="confproc">
                        Murugappan M. Tunable Q wavelet transform based emotion classification in Parkinson’s disease using Electroencephalography / M. Murugappan, W. Alshuaib, A.K. Bourisly [et al.] // PLoS ONE. — 2020. — № 15 (11). — DOI: 10.1371/journal.pone.0242014.
                    </mixed-citation>
                </ref><ref id="B4">
                    <label>4</label>
                    <mixed-citation publication-type="confproc">
                        Righi S. Automatic and controlled attentional orienting toward emotional faces in patients with Parkinson's disease / S. Righi,  G. Gronchi, S. Ramat [et al.] // Cognitive, affective &amp; behavioral neuroscience. — 2023. — DOI: 23.10.3758/s13415.023.01069.5.
                    </mixed-citation>
                </ref><ref id="B5">
                    <label>5</label>
                    <mixed-citation publication-type="confproc">
                        Skibinska J. Parkinson’s Disease Detection based on Changes of Emotions during Speech / J. Skibinska, R. Burget. — 2020. — DOI: 10.1109/ICUMT51630.2020.9222446.
                    </mixed-citation>
                </ref><ref id="B6">
                    <label>6</label>
                    <mixed-citation publication-type="confproc">
                        Yang Z. XLNet: Generalized Autoregressive Pretraining for Language Understanding / Z. Yang, Z. Dai, Y. Yiming [et al.]. — 2019. — DOI: 10.48550/arXiv.1906.08237.
                    </mixed-citation>
                </ref><ref id="B7">
                    <label>7</label>
                    <mixed-citation publication-type="confproc">
                        Livingstone S.R. The Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS): A dynamic, multimodal set of facial and vocal expressions in North American English / S.R. Livingstone, F.A. Russo // PLOS ONE. — 2018. — № 13. — DOI: e0196391.10.1371/journal.pone.0196391.
                    </mixed-citation>
                </ref><ref id="B8">
                    <label>8</label>
                    <mixed-citation publication-type="confproc">
                        Deller J.R. Discrete-Time Processing of Speech Signals / J.R. Deller, H.L.J. Hansen, J.G. Proakis. — MacMillan Pub, 1999. — DOI: 10.1109/9780470544402.
                    </mixed-citation>
                </ref><ref id="B9">
                    <label>9</label>
                    <mixed-citation publication-type="confproc">
                        Flanagan J.L. Speech Analysis Synthesis and Perception / J.L. Flanagan. — Springer-Verlag Berlin Heidelberg, 1972. — DOI: 10.1007/978.3.662.01562.9.
                    </mixed-citation>
                </ref><ref id="B10">
                    <label>10</label>
                    <mixed-citation publication-type="confproc">
                        Shah A.K. Chroma Feature Extraction / A.K. Shah, M. Kattel, A. Nepal [et al.] // Chroma Feature Extraction using Fourier Transform. — 2019.
                    </mixed-citation>
                </ref><ref id="B11">
                    <label>11</label>
                    <mixed-citation publication-type="confproc">
                        Nandini C.S. Modulation spectra of natural sounds and ethological theories of auditory processing / C.S. Nandini, F.E. Theunissen // The Journal of the Acoustical Society of America. — 2003. — № 114. — P. 3394-3411. — DOI: 10.1121/1.1624067.
                    </mixed-citation>
                </ref><ref id="B12">
                    <label>12</label>
                    <mixed-citation publication-type="confproc">
                        Taffeta M.E. The Modulation Transfer Function for Speech Intelligibility / M.E. Taffeta, F.E. Theunissen // PLoS Computational Biology. — 2009. — № 5. — DOI: 10.1371/journal.pcbi.1000302.
                    </mixed-citation>
                </ref><ref id="B13">
                    <label>13</label>
                    <mixed-citation publication-type="confproc">
                        Zielonka M. Recognition of Emotions in Speech Using Convolutional Neural Networks on Different Datasets / M. Zielonka, A. Piastowski, A. Czyżewski [et al.] // Electronics. — 2022. — № 11. — P. 3831. — DOI: 10.3390/electronics11223831.
                    </mixed-citation>
                </ref><ref id="B14">
                    <label>14</label>
                    <mixed-citation publication-type="confproc">
                        Dias I. Speech emotion recognition with deep convolutional neural networks / I. Dias, M.F. Demirci, A. Yazici // Biomedical Signal Processing and Control. — 2020. — Vol. 59. — DOI: 10.1016/j.bspc.2020.101894.
                    </mixed-citation>
                </ref><ref id="B15">
                    <label>15</label>
                    <mixed-citation publication-type="confproc">
                        Kondratenko V. Large Raw Emotional Dataset with Aggregation Mechanism / V. Kondratenko, A. Sokolov, N. Karpov [et al.]. — 2022. — DOI: 10.48550/arXiv.2212.12266.
                    </mixed-citation>
                </ref><ref id="B16">
                    <label>16</label>
                    <mixed-citation publication-type="confproc">
                        Давидчук Н. ANIEMORE Открытая библиотека распознавания эмоций в речи человека / Н. Давидчук, И. Любенец, А. Аментес. — 2023. — DOI: 10.13140/RG.2.2.10999.80802.
                    </mixed-citation>
                </ref><ref id="B17">
                    <label>17</label>
                    <mixed-citation publication-type="confproc">
                        Saeed A. Multi-task Self-Supervised Learning for Human Activity Detection / A. Saeed, T. Ozcelebi, J. Lukkien // Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies. — 2019. — Vol. 3. — № 61. — P. 1-30. — DOI: 10.1145/3328932.
                    </mixed-citation>
                </ref><ref id="B18">
                    <label>18</label>
                    <mixed-citation publication-type="confproc">
                        Schneider S. Unsupervised Pre-Training for Speech Recognition / S. Schneider, A. Baevski, R. Collobert [et al.] // International Speech Communication Association. — 2019. — P. 3465-3469. — DOI: 10.21437/Interspeech.2019.1873.
                    </mixed-citation>
                </ref><ref id="B19">
                    <label>19</label>
                    <mixed-citation publication-type="confproc">
                        Hsu W.N. HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units // W.N. Hsu, B. Bolte, Y.H.H. Tsai [et al.] // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2021. — P. 1. — DOI: 10.1109/TASLP.2021.3122291.
                    </mixed-citation>
                </ref><ref id="B20">
                    <label>20</label>
                    <mixed-citation publication-type="confproc">
                        Chen S. WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing / S. Chen, C. Wang, Z. Chen [et al.] // IEEE Journal of Selected Topics in Signal Processing. — Vol. 16. — 2022. — P. 1-14. — DOI: 10.1109/JSTSP.2022.3188113.
                    </mixed-citation>
                </ref>
        </ref-list>
    </back>
    <fundings>
        
    </fundings>
</article>