<?xml version="1.0" encoding="UTF-8"?>
    <!DOCTYPE article PUBLIC "-//NLM/DTD JATS (Z39.96) Journal Publishing DTD v1.2 20120330//EN" "http://jats.nlm.nih.gov/publishing/1.2/JATS-journalpublishing1.dtd">
    <!--<?xml-stylesheet type="text/xsl" href="article.xsl">-->
<article xmlns:ns0="http://www.w3.org/1999/xlink" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" article-type="research-article" dtd-version="1.2" xml:lang="en">
	<front>
		<journal-meta>
			<journal-id journal-id-type="issn">2303-9868</journal-id>
			<journal-id journal-id-type="eissn">2227-6017</journal-id>
			<journal-title-group>
				<journal-title>Международный научно-исследовательский журнал</journal-title>
			</journal-title-group>
			<issn pub-type="epub">2303-9868</issn>
			<publisher>
				<publisher-name>ООО Цифра</publisher-name>
			</publisher>
		</journal-meta>
		<article-meta>
			<article-id pub-id-type="doi">10.60797/IRJ.2026.163.54</article-id>
			<article-categories>
				<subj-group>
					<subject>Brief communication</subject>
				</subj-group>
			</article-categories>
			<title-group>
				<article-title>ИДЕНТИФИКАЦИЯ И ВЕРИФИКАЦИЯ МНОГОФАКТОРНЫХ ПРЕДИКТОРОВ СЛОЖНОСТИ ТЕКСТА В АСПЕКТЕ ПРЕПОДАВАНИЯ РУССКОГО ЯЗЫКА КАК ИНОСТРАННОГО</article-title>
			</title-group>
			<contrib-group>
				<contrib contrib-type="author" corresp="yes">
					<name>
						<surname>Бай</surname>
						<given-names>Жу</given-names>
					</name>
					<email>261585598@qq.com</email>
					<xref ref-type="aff" rid="aff-1">1</xref>
				</contrib>
			</contrib-group>
			<aff id="aff-1">
				<label>1</label>
				<institution>Санкт-Петербургский государственный университет</institution>
			</aff>
			<pub-date publication-format="electronic" date-type="pub" iso-8601-date="2026-01-23">
				<day>23</day>
				<month>01</month>
				<year>2026</year>
			</pub-date>
			<pub-date pub-type="collection">
				<year>2026</year>
			</pub-date>
			<volume>7</volume>
			<issue>163</issue>
			<fpage>1</fpage>
			<lpage>7</lpage>
			<history>
				<date date-type="received" iso-8601-date="2025-09-18">
					<day>18</day>
					<month>09</month>
					<year>2025</year>
				</date>
				<date date-type="accepted" iso-8601-date="2026-01-14">
					<day>14</day>
					<month>01</month>
					<year>2026</year>
				</date>
			</history>
			<permissions>
				<copyright-statement>Copyright: &amp;#x00A9; 2022 The Author(s)</copyright-statement>
				<copyright-year>2022</copyright-year>
				<license license-type="open-access" xlink:href="http://creativecommons.org/licenses/by/4.0/">
					<license-p>
						This is an open-access article distributed under the terms of the Creative Commons Attribution 4.0 International License (CC-BY 4.0), which permits unrestricted use, distribution, and reproduction in any medium, provided the original author and source are credited. See 
						<uri xlink:href="http://creativecommons.org/licenses/by/4.0/">http://creativecommons.org/licenses/by/4.0/</uri>
					</license-p>
					.
				</license>
			</permissions>
			<self-uri xlink:href="https://research-journal.org/archive/1-163-2026-january/10.60797/IRJ.2026.163.54"/>
			<abstract>
				<p>В статье представлено корпусное исследование, направленное на выявление и верификацию объективных лексико-синтаксических предикторов сложности учебных текстов для изучающих русский язык как иностранный (РКИ). На материале текстов, стратифицированных по уровням CEFR (A1–C2), с помощью статистической среды R был проведён анализ четырёх ключевых параметров: лексического разнообразия (характеристика K Юла), синтаксической сложности (средняя длина предложения и средняя дистанция синтаксической зависимости) и стилистических особенностей (соотношение существительных и глаголов). Результаты статистического анализа (критерий Краскела-Уоллиса и корреляция Спирмена) показали, что синтаксические предикторы и лексическое разнообразие являются высокозначимыми индикаторами, демонстрирующими сильную корреляцию с уровнем владения языком. Соотношение существительных и глаголов также выявило значимую тенденцию к номинализации в текстах более высоких уровней. Исследование предлагает многомерную модель для объективной оценки текстовой сложности и закладывает эмпирическую основу для будущих психолингвистических экспериментов.</p>
			</abstract>
			<kwd-group>
				<kwd>лексическая сложность</kwd>
				<kwd> синтаксическая сложность</kwd>
				<kwd> русский язык как иностранный (РКИ)</kwd>
				<kwd> корпусная лингвистика</kwd>
				<kwd> вычислительная лингвистика</kwd>
			</kwd-group>
		</article-meta>
	</front>
	<body>
		<sec>
			<title>HTML-content</title>
			<p>1. Введение</p>
			<p>Оценка сложности текста является одной из фундаментальных задач в области преподавания русского языка как иностранного (РКИ). Адекватный подбор учебных материалов, соответствующий текущему уровню владения языком обучающегося, напрямую влияет на эффективность усвоения знаний и является залогом успешной языковой подготовки [1]. Однако традиционные методы оценки, часто опирающиеся на интуицию преподавателя или ограниченный набор лексико-грамматических тем, не всегда обеспечивают необходимую объективность и последовательность [5]. В связи с этим возникает острая необходимость в разработке и применении объективных, количественных методов анализа, способных предоставить эмпирически обоснованные критерии для классификации текстов по уровням сложности.</p>
			<p>Современная вычислительная лингвистика предлагает широкий инструментарий для количественного анализа текста, однако многие существующие метрики, такие как простая частотность слов или классические индексы удобочитаемости, оказываются недостаточными для языков с богатой морфологией и свободным порядком слов, каким является русский. Сложность текста — это многомерное явление, которое не может быть сведено к одному или двум параметрам [9]. Она охватывает лексическое разнообразие, синтаксическую структуру, стилистические особенности и когнитивную нагрузку, возникающую при обработке текста читателем. Следовательно, для получения достоверной картины необходимо перейти от одномерных подходов к многофакторному анализу, направленному на выявление целого комплекса взаимосвязанных лингвистических характеристик [6].</p>
			<p>Цель настоящей статьи — идентификация и верификация набора объективных корпусных предикторов, которые надёжно отражают лексико-синтаксическую сложность текстов, предназначенных для изучающих русский язык. На материале учебных текстов, предварительно размеченных по уровням Общеевропейских компетенций владения иностранным языком (CEFR), с помощью статистической среды R и инструментов компьютерной лингвистики (quanteda, udpipe) проводится анализ четырёх ключевых групп параметров: лексического разнообразия (характеристика K Юла), длины синтаксических единиц (средняя длина предложения), сложности внутренней структуры предложения (средняя дистанция синтаксической зависимости) и стилистических особенностей (соотношение существительных и глаголов). Полученные результаты призваны не только способствовать созданию более качественно градуированных учебных материалов, но и заложить эмпирическую основу для последующих экспериментальных исследований в области психолингвистики восприятия текста.</p>
			<p>2. Методы и принципы исследования</p>
			<p>2.1. Материалы</p>
			<p>Эмпирической базой для настоящего исследования послужил корпус учебных текстов, собранных из различных пособий по русскому языку как иностранному. Ключевым преимуществом данного корпуса является то, что все тексты в нём предварительно классифицированы по уровням владения языком в соответствии с Общеевропейскими компетенциями (CEFR), охватывая диапазон от A1 до C2. Для анализа были отобраны преимущественно тексты, предназначенные для чтения (текст для чтения), так как именно они наиболее полно отражают комплексную лексико-синтаксическую структуру, с которой сталкивается обучающийся при работе с аутентичными или адаптированными материалами. Тексты упражнений, имеющие специфическую дидактическую направленность, были исключены из основного анализа для обеспечения гомогенности выборки.</p>
			<p>2.2. Методы анализа</p>
			<p>Анализ данных проводился в среде статистического программирования R, которая предоставляет широкие возможности для обработки и анализа текстовых данных. Для решения поставленных задач были использованы два ключевых пакета компьютерной лингвистики. Пакет quanteda применялся для быстрой и эффективной токенизации текстов и расчёта метрик лексического разнообразия. Для более глубокого морфологического и синтаксического анализа, включая частеречную разметку и построение деревьев зависимостей, был использован пакет udpipe с предварительно обученной моделью для русского языка russian-syntagrus.</p>
			<p>2.3. Анализируемые параметры</p>
			<p>На основе теоретических предпосылок о многомерности языковой сложности для анализа были выбраны четыре предиктора, отражающие различные аспекты текста [10]:</p>
			<p>Характеристика K Юла: метрика лексического разнообразия, измеряющая степень повторяемости слов. В отличие от базового показателя TTR, данный индекс практически нечувствителен к длине текста, что делает его надёжным инструментом для сравнения выборок разного объёма [4].</p>
			<p>Средняя длина предложения: классический параметр, отражающий сложность на макросинтаксическом уровне. Увеличение длины предложения, как правило, коррелирует с усложнением его структуры и повышением когнитивной нагрузки на читателя.</p>
			<p>Средняя дистанция синтаксической зависимости: продвинутый параметр, оценивающий сложность на микросинтаксическом уровне. Он измеряет среднее расстояние (в словах) между синтаксически связанными элементами предложения. Большая дистанция требует от читателя удерживать в рабочей памяти больше информации, что напрямую связано с воспринимаемой трудностью текста.</p>
			<p>Соотношение существительных и глаголов: стилистический параметр, указывающий на степень номинализации текста. Преобладание существительных над глаголами характерно для более абстрактного, формального и информационно плотного стиля, свойственного текстам высоких уровней сложности.</p>
			<p>2.4. Статистическая обработка</p>
			<p>Для верификации выбранных предикторов использовались два непараметрических статистических теста. Критерий Краскела-Уоллиса применялся для определения наличия статистически значимых различий в значениях каждого параметра между всеми уровнями CEFR. Для оценки силы и направления тенденции (т.е. последовательного роста или снижения параметра с повышением уровня) рассчитывался коэффициент ранговой корреляции Спирмена (ρ). Уровень статистической значимости был принят за p &lt; 0,05.</p>
			<p>3. Основные результаты</p>
			<p>Статистический анализ данных, проведённый на материале учебного корпуса, подтвердил гипотезу о многомерности текстовой сложности и позволил верифицировать выбранные параметры в качестве надёжных предикторов уровня владения языком. Всестороннее рассмотрение каждого предиктора выявило их различный вклад и специфику, что даёт комплексное представление о том, как меняется структура текста по мере повышения его сложности. Ниже представлены результаты анализа по каждому из четырёх параметров.</p>
			<p>3.1. Лексическое разнообразие (Характеристика K Юла)</p>
			<fig id="F1">
				<label>Figure 1</label>
				<caption>
					<p>Распределение Характеристики K Юла по уровням владения языком</p>
				</caption>
				<alt-text>Распределение Характеристики K Юла по уровням владения языком</alt-text>
				<graphic ns0:href="/media/images/2026-01-19/a011712f-fc8f-4a5b-bd01-5e349c86b9c2.png"/>
			</fig>
			<p>Анализ показал, что характеристика K Юла является высокочувствительным индикатором лексической сложности. Результаты теста Краскела-Уоллиса продемонстрировали наличие статистически высокозначимых различий в значениях K между текстами разных уровней (χ²(5) = 80,19, p &lt; 0,001). Корреляционный анализ по Спирмену выявил сильную, статистически значимую отрицательную связь между уровнем текста и значением K (ρ = -0,55, p &lt; 0,001). Это означает, что с повышением уровня от A1 до C2 лексическая повторяемость текстов закономерно и значительно снижается, следовательно, их лексическое разнообразие возрастает.2. Сложность на синтаксическом уровне</p>
			<p>Два параметра, оценивающие синтаксическую сложность с разных сторон, показали себя как наиболее сильные предикторы [3]. Средняя длина предложения продемонстрировала положительную корреляцию с уровнем текста (ρ = 0,70, p &lt; 0,001), что подтверждает гипотезу о том, что тексты более высоких уровней систематически используют более длинные и сложносочинённые/сложноподчинённые предложения (χ²(5) = 120,27, p &lt; 0,001).</p>
			<fig id="F2">
				<label>Figure 2</label>
				<caption>
					<p>Распределение средней длины предложения по уровням владения языком</p>
				</caption>
				<alt-text>Распределение средней длины предложения по уровням владения языком</alt-text>
				<graphic ns0:href="/media/images/2026-01-19/59c8a8f4-acea-4e48-b390-8121c8ca0c7d.png"/>
			</fig>
			<fig id="F3">
				<label>Figure 3</label>
				<caption>
					<p>Распределение соотношения существительных и глаголов по уровням владения языком</p>
				</caption>
				<alt-text>Распределение соотношения существительных и глаголов по уровням владения языком</alt-text>
				<graphic ns0:href="/media/images/2026-01-19/932af252-ed66-4b56-8810-6d706c166a0f.png"/>
			</fig>
			<p>Аналогичную сильную положительную тенденцию показала и средняя дистанция синтаксической зависимости (ρ = 0,63, p &lt; 0,001), различия между уровнями также были высокозначимы (χ²(5) = 95,92, p &lt; 0,001). Этот результат особенно важен, так как он свидетельствует не просто о внешнем увеличении длины предложений, но и об усложнении их внутренней структуры. Возрастающая дистанция между синтаксически связанными словами напрямую указывает на повышение когнитивной нагрузки, необходимой для успешной обработки текста читателем.3. Стилистические особенности текста</p>
			<p>Анализ соотношения существительных и глаголов выявил более тонкую, но статистически значимую закономерность. Тест Краскела-Уоллиса показал, что общие различия между группами не достигают порога статистической значимости (χ²(5) = 9,94, p = 0,077). Однако корреляционный анализ по Спирмену обнаружил слабую, но статистически высокозначимую положительную тенденцию (ρ = 0,17, p &lt; 0,01). Это говорит о том, что, несмотря на незначительные колебания, по мере роста уровня сложности наблюдается системный сдвиг в сторону номинализации — увеличения доли существительных по отношению к глаголам. Данный сдвиг отражает переход к более абстрактному, формальному и информационно насыщенному стилю изложения в текстах высоких уровней.</p>
			<fig id="F4">
				<label>Figure 4</label>
				<caption>
					<p>Распределение средней дистанции синтаксической зависимости по уровням владения языком</p>
				</caption>
				<alt-text>Распределение средней дистанции синтаксической зависимости по уровням владения языком</alt-text>
				<graphic ns0:href="/media/images/2026-01-19/1644e369-bd11-4e6b-bdb6-73b31b8eea3f.png"/>
			</fig>
			<p>Для наглядности, сводные результаты статистического анализа по всем четырём предикторам представлены в Таблице 1.</p>
			<table-wrap id="T1">
				<label>Table 1</label>
				<caption>
					<p>Сводные результаты статистического анализа предикторов</p>
				</caption>
				<table>
					<tr>
						<td>Предиктор (Predictor)</td>
						<td>Критерий Краскела-Уоллиса (Kruskal-Wallis)</td>
						<td>Корреляция Спирмена (Spearman's Corr.)</td>
					</tr>
					<tr>
						<td>Характеристика K Юла</td>
						<td>χ²(5) = 80,19</td>
						<td>p &lt; 0,001</td>
						<td>ρ = -0,55</td>
						<td>p &lt; 0,001</td>
					</tr>
					<tr>
						<td>Средняя длина предложения</td>
						<td>χ²(5) = 120,27</td>
						<td>p &lt; 0,001</td>
						<td>ρ = 0,70</td>
						<td>p &lt; 0,001</td>
					</tr>
					<tr>
						<td>Средняя дистанция синтаксической зависимости</td>
						<td>χ²(5) = 95,92</td>
						<td>p &lt; 0,001</td>
						<td>ρ = 0,63</td>
						<td>p &lt; 0,001</td>
					</tr>
					<tr>
						<td>Соотношение существительных и глаголов</td>
						<td>χ²(5) = 9,94</td>
						<td>p = 0,077</td>
						<td>ρ = 0,17</td>
						<td>p &lt; 0,01</td>
					</tr>
				</table>
			</table-wrap>
			<p>4. Обсуждение</p>
			<p>Проведённое исследование позволило выявить и верифицировать четыре объективных параметра, которые в совокупности дают многомерное представление о лексико-синтаксической сложности учебных текстов по РКИ. Полученные результаты не только подтверждают существующие теоретические представления, но и вносят важные уточнения, имеющие как теоретическое, так и практическое значение [7].</p>
			<p>Ключевым выводом является то, что сложность текста для иностранного учащегося определяется не одним, а целым комплексом факторов, среди которых доминирующую роль играют предикторы синтаксического уровня. Средняя длина предложения и, что особенно важно, средняя дистанция синтаксической зависимости показали себя как наиболее сильные и надёжные индикаторы [2]. Это подчёркивает, что по мере повышения уровня владения языком основной вызов для учащегося заключается не столько в освоении новой лексики, сколько в способности обрабатывать всё более сложные синтаксические конструкции. Увеличение дистанции зависимости напрямую свидетельствует о росте когнитивной нагрузки, так как требует от читателя удерживать в рабочей памяти больше грамматических связей для успешного декодирования смысла предложения [8].</p>
			<p>Наряду с синтаксисом, лексическое разнообразие, измеренное с помощью характеристики K Юла, также является фундаментальным параметром сложности. Сильная отрицательная корреляция данного показателя с уровнем текста доказывает, что переход на новый уровень владения языком неразрывно связан с расширением словарного запаса и уменьшением доли повторяющихся лексем. Наконец, соотношение существительных и глаголов, хоть и показало более слабую тенденцию, вскрыло важный стилистический аспект сложности. Системный сдвиг в сторону номинализации в текстах высоких уровней отражает переход от нарративного, ориентированного на действия стиля к более абстрактному, дескриптивному и информационно плотному изложению, характерному для академической и научной речи.</p>
			<p>5. Заключение</p>
			<p>В заключение, данное исследование успешно идентифицировало и верифицировало набор из четырёх корпусных предикторов, эффективно отражающих многоаспектную природу сложности текста в РКИ. Установлено, что сложность определяется как лексическими (разнообразие), так и синтаксическими (длина и внутренняя структура предложений) и стилистическими (степень номинализации) факторами. Практическая значимость работы заключается в том, что предложенные метрики могут быть использованы авторами учебников и преподавателями для объективной оценки и градуировки учебных материалов. Теоретический вклад состоит в количественном подтверждении и детализации структуры текстовой сложности. Результаты данного корпусного анализа закладывают прочную эмпирическую основу для следующего этапа исследований — проведения психолингвистических экспериментов, направленных на изучение того, как эти объективные текстовые параметры влияют на процессы восприятия и когнитивную нагрузку у реальных читателей, изучающих русский язык.</p>
		</sec>
		<sec sec-type="supplementary-material">
			<title>Additional File</title>
			<p>The additional file for this article can be found as follows:</p>
			<supplementary-material xmlns:xlink="http://www.w3.org/1999/xlink" id="S1" xlink:href="https://doi.org/10.5334/cpsy.78.s1">
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://research-journal.org/media/articles/21476.docx">21476.docx</inline-supplementary-material>]-->
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://research-journal.org/media/articles/21476.pdf">21476.pdf</inline-supplementary-material>]-->
				<label>Online Supplementary Material</label>
				<caption>
					<p>
						Further description of analytic pipeline and patient demographic information. DOI:
						<italic>
							<uri>https://doi.org/10.60797/IRJ.2026.163.54</uri>
						</italic>
					</p>
				</caption>
			</supplementary-material>
		</sec>
	</body>
	<back>
		<ack>
			<title>Acknowledgements</title>
			<p/>
		</ack>
		<sec>
			<title>Competing Interests</title>
			<p/>
		</sec>
		<ref-list>
			<ref id="B1">
				<label>1</label>
				<mixed-citation publication-type="confproc">Kupriyanov R.V. Cognitive complexity measures for educational texts: Empirical validation of linguistic parameters / R.V. Kupriyanov, O.V. Bukach, O.I. Aleksandrova // Russian Journal of Linguistics. — 2023. — Vol. 27. — № 3. — P. 641–662. — DOI: 10.22363/2687-0088-35817.</mixed-citation>
			</ref>
			<ref id="B2">
				<label>2</label>
				<mixed-citation publication-type="confproc">Галявиева Л.Ш. Сложность учебных текстов как функция терминологической плотности / Л.Ш. Галявиева, А.Т. Хусаинова, М.И. Солнышкина // Ученые записки национального общества прикладной лингвистики. — 2023. — № 2 (42). — С. 33–50.</mixed-citation>
			</ref>
			<ref id="B3">
				<label>3</label>
				<mixed-citation publication-type="confproc">Калугина Е.Н. Лингвистическая экспертиза анонимного текста: методы и подходы / Е.Н. Калугина, А.В. Волкогонова // Вестник АПК Ставрополья. — 2016. — № 2 (22). — С. 166–168.</mixed-citation>
			</ref>
			<ref id="B4">
				<label>4</label>
				<mixed-citation publication-type="confproc">Колмогорова А.В. Лексико-грамматические маркеры эмоций в качестве параметров для сентимент-анализа русскоязычных интернет-текстов / А.В. Колмогорова, Л.А. Вдовина // Вестник Пермского университета. Российская и зарубежная филология. — 2019. — Т. 11. — № 3. — С. 38–46. — DOI: 10.17072/2073-6681-2019-3-38-46.</mixed-citation>
			</ref>
			<ref id="B5">
				<label>5</label>
				<mixed-citation publication-type="confproc">Куприянов Р.В. Параметрическая таксономия учебных текстов / Р.В. Куприянов, М.И. Солнышкина, П.А. Лехницкая // Вестник Волгоградского государственного университета. Серия 2: Языкознание. — 2023. — Т. 22. — № 6. — С. 80–94. — DOI: 10.15688/jvolsu2.2023.6.6.</mixed-citation>
			</ref>
			<ref id="B6">
				<label>6</label>
				<mixed-citation publication-type="confproc">Вахрушева А.Я. Лингвистическая сложность учебных текстов / А.Я. Вахрушева, М.И. Солнышкина, Р.В. Куприянов [и др.] // Вопросы журналистики, педагогики, языкознания. — 2021. — Т. 40. — № 1. — С. 89–99. — DOI: 10.52575/2712-7451-2021-40-1-89-99.</mixed-citation>
			</ref>
			<ref id="B7">
				<label>7</label>
				<mixed-citation publication-type="confproc">Пешкова Н.П. Лингвистические характеристики текстов как основания для их классификации (на материале научных, технических, учебных текстов):  дис. ... канд. филол. наук / Пешкова Наталья Петровна. — Москва, 1987. — 272 с.</mixed-citation>
			</ref>
			<ref id="B8">
				<label>8</label>
				<mixed-citation publication-type="confproc">Резанова З.И.О выборе признаков текста, релевантных в автороведческой экспертной деятельности / З.И. Резанова, А.С. Романов, Р.В. Мещеряков // Вестник Томского государственного университета. Филология. — 2013. — № 6 (26). — С. 38–52.</mixed-citation>
			</ref>
			<ref id="B9">
				<label>9</label>
				<mixed-citation publication-type="confproc">Солнышкина М.И. Сложность текста: этапы изучения в отечественном прикладном языкознании / М.И. Солнышкина, А.С. Кисельников // Вестник Томского государственного университета. Филология. — 2015. — № 6 (38). — С. 86–99.</mixed-citation>
			</ref>
			<ref id="B10">
				<label>10</label>
				<mixed-citation publication-type="confproc">Толпегин П.В. Информационные технологии анализа русских естественно-языковых текстов. Часть I / П.В. Толпегин // Информационные технологии. — 2006. — № 8. — С. 41–50.</mixed-citation>
			</ref>
		</ref-list>
	</back>
	<fundings/>
</article>