<?xml version="1.0" encoding="UTF-8"?>
    <!DOCTYPE article PUBLIC "-//NLM/DTD JATS (Z39.96) Journal Publishing DTD v1.2 20120330//EN" "http://jats.nlm.nih.gov/publishing/1.2/JATS-journalpublishing1.dtd">
    <!--<?xml-stylesheet type="text/xsl" href="article.xsl">-->
<article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:ns0="http://www.w3.org/1999/xlink" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" article-type="research-article" dtd-version="1.2" xml:lang="en">
	<front>
		<journal-meta>
			<journal-id journal-id-type="issn">2303-9868</journal-id>
			<journal-id journal-id-type="eissn">2227-6017</journal-id>
			<journal-title-group>
				<journal-title>Международный научно-исследовательский журнал</journal-title>
			</journal-title-group>
			<issn pub-type="epub">2303-9868</issn>
			<publisher>
				<publisher-name>ООО Цифра</publisher-name>
			</publisher>
		</journal-meta>
		<article-meta>
			<article-id pub-id-type="doi">10.60797/IRJ.2026.171.59</article-id>
			<article-categories>
				<subj-group>
					<subject>Brief communication</subject>
				</subj-group>
			</article-categories>
			<title-group>
				<article-title>АРХИТЕКТУРНОЕ ОБОСНОВАНИЕ И ПИЛОТНАЯ ОЦЕНКА МОДИФИЦИРОВАННОГО HTR-МОДУЛЯ ДЛЯ РАСПОЗНАВАНИЯ ПЛОТНЫХ РУКОПИСНЫХ МЕДИЦИНСКИХ ПОЛЕЙ</article-title>
			</title-group>
			<contrib-group>
				<contrib contrib-type="author" corresp="yes">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0003-1017-5544</contrib-id>
					<contrib-id contrib-id-type="rinc">https://elibrary.ru/author_profile.asp?id=113391</contrib-id>
					<contrib-id contrib-id-type="rid">https://publons.com/researcher/ADM-9626-2022</contrib-id>
					<name>
						<surname>Ильичев</surname>
						<given-names>Владимир Юрьевич</given-names>
					</name>
					<email>patrol8@yandex.ru</email>
					<xref ref-type="aff" rid="aff-2">2</xref>
				</contrib>
				<contrib contrib-type="author">
					<contrib-id contrib-id-type="rinc">https://elibrary.ru/author_profile.asp?id=156233</contrib-id>
					<name>
						<surname>Федоров</surname>
						<given-names>Виктор Олегович</given-names>
					</name>
					<email>fedorov_vo@bmstu.ru</email>
					<xref ref-type="aff" rid="aff-1">1</xref>
				</contrib>
				<contrib contrib-type="author">
					<name>
						<surname>Русин</surname>
						<given-names>Ярослав Юрьевич</given-names>
					</name>
					<email>zzk88@mail.ru</email>
					<xref ref-type="aff" rid="aff-2">2</xref>
				</contrib>
			</contrib-group>
			<aff id="aff-1">
				<institution-wrap>
					<institution-id institution-id-type="ROR">https://ror.org/00pb8h375</institution-id>
					<institution content-type="education">Московский государственный технический университет имени Н. Э. Баумана</institution>
				</institution-wrap>
			</aff>
			<aff id="aff-2">
				<label>2</label>
				<institution>Московский государственный технический университет имени Н.Э. Баумана</institution>
			</aff>
			<pub-date publication-format="electronic" date-type="pub" iso-8601-date="2026-09-17">
				<day>17</day>
				<month>09</month>
				<year>2026</year>
			</pub-date>
			<pub-date pub-type="collection">
				<year>2026</year>
			</pub-date>
			<volume>14</volume>
			<issue>171</issue>
			<fpage>1</fpage>
			<lpage>14</lpage>
			<history>
				<date date-type="received" iso-8601-date="2026-07-30">
					<day>30</day>
					<month>07</month>
					<year>2026</year>
				</date>
				<date date-type="accepted" iso-8601-date="2026-09-04">
					<day>04</day>
					<month>09</month>
					<year>2026</year>
				</date>
			</history>
			<permissions>
				<copyright-statement>Copyright: &amp;#x00A9; 2022 The Author(s)</copyright-statement>
				<copyright-year>2022</copyright-year>
				<license license-type="open-access" xlink:href="http://creativecommons.org/licenses/by/4.0/">
					<license-p>
						This is an open-access article distributed under the terms of the Creative Commons Attribution 4.0 International License (CC-BY 4.0), which permits unrestricted use, distribution, and reproduction in any medium, provided the original author and source are credited. See 
						<uri xlink:href="http://creativecommons.org/licenses/by/4.0/">http://creativecommons.org/licenses/by/4.0/</uri>
					</license-p>
					.
				</license>
			</permissions>
			<self-uri xlink:href="https://research-journal.org/archive/9-171-2026-september/10.60797/IRJ.2026.171.59"/>
			<abstract>
				<p>Актуальность работы обусловлена высокой трудоёмкостью ручного ввода данных из рукописных карт вызова бригад скорой медицинской помощи (СМП): при суточном объёме в несколько тысяч вызовов на обработку одного документа уходит от нескольких до десятков минут. Существующие универсальные решения оптического распознавания символов недостаточно эффективны для медицинских рукописных текстов из-за специфической лексики, аббревиатур, латинских терминов и неоднородного качества изображений.Целью работы является обоснование и пилотная оценка гибридной нейросетевой архитектуры ResNet18 TE CTC (CNN блок ResNet18, Transformer Encoder, декодер CTC) в качестве HTR модуля системы MedForm HTR. Ключевым этапом выступает аналитическое и экспериментальное подтверждение целесообразности модификации CNN блока на базе ResNet18 под CTC HTR, поскольку именно он во многом определяет точность распознавания.В ходе исследований подтверждён доменный сдвиг между эталонными данными и картами СМП, показана необходимость доменного дообучения и продемонстрировано преимущество предложенной архитектуры для распознавания плотных гетерогенных рукописных полей. Выявлены факторы, ограничивающие качество распознавания; их устранение предполагает дальнейшие работы по предподготовке документации, обучению HTR модуля и интеграции других компонентов MedForm HTR (в том числе медицинского словаря), реализуя систему как конвейер обработки медицинских документов.</p>
			</abstract>
			<kwd-group>
				<kwd>HTR</kwd>
				<kwd> MedForm HTR</kwd>
				<kwd> ResNet18</kwd>
				<kwd> Transformer Encoder</kwd>
				<kwd> CTC</kwd>
				<kwd> доменная адаптация</kwd>
				<kwd> карты вызова СМП</kwd>
			</kwd-group>
		</article-meta>
	</front>
	<body>
		<sec>
			<title>HTML-content</title>
			<p>1. Введение</p>
			<p>Существующие универсальные решения оптического распознавания символов демонстрируют недостаточную точность при работе с рукописными медицинскими текстами: специфическая профессиональная лексика, латинские термины, аббревиатуры и неоднородное качество исходных изображений существенно снижают качество распознавания. Отсутствие предметно-адаптированных инструментов вынуждает операторов выполнять фактически полный ручной ввод данных, не получая от систем распознавания практической пользы.</p>
			<p>Актуальность настоящей работы определяется необходимостью разработки специализированной интеллектуальной системы MedForm-HTR (рисунок 1) в виде конвейера, ориентированного на распознавание рукописных медицинских документов с применением технологий HTR (Handwritten Text Recognition). Приоритетной предметной областью MedForm-HTR являются карты вызовов бригады скорой медицинской помощи (СМП) с последующим применением системы для обработки других медицинских форм. При суточном объёме в 1,5–2,0 тыс. вызовов бригад скорой медицинской помощи для медицинских подразделений среднего города, трудозатраты на обработку карт вызова СМП очень значительные, учитывая, что на ввод одного документа в реестр приходится от нескольких до десятков минут в зависимости от объёма и разборчивости почерка.</p>
			<fig id="F1">
				<label>Figure 1</label>
				<caption>
					<p>Диаграмма контекста разрабатываемого конвейера MedForm-HTR</p>
				</caption>
				<alt-text>Диаграмма контекста разрабатываемого конвейера MedForm-HTR</alt-text>
				<graphic ns0:href="/media/images/2026-07-29/747bc663-627a-404d-8fde-79e20d4e83e0.png"/>
			</fig>
			<p>2. Основная часть</p>
			<p>Карта вызовов СМП представляет собой учетную форму №110/у, утвержденную Приказом Министерства здравоохранения и социального развития Российской Федерации от 02.12.2009 №942 (рисунок 2). Документ содержит десятки структурированных полей, в том числе данные о пациенте, время и адрес вызова, диагноз по МКБ-10, применённые лекарственные средства и дозировки, а также отметки о транспортировке и передаче пациента. Карта вызова СМП является типичным представителем широкого класса первичной медицинской документации и характеризует такие ключевые проблемы предметной области, как высокая вариативность почерка, смешанный текст (прописной и печатный), содержание на нескольких языках, а также необходимость обеспечения юридической и клинической значимости данных.</p>
			<fig id="F2">
				<label>Figure 2</label>
				<caption>
					<p>Обезличенная карта вызовов скорой медицинской помощи</p>
				</caption>
				<alt-text>Обезличенная карта вызовов скорой медицинской помощи</alt-text>
				<graphic ns0:href="/media/images/2026-07-29/209fdddf-9002-4379-98e9-4cce5bf777ae.png"/>
			</fig>
			<p>Карта вызовов СМП состоит из 37 полей, около 70% которых заполняются рукописным текстом, остальные поля представлены чекбоксами и стандартными подчеркиваниями (таблица 1). В MedForm-HTR чекбоксы могут обрабатываться отдельным простым классификатором ОМR (Optical Mark Recognition), в связи с чем они были исключены из задачи HTR.</p>
			<table-wrap id="T1">
				<label>Table 1</label>
				<caption>
					<p>Характеристика репрезентативных полей карты вызова СМП</p>
				</caption>
				<table>
					<tr>
						<td>Номер поля</td>
						<td>Название поля по форме № 110/у</td>
						<td>Категория данных для HTR</td>
						<td>Особенности визуального и текстового распределения</td>
					</tr>
					<tr>
						<td>Поле 20</td>
						<td>Жалобы</td>
						<td>Свободный текст</td>
						<td>Рукописный текст (до 6 строк, до 30–40 символов в строке). Высокая вариативность.</td>
					</tr>
					<tr>
						<td>Поле 21</td>
						<td>Анамнез</td>
						<td>Свободный текст</td>
						<td>Сверхплотный рукописный текст (до 6, до 30–40 символов в строке), обилие латинских терминов и сокращений (например, «ФП» — фибрилляция предсердий, «Luxatio» — вывих).</td>
					</tr>
					<tr>
						<td>Поле 22/28</td>
						<td>Объективные данные</td>
						<td>Клинические метрики, смешанный тип</td>
						<td>Рукописный текст, строгие паттерны: цифры, дроби (130/90), единицы измерения (до 25 строк, до 10–30 символов в строке). Критически важна точность распознавания знаков.</td>
					</tr>
					<tr>
						<td>Поле 33/35</td>
						<td>Результат выезда / Направление</td>
						<td>Смешанный тип</td>
						<td>Чекбоксы + короткие рукописные вставки названия больниц, отделений, например, «КОКБ, отд. сложных нарушений ритма сердца и электрокардиостимуляции», до 12 строк, 10–20 символов в строке).</td>
					</tr>
				</table>
			</table-wrap>
			<p>HTR-модель должна быть устойчивой к вариативности исходных изображений: различным почеркам врачей, бледным или размытым сканам, наклону текста, пересечению рукописи с линиями бланка, исправлениям. Следовательно, выбранная архитектура должна допускать применение процедур доменного дообучения, регуляризации и аугментации данных, направленных на повышение устойчивости модели к реальным условиям эксплуатации. Кроме этого, модель должна обеспечивать контролируемый характер распознавания, особенно для значимых полей, где ошибка в одном символе или цифре может приводить к искажению клинического смысла. Поэтому результаты работы HTR-модуля должны оцениваться не только по средним текстовым метрикам, но и по метрикам полного совпадения поля, точности числовых значений и объёму последующей операторской правки.</p>
			<p>Эволюция современных методов HTR демонстрирует переход от изолированного посимвольного анализа к сквозным (End-to-End) гибридным глубоким нейросетевым архитектурам </p>
			<p>[1][2][3][4]</p>
			<p>С учетом вышеназванных требований были рассмотрены основные гибридные нейросетевые архитектуры, имеющие потенциальную возможность работать со смешанными гетерогенными текстами (таблица 2).</p>
			<table-wrap id="T2">
				<label>Table 2</label>
				<caption>
					<p>Основные гибридные нейросетевые архитектуры, используемые в HTR</p>
				</caption>
				<table>
					<tr>
						<td>Архитектура</td>
						<td>Извлечение признаков</td>
						<td>контекста</td>
						<td>Механизм преобразования признаков в текст</td>
						<td>Уровень распознавания</td>
						<td>Применение</td>
						<td>MedForm-HTR</td>
					</tr>
					<tr>
						<td>CNN - RNN - CTC</td>
						<td>VGG-like CNN, ResNet, другие CNN</td>
						<td>LSTM, BiLSTM, GRU, BiGRU</td>
						<td>CTC + greedy/beam decoding</td>
						<td>слово/строка, поле</td>
						<td>анкеты, отдельные поля</td>
						<td>базовый уровень</td>
					</tr>
					<tr>
						<td>CNN - Transformer Encoder - CTC</td>
						<td>CNN, ResNet, ConvNeXt</td>
						<td>Transformer Encoder</td>
						<td>CTC + greedy/beam decoding</td>
						<td>слово/строка, поле</td>
						<td>HTR при ограниченной разметке, анкеты, медицинские поля</td>
						<td>основной кандидат для исследования</td>
					</tr>
					<tr>
						<td>Encoder-decoder/TrOCR</td>
						<td>ViT / BEiT-like image encoder</td>
						<td>cross-attention между image encoder и text decoder</td>
						<td>авторегрессионный Transformer decoder</td>
						<td>слово/строка, поле</td>
						<td>печатный, рукописный текст</td>
						<td>сильный, базовый уровень</td>
					</tr>
					<tr>
						<td>VAN/page-level attention models</td>
						<td>CNN encoder</td>
						<td>vertical attention / implicit line segmentation</td>
						<td>attention-based decoder</td>
						<td>абзац/страница</td>
						<td>рукописные абзацы, исторические документы</td>
						<td>перспективная модель для распознавание рукописного текста на уровне абзаца и страницы</td>
					</tr>
				</table>
			</table-wrap>
			<p>На основании проведенного анализа в настоящей работе в качестве базовой архитектурной линии рассматривается гибридная модель CNN-Transformer Encoder-CTC. Семейство CNN-Transformer Encoder-CTC является перспективным для HTR, поскольку объединяет локальную визуальную экстракцию CNN, глобальное контекстное моделирование Transformer Encoder (TE) и CTC-обучение без посимвольного выравнивания </p>
			<p>[5][6][7]</p>
			<p>Свёрточная часть архитектуры (CNN-фронтенд) используется для извлечения локальных визуальных признаков рукописного текста: штрихов, петель, соединений букв, наклона и толщины линии. TE (первая ключевая часть архитектуры трансформера) применяется для контекстного моделирования полученной последовательности признаков вдоль оси письма. В отличие от рекуррентных блоков, TE позволяет учитывать более широкий контекст и выполнять обработку последовательности параллельно </p>
			<p>[8][10][11][12]</p>
			<p>Таким образом, выбранная архитектурная линия сочетает три свойства, важные для MedForm-HTR: локальную чувствительность CNN к графемным признакам, контекстное моделирование TE и возможность обучения без посимвольного выравнивания за счёт CTC. В статье исследуется архитектура ResNet18-TE-CTC с модификацией горизонтального downsampling в ResNet18. Такой дизайн позволяет определить влияние исследуемого фактора на CTC-распознавание.</p>
			<p>Учитывая вышесказанное, в работе рассматриваются две конфигурации одной архитектурной линии: стандартная ResNet18-TE-CTC, используемая как контрольный вариант, и модифицированная ResNet18-TE-CTC, в которой в третьем сверточном слое (layer3) и в четвертом сверточном слое (layer4) горизонтальный шаг свертки (stride) заменяется с 2 на 1. Сохранение горизонтальной структуры признаковой карты является распространённым принципом проектирования специализированных HTR-архитектур </p>
			<p>[13][14][15][16]</p>
			<p>Сравнение различных CNN-backbone, включая, например, VGG-like, VGG-11, VGG-19, ConvNeXt и TrOCR, а также VAN выходит за рамки данной работы. В настоящей статье рассматривается архитектурная линия ResNet18-TE-CTC с экспериментальной вариацией геометрии горизонтального downsampling.</p>
			<p>Специфика распознавания рукописных документов накладывает жесткие ограничения на геометрию извлекаемых признаков. Это приводит к повышенной плотности информационных элементов на единицу длины горизонтальной оси W. Соответственно в классической архитектуре ResNet18 последовательное применение слоев Layer 3 и Layer 4 c двумерным шагом свертки stride = (2,2) приводит к изотропному сжатию пространственных размерностей входного тензора признаков:</p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:mi>X</mml:mi>
					<mml:mo>∈</mml:mo>
					<mml:msup>
						<mml:mi>R</mml:mi>
						<mml:mrow>
							<mml:mi>C</mml:mi>
							<mml:mi>×</mml:mi>
							<mml:mi>H</mml:mi>
							<mml:mi>×</mml:mi>
							<mml:mi>W</mml:mi>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<p> </p>
			<p>обуславливая уменьшение его разрешения в k раз по обеим осям с генерацией тензора</p>
			<p> </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>V</mml:mi>
						<mml:mrow>
							<mml:mi>s</mml:mi>
							<mml:mi>t</mml:mi>
							<mml:mi>d</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>∈</mml:mo>
					<mml:msup>
						<mml:mi>R</mml:mi>
						<mml:mrow>
							<mml:msup>
								<mml:mi>C</mml:mi>
								<mml:mrow>
									<mml:mi>′</mml:mi>
								</mml:mrow>
							</mml:msup>
							<mml:mi>×</mml:mi>
							<mml:mfrac>
								<mml:mrow>
									<mml:mi>H</mml:mi>
								</mml:mrow>
								<mml:mrow>
									<mml:mi>K</mml:mi>
								</mml:mrow>
							</mml:mfrac>
							<mml:mi>×</mml:mi>
							<mml:mfrac>
								<mml:mrow>
									<mml:mi>W</mml:mi>
								</mml:mrow>
								<mml:mrow>
									<mml:mi>K</mml:mi>
								</mml:mrow>
							</mml:mfrac>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<p> </p>
			<p>Для плотного и вариативного рукописного текста свертка с параметром stridex = 2 по горизонтальной оси может быть критичной, обуславливая избыточную субдискретизацию графем и связок с их необратимым смешением в рамках одного и того же вектора признаков. Учитывая возможность такого отклика в предлагаемой архитектуре MedForm-HTR в модуле ResNet18 Layer 3 и Layer 4 были модифицированы путем перехода к анизатропному шагу свертки: stride = (2,1). Это позволяет сохранить исходную дискретизацию по горизонтальной оси, формируя тензор признаков:</p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>V</mml:mi>
						<mml:mrow>
							<mml:mo>mod</mml:mo>
						</mml:mrow>
					</mml:msub>
					<mml:mo>∈</mml:mo>
					<mml:msup>
						<mml:mi>R</mml:mi>
						<mml:mrow>
							<mml:msup>
								<mml:mi>C</mml:mi>
								<mml:mrow>
									<mml:mi>′</mml:mi>
								</mml:mrow>
							</mml:msup>
							<mml:mi>×</mml:mi>
							<mml:mfrac>
								<mml:mrow>
									<mml:mi>H</mml:mi>
								</mml:mrow>
								<mml:mrow>
									<mml:mi>K</mml:mi>
								</mml:mrow>
							</mml:mfrac>
							<mml:mi>×</mml:mi>
							<mml:mi>W</mml:mi>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<p> </p>
			<p> </p>
			<p> </p>
			<p> </p>
			<p> </p>
			<p>Последующая операция вертикального пулинга трансформирует данный тензор в последовательность токенов для модуля TE, которые, в свою очередь, должны влиять на последовательность временных шагов Т, увеличивая пространственную дискретизацию вдоль оси написания текста и, соответственно, влиять на качество последующего CTC-распознавания. Данное влияние проявляется не напрямую, а через изменение геометрии карты признаков, поступающей из ResNet18 в TE и далее в CTC-блок.</p>
			<p>Действительно, пусть</p>
			<p>Win Missing Mark : sub— исходная ширина изображения рукописного поля;</p>
			<p>rxMissing Mark : sub — суммарный коэффициент горизонтального сжатия сверточного фронтенда;</p>
			<p>T — длина последовательности визуальных признаков, поступающей в TE и CTC-блок.</p>
			<p>Тогда приближенно можно записать:</p>
			<p> </p>
			<p>  Missing Mark : sub</p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:mi>T</mml:mi>
					<mml:mo>≈</mml:mo>
					<mml:mfrac>
						<mml:mrow>
							<mml:msub>
								<mml:mi>W</mml:mi>
								<mml:mrow>
									<mml:mi>i</mml:mi>
									<mml:mi>n</mml:mi>
								</mml:mrow>
							</mml:msub>
						</mml:mrow>
						<mml:mrow>
							<mml:msub>
								<mml:mi>r</mml:mi>
								<mml:mrow>
									<mml:mi>x</mml:mi>
								</mml:mrow>
							</mml:msub>
						</mml:mrow>
					</mml:mfrac>
				</mml:mrow>
			</mml:math>
			<p> </p>
			<p>То есть чем больше суммарное горизонтальное сжатие rxMissing Mark : sub, тем меньше временных шагов T получает CTC-блок. В стандартной конфигурации ResNet18 поздние блоки Layer 3 и Layer 4 уменьшают горизонтальное разрешение карты признаков. При замене горизонтального stride в этих блоках с 2 на 1 суммарное горизонтальное сжатие уменьшается, поэтому длина выходной последовательности признаков возрастает.</p>
			<p> </p>
			<p>Это можно записать так:</p>
			<p> </p>
			<p> Tmod Missing Mark : sub&gt; TstdMissing Mark : sub</p>
			<p> </p>
			<p>где:</p>
			<p>Tstd Missing Mark : sub— длина последовательности признаков в стандартной архитектуре ResNet18;</p>
			<p>TmodMissing Mark : sub — длина последовательности признаков после модификации stride в Layer 3 и Layer 4.</p>
			<p>Для CTC-декодирования увеличение T имеет принципиальное значение. Если целевая транскрипция содержит |Y| символов, то отношение количества символов к количеству временных шагов можно рассматривать как плотность символов на один временной шаг:</p>
			<p> </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:mi>ρ</mml:mi>
					<mml:mo>=</mml:mo>
					<mml:mfrac>
						<mml:mrow>
							<mml:mo stretchy="false">|</mml:mo>
							<mml:mi>Y</mml:mi>
							<mml:mo stretchy="false">|</mml:mo>
						</mml:mrow>
						<mml:mrow>
							<mml:mi>T</mml:mi>
						</mml:mrow>
					</mml:mfrac>
					<mml:mo>,</mml:mo>
				</mml:mrow>
			</mml:math>
			<p> </p>
			<p>где:</p>
			<p> </p>
			<p>ρ — плотность символов на временной шаг;</p>
			<p>|Y| — длина правильной текстовой строки в символах;</p>
			<p>T — число временных шагов на выходе сверточного фронтенда.</p>
			<p> </p>
			<p>При плотном рукописном заполнении медицинских полей значение ρ в стандартной архитектуре может становиться слишком высоким. Это означает, что на один временной шаг приходится слишком большая часть текстовой информации. В результате возрастает риск слияния соседних графем, пропуска символов и ошибок CTC-выравнивания.</p>
			<p>После модификации stride длина последовательности увеличивается:</p>
			<p> </p>
			<p> TmodMissing Mark : sub &gt; TstdMissing Mark : sub</p>
			<p> </p>
			<p>Следовательно, плотность символов уменьшается:</p>
			<p> </p>
			<p> ρmodMissing Mark : sub &lt; ρstdMissing Mark : sub</p>
			<p> </p>
			<p>Иными словами, модифицированная архитектура предоставляет CTC-блоку больше временных позиций для размещения символов целевой строки. Это расширяет пространство допустимых CTC-выравниваний и создает более благоприятные условия для корректного сопоставления визуальных признаков с текстовой транскрипцией.</p>
			<p>Дополнительно изменение stride влияет на геометрию рецептивного поля сверточного фронтенда. В стандартной конфигурации поздние блоки ResNet18 увеличивают не только размер рецептивного поля, но и эффективный шаг между соседними токенами по горизонтальной оси. В результате один визуальный токен может агрегировать информацию сразу от нескольких соседних рукописных символов. Для плотного медицинского почерка это повышает риск смешения графемных признаков.</p>
			<p>В модифицированном варианте горизонтальный эффективный шаг уменьшается, поэтому признаки становятся более локализованными вдоль оси письма. TE получает более детализированную последовательность токенов, а CTC-блок — больше возможностей для построения корректной траектории выравнивания между визуальными признаками и символами.</p>
			<p>В обобщенном виде аналитическая цепочка влияния модификации stride может быть представлена следующим образом:</p>
			<p> </p>
			<p>stridexMissing Mark : sub: 2 → 1 в Layer 3 и Layer 4</p>
			<p>↓</p>
			<p>уменьшается горизонтальное сжатие rxMissing Mark : sub</p>
			<p>↓</p>
			<p>увеличивается длина последовательности признаков T</p>
			<p>↓</p>
			<p>уменьшается плотность символов ρ</p>
			<p>↓</p>
			<p>CTC получает больше допустимых вариантов выравнивания</p>
			<p>↓</p>
			<p>снижается риск слияния и пропуска графем</p>
			<p>↓</p>
			<p>может снижаться CTC-Loss</p>
			<p>↓</p>
			<p>может снижаться CER (Character Error Rate, доля ошибок на уровне символов) и WER (Word Error Rate, доля ошибок на уровне слов).</p>
			<p> </p>
			<p>Данная зависимость не является строгой гарантией улучшения качества для любого входного изображения, поскольку итоговые метрики зависят от обученных параметров модели, качества разметки, вариативности почерка и условий обучения. Однако она формирует аналитически обоснованную гипотезу, которая проверена в данной работе.</p>
			<p>Кроме изменения шага сверток была проведена также адаптация ResNet18 под задачу извлечения признаков (а не классификации целых изображений): из оригинальной архитектуры backbone были исключены слои глобального усреднения (global average pooling) и полносвязный слой (fully connected), что позволило передавать пространственные карты признаков напрямую в блок TE и декодировать их с помощью CTC-Loss. Модифицированная архитектура ResNet18-TE-CTC представлена на рисунке 3.</p>
			<fig id="F3">
				<label>Figure 3</label>
				<caption>
					<p>Базовая модифицированная архитектура ResNet18-TE-CTC</p>
				</caption>
				<alt-text>Базовая модифицированная архитектура ResNet18-TE-CTC</alt-text>
				<graphic ns0:href="/media/images/2026-07-29/1703b2e7-af03-4bb0-8843-48806b978f31.png"/>
			</fig>
			<p>Экспериментальная </p>
			<p>На втором этапе планировалась пилотная проверка точности распознавания лучшей конфигурации модели на обезличенных фрагментах полей карт вызова СМП. Данный этап рассматривался как предварительная оценка переносимости архитектурной модификации на целевой медицинский домен, характеризующийся высокой плотностью рукописного текста, медицинскими сокращениями и числовыми клиническими показателями.</p>
			<p>В настоящем разделе основное внимание уделяется первому этапу эксперимента, поскольку именно на нём проверялась базовая архитектурная гипотеза: уменьшение горизонтального сжатия в ResNet18 должно увеличивать длину признаковой последовательности, поступающей в TE и CTC-блок, и тем самым улучшать условия CTC-выравнивания.</p>
			<p> </p>
			<p>2.1. Первый этап исследований. Датасет HKR и подготовка данных</p>
			<p>Для первого этапа эксперимента использовался датасет HKR (Handwritten Kazakh and Russian database), содержащий рукописные слова и строки на кириллице. Датасет HKR содержит более 1400 заполненных форм, примерно 63 000 предложений и свыше 715 000 символов, написанных около 200 разными людьми. Слова, формы и строки датасета представляют смесь русского (около 95%) и казахского (около 5%) языков на кириллице. Поскольку целевой областью исследования является русскоязычная медицинская документация, из набора данных были исключены образцы, содержащие специфические казахские символы. Это позволило сформировать русскоязычный кириллический поднабор, более близкий к будущей задаче распознавания карт вызова СМП (таблица 3).В эксперименте использовались строки, содержащие отдельные словосочетания (word-level) датасета HKR. Такой выбор позволил сосредоточиться именно на задаче HTR-распознавания рукописного фрагмента, не смешивая её с отдельной задачей сегментации строк, полей или страниц. Полные изображения форм HKR на данном этапе не использовались.</p>
			<table-wrap id="T3">
				<label>Table 3</label>
				<caption>
					<p>Количественное распределение датасета HKR по выборкам</p>
				</caption>
				<table>
					<tr>
						<td>Режим</td>
						<td>Тренировочная выборка</td>
						<td>Валидационная выборка</td>
						<td>Тестовая выборка</td>
					</tr>
					<tr>
						<td>Обучение</td>
						<td>50000</td>
						<td>6000</td>
						<td>6000</td>
					</tr>
				</table>
			</table-wrap>
			<p>Для всех запусков эксперимента применяли единое разбиение датасета на обучающую, валидационную и тестовую выборки. Это было необходимо для корректного сравнения стандартной и модифицированной конфигураций модели. Обучающая выборка применялась для оптимизации параметров модели, валидационная — для контроля сходимости и выбора лучшего сохраненного состояния модели (checkpoint), тестовая — для финальной оценки качества распознавания.</p>
			<p>Предварительная обработка изображений включала перевод в полутоновый формат, масштабирование по высоте с сохранением аспектного соотношения, дополнение до унифицированного размера (padding) по ширине и нормализацию значений пикселей. Для совместимости с ImageNet-инициализированным ResNet18 одноканальные изображения при необходимости дублировались в три канала. Аугментации применялись только к обучающей выборке и не использовались на validation/test, чтобы не искажать оценку качества.</p>
			<p>В качестве аугментаций использовались слабые преобразования, сохраняющие читаемость текста: аффинные преобразования, изменение яркости и контраста, слабое размытие, гауссовский шум и эластическая деформация. Все аугментации выполнялись в режиме «на лету» (on-the-fly) при формировании обучающих батчей (рисунок 4).</p>
			<fig id="F4">
				<label>Figure 4</label>
				<caption>
					<p>Пример аугментированных изображений HKR</p>
				</caption>
				<alt-text>Пример аугментированных изображений HKR</alt-text>
				<graphic ns0:href="/media/images/2026-07-30/6f4ec035-bc34-438d-87dc-6191d3e4054f.png"/>
			</fig>
			<p>В эксперименте сравнивались две принципиальные конфигурации модели:</p>
			<p>- стандартная ResNet18-TE-CTC (далее «стандарт»);</p>
			<p>- модифицированная ResNet18-TE-CTC, в которой в Layer 3 и Layer 4 горизонтальный stride был изменён с 2 на 1 (далее «модифицированная»).</p>
			<p>Стандартная модель рассматривалась как контрольная конфигурация, отражающая прямое применение ResNet18-фронтенда к задаче HTR. Модифицированная модель рассматривалась как проверка аналитической гипотезы о необходимости сохранения горизонтального разрешения для CTC-распознавания.</p>
			<p>Из классификационной версии ResNet18 были удалены global average pooling и fully connected слой, поскольку в задаче HTR требуется не классификация изображения целиком, а получение пространственной карты признаков. Далее карта признаков преобразовывалась в последовательность токенов вдоль горизонтальной оси изображения и передавалась в Transformer Encoder.</p>
			<p> </p>
			<p>Качество распознавания оценивалось по метрикам CER, WER и Word Exact Match (WEM, доля полностью совпадающих слов). CER использовался как основная метрика, поскольку он отражает долю ошибок на уровне символов и особенно важен для кириллического рукописного текста, где ошибка в одной букве или цифре может существенно изменить значение результата. WER применялась как дополнительная метрика, оценивающая ошибки на уровне целого слова. Для word-level датасета HKR эта метрика позволяет оценить, насколько часто модель ошибается при распознавании всего рукописного слова. Word Exact Match рассчитывался как доля слов, распознанных полностью правильно. Эта метрика является наиболее строгой, поскольку даже одна ошибка в символе делает всё слово неверно распознанным.</p>
			<p> </p>
			<p>Обучение моделей проводилось в среде PyTorch. На этапе обучения модель переводилась в режим model.train(), а на этапах валидации и тестирования — в режим model.eval(). При валидации и тестировании вычисление градиентов отключалось, а аугментации не применялись. Для контроля процесса обучения после каждой эпохи фиксировались значения train CTC loss, validation CTC loss, validation CER и validation WER. Лучший checkpoint выбирался по минимальному значению validation CER. Такой критерий был выбран потому, что CER является основной метрикой качества для HTR и более устойчиво отражает посимвольное качество распознавания, чем WER на малых выборках.</p>
			<p>Для предотвращения переобучения применялся контроль качества на validation-наборе. Если train loss продолжал снижаться, а validation loss или validation CER переставали улучшаться, это рассматривалось как признак переобучения. Финальная оценка выполнялась на test-наборе только после выбора лучшего checkpoint по validation CER.</p>
			<p>Кроме основной модификации, для стандартной модели были выполнены несколько контрольных запусков с изменением параметров обучения и регуляризации. Эти запуски были необходимы для проверки возможности улучшения метрик распознавания в стандартной архитектуре за счёт настройки гиперпараметров без изменения геометрии ResNet18-фронтенда. Изменяемые настройки обучения и диапазон их варьирования показан в таблице 4.</p>
			<table-wrap id="T4">
				<label>Table 4</label>
				<caption>
					<p>Основные гиперпараметры обучения исследуемых конфигураций модели</p>
				</caption>
				<table>
					<tr>
						<td>Конфигурация модели</td>
						<td>Dropout (метод регуляризации)</td>
						<td>Learning Rate (скорость обучения)</td>
						<td>Warmup epochs (число эпох прогрева)</td>
						<td>Weight decay (квадратичная регуляризация весов)</td>
						<td>Early Stoppin (ранняя остановка)</td>
					</tr>
					<tr>
						<td>Стандартная модель*</td>
						<td>0,1</td>
						<td> </td>
						<td>отсутствует</td>
						<td>-4</td>
						<td>не реализована</td>
					</tr>
					<tr>
						<td>Оптимизированная модель</td>
						<td>0,3</td>
						<td> </td>
						<td>3 эпохи</td>
						<td>-4</td>
						<td>7 эпох</td>
					</tr>
				</table>
			</table-wrap>
			<p>Таким образом, значительное улучшение результатов обучения оптимизированной стандартной модели обусловлено комплексным подходом к настройке гиперпараметров: дифференцированным learning rate для backbone и head, внедрением warmup-периода, усиленной регуляризацией (dropout, weight decay, early stopping) и использованием аугментации данных. Эти изменения позволили достичь более стабильной сходимости и лучшего качества распознавания.</p>
			<p> </p>
			<p>В ходе настройки стандартной конфигурации ResNet18-TE-CTC качество распознавания на HKR улучшилось более чем на 40%, тем не менее изменение параметров обучения и регуляризации, хотя заметно и повлияло на динамику train loss, validation loss, CER и WER, однако не привело к качественному улучшению итоговой посимвольной точности. Лучшее значение CER для оптимизированной стандартной конфигурации составило 0.18. Это подтвердило предположение о том, что основное ограничение стандартной модели связано не только с настройками оптимизации, но и с геометрией признаковой карты, формируемой ResNet18. При стандартном горизонтальном сжатии выходная последовательность признаков оказывается слишком короткой для CTC-выравнивания плотных рукописных фрагментов.</p>
			<p>Далее для ResNet18 были использованы настройки ее оптимизированной стандартной модели (базовая модель) и проведена модификация, заключающаяся в замене горизонтального stride в Layer 3 и Layer 4 с 2 на 1, в связи с чем качество распознавания существенно улучшилось (таблица 5). Таким образом, модифицированная модель достигла CER = 0.053 и по сравнению с базовой моделью относительное снижение CER составило около 70% (рисунок 5, таблица 5).</p>
			<fig id="F5">
				<label>Figure 5</label>
				<caption>
					<p>Динамика контролируемых параметров в процессе обучения базовой и модифицированной моделей</p>
				</caption>
				<alt-text>Динамика контролируемых параметров в процессе обучения базовой и модифицированной моделей</alt-text>
				<graphic ns0:href="/media/images/2026-07-30/f7e87d73-f3ea-4d30-9185-7503a7713308.png"/>
			</fig>
			<table-wrap id="T5">
				<label>Table 5</label>
				<caption>
					<p>Результаты первого этапа испытаний архитектурного модуля MedForm-HTR</p>
				</caption>
				<table>
					<tr>
						<td>Конфигурация</td>
						<td>in</td>
						<td>x</td>
						<td>T</td>
						<td>CER</td>
						<td>WER</td>
						<td>WEM</td>
					</tr>
					<tr>
						<td>Базовая ResNet18</td>
						<td>1024</td>
						<td>32</td>
						<td>32</td>
						<td>0,18</td>
						<td>0,52</td>
						<td>0,38</td>
					</tr>
					<tr>
						<td>ResNet18 c модифицированным горизонтальным шагом</td>
						<td>1024</td>
						<td>8</td>
						<td>128</td>
						<td>0,053</td>
						<td>0,22</td>
						<td>0,69</td>
					</tr>
				</table>
			</table-wrap>
			<p>Анализ распознавания моделями тестовой выборки показал сильные стороны и зоны уязвимости модифицированной модели: модель хорошо справляется со сложными и длинными топонимами (написанными капсом или с дефисами), а также с целыми фразами (рисунок 6). Ошибки, которые модель все же допускает, носят локальный характер и связаны с оптическим сходством начертания букв (визуальная двусмысленность) или перекрытием буквами соседних зон других букв (лигатура).</p>
			<fig id="F6">
				<label>Figure 6</label>
				<caption>
					<p>Примеры распознавания из тестовой выборки датасета HKR</p>
				</caption>
				<alt-text>Примеры распознавания из тестовой выборки датасета HKR</alt-text>
				<graphic ns0:href="/media/images/2026-07-30/8bdf4987-bc29-46f8-9417-f36bdae60842.png"/>
			</fig>
			<p> </p>
			<p>Второй этап эксперимента был направлен на оценку эффективности модифицированной архитектуры ResNet18-TE-CTC к доменной адаптации медицинской документации (карты вызовов СМП) и в точности ее распознавания.</p>
			<p>Для пилотного датасета было отобрано 630 карт вызовов СМП, которые заполнялись 12 различными бригадами скорой медицинской помощи в среднем в течение 5 рабочих смен каждой из них. Для формирования датасета из карт вызовов СМП было выбрано 4 различных по содержанию поля (таблица 1), включающие как сверхплотный рукописный текст (поле 20. Жалобы) с элементами сокращений и аббревиатур (поле 21. Анамнез), так и медицинскую метрику (поле 22), а также поле, включающее специфические медицинские мероприятия (поле 26. Оказание помощи на месте вызова). Для поля Жалобы и Анамнез, учитывая специфику поля в качестве единиц обучения выбирались отдельные строки, содержащие от 15 до 30 символов, для более коротких полей (поля 22 и 26) бралось поле целиком. Единицей распознавания в пилотном датасете, таким образом, в целом, являлся не весь документ и не всё многострочное поле целиком, а вырезанные фрагменты строк или короткие числовые поля. Такой подход согласует целевой медицинский датасет с последовательностной природой CTC-модели и снижает риск чрезмерного увеличения длины входной последовательности.</p>
			<p>В результате было подготовлено 2520 строк, включающих по одной строке из каждого поля карты, при этом в валидационную и тестовую выборки не входили поля из карт, подготовленных для тренировочной выборки (таблица 6).</p>
			<table-wrap id="T6">
				<label>Table 6</label>
				<caption>
					<p>Количественное распределение пилотного датасета</p>
				</caption>
				<table>
					<tr>
						<td>Режим</td>
						<td>Тренировочная выборка (строки)</td>
						<td>Валидационная выборка (строки)</td>
						<td>Тестовая выборка (строки)</td>
					</tr>
					<tr>
						<td>Обучение</td>
						<td>2000</td>
						<td>260</td>
						<td>260</td>
					</tr>
				</table>
			</table-wrap>
			<p> </p>
			<p>3. Основные результаты</p>
			<p>Кроме ранее использованных метрик, применяемых на первом этапе эксперимента для оценки полей, содержащих числовые характеристики, использовалась метрика Digit CER (Character Error Rate, коэффициент ошибок для цифр) и Digit EМ (Exact Match, доля полностью совпадающих цифр). Объем и режим аугментации при обучении на тренировочной выборке для пилотного датасета и HKR были идентичными. Кроме основной модифицированной модели ResNet18-TE-CTC, обученной на HKR, в эксперименте участвовала также стандартная модель ResNet18-TE-CTC с оптимизированной настройкой (таблица 4), также обученная на HKR. На втором этапе эксперимента использовались гиперпараметры обучения, соответствующие оптимизированной конфигурации, представленной в таблице 4.</p>
			<p>Второй этап эксперимента включал обучение на пилотном датасете предобученных на HKR стандартной и модифицированной моделей. Также была проведена оценка распознавания модифицированной моделью тестовой выборки пилотного датасета без ее предобучения на данном датасете. Результаты данной серии экспериментов показаны в таблице 7.</p>
			<table-wrap id="T7">
				<label>Table 7</label>
				<caption>
					<p>Результаты пилотных испытаний на картах вызовов СМП</p>
				</caption>
				<table>
					<tr>
						<td>Модель</td>
						<td>Поле</td>
						<td>CER</td>
						<td>WER</td>
						<td>Digit CER</td>
						<td>Digit EM</td>
					</tr>
					<tr>
						<td> </td>
						<td>01 — жалобы</td>
						<td>0,5052</td>
						<td>0,9275</td>
						<td>-</td>
						<td>-</td>
					</tr>
					<tr>
						<td>02 — цифровые показатели</td>
						<td>0,9665</td>
						<td>1,0002</td>
						<td>1,0000</td>
						<td>0,0000</td>
					</tr>
					<tr>
						<td>03 — анамнез</td>
						<td>0,5698</td>
						<td>0,9898</td>
						<td>-</td>
						<td>-</td>
					</tr>
					<tr>
						<td>04 — мероприятия</td>
						<td>0,6574</td>
						<td>0,9987</td>
						<td>1,0000</td>
						<td>0,0000</td>
					</tr>
					<tr>
						<td>Модифицированная, обученная на HKR + СМП</td>
						<td>01 — жалобы</td>
						<td>0,0924</td>
						<td>0,3511</td>
						<td>-</td>
						<td>-</td>
					</tr>
					<tr>
						<td>02 — цифровые показатели</td>
						<td>0,0566</td>
						<td>0,2359</td>
						<td>0,0776</td>
						<td>0,8443</td>
					</tr>
					<tr>
						<td>03 — анамнез</td>
						<td>0,0939</td>
						<td>0,3568</td>
						<td>-</td>
						<td>-</td>
					</tr>
					<tr>
						<td>04 — мероприятия</td>
						<td>0,1021</td>
						<td>0,3879</td>
						<td>0,1150</td>
						<td>0,7500</td>
					</tr>
					<tr>
						<td>Модифицированная, обученная на HKR без предобучения на картах СМП </td>
						<td>01 — жалобы</td>
						<td>0,3895</td>
						<td>0,8756</td>
						<td>-</td>
						<td>-</td>
					</tr>
					<tr>
						<td>02 — цифровые показатели</td>
						<td>0,9139</td>
						<td>1,0000</td>
						<td>1,0000</td>
						<td>0,0000</td>
					</tr>
					<tr>
						<td>03 — анамнез</td>
						<td>0,4032</td>
						<td>0,9695</td>
						<td>-</td>
						<td>-</td>
					</tr>
					<tr>
						<td>04 — мероприятия</td>
						<td>0,5101</td>
						<td>1,0000</td>
						<td>1,0000</td>
						<td>0,0000</td>
					</tr>
				</table>
			</table-wrap>
			<p>Обобщённые показатели качества распознавания на пилотном датасете для модифицированной, обученной на HKR+СМП модели составили CER = 0,0922 и WER = 0,3475, что отражает среднюю точность модели по четырём рукописным полям. Агрегация выполнялась путём суммирования ошибок и эталонных символов/слов по всем полям датасета.</p>
			<p>Пилотная проверка на пилотном датасете показала, что модифицированная архитектура ResNet18-TE-CTC значительно превосходит стандартную конфигурацию и модель, обученную только на HKR. Наилучшие результаты были получены после дополнительного обучения на выделенных фрагментах полей карт СМП. Особенно важным является результат по цифровым значениям, где Digit Exact Match достиг 0,8443.</p>
			<p>Кроме данных пилотных испытаний была проведена оценка влияния разлиновки карт СМП на точность распознавания. Сравнивались обобщенные показатели CER и WER для модифицированной, обученной на HKR+СМП модели до удаления разлиновки и после удаления. Горизонтальные линии бланка выделялись на основании их цветовых и геометрических характеристик, при этом сформированная маска разлиновки использовалась для удаления соответствующих пикселей с последующим локальным восстановлением фоновой области методом inpainting. Полученные результаты показали, что устранения разлиновки практически не повлияло на точность распознавания: общий CER после разлиновки составил 0,0918, а WER — 0,3367. Сравнение исходных и обработанных изображений также не выявило существенного улучшения показателей распознавания, поэтому процедура удаления разлиновки не будет включена в обязательный вариант конвейера MedForm-HTR.</p>
			<p> </p>
			<p> </p>
			<p>Анализ допускаемых модифицированной моделью ошибок показал, что большая их часть обусловлена спецификой почерка и его плотностью, так как высота поля строки составляет всего 3 мм, а наличие соседних строк предполагает еще меньшую рабочую высоту строки, иначе соседние строки будут перекрываться, что сделает невозможным прочтение текста даже человеком (рисунок 7).</p>
			<fig id="F7">
				<label>Figure 7</label>
				<caption>
					<p>Типичные ошибки в распознавании строк полей карт вызовов СМП</p>
				</caption>
				<alt-text>Типичные ошибки в распознавании строк полей карт вызовов СМП</alt-text>
				<graphic ns0:href="/media/images/2026-07-30/03742782-392a-45ef-8150-d1b92dcd40bf.png"/>
			</fig>
			<p>Таким образом, пилотные исследования показали, что данные датасета HKR существенно отличаются от реальных карт вызова СМП (так называемый доменный сдвиг). Это подтверждает необходимость дообучения модели на целевом типе документов и демонстрирует преимущество модифицированной архитектуры ResNet18-TE-CTC для распознавания выделенных фрагментов медицинских полей в картах вызова СМП.</p>
			<p> </p>
			<p>Проведённые пилотные исследования подтвердили принципиальную применимость модифицированной архитектуры ResNet18-TE-CTC для распознавания рукописных полей карт скорой медицинской помощи. Наилучшие результаты были получены после предметно-ориентированного дообучения модели на целевых изображениях: общий CER составил 0,0922, WER — 0,3475, а Digit CER для поля цифровых показателей — 0,0776. Полученные данные показывают, что адаптация к структуре документа, характеру медицинского почерка и особенностям заполнения бланков является необходимым условием создания прикладной HTR-системы.</p>
			<p>Вместе с тем пилотное исследование выявило ряд ограничений, включая сравнительно более высокую ошибку в многострочных текстовых полях, возможное влияние элементов соседних строк, ограниченность объёма и разнообразия предметной выборки, а также отсутствие языкового медицинского постобрабатывания. Дальнейшее развитие MedForm-HTR предполагает расширение и внешнюю валидацию датасета, архитектурное сравнение, изоляцию целевых строк, применение медицинского словаря и предметной языковой модели, а также оценку достоверности и ручную проверку критичных результатов.</p>
			<p>4. Обсуждение</p>
			<p>Таким образом, научный вклад работы заключается в аналитическом обосновании и экспериментальной проверке адаптации ResNet18 в составе гибридной архитектуры (ResNet18-TE-CTC) к задаче распознавания рукописного кириллического текста, что позволило снизить CER на 70% по сравнению с базовой конфигурацией.</p>
			<p>В отличие от специализированных CNN-CTC архитектур, где параметры сжатия учитываются при проектировании, для ResNet18 требуется дополнительная настройка. Контролируемое исследование показало, что изменение шага свёртки в слоях Layer 3 и Layer 4 с 2 на 1 улучшает качество распознавания за счёт оптимизации выходной последовательности признаков.</p>
			<p>Пилотная проверка на фрагментах карт СМП подтвердила эффективность предложенного подхода.</p>
			<p>5. Заключение</p>
			<p>Полученные результаты дают все основания считать модифицированную гибридную архитектуру ResNet18-TE-CTC как перспективную модель для HTR-модуля разрабатываемой интеллектуальной системы MedForm-HTR. Анализ полученных результатов исследований показывает, что для успешной реализации данной системы требуется дальнейшая оптимизация и развития как самой модели HTR-модуля, так и всего процесса обработки документа, включая приём скана, предобработку, определение типа страницы, выравнивание, выделение полей, разбиение строк, их классификацию, HTR-распознавание, OCR, OMR и верификацию.</p>
			<p>В соответствии с этим основные направления совершенствования системы будут включать:</p>
			<p>- расширение набора медицинских документов с разнообразием почерков и типов записей;</p>
			<p>- исследование подходов к оценке качества распознавания: как для конкретных специалистов, так и для общей применимости;</p>
			<p>- улучшение выделения текстовых строк в многострочных полях;</p>
			<p>- оптимизация обработки границ фрагментов и отступов для повышения точности распознавания;</p>
			<p>- разработка методов подавления помех от посторонних элементов;</p>
			<p>- внедрение специальных преобразований изображений, учитывающих особенности медицинских документов;</p>
			<p>- совершенствование алгоритмов распознавания с использованием медицинского словаря и правил проверки;</p>
			<p>- создание системы оценки достоверности результатов с передачей сложных случаев на проверку оператору.</p>
			<p>Таким образом, планируется подготовка системы MedForm-HTRдо полноценного решения задач по обработке медицинских документов (карты вызовов СМП и др.), включающих распознавание текста, анализ структуры документа и контроль качества получаемых результатов.</p>
		</sec>
		<sec sec-type="supplementary-material">
			<title>Additional File</title>
			<p>The additional file for this article can be found as follows:</p>
			<supplementary-material xmlns:xlink="http://www.w3.org/1999/xlink" id="S1" xlink:href="https://doi.org/10.5334/cpsy.78.s1">
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://research-journal.org/media/articles/26907.docx">26907.docx</inline-supplementary-material>]-->
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://research-journal.org/media/articles/26907.pdf">26907.pdf</inline-supplementary-material>]-->
				<label>Online Supplementary Material</label>
				<caption>
					<p>
						Further description of analytic pipeline and patient demographic information. DOI:
						<italic>
							<uri>https://doi.org/10.60797/IRJ.2026.171.59</uri>
						</italic>
					</p>
				</caption>
			</supplementary-material>
		</sec>
	</body>
	<back>
		<ack>
			<title>Acknowledgements</title>
			<p>Благодарим коллектив редакции.</p>
		</ack>
		<sec>
			<title>Competing Interests</title>
			<p/>
		</sec>
		<ref-list>
			<ref id="B1">
				<label>1</label>
				<mixed-citation publication-type="confproc">AlKendi W. Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey / W. AlKendi, F. Gechter, L. Heyberger [et al.] // Journal of Imaging. — 2024. — Vol. 10, No. 1. — Art. 18. — DOI: 10.3390/jimaging10010018.</mixed-citation>
			</ref>
			<ref id="B2">
				<label>2</label>
				<mixed-citation publication-type="confproc">Bluche T. Scan, Attend and Read: End-to-End Handwritten Paragraph Recognition with MDLSTM Attention / T. Bluche, J. Louradour, R. Messina // 2017 14th IAPR International Conference on Document Analysis and Recognition (ICDAR). — Kyoto, Japan, 2017. — P. 1050–1055. — DOI: 10.1109/ICDAR.2017.174.</mixed-citation>
			</ref>
			<ref id="B3">
				<label>3</label>
				<mixed-citation publication-type="confproc">Coquenet D. DAN: A Segmentation-Free Document Attention Network for Handwritten Document Recognition / D. Coquenet, C. Chatelain, T. Paquet // IEEE Transactions on Pattern Analysis and Machine Intelligence. — 2023. — Vol. 45, No. 7. — P. 8227–8243. — DOI: 10.1109/TPAMI.2023.3235826.</mixed-citation>
			</ref>
			<ref id="B4">
				<label>4</label>
				<mixed-citation publication-type="confproc">Shi B. An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition / B. Shi, X. Bai, C. Yao // IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). — 2017. — Vol. 39, No. 11. — P. 2221–2235. — DOI: 10.1109/TPAMI.2016.2646371.</mixed-citation>
			</ref>
			<ref id="B5">
				<label>5</label>
				<mixed-citation publication-type="confproc">Li Y. HTR-VT: Handwritten Text Recognition with Vision Transformer / Y. Li, D. Chen, T. Tang [et al.] // Pattern Recognition. — 2025. — Vol. 158. — Art. 110967. — DOI: 10.1016/j.patcog.2024.110967.</mixed-citation>
			</ref>
			<ref id="B6">
				<label>6</label>
				<mixed-citation publication-type="confproc">Wick C. Transformer for Handwritten Text Recognition Using Bidirectional Post-Decoding / C. Wick, J. Zöllner, T. Grüning // Document Analysis and Recognition — ICDAR 2021. Lecture Notes in Computer Science. — Vol. 12823. — Springer, Cham, 2021. — P. 112–126. — DOI: 10.1007/978-3-030-86334-0_8.</mixed-citation>
			</ref>
			<ref id="B7">
				<label>7</label>
				<mixed-citation publication-type="confproc">Li M. TrOCR: Transformer-based optical character recognition with pre-trained models / M. Li, T. Lv, J. Chen [et al.] // Proceedings of the AAAI Conference on Artificial Intelligence. — 2023. — Vol. 37, No. 11. — P. 13094–13102. — DOI: 10.1609/aaai.v37i11.26538.</mixed-citation>
			</ref>
			<ref id="B8">
				<label>8</label>
				<mixed-citation publication-type="confproc">Coquenet D. End-to-end handwritten text line recognition with attention-based recurrent neural networks / D. Coquenet, C. Chatelain, T. Paquet // Pattern Recognition. — 2023. — Vol. 138. — Art. 109389. — DOI: 10.1016/j.patcog.2023.109389.</mixed-citation>
			</ref>
			<ref id="B9">
				<label>9</label>
				<mixed-citation publication-type="confproc">Kang L. Pay Attention to What You Read: Non-Recurrent Handwritten Text-Line Recognition / L. Kang, P. Riba, M. Rusinol [et al.] // Pattern Recognition. — 2022. — Vol. 129. — Art. 108766. — DOI: 10.1016/j.patcog.2022.108766.</mixed-citation>
			</ref>
			<ref id="B10">
				<label>10</label>
				<mixed-citation publication-type="confproc">Coquenet D. Recurrence-Free Unconstrained Handwritten Text Recognition Using Gated Fully Convolutional Network / D. Coquenet, C. Chatelain, T. Paquet // 2020 17th International Conference on Frontiers in Handwriting Recognition (ICFHR). — Dortmund, Germany, 2020. — P. 19–24. — DOI: 10.1109/ICFHR2020.2020.00015.</mixed-citation>
			</ref>
			<ref id="B11">
				<label>11</label>
				<mixed-citation publication-type="confproc">Vaswani A. Attention is all you need / A. Vaswani, N. Shazeer, N. Parmar [et al.] // Advances in Neural Information Processing Systems 30 (NeurIPS, 2017). — P. 5998–6008.</mixed-citation>
			</ref>
			<ref id="B12">
				<label>12</label>
				<mixed-citation publication-type="confproc">Atienza R. Vision Transformer for fast and efficient scene text recognition / R. Atienza // Document Analysis and Recognition — ICDAR 2021. — Springer, Cham, 2021. — P. 319–334. — DOI: 10.1007/978-3-030-86330-2_21.</mixed-citation>
			</ref>
			<ref id="B13">
				<label>13</label>
				<mixed-citation publication-type="confproc">Michael J. Evaluating sequence-to-sequence models for handwritten text recognition / J. Michael, R. Labahn, J. Zöllner [et al.] // 2019 International Conference on Document Analysis and Recognition (ICDAR). — IEEE, 2019. — P. 1286–1293. — DOI: 10.1109/ICDAR.2019.00208.</mixed-citation>
			</ref>
			<ref id="B14">
				<label>14</label>
				<mixed-citation publication-type="confproc">Yousef M. OrigamiNet: Weakly-Supervised, Segmentation-Free, One-Step, Full Page Text Recognition by Learning to Unfold / M. Yousef, T.E. Bishop // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). — Seattle, WA, USA, 2020. — P. 14710–14719.</mixed-citation>
			</ref>
			<ref id="B15">
				<label>15</label>
				<mixed-citation publication-type="confproc">Puigcerver J. Are Multidimensional Recurrent Layers Really Necessary for Handwritten Text Recognition? / J. Puigcerver // 2017 14th IAPR International Conference on Document Analysis and Recognition (ICDAR). — Kyoto, Japan, 2017. — P. 67–72. — DOI: 10.1109/ICDAR.2017.20.</mixed-citation>
			</ref>
			<ref id="B16">
				<label>16</label>
				<mixed-citation publication-type="confproc">Tabzaoui A. Validated and Decoding-Aware CNN-Transformer-CTC Framework for Multi-Font Printed Arabic Word Recognition / A. Tabzaoui, L. Chakir // Applied Sciences. — 2026. — Vol. 16. — Art. 4071. — DOI: 10.3390/app16094071.</mixed-citation>
			</ref>
		</ref-list>
	</back>
	<fundings/>
</article>