<?xml version="1.0" encoding="UTF-8"?>
    <!DOCTYPE article PUBLIC "-//NLM/DTD JATS (Z39.96) Journal Publishing DTD v1.2 20120330//EN" "http://jats.nlm.nih.gov/publishing/1.2/JATS-journalpublishing1.dtd">
    <!--<?xml-stylesheet type="text/xsl" href="article.xsl">-->
<article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" article-type="research-article" dtd-version="1.2" xml:lang="en">
	<front>
		<journal-meta>
			<journal-id journal-id-type="issn">2303-9868</journal-id>
			<journal-id journal-id-type="eissn">2227-6017</journal-id>
			<journal-title-group>
				<journal-title>Международный научно-исследовательский журнал</journal-title>
			</journal-title-group>
			<issn pub-type="epub">2303-9868</issn>
			<publisher>
				<publisher-name>ООО Цифра</publisher-name>
			</publisher>
		</journal-meta>
		<article-meta>
			<article-id pub-id-type="doi">10.60797/IRJ.2026.170.48</article-id>
			<article-categories>
				<subj-group>
					<subject>Brief communication</subject>
				</subj-group>
			</article-categories>
			<title-group>
				<article-title>Модифицированный Mamba-контроллер с семантической адаптацией для дифференцируемой регистрации лиц в интеллектуальных транспортных системах</article-title>
			</title-group>
			<contrib-group>
				<contrib contrib-type="author" corresp="yes">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-8443-3684</contrib-id>
					<contrib-id contrib-id-type="rinc">https://elibrary.ru/author_profile.asp?id=1095062</contrib-id>
					<name>
						<surname>Куликов</surname>
						<given-names>Александр Анатольевич</given-names>
					</name>
					<email>tibult41@gmail.com</email>
					<xref ref-type="aff" rid="aff-1">1</xref>
					<xref ref-type="aff" rid="aff-2">2</xref>
				</contrib>
			</contrib-group>
			<aff id="aff-1">
				<label>1</label>
				<institution>Научно-исследовательский и проектно-конструкторский институт информатизации, автоматизации и связи на железнодорожном транспорте</institution>
			</aff>
			<aff id="aff-2">
				<label>2</label>
				<institution>Финансовый университет</institution>
			</aff>
			<pub-date publication-format="electronic" date-type="pub" iso-8601-date="2026-08-17">
				<day>17</day>
				<month>08</month>
				<year>2026</year>
			</pub-date>
			<pub-date pub-type="collection">
				<year>2026</year>
			</pub-date>
			<volume>10</volume>
			<issue>170</issue>
			<fpage>1</fpage>
			<lpage>10</lpage>
			<history>
				<date date-type="received" iso-8601-date="2026-06-13">
					<day>13</day>
					<month>06</month>
					<year>2026</year>
				</date>
				<date date-type="accepted" iso-8601-date="2026-07-22">
					<day>22</day>
					<month>07</month>
					<year>2026</year>
				</date>
			</history>
			<permissions>
				<copyright-statement>Copyright: &amp;#x00A9; 2022 The Author(s)</copyright-statement>
				<copyright-year>2022</copyright-year>
				<license license-type="open-access" xlink:href="http://creativecommons.org/licenses/by/4.0/">
					<license-p>
						This is an open-access article distributed under the terms of the Creative Commons Attribution 4.0 International License (CC-BY 4.0), which permits unrestricted use, distribution, and reproduction in any medium, provided the original author and source are credited. See 
						<uri xlink:href="http://creativecommons.org/licenses/by/4.0/">http://creativecommons.org/licenses/by/4.0/</uri>
					</license-p>
					.
				</license>
			</permissions>
			<self-uri xlink:href="https://research-journal.org/archive/8-170-2026-august/10.60797/IRJ.2026.170.48"/>
			<abstract>
				<p>В работе рассматривается проблема накопления ошибок в классических двухэтапных конвейерах распознавания лиц. Проблема обусловлена разрывом графа вычислений между этапами геометрической регистрации и идентификации. Ошибка локализации ключевых точек необратимо снижает качество эмбеддинга, поскольку градиент функции потерь распознавания не передается модулю выравнивания. Этот эффект особенно критичен для видеоподсистем интеллектуальных транспортных систем (ИТС), функционирующих в условиях вибрации, переменного освещения и агрессивного сжатия видеопотока. Предложен модифицированный контроллер дифференцируемой регистрации на основе модели пространства состояний (State Space Model, SSM) архитектуры Mamba.Ключевой вклад — механизм семантической адаптации — обогащение последовательности 68 ключевых точек обучаемыми поточечными эмбеддингами их анатомической роли (зоны глаз, носа, рта, контура), type-conditioned селективность и иерархическая инициализация скоростей затухания скрытого состояния, согласованная со стабильностью анатомических зон. Контроллер интегрирован в единый дифференцируемый конвейер с CNN-энкодером MobileNetV3-Small и обучается end-to-end с регуляризованной функцией потерь, сочетающей ArcFace и геометрический штраф. На бенчмарке LFW модель показывает сопоставимую с современными решениями точность 99.89% при 1.6 млн параметров, 0.26 GFLOPs и времени инференса 4.3 мс; по предварительным данным (один прогон, seed=42) на авторском деградированном наборе (JPEG q=30, шум, аффинные искажения) она сохраняет 98.4% точности против 71.8% у канонической связки ArcFace+Dlib, что соответствует разрыву 26.6 процентного пункта. Сложность контроллера линейна по числу ключевых точек, что существенно для плотных схем разметки; при используемых 68 точках главный выигрыш составляют параметрическая эффективность и учет анатомической структуры.</p>
			</abstract>
			<kwd-group>
				<kwd>Mamba</kwd>
				<kwd> State Space Models</kwd>
				<kwd> дифференцируемая регистрация</kwd>
				<kwd> распознавание лиц</kwd>
				<kwd> семантическая адаптация</kwd>
				<kwd> анатомические эмбеддинги</kwd>
				<kwd> type-conditioned селективность</kwd>
				<kwd> интеллектуальные транспортные системы</kwd>
				<kwd> робастность к JPEG-сжатию</kwd>
				<kwd> edge-устройства</kwd>
			</kwd-group>
		</article-meta>
	</front>
	<body>
		<sec>
			<title>HTML-content</title>
			<p>1. Введение</p>
			<p>Обеспечение безопасности на объектах транспортной инфраструктуры все чаще связывают с переходом от реактивных мер к превентивному непрерывному мониторингу. Видеоподсистемы интеллектуальных транспортных систем (ИТС) — бортовые и салонные камеры мониторинга состояния водителя, терминалы биометрического контроля доступа, камеры пропускных и досмотровых пунктов — функционируют в существенно более тяжелых условиях, чем офисные сценарии. Например, низкая и переменная освещенность, вибрация, смаз от движения, загрязнение оптики и агрессивное сжатие видеопотока в каналах ограниченной пропускной способности </p>
			<p>[1][2][3][4][5]</p>
			<p>Современные системы распознавания лиц достигли высокой точности на стандартных бенчмарках, однако в подавляющем большинстве строятся по двухэтапной схеме: детекция и геометрическое выравнивание лица по ключевым точкам, а затем — извлечение эмбеддинга и его сравнение с эталонами. Такая декомпозиция упрощает разработку, но порождает разрыв вычислительного графа между этапами: первый выступает «черным ящиком» для второго, и ошибки локализации ключевых точек на 2–5 пикселей, неизбежные при плохом освещении, закрытии лица или сильном ракурсе, приводят к некорректному аффинному преобразованию и каскадно переносятся на распознавание. Поскольку градиент от функции потерь идентификации не распространяется к модулю регистрации, эти искажения не компенсируются, а накапливаются </p>
			<p>[6]</p>
			<p>Радикальным решением является переход к дифференцируемым (end–to–end) конвейерам, где параметры геометрической трансформации оптимизируются совместно с задачей распознавания. Базовая идея восходит к Spatial Transformer Networks (STN) </p>
			<p>[7][8][9]</p>
			<p>В последние годы модели пространства состояний (State Space Models, SSM), прежде всего архитектура Mamba </p>
			<p>[10]</p>
			<p>2. Обзор
современных методов</p>
			<p>Эволюция методов распознавания лиц прошла путь от ручных геометрических и статистических признаков (Eigenfaces, Fisherfaces) и эластичных графов к глубоким сверточным сетям (DeepFace, FaceNet). Качественный скачок обеспечили функции потерь с угловым маржином (ArcFace </p>
			<p>[11]</p>
			<p>Парадигма дифференцируемой регистрации устраняет этот разрыв, превращая геометрическое выравнивание из внешнего автономного алгоритма во встроенный обучаемый модуль. Первым и наиболее влиятельным шагом стала работа над STN </p>
			<p>[7][9][8]</p>
			<p>Модели пространства состояний предлагают иную алгоритмическую основу: последовательность описывается рекуррентным скрытым состоянием, кодирующим долгосрочные зависимости с линейной сложностью </p>
			<p>[12][10][13]</p>
			<p>В компьютерном зрении SSM адаптированы как самостоятельный визуальный backbone (опорную сеть): Vision Mamba </p>
			<p>[14][15]</p>
			<p>Таким образом, ни один из существующих подходов не обеспечивает одновременно высокой точности, вычислительной эффективности и робастности к геометрическим искажениям в условиях неконтролируемой съемки, а гибридные CNN-SSM архитектуры, явно спроектированные для совместной дифференцируемой регистрации и распознавания лиц, в литературе не описаны: существующие гибриды заменяют внимание в задачах классификации и сегментации общего назначения, не интегрируя геометрическое выравнивание. Этот научный пробел определяет постановку настоящего исследования.</p>
			<p>3. Математическая
модель семантически адаптированного SSM</p>
			<p>Для устранения указанного пробела сначала формализуем дифференцируемую регистрацию, а затем введем семантически адаптированную SSM, управляющую ее параметрами. Пусть входное изображение лица задается тензором [LATEX_FORMULA]I \in \mathbb{R}^{H \times W \times C}[/LATEX_FORMULA]. Цель  получить нормализованное представление, инвариантное к аффинным искажениям, но сохраняющее семантические особенности лица; в отличие от классического подхода, где выравнивание выполняется внешним алгоритмом, весь процесс полностью дифференцируем. Параметры аффинного преобразования предсказываются обучаемым локализатором [LATEX_FORMULA]\theta=f_{l o c}(I ; \varphi)[/LATEX_FORMULA], где [LATEX_FORMULA]\theta \in \mathbb{R}^{6}[/LATEX_FORMULA] </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:mi>T</mml:mi>
					<mml:mo stretchy="false">(</mml:mo>
					<mml:mi>θ</mml:mi>
					<mml:mo stretchy="false">)</mml:mo>
					<mml:mo>=</mml:mo>
					<mml:mrow>
						<mml:mo stretchy="true" fence="true" form="prefix">[</mml:mo>
						<mml:mtable>
							<mml:mtr>
								<mml:mtd columnalign="left">
									<mml:msub>
										<mml:mi>θ</mml:mi>
										<mml:mrow>
											<mml:mn>11</mml:mn>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
								<mml:mtd columnalign="left">
									<mml:mi>a</mml:mi>
									<mml:mi>m</mml:mi>
									<mml:mi>p</mml:mi>
									<mml:mi>;</mml:mi>
									<mml:msub>
										<mml:mi>θ</mml:mi>
										<mml:mrow>
											<mml:mn>12</mml:mn>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
								<mml:mtd columnalign="left">
									<mml:mi>a</mml:mi>
									<mml:mi>m</mml:mi>
									<mml:mi>p</mml:mi>
									<mml:mi>;</mml:mi>
									<mml:msub>
										<mml:mi>θ</mml:mi>
										<mml:mrow>
											<mml:mn>13</mml:mn>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
							</mml:mtr>
							<mml:mtr>
								<mml:mtd columnalign="left">
									<mml:msub>
										<mml:mi>θ</mml:mi>
										<mml:mrow>
											<mml:mn>21</mml:mn>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
								<mml:mtd columnalign="left">
									<mml:mi>a</mml:mi>
									<mml:mi>m</mml:mi>
									<mml:mi>p</mml:mi>
									<mml:mi>;</mml:mi>
									<mml:msub>
										<mml:mi>θ</mml:mi>
										<mml:mrow>
											<mml:mn>22</mml:mn>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
								<mml:mtd columnalign="left">
									<mml:mi>a</mml:mi>
									<mml:mi>m</mml:mi>
									<mml:mi>p</mml:mi>
									<mml:mi>;</mml:mi>
									<mml:msub>
										<mml:mi>θ</mml:mi>
										<mml:mrow>
											<mml:mn>23</mml:mn>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
							</mml:mtr>
						</mml:mtable>
						<mml:mo stretchy="true" fence="true" form="postfix">]</mml:mo>
					</mml:mrow>
					<mml:mo>∈</mml:mo>
					<mml:msup>
						<mml:mi>ℝ</mml:mi>
						<mml:mrow>
							<mml:mn>2</mml:mn>
							<mml:mi>×</mml:mi>
							<mml:mn>3</mml:mn>
						</mml:mrow>
					</mml:msup>
					<mml:mo>.</mml:mo>
				</mml:mrow>
			</mml:math>
			<p>Координаты выходной сетки отображаются в исходное изображение по обратному (backward) правилу [LATEX_FORMULA][x, y]^{T}=T(\theta)\left[x^{\prime}, y^{\prime}, 1\right]^{T}[/LATEX_FORMULA]</p>
			<p> </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msup>
						<mml:mi>I</mml:mi>
						<mml:mrow>
							<mml:mi>′</mml:mi>
						</mml:mrow>
					</mml:msup>
					<mml:mrow>
						<mml:mo stretchy="true" fence="true" form="prefix">(</mml:mo>
						<mml:msup>
							<mml:mi>x</mml:mi>
							<mml:mrow>
								<mml:mi>′</mml:mi>
							</mml:mrow>
						</mml:msup>
						<mml:mo>,</mml:mo>
						<mml:msup>
							<mml:mi>y</mml:mi>
							<mml:mrow>
								<mml:mi>′</mml:mi>
							</mml:mrow>
						</mml:msup>
						<mml:mo stretchy="true" fence="true" form="postfix">)</mml:mo>
					</mml:mrow>
					<mml:mo>=</mml:mo>
					<mml:msubsup>
						<mml:mo>∑</mml:mo>
						<mml:mrow>
							<mml:mi>i</mml:mi>
							<mml:mo>=</mml:mo>
							<mml:mo stretchy="false">[</mml:mo>
							<mml:mi>x</mml:mi>
							<mml:mo stretchy="false">]</mml:mo>
						</mml:mrow>
						<mml:mrow>
							<mml:mi>⌊</mml:mi>
							<mml:mi>x</mml:mi>
							<mml:mi>⌋</mml:mi>
							<mml:mo>+</mml:mo>
							<mml:mn>1</mml:mn>
						</mml:mrow>
					</mml:msubsup>
					<mml:msubsup>
						<mml:mo>∑</mml:mo>
						<mml:mrow>
							<mml:mi>j</mml:mi>
							<mml:mo>=</mml:mo>
							<mml:mi>⌊</mml:mi>
							<mml:mi>y</mml:mi>
							<mml:mi>⌋</mml:mi>
						</mml:mrow>
						<mml:mrow>
							<mml:mi>⌊</mml:mi>
							<mml:mi>y</mml:mi>
							<mml:mi>⌋</mml:mi>
							<mml:mo>+</mml:mo>
							<mml:mn>1</mml:mn>
						</mml:mrow>
					</mml:msubsup>
					<mml:mi>ω</mml:mi>
					<mml:mo stretchy="false">(</mml:mo>
					<mml:mi>i</mml:mi>
					<mml:mo>,</mml:mo>
					<mml:mi>j</mml:mi>
					<mml:mo>∣</mml:mo>
					<mml:mi>x</mml:mi>
					<mml:mo>,</mml:mo>
					<mml:mi>y</mml:mi>
					<mml:mo stretchy="false">)</mml:mo>
					<mml:mi>I</mml:mi>
					<mml:mo stretchy="false">(</mml:mo>
					<mml:mi>i</mml:mi>
					<mml:mo>,</mml:mo>
					<mml:mi>j</mml:mi>
					<mml:mo stretchy="false">)</mml:mo>
					<mml:mo>,</mml:mo>
					<mml:mspace width="1em"/>
					<mml:mi>ω</mml:mi>
					<mml:mo stretchy="false">(</mml:mo>
					<mml:mi>i</mml:mi>
					<mml:mo>,</mml:mo>
					<mml:mi>j</mml:mi>
					<mml:mo>∣</mml:mo>
					<mml:mi>x</mml:mi>
					<mml:mo>,</mml:mo>
					<mml:mi>y</mml:mi>
					<mml:mo stretchy="false">)</mml:mo>
					<mml:mo>=</mml:mo>
					<mml:mo stretchy="false">(</mml:mo>
					<mml:mn>1</mml:mn>
					<mml:mo>−</mml:mo>
					<mml:mo stretchy="false">|</mml:mo>
					<mml:mi>i</mml:mi>
					<mml:mo>−</mml:mo>
					<mml:mi>x</mml:mi>
					<mml:mo stretchy="false">|</mml:mo>
					<mml:mo stretchy="false">)</mml:mo>
					<mml:mo stretchy="false">(</mml:mo>
					<mml:mn>1</mml:mn>
					<mml:mo>−</mml:mo>
					<mml:mo stretchy="false">|</mml:mo>
					<mml:mi>j</mml:mi>
					<mml:mo>−</mml:mo>
					<mml:mi>y</mml:mi>
					<mml:mo stretchy="false">|</mml:mo>
					<mml:mo stretchy="false">)</mml:mo>
					<mml:mo>.</mml:mo>
				</mml:mrow>
			</mml:math>
			<p>Билинейная интерполяция дифференцируема по </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:mfrac>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>L</mml:mi>
						</mml:mrow>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>θ</mml:mi>
						</mml:mrow>
					</mml:mfrac>
					<mml:mo>=</mml:mo>
					<mml:mfrac>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>L</mml:mi>
						</mml:mrow>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:msup>
								<mml:mi>I</mml:mi>
								<mml:mrow>
									<mml:mi>′</mml:mi>
								</mml:mrow>
							</mml:msup>
						</mml:mrow>
					</mml:mfrac>
					<mml:mi>·</mml:mi>
					<mml:mfrac>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:msup>
								<mml:mi>I</mml:mi>
								<mml:mrow>
									<mml:mi>′</mml:mi>
								</mml:mrow>
							</mml:msup>
						</mml:mrow>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>G</mml:mi>
						</mml:mrow>
					</mml:mfrac>
					<mml:mi>·</mml:mi>
					<mml:mfrac>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>G</mml:mi>
						</mml:mrow>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>θ</mml:mi>
						</mml:mrow>
					</mml:mfrac>
					<mml:mo>,</mml:mo>
					<mml:mspace width="1em"/>
					<mml:mfrac>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>L</mml:mi>
						</mml:mrow>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>φ</mml:mi>
						</mml:mrow>
					</mml:mfrac>
					<mml:mo>=</mml:mo>
					<mml:mfrac>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>L</mml:mi>
						</mml:mrow>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>θ</mml:mi>
						</mml:mrow>
					</mml:mfrac>
					<mml:mi>·</mml:mi>
					<mml:mfrac>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>θ</mml:mi>
						</mml:mrow>
						<mml:mrow>
							<mml:mo>∂</mml:mo>
							<mml:mi>φ</mml:mi>
						</mml:mrow>
					</mml:mfrac>
					<mml:mo>.</mml:mo>
				</mml:mrow>
			</mml:math>
			<p>В качестве основной компоненты функции потерь принят ArcFace </p>
			<p>[11]</p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>L</mml:mi>
						<mml:mrow>
							<mml:mtext>ArcFace </mml:mtext>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mo>−</mml:mo>
					<mml:mi>log</mml:mi>
					<mml:mfrac>
						<mml:mrow>
							<mml:msup>
								<mml:mi>e</mml:mi>
								<mml:mrow>
									<mml:mi>s</mml:mi>
									<mml:mi>cos</mml:mi>
									<mml:mrow>
										<mml:mo stretchy="true" fence="true" form="prefix">(</mml:mo>
										<mml:msub>
											<mml:mi>θ</mml:mi>
											<mml:mrow>
												<mml:mtext>arc </mml:mtext>
												<mml:mo>,</mml:mo>
												<mml:mi>y</mml:mi>
											</mml:mrow>
										</mml:msub>
										<mml:mo>+</mml:mo>
										<mml:mi>m</mml:mi>
										<mml:mo stretchy="true" fence="true" form="postfix">)</mml:mo>
									</mml:mrow>
								</mml:mrow>
							</mml:msup>
						</mml:mrow>
						<mml:mrow>
							<mml:msup>
								<mml:mi>e</mml:mi>
								<mml:mrow>
									<mml:mi>s</mml:mi>
									<mml:mi>cos</mml:mi>
									<mml:mrow>
										<mml:mo stretchy="true" fence="true" form="prefix">(</mml:mo>
										<mml:msub>
											<mml:mi>θ</mml:mi>
											<mml:mrow>
												<mml:mtext>arc </mml:mtext>
												<mml:mo>,</mml:mo>
												<mml:mi>y</mml:mi>
											</mml:mrow>
										</mml:msub>
										<mml:mo>+</mml:mo>
										<mml:mi>m</mml:mi>
										<mml:mo stretchy="true" fence="true" form="postfix">)</mml:mo>
									</mml:mrow>
								</mml:mrow>
							</mml:msup>
							<mml:mo>+</mml:mo>
							<mml:msub>
								<mml:mo>∑</mml:mo>
								<mml:mrow>
									<mml:mi>j</mml:mi>
									<mml:mo>≠</mml:mo>
									<mml:mi>y</mml:mi>
								</mml:mrow>
							</mml:msub>
							<mml:msup>
								<mml:mi>e</mml:mi>
								<mml:mrow>
									<mml:mi>s</mml:mi>
									<mml:mi>cos</mml:mi>
									<mml:msub>
										<mml:mi>θ</mml:mi>
										<mml:mrow>
											<mml:mtext>arc </mml:mtext>
											<mml:mo>,</mml:mo>
											<mml:mi>j</mml:mi>
										</mml:mrow>
									</mml:msub>
								</mml:mrow>
							</mml:msup>
						</mml:mrow>
					</mml:mfrac>
				</mml:mrow>
			</mml:math>
			<p>где </p>
			<p>В предлагаемой архитектуре SSM получает на вход не последовательность патчей изображения, а упорядоченную последовательность координат лицевых ключевых точек [LATEX_FORMULA]\mathcal{L}=\left\{p_{i}\right\}_{i=1}^{n}, \quad p_{i}=\left(x_{i}, y_{i}\right)^{T} \in \mathbb{R}^{2}, \quad n=68,[/LATEX_FORMULA] </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>x</mml:mi>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mrow>
						<mml:mo stretchy="true" fence="true" form="prefix">[</mml:mo>
						<mml:mtable>
							<mml:mtr>
								<mml:mtd columnalign="left">
									<mml:msub>
										<mml:mi>W</mml:mi>
										<mml:mrow>
											<mml:mi>p</mml:mi>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
								<mml:mtd columnalign="left">
									<mml:mi>a</mml:mi>
									<mml:mi>m</mml:mi>
									<mml:mi>p</mml:mi>
									<mml:mi>;</mml:mi>
									<mml:msub>
										<mml:mi>p</mml:mi>
										<mml:mrow>
											<mml:mi>k</mml:mi>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
							</mml:mtr>
							<mml:mtr>
								<mml:mtd columnalign="left">
									<mml:msub>
										<mml:mi>W</mml:mi>
										<mml:mrow>
											<mml:mi>e</mml:mi>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
								<mml:mtd columnalign="left">
									<mml:mi>a</mml:mi>
									<mml:mi>m</mml:mi>
									<mml:mi>p</mml:mi>
									<mml:mi>;</mml:mi>
									<mml:msub>
										<mml:mi>e</mml:mi>
										<mml:mrow>
											<mml:msub>
												<mml:mi>t</mml:mi>
												<mml:mrow>
													<mml:mi>k</mml:mi>
												</mml:mrow>
											</mml:msub>
										</mml:mrow>
									</mml:msub>
								</mml:mtd>
							</mml:mtr>
						</mml:mtable>
						<mml:mo stretchy="true" fence="true" form="postfix">]</mml:mo>
					</mml:mrow>
					<mml:mo>∈</mml:mo>
					<mml:msup>
						<mml:mi>ℝ</mml:mi>
						<mml:mrow>
							<mml:mn>2</mml:mn>
							<mml:msub>
								<mml:mi>d</mml:mi>
								<mml:mrow>
									<mml:mi>p</mml:mi>
								</mml:mrow>
							</mml:msub>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<p>где </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>W</mml:mi>
						<mml:mrow>
							<mml:mi>p</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>∈</mml:mo>
					<mml:msup>
						<mml:mi>ℝ</mml:mi>
						<mml:mrow>
							<mml:msub>
								<mml:mi>d</mml:mi>
								<mml:mrow>
									<mml:mi>p</mml:mi>
								</mml:mrow>
							</mml:msub>
							<mml:mi>×</mml:mi>
							<mml:mn>2</mml:mn>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<p> проекция координат, [LATEX_FORMULA]W_{e} \in \mathbb{R}^{d_{p} \times d_{e}}[/LATEX_FORMULA] так что размерность токена равна </p>
			<p>Дискретная SSM описывается рекуррентным уравнением </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>h</mml:mi>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:msub>
						<mml:mover>
							<mml:mrow>
								<mml:mi>A</mml:mi>
							</mml:mrow>
							<mml:mo stretchy="true">¯</mml:mo>
						</mml:mover>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:msub>
						<mml:mi>h</mml:mi>
						<mml:mrow>
							<mml:mi>k</mml:mi>
							<mml:mo>−</mml:mo>
							<mml:mn>1</mml:mn>
						</mml:mrow>
					</mml:msub>
					<mml:mo>+</mml:mo>
					<mml:msub>
						<mml:mover>
							<mml:mrow>
								<mml:mi>B</mml:mi>
							</mml:mrow>
							<mml:mo stretchy="true">¯</mml:mo>
						</mml:mover>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:msub>
						<mml:mi>x</mml:mi>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>,</mml:mo>
					<mml:msub>
						<mml:mi>y</mml:mi>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mi>C</mml:mi>
					<mml:msub>
						<mml:mi>h</mml:mi>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
				</mml:mrow>
			</mml:math>
			<p>k</p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mover>
							<mml:mrow>
								<mml:mi>B</mml:mi>
							</mml:mrow>
							<mml:mo stretchy="true">¯</mml:mo>
						</mml:mover>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mi>σ</mml:mi>
					<mml:mrow>
						<mml:mo stretchy="true" fence="true" form="prefix">(</mml:mo>
						<mml:msub>
							<mml:mi>W</mml:mi>
							<mml:mrow>
								<mml:mi>r</mml:mi>
							</mml:mrow>
						</mml:msub>
						<mml:msub>
							<mml:mi>e</mml:mi>
							<mml:mrow>
								<mml:msub>
									<mml:mi>t</mml:mi>
									<mml:mrow>
										<mml:mi>k</mml:mi>
									</mml:mrow>
								</mml:msub>
							</mml:mrow>
						</mml:msub>
						<mml:mo stretchy="true" fence="true" form="postfix">)</mml:mo>
					</mml:mrow>
					<mml:mo>⊙</mml:mo>
					<mml:mi>B</mml:mi>
					<mml:mo>,</mml:mo>
					<mml:mspace width="1em"/>
					<mml:msub>
						<mml:mi>Δ</mml:mi>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mi>δ</mml:mi>
					<mml:mi>·</mml:mi>
					<mml:mo>Softplus</mml:mo>
					<mml:mrow>
						<mml:mo stretchy="true" fence="true" form="prefix">(</mml:mo>
						<mml:msub>
							<mml:mi>W</mml:mi>
							<mml:mrow>
								<mml:mi>Δ</mml:mi>
							</mml:mrow>
						</mml:msub>
						<mml:msub>
							<mml:mi>e</mml:mi>
							<mml:mrow>
								<mml:msub>
									<mml:mi>t</mml:mi>
									<mml:mrow>
										<mml:mi>k</mml:mi>
									</mml:mrow>
								</mml:msub>
							</mml:mrow>
						</mml:msub>
						<mml:mo stretchy="true" fence="true" form="postfix">)</mml:mo>
					</mml:mrow>
				</mml:mrow>
			</mml:math>
			<p>где σ(⋅) — сигмоида,</p>
			<p>δ &gt; 0 — масштабирующая константа.</p>
			<p>Базовая матрица входа </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>f</mml:mi>
						<mml:mrow>
							<mml:mrow>
								<mml:mi mathvariant="normal">M</mml:mi>
								<mml:mi mathvariant="normal">L</mml:mi>
								<mml:mi mathvariant="normal">P</mml:mi>
							</mml:mrow>
						</mml:mrow>
					</mml:msub>
					<mml:mrow>
						<mml:mo stretchy="true" fence="true" form="prefix">(</mml:mo>
						<mml:msub>
							<mml:mi>e</mml:mi>
							<mml:mrow>
								<mml:msub>
									<mml:mi>t</mml:mi>
									<mml:mrow>
										<mml:mi>k</mml:mi>
									</mml:mrow>
								</mml:msub>
							</mml:mrow>
						</mml:msub>
						<mml:mo stretchy="true" fence="true" form="postfix">)</mml:mo>
					</mml:mrow>
					<mml:mo>=</mml:mo>
					<mml:msup>
						<mml:mi>W</mml:mi>
						<mml:mrow>
							<mml:mo stretchy="false">(</mml:mo>
							<mml:mn>2</mml:mn>
							<mml:mo stretchy="false">)</mml:mo>
						</mml:mrow>
					</mml:msup>
					<mml:mo>GELU</mml:mo>
					<mml:mrow>
						<mml:mo stretchy="true" fence="true" form="prefix">(</mml:mo>
						<mml:msup>
							<mml:mi>W</mml:mi>
							<mml:mrow>
								<mml:mo stretchy="false">(</mml:mo>
								<mml:mn>1</mml:mn>
								<mml:mo stretchy="false">)</mml:mo>
							</mml:mrow>
						</mml:msup>
						<mml:msub>
							<mml:mi>e</mml:mi>
							<mml:mrow>
								<mml:msub>
									<mml:mi>t</mml:mi>
									<mml:mrow>
										<mml:mi>k</mml:mi>
									</mml:mrow>
								</mml:msub>
							</mml:mrow>
						</mml:msub>
						<mml:mo>+</mml:mo>
						<mml:msup>
							<mml:mi>b</mml:mi>
							<mml:mrow>
								<mml:mo stretchy="false">(</mml:mo>
								<mml:mn>1</mml:mn>
								<mml:mo stretchy="false">)</mml:mo>
							</mml:mrow>
						</mml:msup>
						<mml:mo stretchy="true" fence="true" form="postfix">)</mml:mo>
					</mml:mrow>
					<mml:mo>+</mml:mo>
					<mml:msup>
						<mml:mi>b</mml:mi>
						<mml:mrow>
							<mml:mo stretchy="false">(</mml:mo>
							<mml:mn>2</mml:mn>
							<mml:mo stretchy="false">)</mml:mo>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<p>[13]</p>
			<p>Матрица состояния использует структурированную диагональ-плюс-низкоранговую параметризацию HiPPO/S4, </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>λ</mml:mi>
						<mml:mrow>
							<mml:mtext>eye </mml:mtext>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mo>−</mml:mo>
					<mml:mn>0</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mn>5</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mspace width="1em"/>
					<mml:msub>
						<mml:mi>λ</mml:mi>
						<mml:mrow>
							<mml:mtext>nose </mml:mtext>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mo>−</mml:mo>
					<mml:mn>0</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mn>3</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mspace width="1em"/>
					<mml:msub>
						<mml:mi>λ</mml:mi>
						<mml:mrow>
							<mml:mtext>mouth </mml:mtext>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mo>−</mml:mo>
					<mml:mn>1</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mn>0</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mspace width="1em"/>
					<mml:msub>
						<mml:mi>λ</mml:mi>
						<mml:mrow>
							<mml:mtext>contour </mml:mtext>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mo>−</mml:mo>
					<mml:mn>0</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mn>8</mml:mn>
				</mml:mrow>
			</mml:math>
			<p>Меньший модуль соответствует стабильной области (нос, глаза) и длительному удержанию состояния; больший — вариативной зоне (рот, контур), для которой задается быстрое затухание шума артикуляции. Динамическая устойчивость требует условия </p>
			<code>[LATEX_FORMULA]\left|\lambda_{i}\left(\bar{A}_{k}\right)\right|&amp;lt;1[/LATEX_FORMULA]</code>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mover>
							<mml:mrow>
								<mml:mi>A</mml:mi>
							</mml:mrow>
							<mml:mo stretchy="true">¯</mml:mo>
						</mml:mover>
						<mml:mrow>
							<mml:mi>k</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:mrow>
						<mml:mo stretchy="true" fence="true" form="prefix">(</mml:mo>
						<mml:mi>I</mml:mi>
						<mml:mo>+</mml:mo>
						<mml:msub>
							<mml:mi>Δ</mml:mi>
							<mml:mrow>
								<mml:mi>k</mml:mi>
							</mml:mrow>
						</mml:msub>
						<mml:mi>A</mml:mi>
						<mml:mo stretchy="true" fence="true" form="postfix">)</mml:mo>
					</mml:mrow>
					<mml:mo>⊙</mml:mo>
					<mml:mi>σ</mml:mi>
					<mml:mo stretchy="false">(</mml:mo>
					<mml:mi>S</mml:mi>
					<mml:mo stretchy="false">)</mml:mo>
				</mml:mrow>
			</mml:math>
			<p>(из требования [LATEX_FORMULA]\left|1+\Delta_{k} \lambda_{i}\right|&amp;lt;1[/LATEX_FORMULA]); при рабочих [LATEX_FORMULA]\Delta_{k} \in\left[10^{-3}, 10^{-1}\right][/LATEX_FORMULA] и [LATEX_FORMULA]\operatorname{Re}\left(\lambda_{i}\right) \leq-0,1[/LATEX_FORMULA] </p>
			<p>Предложенный контроллер интегрируется в конвейер из пяти ступеней:</p>
			<p>(1) CNN-энкодер MobileNetV3-Small извлекает признаковую карту F;</p>
			<p>(2) keypoint-голова (голова предсказания ключевых точек) регрессирует координаты 68 точек через heatmap-представление (тепловую карту);</p>
			<p>(3) координаты объединяются с эмбеддингами типов; </p>
			<p>(4) Mamba-блок обрабатывает обогащенную последовательность и предсказывает </p>
			<p>(5) дифференцируемый сэмплер применяет </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>L</mml:mi>
						<mml:mrow>
							<mml:mrow>
								<mml:mi mathvariant="normal">r</mml:mi>
								<mml:mi mathvariant="normal">e</mml:mi>
								<mml:mi mathvariant="normal">g</mml:mi>
							</mml:mrow>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:msubsup>
						<mml:mrow>
							<mml:mo stretchy="true" fence="true" form="prefix">‖</mml:mo>
							<mml:mi>θ</mml:mi>
							<mml:mo>−</mml:mo>
							<mml:msub>
								<mml:mi>θ</mml:mi>
								<mml:mrow>
									<mml:mrow>
										<mml:mi mathvariant="normal">i</mml:mi>
										<mml:mi mathvariant="normal">d</mml:mi>
									</mml:mrow>
								</mml:mrow>
							</mml:msub>
							<mml:mo stretchy="true" fence="true" form="postfix">‖</mml:mo>
						</mml:mrow>
						<mml:mrow>
							<mml:mi>F</mml:mi>
						</mml:mrow>
						<mml:mrow>
							<mml:mn>2</mml:mn>
						</mml:mrow>
					</mml:msubsup>
					<mml:mo>+</mml:mo>
					<mml:mi>α</mml:mi>
					<mml:mi>·</mml:mi>
					<mml:mfrac>
						<mml:mrow>
							<mml:mn>1</mml:mn>
						</mml:mrow>
						<mml:mrow>
							<mml:mi>ε</mml:mi>
							<mml:mo>+</mml:mo>
							<mml:mo>det</mml:mo>
							<mml:mo stretchy="false">(</mml:mo>
							<mml:mi>M</mml:mi>
							<mml:msup>
								<mml:mo stretchy="false">)</mml:mo>
								<mml:mrow>
									<mml:mn>2</mml:mn>
								</mml:mrow>
							</mml:msup>
						</mml:mrow>
					</mml:mfrac>
					<mml:mo>,</mml:mo>
					<mml:mspace width="1em"/>
					<mml:mi>α</mml:mi>
					<mml:mo>=</mml:mo>
					<mml:mn>0</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mn>1</mml:mn>
					<mml:mo>,</mml:mo>
					<mml:mi>ε</mml:mi>
					<mml:mo>=</mml:mo>
					<mml:msup>
						<mml:mn>10</mml:mn>
						<mml:mrow>
							<mml:mo>−</mml:mo>
							<mml:mn>6</mml:mn>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<p>где </p>
			<p>θidMissing Mark : sub = [1, 0, 0, 0, 1, 0]TMissing Mark : sup — параметры тождественного преобразования.</p>
			<p>Первый член (норма Фробениуса) штрафует отклонение от тождественного преобразования и обнуляется при identity-старте; второй препятствует обращению </p>
			<p>[16]</p>
			<p>4. Реализация</p>
			<p>Модель реализована на PyTorch 2.1.0 с CUDA 12.1 и библиотекой </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:mi>I</mml:mi>
					<mml:mo>∈</mml:mo>
					<mml:msup>
						<mml:mi>ℝ</mml:mi>
						<mml:mrow>
							<mml:mi>H</mml:mi>
							<mml:mi>×</mml:mi>
							<mml:mi>W</mml:mi>
							<mml:mi>×</mml:mi>
							<mml:mn>3</mml:mn>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<mml:math display="inline">
				<mml:mrow>
					<mml:mi>θ</mml:mi>
					<mml:mo>∈</mml:mo>
					<mml:msup>
						<mml:mi>ℝ</mml:mi>
						<mml:mrow>
							<mml:mn>6</mml:mn>
						</mml:mrow>
					</mml:msup>
				</mml:mrow>
			</mml:math>
			<p>mamba_ssm[17]</p>
			<p>Важным элементом реализации является identity-инициализация выходного слоя контроллера: параметры последнего линейного слоя </p>
			<p>Обучение проводится в два этапа. На стадии warm-up (разогрев, 5 эпох) CNN-энкодер заморожен, обучаются keypoint-голова, контроллер и голова распознавания; identity-инициализация </p>
			<mml:math display="inline">
				<mml:mrow>
					<mml:msub>
						<mml:mi>L</mml:mi>
						<mml:mrow>
							<mml:mi>k</mml:mi>
							<mml:mi>p</mml:mi>
						</mml:mrow>
					</mml:msub>
					<mml:mo>=</mml:mo>
					<mml:msub>
						<mml:mrow>
							<mml:mo stretchy="true" fence="true" form="prefix">‖</mml:mo>
							<mml:mi>p</mml:mi>
							<mml:mo>−</mml:mo>
							<mml:msub>
								<mml:mi>p</mml:mi>
								<mml:mrow>
									<mml:mrow>
										<mml:mi mathvariant="normal">g</mml:mi>
										<mml:mi mathvariant="normal">t</mml:mi>
									</mml:mrow>
								</mml:mrow>
							</mml:msub>
							<mml:mo stretchy="true" fence="true" form="postfix">‖</mml:mo>
						</mml:mrow>
						<mml:mrow>
							<mml:mn>2</mml:mn>
						</mml:mrow>
					</mml:msub>
				</mml:mrow>
			</mml:math>
			<p> </p>
			<p>5. Методика
эксперимента</p>
			<p>Экспериментальное исследование проводилось на унифицированном вычислительном стенде (Intel Xeon Gold 6248R, NVIDIA A100 40 ГБ, 192 ГБ ОЗУ) с фиксированными версиями программного обеспечения и seed = 42. Для предобучения CNN-энкодера и головы распознавания использовалась очищенная исследовательская версия набора MS-Celeb-1M</p>
			<p> [19]</p>
			<p>Для оценки робастности в условиях, приближенных к реальной эксплуатации, сформирован авторский деградированный набор на основе LFW по методологии Hendrycks &amp; Dietterich </p>
			<p>[18]</p>
			<table-wrap id="T1">
				<label>Table 1</label>
				<caption>
					<p>Сравнительная характеристика базовых моделей и предложенного решения</p>
				</caption>
				<table>
					<tr>
						<td>Модель</td>
						<td>Тип подхода</td>
						<td>Энкодер</td>
						<td>Метод регистрации</td>
						<td>Параметры, млн</td>
						<td>FLOPs, G</td>
						<td>Inference, мс</td>
					</tr>
					<tr>
						<td>ArcFace + Dlib</td>
						<td>двухэтапный</td>
						<td>ResNet-100</td>
						<td>внешний (Dlib)</td>
						<td>55,7</td>
						<td>11,3</td>
						<td>42,1</td>
					</tr>
					<tr>
						<td>MobileFaceNet</td>
						<td>одностадийный</td>
						<td>MobileNet-like</td>
						<td>нет</td>
						<td>0,98</td>
						<td>0,22</td>
						<td>3,8</td>
					</tr>
					<tr>
						<td>STN-ArcFace</td>
						<td>дифференцируемый</td>
						<td>MobileNetV3-Small</td>
						<td>STN (MLP)</td>
						<td>1,5</td>
						<td>0,25</td>
						<td>4,1</td>
					</tr>
					<tr>
						<td>Vision Mamba (Vim)</td>
						<td>SSM-based</td>
						<td>Vim-Tiny</td>
						<td>нет</td>
						<td>5,8</td>
						<td>1,7</td>
						<td>18,5</td>
					</tr>
					<tr>
						<td>Предложенная модель</td>
						<td>гибридный (CNN+SSM)</td>
						<td>MobileNetV3-Small</td>
						<td>Mamba-контроллер</td>
						<td>1,6</td>
						<td>0,26</td>
						<td>4,3</td>
					</tr>
				</table>
			</table-wrap>
			<p>Как видно из таблицы 1, по вычислительной сложности предложенная модель сопоставима с легкими решениями (MobileFaceNet, STN-ArcFace), но вводит принципиально иной механизм управления регистрацией. Обработка биометрических данных регулируется в Российской Федерации Федеральным законом № 152-ФЗ, в международной практике — GDPR (ст. 9); все эксперименты выполнены на публично доступных академических наборах в исследовательских целях без идентификации частных лиц. Исходный набор MS-Celeb-1M был отозван правообладателем (Microsoft) в 2019 г. по соображениям защиты персональных данных, поэтому его очищенная исследовательская версия (MS1MV2) использована только для предобучения, без распространения исходных изображений.</p>
			<p> </p>
			<p>6. Результаты</p>
			<p>На стандартном бенчмарке LFW предложенная модель показала точность 99,89%, сопоставимую с лучшими из сравниваемых архитектур (таблица 2). Разница с ArcFace+Dlib (+0,06 п.п.) находится в пределах наблюдаемой дисперсии запусков; результат интерпретируется как сопоставимая точность при существенно более легком энкодере (MobileNetV3-Small против ResNet-100).</p>
			<table-wrap id="T2">
				<label>Table 2</label>
				<caption>
					<p>Результаты верификации на наборе LFW</p>
				</caption>
				<table>
					<tr>
						<td>Модель</td>
						<td>Accuracy, %</td>
						<td>AUC</td>
					</tr>
					<tr>
						<td>Предложенная модель</td>
						<td>99,89</td>
						<td>0,9995</td>
					</tr>
					<tr>
						<td>ArcFace + Dlib</td>
						<td>99,83</td>
						<td>0,9993</td>
					</tr>
					<tr>
						<td>Vision Mamba (Vim)</td>
						<td>99,30</td>
						<td>0,9982</td>
					</tr>
					<tr>
						<td>STN-ArcFace</td>
						<td>98,95</td>
						<td>0,9963</td>
					</tr>
					<tr>
						<td>MobileFaceNet</td>
						<td>98,72</td>
						<td>0,9951</td>
					</tr>
				</table>
			</table-wrap>
			<p>Ключевые различия проявляются на авторском деградированном наборе (таблица 3). По проведенным экспериментам (seed=42) предложенная модель сохранила точность 98,4%, тогда как у ArcFace+Dlib она снизилась до 71,8%; межмодельный разрыв составляет 26,6 процентного пункта. Время инференса предложенной модели (4,3 мс) при этом существенно меньше, чем у двухэтапной связки (42,1 мс); в последнюю входят CPU-этап Dlib (детекция и локализация точек) и GPU-этап распознавания, поэтому разрыв отражает в том числе гетерогенность исполнения, а не только глубину сетей. Результат отражает преодоление ограничения жесткого разделения этапов: обученный end-to-end Mamba-контроллер адаптивно корректирует выравнивание, компенсируя искажения, тогда как внешний детектор Dlib и жесткий STN менее устойчивы.</p>
			<table-wrap id="T3">
				<label>Table 3</label>
				<caption>
					<p>Результаты на авторском деградированном наборе (JPEG q = 30 + шум + аффинные искажения)</p>
				</caption>
				<table>
					<tr>
						<td>Модель</td>
						<td>Accuracy, %</td>
						<td>NME, %</td>
						<td>PCKh, %</td>
						<td>Inference, мс</td>
					</tr>
					<tr>
						<td>Предложенная модель</td>
						<td>98,4</td>
						<td>3,82</td>
						<td>94,3</td>
						<td>4,30</td>
					</tr>
					<tr>
						<td>ArcFace + Dlib</td>
						<td>71,8</td>
						<td>5,67</td>
						<td>82,1</td>
						<td>42,10</td>
					</tr>
					<tr>
						<td>Vision Mamba (Vim)</td>
						<td>91,1</td>
						<td>4,25</td>
						<td>89,7</td>
						<td>18,50</td>
					</tr>
					<tr>
						<td>STN-ArcFace</td>
						<td>85,3</td>
						<td>4,51</td>
						<td>87,2</td>
						<td>4,10</td>
					</tr>
					<tr>
						<td>MobileFaceNet</td>
						<td>82,0</td>
						<td>-</td>
						<td>-</td>
						<td>3,80</td>
					</tr>
				</table>
			</table-wrap>
			<p>Для локализации источника робастности проведена серия экспериментов с разными типами деградации (таблица 4). Необходимо оговорить протокол: значения строки «JPEG (качество = 30)» таблицы 4 поэлементно совпадают с таблицей 3 (98,4 / 71,8 / 91,1) — это то же измерение на авторском наборе, обозначаемое по доминирующему фактору деградации; изолированный вклад сжатия без шума и аффинных искажений отдельно не оценивался, и данную строку следует читать как оценку на комбинированном наборе, тогда как строки с шумом, поворотом и масштабом характеризуют отдельные факторы. Вследствие различия протоколов строки таблицы 4 корректно сравнивать между моделями, но не между собой. На комбинированном наборе точность всех моделей оказывается выше, чем при изолированном повороте на ±30°. Преимущество предложенной модели сохраняется во всех сценариях, но наиболее выражено при геометрических искажениях (поворот, масштаб), что напрямую подтверждает эффективность адаптивного управления геометрией через Mamba-контроллер.</p>
			<table-wrap id="T4">
				<label>Table 4</label>
				<caption>
					<p>Точность моделей при различных типах деградации (на LFW)</p>
				</caption>
				<table>
					<tr>
						<td>Тип деградации</td>
						<td>Предложенная модель, %</td>
						<td>ArcFace + Dlib, %</td>
						<td>Vision Mamba, %</td>
					</tr>
					<tr>
						<td>Исходный LFW</td>
						<td>99,89</td>
						<td>99,83</td>
						<td>99,30</td>
					</tr>
					<tr>
						<td>JPEG (качество = 30)</td>
						<td>98,40</td>
						<td>71,80</td>
						<td>91,10</td>
					</tr>
					<tr>
						<td>Гауссов шум (σ = 0,01)</td>
						<td>98,95</td>
						<td>85,20</td>
						<td>93,50</td>
					</tr>
					<tr>
						<td>Поворот (± 30∘Missing Mark : sup)</td>
						<td>97,80</td>
						<td>68,40</td>
						<td>89,20</td>
					</tr>
					<tr>
						<td>Масштаб (0,8–1,2)</td>
						<td>98,10</td>
						<td>75,60</td>
						<td>90,80</td>
					</tr>
				</table>
			</table-wrap>
			<p>Вклад компонентов оценен абляционным исследованием (таблица 5) с поэтапным наращиванием архитектуры от MLP-контроллера к полной модели. Добавление блока Mamba дает прирост точности на деградированных данных почти на 9 п.п. относительно MLP, однако ключевой вклад вносит семантическая адаптация: эмбеддинги типов (Type Embeddings) добавляют еще ~2,9 п.п., подтверждая, что знание анатомической роли точки помогает фильтровать шум, а иерархическая инициализация </p>
			<table-wrap id="T5">
				<label>Table 5</label>
				<caption>
					<p>Результаты абляционного исследования компонентов Mamba-контроллера</p>
				</caption>
				<table>
					<tr>
						<td>Модель</td>
						<td>Accuracy LFW (clean), %</td>
						<td>Accuracy Degraded, %</td>
						<td>NME WFLW, %</td>
						<td>Параметры, млн</td>
					</tr>
					<tr>
						<td>Baseline (MLP-контроллер)</td>
						<td>98,95</td>
						<td>85,30</td>
						<td>4,51</td>
						<td>1,5</td>
					</tr>
					<tr>
						<td>Standard Mamba</td>
						<td>99,70</td>
						<td>94,20</td>
						<td>3,95</td>
						<td>1,6</td>
					</tr>
					<tr>
						<td>+ Type Embeddings</td>
						<td>99,82</td>
						<td>97,10</td>
						<td>3,88</td>
						<td>1,6</td>
					</tr>
					<tr>
						<td>Λ </td>
						<td>99,85</td>
						<td>97,80</td>
						<td>3,85</td>
						<td>1,6</td>
					</tr>
					<tr>
						<td>Full Proposed Model</td>
						<td>99,89</td>
						<td>98,40</td>
						<td>3,82</td>
						<td>1,6</td>
					</tr>
				</table>
			</table-wrap>
			<p>Анализ гиперпараметров показал, что оптимально 68 ключевых точек: меньшее количество (20) дает недостаток информации о геометрии, большее (98) — шум от менее устойчивых точек (например, на контуре волос) и снижение точности на проверочной выборке; недостаточный размер скрытого состояния не позволяет кодировать зависимости между точками, чрезмерный — ведет к переобучению. Конфигурация DmodelMissing Mark : sub = 512, dstateMissing Mark : sub = 16, n = 68 принята как компромисс.</p>
			<p>7. Обсуждение
и ограничения</p>
			<p>Предложенный механизм семантической адаптации отвечает на ключевую проблему применения SSM к геометрическим данным: в отличие от однородных токенов текста, каждая точка лица несет уникальную смысловую нагрузку. Type-conditioned селективность реализует аналог «структурного внимания» с линейной сложностью </p>
			<p>Полученная робастность имеет прямое прикладное значение для видеоподсистем ИТС: терминалы биометрического контроля на пропускных пунктах и в депо, турникетные комплексы вокзалов и салонные камеры мониторинга водителя работают именно при агрессивном сжатии видеопотока и геометрических искажениях (поворот ± 30∘Missing Mark : sup — прокси вибрационных смещений камеры), где преимущество модели выражено сильнее всего. Количественная оценка сложных сценариев очерчивает границы применимости: частота ошибок предложенной модели составляет 8,2% при частичном закрытии лица маской, 12,1% при контровом свете, 18,9% при экстремальном профиле (&gt; 60∘Missing Mark : sup) и 15,4% при сильном размытии движения — против 22,5%, 35,7%, 48,2% и 41,0% соответственно у ArcFace+Dlib. Подчеркнем также, что деградированный набор производен от LFW (та же популяция лиц), поэтому сохранение 98,4% точности не переносится автоматически на иные домены съемки.</p>
			<p>Результаты имеют ряд ограничений. Во-первых, все числовые показатели получены в одном прогоне обучения с seed = 42 и носят предварительный характер; разброс ±0,05% на LFW от недетерминизма triton-ядер характеризует лишь вычислительный шум, а строгая валидация по нескольким независимым значениям seed (3 и более) с построением доверительных интервалов запланирована, но не выполнена. Во-вторых, пригодность к edge-развертыванию опирается на профиль сложности, измеренный на серверном GPU, и не подтверждена замерами на периферийных устройствах. В-третьих, метод предполагает знание топологии лица (фиксированную схему разметки): в биометрии это требование обычно выполняется, но оно ограничивает перенос подхода на произвольные классы объектов. Наконец, приведенные выше частоты ошибок в экстремальных сценариях показывают, что точность модели снижается при сильном закрытии лица и экстремальных ракурсах, отражая зависимость от наличия достаточного количества видимых ключевых точек для корректного анализа геометрии. Применение к мониторингу состояния водителя (DMS) рассматривается как потенциальное направление и экспериментально в настоящей работе не проверялось.</p>
			<p>8. Заключение</p>
			<p>В работе предложен и исследован модифицированный Mamba-контроллер с механизмом семантической адаптации для дифференцируемой регистрации лиц в составе единого end-to-end конвейера с CNN-энкодером MobileNetV3-Small.</p>
			<p>Экспериментальное исследование показало, что предложенные модификации обеспечивают сопоставимую с современными решениями точность на чистом бенчмарке LFW (99,89%) при существенно более легком энкодере и, по проведенным экспериментам (seed=42) имеет повышенную робастность к деградации входных изображений: на авторском деградированном наборе модель сохраняет 98.4% точности против 71,8% у канонической связки ArcFace+Dlib (разрыв 26,6 процентного пункта) при времени инференса 4,3 мс против 42,1 мс у двухэтапной связки. Необходимо подчеркнуть, что это сопоставление времени получено при гетерогенном исполнении конвейеров (CPU-этап локализации Dlib против полностью GPU-исполнения предложенной модели), поэтому наблюдаемый разрыв во времени отражает не только различие архитектур, но и условия исполнения. Вычислительная эффективность (1,6 млн параметров, 0.26 GFLOPs) делает архитектуру потенциально пригодной для систем реального времени, в том числе для видеоподсистем интеллектуальных транспортных систем; вместе с тем тезис о пригодности к edge-развертыванию опирается на профиль сложности, измеренный на серверном GPU, и требует подтверждения прямыми замерами на встраиваемом оборудовании. Дальнейшие направления работы включают статистическую валидацию по нескольким независимым значениям seed с построением доверительных интервалов, замеры на периферийных устройствах и экспериментальную проверку применимости подхода к мониторингу состояния водителя.</p>
		</sec>
		<sec sec-type="supplementary-material">
			<title>Additional File</title>
			<p>The additional file for this article can be found as follows:</p>
			<supplementary-material xmlns:xlink="http://www.w3.org/1999/xlink" id="S1" xlink:href="https://doi.org/10.5334/cpsy.78.s1">
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://research-journal.org/media/articles/26143.docx">26143.docx</inline-supplementary-material>]-->
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://research-journal.org/media/articles/26143.pdf">26143.pdf</inline-supplementary-material>]-->
				<label>Online Supplementary Material</label>
				<caption>
					<p>
						Further description of analytic pipeline and patient demographic information. DOI:
						<italic>
							<uri>https://doi.org/10.60797/IRJ.2026.170.48</uri>
						</italic>
					</p>
				</caption>
			</supplementary-material>
		</sec>
	</body>
	<back>
		<ack>
			<title>Acknowledgements</title>
			<p/>
		</ack>
		<sec>
			<title>Competing Interests</title>
			<p/>
		</sec>
		<ref-list>
			<ref id="B1">
				<label>1</label>
				<mixed-citation publication-type="confproc">Hu C.-H. Toward Driver Face Recognition in the Intelligent Traffic Monitoring Systems / C.-H. Hu, Y. Zhang, F. Wu [et al.] // IEEE Transactions on Intelligent Transportation Systems. — 2020. — Vol. 21, № 12. — P. 4958–4971. — DOI: 10.1109/TITS.2019.2945923.</mixed-citation>
			</ref>
			<ref id="B2">
				<label>2</label>
				<mixed-citation publication-type="confproc">Yang L. Video-Based Driver Drowsiness Detection With Optimised Utilization of Key Facial Features / L. Yang, H. Yang, H. Wei [et al.] // IEEE Transactions on Intelligent Transportation Systems. — 2024. — Vol. 25, № 7. — P. 6938–6950. — DOI: 10.1109/TITS.2023.3346054.</mixed-citation>
			</ref>
			<ref id="B3">
				<label>3</label>
				<mixed-citation publication-type="confproc">Куликов А.А. Эволюция систем биометрической идентификации в обеспечении безопасности железнодорожного транспорта: от классических конвейеров к дифференцируемым гибридным архитектурам / А.А. Куликов // Транспортное дело России. — 2026. — № 3. — С. 153–155. — EDN: DXLOUP.</mixed-citation>
			</ref>
			<ref id="B4">
				<label>4</label>
				<mixed-citation publication-type="confproc">Кулагин М.А. Интеллектуальная система анализа и прогнозирования нарушений при управлении подвижным составом : дис. … канд. техн. наук : 05.13.06 / М.А. Кулагин. — Москва : РУТ (МИИТ), 2022.</mixed-citation>
			</ref>
			<ref id="B5">
				<label>5</label>
				<mixed-citation publication-type="confproc">Замышляев А.М. Автоматизация процессов комплексного управления техническим содержанием инфраструктуры железнодорожного транспорта : дис. … д-ра техн. наук : 05.13.06 / А.М. Замышляев. — Москва : НИИАС, 2014.</mixed-citation>
			</ref>
			<ref id="B6">
				<label>6</label>
				<mixed-citation publication-type="confproc">Bulat A. How Far are We from Solving the 2D &amp;amp; 3D Face Alignment Problem? (and a Dataset of 230 000 3D Facial Landmarks) / A. Bulat, G. Tzimiropoulos // Proceedings of the IEEE International Conference on Computer Vision (ICCV). — 2017. — P. 1021–1030. — DOI: 10.1109/ICCV.2017.116.</mixed-citation>
			</ref>
			<ref id="B7">
				<label>7</label>
				<mixed-citation publication-type="confproc">Jaderberg M. Spatial Transformer Networks / M. Jaderberg, K. Simonyan, A. Zisserman [et al.] // Advances in Neural Information Processing Systems 28 (NeurIPS 2015). — 2015. — P. 2017–2025. — arXiv:1506.02025.</mixed-citation>
			</ref>
			<ref id="B8">
				<label>8</label>
				<mixed-citation publication-type="confproc">Finnveden L. Understanding when spatial transformer networks do not support invariance, and what to do about it / L. Finnveden, Y. Jansson, T. Lindeberg // 25th International Conference on Pattern Recognition (ICPR). — Milan, Italy, 2021. — P. 3427–3434. — DOI: 10.1109/ICPR48806.2021.9412997.</mixed-citation>
			</ref>
			<ref id="B9">
				<label>9</label>
				<mixed-citation publication-type="confproc">Saadabadi M.S.E. ARoFace: Alignment Robustness to Improve Low-Quality Face Recognition / M.S.E. Saadabadi, S.R. Malakshan, A. Dabouei, N.M. Nasrabadi // Computer Vision – ECCV 2024. — Cham : Springer, 2024. — P. 308–327. — DOI: 10.1007/978-3-031-73414-4_18.</mixed-citation>
			</ref>
			<ref id="B10">
				<label>10</label>
				<mixed-citation publication-type="confproc">Gu A. Mamba: Linear-Time Sequence Modeling with Selective State Spaces / A. Gu, T. Dao. — arXiv, 2023. — arXiv:2312.00752.</mixed-citation>
			</ref>
			<ref id="B11">
				<label>11</label>
				<mixed-citation publication-type="confproc">Deng J. ArcFace: Additive Angular Margin Loss for Deep Face Recognition / J. Deng, J. Guo, N. Xue [et al.] // 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). — 2019. — P. 4690–4699. — DOI: 10.1109/CVPR.2019.00482.</mixed-citation>
			</ref>
			<ref id="B12">
				<label>12</label>
				<mixed-citation publication-type="confproc">Gu A. Efficiently Modeling Long Sequences with Structured State Spaces (S4) / A. Gu, K. Goel, C. Ré // International Conference on Learning Representations (ICLR). — 2022. — arXiv:2111.00396.</mixed-citation>
			</ref>
			<ref id="B13">
				<label>13</label>
				<mixed-citation publication-type="confproc">Smith J.T.H. Simplified State Space Layers for Sequence Modeling (S5) / J.T.H. Smith, A. Warrington, S.W. Linderman // International Conference on Learning Representations (ICLR). — 2023. — arXiv:2208.04933.</mixed-citation>
			</ref>
			<ref id="B14">
				<label>14</label>
				<mixed-citation publication-type="confproc">Zhu L. Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model / L. Zhu, B. Liao, Q. Zhang [et al.] // International Conference on Machine Learning (ICML). — 2024. — arXiv:2401.09417.</mixed-citation>
			</ref>
			<ref id="B15">
				<label>15</label>
				<mixed-citation publication-type="confproc">Yu W. MambaOut: Do We Really Need Mamba for Vision? / W. Yu, X. Wang. — arXiv, 2024. — arXiv:2405.07992. — URL: https://arxiv.org/abs/2405.07992 (accessed: 08.06.2026).</mixed-citation>
			</ref>
			<ref id="B16">
				<label>16</label>
				<mixed-citation publication-type="confproc">Chen Z. GradNorm: Gradient Normalization for Adaptive Loss Balancing in Deep Multitask Networks / Z. Chen, V. Badrinarayanan, C.-Y. Lee [et al.] // Proceedings of the 35th International Conference on Machine Learning (ICML). — PMLR, 2018. — Vol. 80. — P. 794–803.</mixed-citation>
			</ref>
			<ref id="B17">
				<label>17</label>
				<mixed-citation publication-type="confproc">Howard A. Searching for MobileNetV3 / A. Howard, M. Sandler, G. Chu [et al.] // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). — 2019. — P. 1314–1324. — DOI: 10.1109/ICCV.2019.00140.</mixed-citation>
			</ref>
			<ref id="B18">
				<label>18</label>
				<mixed-citation publication-type="confproc">Hendrycks D. Benchmarking Neural Network Robustness to Common Corruptions and Perturbations / D. Hendrycks, T. Dietterich // International Conference on Learning Representations (ICLR). — 2019. — arXiv:1903.12261.</mixed-citation>
			</ref>
			<ref id="B19">
				<label>19</label>
				<mixed-citation publication-type="confproc">MS1M-ArcFace Dataset // Kaggle. — URL: https://www.kaggle.com/datasets/yakhyokhuja/ms1m-arcface-dataset?resource=download (accessed: 08.06.2026).</mixed-citation>
			</ref>
		</ref-list>
	</back>
	<fundings/>
</article>