Модифицированный Mamba-контроллер с семантической адаптацией для дифференцируемой регистрации лиц в интеллектуальных транспортных системах

Научная статья
  • Куликов Александр Анатольевич0000-0002-8443-3684Научно-исследовательский и проектно-конструкторский институт информатизации, автоматизации и связи на железнодорожном транспорте, Москва, Российская Федерация; Финансовый университет, Москва, Российская Федерация
https://doi.org/10.60797/IRJ.2026.170.48
DOI:
https://doi.org/10.60797/IRJ.2026.170.48
EDN:
DDOUAZ
Предложена:
13.06.2026
Принята:
22.07.2026
Опубликована:
17.08.2026
Выпуск: № 8 (170), 2026
Выпуск: № 8 (170), 2026
Правообладатель:авторы.
Лицензия:Attribution 4.0 International (CC BY 4.0)
33
0
XML
PDF

Аннотация

В работе рассматривается проблема накопления ошибок в классических двухэтапных конвейерах распознавания лиц. Проблема обусловлена разрывом графа вычислений между этапами геометрической регистрации и идентификации. Ошибка локализации ключевых точек необратимо снижает качество эмбеддинга, поскольку градиент функции потерь распознавания не передается модулю выравнивания. Этот эффект особенно критичен для видеоподсистем интеллектуальных транспортных систем (ИТС), функционирующих в условиях вибрации, переменного освещения и агрессивного сжатия видеопотока. Предложен модифицированный контроллер дифференцируемой регистрации на основе модели пространства состояний (State Space Model, SSM) архитектуры Mamba.

Ключевой вклад — механизм семантической адаптации — обогащение последовательности 68 ключевых точек обучаемыми поточечными эмбеддингами их анатомической роли (зоны глаз, носа, рта, контура), type-conditioned селективность и иерархическая инициализация скоростей затухания скрытого состояния, согласованная со стабильностью анатомических зон. Контроллер интегрирован в единый дифференцируемый конвейер с CNN-энкодером MobileNetV3-Small и обучается end-to-end с регуляризованной функцией потерь, сочетающей ArcFace и геометрический штраф. На бенчмарке LFW модель показывает сопоставимую с современными решениями точность 99.89% при 1.6 млн параметров, 0.26 GFLOPs и времени инференса 4.3 мс; по предварительным данным (один прогон, seed=42) на авторском деградированном наборе (JPEG q=30, шум, аффинные искажения) она сохраняет 98.4% точности против 71.8% у канонической связки ArcFace+Dlib, что соответствует разрыву 26.6 процентного пункта. Сложность контроллера линейна по числу ключевых точек, что существенно для плотных схем разметки; при используемых 68 точках главный выигрыш составляют параметрическая эффективность и учет анатомической структуры.

1. Введение

Обеспечение безопасности на объектах транспортной инфраструктуры все чаще связывают с переходом от реактивных мер к превентивному непрерывному мониторингу. Видеоподсистемы интеллектуальных транспортных систем (ИТС) — бортовые и салонные камеры мониторинга состояния водителя, терминалы биометрического контроля доступа, камеры пропускных и досмотровых пунктов — функционируют в существенно более тяжелых условиях, чем офисные сценарии. Например, низкая и переменная освещенность, вибрация, смаз от движения, загрязнение оптики и агрессивное сжатие видеопотока в каналах ограниченной пропускной способности

,
. При этом ошибки идентификации в транспортном контуре напрямую затрагивают безопасность участников движения, что выводит задачу устойчивого к деградации изображения распознавания лиц в число прикладных задач интеллектуализации управления транспортными процессами и средствами. Эволюция систем биометрической идентификации в обеспечении безопасности железнодорожного транспорта — от классических конвейеров к дифференцируемым гибридным архитектурам — рассмотрена в
. Вопросы автоматизации технологических процессов и сквозного контроля участников перевозочного процесса рассматривались, в частности, в работах
,
. Предлагаемая архитектура ориентирована прежде всего на видеоподсистемы ИТС, сохраняя при этом применимость и в других областях биометрической идентификации.

Современные системы распознавания лиц достигли высокой точности на стандартных бенчмарках, однако в подавляющем большинстве строятся по двухэтапной схеме: детекция и геометрическое выравнивание лица по ключевым точкам, а затем — извлечение эмбеддинга и его сравнение с эталонами. Такая декомпозиция упрощает разработку, но порождает разрыв вычислительного графа между этапами: первый выступает «черным ящиком» для второго, и ошибки локализации ключевых точек на 2–5 пикселей, неизбежные при плохом освещении, закрытии лица или сильном ракурсе, приводят к некорректному аффинному преобразованию и каскадно переносятся на распознавание. Поскольку градиент от функции потерь идентификации не распространяется к модулю регистрации, эти искажения не компенсируются, а накапливаются

. При агрессивном JPEG-сжатии отказ детектора ключевых точек ведет к резкому падению точности распознавания.

Радикальным решением является переход к дифференцируемым (end–to–end) конвейерам, где параметры геометрической трансформации оптимизируются совместно с задачей распознавания. Базовая идея восходит к Spatial Transformer Networks (STN)

, впервые предложившим дифференцируемый модуль аффинного преобразования, сохраняющий поток градиентов сквозь операцию выравнивания. Вместе с тем классический STN опирается на полносвязный локализатор, плохо моделирует нелинейные зависимости между удаленными точками лица и ограничен в типах преобразований
. Близкое современное решение задачи робастного дифференцируемого выравнивания — ARoFace
— не использует механизм моделей пространства состояний. Механизмы внимания трансформеров имеют квадратичную по длине последовательности сложность O(N2), что затрудняет их применение на периферийных устройствах.

В последние годы модели пространства состояний (State Space Models, SSM), прежде всего архитектура Mamba

, продемонстрировали способность моделировать длинные зависимости при линейной сложности O(N), конкурируя с трансформерами при меньших затратах ресурсов. Тем не менее прямое применение стандартного Mamba к задаче геометрической регистрации не учитывает анатомическую семантику данных: для модели все ключевые точки являются равнозначными векторами координат, хотя глаза, нос, рот и контур челюсти обладают разной степенью вариативности и информативности. Возможность применения SSM для адаптивного управления регистрацией по антропометрическим точкам остается практически неисследованной.

Целью настоящей работы является разработка и исследование модифицированного Mamba–контроллера с механизмом семантической адаптации, позволяющего дифференцированно обрабатывать анатомические зоны лица для повышения устойчивости регистрации в условиях деградации видеопотока ИТС. Научная новизна состоит в способе интеграции SSM в дифференцируемый конвейер регистрации лица: насколько известно автору, впервые Mamba используется как контроллер конвейера распознавания лиц, учитывающего выравнивание (alignment–aware), последовательность ключевых точек обогащается обучаемыми эмбеддингами анатомической роли точек, а скорости затухания скрытого состояния инициализируются иерархически с учетом стабильности зон лица. Практическая значимость определяется вычислительной эффективностью полученной модели (1,6 млн параметров, 0.26 GFLOPs, 4,3 мс) и количественной характеристикой ее робастности к контролируемой деградации входных изображений.

2. Обзор современных методов

Эволюция методов распознавания лиц прошла путь от ручных геометрических и статистических признаков (Eigenfaces, Fisherfaces) и эластичных графов к глубоким сверточным сетям (DeepFace, FaceNet). Качественный скачок обеспечили функции потерь с угловым маржином (ArcFace

, CosFace, AdaFace, MagFace), ставшие стандартом де-факто; параллельно развивались легкие архитектуры (MobileFaceNet, MobileOne, EfficientFormer) для устройств с ограниченными ресурсами. Однако даже передовые модели сохраняют двухэтапную организацию, при которой регистрация лица по ключевым точкам (Dlib, MTCNN, HRNet) и распознавание являются независимыми подзадачами, что воспроизводит описанный во введении разрыв.

Парадигма дифференцируемой регистрации устраняет этот разрыв, превращая геометрическое выравнивание из внешнего автономного алгоритма во встроенный обучаемый модуль. Первым и наиболее влиятельным шагом стала работа над STN

, показавшая возможность сквозного распространения градиента через операцию выборки пикселей. Последующие расширения (TPS-STN, FiLM-модуляция, GridFace) и наиболее современное из них ARoFace
решают задачу робастного к выравниванию распознавания, однако ограничены классами преобразований либо действуют лишь на уровне функции потерь и не задействуют механизм SSM. Анализ показывает
, что STN эффективен для аффинных преобразований, но плохо справляется с нелинейными деформациями мимики, а полносвязный локализатор снижает интерпретируемость и робастность предсказания параметров трансформации.

Модели пространства состояний предлагают иную алгоритмическую основу: последовательность описывается рекуррентным скрытым состоянием, кодирующим долгосрочные зависимости с линейной сложностью O(N). Модель S4

ввела структурированную HiPPO-параметризацию матрицы состояния, обеспечившую удержание информации на тысячах шагов и интерпретацию рекуррентной обработки как глобальной свертки. Mamba
устранила статичность классических SSM, сделав параметры B, C и шаг дискретизации Δ функциями входного сигнала (input-driven селективность): модель динамически выбирает, какие части истории запоминать. Семейство S5
упрощает модель, используя диагональную поканальную матрицу состояния (как диагональную аппроксимацию HiPPO-инициализации); этот подход концептуально близок к применяемой в настоящей работе type-conditioned селективности — селективности, обусловленной типом ключевой точки.

В компьютерном зрении SSM адаптированы как самостоятельный визуальный backbone (опорную сеть): Vision Mamba

вводит двунаправленный SSM-блок, а VMamba — cross-scan механизм покрытия пространственных зависимостей; обе конкурентоспособны с трансформерами при меньших затратах. Формируется и тенденция гибридизации CNN и SSM, сочетающей локальную чувствительность сверток с глобальным контекстом SSM (U-Mamba, ConvMambaSR). Критический контраргумент дает MambaOut
: в классификации изображений SSM-блоки не приносят существенного выигрыша против тщательно настроенных сверточных моделей; эта критика, однако, относится к чистым SSM-классификаторам и не отменяет преимуществ SSM в задачах с явной последовательной структурой, какой является последовательность ключевых точек лица.

Таким образом, ни один из существующих подходов не обеспечивает одновременно высокой точности, вычислительной эффективности и робастности к геометрическим искажениям в условиях неконтролируемой съемки, а гибридные CNN-SSM архитектуры, явно спроектированные для совместной дифференцируемой регистрации и распознавания лиц, в литературе не описаны: существующие гибриды заменяют внимание в задачах классификации и сегментации общего назначения, не интегрируя геометрическое выравнивание. Этот научный пробел определяет постановку настоящего исследования.

3. Математическая модель семантически адаптированного SSM

3.1. Дифференцируемая регистрация

Для устранения указанного пробела сначала формализуем дифференцируемую регистрацию, а затем введем семантически адаптированную SSM, управляющую ее параметрами. Пусть входное изображение лица задается тензором

. Цель получить нормализованное представление, инвариантное к аффинным искажениям, но сохраняющее семантические особенности лица; в отличие от классического подхода, где выравнивание выполняется внешним алгоритмом, весь процесс полностью дифференцируем. Параметры аффинного преобразования предсказываются обучаемым локализатором
, где
формирует матрицу

Координаты выходной сетки отображаются в исходное изображение по обратному (backward) правилу

, после чего значение пикселя вычисляется билинейной интерполяцией

Билинейная интерполяция дифференцируема по (x,y), поэтому градиент функции потерь распространяется к параметрам трансформации и далее к параметрам локализатора по цепному правилу:

В качестве основной компоненты функции потерь принят ArcFace

, вводящий угловой маржин m между классами в нормализованном пространстве признаков:

,

где s — масштаб, θarc,j — угол между текущим эмбеддингом и центроидом класса j (обозначение θarc отделено от вектора параметров трансформации θ). В отличие от полносвязного локализатора STN, функция floc реализуется как гибридный CNN–SSM-блок, кодирующий долгосрочные зависимости между всеми ключевыми точками, что повышает устойчивость предсказания θ при частичном закрытии лица и сильном ракурсе.

3.2. Семантическое обогащение последовательности ключевых точек

В предлагаемой архитектуре SSM получает на вход не последовательность патчей изображения, а упорядоченную последовательность координат лицевых ключевых точек

и переосмысливается как инструмент моделирования пространственной геометрии объекта. Поскольку координаты сами по себе несут мало семантической информации — модель не «знает», является ли точка центром глаза или уголком рта, — каждой из 68 точек схемы разметки сопоставляется собственный обучаемый эмбеддинг etk, кодирующий ее анатомическую роль (обучается 68 поточечных векторов); анатомические же группы (глаза, нос с бровями, рот, контур) используются далее только для иерархической инициализации спектра Λ и интерпретации. Входной вектор шага k формируется конкатенацией спроецированных координат и эмбеддинга:

,

где

проекция координат,
– проекция эмбеддинга типа. В реализации dp = de = 32, так что размерность токена равна 2dp = 64, после чего он линейно проецируется в скрытую размерность Dmodel = 512. Введение поточечных эмбеддингов дает сети информацию об анатомической роли точки, отсутствующую в стандартном Mamba.

3.3. Type-conditioned селективность

Дискретная SSM описывается рекуррентным уравнением

. В каноническом Mamba селективны параметры. В каноническом Mamba селективны параметры B, C и шаг дискретизации Δ, задаваемые линейными проекциями текущего входа xk. В предлагаемой модификации селективность сохранена для B и Δ, которые обусловливаются обучаемым эмбеддингом анатомического типа точки etk, а не значением входа; роль выходного отображения C выполняет обучаемая readout-проекция gψ конечного состояния hn (см. раздел 4. Реализация):

где σ(⋅) — сигмоида,

Wr, WΔ — обучаемые проекции,

δ > 0 — масштабирующая константа.

Базовая матрица входа B при этом не статична: в реализации она порождается из того же эмбеддинга типа двухслойным MLP

, после чего гейтируется множителем σ(Wretk) и дискретизируется с шагом. Такой подход позволяет контроллеру дифференцировать зоны: для стабильных модель интегрирует информацию на длинных интервалах, для подвижных – быстрее обновляет состояние, реагируя на мимику. Вычислительная сложность снижается относительно канонического Mamba за счет того, что проекции вычисляются от 32-мерного эмбеддинга типа, а не от 512-мерного входного токена; интерпретируемость при этом повышается. Термин «Mamba-контроллер» сохранен, поскольку сохранен ключевой принцип селективности Mamba — зависимость B и Δ от контекста, — однако условие перенесено со значения входа на дискретный анатомический тип; формально такая конструкция ближе к классу S5
.

3.4. Иерархическая инициализация спектра Λ

Матрица состояния использует структурированную диагональ-плюс-низкоранговую параметризацию HiPPO/S4, A = Λ – pqT, Λ = diag (λ_1,…,λ_N ), λi < 0. Элементы λi интерпретируются как скорости затухания информации о различных геометрических модах. Авторская иерархическая инициализация связывает значения λi с анатомическими группами точек:

Меньший модуль соответствует стабильной области (нос, глаза) и длительному удержанию состояния; больший — вариативной зоне (рот, контур), для которой задается быстрое затухание шума артикуляции. Динамическая устойчивость требует условия

, которое достигается параметризацией
: множитель σ(S) ∈ (0, 1)N удерживает собственные значения внутри единичного круга, а инициализация (приведенная выше) задает согласованные начальные скорости затухания. Безусловно (при любом Δk > 0) оно выполняется лишь для точной ZOH-дискретизации; для используемой в реализации Euler-аппроксимации при Re(λi (A)) < 0 устойчивость гарантируется при ограниченном сверху шаге 0 < Δk Δmax (из требования
); при рабочих
и
численная устойчивость подтверждена эмпирически, что обеспечивает ограниченность ∥hk∥ при ограниченном входе.

3.5. Регуляризатор и гибридный блок

Предложенный контроллер интегрируется в конвейер из пяти ступеней:

(1) CNN-энкодер MobileNetV3-Small извлекает признаковую карту F;

(2) keypoint-голова (голова предсказания ключевых точек) регрессирует координаты 68 точек через heatmap-представление (тепловую карту);

(3) координаты объединяются с эмбеддингами типов;

(4) Mamba-блок обрабатывает обогащенную последовательность и предсказывает θ ∈ R6;

(5) дифференцируемый сэмплер применяет θ к карте F, формируя выровненную карту F', на которую действует голова распознавания. Чтобы предотвратить вырожденные преобразования (коллапс изображения в линию или точку), в функцию потерь введен регуляризатор

где M — линейная часть аффинной матрицы;

θid = [1, 0, 0, 0, 1, 0]T — параметры тождественного преобразования.

Первый член (норма Фробениуса) штрафует отклонение от тождественного преобразования и обнуляется при identity-старте; второй препятствует обращению |det(M)| в нуль, сохраняя обратимость и ориентацию; использование det(M)2 вместо |det(M)| устраняет излом производной в нуле. Полная потеря имеет аддитивный вид Ltotal =LArcFace + λ ⋅ Lreg, λ = 10-4; начальное значение λ устанавливается эвристической балансировкой норм градиентов по аналогии с GradNorm

, после чего фиксируется.

4. Реализация

Модель реализована на PyTorch 2.1.0 с CUDA 12.1 и библиотекой mamba_ssm 1.1.0. Входное изображение

преобразуется CNN-энкодером MobileNetV3-Small
в признаковую карту с D = 576 каналами; выбор обусловлен пригодностью для edge-устройств: число операций более чем втрое ниже, чем у ResNet-50, при сопоставимом качестве признаков. Heatmap-голова извлекает из карты координаты 68 точек (каждый канал отвечает за одну точку, координаты — взвешенное среднее активаций). Последовательность передается Mamba-контроллеру с описанной выше type-conditioned селективностью и иерархической λ-инициализацией. Readout-проекция конечного состояния gψ реализована двухслойным MLP с «бутылочным горлышком», выдающим вектор
.

Важным элементом реализации является identity-инициализация выходного слоя контроллера: параметры последнего линейного слоя gψ инициализируются так, чтобы при начале обучения θ0 соответствовало тождественному аффинному преобразованию (M0 = I, нулевые сдвиги). Это дает сети «безопасную» точку отсчета F' ≈ F и предотвращает разрушение предобученных сверточных признаков на ранних эпохах. Группы анатомических индексов в финальной конфигурации (68-точечная разметка Multi-PIE) распределены следующим образом: контур лица — точки 0–16 с λ = -0,8; брови и нос -– точки 17–35 с λ = -0,3; глаза — точки 36–47 с λ = -0,5; рот — точки 48–67 с λ = -1,0. Объединение бровей с группой носа отражает то, что диапазон 17–35 в основном покрывает переносицу и спинку носа, а инициализация задает лишь стартовые значения, корректируемые обучением.

Обучение проводится в два этапа. На стадии warm-up (разогрев, 5 эпох) CNN-энкодер заморожен, обучаются keypoint-голова, контроллер и голова распознавания; identity-инициализация θ стабилизирует начальную фазу. На этой стадии к функции потерь добавляется компонента

— L2-расстояние до ground-truth ключевых точек из WFLW-аннотаций; внешняя разметка используется только для инициализации keypoint-головы; в режиме инференса внешний детектор не применяется, что сохраняет тезис об end-to-end-обучении. На стадии полного обучения (full training, 50 эпох) все слои размораживаются и дообучаются совместно оптимизатором AdamW (начальная скорость обучения, learning rate, 3 ⋅ 10-4, коэффициент затухания весов (weight decay) 10-4, scheduler ReduceLROnPlateau, размер батча 128) на NVIDIA A100. Без регуляризатора нормы градиентов по θ на порядок превышают нормы по весам CNN, и задача регистрации доминирует; введение Lreg с λ = 10-4 выравнивает масштабы. Воспроизводимость обеспечивается фиксированным seed = 42, детерминированным режимом cuDNN и закрепленными версиями библиотек. Triton-ядра не гарантируют побитовую детерминированность: повторные запуски с тем же seed = 42 дают разброс точности на LFW в пределах ±0,05%; эта оценка характеризует недетерминизм вычислений и не заменяет валидацию по нескольким независимым значениям seed. Обученная модель занимает около 6.5 МБ (FP32, 1.6 млн параметров) и около 1.7 МБ при квантизации INT8.

5. Методика эксперимента

Экспериментальное исследование проводилось на унифицированном вычислительном стенде (Intel Xeon Gold 6248R, NVIDIA A100 40 ГБ, 192 ГБ ОЗУ) с фиксированными версиями программного обеспечения и seed = 42. Для предобучения CNN-энкодера и головы распознавания использовалась очищенная исследовательская версия набора MS-Celeb-1M (в литературе известная как MS1MV2)

; для обучения и оценки keypoint-головы и контроллера – WFLW (10 000 изображений in-the-wild, то есть снятых в неконтролируемых условиях; первые 68 точек разметки Multi-PIE); для финальной верификации — LFW по протоколу «unrestricted with labeled outside data» (6000 пар; точность вычисляется при пороге, соответствующем точке равенства FAR и FRR). Качество локализации оценивалось метрикой NME, нормализованной по межзрачковому расстоянию, и метрикой PCKh; вычислительная эффективность — временем инференса полного цикла от загрузки изображения до получения эмбеддинга (усреднение по 1000 прогонов), числом параметров и FLOPs. Замеры выполнялись в типовых для каждого конвейера режимах исполнения: GPU-этапы — на A100, CPU-этап Dlib — на процессоре Intel Xeon; сравнение времени относится к полным конвейерам при гетерогенном исполнении.

Для оценки робастности в условиях, приближенных к реальной эксплуатации, сформирован авторский деградированный набор на основе LFW по методологии Hendrycks & Dietterich

: к каждому изображению одновременно применялись JPEG-сжатие с качеством 30 (имитация узких каналов передачи), гауссов шум со стандартным отклонением σ = 0,01 и случайные аффинные искажения (поворот ± 30, масштабирование [0.8,1.2], сдвиг до 10% размера изображения). Набор не использовался при обучении; случайные аффинные преобразования генерируются детерминированно при фиксированном seed = 42, а скрипт генерации набора и конфигурация деградаций входят в экспериментальный протокол работы и доступны у автора по обоснованному запросу. В качестве базовых моделей выбраны представители ключевых парадигм: канонический двухэтапный конвейер ArcFace+Dlib (детекция и локализация 68 точек Dlib, выравнивание методом наименьших квадратов, распознавание ArcFace на ResNet-100), легкая одностадийная MobileFaceNet, дифференцируемая STN-ArcFace (полносвязный локализатор STN после MobileNetV3-Small) и SSM-архитектура Vision Mamba (Vim-Tiny, привлекается для оценки применимости класса архитектур, а не как SOTA-baseline). Все базовые модели переобучены и протестированы в идентичных условиях единого стенда, поэтому их показатели могут отличаться от значений, опубликованных в оригинальных работах в иных конфигурациях обучения; сравнение корректно внутри единого протокола. Сводные характеристики приведены в таблице 1.

Сравнительная характеристика базовых моделей и предложенного решения

Модель

Тип подхода

Энкодер

Метод регистрации

Параметры, млн

FLOPs, G

Inference, мс

ArcFace + Dlib

двухэтапный

ResNet-100

внешний (Dlib)

55,7

11,3

42,1

MobileFaceNet

одностадийный

MobileNet-like

нет

0,98

0,22

3,8

STN-ArcFace

дифференцируемый

MobileNetV3-Small

STN (MLP)

1,5

0,25

4,1

Vision Mamba (Vim)

SSM-based

Vim-Tiny

нет

5,8

1,7

18,5

Предложенная модель

гибридный (CNN+SSM)

MobileNetV3-Small

Mamba-контроллер

1,6

0,26

4,3

Как видно из таблицы 1, по вычислительной сложности предложенная модель сопоставима с легкими решениями (MobileFaceNet, STN-ArcFace), но вводит принципиально иной механизм управления регистрацией. Обработка биометрических данных регулируется в Российской Федерации Федеральным законом № 152-ФЗ, в международной практике — GDPR (ст. 9); все эксперименты выполнены на публично доступных академических наборах в исследовательских целях без идентификации частных лиц. Исходный набор MS-Celeb-1M был отозван правообладателем (Microsoft) в 2019 г. по соображениям защиты персональных данных, поэтому его очищенная исследовательская версия (MS1MV2) использована только для предобучения, без распространения исходных изображений.

6. Результаты

На стандартном бенчмарке LFW предложенная модель показала точность 99,89%, сопоставимую с лучшими из сравниваемых архитектур (таблица 2). Разница с ArcFace+Dlib (+0,06 п.п.) находится в пределах наблюдаемой дисперсии запусков; результат интерпретируется как сопоставимая точность при существенно более легком энкодере (MobileNetV3-Small против ResNet-100).

Результаты верификации на наборе LFW

Модель

Accuracy, %

AUC

Предложенная модель

99,89

0,9995

ArcFace + Dlib

99,83

0,9993

Vision Mamba (Vim)

99,30

0,9982

STN-ArcFace

98,95

0,9963

MobileFaceNet

98,72

0,9951

Ключевые различия проявляются на авторском деградированном наборе (таблица 3). По проведенным экспериментам (seed=42) предложенная модель сохранила точность 98,4%, тогда как у ArcFace+Dlib она снизилась до 71,8%; межмодельный разрыв составляет 26,6 процентного пункта. Время инференса предложенной модели (4,3 мс) при этом существенно меньше, чем у двухэтапной связки (42,1 мс); в последнюю входят CPU-этап Dlib (детекция и локализация точек) и GPU-этап распознавания, поэтому разрыв отражает в том числе гетерогенность исполнения, а не только глубину сетей. Результат отражает преодоление ограничения жесткого разделения этапов: обученный end-to-end Mamba-контроллер адаптивно корректирует выравнивание, компенсируя искажения, тогда как внешний детектор Dlib и жесткий STN менее устойчивы.

Результаты на авторском деградированном наборе (JPEG q = 30 + шум + аффинные искажения)

прочерки у MobileFaceNet означают, что метрики локализации неприменимы – модель не использует ключевые точки

Модель

Accuracy, %

NME, %

PCKh, %

Inference, мс

Предложенная модель

98,4

3,82

94,3

4,30

ArcFace + Dlib

71,8

5,67

82,1

42,10

Vision Mamba (Vim)

91,1

4,25

89,7

18,50

STN-ArcFace

85,3

4,51

87,2

4,10

MobileFaceNet

82,0

-

-

3,80

Для локализации источника робастности проведена серия экспериментов с разными типами деградации (таблица 4). Необходимо оговорить протокол: значения строки «JPEG (качество = 30)» таблицы 4 поэлементно совпадают с таблицей 3 (98,4 / 71,8 / 91,1) — это то же измерение на авторском наборе, обозначаемое по доминирующему фактору деградации; изолированный вклад сжатия без шума и аффинных искажений отдельно не оценивался, и данную строку следует читать как оценку на комбинированном наборе, тогда как строки с шумом, поворотом и масштабом характеризуют отдельные факторы. Вследствие различия протоколов строки таблицы 4 корректно сравнивать между моделями, но не между собой. На комбинированном наборе точность всех моделей оказывается выше, чем при изолированном повороте на ±30°. Преимущество предложенной модели сохраняется во всех сценариях, но наиболее выражено при геометрических искажениях (поворот, масштаб), что напрямую подтверждает эффективность адаптивного управления геометрией через Mamba-контроллер.

Точность моделей при различных типах деградации (на LFW)

строка «JPEG (качество = 30)» соответствует авторскому комбинированному деградированному набору (JPEG-сжатие + шум + аффинные искажения; те же значения, что в таблице 3), а не изолированному JPEG-сжатию; остальные строки характеризуют каждый фактор деградации по отдельности, поэтому строки таблицы сопоставимы между моделями, но не между собой

Тип деградации

Предложенная модель, %

ArcFace + Dlib, %

Vision Mamba, %

Исходный LFW

99,89

99,83

99,30

JPEG (качество = 30)

98,40

71,80

91,10

Гауссов шум (σ = 0,01)

98,95

85,20

93,50

Поворот (± 30)

97,80

68,40

89,20

Масштаб (0,8–1,2)

98,10

75,60

90,80

Вклад компонентов оценен абляционным исследованием (таблица 5) с поэтапным наращиванием архитектуры от MLP-контроллера к полной модели. Добавление блока Mamba дает прирост точности на деградированных данных почти на 9 п.п. относительно MLP, однако ключевой вклад вносит семантическая адаптация: эмбеддинги типов (Type Embeddings) добавляют еще ~2,9 п.п., подтверждая, что знание анатомической роли точки помогает фильтровать шум, а иерархическая инициализация Λ стабилизирует обучение и дает дополнительный прирост робастности при сильных геометрических искажениях. Эти выводы согласуются с дополнительной серией абляций, выполненной по схеме исключения одного компонента (leave-one-out) из полной модели. В отличие от таблицы 5, где архитектура наращивается от MLP-базлайна и каждый прирост измеряется относительно предыдущей конфигурации, в этой серии вклад компонента оценивается как падение точности при его удалении из полной модели; различием схем измерения и объясняется несовпадение числовых значений двух рядов. Так, замена эмбеддингов типов на простую конкатенацию снижает точность на 4,2 п.п., замена Mamba-контроллера на полносвязный слой — на 6,8 п.п., а отключение регуляризатора Lreg вызывает нестабильность обучения и вырождение трансформаций в 12% случаев (приросты и потери точности здесь и выше указаны в процентных пунктах).

Результаты абляционного исследования компонентов Mamba-контроллера

Модель

Accuracy LFW (clean), %

Accuracy Degraded, %

NME WFLW, %

Параметры, млн

Baseline (MLP-контроллер)

98,95

85,30

4,51

1,5

Standard Mamba

99,70

94,20

3,95

1,6

+ Type Embeddings

99,82

97,10

3,88

1,6

+ Hierarchical Λ Init

99,85

97,80

3,85

1,6

Full Proposed Model

99,89

98,40

3,82

1,6

Анализ гиперпараметров показал, что оптимально 68 ключевых точек: меньшее количество (20) дает недостаток информации о геометрии, большее (98) — шум от менее устойчивых точек (например, на контуре волос) и снижение точности на проверочной выборке; недостаточный размер скрытого состояния не позволяет кодировать зависимости между точками, чрезмерный — ведет к переобучению. Конфигурация Dmodel = 512, dstate = 16, n = 68 принята как компромисс.

7. Обсуждение и ограничения

Предложенный механизм семантической адаптации отвечает на ключевую проблему применения SSM к геометрическим данным: в отличие от однородных токенов текста, каждая точка лица несет уникальную смысловую нагрузку. Type-conditioned селективность реализует аналог «структурного внимания» с линейной сложностью O(N). Оговорим пределы этого аргумента: при n = 68 выигрыш асимптотики невелик (матрица сходства 68 × 68 вычислительно дешева), и практическое преимущество составляют параметрическая эффективность и индуктивное смещение анатомической структуры; линейная сложность значима для плотных схем разметки (98 и более точек, 3D-представления) и видеопоследовательностей. При этом собственный анализ показал, что 98 точек снижают точность, поэтому масштабирование по числу точек – направление дальнейшей работы, а не доказанное преимущество. Профиль эффективности (1,6 млн параметров, 0.26 GFLOPs, 4,3 мс, 1,7 МБ в INT8) по порядку величины соответствует возможностям встраиваемых платформ класса NVIDIA Jetson и NPU бортовых видеорегистраторов, однако фактические замеры на периферийном оборудовании остаются необходимым условием практического внедрения.

Полученная робастность имеет прямое прикладное значение для видеоподсистем ИТС: терминалы биометрического контроля на пропускных пунктах и в депо, турникетные комплексы вокзалов и салонные камеры мониторинга водителя работают именно при агрессивном сжатии видеопотока и геометрических искажениях (поворот ± 30 — прокси вибрационных смещений камеры), где преимущество модели выражено сильнее всего. Количественная оценка сложных сценариев очерчивает границы применимости: частота ошибок предложенной модели составляет 8,2% при частичном закрытии лица маской, 12,1% при контровом свете, 18,9% при экстремальном профиле (> 60) и 15,4% при сильном размытии движения — против 22,5%, 35,7%, 48,2% и 41,0% соответственно у ArcFace+Dlib. Подчеркнем также, что деградированный набор производен от LFW (та же популяция лиц), поэтому сохранение 98,4% точности не переносится автоматически на иные домены съемки.

Результаты имеют ряд ограничений. Во-первых, все числовые показатели получены в одном прогоне обучения с seed = 42 и носят предварительный характер; разброс ±0,05% на LFW от недетерминизма triton-ядер характеризует лишь вычислительный шум, а строгая валидация по нескольким независимым значениям seed (3 и более) с построением доверительных интервалов запланирована, но не выполнена. Во-вторых, пригодность к edge-развертыванию опирается на профиль сложности, измеренный на серверном GPU, и не подтверждена замерами на периферийных устройствах. В-третьих, метод предполагает знание топологии лица (фиксированную схему разметки): в биометрии это требование обычно выполняется, но оно ограничивает перенос подхода на произвольные классы объектов. Наконец, приведенные выше частоты ошибок в экстремальных сценариях показывают, что точность модели снижается при сильном закрытии лица и экстремальных ракурсах, отражая зависимость от наличия достаточного количества видимых ключевых точек для корректного анализа геометрии. Применение к мониторингу состояния водителя (DMS) рассматривается как потенциальное направление и экспериментально в настоящей работе не проверялось.

8. Заключение

В работе предложен и исследован модифицированный Mamba-контроллер с механизмом семантической адаптации для дифференцируемой регистрации лиц в составе единого end-to-end конвейера с CNN-энкодером MobileNetV3-Small.

Экспериментальное исследование показало, что предложенные модификации обеспечивают сопоставимую с современными решениями точность на чистом бенчмарке LFW (99,89%) при существенно более легком энкодере и, по проведенным экспериментам (seed=42) имеет повышенную робастность к деградации входных изображений: на авторском деградированном наборе модель сохраняет 98.4% точности против 71,8% у канонической связки ArcFace+Dlib (разрыв 26,6 процентного пункта) при времени инференса 4,3 мс против 42,1 мс у двухэтапной связки. Необходимо подчеркнуть, что это сопоставление времени получено при гетерогенном исполнении конвейеров (CPU-этап локализации Dlib против полностью GPU-исполнения предложенной модели), поэтому наблюдаемый разрыв во времени отражает не только различие архитектур, но и условия исполнения. Вычислительная эффективность (1,6 млн параметров, 0.26 GFLOPs) делает архитектуру потенциально пригодной для систем реального времени, в том числе для видеоподсистем интеллектуальных транспортных систем; вместе с тем тезис о пригодности к edge-развертыванию опирается на профиль сложности, измеренный на серверном GPU, и требует подтверждения прямыми замерами на встраиваемом оборудовании. Дальнейшие направления работы включают статистическую валидацию по нескольким независимым значениям seed с построением доверительных интервалов, замеры на периферийных устройствах и экспериментальную проверку применимости подхода к мониторингу состояния водителя.

Метрика статьи

Просмотров:33
Скачиваний:0
Просмотры
Всего:
Просмотров:33