Временны́е сети Колмогорова — Арнольда (T-KAN) для высокочастотного прогноза лимитного стакана: эффективность, интерпретируемость и затухание альфы

6/10

Ахмад Макинде · студент бакалавриата, Бристольский университет; независимый исследователь · 5 января 2026

Оригинал: Makinde, A. «Temporal Kolmogorov-Arnold Networks (T-KAN) for High-Frequency Limit Order Book Forecasting: Efficiency, Interpretability, and Alpha Decay», 2026 — arxiv.org/abs/2601.02310 (PDF).

Код: github.com/AhmadMak/Temporal-Kolmogorov-Arnold-Networks-T-KAN…

Исследование выполнено независимо от Бристольского университета.

Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по стандартной лицензии arXiv (non-exclusive distribution), которая производных произведений не разрешает: все права на оригинальный текст принадлежат автору, перевод выполнен для личного ознакомления с указанием источника.

Ключевые слова: лимитный стакан, затухание альфы, набор данных FI-2010, временна́я сеть Колмогорова — Арнольда, интерпретируемость, ПЛИС.

Аннотация

Среды высокочастотной торговли характеризуются большими объёмами данных лимитного стакана, которые печально известны своей зашумлённостью и нелинейностью. Затухание альфы представляет существенную трудность: традиционные модели вроде DeepLOB теряют предсказательную силу по мере роста горизонта $k$. В этой работе на данных набора FI-2010 мы вводим временны́е сети Колмогорова — Арнольда (T-KAN), заменяющие фиксированные линейные веса стандартных LSTM обучаемыми активационными функциями на основе B-сплайнов. Это позволяет модели выучивать «форму» рыночных сигналов, а не только их величину.

Результатом стало относительное улучшение F1-меры на 19,1% на горизонте $k = 100$. Эффективность сетей T-KAN трудно переоценить: они дали доходность 132,48% против просадки DeepLOB в −82,76% при транзакционных издержках 1,0 базисного пункта. Вдобавок модель T-KAN оказывается вполне интерпретируемой: «мёртвые зоны» ясно видны на сплайнах. Архитектура T-KAN также уникально приспособлена к низколатентной реализации на ПЛИС через высокоуровневый синтез.

1. Введение

Моделирование и прогноз ценовой динамики в лимитном стакане — фундаментальные задачи количественных финансов и микроструктуры рынка. В отличие от низкочастотных данных, стакан представляет собой высокоразмерную динамическую систему дискретных событий, где скрытое состояние спроса и предложения проявляется через размещение и снятие заявок на множестве ценовых уровней. Состояние стакана в момент $t$ можно представить вектором $L_t = \{P_t^{(i)}, V_t^{(i)}\}_{i=-n'}^{n}$, где $P$ и $V$ — цена и объём на уровне $i$, а положительные и отрицательные индексы обозначают стороны продажи и покупки соответственно.

В этом пространстве состояний важна аукционная фаза. Она характеризуется интенсивным ценообразованием и структурными сдвигами ликвидности: переход от закрытого аукциона к непрерывной торговле порождает режимы высокой волатильности. Для точного прогноза этот режим требует от модели способности улавливать сложные «путезависимые» нелинейности, где ценовое воздействие сделки есть динамическая функция текущей глубины книги и исторического потока заявок.

В исследовании используется 144-мерный вектор признаков, значения которого предварительно нормированы поставщиком данных z-стандартизацией. Для признака $x$ нормированное значение определяется как

$$\hat{x} = \frac{x - \mu}{\sigma}$$

где $\mu$ и $\sigma$ — среднее и стандартное отклонение, вычисленные по скользящему окну ради сохранения стационарности аукционной среды.

Традиционное прогнозирование существенно сместилось от линейных эконометрических моделей к глубоким рекуррентным архитектурам вроде LSTM. Однако стандартные LSTM опираются на фиксированные поточечные функции активации внутри механизмов вентилей. Стандартный вентиль LSTM определяется как:

$$i_t = \sigma\left(W_i \cdot [h_{t-1}, x_t] + b_i\right) \tag{1}$$

$$f_t = \sigma\left(W_f \cdot [h_{t-1}, x_t] + b_f\right) \tag{2}$$

$$o_t = \sigma\left(W_o \cdot [h_{t-1}, x_t] + b_o\right) \tag{3}$$

где $W$ — статические матрицы весов. Такая архитектура предполагает, что линейного преобразования с фиксированной нелинейностью достаточно для отображения признаков стакана в ценовые движения. Мы полагаем, что этот подход «универсальной аппроксимации» неэффективен по параметрам для улавливания локализованных осцилляций, свойственных микроструктурным данным.

В работе предлагается T-KAN как более удачная альтернатива для прогноза стакана. Заменяя статические матрицы $W$ обучаемыми одномерными сплайн-функциями, T-KAN реализует «вычисления на рёбрах». В конфигурации с 532 675 параметрами модель даёт многообразие высокого разрешения для улавливания агрессивного ценообразования в аукционном режиме набора FI-2010.

2. Обзор литературы

2.1. Глубокое обучение в микроструктуре рынка

Публикация эталонного набора FI-2010 в 2017 году дала стандартизованную крупномасштабную платформу для оценки моделей машинного обучения в прогнозе стакана. Ранние исследования использовали свёрточные нейросети для автоматического извлечения пространственных признаков из 40-мерных сырых данных стакана. Позже DeepLOB объединил свёрточные сети с LSTM для моделирования и пространственных, и временны́х зависимостей.

Эффективность этих моделей опирается на теорему об универсальной аппроксимации, утверждающую, что сеть с фиксированными активациями может приблизить любую непрерывную функцию. Будучи действенным, этот подход часто страдает от «проклятия размерности» при моделировании функций с высокочастотными компонентами. Это привело исследователей к таким архитектурам, как сеть TABL с билинейными проекциями, сжимающая признаки стакана с сохранением временны́х отношений.

2.2. Сети Колмогорова — Арнольда и теория сплайнов

Введение KAN-сетей Лю и соавторами (2024) стало значимой альтернативой многослойному перцептрону. Опираясь на теорему о представлении Колмогорова — Арнольда, многомерная непрерывная функция $f$ на ограниченной области представима как

$$f(x_1, \ldots, x_n) = \sum_{q=1}^{2n+1}\Phi_q\left(\sum_{p=1}^{n}\phi_{q,p}(x_p)\right) \tag{4}$$

где $\phi_{q,p}$ — одномерные непрерывные функции. В архитектуре KAN эти функции обычно параметризуются B-сплайнами. B-сплайн порядка $k$ определяется рекурсивно на сетке узлов $\{t_i\}$ по формуле рекурсии Кокса — де Бура:

$$N_{i,0}(x) = \begin{cases} 1, & t_i \le x < t_{i+1} \\ 0, & \text{иначе} \end{cases} \tag{5}$$

$$B_{i,k}(x) = \frac{x - t_i}{t_{i+k} - t_i}B_{i,k-1}(x) + \frac{t_{i+k+1} - x}{t_{i+k+1} - t_{i+1}}B_{i+1,k-1}(x) \tag{6}$$

Благодаря обучаемым сплайнам на рёбрах сети KAN выучивают саму функцию активации, что даёт более тонкую подгонку к нелинейным многообразиям стакана.

2.3. Рекуррентность и гибрид T-KAN

Теоретически KAN обладают большой выразительной способностью, однако исследования Ратера и соавторов (2024) выявили «временно́й разрыв»: обычные KAN хуже LSTM улавливают последовательные зависимости в задачах прогноза стохастических временны́х рядов. Причина отставания — отсутствие внутренних состояний памяти в стандартных архитектурах KAN.

В этой работе используется гибрид T-KAN (KAN-LSTM). В ячейке T-KAN слои KAN переопределяют вентили, превращая линейную логику вентилей в сплайновое функциональное преобразование. Для входного вектора $x_t$ и предыдущего скрытого состояния $h_{t-1}$ состояние ячейки $c_t$ и скрытое состояние $h_t$ обновляются так:

$$i_t = \sigma\left(\text{KAN}_i([x_t, h_{t-1}])\right) \tag{7}$$

$$f_t = \sigma\left(\text{KAN}_f([x_t, h_{t-1}])\right) \tag{8}$$

$$g_t = \tanh\left(\text{KAN}_g([x_t, h_{t-1}])\right) \tag{9}$$

$$o_t = \sigma\left(\text{KAN}_o([x_t, h_{t-1}])\right) \tag{10}$$

$$c_t = f_t \odot c_{t-1} + i_t \odot g_t \tag{11}$$

$$h_t = o_t \odot \tanh(c_t) \tag{12}$$

Кроме того, для преодоления дисбаланса классов в аукционном наборе FI-2010, где нейтральный класс ($y = 1$) составляет 65% распределения, мы применяем взвешивание по обратной частоте в многоклассовой перекрёстной энтропии:

$$L = -\frac{1}{N}\sum_{i=1}^{N}\sum_{c=1}^{3} w_c \cdot y_{i,c}\log\left(\hat{y}_{i,c}\right) \tag{13}$$

где $w_c = \frac{N}{3 n_c}$. При измеренном распределении $\{36\,533;\ 138\,391;\ 37\,135\}$ вычисленные веса составляют $[1{,}93;\ 0{,}51;\ 1{,}90]$.

3. Методология

3.1. Каркас данных и постановка обучения с учителем

Эмпирическая основа исследования — эталонный набор FI-2010, дающий стандартизованную высокочастотную среду для оценки моделей стакана. Хотя сырые 144-мерные признаки поступают уже с z-нормировкой, переход от дискретных снимков стакана к формату для глубокого обучения требует особого временно́го оформления.

Блок скользящего окна. Следуя стандартным протоколам обучения с учителем на данных стакана, мы используем скользящее окно. По последовательности нормированных состояний строится входной образец $X_t \in \mathbb{R}^{T \times 144}$, где $T = 10$ — горизонт ретроспективы. Это обеспечивает улавливание моделью «моментума потока заявок» и путезависимости ликвидности, а не только статического среза книги.

3.2. Спецификация архитектуры

Базовая линия DeepLOB (CNN-LSTM). Архитектура DeepLOB служит нашей пространственно-временно́й базовой линией. Используются ядра $1 \times 2$ для выделения спредов между покупкой и продажей, затем два ядра $4 \times 1$ для извлечения вертикальной микроструктурной глубины. Выход переставляется так, чтобы карты признаков соответствовали временно́й оси, после чего обрабатывается LSTM на 64 блока.

Предлагаемая конфигурация T-KAN. Архитектура использует двухслойный LSTM-кодировщик (64 скрытых блока) для улавливания высокочастотных зависимостей. Опираясь на теорему о представлении Колмогорова — Арнольда, финальное скрытое состояние $h_T$ обрабатывается классификационной головой на основе KAN. По сравнению со стандартной головой-перцептроном такая структура позволяет проецировать 256-мерное латентное представление на многообразие высокой размерности, где волатильные данные аукционной фазы могут быть эффективно разделены. Это ответ на ограничения фиксированных активаций в рекуррентных состояниях памяти, отмеченные в каркасе TKAN Жене и Инзирилло.

Рисунок 1
Рисунок 1. Экспериментальный конвейер T-KAN: переход от временно́го кодирования LSTM к функциональному отображению KAN. Вход $10 \times 144$ → двухслойный LSTM (64) → голова KAN (SiLU/сплайн) → выход; логика ребра T-KAN показана сплайнами $\phi_1$ и $\phi_2$.

3.3. Оптимизация и взвешивание по обратной частоте

Для устранения значительного дисбаланса классов в аукционном наборе FI-2010 в функции потерь применяется взвешивание по обратной частоте. Исходя из вычисленного распределения классов $\{36\,533;\ 138\,391;\ 37\,135\}$, веса $w_c$ назначаются так, чтобы модель не переобучалась на нейтральный класс. Мы также используем штраф разреженности $L_1$ с $\lambda = 10^{-4}$, обеспечивающий гладкость сплайнов.

4. Результаты

Эталонный набор FI-2010 использовался для оценки T-KAN против базовой линии DeepLOB. Оценка проводилась на горизонте прогноза $k = 100$ тиков — чтобы проверить устойчивость моделей к затуханию информации и смоделировать реалистичные торговые условия.

4.1. Сравнительные метрики

DeepLOB значительно уступил T-KAN по всем основным метрикам классификации. T-KAN достиг F1-меры 0,3995, что означает относительное улучшение на 19,1% по сравнению с базовой линией 0,3354. Кроме того, T-KAN показал лучшую точность (0,5343), что говорит о большей способности выявлять развороты тренда и снижать частоту ложноположительных сигналов исполнения.

Таблица 1. Сравнение результативности моделей на FI-2010 ($k = 100$).
МодельТочность (precision)Полнота (recall)F1-мера
DeepLOB (базовая линия)0,46040,43290,3354
T-KAN (предлагаемая)0,53430,47480,3995
Рисунок 2
Рисунок 2. Сравнительные метрики результативности DeepLOB и T-KAN ($k = 100$). T-KAN демонстрирует более высокую стабильность и точность при прогнозе на длинном горизонте.

4.2. Интерпретируемость модели и анализ активаций

Главное преимущество архитектуры T-KAN — внутренне присущая интерпретируемость через выученные функции активации, в отличие от традиционных ReLU. Модель T-KAN сошлась к нелинейной S-образной кривой (сигмоидальному B-сплайну). Эта выученная функция фактически создаёт «мёртвую зону» вблизи входов с нулевым средним, отфильтровывая микроструктурный шум и нелинейно усиливая сигналы высокой убеждённости из стакана.

Рисунок 3
Рисунок 3. Выученная активационная функция T-KAN на B-сплайнах. Нелинейная S-образная кривая позволяет модели отличать рыночный шум от пригодных к действию сигналов.

4.3. Тестирование с учётом транзакционных издержек

Для оценки экономической значимости предсказаний проведена симуляция торговли по средней цене с транзакционными издержками 1,0 базисного пункта. Разница в результатах огромна. Несмотря на базовую направленную точность DeepLOB, стратегия не смогла преодолеть трение исполнения, что дало итоговую доходность −82,76%.

Напротив, модель T-KAN дала итоговую доходность 132,48%. Это расхождение позволяет предположить, что T-KAN не просто предсказывает направление цены, но и выявляет режимы высокой убеждённости, где ожидаемое движение цены значительно превышает стоимость ликвидности. Хотя T-KAN использует существенно больший объём параметров (104 451 против 58 211), «плотность прибыльности» на параметр значительно выше, что оправдывает возросшую архитектурную ёмкость.

Рисунок 4
Рисунок 4. Сравнение накопленного PnL T-KAN и DeepLOB за тестовый период. Модель T-KAN демонстрирует значительно бо́льшую устойчивость к издержкам в 1,0 базисного пункта.

5. Заключение

Результаты эксперимента подтверждают гипотезу, что использование слоёв Колмогорова — Арнольда вместо стандартных линейных преобразований улучшает извлечение альфы из высокочастотных данных стакана. Выходя за пределы статических активаций базовой линии DeepLOB, архитектура T-KAN демонстрирует превосходящую способность отображать нелинейную динамику рыночных структур.

5.1. Экономическая состоятельность и компромисс «прибыльность — ёмкость»

Лучшее свидетельство в пользу архитектуры T-KAN видно в тестировании с учётом издержек. Хотя модель T-KAN использовала большее число параметров (104 451) против базовой линии DeepLOB (58 211), эта возросшая ёмкость напрямую обернулась экономической состоятельностью. При издержках 1,0 базисного пункта базовая линия не смогла преодолеть трение исполнения, дав итоговую доходность −82,76%.

Совсем иначе повела себя T-KAN с итоговой доходностью 132,48%. Это позволяет предположить, что T-KAN не только достигает более высокой статистической точности, но именно выявляет дисбалансы ликвидности высокой убеждённости, остающиеся прибыльными и после учёта рыночных комиссий. Такая «плотность прибыльности» оправдывает 79,4-процентный рост числа параметров, поскольку модель успешно перешла из категории теоретического предиктора в категорию жизнеспособной торговой стратегии.

5.2. Устойчивость к затуханию альфы

Большая проблема высокочастотной торговли — затухание альфы, то есть быстрое обесценивание информации. По мере роста горизонта прогноза $k$ предсказательная сила традиционных моделей падает. Более высокая F1-мера T-KAN при $k = 100$ говорит о значительно большей устойчивости альфы. Улавливая фундаментальные геометрические свойства стакана в слоях KAN, модель дольше удерживает предсказательную информацию, чем базовая линия на свёрточных сетях, обычно крайне чувствительная к точному пространственному расположению заявок.

Рисунок 5
Рисунок 5. Сравнение затухания альфы: информационный коэффициент против горизонта прогноза $k$. T-KAN сохраняет более высокую предсказательную устойчивость на длинных горизонтах по сравнению с DeepLOB.

5.3. Отраслевая перспектива: интерпретируемость и реализация на ПЛИС

С отраслевой точки зрения T-KAN даёт два основных преимущества. Во-первых, выученные S-образные активации открывают интерпретируемое окно в процесс принятия решений модели, показывая автономную фильтрацию шума «отскока между bid и ask».

Во-вторых, архитектура T-KAN уникально приспособлена к сверхнизколатентному аппаратному ускорению. В отличие от плотного матричного умножения, используемого в глубоких LSTM или трансформерах, слои KAN опираются на локализованные вычисления B-сплайнов. Такая структура хорошо совместима с высокоуровневым синтезом для реализации на ПЛИС. Дальнейшая работа должна сосредоточиться на переносе T-KAN на аппаратуру ради достижения субмикросекундных скоростей вывода, необходимых маркетмейкерам первого эшелона и высокочастотным подразделениям.

Литература

Оригинал статьи: Makinde, A., «Temporal Kolmogorov-Arnold Networks (T-KAN) for High-Frequency Limit Order Book Forecasting», arXiv:2601.02310