HLOB — устойчивость информации и структура в книгах лимитных заявок

8.5/10

Антонио Бриола, Сильвия Бартолуччи, Томазо Асте · Department of Computer Science, University College London; Systemic Risk Centre, LSE · 4 июня 2024 (v3)

Переписка: Antonio Briola, antonio.briola.20@ucl.ac.uk. Код: github.com/FinancialComputingUCL/LOBFrame.

Оригинал: Briola, A., Bartolucci, S., Aste, T. «HLOB – Information Persistence and Structure in Limit Order Books», 2024 — arxiv.org/abs/2405.18938 (PDF), лицензия CC BY-NC-ND 4.0.

Рисунки и крупные таблицы воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY-NC-ND 4.0 (некоммерческое использование, без производных).

Аннотация

Мы вводим новую крупномасштабную модель глубокого обучения для прогноза изменений mid-цены книги лимитных заявок и называем её HLOB. Архитектура (i) использует информацию, закодированную информационно-фильтрующей сетью — Triangulated Maximally Filtered Graph, — чтобы выявить более глубокие и нетривиальные структуры зависимостей между уровнями объёма; и (ii) гарантирует детерминированные проектные решения для управления сложностью системы, опираясь на класс гомологических свёрточных сетей. Мы тестируем модель против девяти современных альтернатив на трёх реальных датасетах стакана, в каждом по 15 акций NASDAQ, и систематически характеризуем сценарии, где HLOB превосходит SoTA. Подход проливает новый свет на пространственное распределение информации в книгах заявок и на её деградацию с ростом горизонта прогноза, сужая разрыв между микроструктурным моделированием и прогнозом на глубоком обучении в высокочастотных рынках.

Ключевые слова: микроструктура рынка; книга лимитных заявок; эконофизика; высокочастотная торговля; глубокое обучение.

1. Введение

Финансовые рынки — сложные среды. Сложность идёт из двух факторов: (i) взаимодействие большого числа агентов с разнородными целями на разных временных масштабах, реализующих стратегии, рассчитанные на асимметричную информацию; (ii) возникновение самоорганизующихся коллективных поведений без центрального контроллера, которые поэтому трудно предвосхитить. Совпадение этих аспектов даёт спорадические и ограниченные во времени неэффективности, делающие торговлю прибыльной. Анализ существующих неэффективностей и прогноз новых опирается на математическое и статистическое моделирование рядов, отражающих поведение рынка. Гранулярность этих рядов сильно зависит от цели анализа; в высокочастотном случае (нас интересует именно он) она может быть событийной, вплоть до наносекунды [31].

Большинство современных бирж хранят обновления на уровне заявок в структурах, известных как книги лимитных заявок (LOB). В каждый момент в данной автоматизированной бирже эти структуры содержат снимок намерений участников купить или продать разные количества (объёмы) актива по данной цене. Такие намерения — «заявки» — бывают рыночными, лимитными и отменами; их поток (входящий или исходящий) обычно обрабатывается компьютеризованными системами с механизмом FIFO для приоритета исполнения [6, 8, 9, 11]. Тайминг доступа к информации книги даёт участникам асимметричные уровни информированности. На самом мелком уровне эксплуатации информации говорят о высокочастотной торговле (HFT): стратегиях, получающих преимущество за счёт скорости и действующих на информации, ещё недоступной другим [28]. HFT использует несовершенства микроструктуры во вред другим трейдерам, запуская динамику «хищник–жертва» [16]. Практика заметна на рынке с 2005 года [20]. Несмотря на критику и регуляторное внимание, показано, что опора HFT на рыночные данные разных уровней, а не на внешнюю информацию, вносит шум и тем самым сохраняет непредсказуемость движений цены акций [5].

Трудность обращения со сложностью HFT-систем и наличие больших объёмов данных стимулировали развитие моделей глубокого обучения для связанных задач моделирования и прогноза. За последние годы появились всё более изощрённые решения, часть из них — в сторону информированных архитектур, аккуратно включающих компоненты LOB в производные признаки. Хотя многие исследования показали потенциал этих подходов, разрыв между теоретическими результатами и практической применимостью остаётся заметным [43]. Недавняя работа Briola et al. [11] подчёркивает, что эффективность методов существенно зависит от уникальных микроструктурных характеристик акций. В частности, микроструктурные свойства акций с более высоким торговым риском («small-tick») навязывают более разреженные структуры книги, сильно подрывая способность глубоких архитектур моделировать скрытую динамику. Напротив, свойства акций с более низким риском («large-tick») навязывают более компактные книги, облегчая обработка информации.

Вклад статьи трояк:

  1. Мы вводим HLOB — новую крупномасштабную архитектуру глубокого обучения, которая использует класс гомологических свёрточных сетей [10, 58], чтобы наложить структуру зависимостей между уровнями объёма LOB и моделировать более глубокие нетривиальные связи между ними. Код всех экспериментов: LOBFrame.
  2. Мы показываем, что эксплуатируемость информационного содержания, закодированного пространственной структурой архитектуры, ограничена во времени, а скорость её деградации сильно зависит от микроструктурных свойств акций.
  3. Мы тестируем модель против девяти SoTA-альтернатив на трёх реальных датасетах LOB по 15 акций NASDAQ. Результаты подчёркивают трудность найти модель, стабильно превосходящую остальные; поэтому мы даём ориентиры выбора модели по желаемой интерпретируемости, горизонту прогноза и доступной инфраструктуре.

Дальше: раздел 2 — обзор работ по динамике LOB, архитектурам прогноза и интуиции информационно-фильтрующих сетей и HCNN; раздел 3 — данные; раздел 4 — устройство HLOB и каркас обучения; раздел 5 — результаты; раздел 6 — сильные и слабые стороны модели и открытые задачи.

Мы даём ссылки, необходимые чтобы (i) понять операционную механику LOB; (ii) познакомиться с моделями микроструктурных альф; (iii) ухватить теоретические основания HLOB. Исследование пересекает микроструктуру, глубокое обучение и науку о сетях. Мы не претендуем на полный обзор: для каждой области выборочно ссылаемся на работы, критически релевантные этой статье.

2.1. Книга лимитных заявок

Большинство современных бирж используют электронные системы записи и матчинга намерений участников. В центре — структура данных LOB, уникальная для каждой бумаги на данной бирже и дающая немедленный доступ к видимому спросу и предложению в реальном времени. Участники одной стороны рынка конкурируют друг с другом и одновременно противостоят противоположной стороне: покупатели хотят дешевле, продавцы — дороже, но сторонам нужны друг друг, чтобы сделки состоялись. Книга обновляется (тики) в нерегулярные моменты. События отражают изменения рынка и ограничены заранее заданными шагами: (i) размер тика $\theta$ для цен; (ii) лот $\psi$ для объёмов. На NASDAQ, источнике данных этой работы (разд. 3), $\theta=0.01$ доллара и $\psi=1$.

Обновления возможны через подачу новых заявок. По направлению — bid (покупка) или ask (продажа); по агрессивности — рыночные или лимитные. Рыночная заявка выражает необходимость купить или продать количество актива по текущей лучшей доступной цене на противоположной стороне; обычно с более высокой комиссией. Лимитная выражает намерение купить или продать по цене выгоднее котируемой на лучшем уровне; она встаёт в очередь на одном из более глубоких уровней, не гарантирует исполнения и обычно дешевле по комиссии. Отмены — третий класс: удаляют активные лимитки и обычно не облагаются комиссией.

Временно LOB устроена как стопка снимков тик за тиком и принимает вид многомерного ряда $L\in\mathbb{R}^{T\times 4L}$, где $T$ — длина истории, $L$ — число уровней (размерность $4L$, потому что на каждом уровне регистрируются ask-цена, ask-объём, bid-цена и bid-объём). Пространственно запись книги:

\[ L(\tau)=\bigl\{p_\ell^{\mathrm{ask}}(\tau),\,v_\ell^{\mathrm{ask}}(\tau),\,p_\ell^{\mathrm{bid}}(\tau),\,v_\ell^{\mathrm{bid}}(\tau)\bigr\}_{\ell=1}^{L}. \tag{1} \]

Mid-цена $m_\tau$ — среднее лучших ask и bid: $m_\tau=(p_1^{\mathrm{ask}}(\tau)+p_1^{\mathrm{bid}}(\tau))/2$. Спред $\sigma_\tau=p_1^{\mathrm{ask}}(\tau)-p_1^{\mathrm{bid}}(\tau)$.

Уровневое представление (1) удобно для человеческого понимания, но страдает существенным недостатком для автоматического обучения: нет гарантии однородного пространственного разделения между соседними ценовыми уровнями. Когда эта неоднородность усилена микроструктурными свойствами акции (Bouchaud et al. [6]; Briola et al. [11]; Sirignano, Cont [46]), она заметно снижает способность отдельных классов глубоких моделей (например CNN) находить микроальфы [60].

2.2. Глубокое обучение для прогноза LOB

Трудность обращения со сложностью книг и обилие данных стимулировали алгоритмы глубокого обучения. Нас особенно интересуют архитектуры прогноза направления изменения mid-цены на высокочастотном разрешении. Фундаментальные вклады: Sirignano [47], Sirignano и Cont [46], Tsantekidis et al. [51, 52], Passalis et al. [40] — MLP, LSTM [19], CNN [27], Bag-of-Features [39]. Затем эти модули стали ядром более сложных архитектур: Zhang et al. [61] и Tsantekidis et al. [53] сочетают свёртки (пространственная структура) с LSTM (длинные зависимости); Passalis et al. [41] и Tran et al. [50] обогащают BoF вниманием [56]. Tran et al. [48, 49] и Shabani et al. [44, 45] предлагают билинейную проекцию и внимание к ключевой временной и пространственной информации.

По вниманию в прогнозе LOB: Guo и Chen [18] — двустадийное временное внимание; Wallbridge [57], Kisiel и Gorse [23], Zhang et al. [63] — трансформеры. Критическая оценка предшествующих методов: Briola et al. [8, 11], Lucchese et al. [33], Kolm и Westray [24], Kolm et al. [25].

2.3. Информационно-фильтрующие сети и гомологические (свёрточные) сети

Один из главных вкладов статьи — HLOB, крупномасштабная модель прогноза изменения mid-цены. Она ловит сложные зависимости на более глубоких уровнях книги и преодолевает традиционные CNN-LSTM (например DeepLOB [62]), которые улавливают только зависимости между соседними уровнями и недостаточны для сложности системы.

Ключевой теоретический prior — информационно-фильтрующие сети (IFN) [3, 4, 34, 35, 54]. IFN представляют структуры зависимостей между переменными сложных систем средствами науки о сетях, налагая строгие топологические ограничения (дерево, планарный граф) и оптимизируя глобальные свойства (правдоподобие модели) [1]. Исторически три главных примера: MST [59], PMFG [2, 55] и TMFG [36]. Нас интересует последний. TMFG улавливает связи высшего порядка до четырёх переменных на клику, будучи планарным и хордальным, и максимизирует правдоподобие, рекурсивно соединяя ковариаты с наибольшим сходством [7, 36]. Этот класс IFN вдохновил гомологические свёрточные сети (HCNN) [10] — полностью data-centric архитектуру, использующую свёртки, чтобы извлечь пользу из топологических prior TMFG. Построение TMFG, HCNN и HLOB — в разделах 4.1 и 4.2.

3. Данные

Анализируем 15 акций из 6 секторов и 13 отраслей, все на NASDAQ. Датасет предложен Briola et al. [11] и содержит только активы с large- (10–200 млрд) до mega-капитализацией ($\ge 200$ млрд) на трёхлетнем периоде январь 2017 — декабрь 2019. Акции разбиты на три группы по размеру тика (табл. 1). Первая (CHTR, GOOG, GS, IBM, MCD, NVDA) — small-tick: $\langle\sigma\rangle\ge 3\theta$. Вторая (AAPL, ABBV, PM) — medium-tick: $1.5\theta\lesssim\langle\sigma\rangle\lesssim 3\theta$. Третья (BAC, CSCO, KO, ORCL, PFE, VZ) — large-tick: $\langle\sigma\rangle\lesssim 1.5\theta$. Подробное описание эффективности этой классификации — в исходной работе [11].

ТикерНазваниеСекторГруппа тикаКапитализация 2017 / 2018 / 2019
CHTRCharter CommunicationsТелекомsmall83.94 / 64.21 / 101.85 млрд
GOOGAlphabetТехнологииsmall729.45 / 723.55 / 921.13 млрд
GSGoldman SachsФинансыsmall96.09 / 61.43 / 79.86 млрд
IBMIBMТехнологииsmall142.03 / 101.44 / 118.90 млрд
MCDMcDonald’sПотреб. дискр.small137.21 / 136.21 / 147.47 млрд
NVDANVIDIAТехнологииsmall117.26 / 81.43 / 144.00 млрд
AAPLAppleТехнологииmedium860.88 / 746.07 / 1.287 трлн
ABBVAbbVieЗдравоохранениеmedium154.39 / 136.33 / 130.94 млрд
PMPhilip MorrisЗдравоохранениеmedium164.09 / 103.78 / 132.39 млрд
BACBank of AmericaФинансыlarge307.91 / 238.25 / 311.20 млрд
CSCOCiscoТелекомlarge189.34 / 194.81 / 203.45 млрд
KOCoca-ColaПотреб. stapleslarge195.47 / 202.08 / 236.89 млрд
ORCLOracleТехнологииlarge195.72 / 162.03 / 169.94 млрд
PFEPfizerЗдравоохранениеlarge215.89 / 249.54 / 216.82 млрд
VZVerizonТелекомlarge215.92 / 232.30 / 253.93 млрд

Таблица 1. Обзор акций. Сектор и отрасль — по таксономии NASDAQ [37]; капитализация — companiesmarketcap.com [14].

Для каждой акции — высокоразрешающие tick-by-tick данные LOBSTER [31]. На каждый торговый день книга с $L=10$ уровнями цены и объёма на обеих сторонах (уравнение 1). Как в табл. 2, на каждый год: 40 дней обучения, 5 валидации, 10 последовательных дней теста. Большинство обучающих дней последовательны, с немногими исключениями. Пять дней валидации случайно выбраны из того же периода, что и обучение: это даёт большую устойчивость валидации и возможно благодаря 5-дневной feature-wise скользящей z-стандартизации, предотвращающей утечку данных [11]. Сырые данные обрабатываются пайплайном Lucchese et al. [33], уточнённым Briola et al. [11].

ГодОбучениеВалидацияТест
201713.03–22.0523.03, 05.04, 13.04, 18.04, 02.0523.05–06.06
201809.08–18.1015.08, 16.08, 19.09, 26.09, 03.1019.10–01.11
201904.06–13.0814.06, 27.06, 08.07, 10.07, 24.0714.08–27.08

Таблица 2. Структура датасетов. Выходные и праздники не входят.

Согласованно с [11] изучаем предсказуемость направления изменения mid-цены на трёх горизонтах $H_{\Delta\tau}\in\{10,50,100\}$, когда движение не меньше $\theta$. Разметка:

\[ \begin{cases} (m_{\tau+\Delta\tau}-m_\tau)\le -\theta &\to -1 \to \text{вниз},\\ -\theta<(m_{\tau+\Delta\tau}-m_\tau)<+\theta &\to 0 \to \text{стабильно},\\ (m_{\tau+\Delta\tau}-m_\tau)\ge +\theta &\to 1 \to \text{вверх}. \end{cases} \tag{2} \]

Горизонты всегда в обновлениях книги (неравномерных), физическое время не используется. Простая разность mid-цен даёт больший контроль над амплитудой изменения на разных горизонтах и сохраняет стационарность. Многие альтернативы в литературе опираются на лог-доходность со сглаживанием [33, 38, 51, 62]; они академически приемлемы, но ближе к трекингу тренда, чем к немедленным колебаниям, и дают мало контроля над тиковыми изменениями, критичными для HFT-стратегий.

4. Методы

HLOB опирается на два механизма: (i) информационное содержание топологических prior IFN как вход адаптированных HCNN [10], обрабатывающих зависимости между пространственными компонентами книги (уровнями объёма); (ii) LSTM для длинных временных паттернов. Нужны: процедура дистилляции информации для TMFG и модификации исходной HCNN под входы LOB.

4.1. Построение TMFG

Строительный блок HCNN и HLOB — произвольный IFN, кодирующий зависимости высшего порядка. Вслед за Briola et al. [10] берём TMFG [36]. Сначала из книги убираем ценовые уровни, оставляя только объёмы: снимок сжимается с $L(\tau)\in\mathbb{R}^{4L}$ до $L(\tau)\in\mathbb{R}^{2L}$. Это нужно для однородности информации IFN. Уровни объёма дискретны (минимум — лот $\psi$), а малые вариации от соседних обновлений вносят шум. Чтобы смягчить его, объёмы категоризуются в равномерные бины. Число бинов оптимизируется на обучении и валидации и постоянно для акций с разными микроструктурными свойствами; размер бинов считается индивидуально по акции и по всем уровням объёма на каждый обучающий день.

Второй шаг: для каждой акции и каждого дня обучения — попарная взаимная информация (MI) между уровнями объёма, положительные симметричные матрицы сходства $2L\times 2L$. Надёжность MI усиливается бутстрэпом по дням. Итоговая матрица акции — среднее дневных MI на обучении.

Третий шаг: TMFG акций считаются по средним MI как матрицам сходства. Для многомерной системы $L$ цель — оценить плотность $\tilde f(L\mid G^*)$ со структурой представления $G^*$, лучше всего описывающей истинную неизвестную $f(L)$. С информационно-теоретической точки зрения обучение оптимальной сетевой репрезентации $G^*$ — минимизация дивергенции KL [26] между $f(L)$ и $\tilde f(L\mid G)$ и, следовательно, кросс-энтропии $H$ системы:

\[ G^* \Rightarrow \arg\min_G D_{\mathrm{KL}}\bigl(f(L)\,\|\,\tilde f(L\mid G)\bigr) \Rightarrow \arg\min_G \bigl(H(L\mid G)\bigr). \tag{3} \]

Член $\mathbb{E}_f(\log f(L))$ не зависит от $G$ и не нужен для поиска оптимальной сети. Второй член зависит от $G$ и должен быть минимизирован: это оценка энтропии системы, кросс-энтропия $H$. Задача решается инкрементально соединением несвязных частей с наибольшей MI — ровно то, что делает алгоритм TMFG (Massara et al. [36]).

Схема построения TMFG
Рис. 1. Схема построения TMFG: (a) упрощённая книга только с объёмами; (b) категоризация объёмов в бины равного размера; (c) попарная MI между уровнями; (d) TMFG по матрице MI. Цвет и размер узлов и рёбер зависят от betweenness centrality. Цветовая шкала едина для матрицы MI и графа.

4.2. От HCNN к HLOB

Из каждого TMFG выделяем реализации трёх симплициальных семейств: (i) максимальные клики размера 4 (тетраэдры, 3-симплексы); (ii) размера 3 (треугольники); (iii) размера 2 (рёбра). Этих трёх структур высшего порядка достаточно, чтобы уловить все зависимости выбранного IFN. Поскольку число наблюдаемых уровней объёма постоянно по акциям и дням, детерминированно считаются формы: вектор тетраэдров $17\times 4$, треугольников $52\times 3$, рёбер $54\times 2$. Все они — вход HLOB, который, однако, обрабатывает не только пространственную динамику TMFG, но и временную динамику книги. Как и у Zhang et al. [62], вход включает окно истории в 100 обновлений.

От TMFG к входу HLOB
Рис. 2. Переход от выхода построения TMFG (a) ко входу HLOB (b). Для TMFG используются только уровни объёма. Для входа HLOB: (i) на каждый timestamp истории каждый набор симплексов flattening; (ii) к каждому представителю добавляются соответствующие ценовые уровни. Цвета напрямую соответствуют входам на рис. 3.

Ценовые уровни несут существенную информацию и включаются на этапе построения HLOB: для каждого timestamp истории векторы тетраэдров, треугольников и рёбер flattening, и к каждому уровню объёма вставляется соответствующая цена. Получаются три двумерных входа: $100\times 136$ (тетраэдры), $100\times 312$ (треугольники), $100\times 216$ (рёбра). Каждый подаётся в отдельную голову HLOB.

Операционный каркас HLOB
Рис. 3. Обзор операционного каркаса HLOB. Три головы свёрток по топологическим prior, конкатенация, LSTM на 32 юнита, dense на 3 класса.

Для каждой головы первый свёрточный фильтр размера $(1\times 2)$ со stride $(1\times 2)$. Как у Zhang et al. [62], этот слой суммирует информацию цены и объёма $\{p_\ell^s,v_\ell^s\}$ на уровне $\ell$ и стороне $s$. Stride не даёт разделять параметры между географически (но не логически) соседними входами. Число параметров этой операции — 96 на голову. Второй свёрточный слой ловит связи внутри одной реализации каждого симплициального семейства: между узлами 4-клик, 3-клик и 2-клик. Stride $(1\times 4)$ для тетраэдров, $(1\times 3)$ для треугольников, $(1\times 2)$ для рёбер снова не даёт разделять параметры между компонентами одного семейства. Параметры: 12 384 (тетраэдры), 11 360 (треугольники), 10 336 (рёбра). Третий слой ловит связи между компонентами каждого семейства. Размер фильтра $(1\times\Omega)$, где $\Omega$ — мощность исходного набора: $136/8=17$ тетраэдров, $312/6=52$ треугольников, $216/4=54$ рёбер. Этот уровень свёртки эффективен [10] для информации, не обязательно связанной в исходном графе, но способной положительно влиять на характеризацию неизвестной $f(L)$ (уравнение 3). Поскольку связи этого слоя не следуют напрямую из TMFG, на каждую голову применяется dropout 0.35. Параметры: 17 440, 53 280 и 55 328. После трёх слоёв размер карты признаков каждой головы $(100\times 1)$. Выходы конкатенируются и проходят LSTM (16 640 параметров). Выход — линейный слой с числом выходов, равным числу классов; модель возвращает логиты, вероятности считаются отдельно.

Существуют сильные проектные аналогии с DeepLOB [62] — архетипом этой архитектуры; поэтому в разд. 5 систематически сравниваются их прогнозные качества.

4.3. Экспериментальные условия

Тестируем HLOB против шести SoTA моделей прогноза mid-цены: CNN1 [51], CNN2 [53], DLA [18], BinBTabl [49], BinCTabl [49], DeepLOB [62] — работы 2017–2022, систематизированные в обзоре Prata et al. [43]. Также против двух чисто трансформерных архитектур, адаптированных под LOB: Transformer [56] и iTransformer [30]. Дополнительный бенчмарк — LobTransformer, сочетание трансформеров и CNN по мотивам Wallbridge [57], здесь в пересмотренной версии. Как отмечают Briola et al. [11], у большинства этих архитектур нет исходного кода, что сильно бьёт по воспроизводимости. Для первой группы результаты получены кодом Prata et al. [43]; остальные реализованы с нуля. Все модели включены в пайплайн LOBFrame [11]. Сводка — табл. 3.

Сводка бенчмарк-моделей
Таблица 3. Три характеристики бенчмарков: наличие исходного кода, число обучаемых параметров, время инференса (мс). Исходный код не предоставлен у 5 из 6 моделей с прямой ссылкой в литературе. Самая экономная — BinBTabl ($6.6\times 10^3$ параметров), самая тяжёлая — LobTransformer ($2.0\times 10^6$). Самый быстрый инференс — CNN1 (0.07 мс), самый медленный — LobTransformer (0.29 мс). HLOB: $1.8\times 10^5$ параметров, 0.16 мс.

Где возможно, гиперпараметры наследуются от Prata et al. [43]; оптимальные веса учатся минимизацией категориальной кросс-энтропии мини-батчами размера 32 [62]. Сэмплирование мини-батчей различно. На обучении — случайное и сбалансированное: с каждого торгового дня берётся число примеров наименее представленного класса; если оно $\ge 5000$, сэмплируется по 5000 на каждый из трёх классов (уравнение 2), иначе — по числу наименьшего класса. На валидации и тесте батчи размера 32 последовательны и покрывают все данные. Все модели обучаются максимум 100 эпох; обучение останавливается, если валидационная потеря не падает хотя бы на 0.003 за 15 эпох. Оптимизатор — AdamW [22, 32]. По последним прикладным результатам [12, 21]: learning rate $6\times 10^{-5}$, $\beta_1=0.90$, $\beta_2=0.95$. Выбор значений определяется пайплайном обучения [11].

Код на Python / PyTorch [42]. Эксперименты — на HPC-кластере факультета Computer Science UCL [13]. 15 акций × 3 года × 10 моделей × 3 горизонта = 450 годовых экспериментов, всего 1350 прогонов, суммарно 7192 часа 20 минут 31 секунда GPU. Использовались десять типов GPU: A100 80GB, A100 40GB, GTX 1080 Ti, RTX 2080 Ti, RTX 4090, RTX 6000 Ada, TITAN X, TITAN Xp, Tesla V100 16GB и 32GB.

5. Результаты

Представляем результаты: (i) эффективность моделей разд. 4.3 в прогнозе направления изменения mid-цены; (ii) поведение HLOB, раскрывающее сложные паттерны структурных зависимостей уровней книги. Во всех экспериментах — три класса акций на $H_{\Delta\tau}\in\{10,50,100\}$. Это позволяет связать эффективность с микроструктурными характеристиками.

5.1. Сравнение качества моделей

Три ключевые метрики: F1, коэффициент Мэттьюса (MCC) [17] и вероятность корректно исполнить round-trip сделку $p_T$ [11]. Результаты — в табл. 4, 5 и 6: лучшая модель (зелёное), вторая (синее), худшая (красное). Для каждой акции модель считается превосходящей остальные, если сумма трёх метрик максимальна. Годовые метрики усреднены.

Качество моделей при горизонте 10
Таблица 4. Качество при $H_{\Delta\tau}=10$: F1, MCC и $p_T$ по 10 архитектурам и 15 акциям.

При $H_{\Delta\tau}=10$ HLOB превосходит SoTA в 73.3% случаев. Для small-tick — лучшая в 4 из 6 сценариев (CHTR, GS, IBM, MCD); для GOOG — вторая, для NVDA — третья. Для medium-tick — лучшая во всех трёх (AAPL, ABBV, PM). Для large-tick — лучшая в 4 из 6 (BAC, CSCO, KO, PFE) и вторая в остальных двух (ORCL, VZ). Средний F1 HLOB: 0.42 / 0.41 / 0.48 (small / medium / large). Средний MCC: 0.16 / 0.16 / 0.33. Средний $p_T$: 0.11 / 0.14 / 0.09. Для small- и medium-tick качества близки по всем трём метрикам, кроме iTransformer и LobTransformer (худшие). Для large-tick даже худшие модели, заметно отставая по F1 и MCC, остаются конкурентоспособны по $p_T$. Выигрыш HLOB против DeepLOB: F1 +0.03 / +0.02 / +0.003; MCC +0.04 / +0.02 / +0.02; $p_T$ +0.02 / +0.01 / 0.00 (small / medium / large).

Качество моделей при горизонте 50
Таблица 5. Качество при $H_{\Delta\tau}=50$.

При $H_{\Delta\tau}=50$ HLOB лучше SoTA в 60% случаев (на 10 п.п. меньше, чем на горизонте 10). Для small-tick лучшая только в 1 из 6 (IBM); GS и MCD — вторая; CHTR, GOOG, NVDA — третья. Для medium-tick снова лучшая во всех трёх. Для large-tick лучшая в 5 из 6 (кроме PFE — вторая). Средний F1: 0.36 (−16.7% к горизонту 10) / 0.40 (−2.5%) / 0.58 (+17.2%). MCC: 0.09 / 0.11 / 0.38. $p_T$: 0.07 / 0.10 / 0.14. iTransformer и LobTransformer по-прежнему худшие; для iTransformer это верно и на large-tick. Выигрыш против DeepLOB по F1 растёт: +0.05 / +0.05 / +0.01.

Качество моделей при горизонте 100
Таблица 6. Качество при $H_{\Delta\tau}=100$.

При $H_{\Delta\tau}=100$ HLOB лучше SoTA лишь в 33% случаев. Для small-tick лучшая в 1 из 6 (IBM); CHTR — вторая; остальные — третья. Для medium-tick — третья во всех трёх. Для large-tick лучшая в 4 из 6 (BAC, CSCO, KO, ORCL), вторая на PFE, третья на VZ. Средний F1: 0.32 / ниже на medium / выше на large относительно короткого горизонта. Информационное преимущество пространственной структуры TMFG деградирует быстрее на sparse small- и medium-tick книгах.

Распределение pT против числа round-trip
Рис. 4. Распределение $p_T$ как функция полного числа исполненных round-trip (TT) для каждой модели табл. 3 при $H_{\Delta\tau}\in\{10,50,100\}$. Квадранты: (I) мало сделок, высокий $p_T$; (II) много сделок, высокий $p_T$; (III) мало сделок, низкий $p_T$; (IV) много сделок, низкий $p_T$. Вертикаль — 25-й процентиль TT, горизонталь — 75-й процентиль $p_T$.

Три группы моделей ведут себя согласованно по горизонтам. Первая: BinBTabl, BinCTabl и HLOB — всегда в верхнем правом квадранте: наиболее эффективны в корректном прогнозе round-trip, хотя не особенно экономны по числу сделок. На горизонте 10 HLOB эффективнее двух бенчмарков, но с самой выраженной склонностью к активной торговле; на 50 и 100 эта склонность исчезает, и HLOB слегка уступает BinBTabl/BinCTabl. Вторая группа: iTransformer и LobTransformer — всегда в нижнем левом квадранте, худшая практичность прогнозов. Третья, разнородная: CNN1, CNN2, DLA, Transformer, DeepLOB. DeepLOB и Transformer стабильно остаются в одном квадранте: менее экономны по числу сделок, но точнее по round-trip. CNN1, CNN2 и DLA — пограничное поведение между III и IV.

Успех HLOB опирается на осмысленность структур высшего порядка IFN. Эффективность устойчива по горизонтам: модель держится на уровне BinCTabl/BinBTabl и постоянно обходит прочие альтернативы, в частности DeepLOB — своего структурно-агностического предка. По сравнению с DeepLOB HLOB ловит два микроструктурных аспекта: (i) у книги есть подлежащая пространственная структура, требующая моделирования высшего порядка между уровнями объёма и цены; (ii) возникновение структур зависимостей — функция размера тика, а их устойчивость на разных горизонтах тоже зависит от него. DeepLOB действует только на соседних уровнях и слабее HLOB на всех горизонтах. На горизонте 10 HLOB лучше всех независимо от тика: средняя структура IFN хорошо моделирует краткосрочную динамику mid-цены. На 50 HLOB остаётся эффективной для medium- и large-tick, где риск (спред) и фактическая глубина книги ниже; для small-tick средняя структура TMFG менее устойчива к изменениям книги. На 100 то же верно и для medium-tick. На длинных горизонтах BinBTabl и BinCTabl слегка сильнее: они применяют двойное внимание по пространству и времени (IFN HLOB обрабатывает только пространство) и перевзвешивают признаки. Цена — падение интерпретируемости. Превосходство этих двух моделей исчезает на large-tick акциях, где структура по уровням объёма выше и информационные дрейфы слабее вредят глубоким моделям.

5.2. Пространственное распределение информации в LOB

На рис. 5–7 — средние (за три года) матрицы MI на обучении по 15 акциям. Анализ показывает, на каких уровнях объёма сосредоточена информация книги и как разные пространственные распределения влияют на прогноз. Эти средние матрицы не используются для построения HLOB, но дают интуицию сценарно-зависимой эффективности. Уровни переименованы: $v_\ell^{\mathrm{ask}}\to A_\ell$, $v_\ell^{\mathrm{bid}}\to B_\ell$.

Матрицы MI для small-tick акций
Рис. 5. Нормированные (по 15 акциям) средние матрицы MI для small-tick: CHTR, GOOG, GS, IBM, MCD, NVDA.

CHTR и GOOG похожи: ненормированная средняя MI 0.35 и 0.26. У CHTR слабая иерархия; лучшие уровни несут наибольшую кумулятивную MI, плавно убывающую вглубь. Наибольшие точечные реализации — между соседними уровнями той же стороны. У GOOG спад круче, с разрывом после $v_4$. GS: средняя MI 0.45, иначе распределена — три кластера уровней $\{1,3\}$, $\{4,7\}$, $\{8,10\}$ без сглаженного перехода; центральные уровни играют всё более центральную роль. IBM: 0.74, высшая среди small-tick, концентрация на $v_{\ell\in\{4,6\}}$, гладкий переход сверху к середине. MCD: 0.58, в основном на верхних 8 уровнях, иерархия ближе к GS, чем к IBM. NVDA уникальна: 0.31, концентрация на глубоких 6 уровнях — верхние несут наименьшую кумулятивную MI.

Эти результаты прямо следуют из Briola et al. [11]: $\Xi^{\mathrm{Bid}}$ и $\Xi^{\mathrm{Ask}}$ измеряют «фактическую глубину» книги (табл. 7). Когда средняя $\Xi\gg 9.0$, как у CHTR и GOOG, расчёт средней MI по уровням страдает от дрейфов: понятие «уровня» становится чисто теоретическим артефактом с краткосрочной практической отдачей. Напротив, осмысленность матриц MI и устойчивость структур высшего порядка на длинных горизонтах растут при $\Xi\simeq 9.0$; IBM — идеальная среда для пространственно-информированных глубоких моделей.

Матрицы MI для medium-tick акций
Рис. 6. Нормированные средние матрицы MI для medium-tick: AAPL, ABBV, PM.

AAPL: ненормированная средняя MI 0.41, в основном на $v_{\ell\in\{2,10\}}$; лучшие уровни заметно отделены, остальные сильно взаимозависимы. ABBV и PM: 0.59 и 0.63, распределение как у MCD — большая часть MI на верхних 7 уровнях и спад на оставшихся трёх. У AAPL более низкая средняя MI компенсируется большей стабильностью книги (табл. 7), что повышает устойчивость структуры, извлечённой IFN. ABBV и PM имеют $\Xi$, ближе к small-tick, и подвержены тем же неблагоприятным последствиям.

Матрицы MI для large-tick акций
Рис. 7. Нормированные средние матрицы MI для large-tick: BAC, CSCO, KO, ORCL, PFE, VZ.

BAC: ненормированная средняя MI 1.18, явная иерархия: $v_1$ — наименьшая попарная MI; $v_{\ell\in\{2,3\}}$ — промежуточная; $v_{\ell\in\{4,10\}}$ — наибольшая концентрация. Внутри групп — гладкий спад вглубь. Large-tick акции в целом сохраняют существенно более высокий уровень структуры; $\Xi$ около 9.0 (табл. 7) почти у всех. Это объясняет устойчивую эффективность глубоких моделей на длинных горизонтах.

Итого: (i) small- и medium-tick обычно страдают от недостатка структуры информационного содержания книги, из-за чего прогнозные способности глубоких моделей быстрее деградируют при удалении горизонта; (ii) large-tick имеют более компактную и осмысленную структуру, гарантируя прямое соответствие теоретического «уровня» практическому информационному каналу — с положительным эффектом на качество и на коротких, и на длинных горизонтах.

Фактическая глубина книги
Таблица 7. Среднее и медиана «фактической глубины» bid и ask ($\Xi^{\mathrm{Bid}}$, $\Xi^{\mathrm{Ask}}$) по 15 акциям за 2017–2019.

6. Заключение и дальнейшая работа

Статья вводит HLOB — крупномасштабную архитектуру глубокого обучения для прогноза направления высокочастотных изменений mid-цены. Новизна — в детерминированном моделировании взаимодействий высшего порядка между уровнями объёма (и цены) через класс IFN: TMFG. Расчёт использует попарную взаимную информацию по уровням объёма; структура оставляет только статистически релевантные зависимости, отсекая слабейшие. Информационное содержание возникающих топологических prior (тетраэдры, треугольники, рёбра) подаётся в HCNN и обрабатывается для прогноза направления mid-цены 15 акций трёх классов за 2017–2019. Этот класс сетей естественно моделирует пространственное измерение книги; здесь он модифицирован LSTM для длинных временных зависимостей — переход от простой HCNN к HLOB.

Развитие архитектуры опирается на гипотезу: более структурированный захват пространственных зависимостей книги повысит точность прогноза. Гипотеза проверена против девяти SoTA; эмпирика также подтверждает теоретические догадки о механике LOB. Три главных вывода:

HLOB — шаг к микроструктурно-информированным моделям прогноза направления высокочастотных изменений mid-цены. Общее качество достойно: существенный прогресс в микроструктурном моделировании, инструмент, сочетающий силу глубокого обучения с нюансированным пониманием механики книги. Сравнение с SoTA выявляет ограничения: двойное внимание по пространству и времени даёт, ценой меньшей интерпретируемости, уточнение нелинейных связей во времени и преимущество над HLOB, который в первую очередь обрабатывает пространственную динамику.

Несколько направлений развития: (i) более тонкие способы считать матрицы сходства в ядре архитектуры; (ii) модификация HLOB, включающая временно эволюционирующие IFN, улавливающие меняющуюся сложность книги. Эта работа — начальный шаг к микроструктурно-информированным моделям, способным адаптироваться к сложностям высокочастотных фазовых переходов рынка.

Благодарности

T.A. признаёт финансовую поддержку ESRC (ES/K002309/1), EPSRC (EP/P031730/1) и EC (H2020-ICT-2018-2 825215). Конфликта интересов нет. Фонды не участвовали в дизайне исследования, сборе и интерпретации данных, написании и решении о публикации. A.B. благодарит Kashif Rasul за помощь в кодировании части SoTA-моделей для сравнения.

Литература

  1. Aste, T. (2022). Topological regularization with information filtering networks. Information Sciences, 608:655–669.
  2. Aste, T. and Di Matteo, T. (2006). Dynamical networks from correlations. Physica A, 370(1):156–161.
  3. Aste, T., Di Matteo, T., and Hyde, S. T. (2005). Complex networks on hyperbolic surfaces. Physica A, 346(1–2):20–26.
  4. Barfuss, W., Massara, G. P., Di Matteo, T., and Aste, T. (2016). Parsimonious modeling with information filtering networks. Physical Review E, 94(6):062306.
  5. Bouchaud, J.-P., Farmer, J. D., and Lillo, F. (2009). How markets slowly digest changes in supply and demand. In Handbook of financial markets, pp. 57–160. Elsevier.
  6. Bouchaud, J.-P., Bonart, J., Donier, J., and Gould, M. (2018). Trades, quotes and prices. Cambridge University Press.
  7. Briola, A. and Aste, T. (2022). Dependency structures in cryptocurrency market from high to low frequency. Entropy, 24(11):1548.
  8. Briola, A., Turiel, J., and Aste, T. (2020). Deep learning modeling of limit order book: A comparative perspective. arXiv:2007.07319.
  9. Briola, A. et al. (2021). Deep reinforcement learning for active high frequency trading. arXiv:2101.07107.
  10. Briola, A., Wang, Y., Bartolucci, S., and Aste, T. (2023). Homological convolutional neural networks. arXiv:2308.13816.
  11. Briola, A., Bartolucci, S., and Aste, T. (2024). Deep limit order book forecasting. arXiv:2403.09267.
  12. Brown, T. et al. (2020). Language models are few-shot learners. NeurIPS, 33:1877–1901.
  13. UCL CS HPC Cluster. hpc.cs.ucl.ac.uk.
  14. companiesmarketcap.com.
  15. Cont, R., Cucuringu, M., and Zhang, C. Cross-impact of order flow imbalance.
  16. Farmer, J. D. Predator–prey dynamics in markets.
  17. Chicco, D. and Jurman, G. Matthews correlation coefficient.
  18. Guo, Z. and Chen, Y. (2022). Dual-stage temporal attention for LOB. DLA.
  19. Hochreiter, S. and Schmidhuber, J. (1997). Long short-term memory. Neural Computation.
  20. HFT prominence since 2005.
  21. Applied findings on AdamW hyperparameters.
  22. Kingma, D. P. and Ba, J. (2014). Adam. arXiv:1412.6980.
  23. Kisiel, D. and Gorse, D. Transformer architectures for LOB.
  24. Kolm, P. and Westray, N. Critical assessment of LOB forecasting.
  25. Kolm, P. et al. Related LOB forecasting evaluation.
  26. Kullback, S. and Leibler, R. A. (1951). On information and sufficiency.
  27. LeCun, Y. et al. Convolutional neural networks.
  28. HFT and speed advantage.
  29. Libman, D. et al. Related MI / LOB information analyses.
  30. Liu, Y. et al. (2023). iTransformer.
  31. Huang, R. and Polak, T. (2011). LOBSTER. SSRN 1977207.
  32. Loshchilov, I. and Hutter, F. AdamW.
  33. Lucchese, L. et al. LOB data processing pipeline.
  34. Massara, G. P. et al. Information filtering networks.
  35. Related IFN literature.
  36. Massara, G. P., Di Matteo, T., and Aste, T. (2016). Network filtering for big data: Triangulated maximally filtered graph. Journal of Complex Networks.
  37. NASDAQ sector taxonomy.
  38. Smoothing methods for mid-price labels.
  39. Passalis, N. et al. Bag-of-Features.
  40. Passalis, N. et al. (2017). CNN for LOB.
  41. Passalis, N. et al. Attention-augmented BoF.
  42. Paszke, A. et al. (2019). PyTorch. NeurIPS.
  43. Prata, M. et al. (2024). LOB-based deep learning models for stock price trend prediction: a benchmark study. Artificial Intelligence Review, 57(5):116.
  44. Shabani, M. et al. Bilinear projection and attention for LOB.
  45. Related bilinear / attention LOB models.
  46. Sirignano, J. and Cont, R. Universal features of price formation.
  47. Sirignano, J. (2019). Deep learning for limit order books. Quantitative Finance.
  48. Tran, D. T. et al. Temporal attention bilinear networks.
  49. Tran, D. T. et al. (2021). BinBTabl / BinCTabl.
  50. Tran, D. T. et al. Attention BoF for LOB.
  51. Tsantekidis, A. et al. (2017). CNN1. Forecasting stock prices from LOB using convolutional neural networks.
  52. Tsantekidis, A. et al. Related CNN LOB work.
  53. Tsantekidis, A. et al. (2020). CNN2. Using deep learning for price prediction from LOB.
  54. TMFG / IFN applications.
  55. PMFG literature.
  56. Vaswani, A. et al. (2017). Attention Is All You Need.
  57. Wallbridge, J. Transformers for limit order books.
  58. Homological neural networks (archetype of HCNN).
  59. MST literature (Mantegna).
  60. Wu, Y. et al. Actual LOB depth $\Xi$.
  61. Zhang, Z. et al. Convolutional-LSTM LOB models.
  62. Zhang, Z., Zohren, S., and Roberts, S. (2019). DeepLOB: Deep convolutional neural networks for limit order books. IEEE Trans. Signal Processing, 67(11):3001–3012.
  63. Zhang, Z. et al. Transformer-based LOB forecasting.

Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2405.18938 · Briola, Bartolucci, Aste · CC BY-NC-ND 4.0.