Attention-Based Reading, Highlighting, and Forecasting of the Limit Order Book

6/10

Дживон Юнг, Кисоп Ли · Department of Statistics, Purdue University · 4 ноября 2024 (v2)

Переписка: Jiwon Jung, jung320@purdue.edu.

Оригинал: Jung, J., Lee, K. «Attention-Based Reading, Highlighting, and Forecasting of the Limit Order Book», 2024 — arxiv.org/abs/2409.02277 (PDF), лицензия CC BY-NC-ND 4.0.

Рисунки и таблицы воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY-NC-ND 4.0 (некоммерческое использование, без производных).

Аннотация

Управление высокочастотными данными книги лимитных заявок (LOB) сложно и часто выходит за пределы возможностей обычных моделей временных рядов. Точный прогноз многоуровневого стакана — не только mid-цены — важен для понимания рыночной динамики, но труден из-за взаимозависимостей между атрибутами: типом заявки, признаком (цена или объём) и уровнем. В работе вводятся seq2seq-модели с вниманием для прогноза всего многоуровневого стакана, включая цены и объёмы. Ключевой вклад — метод составного многомерного эмбеддинга (compound multivariate embedding), который ловит пространственно-временные связи. Эмпирически метод даёт наименьшую ошибку прогноза при сохранении порядковой структуры LOB.

Ключевые слова: книга лимитных заявок; прогноз многомерных временных рядов; механизм внимания; пространственно-временной эмбеддинг.

1. Введение

Книга лимитных заявок — цифровая запись всех неисполненных заявок на покупку и продажу финансового инструмента. Она содержит цену и количество каждой заявки и время её выставления. Стакан непрерывно обновляется при выставлении, исполнении и отмене заявок и даёт мгновенный снимок спроса и предложения. Распределение заявок по ценовым уровням несёт информацию о глубине рынка и возможных движениях цены.

Прогнозное моделирование LOB затруднено высокой частотой и сложностью данных. Заявки добавляются, изменяются и снимаются с миллисекундными интервалами; это требует быстрой обработки больших объёмов информации. Кроме того, данные имеют сложную многомерную структуру с составными атрибутами: уровень, тип (bid/ask) и признак (цена/объём) связаны и одновременно относятся к каждому значению. Порядковая структура многоуровневых цен — типичный пример такой связанности. Чтобы прогноз был осмысленным, нужно явно учитывать влияние каждого атрибута.

Ещё одна трудность — нестационарность. Статистические свойства ряда (среднее, дисперсия, автокорреляция) меняются во времени; сдвиги тренда и структурные изменения дают разные распределения на обучении и тесте. Адаптивное внимание Liu et al. (2022) и обучаемая нормализация Kim et al. (2021) частично решают это, но плохо справляются с резкими скачками высокочастотных данных и требуют аккуратной настройки длинных зависимостей.

Из-за сложности полной динамики стакана многие работы прогнозируют только mid-цену — среднее лучших bid и ask. Применялись регрессия Ntakaris et al. (2018), SVM Kercheval & Zhang (2015) и глубокие сети Liu et al. (2024), Tsantekidis et al. (2020), Zhang et al. (2019). Mid-цена — индикатор общего тренда. Но рис. 1 показывает: стакан может сильно различаться по глубине на разных уровнях и по спреду при одной и той же mid-цене. Одного mid-price недостаточно, когда нужна глубина книги — например, в оптимальном исполнении. То же замечает Sirignano (2019): важно моделировать совместное распределение bid и ask, а не предполагать постоянный спред вокруг mid. В той работе классификация mid расширена до совместного распределения цен, но размеры заявок используются только как входы и не прогнозируются совместно. Полный вид стакана — цены и глубины обеих сторон — нужен для риск-менеджмента.

Три снимка стакана с одинаковой mid-ценой и разной глубиной и спредом
Рис. 1. Три разных снимка LOB с одной и той же mid-ценой: первые два отличаются доступной глубиной, третий — более широким спредом.

Модели с вниманием — Transformer Vaswani et al. (2017) и BERT Devlin et al. (2019) — хорошо решают seq2seq, назначая разные веса разным частям данных. Они успешны в NLP, распознавании речи и прогнозе временных рядов. Приложений к прогнозу стакана пока мало. Недавно Arroyo et al. (2024) оценивали вероятности исполнения методами выживаемости, Liu et al. (2024) классифицировали движение mid vision-трансформером, Wu et al. (2024) применяли вейвлет-разложение для краткосрочного прогноза на китайском рынке. Ни одна из этих работ не прогнозировала полную структуру цен и объёмов внутри стакана.

Мы используем архитектуру Spacetimeformer Grigsby et al. (2022) и добавляем кастомный эмбеддинг, который ловит пространственно-временные признаки и сохраняет структурную целостность LOB. Совместная обработка цен и объёмов повышает точность относительно традиционных моделей.

Вклад трояк:

  1. расширяем модели с вниманием за пределы прогноза mid-цены, чтобы ловить динамику всей структуры стакана;
  2. вводим модифицированные пространственно-временные эмбеддинги, обобщаемые на многомерные ряды с составными атрибутами;
  3. снижаем эффект нестационарности высокочастотных финансовых данных преобразованием «процентное изменение + min-max», не усложняя саму модель.

Дальше: раздел 2 — данные и постановка эксперимента; раздел 3 — методы; раздел 4 — результаты и сравнение; раздел 5 — обсуждение; раздел 6 — заключение.

2. Данные

LOB — запись заявок на покупку и продажу актива в реальном времени. Она упорядочена по ценовым уровням и в каждый момент показывает лучший bid (наивысшая цена покупки) и лучший ask (наименьшая цена продажи) вместе с объёмами и временными метками. В этом разделе разбираем высокочастотные свойства и пространственно-временную структуру данных и описываем подготовку входов.

2.1. Высокочастотная динамика и пространственно-временные корреляции

2.1.1. Высокочастотный стакан

В HFT и микроструктуре классические допущения — стационарность и независимые приращения — плохо согласуются с реальной динамикой стакана. Непрерывный поток заявок, частые смены цены и быстрые реакции алгоритмов дают шумные, нерегулярные и нестационарные ряды. Инструменты низкочастотного анализа не ловят нюансы высокочастотной среды.

Скользящие средние лучших bid и ask AMZN на окнах от 1 секунды до 2 часов
Рис. 2. Скользящие средние лучших bid и ask AMZN на окнах от 1 секунды до 2 часов. Резкие изменения около 11:00 и 12:30 сглаживаются на часовых окнах, где краткосрочные колебания почти исчезают.

Рис. 2 показывает скользящие средние лучших bid и ask AMZN за один торговый день на интервалах от секунд до часов. Короткие окна ловят острые колебания и волатильность; длинные — сглаживают их. Выбор временного масштаба критичен: высокочастотное поведение маскируется агрегацией.

Ещё одно частое упрощение — постоянный спред. Рис. 3 показывает, что в HFT спред далеко не постоянен. На мелких интервалах он непрерывно и заметно флуктуирует, особенно около открытия и закрытия. Меняются и среднее, и волатильность спреда. Модели с постоянным спредом удобны математически, но не отражают богатство микроструктуры Abergel et al. (2016).

Спред GOOG, AAPL и AMZN в течение торгового дня
Рис. 3. Bid–ask спред за выбранный торговый день для GOOG, AAPL и AMZN.

2.1.2. Пространственно-временная структура LOB

В многоуровневом стакане каждый ценовой уровень и соответствующий объём участвуют в перестройке книги: новые заявки, отмены и исполнения меняют структуру и могут влиять на поведение на других уровнях. Эти быстрые одновременные изменения показывают, как взаимодействие участников динамически бьёт и по ценам, и по объёмам.

Mid-цена и теплокарты процентных изменений цен и объёмов пяти уровней AAPL
Рис. 4. Mid-цена (верх), изменения цен пяти уровней bid/ask (середина) и изменения объёмов (низ) вдоль одной оси приходов заявок. В теплокартах более тёмные оттенки — больший абсолютный процентный сдвиг; красный — вверх, синий — вниз; белое — без изменений. Данные: первые 60 событий AAPL на открытии.

Рис. 4 связывает движение mid (верхняя панель) с изменениями цен и объёмов нескольких уровней. Сдвиги в многоуровневой структуре — кумулятивный эффект вариаций цены и объёма, которые обычно взаимосвязаны. На теплокартах большие области стакана статичны (0% изменения): не все уровни меняются с каждым событием. Активность разрежена — сдвиги происходят прерывисто на отдельных уровнях. Но когда существенное движение идёт в определённую сторону, оно часто тянет соседние уровни в том же направлении. Движения часто одновременны по атрибутам (цена и объём) — составной эффект по всей книге. Эта разреженная, но коррелированная активность показывает, как глубина и поток заявок формируют стакан.

Нужен подход, который выдерживает высокочастотность, нестационарность и пространственно-временную структуру. Data-driven метод здесь уместнее теоретических допущений: он лучше ловит зависимости, эволюционирующие на коротких интервалах.

2.2. Структура данных и подготовка

Используем датасет LOBSTER Huang & Polak (2011): сообщения и снимки стакана по выбранным акциям. Пять крупных технологических компаний: AAPL, GOOG, INTC, MSFT и AMZN. Выборка — торговый день 21 июня 2012, с открытия 9:30 до закрытия 16:00; от 300 000 до 600 000 снимков на акцию, миллисекундное разрешение, уровень 5. Файл стакана отслеживает эволюцию книги; файл сообщений логирует события, запускающие обновления (метки от миллисекунд до наносекунд).

Стакан состоит из двух типов заявок: bid (покупка) и ask (продажа). Он обновляется при каждом изменении: выставление, отмена, удаление, исполнение. Снимок $i\in\{1,\ldots,I\}$ обозначаем $\vec{X}_i$. Bid и ask задаются векторами с временной меткой и парами цена–объём на каждом уровне $k\in\{1,\ldots,K\}$:

\[ \vec{X}_i=\bigl[t_i,\,(p^b_{1i},v^b_{1i}),\ldots,(p^b_{Ki},v^b_{Ki}),\,(p^a_{1i},v^a_{1i}),\ldots,(p^a_{Ki},v^a_{Ki})\bigr], \]

где $t_i$ — метка времени, $p^{b/a}_{ki}$ — цена уровня $k$ на стороне bid/ask, $v^{b/a}_{ki}$ — соответствующий объём. Число уровней фиксируем: $K=5$ с обеих сторон.

Для согласованности временные метки приводим к равным интервалам 5 секунд. Это даёт около 4680 снимков за торговый день. Данные пяти акций конкатенируем: получается 100-мерный ряд (пять уровней bid и ask, цены и объёмы, по каждой акции). Разбиение train / validation / test — 6:2:2. Контекст прогноза — 120 шагов (10 минут), цель — 24 шага (2 минуты).

Пайплайн кодирования входа: контекст 10 минут, цель 2 минуты, эмбеддинги времени, переменной и контекста
Рис. 5. Пайплайн кодирования входа. (1) Последовательности уровня 5 режутся на контекст 10 минут и цель 2 минуты. (2) Строятся эмбеддинги времени, переменной и контекста. (3) Итоговая последовательность LOB получается их объединением.

2.3. Преобразование и масштабирование входа

Нестационарные координаты мешают обучению: распределения на обучении и тесте расходятся — типичная проблема длинных рядов. Многоуровневые цены часто нестационарны даже внутри одного дня.

Цены преобразуем в процентные изменения на всех уровнях:

\[ p^{\mathrm{perc}}_{k,i}=\frac{p_{k,i}-p_{k,i-1}}{p_{k,i-1}}. \]

Рис. 6 показывает, что преобразованный ряд заметно стационарнее сырого. На обучении дополнительно применяем min-max по каждой переменной отдельно, чтобы ряды с большой амплитудой (особенно объёмы) не доминировали:

\[ p^{\mathrm{scaled}}_{k,i}=\frac{p^{\mathrm{perc}}_{k,i}-\min_i(p^{\mathrm{perc}}_{k,i})}{\max_i(p^{\mathrm{perc}}_{k,i})-\min_i(p^{\mathrm{perc}}_{k,i})},\qquad v^{\mathrm{scaled}}_{k,i}=\frac{v_{k,i}-\min_i(v_{k,i})}{\max_i(v_{k,i})-\min_i(v_{k,i})}. \]

Сравнение преобразований — табл. 1 в разделе 4.

Сырой ряд цен и ряд процентных изменений
Рис. 6. Движение цен стакана: сырой ряд (слева) и ряд процентных изменений (справа).

3. Метод

3.1. Составной многомерный эмбеддинг

Эмбеддинг кодирует время, значения, переменные и информацию «контекст / цель». Слой Time2Vec Kazemi et al. (2019) переводит временные метки в частотные эмбеддинги; затем feed-forward ловит временные паттерны. Бинарный context-target эмбеддинг отмечает, наблюдается ли значение в контексте или его нужно прогнозировать.

Структура данных несёт составные атрибуты: уровень $k$, тип (bid или ask), признак (цена или объём), акция (тикер). Чтобы ловить зависимости между ними, мы строим составной многомерный эмбеддинг по мотивам Spacetimeformer Grigsby et al. (2022). В исходном Spacetimeformer целочисленный эмбеддинг назначается каждой переменной отдельно. У нас эмбеддинг назначается каждому атрибуту; затем многоуровневые эмбеддинги комбинируются и масштабируются. На рис. 7 у каждого атрибута свой слой: один кодирует bid/ask, другой — уровень, третий — цену или объём, четвёртый — тикер.

Сравнение spatiotemporal эмбеддинга Spacetimeformer и составного многомерного эмбеддинга
Рис. 7. Кодирование входа: пространственно-временной эмбеддинг Spacetimeformer (A) и составной многомерный эмбеддинг этой работы (B). В (A) каждой переменной (level-1-ask-price, …) присваивается отдельный индекс 0, 1, 2, … В (B) индексы факторизованы: тип $i$ (ask/bid), признак $j$ (цена/объём), уровень $k$, акция $l$.

Интеграция и масштабирование нескольких слоёв ловят не только временные и пространственные паттерны, но и связи между атрибутами. Одновременно сокращается число параметров эмбеддинг-слоя. Последовательность обрабатывается encoder–decoder с вниманием (рис. 8). Энкодер — self-attention для локального и глобального контекста; декодер — masked attention, чтобы не видеть будущее. Финальный feed-forward возвращает выход в формат исходной последовательности стакана.

Механизм внимания Vaswani et al. (2017) обновляет представления токенов:

\[ \mathrm{Attention}(Q,K,V)=\mathrm{softmax}\Bigl(\frac{QK^{\top}}{\sqrt{d}}\Bigr)V, \]

где $Q=W^Q X$, $K=W^K Z$, $V=W^V Z$ — линейные проекции с обучаемыми матрицами. Для последовательности длины $L$ и размерности $d$ self-attention оценивает и временные, и межпеременные зависимости. Для вычислительной эффективности используем Performer Choromanski et al. (2020): аппроксимация внимания с линейной сложностью по памяти и времени.

Архитектура spatiotemporal attention: энкодер, декодер, теплокарты внимания
Рис. 8. Пространственно-временное внимание на последовательности снимков стакана. Более тёмные оттенки — более высокие веса внимания. Архитектура по Grigsby et al. (2022).

3.2. Обучение

Прогнозная потеря. Разницу между прогнозом и фактом измеряем MSE и MAE. Функция потерь минимизирует MSE цен и объёмов пяти уровней:

\[ \mathrm{Forecasting\,Loss}=\sum_{i,j,k}\bigl(p^j_{k,i}-\hat p^j_{k,i}\bigr)^2+\sum_{i,j,k}\bigl(v^j_{k,i}-\hat v^j_{k,i}\bigr)^2. \]

MSE выбрана как стандарт для многомерного прогноза в трансформерных моделях и за акцент на крупных ошибках. MAE пишем для отчёта, но в лосс не входит.

Структурный регуляризатор. Чтобы сеть уважала многоуровневую структуру стакана, вводим штраф за нарушение порядка цен. Цена ask уровня 1 — наименьшее предложение продавцов; уровень 2 — второе лучшее, и так далее. Для фиксированного снимка $i$ порядковая структура:

\[ p^a_{k_1,i} \lt p^a_{k_2,i}\quad\text{для всех }k_1 \lt k_2, \] \[ p^b_{1,i} \lt p^a_{1,i}, \] \[ p^b_{k_1,i} \gt p^b_{k_2,i}\quad\text{для всех }k_1 \lt k_2. \]

Чтобы выходы сети следовали этому порядку, добавляем штраф на каждом снимке $i$:

\[ \mathrm{Structure\,loss}_i=\sum_{k=1}^{K-1}\Bigl(\mathrm{ReLU}(\hat p^a_{k,i}-\hat p^a_{k+1,i})+\mathrm{ReLU}(\hat p^b_{k+1,i}-\hat p^b_{k,i})\Bigr)+\mathrm{ReLU}(\hat p^b_{1,i}-\hat p^a_{1,i}), \]

где $\mathrm{ReLU}(x)=\max(0,x)$. Штрафуются только положительные нарушения: предсказанный более глубокий ask не должен быть дешевле лучшего, более глубокий bid — дороже лучшего, лучший bid не должен пересекать лучший ask.

Полный лосс с весом регуляризации $w_o\ge 0$:

\[ \mathrm{Loss}=\mathrm{Forecasting\,loss}+w_o\sum_{i=1}^{I}\mathrm{Structure\,loss}_i. \]

Вес фиксируем $w_o=0.01$, чтобы масштабы прогнозной и структурной частей были сопоставимы.

Скорость обучения затухает с фактором 0.8 и 1000 warmup-шагами. Используем сезонную декомпозицию и обратимую нормализацию Kim et al. (2021). У моделей с вниманием — три головы. Валидационный лосс мониторим по эпохам; обучение останавливаем, если 10 эпох подряд нет улучшения. На тесте берём веса с наименьшим суммарным валидационным лоссом. Обучение — Google Colab, одна GPU A100.

4. Результаты

Сначала — влияние преобразований входа (табл. 1). MSE и MAE считаются по многоуровневым ценам, значения дескейлены в исходные доллары. Комбинация процентного изменения и min-max даёт наименьшие ошибки: MSE 0.0464, MAE 0.1260 — лучше каждого преобразования по отдельности.

Таблица 1. Метрики по преобразованиям входа на пяти ценовых уровнях. Все значения дескейлены в доллары.
ПреобразованиеPercent-changeMin-maxPercent-change + min-max
MSE4.54470.06600.0464
MAE1.32250.14690.1260

Процентное изменение — стандарт в финансовых рядах: оно навязывает стационарность, необходимую для прогноза. Нестационарность уводит модель к тренду вместо флуктуаций. Min-max уместен в многомерных данных с разными шкалами: объёмы обычно волатильнее цен, и без масштабирования они перетягивают внимание. Комбинация стабилизирует ценовой ряд и удерживает объёмы в фиксированном диапазоне.

Дальше сравниваем seq2seq-модели: линейную авторегрессию (Linear), LSTM Schmidhuber et al. (1997), трансформер с временным вниманием (Temporal) в духе Informer Zhou et al. (2021), Spacetimeformer с пространственным и временным вниманием Grigsby et al. (2022) и нашу модель с составным многомерным эмбеддингом (Compound).

Таблица 2. Результаты на тесте. Mid-цена — среднее лучших bid и ask. Forecasting loss — MSE по всем пяти уровням цен и объёмов; structure loss — нарушения порядковой структуры; total loss — взвешенная сумма. Все значения после масштабирования.
Модели рядов Модели с вниманием
LinearLSTMTemporalSpacetimeCompound (ours)
mid-price MSE0.01250.01240.01240.01220.0120
mid-price MAE0.15010.14660.15200.14250.1388
price MSE*0.00260.00260.00270.00250.0025
price MAE*0.03100.03030.03320.02930.0288
volume MSE**0.01050.01180.01090.01050.0106
volume MAE**0.05100.05410.05330.05150.0504
Forecasting loss0.00650.00720.00680.00650.0066
Structure loss0.24300.26240.88360.57740.1480
Total loss0.00900.00980.01570.01230.0080

* Агрегат по bid и ask на всех пяти уровнях. ** То же для объёмов.

Составная модель даёт наименьшую ошибку по всем ценовым метрикам, включая mid и многоуровневые цены. Главное — наименьший structure loss (0.148 против 0.243 у линейной модели, 0.577 у Spacetimeformer и 0.884 у Temporal) и наименьший total loss. Temporal-эмбеддинг (Informer) почти не сохраняет порядок уровней. Метрики mid, цен и объёмов приведены для справки и в лосс не входят.

Прогноз цен пяти уровней AMZN: факт и три метода с вниманием
Рис. 9. Прогноз цен уровня 5 для AMZN на 2 минуты вперёд по 10 минутам контекста; период прогноза — справа от пунктира. (A) факт; (B) составной эмбеддинг; (C) temporal; (D) spatiotemporal. Многоуровневые цены, кроме лучших, — серые линии.

Рис. 9 и 10 сравнивают факт и прогноз цен и объёмов AMZN на первом окне теста. На рис. 9 составной эмбеддинг (B) повторяет нисходящий тренд факта (A) точнее, чем temporal (C) и spatiotemporal (D). И наш метод, и spatiotemporal сохраняют порядковую структуру многоуровневых цен; temporal её ломает — он обрабатывает несколько рядов без эмбеддингов переменных.

Прогноз объёмов пяти уровней AMZN: факт и три метода с вниманием
Рис. 10. Прогноз объёмов уровня 5 для первого снимка теста AMZN по 10 минутам контекста. (A) факт; (B) составной эмбеддинг; (C) temporal; (D) spatiotemporal.

На рис. 10 составной эмбеддинг даёт снимок объёмов, близкий к фактическим размерам заявок. Различия между моделями с вниманием по объёмам слабее, чем по ценам. Дополнительные примеры по другим акциям и по линейной модели / LSTM — на рис. S1–S6 оригинала (приложение).

5. Обсуждение

Подход полностью data-driven: прогнозируются и многоуровневые цены, и размеры заявок на каждом уровне. Это расширяет горизонт анализа за пределы mid-цены, где практические применения часто ограничены. Гранулярная структура уровней лучше отражает реальную динамику и даёт более действенную основу для исполнения.

Глубина рынка — размеры заявок по уровням — сильно влияет на быстрые флуктуации стакана. Выставление, отмена или исполнение крупных заявок сдвигают приоритеты и перестраивают уровни. Из-за ограничений вычислительных ресурсов эксперименты проведены на пяти лучших уровнях; метод расширяется на большую глубину и более длинные горизонты.

Модель ловит зависимости по ценам и объёмам, но не различает причину флуктуации — новая заявка, отмена, исполнение или модификация. Архитектура с вниманием адаптируется к смене рыночного контекста в реальном времени. Дальнейшая работа — включить типы событий, чтобы разделять источники изменений стакана.

На практике прогноз многоуровневого стакана полезен для оптимального исполнения крупных заявок: можно симулировать отклик книги на текущих данных, заранее оценить влияние на глубину, спред и цену и скорректировать размещение, чтобы снизить проскальзывание и импакт. Многоуровневые оценки помогают выбрать размер и момент сделки так, чтобы не вызывать неблагоприятное движение цены и не исчерпывать ликвидность.

6. Заключение

Мы рассмотрели прогноз многоуровневого стакана — задачу, которая часто превосходит обычные модели временных рядов. Основной вклад — составной многомерный эмбеддинг внутри seq2seq-моделей с вниманием. Он ловит взаимозависимости атрибутов LOB: типа заявки, признака и уровня. Эмпирически метод стабильно превосходит существующие многомерные прогнозы: наименьшие ошибки при сохранении порядковой структуры стакана. Это делает его полезным для финансовых рядов, особенно в HFT. Дальнейшее направление — задачи оптимального исполнения и оптимизация под прогноз в реальном времени.

Литература

  1. Abergel, F., Anane, M., Chakraborti, A., Jedidi, A. & Toke, I. M. (2016). Limit order books. Cambridge University Press.
  2. Arroyo, A., Cartea, A., Moreno-Pino, F. & Zohren, S. (2024). Deep attentive survival analysis in limit order books: Estimating fill probabilities with convolutional-transformers. Quantitative Finance 24(1), 35–57.
  3. Bahdanau, D., Chorowski, J., Serdyuk, D., Brakel, P. & Bengio, Y. (2016). End-to-end attention-based large vocabulary speech recognition. In: ICASSP, 4945–4949.
  4. Choromanski, K. et al. (2020). Rethinking attention with performers. arXiv:2009.14794.
  5. Chorowski, J. K., Bahdanau, D., Serdyuk, D., Cho, K. & Bengio, Y. (2015). Attention-based models for speech recognition. NeurIPS 28.
  6. Cui, B., Li, Y., Chen, M. & Zhang, Z. (2019). Fine-tune BERT with sparse self-attention mechanism. In: EMNLP-IJCNLP, 3548–3553.
  7. Devlin, J., Chang, M.-W., Lee, K. & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.
  8. Du, S., Li, T., Yang, Y. & Horng, S.-J. (2020). Multivariate time series forecasting via attention-based encoder–decoder framework. Neurocomputing 388, 269–279.
  9. Fan, C. et al. (2019). Multi-horizon time series forecasting with temporal attention learning. In: KDD, 2527–2535.
  10. Galassi, A., Lippi, M. & Torroni, P. (2020). Attention in natural language processing. IEEE TNNLS 32(10), 4291–4308.
  11. Grigsby, J., Wang, Z. & Qi, Y. (2022). Long-Range Transformers for Dynamic Spatiotemporal Forecasting.
  12. Huang, R. & Polak, T. (2011). LOBSTER: Limit order book reconstruction system. SSRN 1977207.
  13. Kazemi, S. M. et al. (2019). Time2Vec: Learning a Vector Representation of Time.
  14. Kercheval, A. N. & Zhang, Y. (2015). Modelling high-frequency limit order book dynamics with support vector machines. Quantitative Finance 15(8), 1315–1329.
  15. Kim, T. et al. (2021). Reversible instance normalization for accurate time-series forecasting against distribution shift. In: ICLR.
  16. Liu, Y., Wu, H., Wang, J. & Long, M. (2022). Non-stationary transformers: Rethinking the stationarity in time series forecasting. arXiv:2205.14415.
  17. Liu, Z., Sham, C.-W., Ma, L. & Fu, C. (2024). ViT-LOB: Efficient vision transformer for stock-price trend prediction using limit order books. In: ICASI, 436–438.
  18. Ntakaris, A., Magris, M., Kanniainen, J., Gabbouj, M. & Iosifidis, A. (2018). Benchmark dataset for mid-price forecasting of limit order book data with machine learning methods. Journal of Forecasting 37(8), 852–866.
  19. Schmidhuber, J., Hochreiter, S. et al. (1997). Long short-term memory. Neural Comput 9(8), 1735–1780.
  20. Shih, S.-Y., Sun, F.-K. & Lee, H.-y. (2019). Temporal pattern attention for multivariate time series forecasting. Machine Learning 108(8), 1421–1441.
  21. Sirignano, J. A. (2019). Deep learning for limit order books. Quantitative Finance 19(4), 549–570.
  22. Tsantekidis, A. et al. (2020). Using deep learning for price prediction by exploiting stationary limit order book features. Applied Soft Computing 93, 106401.
  23. Vaswani, A. et al. (2017). Attention is all you need. NeurIPS 30.
  24. Wu, Y., Wang, S. & Fu, X. (2024). MWDN-Transformer: Utilizing cyclical patterns for short-term forecasting of limit order book in China markets. In: CNIOT, 175–181.
  25. Yang, B., Wang, L., Wong, D. F., Shi, S. & Tu, Z. (2021). Context-aware self-attention networks for natural language processing. Neurocomputing 458, 157–169.
  26. Zeyer, A., Irie, K., Schlüter, R. & Ney, H. (2018). Improved training of end-to-end attention models for speech recognition. arXiv:1805.03294.
  27. Zhang, Z., Zohren, S. & Roberts, S. (2019). DeepLOB: Deep convolutional neural networks for limit order books. IEEE Trans. Signal Processing 67(11), 3001–3012.
  28. Zhou, H. et al. (2021). Informer: Beyond efficient transformer for long sequence time-series forecasting. In: AAAI, 11106–11115.

Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2409.02277 · Jung, Lee · CC BY-NC-ND 4.0.