Attention-Based Reading, Highlighting, and Forecasting of the Limit Order Book
Дживон Юнг, Кисоп Ли · Department of Statistics, Purdue University · 4 ноября 2024 (v2)
Переписка: Jiwon Jung, jung320@purdue.edu.
Оригинал: Jung, J., Lee, K. «Attention-Based Reading, Highlighting, and Forecasting of the Limit Order Book», 2024 — arxiv.org/abs/2409.02277 (PDF), лицензия CC BY-NC-ND 4.0.
Рисунки и таблицы воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY-NC-ND 4.0 (некоммерческое использование, без производных).
Аннотация
Управление высокочастотными данными книги лимитных заявок (LOB) сложно и часто выходит за пределы возможностей обычных моделей временных рядов. Точный прогноз многоуровневого стакана — не только mid-цены — важен для понимания рыночной динамики, но труден из-за взаимозависимостей между атрибутами: типом заявки, признаком (цена или объём) и уровнем. В работе вводятся seq2seq-модели с вниманием для прогноза всего многоуровневого стакана, включая цены и объёмы. Ключевой вклад — метод составного многомерного эмбеддинга (compound multivariate embedding), который ловит пространственно-временные связи. Эмпирически метод даёт наименьшую ошибку прогноза при сохранении порядковой структуры LOB.
Ключевые слова: книга лимитных заявок; прогноз многомерных временных рядов; механизм внимания; пространственно-временной эмбеддинг.
1. Введение
Книга лимитных заявок — цифровая запись всех неисполненных заявок на покупку и продажу финансового инструмента. Она содержит цену и количество каждой заявки и время её выставления. Стакан непрерывно обновляется при выставлении, исполнении и отмене заявок и даёт мгновенный снимок спроса и предложения. Распределение заявок по ценовым уровням несёт информацию о глубине рынка и возможных движениях цены.
Прогнозное моделирование LOB затруднено высокой частотой и сложностью данных. Заявки добавляются, изменяются и снимаются с миллисекундными интервалами; это требует быстрой обработки больших объёмов информации. Кроме того, данные имеют сложную многомерную структуру с составными атрибутами: уровень, тип (bid/ask) и признак (цена/объём) связаны и одновременно относятся к каждому значению. Порядковая структура многоуровневых цен — типичный пример такой связанности. Чтобы прогноз был осмысленным, нужно явно учитывать влияние каждого атрибута.
Ещё одна трудность — нестационарность. Статистические свойства ряда (среднее, дисперсия, автокорреляция) меняются во времени; сдвиги тренда и структурные изменения дают разные распределения на обучении и тесте. Адаптивное внимание Liu et al. (2022) и обучаемая нормализация Kim et al. (2021) частично решают это, но плохо справляются с резкими скачками высокочастотных данных и требуют аккуратной настройки длинных зависимостей.
Из-за сложности полной динамики стакана многие работы прогнозируют только mid-цену — среднее лучших bid и ask. Применялись регрессия Ntakaris et al. (2018), SVM Kercheval & Zhang (2015) и глубокие сети Liu et al. (2024), Tsantekidis et al. (2020), Zhang et al. (2019). Mid-цена — индикатор общего тренда. Но рис. 1 показывает: стакан может сильно различаться по глубине на разных уровнях и по спреду при одной и той же mid-цене. Одного mid-price недостаточно, когда нужна глубина книги — например, в оптимальном исполнении. То же замечает Sirignano (2019): важно моделировать совместное распределение bid и ask, а не предполагать постоянный спред вокруг mid. В той работе классификация mid расширена до совместного распределения цен, но размеры заявок используются только как входы и не прогнозируются совместно. Полный вид стакана — цены и глубины обеих сторон — нужен для риск-менеджмента.
Модели с вниманием — Transformer Vaswani et al. (2017) и BERT Devlin et al. (2019) — хорошо решают seq2seq, назначая разные веса разным частям данных. Они успешны в NLP, распознавании речи и прогнозе временных рядов. Приложений к прогнозу стакана пока мало. Недавно Arroyo et al. (2024) оценивали вероятности исполнения методами выживаемости, Liu et al. (2024) классифицировали движение mid vision-трансформером, Wu et al. (2024) применяли вейвлет-разложение для краткосрочного прогноза на китайском рынке. Ни одна из этих работ не прогнозировала полную структуру цен и объёмов внутри стакана.
Мы используем архитектуру Spacetimeformer Grigsby et al. (2022) и добавляем кастомный эмбеддинг, который ловит пространственно-временные признаки и сохраняет структурную целостность LOB. Совместная обработка цен и объёмов повышает точность относительно традиционных моделей.
Вклад трояк:
- расширяем модели с вниманием за пределы прогноза mid-цены, чтобы ловить динамику всей структуры стакана;
- вводим модифицированные пространственно-временные эмбеддинги, обобщаемые на многомерные ряды с составными атрибутами;
- снижаем эффект нестационарности высокочастотных финансовых данных преобразованием «процентное изменение + min-max», не усложняя саму модель.
Дальше: раздел 2 — данные и постановка эксперимента; раздел 3 — методы; раздел 4 — результаты и сравнение; раздел 5 — обсуждение; раздел 6 — заключение.
2. Данные
LOB — запись заявок на покупку и продажу актива в реальном времени. Она упорядочена по ценовым уровням и в каждый момент показывает лучший bid (наивысшая цена покупки) и лучший ask (наименьшая цена продажи) вместе с объёмами и временными метками. В этом разделе разбираем высокочастотные свойства и пространственно-временную структуру данных и описываем подготовку входов.
2.1. Высокочастотная динамика и пространственно-временные корреляции
2.1.1. Высокочастотный стакан
В HFT и микроструктуре классические допущения — стационарность и независимые приращения — плохо согласуются с реальной динамикой стакана. Непрерывный поток заявок, частые смены цены и быстрые реакции алгоритмов дают шумные, нерегулярные и нестационарные ряды. Инструменты низкочастотного анализа не ловят нюансы высокочастотной среды.
Рис. 2 показывает скользящие средние лучших bid и ask AMZN за один торговый день на интервалах от секунд до часов. Короткие окна ловят острые колебания и волатильность; длинные — сглаживают их. Выбор временного масштаба критичен: высокочастотное поведение маскируется агрегацией.
Ещё одно частое упрощение — постоянный спред. Рис. 3 показывает, что в HFT спред далеко не постоянен. На мелких интервалах он непрерывно и заметно флуктуирует, особенно около открытия и закрытия. Меняются и среднее, и волатильность спреда. Модели с постоянным спредом удобны математически, но не отражают богатство микроструктуры Abergel et al. (2016).
2.1.2. Пространственно-временная структура LOB
В многоуровневом стакане каждый ценовой уровень и соответствующий объём участвуют в перестройке книги: новые заявки, отмены и исполнения меняют структуру и могут влиять на поведение на других уровнях. Эти быстрые одновременные изменения показывают, как взаимодействие участников динамически бьёт и по ценам, и по объёмам.
Рис. 4 связывает движение mid (верхняя панель) с изменениями цен и объёмов нескольких уровней. Сдвиги в многоуровневой структуре — кумулятивный эффект вариаций цены и объёма, которые обычно взаимосвязаны. На теплокартах большие области стакана статичны (0% изменения): не все уровни меняются с каждым событием. Активность разрежена — сдвиги происходят прерывисто на отдельных уровнях. Но когда существенное движение идёт в определённую сторону, оно часто тянет соседние уровни в том же направлении. Движения часто одновременны по атрибутам (цена и объём) — составной эффект по всей книге. Эта разреженная, но коррелированная активность показывает, как глубина и поток заявок формируют стакан.
Нужен подход, который выдерживает высокочастотность, нестационарность и пространственно-временную структуру. Data-driven метод здесь уместнее теоретических допущений: он лучше ловит зависимости, эволюционирующие на коротких интервалах.
2.2. Структура данных и подготовка
Используем датасет LOBSTER Huang & Polak (2011): сообщения и снимки стакана по выбранным акциям. Пять крупных технологических компаний: AAPL, GOOG, INTC, MSFT и AMZN. Выборка — торговый день 21 июня 2012, с открытия 9:30 до закрытия 16:00; от 300 000 до 600 000 снимков на акцию, миллисекундное разрешение, уровень 5. Файл стакана отслеживает эволюцию книги; файл сообщений логирует события, запускающие обновления (метки от миллисекунд до наносекунд).
Стакан состоит из двух типов заявок: bid (покупка) и ask (продажа). Он обновляется при каждом изменении: выставление, отмена, удаление, исполнение. Снимок $i\in\{1,\ldots,I\}$ обозначаем $\vec{X}_i$. Bid и ask задаются векторами с временной меткой и парами цена–объём на каждом уровне $k\in\{1,\ldots,K\}$:
\[ \vec{X}_i=\bigl[t_i,\,(p^b_{1i},v^b_{1i}),\ldots,(p^b_{Ki},v^b_{Ki}),\,(p^a_{1i},v^a_{1i}),\ldots,(p^a_{Ki},v^a_{Ki})\bigr], \]где $t_i$ — метка времени, $p^{b/a}_{ki}$ — цена уровня $k$ на стороне bid/ask, $v^{b/a}_{ki}$ — соответствующий объём. Число уровней фиксируем: $K=5$ с обеих сторон.
Для согласованности временные метки приводим к равным интервалам 5 секунд. Это даёт около 4680 снимков за торговый день. Данные пяти акций конкатенируем: получается 100-мерный ряд (пять уровней bid и ask, цены и объёмы, по каждой акции). Разбиение train / validation / test — 6:2:2. Контекст прогноза — 120 шагов (10 минут), цель — 24 шага (2 минуты).
2.3. Преобразование и масштабирование входа
Нестационарные координаты мешают обучению: распределения на обучении и тесте расходятся — типичная проблема длинных рядов. Многоуровневые цены часто нестационарны даже внутри одного дня.
Цены преобразуем в процентные изменения на всех уровнях:
\[ p^{\mathrm{perc}}_{k,i}=\frac{p_{k,i}-p_{k,i-1}}{p_{k,i-1}}. \]Рис. 6 показывает, что преобразованный ряд заметно стационарнее сырого. На обучении дополнительно применяем min-max по каждой переменной отдельно, чтобы ряды с большой амплитудой (особенно объёмы) не доминировали:
\[ p^{\mathrm{scaled}}_{k,i}=\frac{p^{\mathrm{perc}}_{k,i}-\min_i(p^{\mathrm{perc}}_{k,i})}{\max_i(p^{\mathrm{perc}}_{k,i})-\min_i(p^{\mathrm{perc}}_{k,i})},\qquad v^{\mathrm{scaled}}_{k,i}=\frac{v_{k,i}-\min_i(v_{k,i})}{\max_i(v_{k,i})-\min_i(v_{k,i})}. \]Сравнение преобразований — табл. 1 в разделе 4.
3. Метод
3.1. Составной многомерный эмбеддинг
Эмбеддинг кодирует время, значения, переменные и информацию «контекст / цель». Слой Time2Vec Kazemi et al. (2019) переводит временные метки в частотные эмбеддинги; затем feed-forward ловит временные паттерны. Бинарный context-target эмбеддинг отмечает, наблюдается ли значение в контексте или его нужно прогнозировать.
Структура данных несёт составные атрибуты: уровень $k$, тип (bid или ask), признак (цена или объём), акция (тикер). Чтобы ловить зависимости между ними, мы строим составной многомерный эмбеддинг по мотивам Spacetimeformer Grigsby et al. (2022). В исходном Spacetimeformer целочисленный эмбеддинг назначается каждой переменной отдельно. У нас эмбеддинг назначается каждому атрибуту; затем многоуровневые эмбеддинги комбинируются и масштабируются. На рис. 7 у каждого атрибута свой слой: один кодирует bid/ask, другой — уровень, третий — цену или объём, четвёртый — тикер.
Интеграция и масштабирование нескольких слоёв ловят не только временные и пространственные паттерны, но и связи между атрибутами. Одновременно сокращается число параметров эмбеддинг-слоя. Последовательность обрабатывается encoder–decoder с вниманием (рис. 8). Энкодер — self-attention для локального и глобального контекста; декодер — masked attention, чтобы не видеть будущее. Финальный feed-forward возвращает выход в формат исходной последовательности стакана.
Механизм внимания Vaswani et al. (2017) обновляет представления токенов:
\[ \mathrm{Attention}(Q,K,V)=\mathrm{softmax}\Bigl(\frac{QK^{\top}}{\sqrt{d}}\Bigr)V, \]где $Q=W^Q X$, $K=W^K Z$, $V=W^V Z$ — линейные проекции с обучаемыми матрицами. Для последовательности длины $L$ и размерности $d$ self-attention оценивает и временные, и межпеременные зависимости. Для вычислительной эффективности используем Performer Choromanski et al. (2020): аппроксимация внимания с линейной сложностью по памяти и времени.
3.2. Обучение
Прогнозная потеря. Разницу между прогнозом и фактом измеряем MSE и MAE. Функция потерь минимизирует MSE цен и объёмов пяти уровней:
\[ \mathrm{Forecasting\,Loss}=\sum_{i,j,k}\bigl(p^j_{k,i}-\hat p^j_{k,i}\bigr)^2+\sum_{i,j,k}\bigl(v^j_{k,i}-\hat v^j_{k,i}\bigr)^2. \]MSE выбрана как стандарт для многомерного прогноза в трансформерных моделях и за акцент на крупных ошибках. MAE пишем для отчёта, но в лосс не входит.
Структурный регуляризатор. Чтобы сеть уважала многоуровневую структуру стакана, вводим штраф за нарушение порядка цен. Цена ask уровня 1 — наименьшее предложение продавцов; уровень 2 — второе лучшее, и так далее. Для фиксированного снимка $i$ порядковая структура:
\[ p^a_{k_1,i} \lt p^a_{k_2,i}\quad\text{для всех }k_1 \lt k_2, \] \[ p^b_{1,i} \lt p^a_{1,i}, \] \[ p^b_{k_1,i} \gt p^b_{k_2,i}\quad\text{для всех }k_1 \lt k_2. \]Чтобы выходы сети следовали этому порядку, добавляем штраф на каждом снимке $i$:
\[ \mathrm{Structure\,loss}_i=\sum_{k=1}^{K-1}\Bigl(\mathrm{ReLU}(\hat p^a_{k,i}-\hat p^a_{k+1,i})+\mathrm{ReLU}(\hat p^b_{k+1,i}-\hat p^b_{k,i})\Bigr)+\mathrm{ReLU}(\hat p^b_{1,i}-\hat p^a_{1,i}), \]где $\mathrm{ReLU}(x)=\max(0,x)$. Штрафуются только положительные нарушения: предсказанный более глубокий ask не должен быть дешевле лучшего, более глубокий bid — дороже лучшего, лучший bid не должен пересекать лучший ask.
Полный лосс с весом регуляризации $w_o\ge 0$:
\[ \mathrm{Loss}=\mathrm{Forecasting\,loss}+w_o\sum_{i=1}^{I}\mathrm{Structure\,loss}_i. \]Вес фиксируем $w_o=0.01$, чтобы масштабы прогнозной и структурной частей были сопоставимы.
Скорость обучения затухает с фактором 0.8 и 1000 warmup-шагами. Используем сезонную декомпозицию и обратимую нормализацию Kim et al. (2021). У моделей с вниманием — три головы. Валидационный лосс мониторим по эпохам; обучение останавливаем, если 10 эпох подряд нет улучшения. На тесте берём веса с наименьшим суммарным валидационным лоссом. Обучение — Google Colab, одна GPU A100.
4. Результаты
Сначала — влияние преобразований входа (табл. 1). MSE и MAE считаются по многоуровневым ценам, значения дескейлены в исходные доллары. Комбинация процентного изменения и min-max даёт наименьшие ошибки: MSE 0.0464, MAE 0.1260 — лучше каждого преобразования по отдельности.
| Преобразование | Percent-change | Min-max | Percent-change + min-max |
|---|---|---|---|
| MSE | 4.5447 | 0.0660 | 0.0464 |
| MAE | 1.3225 | 0.1469 | 0.1260 |
Процентное изменение — стандарт в финансовых рядах: оно навязывает стационарность, необходимую для прогноза. Нестационарность уводит модель к тренду вместо флуктуаций. Min-max уместен в многомерных данных с разными шкалами: объёмы обычно волатильнее цен, и без масштабирования они перетягивают внимание. Комбинация стабилизирует ценовой ряд и удерживает объёмы в фиксированном диапазоне.
Дальше сравниваем seq2seq-модели: линейную авторегрессию (Linear), LSTM Schmidhuber et al. (1997), трансформер с временным вниманием (Temporal) в духе Informer Zhou et al. (2021), Spacetimeformer с пространственным и временным вниманием Grigsby et al. (2022) и нашу модель с составным многомерным эмбеддингом (Compound).
| Модели рядов | Модели с вниманием | ||||
|---|---|---|---|---|---|
| Linear | LSTM | Temporal | Spacetime | Compound (ours) | |
| mid-price MSE | 0.0125 | 0.0124 | 0.0124 | 0.0122 | 0.0120 |
| mid-price MAE | 0.1501 | 0.1466 | 0.1520 | 0.1425 | 0.1388 |
| price MSE* | 0.0026 | 0.0026 | 0.0027 | 0.0025 | 0.0025 |
| price MAE* | 0.0310 | 0.0303 | 0.0332 | 0.0293 | 0.0288 |
| volume MSE** | 0.0105 | 0.0118 | 0.0109 | 0.0105 | 0.0106 |
| volume MAE** | 0.0510 | 0.0541 | 0.0533 | 0.0515 | 0.0504 |
| Forecasting loss | 0.0065 | 0.0072 | 0.0068 | 0.0065 | 0.0066 |
| Structure loss | 0.2430 | 0.2624 | 0.8836 | 0.5774 | 0.1480 |
| Total loss | 0.0090 | 0.0098 | 0.0157 | 0.0123 | 0.0080 |
* Агрегат по bid и ask на всех пяти уровнях. ** То же для объёмов.
Составная модель даёт наименьшую ошибку по всем ценовым метрикам, включая mid и многоуровневые цены. Главное — наименьший structure loss (0.148 против 0.243 у линейной модели, 0.577 у Spacetimeformer и 0.884 у Temporal) и наименьший total loss. Temporal-эмбеддинг (Informer) почти не сохраняет порядок уровней. Метрики mid, цен и объёмов приведены для справки и в лосс не входят.
Рис. 9 и 10 сравнивают факт и прогноз цен и объёмов AMZN на первом окне теста. На рис. 9 составной эмбеддинг (B) повторяет нисходящий тренд факта (A) точнее, чем temporal (C) и spatiotemporal (D). И наш метод, и spatiotemporal сохраняют порядковую структуру многоуровневых цен; temporal её ломает — он обрабатывает несколько рядов без эмбеддингов переменных.
На рис. 10 составной эмбеддинг даёт снимок объёмов, близкий к фактическим размерам заявок. Различия между моделями с вниманием по объёмам слабее, чем по ценам. Дополнительные примеры по другим акциям и по линейной модели / LSTM — на рис. S1–S6 оригинала (приложение).
5. Обсуждение
Подход полностью data-driven: прогнозируются и многоуровневые цены, и размеры заявок на каждом уровне. Это расширяет горизонт анализа за пределы mid-цены, где практические применения часто ограничены. Гранулярная структура уровней лучше отражает реальную динамику и даёт более действенную основу для исполнения.
Глубина рынка — размеры заявок по уровням — сильно влияет на быстрые флуктуации стакана. Выставление, отмена или исполнение крупных заявок сдвигают приоритеты и перестраивают уровни. Из-за ограничений вычислительных ресурсов эксперименты проведены на пяти лучших уровнях; метод расширяется на большую глубину и более длинные горизонты.
Модель ловит зависимости по ценам и объёмам, но не различает причину флуктуации — новая заявка, отмена, исполнение или модификация. Архитектура с вниманием адаптируется к смене рыночного контекста в реальном времени. Дальнейшая работа — включить типы событий, чтобы разделять источники изменений стакана.
На практике прогноз многоуровневого стакана полезен для оптимального исполнения крупных заявок: можно симулировать отклик книги на текущих данных, заранее оценить влияние на глубину, спред и цену и скорректировать размещение, чтобы снизить проскальзывание и импакт. Многоуровневые оценки помогают выбрать размер и момент сделки так, чтобы не вызывать неблагоприятное движение цены и не исчерпывать ликвидность.
6. Заключение
Мы рассмотрели прогноз многоуровневого стакана — задачу, которая часто превосходит обычные модели временных рядов. Основной вклад — составной многомерный эмбеддинг внутри seq2seq-моделей с вниманием. Он ловит взаимозависимости атрибутов LOB: типа заявки, признака и уровня. Эмпирически метод стабильно превосходит существующие многомерные прогнозы: наименьшие ошибки при сохранении порядковой структуры стакана. Это делает его полезным для финансовых рядов, особенно в HFT. Дальнейшее направление — задачи оптимального исполнения и оптимизация под прогноз в реальном времени.
Литература
- Abergel, F., Anane, M., Chakraborti, A., Jedidi, A. & Toke, I. M. (2016). Limit order books. Cambridge University Press.
- Arroyo, A., Cartea, A., Moreno-Pino, F. & Zohren, S. (2024). Deep attentive survival analysis in limit order books: Estimating fill probabilities with convolutional-transformers. Quantitative Finance 24(1), 35–57.
- Bahdanau, D., Chorowski, J., Serdyuk, D., Brakel, P. & Bengio, Y. (2016). End-to-end attention-based large vocabulary speech recognition. In: ICASSP, 4945–4949.
- Choromanski, K. et al. (2020). Rethinking attention with performers. arXiv:2009.14794.
- Chorowski, J. K., Bahdanau, D., Serdyuk, D., Cho, K. & Bengio, Y. (2015). Attention-based models for speech recognition. NeurIPS 28.
- Cui, B., Li, Y., Chen, M. & Zhang, Z. (2019). Fine-tune BERT with sparse self-attention mechanism. In: EMNLP-IJCNLP, 3548–3553.
- Devlin, J., Chang, M.-W., Lee, K. & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.
- Du, S., Li, T., Yang, Y. & Horng, S.-J. (2020). Multivariate time series forecasting via attention-based encoder–decoder framework. Neurocomputing 388, 269–279.
- Fan, C. et al. (2019). Multi-horizon time series forecasting with temporal attention learning. In: KDD, 2527–2535.
- Galassi, A., Lippi, M. & Torroni, P. (2020). Attention in natural language processing. IEEE TNNLS 32(10), 4291–4308.
- Grigsby, J., Wang, Z. & Qi, Y. (2022). Long-Range Transformers for Dynamic Spatiotemporal Forecasting.
- Huang, R. & Polak, T. (2011). LOBSTER: Limit order book reconstruction system. SSRN 1977207.
- Kazemi, S. M. et al. (2019). Time2Vec: Learning a Vector Representation of Time.
- Kercheval, A. N. & Zhang, Y. (2015). Modelling high-frequency limit order book dynamics with support vector machines. Quantitative Finance 15(8), 1315–1329.
- Kim, T. et al. (2021). Reversible instance normalization for accurate time-series forecasting against distribution shift. In: ICLR.
- Liu, Y., Wu, H., Wang, J. & Long, M. (2022). Non-stationary transformers: Rethinking the stationarity in time series forecasting. arXiv:2205.14415.
- Liu, Z., Sham, C.-W., Ma, L. & Fu, C. (2024). ViT-LOB: Efficient vision transformer for stock-price trend prediction using limit order books. In: ICASI, 436–438.
- Ntakaris, A., Magris, M., Kanniainen, J., Gabbouj, M. & Iosifidis, A. (2018). Benchmark dataset for mid-price forecasting of limit order book data with machine learning methods. Journal of Forecasting 37(8), 852–866.
- Schmidhuber, J., Hochreiter, S. et al. (1997). Long short-term memory. Neural Comput 9(8), 1735–1780.
- Shih, S.-Y., Sun, F.-K. & Lee, H.-y. (2019). Temporal pattern attention for multivariate time series forecasting. Machine Learning 108(8), 1421–1441.
- Sirignano, J. A. (2019). Deep learning for limit order books. Quantitative Finance 19(4), 549–570.
- Tsantekidis, A. et al. (2020). Using deep learning for price prediction by exploiting stationary limit order book features. Applied Soft Computing 93, 106401.
- Vaswani, A. et al. (2017). Attention is all you need. NeurIPS 30.
- Wu, Y., Wang, S. & Fu, X. (2024). MWDN-Transformer: Utilizing cyclical patterns for short-term forecasting of limit order book in China markets. In: CNIOT, 175–181.
- Yang, B., Wang, L., Wong, D. F., Shi, S. & Tu, Z. (2021). Context-aware self-attention networks for natural language processing. Neurocomputing 458, 157–169.
- Zeyer, A., Irie, K., Schlüter, R. & Ney, H. (2018). Improved training of end-to-end attention models for speech recognition. arXiv:1805.03294.
- Zhang, Z., Zohren, S. & Roberts, S. (2019). DeepLOB: Deep convolutional neural networks for limit order books. IEEE Trans. Signal Processing 67(11), 3001–3012.
- Zhou, H. et al. (2021). Informer: Beyond efficient transformer for long sequence time-series forecasting. In: AAAI, 11106–11115.
Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2409.02277 · Jung, Lee · CC BY-NC-ND 4.0.