Глубокий attentive survival-анализ в книге лимитных заявок: оценка fill probability свёрточным трансформером

6.5/10

Альваро Арройо, Альваро Картеа, Фернандо Морено-Пино, Стефан Зорен · Oxford-Man Institute / Mathematical Institute, University of Oxford; Universidad Carlos III de Madrid · 8 июня 2023

Опубликовано: Quantitative Finance 24, 35–57.

Оригинал: Arroyo, Á., Cartea, Á., Moreno-Pino, F. and Zohren, S. «Deep Attentive Survival Analysis in Limit Order Books: Estimating Fill Probabilities with Convolutional-Transformers», 2023 — arxiv.org/abs/2306.05479 (PDF).

Оригинал на arXiv по лицензии arXiv nonexclusive-distrib 1.0 (не Creative Commons); перевод для личной коллекции, не для публикации.

Смежные переводы: Fabre–Ragel, фиксированный горизонт и цензурирование · полуаналитические fill при state-dependent потоках.

Ключевые слова: fill probability; лимитный стакан; оптимальное исполнение; маркетмейкинг; размещение заявок; анализ выживаемости.

Аннотация

Ключевое решение в исполнении — пассивная (даёт ликвидность) или агрессивная (забирает) заявка. Для этого нужна fill probability пассивной лимитки. Статья предлагает deep-learning оценку времён исполнения заявок на разных уровнях стакана: survival-модель отображает time-varying признаки LOB в распределение filltimes. Архитектура — свёрточно-трансформерный энкодер и монотонный нейросетевой декодер. Сравнение с литературой survival через proper scoring rules; интерпретируемость — какие признаки информативны. Метод значимо бьёт типичные survival-подходы. В конце — статистика fill заявок внутри спреда для активов с разной динамикой очереди и активностью.

1. Введение

Большинство электронных бирж клирит спрос и предложение через LOB. Рыночная заявка пересекает спред и исполняется сразу; лимитка стоит на уровне и, если исполнится, даёт лучшую цену. Цена улучшения — риск: лимитка ждёт входящий market order или снимается. Время до исполнения — time-to-fill. Здесь его оценивают survival-анализом на разных глубинах книги.

Предлагается encoder–decoder на Transformer (Vaswani et al., 2017) и частично монотонных сетях. Self-attention энкодера суммирует события в lookback до постановки заявки; эта латентная картина стакана даёт вероятность исполнения после отправки. На вход внимания идёт локально-осведомлённое представление ряда — свёртка. Оценка survival — proper scoring rules (Gneiting–Ranjan 2011; Avati et al. 2020; Rindt et al. 2022), а не time-dependent concordance и прочие improper метрики, которые могут хвалить неверный прокси.

Данные — Nasdaq. Матчинг price-time priority. Архитектура бьёт off-the-shelf и стандартные survival-бенчмарки на бумагах с разной микроструктурой. Первая статистическая оценка fill заявок внутри спреда. Shapley (Lundberg–Lee 2017): модель опирается на высокочастотные признаки, а не на медленные внутридневные сезонные.

2. Обзор литературы

Survival (time-to-event) — медицина, churn, клинические испытания. Связь распределения времён с ковариатами: Cox PH (Cox 1972), accelerated failure time (Wei 1992). Deep: Faraggi–Simon (1995) расширяют Cox сетью; Katzman et al. (DeepSurv 2018), Kvamme et al. (2019) — dropout; Lee et al. (DeepHit 2018, 2019) — дискретная survival без формы. Rindt et al. (2022) — зачем proper scores. Ещё: гауссовские процессы, случайные леса, adversarial.

В финансах Cho–Nelling (2000) предполагают Weibull, отмены — правая цензура; частичные исполнения — как заявки меньшего объёма. Lo et al. (2002) — обобщённая гамма и AFT, отдельно time-to-completion / first fill / cancellation; hypothetical limit orders (Handa–Schwartz 1996) как first-passage к лимитной цене. Cartea et al. (2015) и Guéant (2016) — оптимальная торговля с экспоненциальными fill rates, не зависящими от времени, только от расстояния до mid. Maglaras et al. (2021) — RNN на hypothetical заявках, зафиксированных по цене на весь день даже при неблагоприятном движении; бенчмарк AUC-ROC, improper для survival.

Здесь: Transformer + proper scores; несколько способов собрать train — репег hypothetical и fill прямо с наблюдаемых лимиток в книге.

Дальше: §3 LOB, §4 survival и scoring, §5 статистика fill, §6 сеть, §7 результаты и интерпретация.

3. Книга лимитных заявок

Market order — купить/продать объём по лучшей доступной цене. Limit — объём по заданной цене. Market гарантирует немедленное исполнение при ликвидности; limit стоит, пока не исполнится или не снимется. «Market» здесь — FoK (весь объём сразу в ценовом коридоре или отмена) или IoC (сразу, целиком или частично, без прохода книги). Лимитки — DAY, истекают в конце сессии.

Матчинг: сначала цена, затем время (раньше — выше в очереди уровня). Ask — продажи, bid — покупки. Снимок в $t$:

\[ s_t=\bigl\{p^a_\ell(t),\,v^a_\ell(t),\,p^b_\ell(t),\,v^b_\ell(t)\bigr\}_{\ell=1}^{L}, \] матрица $x_t\in\mathbb R^{T\times 4L}$ — динамика от $t-T$ до $t$. Время — микросекунды после полуночи. Сообщения LOBSTER: постановка/снятие, сторона, объём. Табл. 1 оригинала — первые пять сообщений AAPL 3 октября 2022 (время от полуночи, цена в долларах $\times 10\,000$).

4. Анализ выживаемости

Время события $T_\ell\in\mathbb R_{\ge 0}$ — filltime заявки на уровне $\ell$. Цель — прогноз при признаках $x\in\mathbb R^p$. Правая цензура: снятие или конец дня без исполнения. Наблюдения — тройки $(x_i,z_i,\delta_i)$, $\delta_i=1_{\{z_i=t_i\}}$ (0 если цензура). Survival

\[ S_{T_\ell}(t\mid x)=\mathbb P\{T_\ell\gt t\mid x\}=1-F_{T_\ell}(t\mid x), \] плотность $f=-\partial_t S$, hazard $h=f/(1-F)$, и

\[ S_{T_\ell}(t\mid x)=\exp\Bigl(-\int_0^t h_{T_\ell}(s)\,ds\Bigr). \]
Рисунок 1. События после постановки
Рисунок 1. После постановки: наблюдаемый fill, ненаблюдаемый fill, цензура (снятие / конец дня).

Параметрическое семейство (Weibull и т.п.) удобно, но плохо сидит. Сеть увеличивает число параметров и качество. MLE по right-censored log-likelihood:

\[ \mathcal L(\theta)=\sum_{k=1}^N \delta_k\log\hat f(z_k\mid x_k,\theta)+(1-\delta_k)\log\hat S(z_k\mid x_k,\theta).\tag{1} \] Softmax-дискретизация survival требует интерполяции, чтобы попасть ровно в $z_k$. Здесь $z_k$ идёт только в монотонный декодер вместе с латентой ряда — сетка по времени сколь угодно мелкая без лишних параметров, монотонность соблюдена.

Scoring rule $S$ proper, если в ожидании истинная survival получает не меньший балл, чем любая оценка. Concordance и аналоги — improper (прил. C). Rindt et al. (2022): RCLL — proper. Дальше качество меряют RCLL.

5. Эмпирика fill

5.1. Два способа собрать данные

Наблюдаемые заявки. Трассировать сообщения по order ID: последнее = исполнение → fill, иначе цензура. Time-to-fill — от постановки до последнего сообщения.

Hypothetical / pegged. Заявка объёма 1 в конец очереди уровня (price-time). «Peg» — следовать цене уровня. На каждом апдейте книги проверяют fill-условия (прил. A). Без импакта, как Handa–Schwartz и Maglaras et al. Peg глубже best почти всегда цензурирован: агрессия редко проходит книгу. Поэтому hypothetical считают только на best bid/ask. 100 случайных моментов в день.

Рис. 2 (PDF): Kaplan–Meier AAPL — survival растёт с глубиной (fill падает); peg к L1 повышает fill относительно «застывшей» наблюдаемой L1. Это среднее; микроструктурные признаки KM не ловит — отсюда сеть.

5.2. Заявки внутри спреда

Девять акций, small/large tick, разная активность, октябрь 2022. Large tick: средний спред $\lt 1{,}3$ тика (Bińkowski–Lehalle 2022).

спред (тики)vol askvol bidmidсделок/мин
AAPL1,44487442144,3405
AMZN1,91298308114,8319
BIDU8,7513997101,921
COST30,896861478,244
DELL1,7728728436,014
GOOG1,6629923299,6121
MSFT2,88159159236,9205
CSCO1,152212219441,975
INTC1,135996553426,6111

На large tick выгоднее улучшать best, чем вставать в хвост очереди: стоимость почти как пересечение спреда, зато fill в 3–6 раз выше и time-to-fill короче во столько же (рис. 3, табл. 3). Контрагенты спешат забрать улучшение, пока его не сняли. Если fill за секунды — цена пошла «за» заявку, она в голове очереди; иначе цена против — заявка уходит глубже. Активные бумаги: survival падает быстрее.

best $p_{\mathrm{fill}}$1 тик внутрь2 тикаbest filltime, с1 тик, с
AAPL0,0540,1320,3601,320,64
AMZN0,0920,1310,3361,070,70
CSCO0,0570,1750,3556,261,71
INTC0,0570,2960,3227,331,95
MSFT0,0680,0730,2630,990,70
COST0,0460,0120,0835,184,85

Активность внутри спреда на small tick на порядки выше (табл. 4: MSFT 9,7 млн событий на 1 тик внутрь vs CSCO 467 тыс.; на 2 тиках CSCO уже 2817). На large tick спред редко расширяется. Чтобы на small tick получить тот же прирост fill, надо стоять ближе к противоположной стороне — там активность сравнима с «один тик внутрь» на large tick.

6. Монотонный encoder–decoder свёрточный Transformer

Рисунок 4. Encoder–decoder
Рисунок 4. Энкодер $\Phi$ сжимает LOB в $q(x;\Phi)$; монотонный декодер $(\Psi,t)$ даёт $S(t\mid x)$. Веса декодера положительны — survival убывает.

6.2. Свёрточный Transformer-энкодер

Три dilated causal CNN (Oord et al. 2016; раньше в прогнозе рядов — Borovykh et al.; Moreno-Pino–Zohren 2022) делают queries/keys/values. Dilated: свёртка через $p$ шагов, не подряд; causal — без будущего. $p=1$ — обычный Causal-CNN. Одна свёрточная слой на ветку (многослойное расширение — прил. D):

\[ Q(t)=(x*_p k^Q)(t)=\sum_{\tau=0}^{s-1} k^Q_\tau\, x_{t-p\tau}, \] аналогично $K$, $V$.

Канонический Transformer точечно-агностичен и $O(L^2)$. Свёртка даёт локальный контекст (аномалия vs паттерн); sparse attention режет сложность до $O\bigl(L(\log L)^2\bigr)$. Multi-head:

\[ h_i=\mathrm{softmax}\Bigl(\frac{Q_i K_i^\top}{\sqrt{d_k}}M\Bigr)V_i,\qquad \mathrm{MultiHead}=\mathrm{Concat}(h_1,\ldots,h_H), \] маска $M$ против утечки будущего. Линейное слияние голов — латента $q(x;\Phi)$.

Рисунок 5. Энкодер
Рисунок 5. Ядро $s=3$, dilation $p=1$: CNN → Q,K,V → self-attention → $q(x;\Phi)$.

6.3. Монотонный декодер

Survival должна убывать по $t$ — иначе crossing (Tagasovska–López-Paz). Монотонные сети (Chilinski–Silva 2020; Rindt et al. 2022) оценивают CDF $F(t\mid x)$ с условиями $\lim_{t\to-\infty}f=0$, $\lim_{t\to\infty}f=1$, $\partial_t f\ge 0$. Последнее — самое жёсткое для композиции нелинейностей. Плотность — $-\partial_t\hat S$. Ограничение только на декодере (можно сделать маленьким); энкодер не стеснён — универсальная аппроксимация (Cybenko; Kidger–Lyons) и выпуклость в overparametrized режиме сохраняются.

7. Эксперименты

7.1. Признаки

Медленные — внутридневная сезонность: реализованная вола mid (окно 1000 сделок по квадратам доходностей) высока на открытии; объём — U-shape; fill на best тоже гуляет по дню (рис. 7–8, PDF). Альтернатива гомогенизации — transaction time (прил. H).

Быстрые. Спред, вола, скорость прихода заявок персистентны и кросс-коррелированы (Bińkowski–Lehalle) — аргумент за attention на длинном горизонте. Два сигнала:

\[ \Upsilon_t=\frac{v^b_1(t)-v^a_1(t)}{v^b_1(t)+v^a_1(t)}\in[-1,1],\qquad M_t=\frac{v^b_1}{v^b_1+v^a_1}p^a_1+\frac{v^a_1}{v^b_1+v^a_1}p^b_1. \] $\Upsilon$ близко к $1$ — давление покупок (Cartea et al. 2018, 2020); микроцена тянет mid к стороне большего объёма. Плюс сырые цена/объём пяти лучших уровней.

7.2. Качество

Рисунок 10. Предсказанные survival
Рисунок 10. Survival батча заявок: слева AAPL, справа AMZN. Кривые разные — не одно среднее KM.

Train: 1 сент. – 26 дек. 2022, тикеры табл. 2. На день — 100 наблюдаемых заявок или 100 hypothetical, привязанных к best, случайные моменты. Lookback $T\in\{50,500,1000\}$ сделок.

Бенчмарки: DeepSurv, DeepHit; энкодер заменяют на MLP (архитектура Rindt et al. 2022 = MN-MLP), CNN, LSTM. Метрика — negative RCLL (ниже лучше). Conv-Trans лучший на каждом тикере. Модели без динамики ряда заметно хуже: высокочастотная микроструктура важна. LSTM/CNN на длинном lookback почти не выигрывают или деградируют — не суммируют весь горизонт. Conv-Trans взвешивает шаги по релевантности и лучше на $T=500$ и $1000$, при этом параметров меньше, чем у CNN-энкодера.

Улучшение vs MN-MLP на наблюдаемых заявках (табл. 7): Conv-Trans в среднем +86,0% ($T=50$), +85,7% ($T=500$), +85,2% ($T=1000$). CNN на $T=50$ +51%, LSTM +44%; на $T=1000$ CNN +36%, LSTM +31%. На AAPL Conv-Trans +90% уже при $T=50$.

Hypothetical/pegged (табл. 8): Conv-Trans +62,6% / +62,2% / +62,7% на трёх горизонтах; LSTM около +53%, CNN +40–47%. Абсолютный RCLL на pegged на порядок хуже наблюдаемых (табл. 5–6): pegged — другая задача, больше цензуры.

Представление order-flow (Kolm et al. 2021; Lucchese et al. 2022) в прил. I: для шага mid оно часто делает сложные модели лишними; для survival fill Conv-Trans всё равно лучший. Fill ближе к спреду и воле (персистентность, без направления), чем к направленному прогнозу цены.

7.3. Интерпретация

Attention heatmaps (рис. 11, PDF): матрица $T\times T$ после softmax показывает, какие шаги lookback весят. На примере: голова 0 смотрит ~400 сделок назад, где упали вола и спред; остальные головы разреженные — и короткий, и длинный горизонт.

Shapley / DeepSHAP считают на MN-MLP (для моделей с явной динамикой ряда это дорого) — указание, не прямой разбор Conv-Trans. Beeswarm (рис. 12): важнее всего быстрые признаки, особенно микроцена (прокси «справедливой» цены, куда ставят агрессию) и вола (прокси объёма: больше потока — выше шанс, что кто-то пересечёт спред). Время дня почти не влияет: сезонность персистентна, малые сдвиги не двигают выход.

8. Заключение

Свёрточный Transformer поднимает локальную осведомлённость LOB; монотонный декодер гарантирует убывание survival. Обучение и оценка — RCLL, proper score. На реальном стакане архитектура бьёт DeepSurv, DeepHit, MN-MLP/CNN/LSTM и даёт общий каркас survival по рядам. Shapley и attention показывают, какие признаки и какие моменты lookback работают.

Дальше: та же архитектура в healthcare; fill в реалистичном симуляторе стакана; temporally-consistent survival (Maystre–Russo 2022) с информацией после постановки; мультиактив и графы (Bergault et al.; Drissi; Arroyo et al. 2022).

Благодарности: Fayçal Drissi, Leandro Sánchez-Betancourt, Victoria seminar, 67th EWGCFM. Арройо — фонд Rafael del Pino; Морено-Пино — FPU18/00470, PID2021, IntCARE-CM, ERC 714161.

Литература

Полный список и приложения A–I — в PDF.

Перевод: §§1–8. Рис. 2–3, 6–9, 11–12 и полные табл. 5–6 — в PDF. · arXiv:2306.05479 · лицензия arXiv nonexclusive-distrib 1.0