Глубокий attentive survival-анализ в книге лимитных заявок: оценка fill probability свёрточным трансформером
Альваро Арройо, Альваро Картеа, Фернандо Морено-Пино, Стефан Зорен · Oxford-Man Institute / Mathematical Institute, University of Oxford; Universidad Carlos III de Madrid · 8 июня 2023
Опубликовано: Quantitative Finance 24, 35–57.
Оригинал: Arroyo, Á., Cartea, Á., Moreno-Pino, F. and Zohren, S. «Deep Attentive Survival Analysis in Limit Order Books: Estimating Fill Probabilities with Convolutional-Transformers», 2023 — arxiv.org/abs/2306.05479 (PDF).
Оригинал на arXiv по лицензии arXiv nonexclusive-distrib 1.0 (не Creative Commons); перевод для личной коллекции, не для публикации.
Смежные переводы: Fabre–Ragel, фиксированный горизонт и цензурирование · полуаналитические fill при state-dependent потоках.
Ключевые слова: fill probability; лимитный стакан; оптимальное исполнение; маркетмейкинг; размещение заявок; анализ выживаемости.
Аннотация
Ключевое решение в исполнении — пассивная (даёт ликвидность) или агрессивная (забирает) заявка. Для этого нужна fill probability пассивной лимитки. Статья предлагает deep-learning оценку времён исполнения заявок на разных уровнях стакана: survival-модель отображает time-varying признаки LOB в распределение filltimes. Архитектура — свёрточно-трансформерный энкодер и монотонный нейросетевой декодер. Сравнение с литературой survival через proper scoring rules; интерпретируемость — какие признаки информативны. Метод значимо бьёт типичные survival-подходы. В конце — статистика fill заявок внутри спреда для активов с разной динамикой очереди и активностью.
1. Введение
Большинство электронных бирж клирит спрос и предложение через LOB. Рыночная заявка пересекает спред и исполняется сразу; лимитка стоит на уровне и, если исполнится, даёт лучшую цену. Цена улучшения — риск: лимитка ждёт входящий market order или снимается. Время до исполнения — time-to-fill. Здесь его оценивают survival-анализом на разных глубинах книги.
Предлагается encoder–decoder на Transformer (Vaswani et al., 2017) и частично монотонных сетях. Self-attention энкодера суммирует события в lookback до постановки заявки; эта латентная картина стакана даёт вероятность исполнения после отправки. На вход внимания идёт локально-осведомлённое представление ряда — свёртка. Оценка survival — proper scoring rules (Gneiting–Ranjan 2011; Avati et al. 2020; Rindt et al. 2022), а не time-dependent concordance и прочие improper метрики, которые могут хвалить неверный прокси.
Данные — Nasdaq. Матчинг price-time priority. Архитектура бьёт off-the-shelf и стандартные survival-бенчмарки на бумагах с разной микроструктурой. Первая статистическая оценка fill заявок внутри спреда. Shapley (Lundberg–Lee 2017): модель опирается на высокочастотные признаки, а не на медленные внутридневные сезонные.
2. Обзор литературы
Survival (time-to-event) — медицина, churn, клинические испытания. Связь распределения времён с ковариатами: Cox PH (Cox 1972), accelerated failure time (Wei 1992). Deep: Faraggi–Simon (1995) расширяют Cox сетью; Katzman et al. (DeepSurv 2018), Kvamme et al. (2019) — dropout; Lee et al. (DeepHit 2018, 2019) — дискретная survival без формы. Rindt et al. (2022) — зачем proper scores. Ещё: гауссовские процессы, случайные леса, adversarial.
В финансах Cho–Nelling (2000) предполагают Weibull, отмены — правая цензура; частичные исполнения — как заявки меньшего объёма. Lo et al. (2002) — обобщённая гамма и AFT, отдельно time-to-completion / first fill / cancellation; hypothetical limit orders (Handa–Schwartz 1996) как first-passage к лимитной цене. Cartea et al. (2015) и Guéant (2016) — оптимальная торговля с экспоненциальными fill rates, не зависящими от времени, только от расстояния до mid. Maglaras et al. (2021) — RNN на hypothetical заявках, зафиксированных по цене на весь день даже при неблагоприятном движении; бенчмарк AUC-ROC, improper для survival.
Здесь: Transformer + proper scores; несколько способов собрать train — репег hypothetical и fill прямо с наблюдаемых лимиток в книге.
Дальше: §3 LOB, §4 survival и scoring, §5 статистика fill, §6 сеть, §7 результаты и интерпретация.
3. Книга лимитных заявок
Market order — купить/продать объём по лучшей доступной цене. Limit — объём по заданной цене. Market гарантирует немедленное исполнение при ликвидности; limit стоит, пока не исполнится или не снимется. «Market» здесь — FoK (весь объём сразу в ценовом коридоре или отмена) или IoC (сразу, целиком или частично, без прохода книги). Лимитки — DAY, истекают в конце сессии.
Матчинг: сначала цена, затем время (раньше — выше в очереди уровня). Ask — продажи, bid — покупки. Снимок в $t$:
\[ s_t=\bigl\{p^a_\ell(t),\,v^a_\ell(t),\,p^b_\ell(t),\,v^b_\ell(t)\bigr\}_{\ell=1}^{L}, \] матрица $x_t\in\mathbb R^{T\times 4L}$ — динамика от $t-T$ до $t$. Время — микросекунды после полуночи. Сообщения LOBSTER: постановка/снятие, сторона, объём. Табл. 1 оригинала — первые пять сообщений AAPL 3 октября 2022 (время от полуночи, цена в долларах $\times 10\,000$).4. Анализ выживаемости
Время события $T_\ell\in\mathbb R_{\ge 0}$ — filltime заявки на уровне $\ell$. Цель — прогноз при признаках $x\in\mathbb R^p$. Правая цензура: снятие или конец дня без исполнения. Наблюдения — тройки $(x_i,z_i,\delta_i)$, $\delta_i=1_{\{z_i=t_i\}}$ (0 если цензура). Survival
\[ S_{T_\ell}(t\mid x)=\mathbb P\{T_\ell\gt t\mid x\}=1-F_{T_\ell}(t\mid x), \] плотность $f=-\partial_t S$, hazard $h=f/(1-F)$, и \[ S_{T_\ell}(t\mid x)=\exp\Bigl(-\int_0^t h_{T_\ell}(s)\,ds\Bigr). \]
Рисунок 1 — смотреть в оригинале (PDF)
Параметрическое семейство (Weibull и т.п.) удобно, но плохо сидит. Сеть увеличивает число параметров и качество. MLE по right-censored log-likelihood:
\[ \mathcal L(\theta)=\sum_{k=1}^N \delta_k\log\hat f(z_k\mid x_k,\theta)+(1-\delta_k)\log\hat S(z_k\mid x_k,\theta).\tag{1} \] Softmax-дискретизация survival требует интерполяции, чтобы попасть ровно в $z_k$. Здесь $z_k$ идёт только в монотонный декодер вместе с латентой ряда — сетка по времени сколь угодно мелкая без лишних параметров, монотонность соблюдена.Scoring rule $S$ proper, если в ожидании истинная survival получает не меньший балл, чем любая оценка. Concordance и аналоги — improper (прил. C). Rindt et al. (2022): RCLL — proper. Дальше качество меряют RCLL.
5. Эмпирика fill
5.1. Два способа собрать данные
Наблюдаемые заявки. Трассировать сообщения по order ID: последнее = исполнение → fill, иначе цензура. Time-to-fill — от постановки до последнего сообщения.
Hypothetical / pegged. Заявка объёма 1 в конец очереди уровня (price-time). «Peg» — следовать цене уровня. На каждом апдейте книги проверяют fill-условия (прил. A). Без импакта, как Handa–Schwartz и Maglaras et al. Peg глубже best почти всегда цензурирован: агрессия редко проходит книгу. Поэтому hypothetical считают только на best bid/ask. 100 случайных моментов в день.
Рис. 2 (PDF): Kaplan–Meier AAPL — survival растёт с глубиной (fill падает); peg к L1 повышает fill относительно «застывшей» наблюдаемой L1. Это среднее; микроструктурные признаки KM не ловит — отсюда сеть.
5.2. Заявки внутри спреда
Девять акций, small/large tick, разная активность, октябрь 2022. Large tick: средний спред $\lt 1{,}3$ тика (Bińkowski–Lehalle 2022).
| спред (тики) | vol ask | vol bid | mid | сделок/мин | |
|---|---|---|---|---|---|
| AAPL | 1,44 | 487 | 442 | 144,3 | 405 |
| AMZN | 1,91 | 298 | 308 | 114,8 | 319 |
| BIDU | 8,75 | 139 | 97 | 101,9 | 21 |
| COST | 30,89 | 68 | 61 | 478,2 | 44 |
| DELL | 1,77 | 287 | 284 | 36,0 | 14 |
| GOOG | 1,66 | 299 | 232 | 99,6 | 121 |
| MSFT | 2,88 | 159 | 159 | 236,9 | 205 |
| CSCO | 1,15 | 2212 | 2194 | 41,9 | 75 |
| INTC | 1,13 | 5996 | 5534 | 26,6 | 111 |
Таблица 2. Октябрь 2022. CSCO/INTC — large tick, длинные очереди на best.
На large tick выгоднее улучшать best, чем вставать в хвост очереди: стоимость почти как пересечение спреда, зато fill в 3–6 раз выше и time-to-fill короче во столько же (рис. 3, табл. 3). Контрагенты спешат забрать улучшение, пока его не сняли. Если fill за секунды — цена пошла «за» заявку, она в голове очереди; иначе цена против — заявка уходит глубже. Активные бумаги: survival падает быстрее.
| best $p_{\mathrm{fill}}$ | 1 тик внутрь | 2 тика | best filltime, с | 1 тик, с | |
|---|---|---|---|---|---|
| AAPL | 0,054 | 0,132 | 0,360 | 1,32 | 0,64 |
| AMZN | 0,092 | 0,131 | 0,336 | 1,07 | 0,70 |
| CSCO | 0,057 | 0,175 | 0,355 | 6,26 | 1,71 |
| INTC | 0,057 | 0,296 | 0,322 | 7,33 | 1,95 |
| MSFT | 0,068 | 0,073 | 0,263 | 0,99 | 0,70 |
| COST | 0,046 | 0,012 | 0,083 | 5,18 | 4,85 |
Таблица 3 (фрагмент). 1 окт. – 27 дек. 2022. Полные 1–5 тиков — в PDF. На COST один тик внутрь хуже best: спред ~31 тик, один шаг почти ничего не значит.
Активность внутри спреда на small tick на порядки выше (табл. 4: MSFT 9,7 млн событий на 1 тик внутрь vs CSCO 467 тыс.; на 2 тиках CSCO уже 2817). На large tick спред редко расширяется. Чтобы на small tick получить тот же прирост fill, надо стоять ближе к противоположной стороне — там активность сравнима с «один тик внутрь» на large tick.
6. Монотонный encoder–decoder свёрточный Transformer
Рисунок 4 — смотреть в оригинале (PDF)
6.2. Свёрточный Transformer-энкодер
Три dilated causal CNN (Oord et al. 2016; раньше в прогнозе рядов — Borovykh et al.; Moreno-Pino–Zohren 2022) делают queries/keys/values. Dilated: свёртка через $p$ шагов, не подряд; causal — без будущего. $p=1$ — обычный Causal-CNN. Одна свёрточная слой на ветку (многослойное расширение — прил. D):
\[ Q(t)=(x*_p k^Q)(t)=\sum_{\tau=0}^{s-1} k^Q_\tau\, x_{t-p\tau}, \] аналогично $K$, $V$.Канонический Transformer точечно-агностичен и $O(L^2)$. Свёртка даёт локальный контекст (аномалия vs паттерн); sparse attention режет сложность до $O\bigl(L(\log L)^2\bigr)$. Multi-head:
\[ h_i=\mathrm{softmax}\Bigl(\frac{Q_i K_i^\top}{\sqrt{d_k}}M\Bigr)V_i,\qquad \mathrm{MultiHead}=\mathrm{Concat}(h_1,\ldots,h_H), \] маска $M$ против утечки будущего. Линейное слияние голов — латента $q(x;\Phi)$.
Рисунок 5 — смотреть в оригинале (PDF)
6.3. Монотонный декодер
Survival должна убывать по $t$ — иначе crossing (Tagasovska–López-Paz). Монотонные сети (Chilinski–Silva 2020; Rindt et al. 2022) оценивают CDF $F(t\mid x)$ с условиями $\lim_{t\to-\infty}f=0$, $\lim_{t\to\infty}f=1$, $\partial_t f\ge 0$. Последнее — самое жёсткое для композиции нелинейностей. Плотность — $-\partial_t\hat S$. Ограничение только на декодере (можно сделать маленьким); энкодер не стеснён — универсальная аппроксимация (Cybenko; Kidger–Lyons) и выпуклость в overparametrized режиме сохраняются.
7. Эксперименты
7.1. Признаки
Медленные — внутридневная сезонность: реализованная вола mid (окно 1000 сделок по квадратам доходностей) высока на открытии; объём — U-shape; fill на best тоже гуляет по дню (рис. 7–8, PDF). Альтернатива гомогенизации — transaction time (прил. H).
Быстрые. Спред, вола, скорость прихода заявок персистентны и кросс-коррелированы (Bińkowski–Lehalle) — аргумент за attention на длинном горизонте. Два сигнала:
\[ \Upsilon_t=\frac{v^b_1(t)-v^a_1(t)}{v^b_1(t)+v^a_1(t)}\in[-1,1],\qquad M_t=\frac{v^b_1}{v^b_1+v^a_1}p^a_1+\frac{v^a_1}{v^b_1+v^a_1}p^b_1. \] $\Upsilon$ близко к $1$ — давление покупок (Cartea et al. 2018, 2020); микроцена тянет mid к стороне большего объёма. Плюс сырые цена/объём пяти лучших уровней.7.2. Качество
Рисунок 10 — смотреть в оригинале (PDF)
Train: 1 сент. – 26 дек. 2022, тикеры табл. 2. На день — 100 наблюдаемых заявок или 100 hypothetical, привязанных к best, случайные моменты. Lookback $T\in\{50,500,1000\}$ сделок.
Бенчмарки: DeepSurv, DeepHit; энкодер заменяют на MLP (архитектура Rindt et al. 2022 = MN-MLP), CNN, LSTM. Метрика — negative RCLL (ниже лучше). Conv-Trans лучший на каждом тикере. Модели без динамики ряда заметно хуже: высокочастотная микроструктура важна. LSTM/CNN на длинном lookback почти не выигрывают или деградируют — не суммируют весь горизонт. Conv-Trans взвешивает шаги по релевантности и лучше на $T=500$ и $1000$, при этом параметров меньше, чем у CNN-энкодера.
Улучшение vs MN-MLP на наблюдаемых заявках (табл. 7): Conv-Trans в среднем +86,0% ($T=50$), +85,7% ($T=500$), +85,2% ($T=1000$). CNN на $T=50$ +51%, LSTM +44%; на $T=1000$ CNN +36%, LSTM +31%. На AAPL Conv-Trans +90% уже при $T=50$.
Hypothetical/pegged (табл. 8): Conv-Trans +62,6% / +62,2% / +62,7% на трёх горизонтах; LSTM около +53%, CNN +40–47%. Абсолютный RCLL на pegged на порядок хуже наблюдаемых (табл. 5–6): pegged — другая задача, больше цензуры.
Представление order-flow (Kolm et al. 2021; Lucchese et al. 2022) в прил. I: для шага mid оно часто делает сложные модели лишними; для survival fill Conv-Trans всё равно лучший. Fill ближе к спреду и воле (персистентность, без направления), чем к направленному прогнозу цены.
7.3. Интерпретация
Attention heatmaps (рис. 11, PDF): матрица $T\times T$ после softmax показывает, какие шаги lookback весят. На примере: голова 0 смотрит ~400 сделок назад, где упали вола и спред; остальные головы разреженные — и короткий, и длинный горизонт.
Shapley / DeepSHAP считают на MN-MLP (для моделей с явной динамикой ряда это дорого) — указание, не прямой разбор Conv-Trans. Beeswarm (рис. 12): важнее всего быстрые признаки, особенно микроцена (прокси «справедливой» цены, куда ставят агрессию) и вола (прокси объёма: больше потока — выше шанс, что кто-то пересечёт спред). Время дня почти не влияет: сезонность персистентна, малые сдвиги не двигают выход.
8. Заключение
Свёрточный Transformer поднимает локальную осведомлённость LOB; монотонный декодер гарантирует убывание survival. Обучение и оценка — RCLL, proper score. На реальном стакане архитектура бьёт DeepSurv, DeepHit, MN-MLP/CNN/LSTM и даёт общий каркас survival по рядам. Shapley и attention показывают, какие признаки и какие моменты lookback работают.
Дальше: та же архитектура в healthcare; fill в реалистичном симуляторе стакана; temporally-consistent survival (Maystre–Russo 2022) с информацией после постановки; мультиактив и графы (Bergault et al.; Drissi; Arroyo et al. 2022).
Благодарности: Fayçal Drissi, Leandro Sánchez-Betancourt, Victoria seminar, 67th EWGCFM. Арройо — фонд Rafael del Pino; Морено-Пино — FPU18/00470, PID2021, IntCARE-CM, ERC 714161.
Литература
- Avati, A. et al. Survival analysis with proper scoring rules. 2020.
- Bińkowski, M. and Lehalle, C.-A. Endogeneous dynamics of intraday liquidity. 2022.
- Cartea, Á., Jaimungal, S. and Penalva, J. Algorithmic and High-Frequency Trading. CUP, 2015.
- Cartea, Á. et al. Enhancing trading strategies with order book signals. 2018; 2020.
- Chilinski, P. and Silva, R. Neural likelihoods via cumulative distribution functions. 2020.
- Cho, J.-W. and Nelling, E. The probability of limit-order execution. 2000.
- Cox, D. R. Regression models and life-tables. 1972.
- Guéant, O. The Financial Mathematics of Market Liquidity. 2016.
- Handa, P. and Schwartz, R. Limit order trading. 1996.
- Katzman, J. et al. DeepSurv. 2018.
- Lee, C. et al. DeepHit. 2018.
- Lo, A. W., MacKinlay, A. C. and Zhang, J. Econometric models of limit-order executions. 2002.
- Lundberg, S. and Lee, S.-I. A unified approach to interpreting model predictions (SHAP). 2017.
- Maglaras, C., Moallemi, C. and Zheng, H. A multiscale model of high-frequency trading. 2021 (RNN fill).
- Oord, A. van den et al. WaveNet / dilated causal convolutions. 2016.
- Rindt, D. et al. Survival analysis as a proper scoring rule. AISTATS, 2022.
- Vaswani, A. et al. Attention Is All You Need. 2017.
Полный список и приложения A–I — в PDF.
Перевод: §§1–8. Рис. 2–3, 6–9, 11–12 и полные табл. 5–6 — в PDF. · arXiv:2306.05479 · лицензия arXiv nonexclusive-distrib 1.0