Estimation of an Order Book Dependent Hawkes Process for Large Datasets
Лука Муччианте, Алессио Санчетта · Department of Economics, Royal Holloway, University of London · 20 июля 2023 (v2: 10 мая 2026)
Переписка: Alessio Sancetta, asancetta@gmail.com.
Оригинал: Mucciante, L., Sancetta, A. «Estimation of an Order Book Dependent Hawkes Process for Large Datasets», 2023 — arxiv.org/abs/2307.09077 (PDF), лицензия CC BY-NC-ND 4.0.
Рисунки и таблицы воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY-NC-ND 4.0 (некоммерческое использование, без производных).
Аннотация
Представлен точечный процесс приходов событий в высокочастотной торговле. Интенсивность — произведение процесса Хоукса и высокоразмерных функций ковариат, извлечённых из стакана. Сформулированы условия стационарности. Дан алгоритм оценки даже при миллиардах точек, с возможным отображением ковариат в высокоразмерное пространство. Такие объёмы типичны для HFT при нескольких ликвидных инструментах. Показана сходимость алгоритма, установлена состоятельность при слабых условиях, предложена тестовая статистика для сравнения спецификаций вне выборки. Применение — четыре акции NYSE. Вневыборочный тест показывает: учёт нелинейности информации стакана добавляет ценность сверх самовозбуждения HFT-событий.
Ключевые слова: считающий процесс; оценка прогноза; высокочастотная торговля; высокоразмерная оценка; one-hot encoding; приход сделок. JEL: C13, C32, C55.
1. Введение
Модель интенсивности приходов событий в HFT зависит от информации стакана. Это процесс Хоукса, в котором интенсивность определяется не только временем с последнего события, но и состоянием книги. Модель рассчитана на высокоразмерные ковариаты. Процедура оценки работает на больших данных через квадратичное программирование. Стакан ликвидного инструмента даёт больше миллиона записей в день; с несколькими инструментами легко выйти на миллионы обновлений.
Оценка интенсивности условно на стакане и сделках опирается на одну реализацию потока, а не на кросс-секцию, как в моделях выживаемости. Случай большого числа обусловливающих переменных изучали Sancetta (2018) и Mucciante & Sancetta (2022), но без самовозбуждения, хорошо задокументированного обзорами Bacry et al. (2015) и Filimonov & Sornette (2015). Высокоразмерная модель Sancetta (2018) учитывает самовозбуждение в симуляциях, но без доказательства стационарности и эргодичности.
Статистика процессов Хоукса с частичной информацией стакана: Fosset et al. (2020), Morariu-Patrichi & Pakkanen (2022), Mounjid et al. (2019), Wu et al. (2019). Эти модели описывают приходы лимитных, рыночных и отмен условно на размере очереди. Они общи, но сложны при росте размерности: состояния обычно конечны и на практике низкоразмерны. Приложения сводятся к одной дискретной переменной стакана. Они не подходят для оценки на большом информационном множестве и не дают теста функциональных ограничений на влияние переменных книги.
Отличия этой работы. Во-первых, ковариаты стакана принимают значения в подмножестве прямой, а не в конечном пространстве состояний. Во-вторых, число ковариат — сотни и тысячи: десять уровней дают десять цен и десять объёмов с каждой стороны; плюс другие инструменты и динамика. В-третьих, параметризация ловит нелинейности отображением в более высокую размерность — удобно для высокоразмерной оценки и тестов ограничений.
Цель — моделирование и состоятельная оценка при сложном нелинейном влиянии стакана и большом информационном множестве. Стакан не моделируется: его переменные — предикторы интенсивности HFT-событий.
Пусть $N:=(N(t))_{t\ge 0}$ — число приходов сделок, адаптированное к фильтрации $\mathcal{F}=(\mathcal{F}_t)_{t\ge 0}$. Момент $j$-го события — $T_j$, $j\ge 1$, $T_0:=0$. Считающий процесс допускает $\mathcal{F}_t$-адаптированную стохастическую интенсивность
\[ \lambda_0(t)=h_0(t)\,g_0(t), \]где $h_0$ — предсказуемый процесс
\[ h_0(t)=c_0+\int_{(-\infty,t)}\Bigl(\sum_{l=1}^{L}d_{0,l}e^{-a_{0,l}(t-s)}\Bigr)\,dN(s)=c_0+\sum_{j\ge 0:\,T_j\lt t}\sum_{l=1}^{L}d_{0,l}e^{-a_{0,l}(t-T_j)} \]с $a_{0,l},c_0,d_{0,l}\ge 0$, и
\[ g_0(t)=X(t)'b_0, \]где $b_0$ — положительный $K\times 1$ вектор, $X:=(X(t))_{t\ge 0}$ — положительный $K\times 1$ левонепрерывный процесс. Положительность $b_0$ и $X$ гарантирует $\lambda_0(t)>0$. Интенсивность: $\lambda_0(t)=\lim_{s\downarrow 0}\Pr(N(t+s)-N(t)>0\mid\mathcal{F}_t)/s$, так что $M(t)=N(t)-\int_{-\infty}^{t}\lambda_0(s)\,ds$ — $\mathcal{F}_t$-мартингал. $K$ может быть порядка тысяч. Для идентификации $d_{0,1}:=1$.
Если $g_0$ постоянна, модель сводится к Хоуксу с ядром — суммой экспонент. Экзогенный приход информации — $c_0$, эндогенная активность — второе слагаемое $h_0$ (Hawkes & Oakes, 1974). Эта интерпретация не учитывает торговую среду. Её несёт стакан и прочие состояния в $g_0$. В приложениях $X$ отображает векторный процесс ковариат $Z$ (информация стакана) в высокоразмерное пространство. Здесь — one-hot encoding, популярный в ML из-за интерпретируемости (Alaya et al., 2019). Другие варианты: ряды Бернштейна, RKHS. One-hot дискретизует переменные в дамми; рост размерности окупается интерпретируемостью и естественными линейными ограничениями (монотонность).
Оценка чередует оценку $h_0$ при фиксированном $g$ и суррогатный лосс для $g_0$ при фиксированном $h$ — в духе coordinate descent (Friedman et al., 2007; Beck & Tetruashvili, 2013). Состоятельность высокоразмерного $b_0$ при $T^{-1}\ln K\to 0$, где $[0,T]$ — интервал выборки.
Эмпирика: Level 3 по четырём акциям и ETF на S&P 500 как вспомогательный инструмент, все на NYSE, LOBSTER. Level 3 позволяет синхронизировать сделки и стакан. Интерес — форма нелинейного влияния дисбаланса объёмов, спреда и информации других инструментов. Неотрицательность $b_0$ даёт «сжатие»: большинство коэффициентов нулевые без явного штрафа (Mucciante & Sancetta, 2022).
1.1. Замечания о литературе
Интенсивности в HFT-эконометрике: Engle & Russell (1998); обзор Bauwens & Hautsch (2009). Дисбаланс объёмов и другие признаки стакана влияют на цену и приходы сделок на коротких горизонтах (Hall & Hautsch, 2007; Cont et al., 2014; Sancetta, 2018). Интервью экс-алготрейдеров Automated Trading Desk (MacKenzie, 2017) подтверждают роль книги.
Sancetta (2018) рассматривал похожую модель, но не масштабируется на миллионы обновлений ковариат. При постоянном $h_0$ Mucciante & Sancetta (2022) дают состоятельную оценку при большом $K$ относительно числа скачков без штрафа, но требуют линейной независимости переменных и не оценивают базовую интенсивность $h_0$.
Оценка $h_0$ при известном $g_0$ эквивалентна оценке Хоукса. Даже низкая размерность здесь коварна (Ogata & Akaike, 1982; Filimonov & Sornette, 2015). Альтернативы правдоподобию: Da Fonseca & Zaatour (2014), Kirchner (2017), Cartea et al. (2021). Эти проблемы здесь не решаются; квадратичная оценивающая функция для $h_0$ давала относительно стабильные оценки.
1.2. План
Раздел 2 — условия регулярности, стационарность и эргодичность (теорема 1). Раздел 3 — алгоритм и симуляции сходимости (плюс screening переменных). Раздел 4 — состоятельность при высокоразмерном $b_0$ и тест сравнения интенсивностей при неограниченной интенсивности. Раздел 5 — четыре ликвидные акции NYSE. Доказательства — в приложении оригинала.
2. Модель
2.1. Условия регулярности
$|\cdot|_1$ — $\ell_1$-норма, $|g_0|_\infty=\sup_{t\ge 0}|g_0(t)|$. Для стационарности нужна слабая экзогенность $X(t)$ условно на $(N_s)_{s<t}$.
Условие 1 (слабая экзогенность). Существует строго положительная $f_0:\mathbb{R}^l\times\mathcal{M}\to\mathbb{R}$, неубывающая и каузальная по второй переменной, такая что $g_0(t)=f_0(W(t),S_t N)$, где латентный $W$ стационарен, эргодичен и независим от $N(t+C)$ для $C\subseteq(-\infty,0)$.
Условие 2 (истинная модель). Интенсивность $N$ не тождественный ноль, как в (1); $X(t)\in[0,1]^K$; $b_0\ge 0$, $|b_0|_1\le B$, причём $B\sum_{l=1}^L d_{0,l}/a_{0,l}<1$ и $d_{0,1}:=1$.
Условие 3 (множество $\mathcal{G}$). $\mathcal{G}=\{g=X'b:|b|_1\le B,\,b_k\ge 0\}$ и $g_0\in\mathcal{G}$.
Условие 4 (множество $\mathcal{H}$). $\mathcal{H}=\{h_\psi:\psi\in\Psi\}$ — семейство ядер (2) с компактными множествами параметров, содержащими истинные $c_0,d_{0,l},a_{0,l}$.
$B$ — свободный параметр; его выбор не критичен (разд. 3.1). Теорема 1: условие $B\sum d_{0,l}/a_{0,l}<1$ плюс слабая экзогенность дают стационарность считающего процесса.
2.2. Замечания
Неотрицательность $b$ при линейно зависимых столбцах $X$ (one-hot, Bernstein, RKHS) смягчает вырожденность: если $b'(\Phi'\Sigma\Phi/T)b\ge\nu b'b$ для всех $b\ge 0$ при некотором $\nu>0$, задача остаётся выпуклой. «Сжатие» без штрафа: многие $b_k$ обнуляются. One-hot плюс неотрицательность естественно кодирует монотонность: если коэффициенты по бинам убывают, влияние монотонно (рис. 2).
2.3. Стационарность и эргодичность
Условие 5. $\lambda_0=h_0 g_0$ — $\mathcal{F}_t$-интенсивность; $g_0$ равномерно ограничена, неотрицательна, удовлетворяет условию 1, и $|g_0|_\infty\sum_l d_{0,l}/a_{0,l}<1$.
При постоянном $g_0$ это обычное условие стационарности Хоукса (Brémaud & Massoulié, 1996).
Теорема 1. При условии 1: (i) существует единственное стационарное распределение $N$ с конечной средней интенсивностью и динамикой (1), процесс эргодичен; (ii) если при $t\le 0$ процесс ограничен множеством $\{N(t)=0:t\le 0\}$, существует стационарный $\tilde N$ с той же динамикой и случайный момент $\tau<\infty$ п.н., после которого $\tilde N(t)=N(t)$. Процессы сцепляются за конечное время независимо от начального условия — важно, потому что данные есть только для $t>0$.
2.4. Приведённая форма для покупок и продаж
Многомерные расширения есть в литературе; здесь оцениваются одномерные интенсивности отдельно. Если
\[ \lambda^{\mathrm{buy}}(t)=h^{\mathrm{buy}}(t)\bigl(g^{\mathrm{buy}}(t)+\rho^{\mathrm{buy}}g^{\mathrm{sell}}(t)\bigr),\qquad \lambda^{\mathrm{sell}}(t)=h^{\mathrm{sell}}(t)\bigl(g^{\mathrm{sell}}(t)+\rho^{\mathrm{sell}}g^{\mathrm{buy}}(t)\bigr) \]с $\rho\in[0,1)$, система имеет приведённую форму с линейной комбинацией $b^{\mathrm{buy}}$ и $b^{\mathrm{sell}}$. Раздельная оценка buy и sell эквивалентна оценке этой приведённой формы. На больших выборках потеря эффективности вторична. Это отличается от классического многомерного Хоукса, где $\lambda^{\mathrm{buy}}$ зависела бы от $h^{\mathrm{sell}}$ даже условно на $g$.
3. Оценка
Логарифм правдоподобия для $\lambda=hg$:
\[ L_T(h,g)=\int_0^T\ln(hg)\,dN-\int_0^T hg\,d\mu. \]Позитивность $b$ плюс большое $K$ делают MLE непрактичным. Пусть $X(t)=X(t_j)$ на $(t_j,t_{j+1}]$, $m$ — число обновлений (включая скачки $N$). Второй член правдоподобия требует матрицу $m\times K$ в памяти. При $K$ сотни–тысячи и $m$ миллионы (несколько дней ликвидных инструментов) это нереально. Скачков $N$ за день — тысячи, обновлений стакана — на порядки больше.
В окрестности истины отрицательное правдоподобие квадратично. Альтернатива — МНК для интенсивностей (Gaïffas & Guilloux, 2012). Квадратичный лосс:
\[ Q_T(h,g)=-\frac{2}{T}\int_0^T hg\,dN+\frac{1}{T}\int_0^T(hg)^2\,d\mu. \]$\mathbb{E}Q_T$ минимизируется при $h=h_0$, $g=g_0$. При известном $h$ это QP. При неизвестном $h$ второй интеграл снова тяжёлый. Поэтому чередуем: при фиксированном $g$ минимизируем $Q_T$ по $h$; при фиксированном $h$ минимизируем суррогат
\[ R_T(g;h)=-\frac{2}{T}\int_0^T\frac{g}{h}\,dN+\frac{1}{T}\int_0^T g^2\,d\mu. \]Старт: $g$ константа — первая итерация оценивает обычный Хоукс. В координатах
\[ R_T(b)=-\frac{2}{T}b'\Phi'\Gamma+\frac{1}{T}b'\Phi'\Sigma\Phi b, \]где $j$-я строка $\Phi$ есть $X(t_j)$; $\Gamma_j=1/h(T_l)$, если $t_j$ — скачок $N$, иначе 0; $\Sigma$ диагональна с $(t_j-t_{j-1})$. При новом наблюдении обновляются только $\Phi'\Gamma$ ($K\times 1$) и $\Phi'\Sigma\Phi$ ($K\times K$) — размер не зависит от $m$ и от $h$.
Алгоритм 1. Старт $g^{(0)}=\gamma$. Для $v=1,2,\ldots$: минимизировать $Q_T(h,g^{(v-1)})$ по $h$ → $h^{(v)}$ (при $v=1$ также по $\gamma>0$). Минимизировать $R_T(X'b;h)$ по $b\ge 0$, $\sum b_k\le B$ → $g^{(v)}=X'b^{(v)}$. Стоп, когда $h^{(v)}g^{(v)}$ сходится.
Репараметризация (9). $\lambda_0(t)=\bigl(c_0 d_0+\int\sum d_{0,l}e^{-a_{0,l}(t-s)}\,dN(s)\bigr)\,g_0(t)/\mathbb{E}g_0$. На каждой итерации $\mathbb{E}g$ заменяется текущей оценкой $\frac1m\sum_j X(t_j)'b^{(v-1)}$.
3.1. Выбор $B$
Из-за сжатия неотрицательностью выбор $B$ не критичен. Можно минимизировать $-L_T(\hat h_B,\hat g_B)+K_B$ по $B$, где $K_B$ — число ненулевых коэффициентов. Даже при $B=\infty$ имеем $K_B<K$. Порядок величины: $\mathbb{E}h_0 g_0\approx N(T)/T$ даёт нижнюю границу через параметры обычного Хоукса. В эмпирике: решить (8) при $b=\beta\mathbf{1}_K$, взять $\beta=\mathbf{1}'\Phi'\Gamma/(\mathbf{1}'\Phi'\Sigma\Phi\mathbf{1})$, затем QP с $b_k\in[0,\beta]$, то есть $B=K\beta$. Результаты к альтернативам нечувствительны.
3.2. Симуляции: число итераций
$X(t)$ кусочно постоянно, равномерно на $[0,1]^K$; первые три $b_{0,k}=2/3$, остальные ноль ($\mathbb{E}g=1$); $L=1$, $(c_0,d_0,a_0)=(1,1,2)$; $B=K$. Ошибка (10): число компонент с $|b_k-b_{0,k}|>\alpha\cdot(2/3)$. Одна реализация на 100 000 скачков плюс среднее по 50 симуляциям на 4-й итерации.
| $K$ | iter | $b_1$ | $b_2$ | $b_3$ | $c$ | $d$ | $a$ | Err 0.1 | Err 0.05 | Err 0.01 |
|---|---|---|---|---|---|---|---|---|---|---|
| 3 | 1 | 0.675 | 0.640 | 0.684 | 0.701 | 1.130 | 2.171 | 0 | 0 | 3 |
| 2–4 | 0.677 | 0.637 | 0.684 | 1.014 | 0.988 | 2.008 | 0 | 0 | 3 | |
| avg | 0.668 | 0.667 | 0.665 | 0.998 | 0.999 | 2.000 | 0 | 0 | 1.26 | |
| 10 | avg | 0.664 | 0.663 | 0.661 | 0.998 | 1.000 | 2.001 | 0 | 0 | 2.30 |
| 100 | avg | 0.659 | 0.658 | 0.655 | 0.997 | 1.002 | 2.003 | 0 | 0.02 | 3.42 |
Двух–трёх итераций достаточно. Есть screening: ненулевые компоненты находятся. Чувствительность к $B$ через множитель $\{0.5,1,10\}$ от рекомендации разд. 3.1 и $B=K$: при Mult. $=0.5$ хуже (недооценка $B$); при Mult. $\ge 1$ и $B=K$ метрики совпадают (табл. 2). False negatives = 0 во всех ячейках; при $K=100$ почти все лишние коэффициенты — false positives, если $B$ слишком мал, но $\ell_1/\ell_2$ ошибки стабильны при разумном $B$.
4. Асимптотика
Теорема 2. $(\tilde h,\tilde g)=\arg\inf Q_T(h,g)$. При условиях регулярности
\[ \frac1T\int_0^T\bigl(h_0 g_0-\tilde h\tilde g\bigr)^2\,d\mu=O_P\Bigl(B\sqrt{\frac{\ln(1+K)}{T}}\Bigr). \]Теорема 3. Минимизатор $R_T(g;h)$ сходится к лучшей $L^2$-аппроксимации $\lambda_0/h$ равномерно по $h$ в окрестности $h_0$. Вклад размерности $K$ — только логарифмический: метод годится для ультравысокой размерности. В регрессии с гауссовым шумом никакой оценщик выпуклой комбинации не быстрее $(\ln K/n)^{1/4}$ (Tsybakov, 2003); здесь $n\sim N(T)$. Результат оптимален без дополнительных условий.
4.1. Тест двух оценщиков интенсивности
Диагностика $\int_{T_{i-1}}^{T_i}\lambda_0$ как i.i.d. экспоненты не сравнивает две интенсивности. Отношение правдоподобий в высокой размерности имеет нестандартное распределение. Решение — sample splitting: две конкурирующие $\hat\lambda^{(k)}$ оцениваются до момента 0 и оцениваются на следующих днях. Односторонний тест уровня $1-\alpha$: отвергаем модель 2 в пользу 1, если
\[ \frac{L_T^{(1)}-L_T^{(2)}}{\sqrt{T\hat\sigma_T^2}}\ge q_\alpha,\qquad \hat\sigma_T^2=\frac1T\int_0^T\bigl[\ln(\hat\lambda^{(1)}/\hat\lambda^{(2)})\bigr]^2\,dN. \]Предсказуемая часть отношения правдоподобий $\epsilon_T$ при нуле $o_p(\sqrt{T})$: интенсивности асимптотически дают похожие прогнозы. Теорема 4 обобщает предложение 1 Sancetta (2018) на неограниченные интенсивности: при условиях регулярности статистика сходится к $N(0,1)$.
5. Эмпирическое применение
Моделируем приходы сделок отдельно на каждой стороне. Два типа событий: Any Trade Arrivals — любая сделка на стороне; Large Trade Arrivals — размер не меньше лучшего уровня (adverse selection маркетмейкера: пассивная заявка исполняется, цена уходит против). Четыре акции NYSE: AMZN, CSCO, DIS, KO; вспомогательный SPY. Период 1 марта – 30 апреля 2019, 9:30–16:30, 42 торговых дня.
Вопросы. (1) Даёт ли стакан информацию сверх сделок? (2) Важно ли самовозбуждение после учёта стакана? (3) Нелинейно ли влияние? (4) Достаточно ли простого экспоненциального ядра ($L=1$)?
Данные LOBSTER, первые десять уровней, Level 3. После слияния обновлений с одинаковым timestamp у AMZN > 17 млн снимков и > 400 тыс. сделок. Используем первые три уровня (~60% обновлений). $K\le 177$, порядка 300 млн точек. Оценка: меньше двух часов на разбор данных (по дням) и оценка модели, данные влезают в RAM.
5.1. Сырые ковариаты
Дисбаланс объёма уровня $j$:
\[ \mathrm{VolImb}_j=\frac{\mathrm{BidSize}_j-\mathrm{AskSize}_j}{\mathrm{BidSize}_j+\mathrm{AskSize}_j}\in[-1,1]. \]Trade imbalance — EWMA знакового объёма, делённая на EWMA беззнакового, $\alpha=0.98$. Длительности в секундах с наносекундами, затем EWMA с $\alpha=0.98$ и $0.90$. Спред в базисных пунктах. Сезонность — время дня в $[09{:}30,16{:}30]$ EST, нормированное в $[0,1]$. Плюс два вспомогательных инструмента без сезонности: 22 сырые ковариаты, после one-hot не более 168 параметров с константой.
| Переменная | Короткое имя | Smoothing |
|---|---|---|
| Сезонность | Seas | — |
| Дисбаланс объёма ур. 1–3 | VolImb1, VolImb2, VolImb3 | — |
| Спред | Spread | — |
| Trade imbalance | TrdImb98 | $\alpha=0.98$ |
| Длительности | Dur98, Dur90 | $\alpha=0.98$, $0.90$ |
Ковариаты сэмплируются только в reference time торгуемого инструмента и лагаются (левонепрерывность), чтобы не было look-ahead: интенсивность в $t_i$ видит стакан только с $t_{i-1}$.
5.2. One-hot encoding
Бины по квантилям обучающей выборки: $[-\infty,q_1)$, $[q_1,q_{10})$, $[q_{10},q_{25})$, $[q_{25},q_{50})$, $[q_{50},q_{75})$, $[q_{75},q_{90})$, $[q_{90},q_{99})$, $[q_{99},\infty)$. Неуникальные квантили (часто у спреда) сливаются. Итого не более 177 параметров, фактически 168.
5.3. Модели
- E: $h\equiv 1$, $g=X'b$ (нет самовозбуждения, one-hot);
- H01 / H02: Хоукс с $L=1$ или $2$, $g\equiv 1$ (нет стакана);
- H1 / H2: Хоукс $L=1$ или $2$ × one-hot $g$;
- H1L / H2L: то же, но $g=Z'b$ линейно по сырым $Z$, $b\in\mathbb{R}$ (знак любой; на тесте — пол интенсивности).
5.4. Результаты
| $N$ Any | $N$ Large | $m$ | |
|---|---|---|---|
| AMZN | 631 370 | 407 130 | 17 130 000 |
| CSCO | 295 220 | 107 930 | 27 943 000 |
| DIS | 493 100 | 292 820 | 24 938 000 |
| KO | 121 210 | 52 842 | 13 956 000 |
Позитивность и ограничение суммы дают разреженный оценщик. Для H1 доля ненулевых коэффициентов — примерно 20–30% из 168 по четырём акциям, и для Any, и для Large. Согласованность по акциям высокая (табл. 5–6 оригинала): длительности и дисбаланс уровня 1 своего инструмента и SPY входят чаще всего; спред — реже.
Доля ненулевых (Proportion) для Any Trade, модели E / H1 / H2: AMZN 0.24 / 0.27 / 0.27; CSCO 0.24 / 0.27 / 0.27; DIS 0.18 / 0.20 / 0.20; KO 0.28 / 0.31 / 0.30. Для Large Trade чуть ниже у CSCO и KO.
Тест разд. 4.1: последние 5 дней — тест, предыдущие — оценка. Запись E-H1 означает правдоподобие E минус правдоподобие H1. Большое отрицательное значение — второй модель лучше.
- H01-H1, H02-H1, H02-H2: большое отрицательное — стакан даёт информацию сверх самовозбуждения;
- E-H1: большое отрицательное — самовозбуждение важно даже после учёта стакана;
- H1L-H1 и аналоги: большое отрицательное — влияние стакана нелинейно;
- H2-H1: большое положительное — простого экспоненциального ядра недостаточно.
| Any Trade | Large Trade | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| AMZN | CSCO | DIS | KO | AMZN | CSCO | DIS | KO | ||
| E-H1 | Buy | −109.88 | −70.20 | −93.44 | −44.41 | −81.40 | −22.48 | −66.48 | −16.57 |
| Sell | −112.77 | −72.18 | −86.61 | −43.36 | −82.20 | −26.36 | −59.26 | −20.23 | |
| H01-H1 | Buy | −20.28 | −7.84 | −6.43 | −12.83 | −37.01 | −35.13 | −14.08 | −21.27 |
| Sell | −15.53 | −8.32 | −9.65 | −39.54 | −35.27 | −41.36 | −21.21 | −38.94 | |
| H02-H1 | Buy | −20.96 | −3.10 | 39.23 | −4.11 | −20.53 | −33.75 | −4.24 | −21.34 |
| Sell | −15.28 | −6.82 | 35.15 | −24.35 | −18.58 | −39.07 | −12.37 | −38.00 | |
| H2-H1 | Buy | −73.86 | −44.02 | 63.92 | 27.65 | 41.51 | 11.13 | 20.55 | 8.91 |
| Sell | −54.83 | 49.30 | 59.82 | 18.56 | 42.20 | 10.39 | 27.04 | 7.38 | |
| H1L-H1 | Buy | −27.75 | −13.95 | −7.61 | −11.54 | −27.35 | −25.92 | −10.68 | −23.18 |
| Sell | −24.68 | −15.76 | −2.95 | −39.38 | −26.78 | −32.51 | −8.68 | −41.81 | |
| H02-H2 | Buy | −19.02 | −2.77 | −1.07 | −18.27 | −38.17 | −34.68 | −14.76 | −22.12 |
| Sell | −15.09 | −9.02 | −5.28 | −34.93 | −36.76 | −40.34 | −26.29 | −40.28 | |
| H1L-H2 | Buy | −26.70 | −13.71 | −40.41 | −24.05 | −34.81 | −26.44 | −16.76 | −23.96 |
| Sell | −24.57 | −17.45 | −38.13 | −40.26 | −34.61 | −33.22 | −16.58 | −42.91 | |
Итог: и самовозбуждение, и стакан важны (пункты 1–2). Влияние стакана нелинейно (пункт 3). Ядро обычно сложнее одной экспоненты (пункт 4); знак H2-H1 зависит от акции и стороны — у AMZN Any Trade простая экспонента H1 выигрывает у H2, у DIS/KO и у Large Trade — наоборот.
6. Заключение
Процесс Хоукса, умноженный на функцию переменных стакана. Условия стационарности и эргодичности сформулированы. Алгоритм оценки работает на очень больших данных, результаты интерпретируемы. Скорость сходимости портится с числом параметров лишь логарифмически. One-hot кодирование покрывается теорией. На четырёх акциях NYSE вневыборочный тест показывает: нелинейность стакана добавляет ценность к самовозбуждению высокочастотных событий.
Литература
- Alaya, M. Z. et al. (2019). Binarsity: A penalization for one-hot encoded features. JMLR 20, 1–34.
- Bacry, E., Mastromatteo, I. & Muzy, J.-F. (2015). Hawkes processes in finance. Market Microstructure and Liquidity 1(1).
- Bauwens, L. & Hautsch, N. (2009). Modelling financial high frequency data using point processes. In Handbook of Financial Time Series, 953–982.
- Beck, A. & Tetruashvili, L. (2013). On the convergence of block coordinate descent type methods. SIAM J. Optimization 23, 2037–2060.
- Brémaud, P. & Massoulié, L. (1996). Stability of nonlinear Hawkes processes. Ann. Probab. 24, 1563–1588.
- Cartea, Á., Cohen, S. N. & Labyad, S. (2021). Gradient-based estimation of linear Hawkes processes. arXiv:2111.10637.
- Cont, R., Kukanov, A. & Stoikov, S. (2014). The price impact of order book events. J. Financial Econometrics 12, 47–88.
- Da Fonseca, J. & Zaatour, R. (2014). Hawkes process: fast calibration. J. Futures Markets 34, 548–579.
- Engle, R. F. & Russell, J. R. (1998). Autoregressive conditional duration. Econometrica 66, 1127–1162.
- Filimonov, V. & Sornette, D. (2015). Apparent criticality and calibration issues in the Hawkes model. Quantitative Finance 15, 1293–1314.
- Friedman, J. et al. (2007). Pathwise coordinate optimization. Ann. Appl. Stat. 1, 302–332.
- Gaïffas, S. & Guilloux, A. (2012). High-dimensional additive hazards models. Related intensity estimation.
- Hall, A. R. & Hautsch, N. (2007). Modelling the buy and sell intensity. Related LOB intensity work.
- Hawkes, A. G. (1971). Spectra of some self-exciting and mutually exciting point processes. Biometrika 58, 83–90.
- Hawkes, A. G. & Oakes, D. (1974). A cluster process representation of a self-exciting process. J. Appl. Probab. 11, 493–503.
- Huang, R. & Polak, T. (2011). LOBSTER: Limit order book reconstruction system. SSRN 1977207.
- Kirchner, M. (2017). An estimation procedure for the Hawkes process. Quantitative Finance 17, 571–595.
- MacKenzie, D. (2017). A material political economy: Automated Trading Desk and the materiality of prices. Interviews with ATD traders.
- Morariu-Patrichi, M. & Pakkanen, M. S. (2022). State-dependent Hawkes processes and their application to limit order book data. Quantitative Finance.
- Mucciante, L. & Sancetta, A. (2022). High-dimensional intensity estimation complementary to this paper (shrinkage without penalty).
- Sancetta, A. (2018). Estimation for high-dimensional Hawkes-type intensities with order book covariates.
- Tsybakov, A. B. (2003). Optimal rates of aggregation. In COLT.
Перевод основного текста с сохранением формул, алгоритма и таблиц. Доказательства приложения — в PDF оригинала. Оригинал: arXiv:2307.09077 · Mucciante, Sancetta · CC BY-NC-ND 4.0.