Neural Hawkes: непараметрическая оценка в высокой размерности и анализ причинности на крипторынках

4/10

Timothée Fabre · Laboratoire MICS, CentraleSupélec, Université Paris-Saclay; SUN ZU Lab, Paris · Ioane Muni Toke · CentraleSupélec · 5 ноября 2024

Оригинал: Fabre, T. and Muni Toke, I. «Neural Hawkes: Non-Parametric Estimation in High Dimension and Causality Analysis in Cryptocurrency Markets», 2024 — arxiv.org/abs/2401.09361 (PDF).

Оригинал на arXiv по лицензии arXiv nonexclusive-distrib 1.0 (не Creative Commons); перевод для личной коллекции, не для публикации.

Смежные переводы: Хоукс + COE на USDT-стакане · Neural Hawkes симулятор LOB · Hawkes от состояния стакана.

Ключевые слова: процесс Хоукса; непараметрическая оценка; physics-informed neural network; криптовалюты.

Аннотация

Предлагается моментный neural Hawkes — новый подход к восстановлению marked-ядра Хоукса. Процесс полностью задаётся статистиками первого и второго порядка через интегральное уравнение Фredholm второго рода (Bacry–Muzy, 2016). С помощью physics-informed neural networks (PINN) уравнение решается численно в высокой размерности; даны универсальные гиперпараметры, устойчивые к форме ядра.

На симуляциях метод валидирован; затем два приложения к микроструктуре крипты: (1) влияние объёма сделки на интенсивность прихода BTC-USD; (2) направленная причинность между 15 парами на централизованной бирже.

1. Введение

Линейный $D$-мерный Hawkes $N=(N^1,\ldots,N^D)$ имеет интенсивности

\[ \lambda^i_t=\mu^i+\sum_{j=1}^D\int_{(-\infty,t)}\phi_{ij}(t-s)\,dN^j_s, \]

где $\mu$ — базовая интенсивность, $\Phi=(\phi_{ij})$ — матрица ядер. Ядра интерпретируемы для causality analysis (Xu et al.; Achab et al.). Отрицательные части ядер моделируют торможение (Lu–Abergel; Duval et al.), но усложняют теорию.

Классика — параметрическое ядро (часто экспонента) и максимизация likelihood (Lee–Seo; Bonnet et al.). На практике: невыпуклость, латентность и нелинейные marks требуют непараметрики.

1.1 Обзор непараметрических методов

EM по кластерному представлению (Lewis–Mohler; Zhou et al.) — $O(n^2)$ и только положительные ядра. INAR/autoregressive (Eichler et al.; Kirchner), least squares (Bacry et al. 2020), Bayesian (Zhang et al.; Donnet et al.). Neural likelihood (Joseph et al.) масштабируется, но наследует проблемы оптимизации likelihood.

Моментные методы: Laplace автоковариации (Bacry et al. 2012); без симметрии — characterization equation, связывающая ядро со вторым порядком, и решение как Wiener–Hopf с квадратурами (Bacry–Muzy 2016). WH поддерживает power-law и inhibition, но страдает от curse of dimensionality, осцилляций и чувствительности к числу квадратур (Cartea et al. 2021).

Здесь characterization equation решают PINN: нейросеть обучают минимизировать невязку интегрального уравнения (Psichogios–Ungar; Lagaris et al.; Wang et al. 2023).

1.2 Вклад

2. Моментный neural Hawkes

2.1 Каркас

$D$-мерный marked Hawkes: интенсивность типа $i$

\[ \lambda^i_t=\mu^i+\sum_{j=1}^D\int_{(-\infty,t)}\phi_{ij}(t-s,\xi^j_s)\,dN^j_s, \]

marks $\xi^j$ i.i.d. с плотностью $p_j$ на $X_j$. Норма $\|\phi_{ij}\|=\iint \phi_{ij}(s,z)p_j(z)\,ds\,dz$; branching ratio $R=\max_{\lambda\in\mathcal S(\|\Phi\|)}|\lambda|\lt 1$ даёт стационарность. Первый момент: $\Lambda=(I-\|\Phi\|)^{-1}\mu$.

Агрегированное ядро по времени: $\varphi_{ij}(t)=\mathbb E[\phi_{ij}(t,\xi^j)]$; по mark — $f_{ij}(x)=\int \phi_{ij}(t,x)\,dt$. Второй порядок — кросс-кумулянты $G_{ij}(t,x)$ (Eq. 8 оригинала). Теорема 1 (Bacry–Muzy): $G$ и $\phi$ связаны системой интегральных уравнений Фredholm — characterization equation.

2.2 Physics-informed neural networks

PINN $f_\theta$ аппроксимирует решение PDE/IE, минимизируя residual на collocation points. Для Fredholm второго рода $g(t)=f(t)+\int_0^T g(t-s)f(s)\,ds$ residual $I_f(t)=-g(t)+\int g(t-s)f(s)\,ds$; интеграл — квадратура. Loss — средний квадрат residual по сетке точек $(t_n,x_n)$.

2.3 Процедура оценки

Сеть $u_\theta(t,x)=(u^{ij}_\theta)_{1\le i,j\le D}$ на $(0,T]\times X$. Для каждой пары $(i,j)$ невязка characterization equation на точках $E=\{(t_n,x_n)\}$:

\[ \varepsilon^{ij}_n(\theta)=G^{ij}(t_n,x_n)-u^{ij}_\theta(t_n,x_n)-\sum_k\iint u^{ik}_\theta(t_n-s,y)\,G^{kj}(s,y)\,ds\,dy. \]

Loss — сумма $\|\varepsilon^{ij}_n\|^2$ плюс регуляризация (weight decay, gradient clipping). Обучение: Adam, batch по collocation points, deep Galerkin / multi-objective balancing (Bischof–Kraus). Практический corner (§2.4): learning rate 0.001, 1–3 DGM cells, малый batch; marks на общем bounded $X$.

3. Численная валидация

§3.1 — разные формы ядер (экспонента, power-law, inhibition, marked); оценка близка к ground truth. §3.2 — сходимость с ростом числа событий. §3.3 — устойчивость к гиперпараметрам: критичны batch size, learning rate, число скрытых слоёв. §3.4 — сравнение с WH: neural Hawkes стабильнее при больших $D$ и marks, без инверсии огромной матрицы; WH может осциллировать.

4. Приложение к криптовалютам

4.1 Данные

Tick-by-tick сделки централизованной биржи (Binance-тип): timestamps, price, volume, side. Окна высокой активности; фильтрация аномалий.

4.2 Влияние объёма на интенсивность (BTC-USD)

Одномерный marked Hawkes: mark — объём сделки. Оцененная mark-компонента ядра $f(x)$ ведёт себя вогнуто по объёму: крупные сделки повышают краткосрочную интенсивность, но с убывающей отдачей — согласуется с кластеризацией без линейного масштаба.

4.3 Spillover и causality (15 пар)

15 пар (BTC, ETH, SOL, XRP, …). Матрица ядер $\Phi$ даёт направленное влияние. Вводятся:

BTC — частый trigger, но не единственный лидер; объём торгов не совпадает с leader ranking (SEI, ICP могут лидировать по $L_j$ при меньшем notional). Окно 07:00–12:00 UTC; медианные метрики устойчивы к intraday seasonality (§4.4).

5. Заключение

Моментный neural Hawkes сочетает characterization Bacry–Muzy с PINN: обходит инверсию WH-матрицы в высокой размерности, контролирует fit по второму порядку, выдаёт ядро в любой точке без интерполяции между квадратурами. Универсальные гиперпараметры работают на симуляциях; на крипте — вогнутость mark-ядра по объёму и структурированная causality на 15 активах. Метод применим к другим many-body системам с point-process causality.

Литература

Полный список и приложения A–D — в PDF. Рисунки 1–23 — там же.

Перевод: §§1–5 (основной текст). Детали loss, псевдокод обучения и таблицы spillover — в PDF. · arXiv:2401.09361 · лицензия arXiv nonexclusive-distrib 1.0