«Микроструктурные моды»: распутывая совместную динамику цен и потока заявок

7/10

Сальма Эломари-Кессаб, Гийом Метрие, Юлиус Бонарт, Жан-Филипп Бушо · LadHyX, École polytechnique; Chair of Econophysics and Complex Systems; BNP Paribas Global Markets; Capital Fund Management; Académie des Sciences · 20 мая 2024

Оригинал: Elomari-Kessab, S., Maitrier, G., Bonart, J., Bouchaud, J.-P. «“Microstructure Modes” — Disentangling the Joint Dynamics of Prices & Order Flow», 2024 — arxiv.org/abs/2405.10654 (PDF).

Рисунки воспроизведены из оригинальной публикации. Все права на оригинальный текст принадлежат авторам; перевод выполнен в ознакомительных целях с указанием источника.

Аннотация

Понимание микродинамики цен активов в современных электронных стаканах заявок критически важно для инвесторов и регуляторов. В этой работе мы используем базу данных Eurostoxx уровня order-by-order, охватывающую более 3 лет, для анализа совместной динамики цен и потока заявок. Чтобы смягчить различные проблемы, вызванные высокочастотным шумом, мы предлагаем процедуру двойного огрубления (double coarse-graining), которая позволяет извлечь осмысленную информацию на минутном масштабе времени. С помощью метода главных компонент мы строим «микроструктурные моды», описывающие наиболее частые паттерны «поток/доходность», и разделяем их на bid-ask симметричные и bid-ask антисимметричные. Мы определяем и калибруем модель векторной авторегрессии (VAR), кодирующую динамическую эволюцию этих мод. Параметры VAR-модели оказываются чрезвычайно стабильными во времени и дают относительно высокие прогнозные оценки $R^2$, особенно для симметричных мод ликвидности. С включением большего числа лагов VAR-модель становится маргинально неустойчивой, что отражает долгую память потоков и добавляет правдоподобия возможности «эндогенных кризисов ликвидности». Хотя наш VAR-каркас весьма удовлетворителен по нескольким пунктам, мы показываем, что он не воспроизводит хорошо известный закон квадратного корня ценового воздействия.

1. Введение

Микродинамика цен активов запутана: она возникает из тонкого взаимодействия рыночных заявок, лимитных заявок и отмен, происходящих с поразительной скоростью в современных электронных стаканах. Математическое описание последовательности этих различных событий, объёма в стакане и эпизодических изменений цены, когда очередь на лучшем биде или аске опустошается, чрезвычайно трудно. Причины — как высокая размерность задачи, так и наличие дальнодействующих корреляций в знаке рыночных/лимитных заявок, из-за которых необходимы достаточно сильные петли обратной связи. Например, модели нулевого интеллекта (Zero Intelligence) [1, 2], где агенты принимают решения без какого-либо стратегического мышления или предвидения, именно по этой причине не способны создавать когерентные последовательности во времени.

Один из возможных путей, недавно приведший к интересным результатам, — обучение генеративных нейронных сетей на больших наборах данных [3, 4]: каждое событие интерпретируется как слово, и модель пытается угадать серию событий, следующую за данной историей слов. Выучив базовую статистическую структуру динамики стакана, можно было бы генерировать реалистичные синтетические лимитные стаканы. Это, в свою очередь, дало бы ценные возможности для улучшения стратегий маркетмейкинга или двойственной ему задачи — оптимального исполнения. Это также позволило бы симулировать контрфактическое воздействие дополнительных заявок, отсутствующих в публичной ленте, через понимание того, как рынок переваривает такие заявки [5]. Действительно, вывод импакта — скажем — рыночных заявок только по публичной ленте отягощён проблемами кондиционирования.

Хотя сообщалось об определённых успехах использования аналогов больших языковых моделей [6, 4, 7], горизонт прогноза динамики стакана, по-видимому, ограничен несколькими десятками событий. Но поскольку такие события происходят на чрезвычайно высоких частотах, временной горизонт этих прогнозов короче одной секунды для электронных ликвидных рынков — а за это время сама цена меняется редко. Хотя это возможно полезно для высокочастотной торговли [8, 4], хотелось бы разработать инструменты, которые учитывают совместную динамику цен и потоков заявок на несколько более длинных временных масштабах, скажем, минутах.

Одна из главных проблем «полных» моделей, где учитываются все события, состоит в том, что высокочастотная динамика стакана содержит то, что хочется назвать «дрожанием» (jitter): заявки, которые ставятся и немедленно отменяются, дают мало информации о долгосрочной судьбе стакана. Другой источник «дрожания» — рыночные заявки, опустошающие очередь на лучшей цене лишь для того, чтобы она была немедленно заполнена лимитными заявками, что создаёт высокочастотные отскоки мид-цены.

Наша основная идея в этой работе — огрубить и упростить динамику так, чтобы сохранялись только «значимые» изменения цены (точнее определённые ниже). Потоки рыночных заявок, лимитных заявок и отмен, как на биде, так и на аске, агрегируются между двумя изменениями цены и используются как релевантные динамические переменные, на которых мы хотим сосредоточиться и которые хотим прогнозировать, вместе со временем, прошедшим между двумя изменениями цены, и самой соответствующей доходностью. Эти переменные определяют 8-мерное пространство, на которое мы в известном смысле проецируем полную совместную динамику цен и потока заявок.

Затем мы выполняем анализ главных компонент флуктуаций, который определяет «моды ликвидности» — они оказываются стабильными во времени и имеют ясную интерпретацию рыночной динамики. Это позволяет нам определить VAR-модель для прогнозирования таких мод на один лаг вперёд с весьма значимой оценкой $R^2$.

Один из наших ключевых выводов — что на самом деле следует различать две естественные процедуры огрубления. Первая — исключить изменения цены, которые немедленно откатываются, и определить остальные изменения цены как значимые. Однако для получающихся изменений цены, которые мы далее называем «сырыми» (raw), мы всё ещё видим очень сильные эффекты возврата к среднему (или «отскока»). Поэтому мы определяем вторую шкалу огрубления, агрегируя $N$ последовательных сырых изменений цены и строя то, что мы будем называть «биннированными» (binned) доходностями, выбирая $N$ так, чтобы автокорреляция последовательных биннированных доходностей была ниже 0.01. На более длинных временных масштабах ряд ценовых доходностей, таким образом, ближе к белому шуму, так что механические микроструктурные эффекты сглажены. Для таких биннированных данных наша VAR-модель прогнозирует потоки с существенной оценкой $R^2$ ($\sim 25\%$), тогда как — что неудивительно — прогноз доходностей меньше, но всё ещё значим, как in-sample, так и out-of-sample.

И «сырая», и «биннированная» шкалы важны для приложений, но для разных конечных пользователей. Сырая шкала, вероятно, наиболее полезна маркетмейкерам и HFT, тогда как биннированная временная шкала релевантна для оптимального исполнения и даже, возможно, быстрых альфа-сигналов. Наша редуцированная модель позволяет генерировать реалистичные временные ряды изменений цены и потока заявок. Она также позволяет обнаруживать смены режимов, когда остатки относительно VAR-модели становятся аномально высокими.

Интересно, что когда наша VAR-модель расширяется на несколько лагов, мы обнаруживаем ясные признаки, связанные с известными эффектами долгой памяти: несколько направлений активности соответствуют собственным значениям, стремящимся к единице, и становятся маргинально устойчивыми под действием динамики. Известно, что похожий эффект возникает при подгонке линейных процессов Хоукса к финансовым данным [9]: единственный способ ухватить долгую память — привести модель близко к неустойчивости [10, 11]. Если принимать это за чистую монету, маргинально устойчивые собственные векторы нашей VAR-модели указывали бы на зарождающиеся кризисы ликвидности — сценарий, отстаиваемый в различных контекстах, см., например, [12, 13, 14, 15, 16]. Альтернативная интерпретация такой маргинальной устойчивости — эффект меняющихся уровней активности в разные периоды, что в некотором смысле есть другое проявление дальнодействующих корреляций потоков.

Наконец, мы можем также использовать нашу модель для симуляции воздействия дополнительных потоков и посмотреть, насколько удаётся воспроизвести различные стилизованные факты, о которых сообщается в литературе, то есть вогнутость импакта и релаксацию импакта после завершения сделки.

План статьи следующий. Раздел 2 вводит интересующие нас переменные моделирования, описывает набор данных и выбранную предобработку. Раздел 3 предлагает анализ микроструктурных мод на основе метода главных компонент (PCA) наших данных. В разделе 4 мы представляем VAR-модель, применённую к нашим данным, с анализом устойчивости получающейся динамики. Измерения ценового воздействия в рамках нашей модели можно найти в разделе 5; мы заключаем в разделе 6.

2. Описание данных

Набор данных, используемый в этом исследовании, состоит из 545 дней фьючерсного контракта на EuroStoxx с сентября 2016 по август 2019 года. Исходные данные получены на тиковом уровне и содержат детальную информацию о каждом изменении цены. За период анализа наблюдалось чуть менее 4 миллионов изменений цены — в среднем 7264 изменения цены в день.

Стоит отметить, что EuroStoxx — ликвидный крупнотиковый актив со спредом, почти всегда равным одному тику. Эта особенность накладывает сильные ограничения на возможные изменения цены: очень часто мид-цена механически отскакивает назад, потому что одна из лучших очередей немедленно заполняется после опустошения. Считая такие изменения цены микроструктурным шумом, мы отфильтровали их из данных и сохранили только «значимые» изменения цены, определённые следующим образом:

Значимое изменение цены соответствует случаям, когда новый бид совпадает со старым аском, или когда новый аск совпадает со старым бидом.

Другими словами, большинство событий раскрытия спреда соответствуют изменению мид-цены на полтика. Если следующее событие закрытия спреда соответствует ещё одному движению на полтика в том же направлении, мы считаем изменение цены значимым. Это определение позволяет убрать часть «дрожания», которое мы считаем незначимым для динамики, которую хотим ухватить, и снизить размерность задачи, сосредоточившись на суммарном потоке заявок между двумя последовательными изменениями цены.

2.1. Интересующие переменные и внутридневной профиль

Для $n$-го значимого изменения цены дня, происходящего в момент $t_n$, мы определяем следующие переменные:

Все переменные, кроме доходностей, по определению положительны. Доходности могут принимать положительные и отрицательные значения и в большинстве случаев равны $\pm 1$ тику. Для дальнейшего использования мы складываем эти 8 переменных в следующий 8-мерный динамический вектор

\[ \mathbf{X}_n = \left( \Delta t_n,\, V_n^{lo,b},\, V_n^{lo,a},\, V_n^{c,b},\, V_n^{c,a},\, V_n^{ex,b},\, V_n^{ex,a},\, r_n \right) \tag{1} \]

Следствие сосредоточения на «значимых» изменениях цены: когда цены двигаются вверх (дважды, чтобы считаться значимым движением), первый вставленный объём на новом, более высоком биде учитывается в $V_n^{lo,b}$, тогда как ранее существовавший объём на новом аске — нет; и эквивалентно при движении цен вниз. Иными словами: очереди, которые переходят со второй-лучшей на лучшую позицию, не считаются новыми потоками размещения.

Рис. 1 изображает нормированную среднюю форму бидовых объёмных переменных $V_n^{\star,b}$ в течение дня с биннированием в 1-минутные интервалы. Наблюдаемый пик около 15:00 совпадает с открытием американского рынка. Поскольку наш подход к моделированию не включает внутридневные объёмные паттерны, все объёмы масштабируются сглаженным средним профилем, подогнанным двумя различными экспоненциально затухающими функциями $A \exp(-t/\tau) + B$ с 3 параметрами каждая: амплитуда ($A$), постоянная времени затухания ($\tau$) и базовый уровень ($B$), см. таблицу 1.

Нормированный внутридневной профиль потоков размещения и сделок
Рисунок 1: Нормированный внутридневной профиль потоков размещения лимитных заявок и сделок по данным фьючерса на EuroStoxx. Потоки отмен имеют профили, схожие с потоками размещения, и для ясности на рисунке не показаны. Уровень активности высок в начале дня и снижается вплоть до всплеска активности на открытии рынка США. Внутридневной профиль одинаков для всех потоков активности, и мы характеризуем его единственным набором параметров, приведённым в таблице 1.

Таблица 1: Параметры экспоненциальной подгонки для среднего из 6 нормированных внутридневных профилей потоков.

ПараметрДо 15:30После 15:30
Амплитуда ($A$)2.20 ± 0.141.95 ± 0.42
Время затухания ($\tau$)50.0 ± 5.7 минут6.85 ± 2.4 минут
Базовый уровень ($B$)1.79 ± 0.043.95 ± 0.07

2.2. Второе огрубление

Даже после фильтрации изменений цены, признанных незначимыми, доходности $r_n$ всё ещё демонстрируют очень сильные антикорреляции. Рис. 2 показывает, что эмпирическая корреляционная функция $C_r(\ell) := \langle r_n r_{n+\ell} \rangle$ может быть аппроксимирована как

\[ C_r(\ell) \approx (-\gamma)^{\ell}; \qquad (\gamma \approx 0.8 < 1). \tag{2} \]

Эти корреляции становятся малыми ($< 0.01$) только за пределами лага $\ell = 20$. То есть сильные микроструктурные эффекты всё ещё затрагивают наши «значимые» изменения цены: мид-цена становится приблизительно диффузионной только для лагов $\gtrsim 20$.

Ввиду этих устойчивых антикорреляций мы ввели вторую шкалу огрубления, дополнительно объединяя последовательные значимые изменения цены в группы по 20. Всюду в этой статье мы будем называть наше исходное определение значимых изменений цены «сырым» (raw), а агрегированные (пакетами по 20) изменения цены — «биннированными» (binned). Из-за очень коротких временных масштабов сырых данных изменений цены наблюдается очень много нулевых потоков $V_n^{\star,a}$ или $V_n^{\star,b}$ между $t_n$ и $t_{n+1}$ — эффект, полностью исчезающий при биннировании данных.

Абсолютное значение автокорреляции доходностей
Рисунок 2: Абсолютное значение автокорреляции доходностей. Чередование положительных и отрицательных значений автокорреляции указывает на отскоки доходности, которые по существу исчезают после биннирования 20 последовательных изменений цены.

2.3. Преобразование Бокса–Кокса

Из-за сильно негауссовой природы переменных $V_n$ и $\Delta t_n$, даже после биннирования, мы начинаем с применения преобразования «Бокса–Кокса» $f(x; \lambda)$ к биннированным переменным:

\[ f(x; \lambda) := \begin{cases} \dfrac{(ax)^{\lambda}-1}{\lambda}, & \text{если } \lambda \neq 0 \\[4pt] \log(ax), & \text{если } \lambda = 0 \end{cases} \tag{3} \]

с параметром $\lambda$, возможно различным для объёмных переменных $\lambda_v$ (выбранным одинаковым для всех таких переменных) и для временной переменной $\lambda_t$. Эти параметры выбираются так, чтобы максимизировать правдоподобие гауссовского распределения преобразованных переменных, что даёт $\lambda_v = 0.20$ и $\lambda_t = 0.14$. Масштабный параметр $a$ можно без потери общности положить равным единице.

Далее мы будем работать с рядом 8-мерных векторов $\mathbf{T}_n$, определённых как:

\[ \mathbf{T}_n = \Big( f(\Delta t_n; \lambda_{\Delta t}),\, f\big(V_n^{lo,b}; \lambda_f\big),\, f\big(V_n^{lo,a}; \lambda_f\big),\, f\big(V_n^{c,b}; \lambda_f\big),\, f\big(V_n^{c,a}; \lambda_f\big),\, f\big(V_n^{ex,b}; \lambda_f\big),\, f\big(V_n^{ex,a}; \lambda_f\big),\, r_n \Big). \tag{4} \]

Мы дополнительно нормируем биннированные данные изменений цены, используя скользящее окно из дней, предшествующих интересующему дню. Пусть $w$ — ширина временного окна, используемого для вычисления средних и масштабов переменных, с $w = 20$. Пусть $d$ — день в наборе данных, а $N_k$ — число наблюдаемых изменений цены в день $k$. Мы пишем $\mathbf{T}_n^d$, чтобы указать, что вектор наблюдается в день $d$, и определяем каузальное локальное среднее и масштаб следующим образом:

\[ \mu_j^d = \frac{1}{w} \sum_{k=d-w}^{d-1} \frac{1}{N_k} \sum_{n=1}^{N_k} (\mathbf{T}_n^k)_j, \qquad j = 1, 2, \ldots, 8, \tag{5} \] \[ (\sigma_j^d)^2 = \frac{1}{w} \sum_{k=d-w}^{d-1} \frac{1}{N_k} \sum_{n=1}^{N_k} \Big( (\mathbf{T}_n^k)_j - \mu_j^k \Big)^2, \qquad j = 1, 2, \ldots, 8, \tag{6} \]

с которыми мы нормируем каждую компоненту векторов $\mathbf{T}_n$:

\[ \mathbf{T}_n^{\prime d} = \frac{\mathbf{T}_n^d - \mu^d}{\sigma^d}. \tag{7} \]

3. Микроструктурные моды

Как интуитивно ожидается, объёмные переменные $V_n$ и временная $\Delta t_n$ сильно коррелированы. Например, большой поток рыночных заявок может вызвать больше лимитных заявок, и наоборот. Поэтому естественно использовать метод главных компонент (PCA), чтобы понять структуру этих (внутрибиновых) корреляций и определить набор некоррелированных главных компонент. Эти векторы, упорядоченные по своим собственным значениям, представляют доминирующие микроструктурные моды рынка. Оказывается, все эти моды демонстрируют почти идеальную bid-ask симметрию (или антисимметрию), особенно при вычислении на большом числе дней. Поскольку нет причин для нарушения этой симметрии на высоких частотах, мы вручную удалили всю остаточную паразитную bid-ask асимметрию в представленных ниже результатах. Заметим, что PCA-анализ всегда выполняется на Бокс-Кокс-преобразованных переменных $\mathbf{T}_n'$, с окном усреднения $w$, выбранным равным 20 дням.

3.1. PCA-анализ I: сырые данные

Разложение по собственным векторам сырых данных дано на рис. 3; соответствующие собственные значения $\lambda_\alpha$ варьируются от $\lambda_1 = 4.07$ до $\lambda_8 = 0.02$, причём $\sum_{\alpha=1}^{8} \lambda_\alpha = 8$ из нормировки ковариации.

Каждая собственная мода $\mathbf{U}_\alpha$ имеет довольно интуитивную и прозрачную интерпретацию, которую мы комментируем ниже. Три из них bid/ask симметричны, четыре — bid/ask антисимметричны, а последняя содержит только длительность, которая на таких высоких частотах оказывается независимой переменной. Заметим, что знак этих собственных векторов произволен; каждое направление одинаково исследуется динамикой с интенсивностью, задаваемой квадратным корнем соответствующего собственного значения.

Нормированные собственные векторы PCA-разложения (сырые данные)
Рисунок 3: Нормированные собственные векторы $\mathbf{U}_\alpha$ PCA-разложения (сырые данные). Для ясности амплитуды меньше 0.15 (соответствующие весам менее $0.15^2 \approx 2\%$) обнулены. Направления следует интерпретировать как Бокс-Кокс-преобразования исходных направлений (кроме доходности $r$).

3.2. PCA-анализ II: биннированные данные

Теперь мы проводим точно такой же PCA-анализ, но для биннированных данных, агрегируя объёмные потоки и доходности по 20 последовательным изменениям цены. Возникающие собственные моды имеют почти ту же структуру, что и для сырых данных: PCA даёт две категории мод — одна улавливает симметричную активность между бидом и аском, другая — антисимметричную активность и ненулевые изменения цены.

Мода 1 снова соответствует глобальному росту (или спаду) активности, а мода 2 — дисбалансу рыночных заявок, ведущему к изменению цены в направлении дисбаланса. Суммарный вес этих двух мод $\lambda_1 + \lambda_2$ теперь достигает $\approx 6.80$, то есть 85% полной дисперсии, против 69% для сырых данных. Моды 3 и 4 по существу те же, что и для сырых данных, с точностью до перестановки их ранга. То же самое происходит для мод 5 и 6, и снова для мод 7 и 8. Мода 4 (бывшая мода 3 для сырых данных) теперь ассоциирует более короткую длительность с бóльшим объёмом, добавляемым и отменяемым в стакане. Интересно, что bid-ask симметричные флуктуации улавливают 82% полной дисперсии, оставляя лишь 18% дисперсии асимметричным, меняющим цену флуктуациям.

Нормированные собственные векторы PCA-разложения (биннированные данные)
Рисунок 4: Нормированные собственные векторы PCA-разложения (биннированные данные). Для ясности амплитуды меньше 0.15 (соответствующие весам менее $0.15^2 \approx 2\%$) обнулены. Мы наблюдаем 4 симметричные моды (1, 3, 4 и 8) и 4 антисимметричные моды (2, 5, 6 и 7). Направления следует интерпретировать как Бокс-Кокс-преобразования исходных направлений (кроме доходности $r$).

4. VAR-модель динамики потоков

В этом разделе мы представляем математический каркас, лежащий в основе нашего подхода к моделированию. Мы принимаем модель векторной авторегрессии (VAR), чтобы ухватить динамические связи между переменными, ассоциированными с каждым изменением цены. Регрессия на проекции данных на собственные векторы, а не непосредственно на сами данные, помогает справляться с проблемами коллинеарности и облегчает интерпретируемость результатов.

Нас будет интересовать эволюция $\mathbf{X}_n$, определённого в уравнении (1), для биннированных данных. (Для сырых данных большая доля нулевых элементов потребовала бы специальной обработки, следуя, например, [17, 18, 19]. Мы оставляем это для дальнейших исследований.) Для этого мы преобразуем данные с помощью Бокса–Кокса и строим векторную авторегрессионную модель в пространстве 8 главных компонент (или собственных мод), описанных в предыдущем разделе. Для каждого $n$ Бокс-Кокс-преобразованный вектор $\mathbf{X}_n$ проецируется на $j$-ю собственную моду $\mathbf{U}_\alpha$, и получающаяся проекция дополнительно центрируется и нормируется на единичную дисперсию, окончательно определяя 8-вектор в пространстве собственных мод $\mathbf{Y}_n$.

VAR-модель с $p$ лагами задаётся следующим уравнением эволюции

\[ \mathbf{Y}_n = \boldsymbol{\Phi}_1 \mathbf{Y}_{n-1} + \boldsymbol{\Phi}_2 \mathbf{Y}_{n-2} + \ldots + \boldsymbol{\Phi}_p \mathbf{Y}_{n-p} + \boldsymbol{\epsilon}_n, \tag{8} \]

где $\boldsymbol{\epsilon}_n$ представляет вектор белошумных инноваций, а $\boldsymbol{\Phi}_k$ — переходные матрицы $8 \times 8$, улавливающие взаимозависимости и временную динамику в пространстве собственных мод. VAR-модель калибруется стандартными регрессионными методами, за исключением того, что мы вручную добавляем дополнительное ограничение: модель должна уважать bid-ask симметрию. Это означает, что все коэффициенты $(\boldsymbol{\Phi}_k)_{\alpha\beta}$, связывающие bid-ask симметричные моды ($\alpha = 1, 3, 4, 8$) с bid-ask антисимметричными модами ($\beta = 2, 5, 6, 7$), должны быть нулевыми. Впрочем, и без этого ограничения все нарушающие симметрию коэффициенты оказываются очень малыми.

4.1. VAR-модель с одним лагом

Сначала мы сосредоточимся на VAR-модели с $p = 1$ лагом:

\[ \mathbf{Y}_n = \boldsymbol{\Phi}_1 \mathbf{Y}_{n-1} + \boldsymbol{\epsilon}_n. \tag{9} \]

Переходная матрица $\boldsymbol{\Phi}_1$ представлена в таблице 2. Наиболее значимые элементы, то есть такие, что $|(\boldsymbol{\Phi}_1)_{\alpha\beta}| > 0.1$, выделены жирным и соответствуют в основном диагональным элементам (кроме 22 и 66). Однако лучшее описание переходной матрицы — в терминах её собственных значений и собственных векторов. 6 собственных векторов соответствуют вещественным собственным значениям, 5 положительным и одному отрицательному, а 2 собственных вектора соответствуют паре комплексно-сопряжённых собственных значений с очень малым модулем. Пять собственных векторов с наибольшей нормой показаны на рис. 5. Тот факт, что все собственные значения лежат внутри единичного круга, означает, что 1-лаговая VAR-модель устойчива: флуктуации затухают, а не усиливаются. Заметим, что верхнее собственное значение равно 0.68 и соответствует симметричной моде отмен, отражающей главным образом активность маркетмейкеров.

Вторая мода, с собственным значением 0.56, тоже симметрична и соответствует большему числу лимитных заявок, меньшему числу рыночных заявок и меньшему времени между изменениями цены — или наоборот. Наибольшая антисимметричная мода имеет собственное значение $\lambda_5 = -0.23$ и является уровнем дисбаланса для всех потоков, который, как видно, возвращается к среднему (поскольку $\lambda_5 < 0$).

Таблица 2: Переходная матрица для микроструктурных мод, где значения, превышающие порог значимости 0.05 по соответствующему p-значению, обнулены. Столбцы соответствуют входным модам в момент $n-1$, строки — прогнозируемым модам в момент $n$. Символ S (или A) обозначает bid-ask симметрию (антисимметрию) мод.

Мода1S2A3S4S5A6A7A8S
1S0.560.00-0.02-0.030.000.000.000.09
2A0.00-0.060.000.00-0.000.04-0.090.00
3S0.050.000.530.000.000.000.00-0.09
4S-0.060.00-0.020.590.000.000.00-0.03
5A0.000.010.000.000.15-0.02-0.040.00
6A0.000.080.000.00-0.09-0.050.090.00
7A0.00-0.080.000.00-0.080.09-0.110.00
8S0.120.00-0.05-0.040.000.000.000.52
5 собственных векторов с наибольшей нормой собственного значения
Рисунок 5: 5 собственных векторов с наибольшей нормой собственного значения из разложения переходной матрицы. Первые 4 собственных вектора имеют положительные собственные значения и описывают симметричные сценарии на биде и аске, пятый — антисимметричный и возвращающийся к среднему.

Успех 1-лаговой VAR-модели можно количественно оценить в терминах прогнозных оценок $R^2$, представленных в таблице 3, как по модам преобразованных переменных $\mathbf{Y}_n$, так и для исходных переменных $\mathbf{X}_n$. Заметим, что, как и ожидалось, оценки $R^2$ намного выше ($\sim 0.28$–$0.32$) для симметричных мод, не несущих информации о доходностях, чем для антисимметричных мод ($\sim 0.01$–$0.03$). Однако in-sample и out-of-sample оценки $R^2$ близки, что подчёркивает статистическую значимость прогнозной ценности VAR-модели. Мы использовали первые 465 дней данных для калибровки модели и вычисления in-sample оценок. Оставшиеся 80 дней отведены для вычисления out-of-sample оценок.

Таблица 3: Оценки $R^2$ в % как в пространстве мод (сверху), так и в исходном пространстве (снизу). Символ S (или A) обозначает bid-ask симметрию (антисимметрию) мод.

Мода1S2A3S4S5A6A7A8S
In-sample (%)32.41.229.135.12.432.393.0728.8
Out-of-sample (%)28.01.1121.836.14.331.682.2432.5
Переменная$\Delta t$$V^{lo,b}$$V^{lo,a}$$V^{c,b}$$V^{c,a}$$V^{ex,b}$$V^{ex,a}$$r$
In-sample (%)21.329.829.836.436.025.324.81.60
Out-of-sample (%)27.422.721.525.624.122.925.01.46

Особый интерес представляет оценка $R^2 = 1.6\%$ для доходности $r$. Она, в частности, значимо выше оценки 0.49%, получаемой при прогнозе доходностей с использованием прошлой доходности как единственного признака. Это показывает, что потоковые переменные добавляют полезную прогнозную силу для переменной доходности.

4.2. Многолаговая VAR-модель

В этом подразделе мы расширяем наш подход к моделированию на многолаговую модель векторной авторегрессии VAR($p$), задаваемую уравнением (8) с $p > 1$. Интересно, что добавление лагов снижает автокорреляцию остатков и повышает out-of-sample оценку $R^2$ всех мод — на $\sim 25\%$ как для симметричных, так и для антисимметричных, когда $p$ растёт от 1 до 10 — см. таблицы 4 и 5.

Таблица 4: Средние оценки $R^2$ для симметричных (S) и асимметричных (A) мод in-sample и out-of-sample для разного числа лагов $p$.

Лаги12345678910
In-sample S (%)31.435.837.338.138.538.839.039.239.339.4
Out-of-sample S (%)29.634.336.237.037.337.637.938.138.338.4
In-sample A (%)2.292.562.692.772.862.943.003.053.103.15
Out-of-sample A (%)2.352.562.652.732.792.852.922.993.033.04

Таблица 5: Оценки $R^2$ для VAR(8) в % как в пространстве мод (сверху), так и в исходном пространстве (снизу). Заметим, что out-of-sample оценка $R^2$ доходностей растёт с 1.46 при $p = 1$ до 1.7 при $p = 8$.

Мода1S2A3S4S5A6A7A8S
In-sample (%)36.01.4635.543.53.472.294.0036.3
Out-of-sample (%)36.71.3027.545.45.532.222.8942.6
Переменная$\Delta t$$V^{lo,b}$$V^{lo,a}$$V^{c,b}$$V^{c,a}$$V^{ex,b}$$V^{ex,a}$$r$
In-sample (%)30.437.637.944.043.832.131.51.87
Out-of-sample (%)36.331.429.434.132.128.431.31.7

Другой интересный вопрос — делает ли добавление памяти систему менее устойчивой. Чтобы обсудить этот пункт, поищем вектор $\mathbf{Z}$ такой, что на больших временах $p$-VAR-модель в отсутствие инноваций давала бы

\[ \mathbf{Y}_n \approx_{n \gg 1} \gamma^n \mathbf{Z}. \]

Подставляя в уравнение (8) и деля на $\gamma^n$, находим следующее условие:

\[ \mathbf{Z} = \mathbb{M}_p \mathbf{Z}, \qquad \mathbb{M}_p(\gamma) := \left[ \sum_{k=1}^{p} \gamma^{-k} \boldsymbol{\Phi}_k \right]. \tag{10} \]

Другими словами, следует искать такое значение $\gamma$, при котором матрица $\mathbb{M}_p(\gamma)$ имеет одно собственное значение, в точности равное единице; соответствующий собственный вектор определяет $\mathbf{Z}$. Наименее устойчивое направление $p$-VAR-модели ассоциировано с наибольшим возможным значением $|\gamma|$ (где $\gamma$ может быть комплексным).

Два наибольших значения gamma как функция числа лагов p
Рисунок 6: Два наибольших значения $\gamma_{1,2}(p)$, таких что матрица $\mathbb{M}_p(\gamma)$ имеет собственное значение, равное единице, как функция лага $p$. График сравнивает методы нормировки данных: один использует все доступные 545 дней, в другом каждый день нормируется независимо. Вставка: те же результаты, построенные как функция $1/p$, демонстрируют почти идеально линейное поведение, экстраполирующееся к единице при $p \to \infty$.

Весьма интересно, что на рис. 6 мы наблюдаем: и $\gamma_1(p)$, и $\gamma_2(p)$ могут быть подогнаны как $1 - C_{1,2}/p$ и, следовательно, по-видимому, сходятся к единице с ростом числа лагов. Это означает, что доминирующие собственные векторы, показанные на рис. 7, становятся всё более и более персистентными по мере увеличения числа лагов $p$. Это предполагает, что динамика потоков на самом деле маргинально устойчива, что согласуется с хорошо известным стилизованным фактом: поток заявок обладает степенными, долгопамятными корреляциями [5], соответствующими единичному корню в VAR-описании или маргинальной устойчивости в описании через процессы Хоукса [11]. Маргинальная устойчивость могла бы, однако, быть результатом неадекватности VAR-модели для представления данных, поскольку единственный способ представить долгопамятные корреляции в VAR-каркасе — иметь единичные корни.

Доминирующие собственные векторы Mp(gamma)
Рисунок 7: Доминирующие собственные векторы $\mathbb{M}_p(\gamma_{1,2})$. При $p = 1$ мы восстанавливаем собственные векторы с рис. 5. При $p \geq 2$ все доминирующие собственные векторы по существу не зависят от $p$ и ассоциированы с важными флуктуациями ликвидности. Например, $\gamma_2$ описывает персистентную моду с меньшим размещением заявок и бóльшими отменами, которая может вести к кризисам ликвидности.

Доминирующие собственные векторы идентичны для всех $p \geq 2$ и описывают флуктуации ликвидности. Мода, ассоциированная с $\gamma_1(p)$, предсказывает меньше (или больше) размещений, чем обычно. Вторая, со скоростью $\gamma_2(p)$, описывает персистентную моду с меньшим размещением заявок и бóльшими отменами, которая может вести к кризисам ликвидности, как аргументировано в [14]. Даже если $\gamma_2(p)$ ниже единицы, система, по-видимому, очень близка к этой границе устойчивости и потому склонна к эндогенным кризисам ликвидности. В этом контексте напомним, что мы выбрали особенно стабильный, крупнотиковый контракт (Eurostoxx); было бы интересно выполнить тот же анализ на мелкотиковых отдельных акциях.

5. Попытка моделирования ценового импакта

В этом разделе нас интересует понимание воздействия торговли одного агента на рынок и его будущие состояния в рамках установленного выше VAR-каркаса. До конца раздела мы сосредоточимся на воздействии возмущений потоков на аске — без потери общности, поскольку регрессионная матрица симметрична между бидом и аском.

Феномен, обычно изучаемый в литературе, — ценовое воздействие [20, 2, 21], то есть насколько трейдер изменяет цену актива, покупая или продавая его. Эта метрика критична для практиков, но также и с академической точки зрения. Ценовое воздействие обладает интересными теоретическими свойствами, такими как так называемый закон квадратного корня (обзор см. в [2, 21]).

В принципе, механический импакт рыночных заявок (то есть та часть, которая не зависит от какой-либо информации, мотивирующей сделки) определяется как [2, 21]

\[ \mathcal{I}(\ell) := \mathbb{E}[m_{t+\ell} - m_t \,|\, \text{exec}_t] - \mathbb{E}[m_{t+\ell} - m_t \,|\, \text{no-exec}_t], \tag{11} \]

где $m(t)$ — мид-цена в момент $t$, когда исполняется рыночная заявка. Другими словами, следует сравнить изменение цены между моментами $t$ и $t + \ell$ с исполнением заявки и без него. Разумеется, такое измерение невозможно, поскольку эти два состояния рынка взаимоисключающи. Поэтому на практике предполагается, что на достаточно коротких временных масштабах рыночные заявки, выставляемые медленными трейдерами, обладают малой краткосрочной предсказуемостью, так что вторым членом в уравнении (11) можно пренебречь. Отсюда наблюдаемый импакт определяется как

\[ \mathcal{I}^{obs}(\ell \,|\, exec_t) := \mathbb{E}[m_{t+\ell} - m_t]. \tag{12} \]

Вся идея построения достоверной генеративной модели цен и потока заявок — в возможности выполнить численно «do-операцию» [21], описанную в уравнении (11).

Мы провели такой численный эксперимент, используя VAR-модель, откалиброванную выше на биннированных данных, — которые, напомним, агрегируют вместе 20 последовательных значимых изменений цены. Процедура следующая: мы добавляем к наблюдаемому потоку рыночных заявок на аске определённое количество, соответствующее нашему дополнительному покупателю, между огрублённым временем $n$ и временем $n + k$. На каждом временном шаге мгновенный импакт вычисляется с использованием средних кривых импакта, полученных в [22], которые воспроизведены в Приложении.

Однако существует тонкость, связанная с потоками исполнений, предсказываемыми VAR-моделью. Поворачивая матрицу $\boldsymbol{\Phi}_1$ в пространство реальных потоков, мы получаем матрицу, показанную в таблице 6. Эта матрица показывает, что за ростом потока рыночных заявок на аске на следующем временном шаге, скорее всего, последует рост потоков рыночных заявок и на аске, и на биде, с чуть более высокими значениями на противоположной стороне. Последовательность рыночных заявок на одной стороне — проявление хорошо известной дальнодействующей корреляции потоков на рынке [5], которая обусловлена прежде всего расщеплением мета-ордеров, с очень малым вкладом стадности [23].

Таблица 6: Аппроксимация переходной матрицы в пространстве реальных потоков, полученная поворотом $\boldsymbol{\Phi}_1$ обратно в пространство реальных переменных. Столбцы соответствуют входным переменным на шаге $n-1$, строки — оценке переменных на шаге $n$. Замечание: строго говоря, это не переходная матрица из-за нелинейной операции Бокса–Кокса.

Переменные$\Delta t$$V^{lo,b}$$V^{lo,a}$$V^{c,b}$$V^{c,a}$$V^{ex,b}$$V^{ex,a}$$r$
$\Delta t$0.560.05-0.05-0.000.00-0.02-0.03-0.0
$V^{lo,b}$-0.020.210.220.06-0.050.02-0.010.06
$V^{lo,a}$-0.020.220.21-0.050.06-0.010.02-0.05
$V^{c,b}$-0.000.08-0.060.390.28-0.000.02-0.04
$V^{c,a}$-0.00-0.06-0.080.280.390.06-0.000.04
$V^{ex,b}$0.020.020.04-0.020.040.260.28-0.05
$V^{ex,a}$0.020.040.020.04-0.020.280.260.05
$r$-0.000.06-0.05-0.060.04-0.020.02-0.14

Наша модель обучена на реальных данных цен и потоков, чья каузальная структура включает механизм «возмущение–отклик», но не сводится к нему. Отдельные участники рынка не действуют изолированно и могут через сложные торговые стратегии влиять на динамику рынка на длинных временных масштабах и даже кросс-секционно. В той мере, в какой экзогенное возмущение, чей импакт мы хотим симулировать, не репрезентативно для торгового расписания среднего участника рынка, модель не может полностью различить, обусловлены ли корреляции рыночным откликом или индивидуальными сложными торговыми стратегиями. Чтобы согласованно смоделировать импакт конкретного экзогенного мета-ордера, мы должны избежать двойного учёта таких вкладов. Поэтому, как аппроксимация, внутри нашего симуляционного каркаса мы игнорируем последующие заявки на исполнение, предсказываемые моделью на той же стороне, и учитываем только индуцированные эффекты. Возмущённые потоки и доходности затем распространяются вперёд во времени с помощью VAR-модели. Полное ценовое воздействие получается вычитанием невозмущённой наблюдаемой ценовой траектории и усреднением по времени. Однако важно отметить, что этот подход даже на концептуальном уровне является аппроксимацией, точность которой трудно оценить количественно. Результат для модели VAR(10) показан на рис. 8.

Симуляции импакта мета-ордеров длины k = 4
Рисунок 8: Симуляции импакта мета-ордеров длины $k = 4$. В течение первых 4 временных шагов к наблюдаемому потоку исполнений добавляется рыночная заявка размера $q$. Начиная с 5-го временного шага рынок больше не возмущается. Измеренный импакт масштабирован на размер добавленного торгового потока.

Эмпирически, как упомянуто выше, импакт сильно вогнут и демонстрирует зависимость квадратного корня как по времени (внутри мета-ордера), так и по полному размеру (в пике импакта), см. [2], глава 12. Более того, такой импакт сильно возвращается к среднему в конце мета-ордера. Наша методология, однако, даёт поведение импакта, отличающееся в заметных отношениях. На рис. 8 мы видим, что генерируемый импакт лишь слегка вогнут внутри мета-ордера, а затем спадает после завершения мета-ордера. Несмотря на это, пиковый импакт линеен по размеру мета-ордера, вопреки вогнутому поведению в наблюдаемых рыночных данных. Эта линейная форма на самом деле ожидаема в рамках нашего возмущенческого подхода, где добавленный торговый поток достаточно мал, чтобы быть поглощённым рынком, что ведёт к линейному поведению нелинейного преобразования Бокса–Кокса. Более того, уровень отката цены между моментом, когда мы перестаём возмущать рынок, и моментом стабилизации цены составляет около 75% пикового импакта, тогда как в реальных данных спад импакта намного круче, со значительно более низким значением плато [24].

Вывод этого раздела: хотя наш VAR-каркас предлагает хороший бенчмарк для моделирования импакта мета-ордеров, по-видимому, отсутствует некий ключевой элемент, поскольку сильно вогнутая, возвращающаяся к среднему природа импакта не воспроизводится. Мы предполагаем, что этот отсутствующий элемент — явная привязка к недавним изменениям цены, чтобы включить идею асимметричной латентной ликвидности, как аргументировано в [25, 2]. Кроме того, из-за использования кривых импакта из [22] для вычисления мгновенной доходности доходность, производимая нашей моделью, разбавлена по масштабу. Для устранения этих ограничений будущая работа могла бы выиграть от изучения моделей с усиленной нелинейностью, таких как нейронные сети.

6. Заключение и обсуждение

Лихорадочная и шумная динамика стакана на самых высоких частотах затрудняет попытки моделирования на основе активности order-by-order. В этой работе мы разработали специальную процедуру огрубления для извлечения осмысленной информации из таких беспорядочных данных о потоках. Во-первых, чтобы убрать «мерцающий» шум bid-ask отскоков, мы предложили определение значимых изменений цены и определили интересующие потоковые переменные как агрегаты рыночных заявок, лимитных заявок и отмен между двумя такими значимыми изменениями цены.

Однако мы сочли необходимым ввести вторую шкалу огрубления по времени, чтобы (i) сгладить сильный возврат цены к среднему, сохраняющийся до $\sim 20$ значимых изменений цены, и (ii) устранить большое количество нулей в потоковых переменных, которые затрудняют интерпретацию линейного анализа.

Один из наших наиболее интересных новых результатов — появление того, что мы назвали «микроструктурными модами», то есть главных компонент совместной огрублённой динамики цены и потока заявок. Эти моды чрезвычайно стабильны во времени и все имеют интуитивную интерпретацию. Они распадаются на две категории: bid-ask симметричные и bid-ask антисимметричные. Первая категория описывает, например, рост/спад отмен и спад/рост лимитных заявок с обеих сторон стакана одновременно, ассоциированные с динамикой ликвидности. Вторая категория описывает, например, рост рыночных заявок на аске и спад рыночных заявок на биде, ассоциированные с положительной ценовой доходностью.

Используя эти микроструктурные моды как входы, мы построили и откалибровали многолаговую VAR-модель, улавливающую их динамику. Модель стабильна во времени и даёт высокие оценки $R^2 \sim 30$–$40\%$ для симметричных мод и, как и ожидалось, более низкие, но значимые оценки $R^2 \sim 2$–$3\%$ для антисимметричных (направленных) мод. Нелинейные, нейросетевые модели, принимающие наши микроструктурные моды как признаки, должны ещё улучшить качество прогноза.

Мы обнаружили, что VAR-модель становится маргинально устойчивой с ростом числа лагов. Это отражает хорошо известную долгопамятную природу потока заявок на финансовых рынках. Анализ направлений потока, которые становятся неустойчивыми, добавляет правдоподобия сценарию «эндогенного кризиса ликвидности», предложенному в [12, 13, 14, 15, 16].

Наконец, мы использовали наш VAR-формализм для измерения импакта мета-ордеров на цену. Хотя мы наблюдаем некоторый возврат цены к среднему в конце мета-ордера, схожий с реальными данными, нам не удалось воспроизвести вогнутую корневую зависимость импакта от времени и объёма. Мы предположили, что для улавливания эффектов «латентной ликвидности», которые считаются источником вогнутости импакта [25, 2], необходимо явное кондиционирование переходной матрицы VAR на недавние доходности.

При работе с «сырыми», небиннированными данными мы столкнулись с тем, что на коротких временных масштабах большинство наблюдаемых объёмов потоков нулевые, что делает нашу линейную VAR-модель непригодной. Эту проблему можно было бы решить с помощью недавних статистических техник [17, 18, 19] или с использованием более сложных нейросетевых архитектур, комбинирующих рекуррентные нейронные сети и техники внимания. Было бы также интересно пересмотреть задачу ценового импакта в этом каркасе.

Благодарности

Мы хотели бы поблагодарить Нирбхая Патила, Сесилию Обран и Жерома Гарнье-Брюна за их полезные предложения. Это исследование выполнено в рамках Econophysics & Complex Systems Research Chair под эгидой Fondation du Risque, Fondation de l'École Polytechnique и Capital Fund Management.

Литература

  1. J Doyne Farmer, Paolo Patelli, and Ilija I Zovko. The predictive power of zero intelligence in financial markets. Proceedings of the National Academy of Sciences, 102(6):2254–2259, 2005.
  2. Jean-Philippe Bouchaud, Julius Bonart, Jonathan Donier, and Martin Gould. The Impact of Market Orders, page 208–228. Cambridge University Press, 2018.
  3. Andrea Coletta, Aymeric Moulin, Svitlana Vyetrenko, and Tucker Balch. Learning to simulate realistic limit order book markets from data as a world agent. In Proceedings of the third ACM international conference on AI in finance, pages 428–436, 2022.
  4. Peer Nagy, Sascha Frey, Silvia Sapora, Kang Li, Anisoara Calinescu, Stefan Zohren, and Jakob Foerster. Generative AI for end-to-end limit order book modelling: A token-level autoregressive generative model of message flow using a deep state space network. In Proceedings of the Fourth ACM International Conference on AI in Finance, pages 91–99, 2023.
  5. Jean-Philippe Bouchaud, J Doyne Farmer, and Fabrizio Lillo. How markets slowly digest changes in supply and demand. In Handbook of financial markets: dynamics and evolution, pages 57–160. Elsevier, 2009.
  6. Hanna Hultin, Henrik Hult, Alexandre Proutiere, Samuel Samama, and Ala Tarighati. A generative model of a limit order book using recurrent neural networks. Quantitative Finance, 23(6):931–958, 2023.
  7. Andrea Coletta, Matteo Prata, Michele Conti, Emanuele Mercanti, Novella Bartolini, Aymeric Moulin, Svitlana Vyetrenko, and Tucker Balch. Towards realistic market simulations: a generative adversarial networks approach. In Proceedings of the Second ACM International Conference on AI in Finance, pages 1–9, 2021.
  8. Andrea Coletta, Joseph Jerome, Rahul Savani, and Svitlana Vyetrenko. Conditional generators for limit order book environments: Explainability, challenges, and robustness. In Proceedings of the Fourth ACM International Conference on AI in Finance, pages 27–35, 2023.
  9. Emmanuel Bacry, Iacopo Mastromatteo, and Jean-François Muzy. Hawkes processes in finance. Market Microstructure and Liquidity, 1(01):1550005, 2015.
  10. Stephen J Hardiman, Nicolas Bercot, and Jean-Philippe Bouchaud. Critical reflexivity in financial markets: a Hawkes process analysis. The European Physical Journal B, 86:1–9, 2013.
  11. Stephen J Hardiman and Jean-Philippe Bouchaud. Branching-ratio approximation for the self-exciting Hawkes process. Physical Review E, 90(6):062807, 2014.
  12. Armand Joulin, Augustin Lefevre, Daniel Grunberg, and Jean-Philippe Bouchaud. Stock price jumps: news and volume play a minor role. Wilmott Magazine, 46, 2008.
  13. Jean-Philippe Bouchaud. The endogenous dynamics of markets: Price impact, feedback loops and instabilities. Lessons from the credit crisis, pages 345–74, 2011.
  14. Antoine Fosset, Jean-Philippe Bouchaud, and Michael Benzaquen. Endogenous liquidity crises. Journal of Statistical Mechanics: Theory and Experiment, 2020(6):063401, 2020.
  15. Riccardo Marcaccioli, Jean-Philippe Bouchaud, and Michael Benzaquen. Exogenous and endogenous price jumps belong to different dynamical classes. Journal of Statistical Mechanics: Theory and Experiment, 2022(2):023403, 2022.
  16. Cecilia Aubrun, Rudy Morel, Michael Benzaquen, and Jean-Philippe Bouchaud. Riding wavelets: A method to discover new classes of price jumps. arXiv preprint arXiv:2404.16467, 2024.
  17. Aaron J. Boulton and Anne Williford. Analyzing skewed continuous outcomes with many zeros: A tutorial for social work and youth prevention science researchers. Journal of the Society for Social Work and Research, 9(4):721–740, 2018.
  18. Brian Neelon, A. James O'Malley, and Valerie A. Smith. Modeling zero-modified count and semicontinuous data in health services research part 1: background and overview. Statistics in Medicine, 35(27):5070–5093, 2016.
  19. Lei Liu, Ya-Chen Tina Shih, Robert L Strawderman, Daowen Zhang, Bankole A Johnson, and Haitao Chai. Statistical analysis of zero-inflated nonnegative continuous data. Statistical Science, 34(2):253–279, 2019.
  20. Jean-Philippe Bouchaud. Price impact. Encyclopedia of Quantitative Finance. 2010. Wiley.
  21. Kevin T Webster. Handbook of Price Impact Modeling. Chapman and Hall/CRC, 2023.
  22. Felix Patzelt and Jean-Philippe Bouchaud. Universal scaling and nonlinearity of aggregate price impact in financial markets. Physical Review E, 97(1):012304, 2018.
  23. Bence Toth, Imon Palit, Fabrizio Lillo, and J Doyne Farmer. Why is equity order flow so persistent? Journal of Economic Dynamics and Control, 51:218–239, 2015.
  24. Frédéric Bucci, Michael Benzaquen, Fabrizio Lillo, and Jean-Philippe Bouchaud. Slow decay of impact in equity markets: insights from the Ancerno database. Market Microstructure and Liquidity, 4(03n04):1950006, 2018.
  25. Jonathan Donier, Julius Bonart, Iacopo Mastromatteo, and J-P Bouchaud. A fully consistent, minimal model for non-linear market impact. Quantitative Finance, 15(7):1109–1121, 2015.

Приложение. Агрегированный импакт

Вдохновляясь работой Ф. Патцельта и одного из нас (Ж.-Ф. Б.) [22], мы количественно описываем связь между агрегированным дисбалансом исполнений и его импактом на цену для размера бина $N$. Аналогичным образом определим импакт агрегированного дисбаланса для $N$ последовательных наблюдаемых изменений цены:

\[ \mathcal{R}_N(\mathcal{I}_N) = \left\langle m_{t+i} - m_t \,\Big|\, \mathcal{I}_N = \sum_{i=0}^{N-1} V_i^{ex,a} - V_i^{ex,b} \right\rangle. \tag{13} \]

Как и в [22], запишем:

\[ \mathcal{R}_N(\mathcal{I}) = g(N) \mathcal{F}_{\alpha,\beta}\left( \frac{\mathcal{I}}{h(N)} \right), \tag{14} \]

где $g(N)$ и $h(N)$ — подходящие масштабы доходности и дисбаланса для размера бина $N$, а $\mathcal{F}_{\alpha,\beta}$ — сигмоидальная параметрическая функция

\[ \mathcal{F}_{\alpha,\beta}(x) = \frac{x}{(1 + |x|^{\alpha})^{\frac{\alpha}{\beta}}}. \tag{15} \]

После калибровки параметров уравнения (14) перемасштабированный агрегированный импакт одинаков для всех размеров бина $N$, как видно на рис. 9 и 10.

Эволюция масштабов импакта и доходности
Рисунок 9: Эволюция масштабов импакта и доходности. Начиная с $N = 20$ эволюция масштабов стабильна.
Импакт агрегированного дисбаланса на сырых данных до и после перемасштабирования
Рисунок 10: Слева: импакт агрегированного дисбаланса на сырых данных для разных размеров бина $N$ до перемасштабирования. Справа: импакт агрегированного дисбаланса на сырых данных для разных размеров бина $N$ после перемасштабирования.

Интересно отметить, что универсальность агрегированного импакта сохраняется даже для данных «изменение цены за изменением цены», хотя масштабирование доходностей и импакта больше не следует чистому степенному закону.

Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2405.10654 · Elomari-Kessab, Maitrier, Bonart, Bouchaud (École polytechnique, CFM).