Price Discovery in the Machine Learning Age
Агостино Каппони, Шихао Юй · Columbia University, Department of Industrial Engineering and Operations Research · версия от 15 марта 2024
Оригинал: Capponi, A., Yu, S. «Price Discovery in the Machine Learning Age» — shihaoyu.org/research/papers/ml-microstructure.pdf (PDF).
Перевод выполнен с сохранением структуры, формул и эмпирических результатов оригинала; рисунки описываются по тексту статьи. Для личной коллекции с указанием источника.
Аннотация
Анализ высокочастотного ценового обнаружения на быстром и фрагментированном рынке сталкивается с вызовами «больших данных». Чтобы справиться с ними, авторы интегрируют модели машинного обучения с данными сообщений книги лимитных заявок уровня 3 (level-three order book messages) с нескольких бирж. Показано, что модель градиентного бустинга регрессионных деревьев (gradient-boosted regression tree, GBRT) превосходит линейные модели в прогнозировании краткосрочных изменений цены за счёт учёта временной зависимости и взаимодействий между признаками книги лимитных заявок. В частности, расширение истории книги с одного до 25 событий повышает out-of-sample $R^2$ для GBRT с 4,34% до 6,32% — паттерн, который не наблюдается у линейных моделей. Через permutation importance (важность признаков при перестановке) авторы интерпретируют результаты прогноза моделей ML и анализируют процесс ценового обнаружения: GBRT отводит большую информационную долю признакам вершины книги (top-of-book) по сравнению с линейными моделями.
Ключевые слова: ценовое обнаружение; книга лимитных заявок; GBRT; машинное обучение; микроструктура рынка; permutation importance; level-3 данные; фрагментация рынка; высокочастотный прогноз.
1. Введение
Современная торговая среда, особенно на рынке акций США, определяется несколькими характеристиками. Во-первых, торговля крайне быстра: значительная доля сделок исполняется в субмиллисекундных интервалах (Menkveld, 2018). Во-вторых, торговля сильно фрагментирована между десятками торговых площадок — публичными биржами и тёмными пулами (O’Hara, Ye, 2011). Из-за скорости и фрагментации биржи постоянно порождают огромный объём рыночных данных. Наиболее гранулярные данные, продаваемые биржами искушённым участникам вроде высокочастотных трейдеров (HFT), — так называемые direct feeds — фиксируют каждое событие всей книги лимитных заявок: исполнения сделок, выставление лимиток, модификации и отмены.
Такая среда создаёт уникальный вызов «больших данных» для анализа ценового обнаружения. Набор полезных сигналов, которые можно построить по гранулярным рыночным данным, существенно расширился, что приводит к высокой размерности предикторов. Кроме того, сложные алгоритмические стратегии порождают нелинейные эффекты и взаимодействия между предикторами. Традиционные структурные эконометрические модели, такие как векторная авторегрессия (VAR), ограничены в способности справиться с этими проблемами.
В ответ формируется консенсус о необходимости моделей машинного обучения (ML), способных адекватно обрабатывать «большие данные», учитывать нелинейности и взаимодействия предикторов и тем самым углублять понимание процесса ценового обнаружения в современной торговле. Цель статьи двояка. Во-первых, выявить источники превосходства ML-моделей над линейными при прогнозировании краткосрочных изменений цены — в частности, их способность захватывать временные зависимости и межпризнаковые динамики. Во-вторых, интерпретировать результаты прогноза ML-моделей (часть из которых называют «чёрными ящиками») через permutation importance — модельно-агностический подход. С интерпретируемостью можно отвечать на экономические вопросы: как атрибутировать информацию по уровням книги и по биржам в процессе ценового обнаружения.
Авторы получают данные direct feeds со всех публичных бирж США. Direct feed даёт наиболее гранулярную запись всех событий книги: исполнения, новые лимитки, модификации и отмены. Датасет охватывает 30 акций — составляющих Dow Jones Industrial Average (DJI), — репрезентативный срез высоколиквидных бумаг. Выборка включает 54 торговых дня, охватывая разнообразные рыночные условия 2017–2021 годов.
На основе сообщений книги строится полная книга лимитных заявок по каждой акции, что позволяет сконструировать богатый набор высокочастотных признаков. В частности, строятся event-переменные (события книги): исполнения, новые заявки и отмены на разных ценовых уровнях. Помимо event-переменных строятся state-переменные состояния книги — например, дисбаланс глубины на различных уровнях. Наконец, используя полноту direct feeds (order-by-order, level-3), авторы включают новые признаки: длину очередей заявок и время жизни (resting time) отменённых заявок.
Для прогнозных упражнений используются несколько популярных ML-моделей: модели снижения размерности вроде elastic net, древовидные модели вроде GBRT и более продвинутые нейросети вроде long short-term memory (LSTM). При этом основная цель выходит за рамки простого сравнения эффективности: выявить причины превосходства одних моделей над другими с акцентом на интерпретируемость.
Кроме того, используется простой агностический подход к анализу важности признаков и атрибуции информации по уровням книги и по биржам. Permutation importance количественно оценивает влияние каждого признака на точность прогноза модели, измеряя падение качества, когда значения признака случайно перемешиваются и тем самым разрывается связь с целевой переменной.
Показано, что ML-модели, способные захватывать нелинейности и взаимодействия признаков, существенно превосходят остальные. Лучше всего работает древовидная модель GBRT: средний out-of-sample $R^2$ при истории книги в 25 событий составляет 6,32%. Временнó-ориентированная нейросеть LSTM следует с out-of-sample $R^2$ 3,14%. Чистая модель снижения размерности Elastic Net и обычный MLP превосходят OLS, но с заметно меньшим отрывом.
Анализ показывает, что источник превосходства ML — способность учитывать и state-зависимость, и временную зависимость признаков. Добавление state-признаков книги (например, дисбаланса глубины) к event-признакам (отмены и т.п.), то есть разрешение зависимости ценового воздействия действий в книге от её состояния, резко повышает out-of-sample $R^2$ для ML-моделей вроде GBRT: $R^2$ более чем удваивается — с 2,66% до 5,29%. Для OLS out-of-sample $R^2$ остаётся пренебрежимо малым, близким к нулю. Кроме того, включение расширенной истории событий и состояний книги существенно улучшает прогноз: переход от одного события к 25 повышает out-of-sample $R^2$ GBRT примерно на 50%.
Анализ важности признаков согласуется с классической теорией микроструктуры: ключевую роль в прогнозе краткосрочных движений цены играют top-of-book признаки — исполнения сделок, отмены и добавления на вершине книги. Примечательно, что ML-модели, особенно GBRT, отводят этим признакам больший вес, чем линейные модели. Кроме того, признаки, доступные только по level-3 сообщениям (например, время жизни отменённых заявок), существенно улучшают высокочастотный прогноз: out-of-sample $R^2$ GBRT растёт примерно на 20% при добавлении level-3 признаков к уже имеющимся level-2.
Структура статьи: Раздел 3 описывает данные и переменные; Раздел 4 — стратегию идентификации и эмпирический дизайн; Раздел 5 — результаты; Раздел 6 — заключение.
2. Обзор литературы
Работа связана с литературой по эмпирической рыночной микроструктуре. Традиционно эмпирическая микроструктура опиралась на VAR или векторные модели коррекции ошибок (VECM) для анализа и интерпретации ценового обнаружения. Эти модели обычно включают структурные функциональные формы с относительно небольшим набором признаков и фокусируются на in-sample атрибуции информационных долей. Хотя они дали ценные insights, эпоха машинного обучения ставит новые вызовы и требует пересмотра аналитических рамок.
Статья отличается от Hasbrouck (1991), Hasbrouck (1995) и поздних расширений вроде Brogaard, Hendershott, Riordan (2019) и Hagströmer, Menkveld (2023) по нескольким аспектам. Во-первых, прошлые работы используют стандартные VAR и VECM — линейные модели, которым трудно захватывать нелинейности и взаимодействия. Во-вторых, VAR/VECM различают перманентные информационные эффекты и транзиентное поведение; после обычных преобразований получают дисперсии случайного блуждания и информационные доли. В ML таких процедур нет: импульсные отклики для ML-моделей чётко не определены. В-третьих, два ключевых информационных показателя — перманентный ценовой импакт и информационная доля — по сути считаются in-sample, тогда как ML строится для out-of-sample прогноза. В-четвёртых, обычный способ определения важности признаков в ML — permutation importance или глобальные значения Шепли. Оба подхода модельно-агностичны, но зависят от целевой переменной: если цель не является истинной информационной мерой, перевести важность признаков в информационную долю трудно.
Шире работа связана с литературой по финансовому машинному обучению. ML применялся на многих рынках. Заметные вклады: Gu, Kelly, Xiu (2020) — пионеры ML в кросс-секционном asset pricing; Li, Rossi (2020) — отбор mutual funds по характеристикам underlying; Rossi, Utkus (2020) — объяснение кросс-секционной вариации эффектов robo-advising; Cong et al. (2021) — deep RL с attention для оптимального управления портфелем; Bali et al. (2020) — прогноз доходностей корпоративных облигаций; Bryzgalova, Pelger, Zhu (2019) — деревья решений для построения кросс-секций доходностей; Cao et al. (2021) — AI-аналитик, переваривающий disclosures, отраслевые тренды и макроиндикаторы. Помимо эмпирики ML помогает строить новые теории: Colliard, Foucault, Lovo (2022) моделируют «алгоритмических маркетмейкеров» через Q-learning. Kelly, Xiu (2023) дают обзор state-of-the-art финансового ML.
Большинство упомянутых работ фокусируется на прогнозе цен в кросс-секции и не учитывает временнóе измерение. В высокочастотном прогнозе движений цены временная зависимость — ключевой фактор. Вклад авторов относительно этого потока литературы — интеграция ML-моделей, подходящих для time-series эмпирической микроструктуры, выявление источников прогнозной силы и интерпретация результатов для атрибуции информационных долей.
3. Данные и переменные
3.1. Источник данных
Используются direct feeds со всех публичных бирж рынка акций США. Direct feeds — самые полные и быстрые фиды на рынке US equities; их потребляют в основном искушённые трейдеры (HFT) для маркетмейкинга или арбитража. Они содержат полные сообщения событий книги: каждое выставление, отмену и исполнение.
Выборка акций — 30 составляющих Dow Jones Index (DJI). Период — 54 торговых дня с 2017 по 2021 год: конкретно первая среда каждого месяца. На основе direct feeds пересобираются книги по каждой бирже (детали — в Приложении A). Это позволяет рассчитать серию высокочастотных признаков книги с потенциальной прогнозной силой относительно краткосрочных изменений цены. В эмпирическом анализе включены четыре maker-taker биржи (Nasdaq, NYSE, Arca, BATs) и три take-maker биржи (BX, BATSY, EDGA).
Данные собраны MayStreet (ныне часть LSEG), поставщиком SEC MIDAS. Используются фиды: BATS BZX/BYZ Multicast Pitch, CHX Book Feed, DirectEdge EDGA/EDGX EdgeBook Depth, Nasdaq BX/TotalView/PSX ITCH, NYSE MKT OpenBook Ultra, NYSE ARCA ARCABook и Trades, NYSE OpenBook Ultra и Trades, National Stock Exchange Multicast Depth of Book.
3.2. Признаки книги лимитных заявок
Из книги можно построить множество признаков. Авторы используют два основных набора: первый отражает действия в книге (events), второй — состояния книги (states).
3.2.1. Event-переменные книги
Первый набор представляет действия в книге — каждое выставление, отмену и исполнение, как в Brogaard, Hendershott, Riordan (2019). Главное отличие: в той работе используют только направление события (дамми $+1$ или $-1$). Чтобы полностью реализовать потенциал ML, авторы сохраняют исходную информацию о количестве (size), которая может быть информативной: размер сделки или добавленной ликвидности несёт полезный сигнал.
В микроструктурном анализе несколько типов заявок играют ключевую роль. Сделки могут быть marketable buy (агрессивные, давление вверх) или sell (давление вниз). Лимитки, улучшающие лучший bid или ask, сужают спред и усиливают ликвидность; отмены, ухудшающие best bid/ask, расширяют спред и вредят ликвидности. Заявки, добавляющие глубину на текущих BBO, повышают устойчивость лучшей котировки; снимающие глубину — делают BBO уязвимее к колебаниям цены. Лимитки вне BBO (non-BBO-depth) вносят вклад в общую глубину рынка; их отмена уменьшает защитный слой против крупных сделок.
Event-переменные (в порядке убывания агрессивности):
- BBO-Moving Trade — marketable buy/sell, приводящие к сделкам, сдвигающим цены BBO (например, buy, съедающий всю глубину на best ask, сдвигает best ask вверх).
- Non-BBO Moving Trade — marketable buy/sell, приводящие к сделкам без сдвига BBO.
- BBO Improving Limit — лимитки, повышающие best bid или понижающие best ask.
- BBO Worsening Cancel — отмены, понижающие best bid или повышающие best ask.
- BBO-Depth Add Limit — лимитки, добавляющие глубину на текущих best bid/ask.
- BBO-Depth Remove Cancel — отмены, снимающие глубину на текущих best bid/ask.
- Non-BBO-Depth Add Limit (within best five) — лимитки вне BBO, но в пределах пяти лучших цен.
- Non-BBO-Depth Remove Cancel (within best five) — отмены глубины вне BBO в пределах пяти лучших цен.
- Non-BBO-Depth Add Limit (beyond best five) — лимитки глубже пяти лучших цен.
- Non-BBO-Depth Remove Cancel (beyond best five) — отмены глубже пяти лучших цен.
Между признаками и их лагами возможны сложные взаимодействия, обусловленные стратегиями исполнения. Например, BBO-improving лимитка, за которой следуют исполнения, может отражать взаимодействие buy-side алгоритма исполнения и высокочастотного маркетмейкинга.
3.2.2. State-переменные книги
Второй набор характеризует состояния книги. Event- и state-переменные тесно связаны: события индуцируют изменения состояний; одно событие может менять несколько state-переменных. Например, лимитка, задающая новый best bid, меняет кумулятивную глубину на разных уровнях.
Хотя события и состояния связаны, первые не идеальный substitute для вторых. Включение состояний помогает прогнозу цены, потому что ценовой импакт одного и того же события зависит от рыночных условий. Kwan, Philip, Shkilko (2020) оценивают импакты действий в книге условно на состояниях вроде дисбаланса глубины: buy-сделка при положительном дисбалансе имеет иной импакт, чем при отрицательном.
- BBO-Depth Imbalance — разница глубины на best bid и best ask.
- Non-BBO-Depth Imbalance (within best five) — разница кумулятивной глубины в пределах пяти лучших bid и ask.
- Non-BBO-Depth Imbalance (beyond best five) — разница кумулятивной глубины на всех bid и всех ask.
3.3. Использование гранулярности level-3 данных
Данные книги дают insights с гранулярностью от Level 1 до Level 3. Level 1 — базовый уровень: лучший bid и лучший ask (вершина книги); достаточно для большинства базовых решений buy/sell, но без глубины. Level 2 расширяет Level 1: все публичные котировки маркетмейкеров и участников, количества на лучших и других уровнях; полезен для понимания глубины, ликвидности, поддержки/сопротивления; не раскрывает скрытые заявки и намерения за сегментированными крупными ордерами. Level 3 — самый детальный, в основном для маркетмейкеров: всё из Level 2 плюс возможность вводить котировки, исполнять и видеть заявки других маркетмейкеров.
Чтобы исследовать информацию level-3 сообщений, строятся два признака, доступных только по order-level данным:
- BBO Queue Length Imbalance — разница числа заявок на best bid и best ask.
- Order Cancellation Time — время жизни resting лимитки до исполнения или отмены.
Обоснование: стратегии маркетмейкинга сильно опираются на интерпретацию книги для антиципации краткосрочных движений и управления инвентарём. Длины очередей дают real-time insights о спросе и предложении; диспропорция длин на одной стороне может сигнализировать о надвигающемся сдвиге цены. Структура книги также помогает оценивать ликвидность актива — критично для исполнения крупных ордеров с минимальным импактом.
Тайминг отмен — важный индикатор настроения, динамики ликвидности и надвигающихся движений цены. Быстрые изменения rates отмен могут сигнализировать сдвиги sentiment или реакцию на новую информацию (van Kervel, 2015). Высокие rates отмен могут отражать изменения ликвидности, рост волатильности или манипулятивные практики вроде spoofing.
Для каждой биржи строятся перечисленные признаки: всего $7 \times 15 = 105$ признаков в один момент времени. При включении истории число признаков (contemporaneous плюс лаги) становится очень большим: при истории из 25 событий — до 2625 признаков. Это естественно требует снижения размерности; ML-модели хорошо подходят для этой задачи.
4. Методология
4.1. Зачем нужны модели машинного обучения
Прежде чем детально обсуждать модели, авторы мотивируют: почему ML полезен в высокочастотном прогнозе цены? Есть три характеристики, где линейные модели могут провалиться.
Первое. Ценовые импакты сделок и заявок нелинейны. Philip (2020) показывает, что перманентные импакты потоков сделок нелинейны, и линейные модели вроде VAR не захватывают это. ML естественно обрабатывает нелинейные связи.
Второе. Импакты действий в книге сильно зависят от состояний книги. Kwan, Philip, Shkilko (2020) оценивают импакты условно на состояниях вроде depth imbalance.
Третье. Последовательность действий в книге может быть предиктивной: она отражает конкретные торговые или маркетмейкерские стратегии. Пример: всплеск волатильности после паттерна агрессивных отмен на best bid вкупе с всплеском крупных скрытых sell-ордеров. Нейросеть может научиться антиципировать просадку цены, выявляя нелинейное взаимодействие этих признаков. Аналогично GBRT может обнаружить, как комбинации дисбалансов книги и прошлых объёмов сделок часто предшествуют существенному движению цены, захватывая интерактивные эффекты без явной спецификации кросс-термов.
Аргументируемо, все три аспекта можно частично учесть в линейном каркасе: нелинейные импакты — через трансформации (signed squared / signed square root объёма сделки); состояния — включением state-переменных в уравнение доходности (но они часто нестационарны и усложняют оценку); временную зависимость — через VAR (но структура VAR очень ограничительна).
4.2. Эскиз моделей машинного обучения
В каждом подразделе кратко вводится используемая модель. Более глубокое обсуждение — у Kelly, Xiu (2023). Рассматриваются линейные модели с штрафами (elastic net), древовидные (GBRT) и модели для последовательностей (LSTM). LSTM мотивирован способностью захватывать временные зависимости в sequential data — критично на высокочастотных рынках, где последовательность и тайминг событий предиктивны. LSTM особенно хорош на длинных последовательностях без vanishing gradient.
4.2.1. Линейные модели со штрафами
Линейные модели со штрафами незаменимы при overfitting и мультиколлинеарности. Elastic net сочетает $L_1$-штраф lasso с $L_2$-штрафом ridge, используя и регуляризацию correlated features (ridge), и отбор признаков (lasso, обнуление слабых коэффициентов).
Задача оптимизации elastic net:
\[ \min_{\beta}\;\frac{1}{2n}\,\lVert Y - X\beta\rVert_2^{2} \;+\; \lambda\left( \frac{1-\alpha}{2}\,\lVert\beta\rVert_2^{2} \;+\; \alpha\,\lVert\beta\rVert_1 \right) \tag{1} \]где $Y$ — вектор наблюдений, $X$ — матрица предикторов, $\beta$ — вектор коэффициентов, $n$ — число наблюдений, $\lambda$ — параметр регуляризации, $\alpha$ — mixing-параметр баланса ridge и lasso. Параметры $\lambda$ и $\alpha$ обычно выбираются кросс-валидацией. Elastic net особенно полезен при многих коррелированных предикторах или когда $p > n$.
4.2.2. Градиентный бустинг регрессионных деревьев (GBRT)
Базовая идея деревьев решений — предсказывать целевую переменную, обучаясь простым decision rules из признаков данных. Дерево строится бинарным рекурсивным разбиением: данные последовательно сплитуются по критериям. Правила обычно имеют вид if-then-else. Корневой узел задаёт вопрос и по ответу (Yes/No) ветвится; последующие узлы рекурсивно партиционируют данные, пока не сделан прогноз для каждого инстанса или не достигнуты критерии остановки. В идеале каждый лист «чист» (один класс / одно значение).
Главные преимущества деревьев — прозрачность и лёгкость интерпретации: их можно визуализировать графически, решения понятны без статистической подготовки. Но деревья склонны к overfitting при чрезмерной сложности; против этого используют pruning и ограничение максимальной глубины.
GBRT — ансамбль, комбинирующий прогнозы многих деревьев для улучшения качества. Принцип boosting: деревья добавляются последовательно, каждое новое пытается исправить ошибки текущего ансамбля. Каждое дерево обычно слабый learner (чуть лучше случайного угадывания); вместе они образуют сильный предиктор. Процесс «boosting» корректирует недостатки существующих деревьев, уделяя больше внимания плохо предсказанным наблюдениям и обостряя точность на сложных случаях.
4.2.3. Long short-term memory (LSTM)
Древовидные модели (GBRT, random forests) изначально не построены для sequential / time-series данных. LSTM, предложенный Hochreiter, Schmidhuber (1997), — продвинутый вариант RNN, эффективно захватывающий временные зависимости и решающий проблему долгосрочного удержания информации. Архитектура LSTM отличается системой gating: input, forget и output gates оркестрируют поток информации внутри ячейки.
Гейты совместно регулируют состояние memory cell, позволяя селективно сохранять или стирать информацию. Это критично для обхода vanishing gradient, подрывающего способность классических RNN учиться на далёких во времени точках. Следовательно, LSTM сохраняет контекст на длинных последовательностях — существенно для строгого time-series анализа.
В финансовом прогнозировании способность вспоминать и использовать длинную историю облегчает более точные модели. LSTM различает сложные паттерны рыночной динамики, позволяя антиципировать тренды на основе временной прогрессии переменных. Это делает LSTM ценным активом в анализе микроструктуры, где прогноз краткосрочных флуктуаций опирается на последовательность прошлых сделок и котировок. Bali et al. (2020) — одна из немногих работ, использующих LSTM для прогноза доходностей.
4.3. Оценка качества
В качестве целевых переменных используются краткосрочные midquote-доходности на горизонте следующих пяти, десяти и 25 событий. И признаки, и цели семплируются по event-clock (времени событий), а не по wall-clock. Качество измеряется out-of-sample $R^2$:
\[ R^{2}_{\mathrm{OOS}} = 1 - \frac{\sum_{i}\bigl(Y_i - \widehat{Y}_i\bigr)^{2}} {\sum_{i}\bigl(Y_i - \overline{Y}\bigr)^{2}} \tag{2} \]где $\overline{Y}$ — среднее наблюдаемых значений на out-of-sample выборке. Значение $R^{2}_{\mathrm{OOS}} > 0$ означает, что модель превосходит наивный бенчмарк (out-of-sample среднее) и полезна сверх простой оценки среднего. Заметим, что $R^{2}_{\mathrm{OOS}}$ может быть отрицательным, если fitted values произвольно плохи.
4.4. Подгонка модели
В ML процедуры train / validation / test делят данные, чтобы предотвратить overfitting и обеспечить обобщаемость: обучение — на training set, тюнинг гиперпараметров — на validation, финальная оценка — на testing (невидимых данных). Это помогает балансировать сложность модели и прогнозную силу.
Из вычислительных соображений каждый торговый день сегментируется на тринадцать получасовых интервалов. Используется inter-day rolling window: последовательные интервалы по дням для разных целей. Например, 09:30–10:00 одного дня — training, тот же интервал следующего дня — validation, ещё следующего — testing.
4.5. Тюнинг гиперпараметров
Выбор гиперпараметров критичен. Рассматриваемый диапазон:
- Elastic net: $\rho = 0{,}5$, $\alpha \in \{0{,}1,\,0{,}01,\,0{,}001,\,0{,}0001\}$.
- Boosted Regression Trees: глубина деревьев $\in \{1,\,2\}$, число деревьев $\in \{100,\,1000\}$, learning rate $\in \{0{,}01,\,0{,}1\}$.
- MLP: units $((32,16),\,(32))$.
- LSTM: units $((32,16),\,(32))$ для LSTM-слоёв и $((32,16),\,(32))$ для MLP-слоёв.
Гиперпараметры итеративно подстраиваются по качеству на validation set.
4.6. Детали реализации
Несколько ключевых выборах реализации. Во-первых, используется event clock. Event-clock или volume clock — распространённый метод семплирования в микроструктуре (Easley, López de Prado, O’Hara, 2012). Выгода: волатильность сглаживается, доходность ближе к нормальной. Идея проста: волатильность и объём идут вместе — при крупном изменении цены высока рыночная активность; семплируя по одинаковому числу shares или транзакций, получают примерно одинаковую волатильность на bucket.
GBRT реализован через LightGBM (leaf-wise рост деревьев). LSTM — через TensorFlow и Keras.
5. Результаты
5.1. Прогнозное качество моделей ML
Таблица 1 сообщает прогнозное качество разных моделей: mean squared error (MSE) на validation и test, а также $R^{2}_{\mathrm{OOS}}$. Сравниваются OLS, Elastic Net, GBRT, MLP и LSTM.
Два заметных наблюдения. Во-первых, все ML-модели превосходят простейший OLS. Например, GBRT показывает лучший out-of-sample прогноз с $R^{2}_{\mathrm{OOS}}$ около 6%, существенно выше $\approx 1{,}5\%$ у OLS. Во-вторых, внутри ML есть значительная вариация качества. GBRT и LSTM опережают Elastic Net и MLP. По сравнению с Elastic Net древовидные модели вроде GBRT допускают нелинейные импакты и взаимодействия признаков книги. LSTM существенно опережает plain-vanilla MLP — сигнал о важности временной зависимости в признаках: модели захватывают долгосрочную temporal dependence в time series признаков, которая может возникать из алгоритмических стратегий (informed traders нарезают ордера, минимизируя импакт).
| Модель | MSE-Validation | MSE-Test | $R^{2}_{\mathrm{OOS}}$ |
|---|---|---|---|
| OLS | 0,28 | 0,24 | 1,45 |
| Elastic Net | 0,28 | 0,24 | 1,61 |
| GBRT | 0,27 | 0,23 | 6,13 |
| MLP | 41,98 | 35,74 | 1,77 |
| LSTM | 41,6 | 35,16 | 3,38 |
5.2. Источники прогнозного качества ML-моделей
Далее исследуется, что даёт превосходство ML. Потенциально три источника: (1) захват нелинейных импактов событий книги; (2) захват state-зависимости действий в книге (ценовое обнаружение зависит от состояний LOB, см. Kwan, Philip, Shkilko, 2020); (3) захват временной зависимости событий (последовательность действий может отражать стратегию конкретного трейдера).
Хотя третий источник логически отделён от второго, в некоторых ML-моделях они эквивалентны по реализации. Чтобы включить историю событий, в древовидную модель добавляют лаги признаков: state-зависимость захватывается взаимодействиями event- и state-признаков; temporal dependence — взаимодействиями текущих наблюдений и их лагов.
5.2.1. Качество от state-зависимости
Чтобы отделить state-зависимость от temporal, включают только самую свежую историю — последнее событие и последнее состояние книги, исключая возможность учить temporal dependence внутри признаков или между ними.
Модель обучается на двух наборах: (i) только event-переменные; (ii) event + state. Если state-зависимость важна для краткосрочного прогноза, out-of-sample $R^2$ должен существенно вырасти при добавлении информации о состоянии книги. Таблица 2 — результаты для лучшей модели GBRT как представителя ML.
По всем уровням признаков включение state-переменных к event существенно повышает out-of-sample $R^2$. Например, при всех признаках level-3: $R^2$ только с event — 2,66%, более чем удваивается до 5,29% при добавлении state (и тем самым взаимодействий event–state). Важно: добавление state не бустит OLS в той же мере — $R^2$ остаётся близким к нулю (хотя иногда становится положительным); в ряде случаев (все level-3 признаки) качество даже ухудшается.
Вывод: ML вроде GBRT захватывает «state-dependence» — взаимодействия состояний и событий книги — и улучшает прогноз; OLS из-за своих ограничений того же не достигает.
| Модель | Уровень признаков | Только Event | Event + State |
|---|---|---|---|
| GBRT | Level1 | 2,46 | 5,29 |
| Level2 | 2,63 | 5,43 | |
| Level2-Top5 | 2,42 | 5,24 | |
| Level3 | 2,66 | 5,42 | |
| OLS | Level1 | −0,74 | 0,61 |
| Level2 | −0,74 | 0,38 | |
| Level2-Top5 | −0,73 | 0,41 | |
| Level3 | −0,85 | −1,1 |
5.2.2. Качество от временной зависимости
Второй источник — способность захватывать temporal dependence признаков. Для деревьев включают лаги: при сплитах реализуются гибкие взаимодействия между лагами одного признака или между разными признаками. Более длинная история допускает потенциально более длинную структуру зависимости.
Рисунок 1 (описан по тексту оригинала) показывает out-of-sample $R^2$ всех моделей при разной длине истории. По мере удлинения истории (больше temporal dependence событий и состояний) $R^2$ существенно растёт. При одном лаге GBRT даёт $\approx 4{,}34$; при 25 лагах — 6,32%. Рост происходит именно у GBRT — лучшей ML-модели. У OLS out-of-sample $R^2$ заметно падает при добавлении лагов.
Итог: второй источник превосходства ML — захват temporal dependence. GBRT эффективно использует богатую информацию длинной истории event- и state-переменных и улучшает прогноз.
| Модель | 1 | 2 | 5 | 10 | 25 |
|---|---|---|---|---|---|
| OLS | 2,68 | 2,65 | 2,1 | 1,45 | 0,71 |
| Elastic Net | 2,7 | 2,7 | 2,21 | 1,61 | 1,74 |
| GBRT | 4,34 | 4,77 | 5,57 | 6,13 | 6,32 |
| MLP | 2,65 | 2,09 | 2,36 | 1,77 | 1,41 |
| LSTM | 3,95 | 3,64 | 3,64 | 3,38 | 3,14 |
5.3. Анализ важности признаков
Далее результаты ML используются для ответа на ключевой вопрос микроструктуры (и финансов вообще): как происходит ценовое обнаружение? Например, при нескольких биржах, торгующих одну бумагу, какая биржа играет главную роль? Важны ли глубокие уровни и ликвидность в книге? Оправдана ли высокая стоимость самых гранулярных данных (direct feeds)?
5.3.1. Permutation importance
Для оценки значимости признака или набора признаков используется permutation importance — модельно-агностическая техника. Процесс:
- Обучить модель и оценить её по метрике (например, MSE).
- Для каждого признака (или набора) перемешать его значения по всем сэмплам.
- Важность = падение метрики качества из-за permutation; чем больше падение, тем важнее признак.
- Повторить для всех признаков/наборов и ранжировать по scores.
Преимущества: применимость к любому типу модели, простая концепция, устойчивость к корреляциям между признаками. Ограничения: вычислительная дороговизна, случайность scores, неполное покрытие сложных взаимодействий. Тем не менее метод ценен для отбора признаков и понимания поведения модели.
Пример: чтобы оценить важность Trade на NYSE, перемешивают значения этой переменной во времени, превращая её в «шум». Если MSE сильно растёт — переменная важна для высокочастотного прогноза. То же применимо к набору признаков: для важности уровня книги (best bid/ask) включают все связанные признаки (add/remove на BBO, improving-ордера) и перемешивают группу целиком.
5.3.2. Важность уровней LOB по моделям
Рисунок 2 (по тексту оригинала) показывает scores важности признаков книги для OLS, ElasticNet и GBRT: события вроде trades и cancellations на разных уровнях, с различением затрагивающих BBO и находящихся в пределах 5 уровней от BBO.
«Trade (BBO-Moving)» имеет наивысшую важность в GBRT, тогда как «Trade» без различия BBO-moving влиятельнее в OLS и ElasticNet. То есть GBRT присваивает больший вес top-of-book признакам, чем линейные модели. Относительная важность «Add (BBO)» и «Cancel (> 5Lvl)» ниже. Торговые события, особенно сдвигающие BBO, — ключевые предикторы движений цены; влияние варьируется по моделям. GBRT сильно весит BBO-moving trades, возможно благодаря захвату сложных нелинейных связей.
| Признак | OLS | ElasticNet | GBRT |
|---|---|---|---|
| Trade (BBO-Moving) | 1,89 | 1,85 | 2,27 |
| Trade | 0,88 | 1,74 | 1,10 |
| Cancel (BBO-Moving) | 0,06 | 0,19 | 0,00 |
| Add (BBO-Moving) | −0,06 | 0,00 | 0,06 |
| Cancel (BBO) | −0,06 | 0,01 | 0,00 |
| Add (BBO) | 0,13 | 0,02 | 0,07 |
| Cancel (≤ 5Lvl) | 0,15 | 0,13 | 0,01 |
| Add (≤ 5Lvl) | 0,03 | 0,04 | −0,00 |
| Cancel (> 5Lvl) | 0,01 | 0,03 | 0,00 |
| Add (> 5Lvl) | 0,02 | 0,01 | 0,11 |
5.3.3. Важность уровней LOB по информационным горизонтам
Рисунок 3 показывает scores важности по горизонтам 1, 2, 5, 10 и 25 событий (лучшая модель — GBRT). «Trade» и «Trade (BBO-Moving)» значимы на всех горизонтах, пик влияния — около 10 событий. «Cancel (≤ 5Lvl)» заметно пикирует на горизонте 5 событий — временной sweet spot предиктивности. На длинном горизонте (25) scores в целом падают, кроме Trade-признаков, сохраняющих более высокие значения: торговая активность, особенно влияющая на BBO, — стабильный предиктор во времени. Отмены и добавления дальше от BBO менее важны: модель приоритизирует события ближе к цене исполнения. Релевантность разных событий книги для прогноза цены меняется с длиной учитываемой истории.
| Признак | 1 | 2 | 5 | 10 | 25 |
|---|---|---|---|---|---|
| Trade (BBO-Moving) | 0,69 | 2,26 | 2,11 | 2,20 | 0,59 |
| Trade | 0,91 | 1,95 | 2,19 | 2,39 | 0,90 |
| Cancel (BBO-Moving) | 0,03 | 0,08 | 0,05 | 0,09 | 0,07 |
| Add (BBO-Moving) | 0,00 | −0,00 | 0,00 | 0,00 | 0,00 |
| Cancel (BBO) | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 |
| Add (BBO) | 0,04 | 0,13 | 0,11 | 0,17 | 0,02 |
| Cancel (≤ 5Lvl) | −0,02 | 0,22 | 0,52 | 0,09 | 0,01 |
| Add (≤ 5Lvl) | 0,00 | 0,00 | −0,00 | −0,00 | 0,00 |
| Cancel (> 5Lvl) | 0,00 | 0,02 | −0,01 | −0,04 | 0,00 |
| Add (> 5Lvl) | 0,00 | 0,01 | 0,00 | −0,00 | 0,00 |
5.3.4. Гранулярная важность переменных
Рисунок 4 показывает scores по признакам и биржам. «Trade» на NYSE имеет наивысший score — сильный предиктор краткосрочной цены. «Trade (BBO-Moving)» значим на многих биржах, особенно на INET (NASDAQ) и BATS. Общий тренд: торговая активность, особенно BBO-moving trades, — жизненно важный индикатор будущих изменений цены на разных площадках. Признаки отмен и добавлений, особенно глубже топ-5 уровней, несут меньшую прогнозную силу.
| Признак | INET | NYSE | ARCA | BATS | EDGX | BX | BATSY | EDGA |
|---|---|---|---|---|---|---|---|---|
| Trade (BBO-Moving) | 0,70 | 0,46 | 0,36 | 0,60 | 0,22 | 0,00 | 0,00 | 0,00 |
| Trade | 0,44 | 1,14 | 0,15 | 0,03 | 0,21 | 0,00 | 0,00 | 0,00 |
| Cancel (BBO-Moving) | 0,00 | 0,01 | 0,00 | 0,01 | −0,00 | 0,00 | 0,01 | 0,00 |
| Add (BBO-Moving) | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | −0,00 |
| Cancel (BBO) | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 |
| Add (BBO) | 0,11 | 0,02 | 0,11 | 0,00 | 0,00 | −0,02 | 0,00 | 0,00 |
| Cancel (≤ 5Lvl) | 0,05 | 0,00 | 0,00 | 0,00 | −0,02 | 0,00 | 0,00 | −0,01 |
| Add (≤ 5Lvl) | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | −0,00 | 0,00 |
| Cancel (> 5Lvl) | 0,00 | 0,00 | −0,00 | 0,15 | 0,00 | −0,00 | 0,00 | −0,03 |
| Add (> 5Lvl) | 0,00 | 0,00 | 0,00 | 0,00 | 0,00 | −0,01 | −0,00 | −0,03 |
6. Заключение
В статье показано, что модели машинного обучения достигают существенно лучшего качества, чем традиционные эконометрические модели, при прогнозировании краткосрочных движений цены на быстром и фрагментированном рынке с вызовами «больших данных». Среди них Gradient Boosted Regression Tree (GBRT) имеет наивысший out-of-sample $R^2$ 6,32% при tick-by-tick признаках, построенных по level-three сообщениям книги, на выборке высоколиквидных акций США.
Далее показано, что превосходство ML проистекает из способности захватывать временную зависимость и взаимодействия между признаками. Включение исторической информации книги критично: GBRT существенно выигрывает от более длинных информационных горизонтов. Наконец, через permutation importance интерпретируются результаты прогноза: top-of-book признаки — исполнения сделок и обновления заявок — самые влиятельные предикторы краткосрочных движений цены, причём GBRT присваивает им больший вес, чем линейные модели.
Приложение A. Построение книг из данных direct feeds
INET, BX, PSX. Trade-сообщения по display и hidden ордерам включают цену и количество; у hidden отсутствует side. Hidden обозначаются order_id = "0" и флагом "h". Аукционные сообщения ("SOX"/"SCX") неполны. Modification-сообщения back-fill’ятся из исходных add.
NYSE. Аналогичная обработка display-trades, как у INET/BX/PSX; у hidden нет ни side, ни order_id (флаг "h"). Аукционные сделки с пропусками: "SOX"/"SCX" для одиночных, "n"/"hn" для множественных. Modifications требуют заполнения из add.
NYSE Arca. Display trades полны; ISO — флаг "s". Hidden trades включают side, но без order_id. Аукционы — "nSO"/"nSC". Modifications без цены и side — fill-in из add.
BATS, BATSY. Display trades — стандартная модель; hidden получают новый order_id с окончанием "?". Аукционы — "nSO"/"nSC".
IEX и AMEX. Эти биржи предоставляют quote-сообщения, а не trade-сообщения.
Литература
- Bali, T. G., Goyal, A., Huang, D., Jiang, F., and Wen, Q. (2020). Predicting Corporate Bond Returns: Merton Meets Machine Learning. SSRN.
- Brogaard, J., Hendershott, T., and Riordan, R. (2019). Price Discovery without Trading: Evidence from Limit Orders. The Journal of Finance, 74(4):1621–1658.
- Bryzgalova, S., Pelger, M., and Zhu, J. (2019). Forest Through the Trees: Building Cross-Sections of Stock Returns. SSRN.
- Cao, S., Jiang, W., Wang, J. L., and Yang, B. (2021). From Man vs. Machine to Man Machine: The Art and AI of Stock Analyses. SSRN.
- Colliard, J.-E., Foucault, T., and Lovo, S. (2022). Algorithmic Pricing and Liquidity in Securities Markets. SSRN Electronic Journal.
- Cong, L. W., Tang, K., Wang, J., and Zhang, Y. (2021). AlphaPortfolio: Direct Construction Through Deep Reinforcement Learning and Interpretable AI. SSRN.
- Easley, D., López de Prado, M. M., and O’Hara, M. (2012). Flow Toxicity and Liquidity in a High-frequency World. Review of Financial Studies, 25(5):1457–1493.
- Eun, C. S. and Sabherwal, S. (2003). Cross-Border Listings and Price Discovery: Evidence from U.S.-Listed Canadian Stocks. The Journal of Finance, 58(2):549–575.
- Gu, S., Kelly, B., and Xiu, D. (2020). Empirical Asset Pricing via Machine Learning. The Review of Financial Studies, 33(5):2223–2273.
- Hagströmer, B. and Menkveld, A. J. (2023). Trades, Quotes, and Information Shares. SSRN.
- Harris, F. H. DeB., McInish, T. H., and Wood, R. A. (2002). Security Price Adjustment across Exchanges. Journal of Financial Markets, 5(3):277–308.
- Hasbrouck, J. (1991). Measuring the Information Content of Stock Trades. The Journal of Finance, 46(1):179–207.
- Hasbrouck, J. (1995). One Security, Many Markets: Determining the Contributions to Price Discovery. The Journal of Finance, 50(4):1175–1199.
- Hasbrouck, J. (2003). Intraday Price Formation in U.S. Equity Index Markets. The Journal of Finance, 58(6):2375–2400.
- Hendershott, T. and Jones, C. M. (2005). Island Goes Dark: Transparency, Fragmentation, and Regulation. Review of Financial Studies, 18(3):743–793.
- Hochreiter, S. and Schmidhuber, J. (1997). Long Short-Term Memory. Neural Computation, 9(8):1735–1780.
- Kelly, B. T. and Xiu, D. (2023). Financial Machine Learning. SSRN.
- Kwan, A., Philip, R., and Shkilko, A. (2020). The Conduits of Price Discovery: A Machine Learning Approach. SSRN.
- Li, B. and Rossi, A. G. (2020). Selecting Mutual Funds from the Stocks They Hold: A Machine Learning Approach. SSRN.
- Menkveld, A. J. (2018). High-Frequency Trading as Viewed through an Electron Microscope. Financial Analysts Journal, 74(2):24–31.
- O’Hara, M. and Ye, M. (2011). Is Market Fragmentation Harming Market Quality? Journal of Financial Economics, 100(3):459–474.
- Philip, R. (2020). Estimating Permanent Price Impact via Machine Learning. Journal of Econometrics, 215(2):414–449.
- Putniņš, T. J. (2013). What Do Price Discovery Metrics Really Measure? Journal of Empirical Finance, 23:68–83.
- Rossi, A. G. and Utkus, S. P. (2020). Who Benefits from Robo-advising? Evidence from Machine Learning. SSRN.
- van Kervel, V. (2015). Competition for Order Flow with Fast and Slow Traders. The Review of Financial Studies, 28(7):2094–2127.
Перевод выполнен с сохранением структуры, формул и эмпирических таблиц оригинала. Оригинал: Capponi, Yu · shihaoyu.org/research/papers/ml-microstructure.pdf · Price Discovery in the Machine Learning Age (март 2024).