Микроструктура / LOB: развёрнутые саммари (75 позиций)
Пометки: 💻 — репозиторий с кодом · 🧮 — статья с моделью или формулами.
Сначала практика: разборы с кодом
- ⭐ JAX-LOB: GPU-симулятор стакана 🧮💻
- ⭐ HLOB — Information Persistence and Structure in Limit Order Books 🧮💻
- ⭐ LOBFrame — открытый пайплайн обработки данных стакана 💻
- ⭐ TLOB — трансформер с двойным вниманием 💻🧮
- ⭐ ML-HFT: пайплайн сигналов из стакана L2 💻
- ⭐ Label Unbalance in High-Frequency Trading 💻🧮
- ⭐ Probability of Informed Trading (PIN) 💻🧮
1. Модели стакана и симуляторы
⭐ Bridging the Reality Gap in Limit Order Book Simulation 🧮
arXiv:2603.24137 · Noble, Rosenbaum, Souilmi, 2026
Практичный интерактивный симулятор стакана для large-tick активов, спроектированный так, чтобы давать реалистичные исполнение, издержки и P&L. Состояние книги проецируется на компактное представление из спреда и объёмного дисбаланса — это делает оценку по рыночным данным устойчивой.
Два содержательных наблюдения. Первое: тайминг событий калиброван так, чтобы воспроизводить тонкую временную структуру реального рынка, и при этом обнаруживается выраженная мода на времени round-trip до биржи — след одновременных реакций и латентных гонок между участниками. Второе: добавлен механизм обратной связи, накапливающий знаковый поток сделок через степенное ядро затухания, что воспроизводит и вогнутый импакт во время исполнения, и частичный возврат цены после.
По нескольким акциям и кейсам стратегий симулятор даёт поведение, при котором прибыльность резко чувствительна к параметрам исполнения. Авторы формулируют подход как рецепт: project → estimate → validate → adapt.
Кому полезно: если нужен симулятор, в котором стратегия не выглядит прибыльной по ошибке, — это самый прямой рецепт в подборке.
⭐ JAX-LOB: GPU-симулятор стакана 🧮💻
Полный перевод на русский · оригинал: arXiv:2308.13289 · GitHub: KangOxford/AlphaTrade
Первый симулятор лимитного стакана на GPU, рассчитанный на параллельную обработку тысяч книг с заметно сниженным временем на сообщение. Мотивация: и калибровка агентных моделей, и обучение RL-агентов требуют прогонять множество книг одновременно. Реализация на JAX; проектные решения нацелены на максимальное использование JAX без потери реалистичности механик стакана. Интегрирован с другими JAX-пакетами — показан пример решения задачи оптимального исполнения через RL и приведены предварительные результаты end-to-end обучения на GPU.
⭐ Multidimensional Deep Queue-Reactive (MDQR) 🧮
Полный перевод на русский · оригинал: arXiv:2501.08822 · 2025
Queue-Reactive модель Huang et al. (2015) стала стандартом моделирования стакана. MDQR расширяет её тремя способами: снимает предположение о независимости очередей, обогащает пространство состояний рыночными признаками и моделирует распределение размеров заявок. Нейросетевая архитектура выучивает сложные зависимости между уровнями цен и адаптируется к смене условий, сохраняя интерпретируемую основу на точечных процессах.
На данных фьючерса на Bund показано, что MDQR воспроизводит закон квадратного корня для рыночного воздействия, кросс-корреляции очередей и реалистичные паттерны размеров заявок; особенно силён в воспроизведении условных и стационарных распределений размеров. При этом сохраняется вычислительная эффективность, достаточная для разработки стратегий через RL и реалистичного бэктеста.
⭐ Compound Hawkes Process с размером заявки 🧮
Полный перевод на русский · оригинал: arXiv:2312.08927 · 2024
Процессы Хоукса применялись к стакану многократно, но фокус был на межсобытийных интервалах, а размер заявки обычно считался константой. Здесь предложен составной процесс Хоукса, где каждое событие получает размер из откалиброванного распределения. Процесс сформулирован так, что спред всегда остаётся положительным. Параметры условны на времени дня — под эмпирические наблюдения. Ядра Хоукса калибруются усиленным непараметрическим методом, допускаются ингибирующие кросс-возбуждающие ядра. Показано качество подгонки на акции NASDAQ против нескольких бейзлайнов; в исследовании рыночного воздействия симулятор воспроизводит эмпирически наблюдаемую вогнутую функцию импакта.
⭐ Event-driven LOB на Neural Hawkes 🧮
arXiv:2502.17417 · 2025
Событийная модель стакана, охватывающая двенадцать наиболее частых типов событий на биржевых рынках. Вместо традиционного процесса Хоукса используется Neural Hawkes: динамические отношения между типами событий, включая их долго- и краткосрочные взаимодействия, моделируются LSTM-сетью. На этой основе строится процесс mid-price, воспроизводящий событийное поведение стакана.
Эмпирика показывает, что модель улавливает широкие характеристики ценовых колебаний, особенно общий уровень волатильности. Симулятор применён внутри DRL-фреймворка маркетмейкинга: агент получает исполнения, близкие к реальным, и распределение исполнений сходится с тем, что наблюдается на реальных данных.
⭐ Estimation of an Order Book Dependent Hawkes Process for Large Datasets 🧮
arXiv:2307.09077 · Mucciante, Sancetta, 2023
Точечный процесс, где интенсивность — произведение процесса Хоукса и высокоразмерных функций от ковариат, извлечённых из стакана. Сформулированы условия стационарности. Основной вклад инженерный: алгоритм оценки модели даже при миллиардах точек данных, с возможным отображением ковариат в высокоразмерное пространство. Доказана сходимость алгоритма, установлена состоятельность при слабых условиях, предложена тестовая статистика для сравнения спецификаций вне выборки. Применение — четыре акции NYSE; тест вне выборки показывает, что учёт нелинейности информации стакана добавляет ценность сверх самовозбуждающейся природы HFT-событий.
⭐ Semi-Markov и Hawkes jump-diffusion для исполнения 🧮
arXiv:2409.12776 · 2024
Модель ценообразования со скачками и диффузией, специально под алго- и высокочастотную торговлю: независимые скачковый и диффузионный процессы дают более точное представление динамики стакана в рамках скейлинг-предела. Мотивация — накопленные свидетельства немарковских свойств данных стакана. Решаются задачи набора и ликвидации позиции при более общих составных полумарковских и Хоукс-моделях: сначала строятся jump-diffusion каркасы, затем к скачковым компонентам применяются диффузионные аппроксимации, чтобы получить устойчивые решения. Оптимальные стратегии формулируются через стохастическое оптимальное управление и решаются численно; приведены симуляции траекторий цены, эволюции инвентаря, скорости торговли и средних цен исполнения.
Смежная работа того же круга — SSRN 4956752, торговые алгоритмы, воспроизводящие данные стакана на полумарковских и Хоукс-моделях.
⭐ An Algebraic Framework for the Modeling of Limit Order Books 🧮
arXiv:2406.04969 · Bleher & Bleher, 2024
Алгебраический каркас из физики и стохастических процессов: рождение и уничтожение заявок, матчинг, эволюция состояния книги. Допускает композиционные постановки — взаимодействие разнородных трейдеров и разные структуры рынка. Пространство состояний и динамика описываются нотацией Дирака и обобщёнными производящими функциями. Показаны симуляции упрощённых сценариев: как изменение поведения трейдеров влияет на спред, волатильность доходности и ликвидность. Алгебраическое представление допускает точные симуляции алгоритмом Гиллеспи — то есть инструмент для оценки последствий изменений дизайна рынка и регулирования.
⭐ Revisiting Mean-field Theory of the Santa Fe Model 🧮
полный перевод на русский · оригинал: arXiv:2510.01814 · Wakatsuki, Kanazawa (Kyoto University), 2025
Модель Санта-Фе — эконофизический стандарт описания стохастической динамики стакана в подходе zero-intelligence. Её основание изучалось Смитом и соавторами (Quantitative Finance, 2003) через размерный анализ и mean-field теорию, но аргументы там эвристические, а решения уравнений явно не получены.
Здесь модель пересматривается с позиций кинетической теории: изучается точное master equation, систематически выводится иерархия ББГКИ (Боголюбов–Борн–Грин–Кирквуд–Ивон), применением mean-field приближения получается уравнение для профиля плотности стакана — аналог уравнения Больцмана. Получены явные замкнутые выражения для mean-field решений. Три следствия: (1) формулы скейлинга работают в асимптотиках μ→0 и μ→∞ (μ — интенсивность подачи рыночных заявок), причём при малых μ теория работает очень хорошо, при больших частично; (2) «метод изображений» Бушо–Мезара–Поттерса (2002) получается как предел больших μ, что даёт математическое основание их эвристике; (3) найдена ошибка в работе Смита и соавторов 2003 года в законе скейлинга для константы диффузии — из-за неверной спецификации в размерном анализе.
⭐ TradeFM: генеративная foundation-модель потока сделок 🧮
arXiv:2602.23784 · Kawawa-Beaudan, Sood, Papasotiriou, Borrajo, Veloso (J.P. Morgan AI Research), 2026
Генеративный трансформер на 524 млн параметров, обученный напрямую на миллиардах торговых событий по более чем 9000 акций. Для кросс-активного обобщения разработаны масштабно-инвариантные признаки и универсальная схема токенизации, отображающие разнородный мультимодальный поток событий в единую дискретную последовательность — это устраняет необходимость калибровки под конкретный актив.
В связке с детерминированным симулятором рынка роллауты TradeFM воспроизводят ключевые стилизованные факты доходностей: тяжёлые хвосты, кластеризацию волатильности, отсутствие автокорреляции доходностей. Количественно: в 2–3 раза ниже дистрибуционная ошибка, чем у бейзлайнов на составных процессах Хоукса, и zero-shot обобщение на географически внераспределённые рынки APAC с умеренной деградацией перплексии. Открывает путь к генерации синтетических данных, стресс-тестированию и обучению торговых агентов.
⭐ Модели генерации стакана: бенчмарк и диффузия 🧮
LOB-Bench — arXiv:2502.09172, 2025. Python-бенчмарк оценки качества и реалистичности генеративных message-by-order данных в формате LOBSTER. Измеряет дистрибуционные различия условных и безусловных статистик между сгенерированными и реальными данными; включает привычные метрики (спред, объёмы, дисбаланс, интервалы между сообщениями), оценки обученного дискриминатора и «метрики рыночного воздействия» — кросс-корреляции и функции ценового отклика на конкретные события. При сравнении авторегрессионных state-space моделей, (C)GAN и параметрической модели стакана авторегрессионный GenAI-подход побеждает традиционные классы моделей.
Диффузия с inpainting — полный перевод на русский · оригинал: arXiv:2509.05107, 2025. Данные стакана переводятся в структурированный формат изображения, будущие состояния генерируются диффузионной моделью с inpainting. Это использует пространственно-временные индуктивные смещения книги и позволяет генерировать длинные последовательности параллельно, обходя накопление ошибки, свойственное авторегрессии. Метод достигает state-of-the-art на LOB-Bench несмотря на вход более низкой точности (Level-2 вместо Level-3), и приоритизирует связную глобальную структуру над локальной детализацией.
Прочие модели стакана
- DTRW: аномальная диффузия и price impact в lit стакане — полный перевод на русский · оригинал: arXiv:2310.06079: reaction-diffusion fluid limit с Sibuya waiting times, flash-лимитки и market orders, kinks от дискретизации, non-uniform sampling (Diana, Gebbie, UCT, 2023/2025). Связано с двумя связанными стаканами.
- Passive Market Impact: точечные процессы — полный перевод на русский · arXiv:2412.07461: Hawkes-пропагатор с весом κ(q), queue-reactive LOB и scaling limits пассивного impact limit orders (Ouazzani Chahdi, Rosenbaum, Szymanski, 2026).
- Модель разреженных стаканов на рынке электроэнергии — arXiv:2410.06839: неоднородный пуассоновский процесс поступления и отмены заявок для неликвидного европейского внутридневного рынка.
- Neural HMM с вниманием адаптивной гранулярности для моделирования высокочастотного потока заявок — RePEc, апрель 2026.
- Моментный нейронный метод оценки процессов Хоукса для микроструктуры крипторынков; нейросети решают соответствующие уравнения в частных производных — полный перевод на русский · оригинал: arXiv:2401.09361.
- Прогноз длительностей между событиями самовозбуждающимся точечным процессом с гибкой спецификацией остатков — arXiv:2604.00346.
- Эффект Эппса в двух связанных стаканах — Ангстманн и Гебби выводят, как возникает межактивная корреляция: arXiv:2408.03181 и более поздняя arXiv:2606.14182.
- Стилизованные факты и микроструктура фьючерсов на немецкие облигации, с метриками оценки рыночных симуляторов — arXiv:2401.10722.
- Мультиагентная RL-симуляция крипторынка по 153 монетам Binance 2018–2022 — arXiv:2402.10803.
- Тред на r/quant о моделировании микроструктурного шума процессами Хоукса — Reddit.
2. Вероятность исполнения и позиция в очереди
Это, пожалуй, самая практически ценная подгруппа раздела: четыре независимые работы с разными методами, сходящиеся на одной задаче.
⭐ Deep Attentive Survival Analysis in Limit Order Books 🧮
полный перевод на русский · оригинал: arXiv:2306.05479 · Arroyo, Cartea, Moreno-Pino, Zohren · Quantitative Finance 24, 35–57
Ключевое решение в стратегии исполнения — выбор между пассивной (предоставляющей ликвидность) и агрессивной (забирающей) заявкой. Центральная величина для этого выбора — вероятность исполнения лимитной заявки.
Метод: глубокое обучение для оценки времён исполнения заявок, размещённых на разных уровнях книги. Новая модель анализа выживаемости отображает изменяющиеся во времени признаки стакана в распределение времён исполнения; архитектура — свёрточно-трансформерный энкодер и монотонный нейросетевой декодер (монотонность нужна, чтобы функция выживания была корректной). Сравнение с другими подходами анализа выживаемости через proper scoring rules; проведён анализ интерпретируемости — какие признаки реально информативны для вероятности исполнения. Метод значимо превосходит стандартные подходы. В конце — статистический анализ вероятности исполнения заявок внутри спреда для активов с разной динамикой очередей и активностью.
⭐ Understanding Fill Probability in HFT Algorithms 🧮
полный перевод на русский · оригинал: arXiv:2307.04863 · 2023
Работа с сильным практическим уклоном. На качественных высокочастотных данных и наборе микроструктурных признаков показана сильная зависимость функции вероятности исполнения от состояния книги. Нейросеть обучается выводить эту функцию на фиксированном горизонте; архитектура намеренно простая, поскольку цель — высокочастотный контур исполнения. К функции потерь применено взвешивание, чтобы модель училась на цензурированных данных (заявки, которые так и не исполнились).
Сравнение результатов на криптовалютных CEX и на фондовых рынках позволяет разобрать различия важности признаков между small-tick криптопарами и акциями Euronext. Практическое применение показано на задаче исполнения с фиксированным горизонтом: характеризуются и решение «выставить лимитку или исполнить немедленно», и оптимальное расстояние размещения. Отдельно обсуждается важность точной оценки clean-up cost — издержки при неисполнении, — и показано, что она хорошо приближается гладкой функцией рыночных признаков. Наконец, результативность оценивается бэктестом, который избегает вставки гипотетических заявок и позволяет тестировать алгоритм размещения заявками, реалистично влияющими на процесс формирования цены.
⭐ Fill Probabilities in a Limit Order Book with State-Dependent Stochastic Order Flows 🧮
полный перевод на русский · оригинал: arXiv:2403.02572 · 2024
Аналитический подход к той же задаче. Стакан моделируется в общем зависящем от состояния стохастическом каркасе — как набор взаимодействующих систем массового обслуживания с учётом ключевых стилизованных признаков рынка. Внутри каркаса получены полуаналитические выражения для нескольких величин при зависящих от состояния потоках заявок: вероятность изменения mid-price, вероятности исполнения заявок на лучших котировках и вероятности исполнения заявок глубже в книге до того, как сдвинется противоположная лучшая котировка. Каркас расширяем на более глубокие уровни, но там вероятности исполнения обычно пренебрежимо малы. Валидация — обширные численные эксперименты на реальных данных спот-рынка FX; модель остаётся аналитически податливой и при этом даёт хорошую точность.
Смежное упоминание: перевод о новой работе про вероятности исполнения на лучших котировках.
3. Прогноз mid-price: архитектуры и код
⭐ HLOB — Information Persistence and Structure in Limit Order Books 🧮💻
arXiv:2405.18938 · Briola, Bartolucci, Aste (UCL), 2024 · код в LOBFrame · дайджест RePEc/NEP-CMP
Крупномасштабная модель глубокого обучения для прогноза изменений mid-price. Два конструктивных элемента: (i) используется информация, закодированная информационно-фильтрующей сетью — Triangulated Maximally Filtered Graph, — чтобы выявить более глубокие и нетривиальные структуры зависимостей между уровнями объёма; (ii) детерминированные проектные решения для управления сложностью системы, вдохновлённые классом гомологических свёрточных сетей.
Тест против 9 современных альтернатив на 3 реальных датасетах стакана, в каждом по 15 акций NASDAQ; систематически охарактеризованы сценарии, где HLOB выигрывает. Главный содержательный вклад — новый взгляд на пространственное распределение информации в стакане и её деградацию с ростом горизонта прогноза.
⭐ LOBFrame — открытый пайплайн обработки данных стакана 💻
GitHub: FinancialComputingUCL/LOBFrame · CC BY-NC-ND 4.0
Кодовая база к двум статьям — «Deep Limit Order Book Forecasting: A microstructural guide» (arXiv:2403.09267) и HLOB. Сильная сторона — полнота пайплайна: трансформация и обработка данных, быстрая реализация обучения/валидации/тестирования и оценка качества выходов модели через торговые симуляции.
Стадии запускаются флагом --stages: data_processing → torch_dataset_preparation (+ _backtest) → complete_homological_structures_preparation (обязательно для HLOB) → training → evaluation → backtest,post_trading_analysis. Готовые модели: deeplob, transformer, itransformer, lobtransformer, dla, cnn1, cnn2, binbtabl, binctabl, axiallob, hlob. Данные — LOBSTER. Каркас рассчитан на добавление новых моделей; в репозитории есть отдельный simulator/ с market_sim.py, trading_agent.py и post_trading_analysis.py.
Кому полезно: редкий случай, когда бенчмарк архитектур на стакане идёт вместе с торговой симуляцией, а не останавливается на F1.
⭐ TLOB — трансформер с двойным вниманием 💻🧮
GitHub: LeonardoBerti00/TLOB · arXiv:2502.15757 · Berti, Kasneci, 2025
Несколько результатов, которые стоит выделить отдельно.
Во-первых, простая MLP-архитектура, адаптированная к стакану, превосходит SoTA — что ставит под вопрос необходимость сложных архитектур. Во-вторых, сам TLOB — трансформер с двойным вниманием, улавливающим пространственные и временные зависимости; он адаптивно фокусируется на микроструктуре и особенно эффективен на длинных горизонтах и в волатильных условиях. В-третьих, предложен новый метод разметки, устраняющий horizon bias.
Цифры: на бенчмарке FI-2010 превосходство над SoTA в среднем на 3.7 F1; на Tesla и Intel +1.3 и +7.7 F1; на свежем биткоин-датасете +1.1 F1.
Два вывода, которые важнее метрик. Предсказуемость цены акций падает со временем: −6.68 F1, что авторы связывают с ростом эффективности рынков. И: предсказуемость нужно рассматривать вместе с издержками — при определении тренда через средний спред (основную транзакционную издержку) результативность ощутимо деградирует, подчёркивая сложность превращения классификации тренда в прибыльную стратегию.
⭐ Attention-Based Reading, Highlighting, and Forecasting of the LOB 🧮
arXiv:2409.02277 · Jung, Lee (Purdue), 2024
Прогнозируется весь многоуровневый стакан — цены и объёмы по всем уровням, а не только mid-price. Мотивация показана наглядно: три снимка стакана с одинаковым mid-price могут иметь совершенно разную глубину и спред, поэтому для задач оптимального исполнения одного mid-price мало.
Основной вклад — compound multivariate embedding: в отличие от Spacetimeformer, где эмбеддинг присваивается каждой переменной отдельно, здесь эмбеддинги присваиваются каждому атрибуту (тип bid/ask, признак цена/объём, уровень, тикер) и затем комбинируются и масштабируются. Это сокращает число параметров эмбеддинг-слоя и одновременно кодирует взаимозависимости атрибутов. Плюс Time2Vec для временных меток и бинарный context-target эмбеддинг.
Отдельная деталь, полезная на практике: структурный регуляризатор, штрафующий нарушения порядковой структуры цен через ReLU-члены вида ReLU(p̂ᵃ_k − p̂ᵃ_{k+1}) и ReLU(p̂ᵇ_1 − p̂ᵃ_1), с весом 0.01. Данные: LOBSTER, 5 акций (AAPL, GOOG, INTC, MSFT, AMZN), уровень 5, шаг 5 секунд, контекст 10 минут → прогноз 2 минуты.
Результат: метод в лидерах по ошибке прогноза, но главное — structure loss в 0.2–0.6 раза меньше, чем у конкурентов, то есть заметно меньше нарушений порядковой структуры. Temporal-эмбеддинг (Informer) структуру не сохраняет вовсе.
⭐ ML-HFT: пайплайн сигналов из стакана L2 💻
GitHub: bradleyboyuyang/ML-HFT
Полный учебный пайплайн на тиковых данных глубины по фьючерсу SGX FTSE China A50. Сигналы из стакана: Depth Ratio, Rise Ratio, Order Book Imbalance (OBI), в простом и взвешенном по уровням вариантах. Модели: RandomForest, ExtraTrees, AdaBoost, GradientBoosting, SVM, softmax, KNN, MLP, LSTM. Гиперпараметры показательны для жанра: окно обучения 30 минут, окно теста 10 секунд, метка на 15 минут вперёд. Есть кросс-валидация, визуализация точности по дням и P&L.
В README отдельный раздел «что улучшить» — фактически список идей для фич: volume imbalance, trade imbalance, технические индикаторы по bid/ask рядам, WAP/WPR, VWAP/TWAP, разные веса по уровням стакана, скользящие средние сигналов, отбор через Lasso и генетическое программирование.
Прочие репозитории и работы по прогнозу
- DeepLOB — zcakhaa/DeepLOB, Jupyter-ноутбук с глубокой свёрточной сетью на датасете FI2010; каноническая базовая реализация.
- Axial-LOB — LeonardoBerti07/Axial-LOB, PyTorch-реализация осевого внимания для HFT.
- lob-deep-learning — Jeonghwan-Cheon/lob-deep-learning, сравнение архитектур глубокого обучения на данных стакана.
- HSBC Order Book Project — mlwynne24, студенческий проект с AI-командой HSBC: прибыльная стратегия на ML по данным L2.
- T-KAN для прогноза стакана в HFT — полный перевод на русский · оригинал: arXiv:2601.02310: +19.1% по F1, 132% доходности на бэктесте.
- Многоуровневый прогноз стакана seq2seq — та же работа Purdue, см. выше.
- Прогноз цен фьючерсов графовыми нейросетями на китайском рынке — полный перевод на русский · оригинал: arXiv:2303.16532.
- Informer в автоматических стратегиях на биткоине — arXiv:2503.18096; часть моделей лучше работает на высокочастотных данных.
- GBRT для моделирования стакана — перевод.
⭐ Label Unbalance in High-Frequency Trading 💻🧮
полный перевод на русский · GitHub: RS2002/Label-Unbalance-in-High-Frequency-Trading · arXiv:2503.09988 · 2025
Небольшая, но прицельная работа про проблему, с которой сталкивается каждый, кто размечает HFT-данные: класс «без движения» доминирует. Четыре бэкбона на выбор — MLP, LSTM, BERT, Mamba. Два способа борьбы с дисбалансом: ресемплинг (--data_balance случайно удаляет 7/8 данных класса «0») и взвешивание классов в функции потерь (--class_weight). Исходные данные не выложены из-за копирайта, но приведены структура данных и распределение классов, так что dataset.py заменяется на свой.
4. Дисбаланс стакана и order flow как сигнал
- Essential Factors from Order Flow Data — arXiv:2308.08135: извлечение ключевых факторов из высокочастотного потока заявок для прогноза движения акций и улучшения исполнения.
5. Данные, восстановление стакана, инструменты
⭐ Probability of Informed Trading (PIN) 💻🧮
GitHub: shuangology/Probability-of-Informed-Trading
Реализация PIN на дневных публичных данных A-Share (обычно PIN считают по внутридневным данным — здесь обходятся тем, что доступно из Wind: суммы покупок/продаж по типам инвесторов, сегментированным по объёму сделки от 40 тыс. до 1 млн CNY).
Формула прямо в README:
PIN = α·μ / (α·μ + ε_B + ε_S)
где α — вероятность информационного события, δ — вероятность того, что новость плохая, μ — дневная интенсивность заявок информированных трейдеров, ε_B и ε_S — интенсивности покупок и продаж неинформированных.
Реализованы два метода оценки параметров: Easley–Hvidkjaer–O'Hara (2010) и совместная функция правдоподобия Lin & Ke (2011) — вторая нужна, чтобы обойти переполнение с плавающей точкой при MLE. Опирается на улучшенный метод Yan & Zhang (JBF, 2012).
Прочие инструменты
- obanalytics — phil8192/ob-analytics, R-пакет для исследования, визуализации и восстановления данных стакана.
- Оценка L3-стакана по данным L2 на Binance — OctopusTakopi/binance_l3_est: восстановление микроструктуры уровня L3 по изменениям L2 во времени.
- OrderBook Heatmap — Elenchev/order-book-heatmap, визуализация стакана и ленты по живым данным Binance WS API.
- IcedTrade — akenshaw/iced-trade, десктопное приложение для отображения потока заявок на криптоплощадках.
- dukascopy-node — Leo4815162342/dukascopy-node, загрузка исторических тиковых данных по крипте, акциям, ETF, CFD и форексу через CLI/Node.
- MTH9879 Market Microstructure Models — gjimzhou, домашние задания курса по моделям микроструктуры (Baruch); удобно как учебный материал.
- PandoraTrader — pegasusTrader/PandoraTrader, C++ платформа для высокочастотной количественной торговли.
6. Информированная торговля, воздействие, конкуренция скоростей
- Impact of HFT Front-Running on Traders — arXiv:2211.06046: высокочастотные трейдеры всегда фронтранят, а крупные трейдеры выигрывают при достаточном объёме быстрого шумового потока и неточном прогнозе HFT.
- Large Order Trading with HFT — полный перевод на русский · arXiv:2403.08202: anticipatory HFT (Small-IT, Round-Tripper) против крупного IT; смешанная рандомизация и парадокс прибыли при ускорении HFT.
- Optimal Liquidation in HFT — arXiv:2411.04616: скрытый марковский процесс для оптимальной ликвидации при неполной информации, с практичным алгоритмом аппроксимации.
- Optimal Trading with Price Impact — полный перевод на русский · arXiv:2507.17162: Gârleanu–Pedersen с multiscale стохастической волатильностью; поправки к target portfolio и tracking speed.
- Stochastic Order Flow Unwinding — полный перевод на русский · arXiv:2310.14144: разгрузка стохастического потока с минимальными издержками в central risk book внутри организации.
- Fast and Slow Optimal Trading with Exogenous Information — перевод.
- Estimating Realized Correlation in HF Data — arXiv:2310.19992: внутридневные изменения рынка в основном определяются изменением внутридневной корреляции.
- Realized local volatility surface на высокочастотных данных (пример на Tesla) — DOI.
- Stock Market Order Dynamics — DOI: во время торговой войны США–Китай 2018 стратегии оставались схожими независимо от волатильности.
- High Frequency Statistical Arbitrage — блог Jonathan Kinlay.
7. HFT-инфраструктура и низкая латентность
- C++ Design Patterns for Low-latency Applications — arXiv:2309.04259: оптимизация латентно-критичного кода в HFT-системах; результат — репозиторий Low-Latency Programming и оптимизированная стратегия.
- fmtlog — MengRao/fmtlog: быстрая библиотека логирования уровня fmtlib с наносекундной задержкой. Практичный компонент для горячего пути.
8. Крипта и децентрализованные площадки
- Anomaly Detection in Crypto Order Books — arXiv:2507.14960: сравнение статистических методов и ML; Empirical Covariance оказалась лучшей, обойдя Buy-and-Hold на 6.70%.
- Hawkes Model for Cryptocurrency Forecasting — arXiv:2312.16190: алгоритм на данных стакана с моделью непрерывной ошибки выхода.
- The Anatomy of a Decentralized Prediction Market — arXiv:2604.24366: Дюбах анализирует 30 млрд событий стакана Polymarket за 52 дня; восемь стилизованных фактов, включая longshot-премию в спреде и границы wash-трейдинга.
- Fill-Side Non-Retail Trading on Polymarket — arXiv:2605.11640: 13.36 млн событий OrderFilled, поведенческие «тиры» и микроструктурные сигнатуры неретейл-потока. Четвёртая работа в серии из четырёх.
- QuantAgent — arXiv:2509.09995: первый мультиагентный LLM-фреймворк, спроектированный под HFT (4 специализированных агента).
9. Обсуждения, новости, отраслевой контекст
- Микроструктура в работе хедж-фондов и проп-трейдинга — тред на r/quant.
- Чем реально занят квант в HFT — r/quant.
- Повседневные задачи квантов в HFT: модели строят исследователи, внедряют разработчики — r/quant.
- RL в модельной торговле по стакану — перевод.
- Диссертация по HFT и микроструктуре — перевод.
- Aquis Exchange открывает платформу для HFT — Financial News.
- Наём и зарплаты в HFT-фирмах — eFinancialCareers об исследовании выпускника Imperial College.
Что стоит прочитать первым
Если строите симулятор или бэктест: «Bridging the Reality Gap» (проекция на спред+дисбаланс, мода на round-trip латентности, степенное ядро импакта), MDQR (снятие независимости очередей + распределение размеров заявок), JAX-LOB (если нужен масштаб), LOB-Bench (как вообще измерять качество генератора).
Если нужна вероятность исполнения: три работы подряд — Arroyo/Cartea (свёрточно-трансформерный энкодер + монотонный декодер, анализ выживаемости), arXiv:2307.04863 (простая сеть, обучение на цензурированных данных, clean-up cost, честный бэктест без гипотетических заявок), arXiv:2403.02572 (полуаналитические выражения, если нужна форма, а не сеть).
Если прогнозируете mid-price: TLOB — не столько за архитектуру, сколько за два вывода: простой MLP бьёт SoTA, а предсказуемость падает со временем и почти исчезает при учёте спреда. LOBFrame — единственный каркас здесь, доводящий модель до торговой симуляции. Purdue-работа — за структурный регуляризатор, если предсказываете весь стакан.
Фундамент: пересмотр модели Санта-Фе через кинетическую теорию (плюс найденная ошибка в оригинале), алгебраический каркас с алгоритмом Гиллеспи, Order Book Dependent Hawkes для миллиардов событий.
Свежее и амбициозное: TradeFM — foundation-модель микроструктуры на 524M параметров с zero-shot переносом на другие регионы; диффузия с inpainting как альтернатива авторегрессии для генерации стакана.