RL-трейдинг: развёрнутые саммари (29 позиций)
Пометки: 💻 — репозиторий с кодом · 🧮 — статья с моделью или формулами.
Сначала практика: разборы с кодом
- 7. Hierarchical RL for Pair Trading 💻🧮
- 23. TorchTrade — модульный RL-фреймворк для трейдинга 💻
- 24. FinRL-X (бывш. FinRL-Live-Trading) 💻
- 25. FinRL-DeepSeek: LLM-инфузированный risk-sensitive RL 💻
- 26. Deep RL for Portfolio Optimization (Capital Fund Management) 💻🧮
- 27. RLtools — самая быстрая библиотека глубокого RL 💻
- 28. Deep Q-Learning Applied to Algorithmic Trading 💻
Маркетмейкинг, исполнение и микроструктура
1. Towards Multi-Agent RL driven Over-The-Counter Market Simulations 🧮
Полный перевод на русский · оригинал: arXiv:2210.07184 · Vadori, Ardon, Ganesh, Spooner, Amrouni, Vann, Xu, Zheng, Balch, Veloso (J.P. Morgan AI Research), 2022, ревизия 2023
Игра между агентами-поставщиками ликвидности (LP) и агентами-потребителями (LT) на OTC-рынке; типовой пример — FX. Ключевая конструкция: параметризованные семейства функций награды плюс shared policy learning — одна политика обучается на всё семейство целей, что резко сокращает стоимость обучения по сравнению с обучением отдельного агента под каждую цель.
Играя друг против друга, агенты вырабатывают эмерджентное поведение под широкий спектр целей: P&L, оптимальное исполнение, доля рынка. Главный содержательный результат: LP самостоятельно обучаются балансировать хеджирование и скьюинг — асимметричное выставление bid и ask как функцию текущего инвентаря. То есть классическая маркетмейкерская интуиция возникает из награды, а не закладывается руками.
Дополнительно: RL-алгоритм калибровки, который хорошо справляется с наложением ограничений на равновесие игры. Теоретическая часть — скорости сходимости для мультиагентного policy gradient при предположении транзитивности, близком к обобщённым порядковым потенциальным играм.
Кому полезно: проектирование reward для MM-агента, симуляция OTC/FX-потока, вопрос «как устроен оптимальный скью по инвентарю».
2. An Offline Learning Approach to Propagator Models 🧮
Полный перевод на русский · arXiv:2309.02994 · Neuman, Stockinger, Zhang (Imperial College London), 2023 · перевод
Offline-задача: агент оценивает неизвестное ядро ценового воздействия (propagator) по статическому датасету, а затем строит стратегию ликвидации актива с транзиентным импактом. Предложен непараметрический метод оценки пропагатора по данным, содержащим коррелированные ценовые траектории, торговые сигналы и метаордера.
Центральное наблюдение: жадная стратегия, построенная напрямую на оценённом пропагаторе, субоптимальна по двум причинам — (а) ложная корреляция между самой стратегией и оценщиком, (б) внутренняя неопределённость из-за смещённого функционала издержек. Решение в духе offline RL: пессимистичный функционал потерь, учитывающий неопределённость оценки, плюс оптимизатор, устраняющий ложную корреляцию. Получена асимптотически оптимальная оценка сверху на издержки исполнения — без точного знания истинного пропагатора.
Кому полезно: оценка impact-моделей по историческим данным без A/B-экспериментов на живом рынке; это ровно та задача, где наивный fit по своим же сделкам даёт систематическую ошибку.
3. Deep Reinforcement Learning for Active High Frequency Trading 🧮
Полный перевод на русский · оригинал: arXiv:2101.07107 · Briola, Turiel, Marcaccioli, Aste (UCL), 2021
Первый end-to-end фреймворк для обучения и деплоя DRL-агента на реальных высокочастотных данных стакана. Данные: LOBSTER, акция INTC на NASDAQ, глубина стакана 10 уровней; 60 дней на обучение (фев–апр 2019), 22 на валидацию, 20 на тест. Открытие и закрытие дня исключены (первые и последние 2·10⁵ тиков).
Алгоритм: PPO, политика — простой MLP (два скрытых слоя по 64), continual learning. Обучающая выборка формируется отбором окон с наибольшими изменениями mid-price — то есть сознательно смещена в сторону высокого отношения сигнал/шум. Гиперпараметры (learning rate, entropy coefficient) подбираются байесовской оптимизацией: GP со squared exponential ядром + Expected Improvement.
Действия: sell / stay / buy / daily_stop_loss. Агент торгует одну единицу актива — чтобы гарантированно не потреблять ликвидность глубже лучшей котировки и не моделировать собственный импакт. Вход в позицию по bid/ask (то есть спред как транзакционная издержка учтён явно).
Три варианта состояния и главный результат:
S₂₀₁— объёмы 10 уровней с обеих сторон + последние 9 тиков + текущая позиция;S₂₀₂— то же плюс mark-to-market открытой позиции;S₂₀₃— то же плюс текущий спред.
S₂₀₂ даёт P&L на порядок выше остальных и на два порядка больше сделок, чем S₂₀₁. Вывод авторов: знание нереализованного P&L позволяет агенту аккуратнее входить и выходить, при этом качество отдельной сделки не меняется — растёт число используемых возможностей. Спред (S₂₀₃) почти ничего не добавляет, что ожидаемо для large-tick акции, где он почти константа.
Кому полезно: конкретный рецепт state design для HFT-агента на стакане; вывод про mark-to-market переносится на любую RL-постановку с инвентарём.
4. Learning Not to Spoof 🧮
полный перевод на русский · arXiv:2306.06087 · ACM ICAIF'22 · David Byrd, 2022
Три эксперимента подряд. Сначала в мультиагентную симуляцию рынка внедряется захардкоженный спуфер, и на его следах обучается распознаватель последовательностей спуфинга. Затем спуфер заменяется на обычного RL-агента, максимизирующего прибыль, — и тот самостоятельно открывает спуфинг как оптимальную стратегию. Наконец, распознаватель подключается как нормативный ориентир: он формирует воспринимаемую агентом награду и меняет выбираемые действия. Агент остаётся прибыльным, но избегает спуфинга, который дал бы ещё большую прибыль.
Метод обобщается на подавление любого нежелательного поведения, для которого можно обучить распознаватель — то есть на случаи, где есть примеры нарушения, но нет программируемого определения.
Кому полезно: compliance-слой поверх RL-агента; вопрос «что мой агент выучит, если его не ограничить».
5. Gray-box Adversarial Attack of Deep RL-based Trading Agents 🧮
полный перевод на русский · arXiv:2309.14615 · Ataiefard (Calgary), Hemmati (York), 2023
Классические атаки на RL (FGSM и прочие white-box) неприменимы к трейдингу: модель спрятана за биржевым API. Здесь предложена «серая» атака — противник просто торгует на том же рынке. Ему недоступны ни код, ни архитектура, ни веса, ни алгоритм обучения жертвы; известны только текущее состояние рынка и выбранное жертвой действие (публичная информация на многих площадках).
Политика противника — CNN + полносвязные слои, обучение через A2C. Награда: R = (Balance + P − P̂)·α + |π(a|S) − π(â|Ŝ)|, то есть смесь собственного P&L и величины сдвига softmax-выхода политики жертвы; α подбирается при обучении. Среда — ABIDES, обёрнутый в OpenAI Gym; состояние включает 10 лучших бидов/асков с объёмами, баланс, позицию и RSI/CCI/MACD. Шаг — 20 мс. Жертвы: базовый actor-critic, ансамбль (PPO + A2C + DDPG) и промышленный агент индустриального партнёра.
Результаты: средняя награда жертв падает на 214% (с +0.623 до −0.711), кумулятивная доходность снижается на 64–95% в зависимости от жертвы и конфигурации рынка. При этом противник тратит существенно меньше бюджета, чем теряет жертва (в 4.3 / 2.9 / 1.7 раза меньше). Loss Hit Ratio (доля потерь жертвы от сделок напрямую с противником) — всего 10–18%: атака работает не за счёт прямой торговли, а за счёт вывода стакана в состояние, нехарактерное для обучающей выборки жертвы.
Кому полезно: оценка нижней границы устойчивости своего агента; аргумент за домены рандомизации и out-of-distribution тесты.
Optimal Execution при time-varying ликвидности (DDQL) 🧮
Полный перевод на русский · оригинал: arXiv:2402.12049 · Macrì, Lillo (SNS Pisa / University of Bologna), 2024
DDQL для оптимального исполнения в Almgren–Chriss, когда temporary и permanent impact не константы, а следуют детерминированным линейным trends или стохастическим square-root mean-reverting процессам. Агент model-agnostic: не знает ни модели, ни параметров impacts.
На 10 000 train и 5 000 test эпизодах: при постоянном impact восстанавливает TWAP (отклонение менее 0,5 bp). При time-varying trend mid-price в признаках $(q_t, t, S_{t-1})$ критичен — без него стратегия на уровне TWAP; с ним агент front-loads или back-loads торговлю в соответствии с направлением trend. Mixed train на обоих направлениях trend + test на одном — с ценой в состоянии почти оптимальные издержки и существенный выигрыш vs TWAP. В стохастическом режиме DDQL бьёт Taylor-аппроксимацию [4], особенно при слабой mean reversion impacts.
Кому полезно: когда оценка impact-параметров в реальном времени зашумлена, а нужна адаптивная стратегия ликвидации; дизайн feature set для RL-исполнения (цена в state vs только инвентарь и время).
Статистический арбитраж и парный трейдинг
6. Statistical Arbitrage with RL 🧮
полный перевод на русский · arXiv:2403.12180 · 2024
Model-free фреймворк, снимающий зависимость от модельных допущений. Две части. Построение спреда: вводится эмпирическая метрика времени возврата к среднему, коэффициенты активов подбираются минимизацией этой метрики. Торговля: RL, где пространство состояний нестандартно — оно кодирует недавние тренды в движении цены, а не только отклонение от долгосрочного среднего, как в классических mean-reversion стратегиях. Функция награды подогнана под специфику возврата к среднему.
7. Hierarchical RL for Pair Trading 💻🧮
полный перевод на русский · arXiv:2301.10724 · 2023
Претензия к существующим подходам: парный трейдинг разбивают на два независимых шага — отбор пары и торговля. Развязка мешает распространению информации: отбор без учёта торгового результата даёт пары с нерелевантной динамикой, а агент, обученный торговать выбранную пару, переобучается на неё и не видит истории остальных активов.
Решение: иерархический RL, обучающий обе подзадачи совместно. Политика верхнего уровня выбирает два актива из всех возможных комбинаций, политика нижнего уровня выполняет последовательность торговых действий. На реальных данных по акциям метод обходит и существующие методы отбора пар, и существующие торговые методы.
8. Dynamic Multi-Pair Trading in Cryptocurrency Markets with DRL 🧮
arXiv:2606.04574 · Lebiedź, Ślepaczuk, 2026 (61 стр., 37 рисунков, 16 таблиц)
DRL как надстройка над исполнением классического парного трейдинга, а не как замена стратегии. Мотивация: классика хорошо работает на акциях, но на крипте становится негибкой и подвержена риску расхождения пары.
Две авторские конструкции: иерархический отбор пар «Filter-then-Rank» и модель исполнения «Fixed Risk, Adaptive Mean». Агент — PPO с LSTM-слоем, принимающий решения об исполнении внутри жёстких детерминированных границ риск-менеджмента (deterministic shielding — вариант safe RL). Данные: часовые бары Binance USD-M Futures.
Результат: оптимизированная RL-политика существенно обходит эвристический бейзлайн out-of-sample. Проверка робастности stationary circular block bootstrap подтверждает превосходство по risk-adjusted метрикам на уровне значимости 10%, но не проходит порог 5% — авторы связывают это с экстремальной идиосинкратической дисперсией криптоактивов. Честная формулировка, редкая для этого жанра.
Кому полезно: конкретный паттерн «нейросеть внутри детерминированной оболочки риска» — так неаккуратная политика не может увести стратегию в катастрофу.
9. Hoffman on Kalman Filtering and Pairs Trading
перевод · 2024
Разбор главы книги: фильтр Калмана для динамической оценки хедж-коэффициента пары, частичная коинтеграция, связки с RL.
HFT и общий алготрейдинг
10. QTNet: Deep RL для квантового трейдинга 🧮
Полный перевод на русский · оригинал: arXiv:2312.15730 · 2023
Задача формулируется как частично наблюдаемый марковский процесс принятия решений (POMDP) — что честнее для финансовых данных, чем обычный MDP. Модель сочетает DRL с имитационным обучением: имитация традиционных торговых тактик даёт агенту разумную стартовую политику и балансирует exploration/exploitation, вместо того чтобы искать стратегию с нуля в среде с околонулевым отношением сигнал/шум. Обучение на минутных данных живого рынка. Заявлено, что модель извлекает устойчивые рыночные признаки и адаптируется к разным режимам.
11. Navigating Black Swan Events in Algorithmic Trading: A RL Perspective
перевод · октябрь 2023
Сравнение RL-стратегий на экстремальных рыночных событиях. Данные: 2000-01-01 — 2023-01-01 (Yahoo Finance), признаки — отношение цены к EMA, %B и моментум. Заявленный результат: DQN лучше всех — коэффициент Шарпа 4.75 и рост портфеля на 150%, против 0.604 у ручной стратегии и 0.112 у buy-and-hold.
Оговорка: Шарп 4.75 на дневных данных за 23 года — величина, которую стоит воспринимать как индикатор проблем с методологией (скорее всего, отбор по итогам теста), а не как результат.
12. Deep Reinforcement Trading: разделяя непредсказуемость и необучаемость 🧮
полный перевод на русский · arXiv:2104.14683 · 2021
Аккуратно поставленный методологический эксперимент. Проблема: когда DRL-трейдер работает плохо, непонятно, что виновато — непредсказуемость доходностей или необучаемость алгоритма. Авторы строят рыночную среду с известными факторами возврата к среднему, для которой существует точное решение динамического программирования, и на этом фоне измеряют, насколько разные value-based алгоритмы способны извлечь осмысленный торговый сигнал из данных.
Дополнительный результат: агенты, использующие классические стратегии как основу, получают гибкость и обходят бенчмарк, когда динамика цены специфицирована неверно и нарушаются исходные предположения о среде — при наличии экстремальных событий и кластеризации волатильности.
13. Large Language Model Agents in Financial Trading: A Survey
arXiv:2408.06361 · 2024, обновление март 2026
Обзор направления: типовые архитектуры LLM-агентов, состав входных данных, результаты на бэктестах, а также проблемы, с которыми сталкиваются такие работы. Полезно как карта области перед погружением, а не как источник конкретного метода.
14. Algorithmic Pricing and Collusion in Competitive Markets 🧮
полный перевод на русский · arXiv:2503.11270 · 2025
Изучается риск молчаливого сговора, когда RL-алгоритмы задают цены на маркетплейсах. Предыдущая литература крутилась вокруг табличного Q-learning (TQL) и дала противоречивые выводы; здесь добавлены off-policy и on-policy DRL. Постановка — варианты олигополии Бертрана.
Результаты: TQL склонен к более высокому сговору и разбросу цен, нестабилен и неравномерен (агенты с большей скоростью обучения стабильно зарабатывают больше), а его ценовая динамика сильно зависит от того, какая информация попала в представление состояния. DRL (PPO, DQN), наоборот, сходится к более низким ценам, ближе к равновесию Нэша. Когда предобученные TQL-агенты играют против DRL, последние их быстро обходят. Конкуренция между разнородными DRL-алгоритмами (PPO против DQN) дополнительно снижает вероятность сверхконкурентных цен.
⚠️ Встречающаяся формулировка «DRL лучше выявляют риск сговора» — искажение. Реальный вывод обратный: DRL сговариваются меньше, чем табличный Q-learning.
Портфельное управление
15. DRL vs Mean-Variance Optimization: развёрнутое сравнение 🧮
полный перевод на русский · arXiv:2602.17098 · 2026
Претензия к жанру: работы по DRL для портфеля обычно сравнивают себя с простыми бенчмарками или с другими DRL-агентами, но не с тем, чем реально пользуются практики. Здесь сделано подробное сравнение model-free DRL с Mean-Variance Optimization (Марковиц по историческим оценкам доходностей и ковариаций). Ценность работы во многом в инженерных деталях: что именно нужно сделать, чтобы DRL для портфеля заработал на практике, и какие поправки требуются самому MVO для честного сравнения. По бэктестам DRL-агент показывает сильные результаты по Шарпу, максимальной просадке и абсолютной доходности.
16. DRL Framework for Diversified Portfolio Management Across Global Equity Markets 🧮
полный перевод на русский · arXiv:2605.17307 · Kashif, Ślepaczuk, 2026 (67 стр.)
Soft Actor-Critic учит непрерывные веса портфеля в рамках MDP; в награду встроены транзакционные издержки, штраф за оборот и ограничения на диверсификацию. Сравниваются пять конфигураций, различающихся формулировкой награды, структурой политики (плоская против иерархической Дирихле), ограничениями на портфель и временным энкодером (LSTM против трансформера). Оценка — walk-forward по шестнадцати out-of-sample фолдам за 2003–2026 на Nasdaq-100, Nikkei 225 и Euro Stoxx 50.
Результат сформулирован непривычно честно: конкурентная risk-adjusted доходность достигается в основном на Euro Stoxx 50, где наблюдаются статистически значимые аномальные доходности, но ни одна стратегия не показывает статистически значимого превышения над Buy and Hold при HAC-робастном выводе на всех рынках сразу. Анализ режимов: RL приносит больше всего пользы в периоды повышенной неопределённости; ансамблирование по рынкам улучшает risk-adjusted показатели и подтверждает выгоду географической диверсификации.
17. CAD: кластеризация + DRL для многопериодной торговли 🧮
полный перевод на русский · arXiv:2310.01319 · 2023
Трёхуровневая схема. Кластеризация распределяет акции по группам на основе финансовых показателей. Асинхронный A3C определяет торговые действия для акций внутри каждого кластера. DDPG строит вектор весов портфеля, решая, сколько покупать, продавать или держать, исходя из действий разных кластеров. Заявка на новизну — первое сочетание кластеризации и RL для управления портфелем в многопериодной постановке.
Бэктесты на четырёх датасетах, всего 800 акций (Шанхайская биржа и NASDAQ). Средняя доходность 151% за 360 торговых периодов против лучших 124% у конкурентов (Robust Median Reversion, Passive Aggressive Median Reversion и несколько ML-методов).
18. XDRL: объяснимый DRL для управления портфелем 🧮
русский перевод · arXiv:2407.14486 · 2024
Мотивация практическая: инвестиционная политика требует объяснимости, а DRL-агент — чёрный ящик с неинтерпретируемыми параметрами, поэтому ему нельзя ни поручить следование мандату, ни объяснить его действия. Решение: PPO в связке с модельно-агностическими методами интерпретации — feature importance, SHAP и LIME, применяемыми в момент предсказания. Это позволяет проверить, соответствуют ли действия агента требованиям инвестиционной политики, и оценить риск следования его рекомендациям. Заявлено как первая post-hoc объяснимая портфельная политика DRL-агента.
19. Deep RL для распределения портфеля — Reading Group Hudson & Thames
YouTube · 2023
Разбор на семинаре: распределение портфеля как задача непрерывного управления, обзор соответствующих DRL-подходов.
Хеджирование деривативов
20. Сравнение восьми DRL-алгоритмов для динамического хеджирования 🧮
Полный перевод на русский · оригинал: arXiv:2504.05521 · 2025
Проблема жанра: большинство работ тестируют один-два алгоритма, из-за чего объективное сравнение невозможно. Здесь сопоставлены восемь: Monte Carlo Policy Gradient (MCPG), PPO, четыре варианта Deep Q-Learning и два варианта DDPG (два из них — новое применение к этой задаче). Данные симулируются моделью GJR-GARCH(1,1), бейзлайн — дельта-хедж по Блэку–Шоулзу, метрика — root semi-quadratic penalty.
Результат: лучший — MCPG, за ним PPO. При этом только MCPG обходит дельта-хедж Блэка–Шоулза в рамках выделенного вычислительного бюджета; авторы связывают это с разреженностью наград в их среде. Полезное отрезвление: «DRL бьёт классику» здесь верно ровно для одного алгоритма из восьми.
21. Hedging American Put Options with Deep Reinforcement Learning 🧮
arXiv:2405.06774 · Pickard, Wredenhagen, DeJesus, Schlener, Lawryshyn (University of Toronto, Ernst & Young), 2024
Метод — DDPG; заявлено как первые DRL-агенты, специально сделанные под хеджирование американских путов. Два круга экспериментов. Первый: обучение и тест на траекториях геометрического броуновского движения — агенты обходят дельту Блэка–Шоулза, особенно при наличии транзакционных издержек. Второй, ближе к практике: собраны 80 путов по 8 тикерам, для каждого тикера откалибрована модель стохастической волатильности, и для каждого из 80 опционов обучен свой агент на симулированных траекториях соответствующей модели.
DRL-агенты обходят дельту Блэка–Шоулза не только на данных той же откалиброванной модели, но и при хеджировании реально реализовавшейся траектории актива между датой продажи опциона и погашением. Отдельная техническая деталь: для подачи агенту цены опциона на каждом шаге используется модельно-агностическая интерполяция Чебышёва — это даёт общий каркас, легко расширяемый на более сложные процессы базового актива.
22. Solving The Dynamic Volatility Fitting Problem: A DRL Approach 🧮
arXiv:2410.11789 · Gnabeyeu, Karkar, Idboufous, 2024
Подгонка поверхности волатильности — одна из базовых задач в бизнесе акционных деривативов. Стандартный индустриальный подход задаёт степени свободы (параметризация, плотность, диффузия) набором детерминированных правил: эффективно, но по своей природе не умеет учиться на смене рыночных режимов и находить неочевидные оптимальные поведения.
Авторы меняют парадигму и решают задачу подгонки как RL-задачу с непрерывными пространствами состояний и действий. Варианты DDPG и SAC оказываются как минимум не хуже стандартных алгоритмов подгонки. Отдельно объясняется, почему RL-каркас здесь уместен: он естественно работает со сложными целевыми функциями и изначально приспособлен к онлайн-обучению.
Инструменты и репозитории
23. TorchTrade — модульный RL-фреймворк для трейдинга 💻
GitHub: TorchTrade/torchtrade · MIT · 383★ · Python, поверх TorchRL
Самый живой из инструментов в этом разделе. Алгоритмы: PPO, DQN, IQL, GRPO, DSAC, CTRL — переключаются конфигом Hydra и работают в любой среде. Наблюдения мультитаймфреймовые: 1m / 5m / 15m / 1h одновременно, с настраиваемыми окнами. Универсальный вектор состояния счёта из 6 элементов: exposure_pct, position_direction, unrealized_pnl_pct, holding_time, leverage, distance_to_liquidation.
Среды: офлайн (SequentialTradingEnv, версия с bracket-ордерами SL/TP, OneStepTradingEnv для GRPO и контекстных бандитов) и live — Alpaca, Binance, Bitget, Bybit, OKX (фьючерсы с плечом до 125x), Polymarket. Тот же код используется в бэктесте и в проде. Дополнительно: LLM-акторы (GPT-4o-mini или локальные модели) как торговая политика, rule-based акторы для имитационного обучения и бейзлайнов, эмбеддинги Chronos как трансформ, готовые OHLCV-датасеты на HuggingFace.
Ограничение на сегодня: одна бумага на среду; мультиактивные портфельные среды заявлены в планах. Проект в активной разработке, API меняется.
24. FinRL-X (бывш. FinRL-Live-Trading) 💻
Полный перевод на русский · GitHub: AI4Finance-Foundation/FinRL-Live-Trading · оригинал: arXiv:2603.21330 · Apache 2.0
Преемник оригинального FinRL, переписанный под «AI-native» архитектуру. Центральная идея — weight-centric контракт: единственный интерфейс между логикой стратегии и исполнением — вектор целевых весов портфеля, wₜ = R(T(A(S(X≤ₜ)))), где S — отбор бумаг, A — распределение, T — тайминг, R — портфельный риск-оверлей. Каждое преобразование сохраняет контракт, поэтому любой модуль (например, равные веса → DRL-аллокатор) меняется без переписывания остального, а одни и те же веса одинаково текут и в бэктесте, и в живом исполнении.
Слои: данные (FMP / Yahoo / WRDS, LLM-препроцессинг сентимента, кэш в SQLite), стратегия, бэктест (движок на bt с мультибенчмарком и издержками), исполнение (Alpaca, мультиаккаунт, предторговые риск-чеки). Три сценария из статьи: сравнение парадигм распределения (equal weight, Марковиц, min-variance, DRL-аллокатор на PPO/SAC, тайминг KAMA); квартальный отбор топ-25% NASDAQ-100 по ML-скорингу фундаменталок плюс DRL-распределение со строгим запретом заглядывания вперёд; адаптивная ротация между группами активов (Growth Tech / Real Assets / Defensive) с недельной ребалансировкой и ежедневным мониторингом риска.
Заявленные цифры: бэктест 2018–2025 — адаптивная ротация Шарп 1.10, максимальная просадка −21.5%, Кальмар 1.04 против QQQ 0.81 / −35.1% / 0.56. Бумажная торговля окт. 2025 — март 2026: +19.8% против −2.5% у SPY. К бумажной торговле на полугодовом окне стоит относиться как к иллюстрации, а не как к доказательству.
25. FinRL-DeepSeek: LLM-инфузированный risk-sensitive RL 💻
Полный перевод на русский · GitHub: benstaf/finrl_deepseek · оригинал: arXiv:2502.07393 · блог
Идея: добавить в RL-агента два сигнала, извлекаемых LLM из новостного потока, — сентимент и риск. База — датасет новостей FNSPID, отфильтрованный по Nasdaq за 2013–2023; сигналы генерируются скриптами sentiment_deepseek_deepinfra.py и risk_deepseek_deepinfra.py через DeepSeek, готовые датасеты выложены на HuggingFace.
Четыре варианта агентов со своими средами: PPO и CPPO (среда как в оригинальном FinRL), PPO-DeepSeek (env_stocktrading_llm.py) и CPPO-DeepSeek (env_stocktrading_llm_risk.py); у LLM-вариантов есть по две версии среды с разной силой влияния LLM-сигнала. Оценка на торговой фазе 2019–2023 по Information Ratio, CVaR и Rachev Ratio — то есть с акцентом на хвостовой риск, а не только на Шарп.
Предварительный вывод авторов лаконичен: бычий рынок → PPO, медвежий → CPPO-DeepSeek. Проект интегрирован в основной FinRL от AI4Finance и лёг в основу задачи 1 конкурса FinRL Contest 2025. Для запуска рекомендуется CPU-инстанс со 128 ГБ RAM.
26. Deep RL for Portfolio Optimization (Capital Fund Management) 💻🧮
Полный перевод на русский · GitHub: CFMTech/Deep-RL-for-Portfolio-Optimization · оригинал: arXiv:2003.06497
Репозиторий к статье «Deep Deterministic Portfolio Optimization» от CFM. Постановка методологически ценная: берутся три аналитически разрешимые модели издержек, для которых оптимальные или почти оптимальные решения известны из литературы, и DDPG адаптируется под каждую — чтобы проверить, восстанавливает ли RL уже известный ответ. Это правильный способ отделить «алгоритм работает» от «нам повезло с данными».
Технически: PyTorch, ноутбук summary.ipynb с полным пайплайном (среда → агент → обучение → оценка), логирование позиций, действий, значений сигнала, лоссов актора и критика в tensorboardX. Тип буфера воспроизведения переключается параметром memory_type (uniform / prioritized). Код документирован по методам и типам аргументов.
27. RLtools — самая быстрая библиотека глубокого RL 💻
Полный перевод на русский · GitHub: rl-tools/rl-tools · оригинал: arXiv:2306.03530 · JMLR 25(301), 2024 · Eschmann, Albani, Loianno
Не финансовая библиотека, но попала в раздел заслуженно: это header-only C++17 без зависимостей, с упором на скорость и портируемость. Алгоритмы: TD3, PPO, multi-agent PPO, SAC. Порядок величин — обучение маятника за секунды на MacBook Pro M1, квадрокоптер «learning to fly» за 18 секунд. Работает на микроконтроллерах (Crazyflie, ESP32, teensy) и на iOS; есть Python-биндинги rltools через pip (правда, Gym-среды из Python заметно замедляют обучение относительно нативных).
Почему это интересно в торговом контексте: если RL-политика должна исполняться в низколатентном контуре рядом с шлюзом, C++ без аллокаций и без Python в горячем пути — ровно то, что нужно.
28. Deep Q-Learning Applied to Algorithmic Trading 💻
GitHub: adamd1985/Deep-Q-Learning-Applied-to-Algorithmic-Trading
Учебный репозиторий: применение Deep Q-Learning к алгоритмическим торговым стратегиям.
Анонс библиотеки FinRL: обучающие материалы для новичков, готовые пайплайны построения торговых стратегий, учёт торговых ограничений. Актуальная версия проекта — FinRL-X (см. п. 24).
Что стоит прочитать первым
Если цель — маркетмейкинг и микроструктура: №1 (эмерджентный скью по инвентарю), №3 (state design для HFT-агента, вывод про mark-to-market), №2 (оценка impact-модели по офлайн-данным).
Если цель — не наступить на грабли: №16 и №20 — обе честно показывают, где RL не выигрывает; №12 — как отделить непредсказуемость рынка от необучаемости алгоритма; №5 и №4 — что ломает агента и что он выучит без ограничений.
Если нужен работающий код прямо сейчас: №23 (TorchTrade) для исследований, №24 (FinRL-X) для сквозного пайплайна до брокера, №26 (CFM) как образец методологической проверки.