Deep Learning для торговли факторными остатками
William J. Long · Victor Xiao · Columbia University, New York, NY, USA
Оригинал: Long, W. J. and Xiao, V. «A Deep Learning Approach for Trading Factor Residuals», 8 декабря 2024 — arxiv.org/abs/2412.11432 (PDF).
Рисунки воспроизведены из оригинальной публикации.
Оговорка. Работа выполнена как финальный проект курса IEOR 4576: Data-Driven Methods in Finance в Колумбийском университете. Результаты предварительные; авторы сами предупреждают о возможном переобучении и отсутствии транзакционных издержек.
Аннотация
Остатки факторных моделей, широко используемых в asset pricing, открывают возможность эксплуатировать mis-pricing из не объяснённой кросс-секционной вариации для арбитража. Мы провели репликацию методологии Guijarro-Ordonez et al. (2019) (G-P-Z) по Deep Learning Statistical Arbitrage (DLSA), изначально применённой к данным акций США за 1998–2016 годы, на более свежем out-of-sample периоде 2016–2024. Строго соблюдая point-in-time (PIT) принципы и исключая утечку информации, мы повторяем предобработку данных, факторное моделирование и архитектуры deep learning (CNN и Transformers), описанные G-P-Z. Репликация даёт необычно сильные метрики в отдельных тестах: out-of-sample Sharpe ratio иногда превышает 10. Хотя такие цифры интригуют, они могут указывать на переобучение модели, специфические рыночные условия или недоучёт транзакционных издержек и market impact. Нужны дополнительные проверки и robustness-тесты, чтобы сопоставить эти результаты с более скромными улучшениями в оригинальной работе.
1. Введение
Deep Learning Statistical Arbitrage (DLSA), разработанный Guijarro-Ordonez et al. (2019) (далее G-P-Z), применяет продвинутые методы машинного обучения — свёрточные нейросети (CNN) и Transformers — к остаткам факторных моделей, чтобы находить прибыльные возможности статистического арбитража. G-P-Z показали, что эти deep learning-подходы выявляют сложные паттерны в кросс-секции доходностей и дают значимый экономический эффект на выборке 1998–2016.
В этой работе мы воспроизводим методологию DLSA на более свежем наборе данных за 2016–2024 годы. Строго придерживаемся point-in-time (PIT) обработки данных, используем только forward-fill и исключаем data snooping и ретроспективные корректировки, которые могли бы исказить результаты. Цель — проверить устойчивость исходного подхода в ином рыночном режиме и убедиться, что сильные улучшения, зафиксированные G-P-Z, не привязаны к конкретной исторической выборке.
Неожиданно репликация даёт метрики ещё сильнее, чем в оригинале. В частности, out-of-sample Sharpe ratio иногда превышает 10. На первый взгляд это впечатляет, но настораживает: возможны переобучение, нестационарная динамика рынка или пропущенные транзакционные издержки. Нужны дополнительные эксперименты и симуляции, чтобы подтвердить реальную экономическую значимость.
2. Данные
2.1. Источники и охват
Конструкция данных максимально следует G-P-Z. Цены и доходности акций — из CRSP, бухгалтерская информация — из Compustat. Безрисковая ставка — трёхмесячная Treasury bill из Kenneth French Data Library. Выборка — относительно ликвидные акции США (S&P 500) по критериям, близким к оригинальной DLSA-работе, но на более свежем горизонте 2016–2024.
2.2. Point-in-time обработка и пропуски
Все данные обрабатываются по PIT-принципам: в момент $t$ используется только информация, известная на $t$ или раньше. Пропуски заполняются строго forward-fill, без ретроспективной импутации. Акции с чрезмерным числом пропусков исключаются. Факторные нагрузки для расчёта остаточных доходностей оцениваются только на истории до $t-1$.
3. Методология
3.1. Факторные модели и остаточные доходности
Чтобы выделить остаточные доходности, применяются факторные модели — Fama-French 5-factor, PCA и IPCA. Они раскладывают доходности на систематическую часть и остатки. Остаток $\epsilon_{n,t}$ определяется как
\[ \epsilon_{n,t} = R_{n,t} - \beta_{n,t-1}^{\top} F_{t}, \]где $R_{n,t}$ — избыточная доходность актива, $\beta_{n,t-1}$ — факторные нагрузки, оцененные на скользящем окне, $F_t$ — реализации факторов в момент $t$. Остатки должны отражать idiosyncratic-доходности без систематического риска.
PCA-модели оценивают латентные факторы по корреляционной матрице на скользящем окне 252 дня. Факторы суммируют систематическую вариацию доходностей; нагрузки — регрессией за последние 60 дней. Теоретически остатки свободны от систематической экспозиции и содержат более предсказуемую idiosyncratic-компоненту.
3.2. Архитектура deep learning: CNN + Transformer
Используется CNN в связке с Transformer для поиска паттернов в рядах остаточных доходностей — по схеме G-P-Z. CNN служит гибким локальным фильтром, выявляющим тренды и развороты на коротких отрезках. Через свёрточные слои из входного ряда остатков извлекаются $D$ feature maps, количественно описывающих экспозицию к базовым локальным паттернам. Эти признаки передаются в Transformer для глобального анализа.
Transformer захватывает временные зависимости между локальными паттернами через attention-механизм. Каждая attention head учится глобальным структурам — mean-reversion, trend-following и т.п. — взвешивая взаимодействия между сегментами ряда. Модель представляет остаточные доходности через глобальные зависимости, совмещая краткосрочные флуктуации и долгосрочную динамику.
3.3. Торговая стратегия и построение портфеля
Feedforward-нейросеть отображает извлечённые сигналы в торговые веса, максимизируя out-of-sample Sharpe ratio. Ограничения на leverage, turnover и short selling — как в исходном каркасе.
Модель обучается и тестируется на rolling basis: историческое окно (например, 1000 дней) для обучения и следующие 125 дней — для out-of-sample теста.
4. Результаты
4.1. Предварительная производительность бэктеста
Применяя методологию G-P-Z к данным 2016–2024, неожиданно обнаруживаем, что модель часто находит паттерны с очень высокой risk-adjusted доходностью. В отдельных тестовых окнах out-of-sample Sharpe ratio превышает 10 — заметно выше примерно 3,5–4 в оригинальной работе.
На рисунке 3 — метрики производительности и распределения доходностей стратегии. Визуально впечатляет, но результаты требуют скептической проверки.
Рисунок 4 показывает кумулятивную производительность и связанные метрики на out-of-sample окне. Несмотря на высокие доходности, в предварительном анализе нет транзакционных издержек и прочих friction — это может завышать видимую прибыльность.
4.2. Интерпретация и осторожность
Предварительные результаты соблазнительны, но требуют осторожности по нескольким причинам:
- Переобучение. Высокие out-of-sample Sharpe ratio могут отражать подгонку под паттерны конкретного недавнего периода. Нужны тесты на других окнах и регуляризация.
- Смена рыночных режимов. 2016–2024 может сильно отличаться от 1998–2016: посткризисная монетарная политика, динамика COVID-19 и др. могли создать краткоживущие exploitable-паттерны.
- Транзакционные издержки и market impact. Реалистичные комиссии, impact и short-sale fees пока не учтены — они, вероятно, снизят Sharpe и доходности.
- Проверка целостности данных. Применены строгие PIT-правила и меры против утечки, но экстремальные цифры требуют дополнительной верификации: даже тонкая утечка или survivorship bias могут раздуть метрики.
5. Обсуждение
Репликация DLSA на более свежем периоде даёт результаты, существенно превосходящие оригинал. Мы не трактуем это как доказательство улучшенной эффективности модели, а как сигнал, что нужны более тщательные robustness-проверки.
Например, экстремально высокие Sharpe ratio требуют повторного тестирования с реалистичными издержками и сдвигающимися validation-окнами. Высокая предсказательная точность может отражать переобучение или эксплуатацию транзиентных условий, а не устойчивую арбитражную возможность. Нужны тесты на альтернативных фазах рынка и дополнительных out-of-sample сегментах.
6. Итоги
Мы воспроизвели Deep Learning Statistical Arbitrage по G-P-Z на данных 2016–2024, тщательно соблюдая point-in-time целостность и предотвращая утечку информации. Out-of-sample Sharpe ratio иногда превышает 10 — результат, требующий осторожной интерпретации.
Наши выводы не опровергают оригинальную работу, но показывают, что рыночные условия, выбор выборки и протокол оценки могут радикально менять метрики. Прежде чем делать вывод о превосходстве метода в недавний период, нужны реалистичные trading frictions, контроль переобучения и проверка стабильности на множестве out-of-sample сегментов.
Благодарности
Благодарим авторов оригинальной DLSA-работы (G-P-Z) за методологию и поставщиков данных (CRSP, Compustat, Kenneth French Data Library) за доступ к финансовым рядам. Работа выполнена как финальный проект курса IEOR 4576: Data-Driven Methods in Finance в Колумбийском университете.
Литература
- Fama, Eugene F. and Kenneth R. French (1993). Common risk factors in the returns on stocks and bonds. Journal of Financial Economics, 33(1):3–56.
- Fama, Eugene F. and Kenneth R. French (2015). A five-factor asset pricing model. Journal of Financial Economics, 116(1):1–22.
- Guijarro-Ordonez, Jorge, Markus Pelger, and Greg Zanotti (2019). Deep Learning Statistical Arbitrage. SSRN Working Paper. https://ssrn.com/abstract=3862004
Оригинал статьи: Long and Xiao, «A Deep Learning Approach for Trading Factor Residuals», arXiv:2412.11432