Проблема запоминания: можно ли доверять экономическим прогнозам LLM?

5.5/10

Алехандро Лопес-Лира, Юэхуа Тан, Минъинь Чжу · University of Florida · первая версия: 15 апреля 2025; текущая версия: 16 декабря 2025

Оригинал: Lopez-Lira, A., Tang, Y., Zhu, M. «The Memorization Problem: Can We Trust LLMs' Economic Forecasts?», 2025 — arxiv.org/abs/2504.14765 (PDF).

Рисунки воспроизведены из оригинальной публикации; тексты промптов и примеры анонимизированных документов сохранены на английском, поскольку это дословные входы и выходы моделей. Оригинал распространяется по лицензии CC BY-NC-ND 4.0; перевод выполнен в ознакомительных целях с указанием источника.

Аннотация

Большим языковым моделям (LLM) нельзя доверять в экономических прогнозах на периодах, покрытых их обучающими данными. Контрфактическая прогнозная способность неидентифицируема, когда модель видела реализованные значения: любой наблюдаемый выход согласуется и с подлинным навыком, и с запоминанием. Любое свидетельство запоминания — лишь нижняя граница закодированного знания. Мы демонстрируем, что LLM запомнили экономические и финансовые данные и воспроизводят точные значения до своей даты отсечки знаний. Инструкции соблюдать исторические границы не мешают достигать точности уровня воспроизведения, а маскирование не защищает: LLM реконструируют сущности и даты из минимального контекста. После отсечки воспроизведения не наблюдается. Запоминание распространяется и на эмбеддинги.

Ключевые слова: большие языковые модели, ChatGPT, запоминание, lookahead-смещение, экономическое прогнозирование, текстовый анализ, эмбеддинги. Классификация JEL: C53, C58, E37, G10, G17.

1. Введение

Растущий корпус литературы применяет большие языковые модели (LLM) для генерации исторических ожиданий, оценки их прогнозной точности или бэктестирования инвестиционных стратегий на основе LLM внутри периодов, покрытых обучающими данными этих моделей. Большинство LLM обучены на всеобъемлющих датасетах интернет-масштаба вплоть до конкретной даты отсечки знаний, что создаёт фундаментальную проблему: анализируя данные до отсечки, мы не можем различить, демонстрирует ли модель подлинную прогнозную способность или просто воспроизводит запомненную информацию.1 Например, если LLM запомнили исторические значения S&P 500, оценка их способности «прогнозировать» эти значения из любой информации до отсечки становится ненадёжной. В этой статье мы показываем, что LLM запомнили большие объёмы экономических и финансовых данных, что ставит под сомнение обычную интерпретацию прогнозной способности LLM.

Теоретически мы формализуем проблему запоминания как проблему неидентифицируемости и доказываем: когда модель видела реализованные значения во время обучения, её контрфактическую прогнозную способность нельзя восстановить из её выходов. Любой наблюдаемый прогноз согласуется с двумя противоречащими объяснениями (подлинный аналитический навык или простое воспроизведение запомненной информации), делая статистический вывод невозможным. Эмпирически мы показываем, что эта проблема действует на практике, предоставляя систематические свидетельства масштабного запоминания LLM экономических и финансовых данных. Вместе эти результаты устанавливают, что исследования «прогнозирования» до отсечки сталкиваются с фундаментальной методологической проблемой: они не могут отличить подлинную предсказательную способность от запоминания. Ограничивающие промпты (например, «используй только данные до 2010 года») не могут это разрешить, потому что промпты не меняют информацию, закодированную в параметрах модели.

Наши теоретические результаты доказывают, что и другие часто предлагаемые решения не работают. Во-первых, дообучение модели «забыть» будущую информацию не помогает: не исследуя, что фактически удалено из модели, мы не можем сказать, действительно ли модель забыла или лишь научилась скрывать то, что знает. Во-вторых, использование малых выборок после отсечки в качестве «проверок устойчивости» невалидно: когда эти выборки малы, подлинный прогнозный навык и необнаруженное запоминание дают статистически неразличимые результаты. Наконец, любое свидетельство запоминания — лишь нижняя граница: то, что один тест не смог извлечь запомненное знание, не означает его отсутствия, поскольку другие промпты или контекстные подсказки могут его активировать.

С помощью нового тестового каркаса мы показываем, что LLM способны воспроизводить точные числовые значения экономических данных из своего обучения. Например, до своей даты отсечки знаний (октябрь 2023) GPT-4o может воспроизводить конкретные уровни индекса S&P 500 с идеальной точностью на определённые даты, уровни безработицы с точностью до десятой процентного пункта и точные квартальные темпы роста ВВП. Рисунок 1 показывает запомненные моделью значения трёх фондовых индексов (S&P 500, Dow Jones Industrial Average и Nasdaq Composite) вместе с фактическими значениями и соответствующими ошибками. Помимо американских и международных макроиндикаторов и рыночных индексов, мы находим ясные свидетельства запоминания цен отдельных бумаг — более выраженного для заметных акций и в недавние периоды. Модель также демонстрирует почти идеальную идентификацию дат заголовков первых полос главных СМИ. Короче говоря, мы документируем повсеместное запоминание.

Рисунок 1
Рисунок 1. Воспроизведение точных числовых уровней рыночных индексов. Показаны оценки закрытий фондовых индексов, данные LLM, в сравнении с фактическими значениями. Панели A, C и E — фактические значения против оценок; панели B, D и F — ошибка оценки для S&P 500, Dow Jones Industrial Average и Nasdaq Composite. Ошибка оценки считается как (оценка − факт)/факт и показана в процентных пунктах (5 означает 5%). Для панелей Nasdaq Composite удалены 10 выбросов для удобства построения; в таблицах метрик эти значения учтены. Период после отсечки (с 10/2023) закрашен серым.

Далее мы демонстрируем, что стандартные техники ограничения знаний модели не мешают доступу к запомненным данным. Когда мы инструктируем GPT-4o игнорировать любую информацию после 2010 года при прогнозе направления квартального роста ВВП, модель достигает пороговой точности 97.6% до искусственной отсечки и 98.0% после — почти одинаковый результат вопреки явному ограничению.2 Для сравнения, фактическая точность после настоящей отсечки знаний — лишь 40%. Эти результаты говорят, что ограничения на уровне промпта на практике не работают. Но даже если бы ограниченные промпты давали более низкую точность, теория объясняет, почему и этот результат был бы столь же неинформативен: прогнозная способность не идентифицируется — результат согласуется и с тем, что модель запомнила исход и отыгрывает роль худшего прогнозиста, и с тем, что она действительно способна забыть исходную информацию.

Чтобы понять, какие приложения уязвимы, нужно отличать задачи, где знание будущего влияет на ответ, от задач, где не влияет. Проблема запоминания касается всех задач, не являющихся будуще-инвариантными: задач, где ответ аналитика отличался бы при знании будущих исходов. Простые задачи извлечения, где правильный ответ одинаков независимо от знания будущего (например, извлечение имён сущностей или объективных числовых фактов), обычно не затронуты. Однако многие задачи, выглядящие как чистое извлечение, на деле нагружены суждением: оценка «релевантности» или «важности», выявление «рисков», классификация «тональности», генерация «ожиданий» — всё это интерпретации, на которые может влиять знание последующих исходов. Для таких задач параметры модели кодируют будущую информацию, несмотря на входы до отсечки: lookahead-смещение в функции, а не в данных. Раздел 2 формализует это различие и даёт конкретные рекомендации по типовым категориям задач.

Техники маскирования (анонимизация имён сущностей, компаний или дат) дают более тонкую картину. В теории валидное маскирование требует двух условий: будущей инвариантности (замаскированная задача не зависит от информации после отсечки) и обнаружимого навыка (модель показывает статистически значимую результативность). Когда оба условия выполнены, маскирование допускает либо использование с сохранением задачи (восстановление исходной цели оценивания), либо использование для демонстрации способности (установление подлинной способности модели на другом классе задач). Без обнаружимого навыка слабая результативность создаёт ещё одну проблему идентификации: мы не можем отличить отсутствие способности от чрезмерно агрессивного маскирования, удалившего необходимую информацию.

На практике попытки помешать LLM обращаться к будущей информации через маскирование сталкиваются со значительными трудностями. Мы показываем, что LLM способны реконструировать исходные сущности из, казалось бы, минимальных контекстных подсказок в сложных финансовых документах. Например, рисунок 2 показывает: когда мы предъявляем GPT-4o анонимизированную стенограмму отчётного звонка Ethan Allen (ETH), где названия компаний, числа, локации и даты замаскированы методом «нейтрализации сущностей» (entity neutering) из Engelberg et al. (2025), модель всё равно правильно идентифицирует компанию (ETH), квартал (Q1) и год (2018). Стенограмма содержала лишь общие деловые формулировки вроде «Our adjusted EPS of number e increased number f percent from the prior year», и тем не менее модель восстанавливает точную корпоративную идентичность и отчётный период.

Анонимизированный фрагмент отчётного звонка:

Thank you, name x, and welcome to our earnings call.
Our time x sales were up number a%. They would have been higher, but due to bottlenecks on production and delay in shipments. We ended with wholesale backlogs increasing number b% and Retail Division backlogs increasing number c%. Several factors impacted our production, gross margins, and shipments. We processed a large location x order of mostly new product to be delivered in number d days as per contract. Although a significant portion that was produced had to be held up for shipment until our time x at their request. We were also affected by political events in location x this time x. These events are now resolved and production has resumed.
Our adjusted EPS of number e increased number f% from the prior year, helped by change in the tax laws.
While we maintained a strong operating margin of number g%, we had the opportunity to have higher margins with more delivered sales.
While we are making good progress expanding our business with the location x, worldwide product type x program and our contract division and internationally, we need to increase written business in our location x retail network.
With many already initiatives underway, including continuing to develop a strong talented team, strengthening our offerings and the projections and the locations of our design centers and improvements in our production capabilities, we plan to substantially increase our marketing efforts in the time x.
We expect to increase our advertising expenditures by number h% in the time x and number i% in the time x from higher levels spent last year in the time x and time x.
After name x gives a brief overview, I will discuss our initiatives in greater detail.

Ответ GPT-4o: Ticker: ETH   Quarter: Q1   Year: 2018

Рисунок 2. GPT-4o правильно идентифицирует Ethan Allen (ETH), Q1 и 2018 год из тщательно анонимизированной стенограммы отчётного звонка.

Систематически анализируя анонимизированные стенограммы отчётных звонков, мы находим, что GPT-4o правильно идентифицирует компанию в 100% звонков Apple, Meta и Microsoft и более чем в 85% звонков для всех фирм «Великолепной семёрки».3 Для Apple модель достигает точности 93.2% в определении правильного квартала и года. Успешная реконструкция доказывает, что замаскированная задача не является будуще-инвариантной — модель по-прежнему может обращаться к контекстным знаниям об этих сущностях. Более того, даже когда реконструкция не удаётся, модель может обращаться к запомненному знанию через непроверенные агрегированные каналы (например, отраслевые паттерны, деловую конъюнктуру, макроэкономический контекст). Короче говоря, тесты на реконструкцию прощупывают лишь конечное множество путей; неудача реконструкции не доказывает, что будущая инвариантность выполняется.

Далее, запоминание не ограничено задачами на промптах: признаки его несут даже векторы эмбеддингов.4 Мы тестируем запоминание, кодируя текстовые промпты, в которых опущено конкретное числовое значение для заданной даты (например, «In Q4 2020, the earliest estimate of the US GDP growth rate was»), вычисляя их эмбеддинги и регрессируя макроэкономические исходы на эти эмбеддинги. При нулевой гипотезе отсутствия запоминания эти эмбеддинги не должны обладать предсказательной силой; вместо этого мы находим свидетельства предсказательного содержания для таких переменных, как инфляция и уровень безработицы.

Учитывая эти трудности методов, пытающихся обойти запоминание, надёжная оценка подлинных прогнозных способностей LLM возможна только на данных после их дат отсечки знаний. Один подход — применять модели, явно спроектированные с временными отсечками (например, Sarkar 2024; Rahimikia, Drinkall 2024; He et al. 2025). Другой — ограничивать анализ исключительно периодом после отсечки знаний (например, Lopez-Lira, Tang 2023; Pham, Cunningham 2024; Bozman, Fairhurst, Greene 2025). Только тестируя предсказания для периодов, которым модели не были экспонированы при обучении, можно уверенно отличить подлинную прогнозную способность от запоминания.

Как минимум мы рекомендуем использовать нашу методологию, чтобы проверять, запомнила ли модель информацию в каждой исследовательской постановке. Всякий раз, когда выход LLM отличался бы при знании будущего, применять её к данным внутри периода обучения по сути рискованно.

Связанная литература и вклад. Мы вносим вклад в литературу о пределах LLM в экономике и финансах через теоретические и эмпирические продвижения. Теоретически мы доказываем: когда модели запомнили исходы, прогнозная способность неидентифицируема. Эмпирически мы демонстрируем, что LLM проявляют систематическое запоминание экономических и финансовых данных в масштабе. Наш ключевой методологический вклад — тестовый каркас, выявляющий то, что упускают косвенные тесты, и дающий недвусмысленные свидетельства запоминания.

Предыдущие исследования опирались на изобретательные контекст-специфичные эксперименты для выявления lookahead-смещения. Sarkar и Vafa (2024) используют появление COVID-19 в допандемийных факторах риска фирм как свидетельство того, что модели Llama непреднамеренно включают будущую информацию. Хотя такие естественные эксперименты ценны, они требуют конкретных исторических событий и не могут раскрыть полный масштаб проблемы. Levy (2024) находит, что GPT-4o плохо справляется с числовыми задачами и что возмущение финансовой отчётности роняет предсказательную точность LLM до случайного уровня, и высказывает гипотезу, что LLM запоминают.5 В отличие от этих работ, наш метод универсально применим: напрямую извлекая числовые значения, используя лишь названия переменных и даты, любой исследователь может проверить любой экономический ряд на запоминание без изобретательных дизайнов. Более того, наш метод демонстрирует, как запоминание затрагивает и подходы на основе эмбеддингов.

Параллельная работа Ludwig, Mullainathan и Rambachan (2025) развивает эконометрический каркас использования LLM и выделяет «утечку обучения» (training leakage — попадание конкретных текстов из выборки исследователя в обучающие данные модели) как угрозу валидному выводу. Мы адресуем более фундаментальную проблему: функциональное lookahead-смещение, когда параметры модели кодируют информацию после момента $t$, выученную из агрегированного обучающего корпуса, тем самым загрязняя решающее правило, даже если конкретный входной текст никогда не встречался в обучении. Мы доказываем, что целевой эстиманд неидентифицируем из-за наблюдательной эквивалентности (предложение 1, следствие 1), а распространённые средства доказуемо не работают (следствие 2, предложение 2). Эмпирически мы даём систематические свидетельства того, что модели запомнили исходы и фундаментальные показатели в масштабе для экономических и финансовых данных, и разрабатываем каркас прямого извлечения для проверки того, какая информация закодирована в параметрах модели.

Исследования сосредоточивались и на потенциальных решениях. Sarkar (2024), Rahimikia и Drinkall (2024) и He et al. (2025) обучают хронологически согласованные языковые модели, полностью избегающие lookahead-смещения за счёт обучения различных чекпойнтов на темпорально упорядоченном датасете. Engelberg et al. (2025) предлагают «нейтрализацию сущностей» — использование LLM для удаления идентифицирующей информации из текста — и находят, что замаскированный текст сохраняет ту же тональность и предсказуемость доходностей, что и незамаскированный. Родственно, Glasserman и Lin (2023) находят, что прогнозирование по анонимизированным заголовкам превосходит оригиналы внутри окна обучения — то есть эффект отвлечения от общих знаний о компании (в случае анонимизированных заголовков), по-видимому, перевешивает lookahead-смещение. Наконец, другие исследователи ограничивались исключительно периодом после отсечки знаний во избежание lookahead-смещения (например, Lopez-Lira, Tang 2023; Pham, Cunningham 2024; Bozman, Fairhurst, Greene 2025), эксплуатируя то, что у старых версий GPT-3.5 и GPT-4 дата отсечки — сентябрь 2021.

ChatGPT и другие LLM в последнее время использовались для прогнозирования или извлечения ожиданий по разнообразным экономическим рядам, включающим период обучения LLM, путём опроса модели (например, J. Chen et al. 2023; Bond, Klok, Zhu 2024; Tan, Wu, Zhang 2024; Jha et al. 2025; Degen et al. 2024). Наши результаты предполагают осторожность при интерпретации части этих выводов: видимая прогнозная точность может отражать запоминание моделью обучающих данных, а не подлинную предсказательную способность. Более того, исследования, находящие неточности или смещения в предсказаниях LLM в течение их периода обучения, могут измерять не фактические ограничения прогнозирования, а случаи, когда модель пытается дать полезный ответ, притворяясь, что не знает информацию, которую запомнила.

С ростом числа применений LLM в исследованиях по экономике и финансам (например, Jha et al. 2024; Cao et al. 2025; van Binsbergen, Han, Lopez-Lira 2022; Bai et al. 2023; Chen, Kelly, Xiu 2022; Kim, Muhn, Nikolaev 2024; Beckmann et al. 2024; Breitung, Müller 2025; Bybee 2023; Horton 2023; Hansen et al. 2024; Manning, Zhu, Horton 2024; Clayton et al. 2025) требуется больше работы по оценке того, в какой мере запоминание LLM может влиять на конкретные приложения — сопоставление по сходству, оценку тональности, генерацию опросов и извлечение ожиданий.

2. Формализация проблемы запоминания

Эконометрически проблема состоит в несоответствии информационных множеств и параметров. Исследователь хочет оценивать решения, используя только то, что было известно в момент $t$, но параметры модели уже кодируют информацию, раскрытую после $t$. Этот раздел даёт интуицию в упрощённых обозначениях; формальные определения, предположения и доказательства — в приложении C.

2.1. Lookahead-смещение в прогнозировании LLM

Постановка. Пусть $I_t$ — информация, доступная в момент $t$, а $I_{>t}$ — информация, раскрытая позже; $I_{\mathrm{all}} = I_t \cup I_{>t}$. Пусть $Q_t$ — задача, поставленная «по состоянию на $t$» (включающая инструкцию и любые входные данные из $I_t$). Пусть $Y_{\mathrm{true}}$ — реализованный исход (раскрытый после момента $t$). Пусть $\theta = \theta(I_{\mathrm{all}})$ — фактические параметры полностью обученной модели (обученной на всех данных), а $S_\phi(\cdot)$ — внутренняя оценочная функция модели, где $\phi$ обозначает произвольные параметры модели. Определим $\theta_t = \theta(I_t)$ как контрфактические параметры, которые получились бы при применении той же процедуры обучения к ограниченному информационному множеству $I_t$. Мы моделируем выход LLM как оптимальное решение $y$ из множества возможных ответов $\mathcal{Y}$, выбираемое решающим правилом $\delta_\phi(Q, P) := \operatorname{argmax}_{y \in \mathcal{Y}} S_\phi(y; Q, P)$, где $Q$ — задача, а $P$ — дополнительные инструкции, модифицирующие задачу ($P = \varnothing$ обозначает отсутствие дополнительных инструкций сверх самой задачи).6

Идеал (целевой эстиманд). Контрфактическое решение, которое хочет получить исследователь:

\[ Y_t^\star := \delta_{\theta_t}(Q_t, \varnothing) = \operatorname*{argmax}_{y \in \mathcal{Y}} S_{\theta_t}\big(y;\, Q_t, \varnothing\big). \tag{1}\]

Наблюдаемое (реализуемый эстиманд). На практике мы наблюдаем решение полностью обученной модели:

\[ Y_{\mathrm{LLM}} = \delta_{\theta}(Q_t, \varnothing) = \operatorname*{argmax}_{y \in \mathcal{Y}} S_{\theta}\big(y;\, Q_t, \varnothing\big), \qquad \theta = \theta(I_{\mathrm{all}}). \tag{2}\]

Определение 1 (инвариантность задачи и lookahead-смещение). Задача $Q_t$ является либо:

Поскольку параметры модели кодируют информацию из полных обучающих данных, иные применения этих параметров (например, векторы эмбеддингов) также могут отражать запомненную информацию.

Lookahead-смещение повсеместно и затрагивает задачи, требующие суждения, выбора или предсказания. Оно загрязняет любую задачу, не являющуюся будуще-инвариантной. Например, классификация тональности статьи 2007 года о рынке жилья: при $\theta_t$ оптимальным по оценочной функции может быть ответ «оптимистично»; при $\theta$ (включающей кризис 2008 года) оптимальным может стать «негативно». Это отличается от стандартного lookahead-смещения данных в эконометрике (например, случайного включения данных Q4 в предиктивную регрессию Q3): вход $Q_t$ здесь валиден и содержит только информацию, доступную в момент $t$, но обрабатывающая его функция $\delta_\theta$ загрязнена будущей информацией, встроенной в параметры модели (lookahead-смещение функциональной формы).

Практическое руководство для исследователей. Чтобы применять это различие на практике, исследователь может оценить будущую инвариантность задачи вопросом: изменился бы ответ аналитика, знай он, что произошло после момента $t$? Если да — или даже правдоподобно да, — задача не будуще-инвариантна. При восстановлении ответов о конкретных фирмах, событиях или периодах использование выходов LLM на данных до отсечки проблематично.

Типовые категории задач.

Вероятно будуще-инвариантные (безопасны для использования до отсечки):

Не будуще-инвариантные:

Для будуще-вариантных задач второй категории использование до отсечки невалидно. Независимо от типа задачи исследователям следует проверять, что модель запомнила, нашей процедурой прямого извлечения (см. раздел 3). Даже кажущиеся безопасными задачи фактологического извлечения могут быть загрязнены, если модель запомнила конкретные факты, значимые для анализа. Например, задача «извлеки все риски, упомянутые в этом отчётном звонке 2007 года» не будуще-инвариантна, хотя выглядит простым извлечением. Понятие «риска» нагружено суждением: то, какие риски модель сочтёт заметными, информировано знанием, какие из опасений действительно материализовались в проблемы.

Замечание 1 (свойство нижней границы у тестов запоминания). Любой тест запоминания устанавливает лишь нижнюю границу закодированного в $\theta$: положительное свидетельство заключительно, отрицательное — нет.

Разные пары «запрос–промпт» могут обращаться к разным подмножествам закодированной информации через разные механизмы, поэтому неспособность извлечь знание в конкретном тесте не доказывает его отсутствия. Следовательно, обусловливание на случаях, где тесты не срабатывают (например, ограничение наблюдениями, где модель не может идентифицировать фирму), не разрешает неидентифицируемость — модель по-прежнему может обращаться к запомненной информации через альтернативные контекстные подсказки.

2.2. Неидентифицируемость ограниченных прогнозов

Исследователи иногда добавляют ограничивающие промпты $P$ (например, «используй только данные до 2010 года»), надеясь эмулировать $Y_t^\star$ без переобучения модели. Для любого такого промпта определим ограниченный выход как

\[ Y_{\mathrm{constrained}}(P) := \delta_{\theta}(Q_t, P) = \operatorname*{argmax}_{y \in \mathcal{Y}} S_{\theta}\big(y;\, Q_t, P\big), \qquad \theta = \theta(I_{\mathrm{all}}). \tag{5}\]

Цель исследователя — использовать наблюдаемое $Y_{\mathrm{constrained}}(P)$ как прокси ненаблюдаемого идеального эстиманда $Y_t^\star$. Центральный методологический вопрос — можно ли однозначно восстановить $Y_t^\star$ из ограниченных выходов. Это формальный вопрос идентификации. Следующее предложение утверждает, что это невозможно.

Предложение 1 (неидентифицируемость). Даны наблюдения $Y_{\mathrm{constrained}}(P)$ для любого множества ограничивающих промптов $\{P_k\}$, призванных ограничить модель информацией, доступной в момент $t$. Тогда идеальный эстиманд $Y_t^\star$ не может быть однозначно идентифицирован. Любой наблюдаемый ограниченный выход согласуется с множественными, противоречащими друг другу значениями истинного контрфактического прогноза $Y_t^\star$.

Проблема — в наблюдательной эквивалентности: любой наблюдаемый выход согласуется и с тем, что ограничение сработало (модель действительно прогнозирует, используя только информацию до $t$), и с тем, что ограничение не сработало (модель достаёт запомненный ответ). Без дополнительных предположений эти альтернативы неразличимы. Формальную конструкцию см. в приложении C.

Следствие 1 (резкая неидентифицируемость). При тех же условиях, что и в предложении 1, для любого наблюдаемого ограниченного выхода идентифицированное множество для $Y_t^\star$ равно всему множеству меток $\mathcal{Y}$. То есть наблюдение ограниченных выходов даёт нулевую информацию об идеальном эстиманде.

(Доказательство см. в приложении C.)

Для иллюстрации практических следствий рассмотрим реализованный исход, раскрывшийся со временем после момента $t$. Пусть $Y_{\mathrm{true}} \in \mathcal{Y}$ — этот истинный исход. Контринтуитивно, и хорошие, и плохие прогнозы неинтерпретируемы из-за точной наблюдательной эквивалентности. «Хороший» прогноз ($Y_{\mathrm{constrained}} = Y_{\mathrm{true}}$) может означать, что ограничение сработало и модель показала подлинный навык, — или что ограничение не сработало и модель просто вспомнила запомненный ответ. «Плохой» прогноз ($Y_{\mathrm{constrained}} \ne Y_{\mathrm{true}}$) столь же неинформативен: ограничение могло сработать, дав подлинный, но неверный прогноз ($Y_t^\star = Y_{\mathrm{constrained}}$), — или модель использует информацию после $t$ непредусмотренным образом (например, опираясь на запомненное знание того, как выглядели исторические прогнозы или убеждения, чтобы симулировать ответ, уместный для эпохи). Как показывают наши эмпирические тесты, неправдоподобно высокая точность по многим позициям говорит, что ограничения обычно не срабатывают. Следовательно, ограниченные промпты делают прогнозы фундаментально неинформативными о целевом эстиманде.

Следствие 2 (чёрный ящик дообучения). Тот же результат неидентифицируемости справедлив для дообучения «чёрным ящиком» с целью «забыть» информацию после $t$: без верификации «белым ящиком» $Y_t^\star$ нельзя идентифицировать из выходов дообученной модели.

Проблема — наблюдательная эквивалентность между подлинным забыванием (параметры изменены так, чтобы приблизить $\theta_t$) и поведенческим подавлением (информация после $t$ по-прежнему встроена, но модель научилась её скрывать). Формальную конструкцию см. в приложении C.

2.3. Маскирование как потенциальное решение

Процедуры маскирования пытаются удалить идентифицирующую информацию (названия фирм, даты, отраслевые метки) из задач в надежде помешать модели обращаться к запомненной информации, сохранив при этом способность к полезному анализу.

Определение 2 (валидное маскирование). Пусть $M : Q_t \mapsto Q_t^{\mathrm{mask}}$ — процедура маскирования. Маскирование валидно, если:

  1. Будущая инвариантность: $\delta_{\theta_t}(Q_t^{\mathrm{mask}}, \varnothing) = \delta_{\theta}(Q_t^{\mathrm{mask}}, \varnothing)$.
  2. Обнаружимый навык: точность модели на замаскированных данных до отсечки превышает бейзлайн ($p_{\mathrm{mask}} > p_0$).

Условие (ii) необходимо для идентификации: без него слабая результативность может отражать либо отсутствие способности, либо чрезмерно агрессивное маскирование — наблюдательно эквивалентные альтернативы, аналогичные предложению 1. Валидное маскирование допускает два исследовательских применения: с сохранением задачи (если $\delta_{\theta}(Q_t^{\mathrm{mask}}, \varnothing) = Y_t^\star$ — восстановление исходного эстиманда) или для демонстрации способности (если эстиманд меняется — установление способности на классе замаскированных задач).

Замечание 2 (тесты реконструкции и свойство нижней границы). По замечанию 1 тесты реконструкции дают асимметричные свидетельства: успешная реконструкция доказывает, что условие (i) нарушено, но неудача реконструкции не доказывает, что оно выполняется.

Верификация условия (i) требует и эмпирических свидетельств (реконструкция не удаётся), и теоретических аргументов (не существует информационного пути) — аналогично установлению экзогенности инструментальной переменной в эконометрике. Когда маскирование сохраняет будущую инвариантность, оно допускает использование с сохранением задачи (восстановление исходного эстиманда); когда оно меняет эстиманд, но поддерживает будущую инвариантность, — использование для демонстрации способности. Подробности см. в приложении C.

2.4. Данные после отсечки и проблема идентификации

Данные после отсечки дают потенциальное решение предложения 1: поскольку модель не обучалась на этих данных, точность после отсечки напрямую измеряет прогнозную способность. Однако распространённая практика — сообщать точность до отсечки как основной результат, а малые выборки после отсечки использовать как «проверки устойчивости», утверждая, что схожая точность означает отсутствие запоминания. Следующее предложение показывает, почему эта практика необоснованна.

Предложение 2 (статистическая неразличимость в сравнениях до/после отсечки). Когда размер выборки после отсечки мал относительно размера выборки до отсечки, подлинный прогнозный навык и необнаруженное запоминание не могут быть надёжно различены тестами гипотез. Экономически существенные разрывы запоминания остаются статистически необнаружимыми из-за низкой мощности.

Следовательно, если данные после отсечки достаточны, чтобы быть информативными, они должны быть основным анализом, а не проверкой устойчивости; если недостаточны — сравнение точности до и после отсечки не способно отличить навык от запоминания. Формальный анализ мощности см. в приложении C.

3. Методология

Для оценки запоминания LLM экономических и финансовых данных мы разрабатываем тестовый каркас, изолирующий способность к воспроизведению от прогнозирования. Наш подход формализует информационную среду, предоставляя контекстное множество $x_t$ и запрашивая предсказание о $y_{t+1}$, где $t$ — конкретный момент времени. Структура запроса явно ссылается на периоды, прося модель предоставить экономические или финансовые данные на конкретные даты. Например, мы можем спросить: «Каким был уровень S&P 500 2 мая 2020 года?»

Мы варьируем информационное множество $x_t$, чтобы изолировать разные механизмы доступа к памяти. В базовом случае мы не даём контекста, тестируя чистое воспроизведение. Затем мы дополняем его двумя всё более богатыми информационными средами: (1) исторический контекст с недавней историей $y_t$ до момента $t$ и (2) новостной контекст с заголовками ведущих финансовых изданий за период перед $t$.

Наши тесты способностей LLM к воспроизведению охватывают несколько категорий экономических переменных. Во-первых, мы тестируем макроэкономические индикаторы, запрашивая точные значения (например, уровни безработицы) и направленные тренды. Во-вторых, мы исследуем фондовые индексы через вопросы о точных числовых уровнях, направленных изменениях, процентных движениях и относительной результативности. Например, мы спрашиваем значение закрытия S&P 500 на конкретные даты или вырос либо упал NASDAQ в конкретные дни. В-третьих, мы тестируем способность LLM определять даты новостных заголовков, предъявляя наборы заголовков первой полосы The Wall Street Journal без дат и прося определить, когда эти заголовки появились, и предсказать соответствующий уровень S&P 500 на следующий торговый день. В-четвёртых, мы оцениваем способность воспроизводить информацию по отдельным бумагам, включая конкретные уровни цен акций и направленные движения. В-пятых, мы исследуем эффективность просьб к LLM наложить искусственные даты отсечки знаний. Наконец, мы тестируем способность LLM восстанавливать идентичность компаний из анонимизированных фирменных текстов, включая отчётные звонки и новостные заголовки.

3.1. Выбор периодов и дополнительный анализ

Наш экспериментальный дизайн стратегически охватывает три временные зоны относительно даты отсечки обучения LLM. Во-первых, мы включаем периоды до отсечки, где при наличии запоминания ожидаем высокую точность воспроизведения. Во-вторых, мы исследуем периоды в пределах 10 лет перед отсечкой, чтобы оценить возможные эффекты недавности в паттернах запоминания. Наконец, мы включаем периоды после отсечки как контрольное условие, где запоминание не ожидается.

3.2. Промпт

Мы применяем стандартизированный шаблон промпта во всех запросах к моделям для обеспечения согласованности и минимизации экспериментальной вариации. Каждый промпт включает опциональную контекстную секцию, конкретный вопрос об экономических данных и явные инструкции по форматированию ответа. Общий шаблон:

[Context: {context information}]

{question about economic data}

Provide a precise answer based on your knowledge. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise answer to the question.
  • confidence: A number between 0 and 100 indicating the model's confidence in its answer.

Контекстная информация представляет информационное множество $x_t$ наших экспериментальных условий; она может быть пустой (при тестировании чистого воспроизведения), содержать исторические точки данных, включать релевантные новостные заголовки или давать общие знания о периоде. Более детальная информация — в разделе A приложения.

Например, в промпте, тестирующем воспроизведение с историческим контекстом, мы можем предоставить: «Context: The S&P 500 closed at 2,834.40 on March 14, 2019, and at 2,808.48 on March 13, 2019. What was the S&P 500 closing value on March 15, 2019?» Этот стандартизированный подход позволяет систематически варьировать предоставляемую информацию, контролируя смешивающие факторы в формулировке вопроса или ожиданиях ответа.

3.3. LLM

Учитывая широкое использование в исследованиях, основной анализ мы проводим на ChatGPT-4o, конкретная версия — «gpt-4o-2024-08-06». Эта модель — снапшот GPT-4o, обеспечивающий согласованные результативность и поведение. Она не будет получать обновления, а её обучающие данные заканчиваются октябрём 2023.7 Важно, что температура модели установлена в 0 для всех анализов, чтобы максимизировать воспроизводимость результатов.8 В дополнительных анализах мы также тестируем способности к воспроизведению у open-source моделей, таких как Llama-3.1-70b-Instruct.9

4. Данные

Большинство тестов используют данные с января 1990 по сентябрь 2023, то есть до даты отсечки знаний GPT-4o (октябрь 2023). Для проверки запоминания LLM мы используем три категории датасетов: (1) фондовые индексы и цены отдельных акций, (2) макроэкономические индикаторы, (3) текстовые данные — новости первой полосы WSJ, отчётные звонки и фирменные новостные заголовки.

Мы просим LLM дать значение закрытия фондовых индексов и выборки отдельных акций. Для оценки ответов LLM используем дневные закрытия S&P 500, Dow Jones Industrial Average и Nasdaq Composite из Yahoo Finance. Данные Center for Research in Security Prices (CRSP) используем для получения дневных цен закрытия отдельных акций. Выборка отдельных акций включает «Великолепную семёрку» (AAPL, AMZN, GOOGL, META, MSFT, NVDA, TSLA) и случайно отобранные подвыборки акций разных категорий размера — всего более 4 200 уникальных тикеров.

Мы также просим LLM дать оценки различных макроэкономических индикаторов. Тестируемые индикаторы: (i) рост ВВП США, (ii) инфляция, (iii) уровень безработицы, (iv) доходность 10-летних трежерис, (v) VIX, (vi) закладки новых домов (housing starts), (vii) изменение занятости вне сельского хозяйства (nonfarm payrolls). Фактические значения уровня безработицы и доходности 10-летних трежерис берём из Federal Reserve Economic Data (FRED). Уровни VIX — из Yahoo Finance. Для роста ВВП, инфляции, закладок домов и изменения занятости используем Real-Time Data Set Федерального резервного банка Филадельфии, чтобы получить первую оценку (first vintage), и просим LLM дать самую раннюю оценку этих индикаторов.

Используемые текстовые данные включают заголовки первой полосы The Wall Street Journal (WSJ) из Factiva, стенограммы отчётных конференц-звонков из Capital IQ, фирменные заголовки и новостную базу RavenPack. Датасет новостей первой полосы WSJ содержит 90 123 заголовка с января 1990 по февраль 2025 — в среднем около 9 заголовков на дату. По каждому набору заголовков мы просим LLM назвать дату и уровень S&P 500 на следующий торговый день. Датасет конференц-звонков начинается в январе 2006 и заканчивается в мае 2024. Мы извлекаем вступительное заявление CEO, анонимизируем текст методом нейтрализации сущностей по Engelberg et al. (2025) и просим LLM назвать фирму, квартал и год звонка.

Аналогичный тест мы реализуем для фирменных заголовков с января 2000 по июнь 2024. Мы следуем процедурам фильтрации по базе RavenPack как в Lopez-Lira, Tang (2023): оставляем только заголовки с релевантностью 100, только полные статьи и пресс-релизы, исключаем заголовки категорий «stock-gain» и «stock-loss» и избегаем повторов, требуя «event similarity days» больше 90 и удаляя дубликаты. Получаем выборку из 1 358 737 заголовков по 4 391 уникальной фирме с января 2000 по июнь 2024. Около 70% заголовков — из «ночных» статей, вышедших до 9:00 или после 16:00, остальные 30% — внутридневные.

5. Результаты

В этом разделе мы представляем всестороннюю оценку запоминания GPT-4o экономических и финансовых данных: макроиндикаторы, рыночные индексы, отдельные акции, заголовки — и попытки смягчить запоминание фальшивыми отсечками знаний и маскированием. Во всех этих областях мы оцениваем способность модели воспроизводить точные значения, идентифицировать контекстные детали и соблюдать ограничения. Наша цель — изучить масштаб и селективность запоминания, подчёркивая последствия для использования LLM в экономическом прогнозировании и трудности изоляции подлинной предсказательной способности. Каждый подраздел исследует конкретный тип данных или стратегию смягчения, складывая цельную картину того, как запоминание проявляется и сохраняется.

Во-первых, мы устанавливаем существование запоминания тестами прямого извлечения на данных до отсечки, запрашивая у модели конкретные значения только по названиям переменных и датам. Высокая точность в этих тестах — недвусмысленное свидетельство запоминания. Во-вторых, мы исследуем результативность после отсечки как описательное свидетельство о загрязнении данных. Когда выборки после отсечки малы, тесты гипотез имеют низкую мощность для различения подлинного прогнозного навыка и необнаруженного запоминания. Поэтому мы интерпретируем результаты после отсечки осторожно: слабая результативность после отсечки описательно согласуется с отсутствием загрязнения данных, но наши выборки после отсечки часто малы и не составляют окончательных статистических тестов.

5.1. Воспроизведение макроэкономических данных

Для оценки запоминания GPT-4o макроэкономических индикаторов мы тестировали её способность воспроизводить месячные значения по различным переменным (квартальные для ВВП). В базовом анализе используются данные с января 1990 по сентябрь 2023 — всё внутри отсечки обучения модели (октябрь 2023). Важно, что для сравнения мы также исследуем период после отсечки с октября 2023 по февраль 2025. Индикаторы разделены на две группы: ставки (рост ВВП, инфляция, уровень безработицы, доходность 10-летних трежерис) и уровни (закладки домов, VIX, nonfarm payrolls). Для ставок мы запрашивали процентные значения, оценивая точность через среднюю ошибку (ME), среднюю абсолютную ошибку (MAE), пороговую точность (правильная идентификация превышения порога) и направленную точность (правильное направление изменения от предыдущего периода). Для уровней мы запрашивали сырые значения, с ошибками относительно фактических уровней через среднюю процентную ошибку (MPE), среднюю абсолютную процентную ошибку (MAPE), пороговую и направленную точность. Мы также исследовали уровни за 10-летний период перед отсечкой для изучения эффектов недавности. Результативность измеряется относительно фактических значений макроиндикаторов; результаты — в таблице 1.10

Результаты обнаруживают сильную способность GPT-4o воспроизводить макроэкономические данные. Рисунок 3 строит воспроизведённые значения против фактических, а также ошибку оценки для роста ВВП, инфляции, уровня безработицы и доходности 10-летних трежерис. Ряды воспроизведённых и фактических значений почти идентичны, особенно в более недавние периоды. Для ставок модель демонстрирует почти идеальное воспроизведение: средние абсолютные ошибки от 0.03% (безработица) до 0.15% (рост ВВП), пороговая точность выше 96% по всем индикаторам — до 98% для 10-летних трежерис и 99% для безработицы. Этот набор результатов говорит, что GPT-4o запомнила эти процентные индикаторы с высокой точностью.

Таблица 1. Метрики оценки для макроиндикаторов. Мы просим LLM воспроизвести месячные значения (квартальные для ВВП; конкретная дата конца месяца для доходности 10-летних трежерис и VIX). Ставки: рост ВВП, инфляция, безработица, доходность 10-летних трежерис — запрашивается процент. Уровни: закладки домов, VIX, nonfarm payrolls — полный период. ME, MAE, MPE, MAPE, пороговая и направленная точность в процентных пунктах (0.01 означает 0.01%). Для ставок ME = оценка − факт; MAE — среднее модуля ME. Пороговая точность — доля предсказаний, правильно определивших превышение порога (2.5% для роста ВВП, 3% для инфляции, 4% для безработицы, 4% для 10-летних трежерис, 16 для VIX, 1400 для закладок, 200 для nonfarm payrolls). Для уровней MPE — среднее процентной ошибки (оценка − факт)/факт; MAPE — среднее её модуля. Направленная точность — доля предсказаний, правильно определивших направление изменения к предыдущему месяцу. Калибровка уверенности — корреляция между уровнем уверенности LLM (0–100) и MAPE. Num Obs — число наблюдений. Отказы — случаи, когда модель воздержалась от предсказания (ответ «null» или 0), включая пропуски данных.
Панель A: СтавкиME (%)MAE (%)Порог. точн. (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
До отсечки, 01/1990 — 09/2023
Рост ВВП0.010.1596.2796.99−0.271341
Инфляция0.000.0498.0293.07−0.114050
Безработица−0.000.0399.2683.420.094050
10-л. трежерис−0.000.0698.5288.12−0.404050
После отсечки, 10/2023 — 02/2025
Рост ВВП0.010.9540.00100.0060
Инфляция0.350.3847.0656.250.70170
Безработица−0.200.2652.9431.250.47170
10-л. трежерис−0.240.4829.4150.000.16170
Панель B: УровниMPE (%)MAPE (%)Порог. точн. (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
До отсечки, 01/1990 — 09/2023
VIX3.256.7494.6287.40−0.4239015
Закладки домов−2.383.92100.0081.91−0.243996
Nonfarm Payrolls−7.6566.3095.5694.06−0.114050
Недавний период до отсечки, 10/2014 — 09/2023
VIX0.040.34100.0098.13−0.201080
Закладки домов−0.221.0695.2898.10−0.141062
Nonfarm Payrolls−0.000.00100.00100.00−0.141080
После отсечки, 10/2023 — 02/2025
VIX16.8721.1450.0061.54143
Закладки домов2.258.5435.2956.25170
Nonfarm Payrolls69.5197.4458.8268.75−0.21170
Рисунок 3
Рисунок 3. Воспроизведение точных числовых значений макроиндикаторов: инфляция, доходность 10-летних трежерис, рост ВВП и уровень безработицы в сравнении с фактическими значениями. Панели A, C, E и G — факт против оценки; панели B, D, F и H — ошибка оценки, (оценка − факт)/факт, в процентах (5 означает 5%). Период после отсечки (с 10/2023) закрашен серым.

Для уровней воспроизведение остаётся высоким: пороговые точности 94–100% по всем индикаторам за весь период до обучения. Более того, при фокусе на последнем 10-летнем отрезке выборки до обучения результативность улучшается драматически: средние абсолютные процентные ошибки падают до 1.06% для закладок домов, 0.34% для VIX и 0.00% для nonfarm payrolls, а пороговая точность растёт до 95–100%. Этот эффект недавности указывает на более сильное запоминание свежих данных — вероятно, из-за более плотной представленности в обучающем корпусе.

Напротив, метрики оценки в периоде после отсечки воспроизведения не предполагают. Для ставок средние абсолютные ошибки значительно растут — от 0.26% (безработица) до 0.95% (рост ВВП). Пороговая точность падает до 29.41% (10-летние трежерис) — 52.94% (безработица). Для уровней — тот же слом воспроизведения. Средняя абсолютная процентная ошибка резко подскакивает по сравнению с воспроизведением в недавнем периоде до отсечки: например, для nonfarm payrolls — с 0% до 97.4%. Пороговая точность падает с более чем 94% по всем индикаторам до 35.3% (закладки), 50.0% (VIX) и 58.8% (nonfarm payrolls).

Высокая точность воспроизведения для ставок и недавних уровней подчёркивает проблему запоминания при оценке прогнозных способностей LLM в течение периода обучения. Способность модели воспроизводить точные макроэкономические значения, особенно для процентных индикаторов и недавних периодов, говорит, что видимый прогнозный успех на данных до отсечки может проистекать из извлечения запомненной информации, а не подлинного экономического анализа. Более слабая результативность для уровней за полный период, особенно для волатильных индикаторов вроде nonfarm payrolls, намекает на селективное запоминание, при котором определённые типы данных или временные отрезки удерживаются менее надёжно. С другой стороны, воспроизведения после отсечки мы не наблюдаем.

5.2. Воспроизведение рыночных индексов

Далее мы оцениваем запоминание GPT-4o данных рыночных индексов, тестируя способность воспроизводить дневные и месячные значения S&P 500, Dow Jones Industrial Average (DJIA) и Nasdaq Composite на данных с января 1990 по февраль 2025. Для тестов числового воспроизведения мы запрашивали точные закрытия на дневной частоте — и без контекста, и с уровнями двух предыдущих дней, — а также месячные доходности. Дополнительно мы оценивали направленные изменения (вверх/вниз) и относительную результативность пар индексов на месячной частоте. Метрики: MPE, MAPE и направленная точность (доля предсказаний, правильно определивших направление изменения к предыдущему периоду) для числовых предсказаний и точность для направленных задач и задач относительной результативности — всё в сравнении с фактическими значениями.

Результаты приведены в таблице 2 с разделением периодов до отсечки (до октября 2023) и после (после октября 2023) для изоляции эффектов запоминания. Для точных дневных уровней до отсечки GPT-4o демонстрирует сильное воспроизведение: MAPE 0.61% для S&P 500, 0.53% для DJIA и 1.80% для Nasdaq Composite, направленная точность от 69.4% (Nasdaq) до 80.7% (DJIA). Контекст слегка улучшает точность для S&P 500 (0.50%) и Nasdaq (1.06%). Прямой запрос доходностей, тестируемый помесячно, даёт более высокую направленную точность (79.5–85.2%), отражая устойчивое запоминание направленных трендов. Другие тесты дополнительно подтверждают запоминание: прямой запрос направления («вверх» или «вниз») даёт точность выше 79% по всем индексам, а точность относительной результативности — от 82.9% (S&P 500 против Nasdaq) до 87.1% (S&P 500 против DJIA).

Напротив, после отсечки результативность рушится. Например, без контекста MAPE раздувается до 13.01–20.48% для точных уровней, а направленная точность падает до почти случайных уровней (44.0–49.3%). Схожие свидетельства для воспроизведения с контекстом: направленная точность 51.9–54.4% после отсечки — существенно ниже, чем 68.6–80.8% до отсечки. Эти результаты не указывают на утечку данных за дату отсечки обучения.

Таблица 2. Метрики оценки для фондовых индексов. Тесты на дневной или месячной частоте. Мы просим LLM воспроизвести закрытие индекса в каждый торговый день. Панель A — метрики предсказаний дневных уровней и дневных уровней с контекстом (уровни двух предыдущих дней), а также месячных доходностей: MPE, MAPE и направленная точность, в процентных пунктах (0.10 означает 0.10%). Направленная точность — доля предсказаний уровней, правильно следующих направлению изменения к предыдущему дню. Калибровка уверенности — корреляция уверенности LLM (0–100) и MAPE. Панель B — точности предсказания направленных изменений и относительной результативности пар индексов за месяц.
Панель A: Числовые тестыMPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
Дневные уровни: до отсечки, 02.01.1990 — 29.09.2023
SP5000.120.6180.58−0.148 4880
DJIA0.110.5380.66−0.368 4880
Nasdaq Composite0.181.8069.38−0.128 4880
Дневные уровни: после отсечки, 02.10.2023 — 28.02.2025
SP500−16.7816.8745.70−0.1029262
DJIA−12.9613.0149.26−0.1427183
Nasdaq Composite−20.4020.4844.03−0.2529460
Дневные уровни: до отсечки с контекстом, 02.01.1990 — 29.09.2023
SP5000.130.5080.78−0.168 4880
DJIA0.060.4680.06−0.178 4880
Nasdaq Composite0.001.0668.62−0.188 4880
Дневные уровни: после отсечки с контекстом, 02.10.2023 — 28.02.2025
SP5000.000.6454.40−0.0731935
DJIA−0.040.5453.170.0233222
Nasdaq Composite−0.030.9251.85−0.0929856
Месячные доходности: до отсечки, 01/1990 — 09/2023
SP500−0.703.3685.190.274050
DJIA−0.703.2880.490.264050
Nasdaq Composite−1.034.8379.510.214050
Месячные доходности: после отсечки, 10/2023 — 02/2025
SP500−1.163.2041.67−0.28125
DJIA−0.803.1830.77−0.06134
Nasdaq Composite−2.464.0741.67−0.39125
Панель B: Другие тестыТочность (%)Калибровка увер.
Месячные направленные изменения: до отсечки
SP50082.800.33
DJIA80.630.29
Nasdaq Composite79.360.29
Месячная относительная результативность: до отсечки
SP500, DJIA87.100.23
SP500, NDAQ82.860.49
NDAQ, DJIA83.870.42

Резкая точность до отсечки, особенно для точных уровней и относительной результативности, подчёркивает масштабное запоминание GPT-4o исторических данных индексов, создавая трудности для прогнозных исследований в экономике и финансах. Способность модели воспроизводить точные закрытия и правильно определять направленные тренды внутри периода обучения означает, что любой видимый предсказательный успех может отражать запомненные данные, а не аналитическую способность. Ничтожное улучшение от контекста и полный провал результативности после отсечки подкрепляют вывод, что эти результаты проистекают из экспозиции обучающим данным. Эти находки предостерегают от использования LLM для исторического анализа рынка без гарантии, что данные вне их обучающего охвата: выходы рискуют быть артефактами запоминания, а не подлинного экономического предвидения.

5.3. Идентификация дат заголовков

В этом разделе мы оцениваем способность LLM извлекать информацию о датах из заголовков первой полосы и, в свою очередь, предсказывать агрегированный фондовый индекс. Для этого мы предъявляем GPT-4o наборы заголовков первой полосы The Wall Street Journal (примерно 9 заголовков в день) из нашего датасета в 90 123 заголовка с января 1990 по февраль 2025, не раскрывая даты публикации. Мы просили модель определить, когда эти заголовки появились, и — в отдельном варианте теста — предсказать уровень S&P 500 на следующий торговый день. Результативность оценивается несколькими метриками точности: точность года, точность месяца и года, точность точной даты, средняя абсолютная разница в днях и калибровка уверенности. Сравнивая результаты между заголовками до отсечки (где запоминание возможно) и после отсечки (где оно невозможно), мы можем чётко разграничить инференциальные способности модели и её способность воспроизводить запомненную хронологию.

Результаты — в таблице 3. GPT-4o демонстрирует замечательное запоминание хронологии заголовков внутри периода обучения. Для заголовков до отсечки она достигает точности 98.5% в определении правильного года и 90.4% — правильного месяца и года. Даже для точной даты модель достигает 47.0% — значимо выше случайного уровня. Когда модель ошибается, её оценки остаются близкими к фактической дате: средняя абсолютная разница — 9.5 дня.

В разительном контрасте для заголовков, опубликованных после даты отсечки обучения, результативность драматически деградирует по всем метрикам. Точность года падает до 28.8%, месяца и года — до 20.7%, точной даты — до всего 7.9%. Средняя абсолютная разница вырастает до 414.5 дня — по сути случайное угадывание.

Таблица 3. Метрики оценки для новостных заголовков. Метрики разделены на две панели: «Даты заголовков» (только точность предсказанных дат) и «Даты заголовков и уровни» (модель даёт и даты, и уровни S&P 500 на следующий торговый день). Средняя разница в днях — средняя знаковая разница (в днях) между предсказанной и фактической датами; средняя абсолютная разница — среднее модуля. Точность года, месяца и года, точной даты — процент предсказаний, правильно воспроизводящих год, месяц и год, точную дату соответственно. Калибровка уверенности — корреляция уверенности LLM (0–100) и точности дат. MPE и MAPE S&P 500 измеряют точность предсказанных уровней индекса, в процентных пунктах (−0.01 означает −0.01%).
Ср. разница, дниСр. абс. разница, дниТочн. года (%)Точн. месяца и года (%)Точн. даты (%)Калибровка увер.MPE S&P 500 (%)MAPE S&P 500 (%)
Даты заголовков
Период до обучения−0.779.5298.4590.3847.03−0.10
Период после обучения413.46414.5428.8120.717.86−0.12
Даты заголовков и уровни
Период до обучения−1.309.6398.5090.3139.31−0.100.000.01
Период после обучения456.84457.1326.2019.475.530.29−0.210.22

Схожую картину мы наблюдали, расширив тест: модель должна дать и дату заголовка, и соответствующий уровень S&P 500 на следующий торговый день. Для периода до обучения модель достигает высокой временной точности при почти идеальном воспроизведении значений индекса (средняя абсолютная процентная ошибка всего 0.01%). Для заголовков после обучения и идентификация дат, и предсказания уровней индекса стали значимо менее точными.

Резкий разрыв результативности на дате отсечки обучения даёт убедительное свидетельство, что видимое «знание» моделью финансовой хронологии проистекает в первую очередь из запоминания, а не из вывода или рассуждения. Эта находка вызывает серьёзные опасения по поводу использования LLM для анализа исторических связей между новостными событиями и движениями рынка внутри их периода обучения: ответы могут отражать запомненные ассоциации, а не подлинные аналитические инсайты.

5.4. Воспроизведение цен отдельных акций

Дополняя более ранние результаты по рыночным индексам, в этом разделе мы исследуем запоминание на уровне отдельных бумаг. В частности, мы тестируем способность модели воспроизводить цены закрытия конца месяца для заметных акций («Великолепная семёрка») и отдельных акций в кросс-секции.

5.4.1. Акции «Великолепной семёрки»

Мы начинаем анализ с акций «Великолепной семёрки» (META, GOOGL, AMZN, TSLA, NVDA, MSFT, AAPL) с января 1990 по сентябрь 2023 — до отсечки обучения модели (октябрь 2023). Мы запрашивали цены и без контекста, и с ценами закрытия двух предыдущих месяцев, используя данные CRSP. Результативность оценивалась через MPE, MAPE и направленную точность (правильное направление изменения к предыдущему месяцу) в сравнении с фактическими ценами закрытия. Метрики — в таблице 4; факт против оценки без контекста — на рисунках 4 и 5.

Результаты выявляют неравномерную точность воспроизведения по акциям с заметным улучшением при наличии контекста. Без контекста (панель A) GPT-4o лучше всего справляется с более недавно листингованными акциями, такими как META (MAPE 0.37%, направленная точность 99.26%), но испытывает трудности с акциями с длинной историей: AAPL (ошибка 36.44%, точность 72.61%) и MSFT (26.62%, 76.75%). Ошибки высоки и для NVDA (23.92%) и TSLA (9.99%), что указывает на селективное запоминание, связанное с длиной ценового ряда или заметностью данных. С контекстом точность улучшается значительно (панель B): MAPE падает до 0.40% для META, 0.84% для GOOGL и 5.89% для AAPL, а направленная точность растёт до 98.52%, 95.52% и 83.91% соответственно. Это контекстное усиление зеркалит слабые улучшения для рыночных индексов, показывая, что недавние ценовые подсказки помогают модели точнее заякорить воспроизведение, особенно для акций с длинной историей.

Таблица 4. Метрики оценки для акций «Великолепной семёрки» (META, GOOGL, AMZN, TSLA, NVDA, MSFT, AAPL). Мы просим LLM воспроизвести цены закрытия на конец каждого месяца. MPE, MAPE и направленная точность в процентных пунктах (0.18 означает 0.18%). MPE — среднее процентной ошибки (предсказание − факт)/факт; MAPE — среднее её модуля. Направленная точность — доля предсказаний в правильном направлении (вверх/вниз) к предыдущему месяцу. Калибровка уверенности — корреляция уверенности LLM (0–100) и MAPE. Панель A — промпт с пустым контекстом, панель B — промпт с ценами закрытия двух предыдущих месяцев.
Панель A: Без контекстаMPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.Num ObsНачалоКонецОтказы
До отсечки, 01/1990 — 09/2023
META0.180.3799.26−0.0813705/201209/20230
GOOGL−1.411.7993.42−0.1922908/200409/20231
AMZN−5.877.9891.77−0.1231705/199709/20230
TSLA−9.219.9992.45−0.1316006/201009/20230
NVDA−20.6023.9277.05−0.5329301/199909/20234
MSFT−25.7226.6276.75−0.6540101/199009/202314
AAPL−35.1436.4472.61−0.5439901/199009/20236
После отсечки, 10/2023 — 02/2025
META−29.5929.6050.000.48510/202302/202512
GOOGL138.06170.0955.56−0.981010/202302/20257
AMZN−22.0622.0642.860.48810/202302/20257
TSLA−0.8120.15100.000.61610/202302/202511
NVDA436.43436.43100.00−0.64810/202302/20259
MSFT−19.2519.2545.45−0.481210/202302/20255
AAPL−15.4615.4630.000.361110/202302/20256
Панель B: С контекстомMPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.Num ObsНачалоКонецОтказы
До отсечки, 01/1990 — 09/2023
META−0.180.4098.52−0.1013605/201209/20231
GOOGL−0.270.8495.520.1022408/200409/20236
AMZN−0.423.1293.350.0231705/199709/20230
TSLA−0.872.3494.87−0.1715706/201009/20233
NVDA1.018.8080.68−0.1729601/199909/20231
MSFT1.244.5784.71−0.2140001/199009/20235
AAPL−1.375.8983.91−0.2540501/199009/20230
После отсечки, 10/2023 — 02/2025
META−5.045.2950.000.14710/202302/202510
GOOGL0.886.2650.00−0.36910/202302/20258
AMZN−2.726.0654.550.541210/202302/20255
TSLA−5.6710.7560.000.021110/202302/20256
NVDA85.8999.3966.670.451010/202302/20257
MSFT−0.802.7550.00−0.14910/202302/20258
AAPL−2.904.1255.56−0.101010/202302/20257
Рисунок 4
Рисунок 4. Воспроизведение цен закрытия AMZN, GOOGL, META и TSLA без контекста. Панели A, C, E и G — факт против оценки; панели B, D, F и H — ошибка оценки, (оценка − факт)/факт, в процентах (5 означает 5%). Период после отсечки (с 10/2023) закрашен серым.
Рисунок 5
Рисунок 5. Воспроизведение цен закрытия AAPL, MSFT и NVDA без контекста. Панели A, C и E — факт против оценки; панели B, D и F — ошибка оценки, в процентах. Период после отсечки (с 10/2023) закрашен серым.
Рисунок 6
Рисунок 6. Воспроизведение цен закрытия AAPL, MSFT и NVDA с контекстом (модели даны цены закрытия двух предыдущих концов месяца). Панели A, C и E — факт против оценки; панели B, D и F — ошибка оценки, в процентах. Период после отсечки (с 10/2023) закрашен серым.

Факт против оценки с контекстом для NVDA, AAPL и MSFT показан на рисунке 6. В сравнении с рисунком 5 этот рисунок показывает, почему любая результативность запоминания даёт лишь нижнюю границу. Ошибки существенно уменьшаются, когда мы даём ChatGPT цены за два предыдущих месяца. Эта ситуация значима, поскольку при прогнозировании исследователи обычно предоставляют контекстную информацию.

В целом эти результаты расширяют наши результаты по рыночным индексам, подчёркивая, что запоминание GPT-4o неоднородно по бумагам и чувствительно к контекстным подсказкам и специфике акций. Высокая точность для META и GOOGL, особенно с контекстом, параллельна сильному воспроизведению недавних макроуровней и значений индексов, указывая на устойчивое запоминание заметных, часто упоминаемых данных. Напротив, большие ошибки для давно листингованных акций вроде AAPL и MSFT даже с контекстом согласуются со слабым воспроизведением долгосрочных макроуровней, указывая на возможное «размывание» старых данных в обучающем корпусе. Это селективное запоминание усиливает вызов для финансовых исследований: видимый прогнозный успех для отдельных акций внутри периода обучения может отражать запомненные цены, а не предсказательную способность, что требует оценок на данных после отсечки для методологической строгости.

5.4.2. Отдельные акции в кросс-секции

Чтобы расширить анализ запоминания GPT-4o, мы исследуем также воспроизведение цен закрытия конца месяца для отдельных акций, сгруппированных по рыночной капитализации, за январь 1990 — декабрь 2024. Акции делятся на квинтили капитализации с границами по акциям только NYSE. Мы случайно отбираем 50 акций из каждого квинтиля с ежегодным перевыбором для учёта изменений размера, используя ценовые данные CRSP. Мы тестируем воспроизведение без контекста, с ценами двух предыдущих месяцев и на недавнем 10-летнем периоде до отсечки для оценки эффектов недавности. Метрики (MPE, MAPE и направленная точность) — в таблице 5. Факт против оценки — на рисунке 7.

Таблица 5. Метрики оценки для отдельных акций по квинтилям размера. Акции делятся на квинтили по капитализации (границы по акциям NYSE), из каждого квинтиля отбирается 50 акций с ежегодным перевыбором. Мы просим LLM воспроизвести цены закрытия конца месяца по каждой акции. MPE, MAPE и направленная точность в процентных пунктах (0.78 означает 0.78%). Результаты даны для полного периода, недавнего периода за последние 10 лет и варианта «с контекстом» (модели даны цены закрытия двух предыдущих месяцев).
Панель A: Без контекста
Квинтиль
MPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
До отсечки, 01/1990 — 09/2023
11.2024.7042.66−0.1011 9256 828
2−0.5519.1748.78−0.1312 2626 394
3−3.0417.0651.02−0.3213 0775 469
4−3.3614.1853.64−0.2213 5934 908
5−4.5511.2961.11−0.2614 8163 576
Недавний период, 01/2014 — 09/2023
14.2415.2448.62−0.035 41596
22.7110.1858.59−0.045 44826
31.536.4563.61−0.025 40320
40.544.7969.210.015 30910
50.213.1679.54−0.015 4447
После отсечки, 10/2023 — 12/2024
153.3697.8329.710.01238479
227.2446.0639.470.03302426
312.6339.1838.790.04290440
4−6.0423.5237.14−0.03322413
50.2327.3246.360.03390348
Панель B: С контекстом
Квинтиль
MPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
До отсечки, 01/1990 — 09/2023
11.3510.8074.460.0118 187565
21.4710.1474.35−0.0118 029627
30.658.4774.01−0.0317 839707
41.157.7774.45−0.0117 767734
50.725.7375.58−0.0617 565827
Недавний период, 01/2014 — 09/2023
11.8610.6973.35−0.015 376135
20.978.5573.62−0.045 311163
30.456.6872.88−0.105 192231
40.475.4874.52−0.105 083236
50.353.2980.56−0.115 217234
После отсечки, 10/2023 — 12/2024
110.5525.5673.500.03533184
21.3211.4976.400.04525203
30.959.9372.38−0.11456274
40.908.7472.18−0.10455280
51.449.0676.020.01438300
Рисунок 7
Рисунок 7. Воспроизведение точных числовых уровней цен закрытия по квинтилям размера. Показана равновзвешенная средняя цена пяти групп по капитализации, Q1 (наименьшие) — Q5 (наибольшие). Каждый квинтиль включает 50 случайно отобранных акций с ежегодным перевыбором; границы капитализации по акциям NYSE. Период после отсечки (с 10/2023) закрашен серым.

Результаты показывают более слабое воспроизведение по сравнению с «Великолепной семёркой», с улучшением точности для более крупных акций и недавних периодов. Без контекста в периоде до отсечки MAPE высоки: от 11.29% для квинтиля 5 (крупнейшие акции) до 24.70% для квинтиля 1 (наименьшие). Направленная точность низка: 42.66–61.11%. Высокие доли отказов указывают на неуверенность по менее заметным акциям. За недавний 10-летний период ошибки значительно снижаются: от 3.16% (квинтиль 5) до 15.24% (квинтиль 1), направленная точность растёт до 48.6–79.5% при почти нулевых отказах — эхо эффекта недавности в макроуровнях. После отсечки ошибки подскакивают: MAPE от 23.52% до 97.83%, направленная точность всех квинтилей ниже 46.4%, у квинтиля 1 — лишь 29.7%. С контекстом направленная точность улучшается: все квинтили достигают минимум 74% в периоде до отсечки. Более крупные акции стабильно показывают лучшее воспроизведение — вероятно, из-за большей заметности данных, в согласии с более сильными результатами «Великолепной семёрки».

Эти находки дополняют результаты по «Великолепной семёрке», обнаруживая, что запоминание GPT-4o слабеет для менее заметных акций, особенно мелких, и сильнее всего для недавних данных крупной капитализации. Высокие ошибки и отказы для мелких акций контрастируют с точностью для META или GOOGL, указывая, что запоминание смещено к широко освещаемым бумагам, — аналогично устойчивому воспроизведению индексов и макроставок. Эффекты недавности и контекста параллельны улучшениям в предыдущих тестах, но более низкая направленная точность с контекстом указывает на пределы улавливания трендов для разнообразных портфелей. Снова: это селективное запоминание подчёркивает риск полагаться на LLM в историческом анализе акций — видимая прогнозная точность может проистекать из запомненных цен заметных акций, а не из широкого предсказательного инсайта, что усиливает необходимость оценок после отсечки.

5.5. Могут ли LLM следовать промптам с «фальшивой» отсечкой знаний?

Чтобы оценить, способна ли GPT-4o придерживаться инструкций не использовать информацию после искусственно наложенной даты отсечки (фальшивой отсечки), мы тестируем её результативность в предсказании темпов роста реального ВВП США за период с марта 1990 по июнь 2023.

Мы проектируем три промптовых условия с искусственной отсечкой в декабре 2010: (i) и системное, и пользовательское сообщения явно ограничивают знания данными до 2010; (ii) фальшивую отсечку накладывает только системный промпт; (iii) только пользовательский промпт. Задача — предсказать квартальный рост ВВП год-к-году; данные разделены на периоды до фальшивой отсечки (1990–2010) и после (с 2011), чтобы оценить соблюдение ограничения. Метрики: MPE, MAPE, направленная точность и число отказов — в таблице 6.

Когда отсечку до 2010 навязывают и системный, и пользовательский промпты, GPT-4o хорошо работает до этой искусственной отсечки (MAE 0.27%, направленная точность 95.12%), но испытывает трудности после неё: выше ошибка (0.59%), ниже точность (69.23%) и 38 отказов из 51 наблюдения после фальшивой отсечки. По предложению 1 такое поведение наблюдательно эквивалентно нескольким противоречащим объяснениям: ограничение действительно работает (модель не может обращаться к информации после 2010), поведенческое подавление (модель сохраняет запомненную информацию, но научилась её скрывать) или стратегическое послушание (модель отыгрывает то, что, по её мнению, сказала бы ограниченная модель). Мы также находим, что результаты схожи, когда отсечку 2010 указывает только пользовательский промпт. Напротив, когда отсечку указывает только системный промпт, точность до фальшивой отсечки слегка улучшается (ошибка 0.11%, точность 97.59%), но результативность после фальшивой отсечки остаётся неправдоподобно сильной (ошибка 0.05%, точность 98.00%) при единственном отказе из 50 наблюдений. Этот минимальный спад точности после фальшивой отсечки указывает, что без подкрепления пользовательскими инструкциями модель, вероятно, обращается к запомненным данным, подрывая ограничение отсечки.11

Таблица 6. Фальшивая отсечка знаний. Результативность GPT-4o в предсказаниях роста реального ВВП США на данных Real-Time Data Set ФРБ Филадельфии при разных искусственно наложенных ограничениях отсечки знаний: обе (системная и пользовательская) инструкции, только системная, только пользовательская. Задача — предсказание квартального роста ВВП год-к-году; данные разделены на периоды до фальшивой отсечки (1990–2010) и после (с 2011). Метрики: ME, MAE, пороговая точность (порог 2.5%), направленная точность, калибровка уверенности, число наблюдений и отказов.
ME (%)MAE (%)Порог. точн. (%)Направл. точн. (%)Калибровка увер.НачалоКонецNum ObsОтказы
Рост ВВП: отсечка и в системном, и в пользовательском сообщении
До фальш. отсечки0.070.2797.5995.12−0.0201.03.199001.12.2010830
После фальш. отсечки0.580.5969.2375.000.5101.03.201101.09.20231338
Рост ВВП: отсечка только в системном сообщении
До фальш. отсечки0.020.1197.5997.56−0.1201.03.199001.12.2010830
После фальш. отсечки−0.010.0598.00100.00−0.2401.03.201101.09.2023501
Рост ВВП: отсечка только в пользовательском сообщении
До фальш. отсечки0.080.2298.8096.34−0.1801.03.199001.12.2010830
После фальш. отсечки0.600.6166.6770.59−0.1501.03.201101.09.20231832

В дополнительном наборе анализов, представленных в таблице A4, мы проводим аналогичный эксперимент для уровней S&P 500 на дневной частоте. В тесте «скользящей фальшивой отсечки» мы модифицируем пользовательский промпт инструкцией «Do not use any knowledge after time {t − 1}», где {t − 1} — дата перед той, которую мы просим воспроизвести. Мы применяем эту процедуру в периодах до и после отсечки и находим, что результаты совпадают с исходной процедурой воспроизведения без инструкций фальшивой отсечки: точность до отсечки по-прежнему очень высока по сравнению с периодом после. Для исходного бенчмарка модель воспроизводит уровни индекса до отсечки с малыми ошибками (MAPE 0.61%, направленная точность 80.6%), но плохо работает после настоящей отсечки (MAPE 16.9%, направленная точность 45.7%). Со скользящей фальшивой отсечкой результативность до отсечки остаётся сильной (MAPE 0.81%, направленная точность 69.6%), а после — слабой (MAPE 17.2%, направленная точность 42.2%). Мы также проводим два подвыборочных теста для периодов 1990–2008 и 2009–2023 с индивидуальными датами отсечки 31 декабря 1999 и 31 декабря 2015 соответственно. Результаты до и после этих дат должны быть схожими в обоих периодах, поскольку все даты попадают в период до настоящей отсечки модели. Мы это и находим: для подвыборки 1990–2008 MAPE даже падает с 1.39% до фальшивой отсечки до 0.67% после, а направленная точность растёт с 59.3% до 74.4%. Аналогично, в подвыборке 2009–2023 MAPE слегка падает с 0.05% до 0.03%, а направленная точность слегка растёт с 97.3% до 98.1%.

Эти результаты хорошо согласуются с нашими более ранними находками по макроиндикаторам и рыночным индексам, где высокая точность до отсечки отражает запоминание. Сильная результативность после фальшивой отсечки без пользовательского подкрепления (точность 98%) демонстрирует, что промптовые ограничения эмпирически не предотвращают доступ к запомненным данным. Более того, даже если бы фальшивые отсечки успешно снижали точность, предложение 1 устанавливает: мы не могли бы верифицировать, что ограничение действительно сработало, — сниженная точность может отражать либо успешное ограничение исторической информацией, либо то, что модель научилась подавлять известные ответы. Эти наблюдательно эквивалентные исходы делают целевой эстиманд фундаментально неидентифицируемым. Высокая доля отказов при двойных промптах указывает на частичное соблюдение, но не на полную изоляцию от запомненной информации, иллюстрируя практическую трудность ограничения выходов модели даже при теоретической невозможности верификации.

5.6. Тестирование эффективности маскирования

Чтобы оценить, способно ли маскирование помешать GPT-4o обращаться к запомненной информации, мы исследуем её способность определять фирму, год и квартал анонимизированных стенограмм отчётных конференц-звонков с января 2006 по сентябрь 2023 — целиком внутри периода до отсечки обучения (октябрь 2023). Стенограммы анонимизированы методом нейтрализации сущностей Engelberg et al. (2025) с удалением идентифицирующих деталей вроде названий компаний и дат. Мы фокусируемся на акциях «Великолепной семёрки» (AAPL, META, MSFT, GOOGL, NVDA, TSLA, AMZN) и портфелях по терцилям капитализации (крупные, средние, мелкие), измеряя результативность через среднюю разницу лет, среднюю абсолютную разницу лет и точности определения точного года, квартала с годом и фирмы. Результаты — в таблице 7.

Таблица 7. Анонимизированные конференц-звонки. Результативность GPT-4o в определении правильной фирмы, года и квартала анонимизированных стенограмм отчётных звонков из Capital IQ за период до отсечки (январь 2006 — сентябрь 2023). Для каждой фирмы: средняя и средняя абсолютная разница между определённым моделью и фактическим годом стенограммы, а также процент звонков с правильно определёнными точным годом, точным кварталом с годом и фирмой. Результаты сгруппированы по фирмам и терцилям капитализации (границы терцилей по акциям NYSE).
Панель A: «Великолепная семёрка»
Тикер
Ср. разница летСр. абс. разница летТочн. года (%)Точн. квартала и года (%)Точн. фирмы (%)Num Obs
До отсечки, 01/2006 — 09/2023
AAPL−0.030.0595.9593.24100.0074
META0.220.2773.472.04100.0049
MSFT−0.670.7861.641.37100.0073
GOOGL−1.051.5959.466.7691.8974
NVDA−1.341.6650.001.6193.5562
TSLA−3.273.4539.293.5785.7156
AMZN−1.872.1130.674.0085.3375
Панель B: Фирмы по капитализации
Размер
Ср. разница летСр. абс. разница летТочн. года (%)Точн. квартала и года (%)Точн. фирмы (%)Num Obs
До отсечки, 01/2006 — 09/2023
Крупные−1.541.9244.698.0965.77593
Средние−1.872.3739.937.3440.78586
Мелкие−1.522.2633.265.7930.90466

GPT-4o демонстрирует замечательную способность деанонимизировать стенограммы, особенно для заметных фирм. Для AAPL модель достигает 100% точности фирмы, 95.95% точности года и 93.24% точности квартала с годом при средней абсолютной разнице лет всего 0.05 года. META и MSFT также показывают идеальную идентификацию фирмы (100%), хотя точность года падает до 73.47% и 61.64% соответственно, а точность квартала с годом низка (2.04% и 1.37%). Результативность чуть слабее для GOOGL (91.89% точности фирмы), NVDA (93.55%), TSLA (85.71%) и AMZN (85.33%), с точностью года от 30.67% до 59.46% и средними абсолютными разницами лет 1.59–3.45 года. По терцилям капитализации точность фирмы снижается с 65.77% для крупных до 30.90% для мелких, а точность года — с 44.69% до 33.26%, указывая на более сильное запоминание крупных, заметных фирм — в согласии с нашими портфельными результатами.

Эти результаты демонстрируют, что маскирование эмпирически не предотвращает деанонимизацию. Однако даже когда тесты деанонимизации не срабатывают, предложение 1 и замечание 1 устанавливают: нельзя заключить, что ограничение сработало — неудавшаяся реконструкция может означать и подлинную анонимизацию, и просто недоступность запомненного знания через данный конкретный тест. Высокая точность фирмы и года для «Великолепной семёрки» (100% для AAPL/META/MSFT) — нижняя граница того, что модель запомнила; фактическое знание, вероятно, существенно больше. Более слабая результативность для мелких акций зеркалит более высокие ошибки для портфелей малой капитализации, подкрепляя вывод, что запоминание благоприятствует хорошо представленным сущностям. Способность определять фирмы и годы из анонимизированных текстов означает, что LLM могут использовать тонкие подсказки для доступа к запомненным данным, подрывая маскирование как защиту от загрязнения прогнозов. Эта находка подчёркивает необходимость данных после отсечки для оценки истинной предсказательной способности: замаскированные исторические анализы всё равно могут отражать запомненные исходы, а не подлинный инсайт.

В следующем анализе мы дополнительно проверяем, способно ли маскирование помешать GPT-4o обращаться к запомненной информации, повторяя тест для фирменных новостных заголовков с января 2000 по сентябрь 2023 (период до отсечки). Дополнительно есть данные с октября 2023 по июнь 2024 в периоде после отсечки. В отличие от стенограмм звонков, фирменные заголовки — короткие тексты с более однородными формулировками. После нейтрализации сущностей рутинные новости — торговля акциями со стороны топ-менеджеров или анонсы отчётности — почти неразличимы между фирмами и во времени. По этим причинам в данном тесте мы группировали заголовки по месяцам, а не давали GPT-4o по одному.

В таблице 8 мы показываем, что такой подход к маскированию мог разумно затемнить даты новостей, но GPT-4o угадывала фирмы «Великолепной семёрки» с точностью 70%, верхний дециль по капитализации — с точностью 55.64%, верхний квинтиль — 46.71%. Даже по датам, хотя LLM не сверхточна, она угадывала год в периоде до отсечки почти в 20% случаев, а в более недавнем периоде около отсечки октября 2023 точность вырастала до 50%.

Таблица 8. Анонимизированные фирменные заголовки. LLM предъявлялась группа анонимизированных заголовков RavenPack о фирме за месяц с просьбой назвать месяц, год и компанию. Оставлены только группы минимум из 10 заголовков. Панель A — результаты идентификации анонимизированных заголовков; средняя разница месяцев — средняя знаковая разница (в месяцах) между предсказанной и фактической датами, средняя абсолютная — среднее модуля. Точность года — процент предсказаний с правильным годом; точность фирмы — с правильным тикером. Панель B — разбивка по децилям капитализации. Панель C — бенчмарк точности дат по деанонимизированным заголовкам.
Панель A: Даты и фирмы по анонимизированным заголовкамСр. разница мес.Ср. абс. разница мес.Точн. года (%)Точн. фирмы (%)Num Obs
Различные периоды
Период до обучения37.7655.1719.6521.138 714
До обучения, недавний (01/2014–09/2023)26.3442.4423.4423.212 133
До обучения, около отсечки (01/2022–09/2023)−3.6513.0150.4727.96422
Период после обучения−15.2615.2615.7928.57133
Различные размеры фирм
«Великолепная семёрка»13.3926.1033.3370.00390
Верхний дециль18.6832.1730.2555.64638
Верхний квинтиль23.1437.4625.7146.711 276
Крупные25.9944.3622.5932.685 233
Мелкие и средние43.5562.9815.118.121 145
Панель B: Децили размера
Дециль
Ср. разница мес.Ср. абс. мес.Точн. года (%)Точн. фирмы (%)Мес.-фирмУник. фирмМин. кап. (\$ млрд)Макс. кап. (\$ млрд)Медиана кап. (\$ млрд)
148.0067.4914.298.796372630.252.281.04
240.7660.5414.739.096382552.285.653.88
331.4851.5022.1012.546382265.6512.018.57
427.5848.5417.4323.8663717312.0121.3216.33
525.7547.9620.0625.2463814721.3236.9827.93
620.4742.6522.4136.2163810636.9859.9847.59
729.2148.5321.5136.736377959.9899.7278.37
822.0234.9728.5336.836385299.72157.61127.24
927.5942.7421.1637.7763842157.61241.22191.06
1018.7132.2130.1455.5763732241.222831.10355.71
Панель C: Даты по деанонимизированным заголовкамСр. разница мес.Ср. абс. разница мес.Точн. месяца и года (%)Num Obs
Период до обучения1.533.9476.718 733
До обучения, недавний2.853.5277.812 181
Период после обучения−1.201.4757.89152

Хотя для фирменных заголовков подход маскирования оказался более эффективным, он всё равно не может полностью помешать GPT-4o реконструировать различную идентифицирующую информацию. Однако возможно, что при достаточно коротком замаскированном тексте GPT-4o не сможет эффективно определить идентичность фирмы. Для проверки этой гипотезы мы дополнительно исследуем эффективность маскирования фирменных заголовков, отбирая по 50 акций на каждый дециль капитализации (с ежегодным перевыбором) и тестируя идентификацию фирм GPT-4o по одиночным заголовкам. В отличие от предыдущего теста, замаскированные заголовки даются по одному, а не группой. Поскольку одиночные заголовки, как правило, коротки и типовы, особенно после маскирования, у LLM мало различающей информации для идентификации фирм. Поэтому доли воспроизведения в периоде до отсечки в целом ниже, как показано в панели A таблицы 9. Однако они выше случайного уровня во всех децилях. Например, точность фирмы для дециля 10 с крупнейшими фирмами — 7.53%, более чем в пять раз выше случайного угадывания фирмы из дециля (1.41%). Напротив, результаты периода после отсечки показывают слабую способность воспроизведения: как показано в панели B, точность фирмы близка к случайной или ниже во всех децилях.

Таблица 9. Анонимизированные фирменные заголовки — точность тикера по одиночному заголовку. LLM предъявлялся анонимизированный заголовок RavenPack о фирме с просьбой назвать месяц, год и компанию. Выборка: январь 2000 — июнь 2024. «Самые частые новости» — точность стратегии всегда предсказывать фирму с наибольшим общим числом заголовков в выборке. «Случайно» — обратная величина числа уникальных фирм (точность равномерного случайного угадывания по фирмам дециля). AAPL — точность стратегии всегда предсказывать AAPL. Децили по акциям NYSE на каждый год, из каждого дециля случайно отбирается 50 акций с ежегодным перевыбором.
ДецильТочн. фирмы (%)Случайно (%)Самые частые новости (%)AAPL (%)ЗаголовковУник. фирмМедиана кап. (\$ млрд)Мин. кап. (\$ млрд)Макс. кап. (\$ млрд)
Панель A: До отсечки, 01/2000 — 09/2023
10.570.200.000.0011 5005010.450.251.09
20.700.250.000.0011 4494081.080.472.15
30.780.260.000.0011 6423841.820.763.49
41.000.290.000.0011 4893452.941.496.07
51.010.300.000.0011 6823324.822.2310.96
61.260.350.000.4911 3522848.013.1317.71
71.800.430.000.0011 61523213.875.4946.48
82.990.540.000.0011 26218424.379.2292.19
93.890.730.001.1311 26313751.5217.10239.51
107.531.417.013.1112 01271174.0642.132434.21
Панель B: После отсечки, 10/2023 — 06/2024
10.921.590.000.00433630.260.000.54
20.001.960.000.00378510.870.381.42
30.001.960.000.00425511.791.302.43
40.501.850.000.00404542.822.173.95
50.002.000.000.00396504.983.227.40
61.952.270.000.00411448.855.8114.40
70.722.500.000.004154015.598.9427.22
82.842.440.000.004234138.4417.3471.06
93.793.130.000.003963297.3833.65428.85
106.947.1442.8210.0541814497.4883.832434.21

Эти результаты маскирования обнаруживают фундаментальный компромисс. Чтобы LLM могла генерировать полезные прогнозы, текст должен содержать специфическую контекстную информацию. Но именно эта специфичность делает возможной идентификацию сущности. Рассмотрим замаскированный заголовок: «Фирма x сообщила о слабом спросе на продукт y в регионе z». Если детали достаточно генеричны, чтобы предотвратить идентификацию («некая компания сообщила о слабом спросе»), сигнал теряет предсказательную ценность. Если детали достаточно специфичны для предсказания («производитель смартфонов сообщил о слабом спросе в Китае в Q4 2018»), они раскрывают идентичность (Apple). Достичь одновременно эффективной анонимизации и содержательной прогнозной силы крайне сложно. В сочетании с замечанием 1, устанавливающим, что неудавшаяся идентификация не доказывает успешную анонимизацию, этот компромисс говорит, что маскирование не может надёжно решить проблему запоминания для задач прогнозирования.

5.7. Борьба с lookahead-смещением через экономическую логику

В предыдущих разделах мы показали, что эффективность смягчения lookahead-смещения через искусственно наложенные даты отсечки знаний и анонимизацию маскированием сущностей ограничена. Естественный вопрос: может ли дальнейшая абстракция — удаление исходной формулировки с сохранением экономического смысла — ослабить связь между текстом и внутренней памятью GPT-4o. В этом разделе мы тестируем, снижает ли преобразование фирменных заголовков в анонимизированную «экономическую логику» долю запоминания, всё ещё позволяя модели делать прогнозы. Если абстракция успешно удаляет идентифицирующую информацию и структуру предложения, сохраняя лежащую в основе экономическую логику, модель должна быть способна прогнозировать доходности акций, но уже не должна восстанавливать фирму или дату заголовка. Валидное маскирование требует и будущей инвариантности (задача не зависит от информации, раскрытой после момента $t$), и обнаружимого навыка (точность выше бейзлайна). Мы находим, что эта процедура даёт обнаружимый навык, но тесты реконструкции обнаруживают множественные пути, через которые модель может обращаться к запомненной информации, — то есть маскирование не достигает будущей инвариантности.

Мы начинаем с набора фирменных заголовков. Для каждого заголовка мы просим LLM описать эффект этой новости для фирмы, опуская любую конкретику, — вывести только экономическую логику одним предложением. Дополнительно мы просим LLM анонимизировать эту экономическую логику техникой маскирования. Затем, используя построенное на первом шаге множество экономической логики, мы просим LLM предсказать, вырастет акция или упадёт, давая ей анонимизированную экономическую логику. Пример — на рисунке 8.

Пример экономической логики (одно предложение):

Заголовок: Amazon Launches Kindle in Mexico
Экономическая логика: The firm could experience increased revenue and market expansion opportunities due to tapping into a new consumer base in Mexico.
Анонимизированная экономическая логика: The firm could experience increased revenue and market x expansion opportunities due to tapping into a new consumer base x in location x.

Рисунок 8. Пример заголовка, экономической логики в одно предложение, сгенерированной GPT-4o, и анонимизированной экономической логики, замаскированной методом нейтрализации сущностей (Engelberg et al. 2025) с помощью GPT-4o mini.

Таблица 10 приводит результаты тестирования этой процедуры на акциях «Великолепной семёрки» с GPT-4o на дневной частоте. Для каждого дня, где была новость до 9:00 текущего дня или после 16:00 предыдущего, мы просим LLM предсказать по анонимизированной экономической логике, вырастет акция или упадёт от открытия к закрытию. Для периода до отсечки направленные точности по всем семи акциям превышают 50% (от 50.74% до 58.19%), удовлетворяя требованию обнаружимого навыка для валидного маскирования.

Для проверки условия будущей инвариантности мы пытаемся реконструировать идентифицирующую информацию из анонимизированной экономической логики, прося GPT-4o определить фирму и дату новости из анонимизированного текста. Результаты показывают: для заметных акций (AAPL, META, MSFT, TSLA, AMZN) GPT-4o может определять фирму из анонимизированной экономической логики с точностью от 11.9% до 46.3%. Для GOOGL и NVDA точности идентификации ниже (3.3% и 0.6% соответственно). Реконструкция дат в основном не удаётся: LLM практически не способна угадать точную дату и определяет год лишь в 3–13% случаев в зависимости от акции. Для заметных акций успешная реконструкция фирмы прямо демонстрирует нарушение будущей инвариантности: модель может обращаться к информации, связывающей замаскированную задачу с запомненным знанием о том, что произошло после даты заголовка.

Таблица 10. Анонимизированная экономическая логика. Результативность GPT-4o в использовании экономической логики заголовков для направленного прогноза движения цены на дневной частоте с января 2000 по июнь 2024 (заголовки RavenPack для «Великолепной семёрки»). Панель A — точности прогнозов по фирмам, в процентных пунктах. Панель B — доля успеха в определении правильной фирмы, года и точной даты анонимизированной экономической логики.
Панель A: Точность прогноза
Тикер
Точн. прогноза без «не знаю» (%)Точн. прогноза с «не знаю» (%)Num ObsЗаголовковЗаголовков (до 9:00 / после 16:00)Ср. заголовков в день
До отсечки, 01/2000 — 09/2023
AAPL54.8949.519192 8572 0082.04
META50.7741.383199336601.62
MSFT50.7446.061 3333 6712 3851.77
GOOG56.6148.748352 0091 2841.47
NVDA55.2944.534111 0707751.73
TSLA58.1949.433528996211.59
AMZN52.8541.147222 0251 3421.72
После отсечки, 10/2023 — 06/2024
AAPL68.1851.7229107621.95
META50.0043.751644321.76
MSFT55.8852.7836126641.62
GOOG74.0760.613397622.16
NVDA53.3341.111968461.94
TSLA71.4362.501662241.72
AMZN53.3351.613188591.69
Панель B: Идентификация анонимизированной экономической логики
Тикер
Точн. фирмы (%)Точн. года (%)Точн. даты (%)
До отсечки, 01/2000 — 09/2023
AAPL46.33.50.0
META11.97.20.4
MSFT21.63.90.1
GOOG3.37.30.0
NVDA0.67.50.0
TSLA27.512.20.0
AMZN19.25.40.0
После отсечки, 10/2023 — 06/2024
AAPL39.234.00.0
META11.425.04.5
MSFT27.026.20.0
GOOG1.927.10.0
NVDA5.930.90.0
TSLA27.421.00.0
AMZN22.727.30.0

Для более широкой кросс-секции акций эта процедура даёт направленные точности, схожие с маскированием коротких текстов, как показано в таблице 11. Доли идентификации фирм из анонимизированной экономической логики выше случайных (случайного выбора уникальной фирмы из дециля) для децилей 5–10 в периоде до отсечки, хотя ниже, чем для «Великолепной семёрки». В периоде после отсечки доли идентификации фирм падают ниже случайного бенчмарка — в согласии с тем, что модель не видела этих данных при обучении.

Таблица 11. Анонимизированная экономическая логика — выборка акций. Та же процедура, что и в таблице 10, для выборки акций из таблицы 9. Панель A — точность идентификации фирмы по анонимизированной экономической логике. «Самые частые новости», «Случайно», AAPL — бенчмарки как в таблице 9. Децили по акциям NYSE на каждый год, из каждого дециля случайно отбирается 50 акций с ежегодным перевыбором.
ДецильТочн. фирмы (%)Случайно (%)Самые частые новости (%)AAPL (%)ЗаголовковУник. фирмМедиана кап. (\$ млрд)Мин. кап. (\$ млрд)Макс. кап. (\$ млрд)
Панель A: До отсечки, 01/2000 — 09/2023
10.030.200.000.0011 5005010.450.251.09
20.010.250.000.0011 4494081.080.472.15
30.110.260.000.0011 6423841.820.763.49
40.020.290.000.0011 4893452.941.496.07
50.340.300.000.0011 6823324.822.2310.96
60.420.350.000.4911 3522848.013.1317.71
70.410.430.000.0011 61523213.875.4946.48
81.160.540.000.0011 26218424.379.2292.19
91.860.730.001.1311 26313751.5217.10239.51
106.151.417.013.1112 01271174.0642.132434.21
Панель B: После отсечки, 10/2023 — 06/2024
10.231.590.000.00433630.260.000.54
20.001.960.000.00378510.870.381.42
30.001.960.000.00425511.791.302.43
40.001.850.000.00404542.822.173.95
50.002.000.000.00396504.983.227.40
60.492.270.000.00411448.855.8114.40
70.002.500.000.004154015.598.9427.22
80.472.440.000.004234138.4417.3471.06
91.523.120.000.003963297.3833.65428.85
104.557.1442.8210.0541814497.4883.832434.21

Дополнительно таблица 12 показывает, что GPT-4o может определять правильную отраслевую классификацию Фамы–Френча со скоростью, значительно превышающей случайную, даже из анонимизированной экономической логики. При классификации на 5 отраслей модель правильно назначает отрасль «Consumer» в 62.4% случаев в периоде до отсечки и в 59.0% — после. Даже при более гранулярной группировке на 10 отраслей GPT-4o показывает нетривиальную результативность классификации, правильно определяя такие отрасли, как HiTec, Manuf и NoDur, примерно с 20–33% точности.

Таблица 12. Точность идентификации отрасли по анонимизированной экономической логике. Панель A — группировка Фамы–Френча на 5 отраслей; панель B — на 10 отраслей. Точность отрасли = правильно / всего, в процентных пунктах. «Случайно» — бенчмарк равномерного случайного угадывания по отраслям группировки (20% для 5 отраслей, 10% для 10). Период до отсечки — наблюдения до 01.10.2023, после — с 01.10.2023.
Панель A: 5 отраслей (FF5)ВсегоПравильноТочн. отрасли (%)Случайно (%)
До отсечки, 01/2000 — 09/2023
Cnsmer18 17511 33762.420.0
HiTec14 0552 58818.420.0
Hlth5 2033085.920.0
Manuf18 1442 72215.020.0
Other60 64012 53220.720.0
После отсечки, 10/2023 — 06/2024
Cnsmer36321459.020.0
HiTec3454212.220.0
Hlth16163.720.0
Manuf4295212.120.0
Other2 68560922.720.0
Панель B: 10 отраслей (FF10)ВсегоПравильноТочн. отрасли (%)Случайно (%)
До отсечки, 01/2000 — 09/2023
Durbl3 22553316.510.0
Enrgy2 8671645.710.0
HiTec11 6032 49321.510.0
Hlth5 2003085.910.0
Manuf12 0422 48220.610.0
NoDur4 3321 34731.110.0
Other60 62811 46718.910.0
Shops10 6134314.110.0
Telcm2 4511686.910.0
Utils3 229250.810.0
После отсечки, 10/2023 — 06/2024
Durbl48612.510.0
Enrgy6634.510.0
HiTec3126219.910.0
Hlth16163.710.0
Manuf2715018.410.0
NoDur1334433.110.0
Other2 68554420.310.0
Shops18242.210.0
Telcm3300.010.0
Utils9200.010.0

Этот результат реконструкции отраслей критичен для оценки будущей инвариантности. Даже когда модель не может прямо идентифицировать конкретную фирму, она реконструирует отраслевую принадлежность со скоростью, намного превышающей случайную. По замечанию 1 тесты реконструкции дают лишь нижние границы доступной информации: неспособность реконструировать идентичность фирмы не доказывает, что модель не может обращаться к другой запомненной контекстной информации (отраслевые паттерны, деловая конъюнктура, макроэкономический контекст), связывающей замаскированную задачу с информацией, раскрытой после момента $t$. Успешная реконструкция отраслей демонстрирует, что альтернативные информационные пути остаются доступными, даже когда прямая идентификация фирмы не удаётся. Вместе с результатами прямой идентификации фирм для заметных акций эти находки указывают, что процедура экономической логики не удовлетворяет требованию будущей инвариантности для валидного маскирования.

5.8. Запоминание в эмбеддингах?

Ещё один вопрос — проявляют ли признаки запоминания эмбеддинги LLM. Недавние работы, использующие эмбеддинги LLM в финансовых приложениях, такие как Chen, Kelly, Xiu (2022), дают существенно лучшие предсказания доходностей акций, чем традиционные индикаторы или более простые NLP-методы. Вне финансов показано, что эмбеддинги утекают примерно столько же чувствительной информации, сколько сам текст (Morris et al. 2023). Эмбеддинги — числовые векторные представления текста, генерируемые LLM. Эти векторы содержат семантическое содержание входного текста, включая контекстную информацию из паттернов, встреченных моделью при предобучении. Способность восстановить исторически отчётные показатели из эмбеддингов промптов, в которых опущен числовой токен, была бы сильным свидетельством запоминания в эмбеддингах LLM.

Используя модель text-embedding-3-large, мы сначала кодируем серию промптов, где опущено конкретное числовое значение на конкретную дату для макроиндикатора, например «In Q4 2020, the earliest estimate of the US GDP growth rate was».12 Затем мы обучаем Ridge-регрессию с силой регуляризации $\lambda = 0.01$ на этих эмбеддингах и соответствующих экономических данных для предсказания четырёх экономических индикаторов: роста ВВП, инфляции, ставки 10-летних трежерис и уровня безработицы. Ridge-регрессия позволяет контролировать мультиколлинеарность среди высокоразмерных признаков эмбеддингов. Скользящее окно обучается на последних пяти годах данных (месячных для инфляции, ставки 10-летних трежерис и безработицы; квартальных для роста ВВП) и предсказывает следующую точку. Рисунок 9 показывает по каждому индикатору сравнение фактических значений с предсказанными по скользящим окнам и 5-летней простой скользящей средней.13

Рисунок 9
Рисунок 9. Воспроизведение через эмбеддинги. Сравнение фактических и предсказанных значений роста ВВП, инфляции, ставки 10-летних трежерис и безработицы с использованием Ridge-регрессии (параметр регуляризации 0.01), обученной на эмбеддингах текстовых промптов вида «In Q4 2020, the earliest estimate of the US GDP growth rate was» и соответствующих экономических данных. 5-летнее скользящее окно; сплошные синие линии — факт, пунктирные красные — предсказания.

Таблица 13 приводит корреляции между предсказанными и фактическими значениями, сравнивая модель с 5-летним скользящим окном и бенчмарк — 5-летнюю простую скользящую среднюю (SMA).14 Мы находим свидетельства запоминания в эмбеддингах инфляции и уровня безработицы. В частности, корреляция между фактическими и предсказанными по скользящему окну значениями инфляции (0.892) — большое улучшение над SMA-бенчмарком (0.333). Безработица тоже показывает высокую согласованность (0.927 против 0.385 у SMA), особенно при использовании недавней истории. Рост ВВП стабильно даёт корреляцию около нуля (−0.114 скользящее окно, −0.074 SMA). Эмбеддинги почти не дают сигнала для роста ВВП, но при обучении с расширяющимся окном чуть превосходят SMA-бенчмарк (корреляция 0.169). В совокупности эти результаты говорят, что эмбеддинги действительно несут некоторые ассоциации, но не согласованно по всем экономическим индикаторам.15

Таблица 13. Воспроизведение через эмбеддинги. Корреляции между фактическими и предсказанными значениями роста ВВП, инфляции, доходности 10-летних трежерис и безработицы для Ridge-регрессии, обученной на эмбеддингах текстовых промптов («эмбеддинги даты и переменной») и соответствующих данных. Данные: январь 1990 — декабрь 2024. Скользящее окно — переобучение каждый период на последних пяти годах для предсказания следующего значения. SMA — простая скользящая средняя за прошлые пять лет (20 кварталов для роста ВВП, 60 месяцев для остальных). t-статистики для гипотезы равенства корреляций по тесту Уильямса. Плацебо-тесты: «эмбеддинги дат» (только дата, без названия переменной), «перемешанные эмбеддинги даты и переменной» (случайная перестановка) и «случайные числовые векторы».
РядКорреляция: скользящее окноКорреляция: SMARoll−SMAt-стат. Roll−SMA
Эмбеддинги даты и переменной
Инфляция0.8920.3330.559t = 20.07
10-л. трежерис0.9650.8570.108t = 15.76
Безработица0.9270.3850.542t = 23.26
Рост ВВП−0.114−0.074−0.040t = −0.35
Эмбеддинги дат
Инфляция0.8820.3330.549t = 18.45
10-л. трежерис0.9660.8570.109t = 15.85
Безработица0.9150.3850.530t = 21.77
Рост ВВП−0.124−0.074−0.050t = −0.44
Перемешанные эмбеддинги даты и переменной
Инфляция0.1180.333−0.215t = −4.17
10-л. трежерис0.8060.857−0.051t = −4.86
Безработица0.3010.385−0.084t = −2.06
Рост ВВП0.001−0.0740.075t = 0.64
Случайные числовые векторы
Инфляция0.3080.333−0.025t = −2.05
10-л. трежерис0.8530.857−0.004t = −2.33
Безработица0.3650.385−0.020t = −2.66
Рост ВВП−0.135−0.074−0.061t = −1.28

Естественное опасение после этого результата — не улавливают ли Ridge-регрессии на эмбеддингах временные паттерны вместо проявления запоминания. Таблица 13 также содержит набор плацебо-тестов, где мы модифицируем значимую информацию в эмбеддингах. Мы проводим три плацебо-теста: (1) эмбеддинги, содержащие только информацию о дате; (2) эмбеддинги, являющиеся случайной перестановкой эмбеддингов даты и переменной; (3) набор векторов из случайно сгенерированных чисел. Эти тесты показывают: предсказательная сила сохраняется, когда временная информация остаётся в эмбеддингах, и исчезает, когда мы её удаляем. Для эмбеддингов дат мы по-прежнему видим значимое улучшение результатов скользящего окна над SMA для всех переменных, кроме роста ВВП. Однако результаты скользящего окна для перемешанных эмбеддингов и случайных числовых векторов хуже SMA. Это говорит, что часть предсказательной силы обусловлена кодированием дат в эмбеддингах, даже когда экономический индикатор не включён. Не ослабляя напрямую свидетельства запоминания, эти плацебо-результаты согласуются с утечкой временной информации внутри эмбеддингов, подразумевая, что модель содержит индексированные по времени сигналы. В таких случаях прогнозная результативность может отражать временное запоминание, а не подлинное экономическое рассуждение.

Таблица 14. Косинусные сходства и различия по типам эмбеддингов. Сравнение косинусных сходств между эмбеддингами значений (эмбеддинги фактических значений экономических переменных) и несколькими конструкциями: эмбеддинги даты и переменной, эмбеддинги дат, перемешанные эмбеддинги даты и переменной, случайные числовые векторы. Приведены средние косинусные сходства; в скобках — t-статистики парных тестов средней разницы с нулевым истинным средним.
Эмбеддинги даты и переменнойЭмбеддинги датПеремешанныеСлучайные векторы
Инфляция0.223 (129.61)0.219 (114.03)0.220 (123.96)0.000 (0.25)
10-л. ставка0.276 (192.02)0.193 (110.40)0.262 (149.13)0.001 (1.36)
Безработица0.175 (98.21)0.208 (98.91)0.169 (104.15)0.001 (1.23)
Рост ВВП0.257 (90.30)0.267 (69.24)0.252 (99.10)0.001 (0.69)

Эту интерпретацию подкрепляет таблица 14, сравнивающая косинусные сходства между эмбеддингами, построенными из промптов с датой и переменной (или плацебо-эмбеддингами), и эмбеддингами фактических значений экономических индикаторов. По всему набору экономических переменных эмбеддинги даты и переменной в целом ближе к эмбеддингам значений, чем перемешанные или случайные плацебо. Эти паттерны говорят, что модель интернализировала ассоциации между конкретными датами и соответствующими им экономическими состояниями.

Таблица 15. Воспроизведение через эмбеддинги — инверсия vec2text. Результаты использования библиотеки vec2text (Morris et al. 2023; Morris et al. 2024) для инверсии эмбеддингов промптов о закрытиях S&P 500 на конец месяца с января 2019 по декабрь 2024. Пример промпта: «On 08/31/20, the closing value of the SPX was 3500.31». Две группы промптов: (1) реальные даты с фальшивыми значениями закрытия и (2) случайные даты с реальными закрытиями. Точность инверсии — доля точно правильных инверсий; точность даты — доля правильных инверсий даты без проверки значения; MAE/MAPE — средняя абсолютная ошибка для инфляции и средняя абсолютная процентная ошибка для S&P 500 между исходным и инвертированным значениями; корреляция значений — коэффициент корреляции между исходными и инвертированными значениями. 13.9 означает, что точно инвертированы 13.9% промптов.
Точн. инверсии (%)Точн. даты (%)MAE/MAPE (%)Корреляция значений
РеальныеСлуч. датыРеальныеСлуч. датыРеальныеСлуч. датыРеальныеСлуч. даты
Уровни S&P 500 (напр. 4200.11)
Steps = 5, Width = 213.98.340.325.030.945.6−0.0710.259
Steps = 10, Width = 226.416.752.836.142.353.00.3500.100
Steps = 15, Width = 225.016.744.434.731.045.00.122−0.038
Уровни S&P 500, округлённые (напр. 4200)
Steps = 5, Width = 234.729.251.436.1209.5151.90.460.34
Steps = 10, Width = 243.136.159.741.7149.8157.60.300.46
Steps = 15, Width = 244.437.562.541.7170.6133.20.340.41
Уровни S&P 500, округлённые, с запятыми (напр. 4,200)
Steps = 5, Width = 254.241.761.143.16.314.40.430.32
Steps = 10, Width = 270.847.273.648.61.712.80.900.31
Steps = 15, Width = 273.650.077.852.80.512.70.990.31
Уровни инфляции
Steps = 5, Width = 287.581.987.583.31.111.2711
Steps = 10, Width = 290.388.990.388.90.691.3911
Steps = 15, Width = 290.391.790.391.71.110.2811

Наконец, мы находим, что инверсия эмбеддингов в текст даёт более высокую точность на текстах, виденных при обучении. Таблица 15 показывает: модель vec2text (Morris et al. 2023; Morris et al. 2024) для инверсии эмбеддингов обратно в текст существенно точнее, когда эмбеддинг соответствует точному промпту с датой и реальным соответствующим экономическим значением, чем для фальшивых плацебо-эмбеддингов. Мы тестируем точность инверсии, точность даты, MAE/MAPE и корреляцию значений для промптов с датой и закрытием S&P 500. Модели инверсии проще восстановить текст из эмбеддинга, когда использованная эмбеддинг-модель, скорее всего, видела даты и исторические значения в непосредственной близости при обучении.16 Мы также находим, что округление закрытий S&P до целых улучшает точность инверсии и точность дат. Более того, добавление запятых в форматирование закрытий поднимает точность инверсии реальных промптов до 73.6%. Только при увеличении ширины поиска до четырёх фальшивые промпты начинают инвертироваться точнее. Короче говоря, плацебо-регрессии, структура косинусных сходств и результативность инверсии дают согласованные свидетельства того, что эмбеддинги нетривиально кодируют исторические экономические состояния.

5.9. Дополнительный анализ

5.9.1. Международные данные

Документируемые нами паттерны воспроизведения не ограничены данными США. Мы проводим дополнительные тесты воспроизведения макроиндикаторов на инфляции и безработице для еврозоны, Великобритании, Японии и Китая. Результаты в таблице A7 показывают схожее поведение, указывая, что запоминание макроэкономических данных распространяется на международный уровень. Рисунок A1 строит воспроизведённые значения инфляции для четырёх международных экономик против фактических; рисунок A2 — воспроизведённые уровни безработицы против фактических.

Мы повторяем тесты воспроизведения фондовых индексов для Euro Stoxx 50 (еврозона), FTSE 100 (Великобритания), Nikkei 225 (Япония) и SSE Composite (Китай). Результаты в таблице A8 показывают схожие паттерны: точность воспроизведения до отсечки намного превышает точность после, что указывает на распространение запоминания индексов и на международные рынки. Однако доли воспроизведения до отсечки для международных индексов менее точны, чем для американских, особенно для Euro Stoxx 50. Рисунок A3 строит воспроизведённые значения четырёх международных индексов против фактических.

5.9.2. Альтернативный промпт

Мы также исследуем, как меняются выходы модели при изменении формулировки промпта на термин «forecast» вместо прямого запроса уровня закрытия, и при предоставлении контекста (закрытий двух предыдущих дней). Результаты — в таблице A9. Без контекста выходы до отсечки остаются точнее случайных (MAPE 2.76% и направленная точность 74.26%), а точность после отсечки деградирует (MAPE 15.30% и направленная точность 43.06%). С контекстом из закрытий двух предыдущих дней MAPE снижается до 0.7–1.1% для обоих периодов, а направленная точность — примерно 50% и до отсечки (48.54%), и после (51.84%).

5.9.3. Запоминание другими LLM

Наконец, мы повторяем тесты воспроизведения макроиндикаторов и фондовых индексов с open-source LLM Llama-3.1-70b-Instruct вместо GPT-4o.17 Результаты также показывают явную способность воспроизводить и макроэкономические данные, и фондовые индексы. Таблица A10 показывает: воспроизведённые значения ставок чрезвычайно близки к фактическим — MAE от 0.06% для безработицы до 0.48% для роста ВВП, пороговая точность выше 91% по всем индикаторам (до 97% для 10-летних трежерис и 99% для безработицы). Этот набор результатов говорит, что Llama-3.1-70b-Instruct запомнила эти процентные индикаторы с высокой точностью, аналогично GPT-4o. В периоде после отсечки MAE удваиваются, а пороговая точность падает до 60–75%.

Для уровней макроиндикаторов воспроизведение слабее, но остаётся нетривиальным. Пороговая точность до отсечки — от 86% для nonfarm payrolls до более 90% для закладок домов и VIX. Однако MAPE для уровней — от 5.51% для закладок до более 200% для nonfarm payrolls. Зеркаля паттерн GPT-4o, ошибки существенно снижаются при взгляде только на последнее десятилетие перед отсечкой знаний (2014–2023): MAPE падает до 3.4% для закладок, 7.6% для VIX и 9.5% для nonfarm payrolls.

Таблица A11 показывает дневные результаты воспроизведения фондовых индексов. Они тоже дают ясную поддержку запоминания, хотя более слабого, чем у GPT-4o. Воспроизведение до отсечки умеренно по точности: MAPE от 2% для DJIA до 4.5% для Nasdaq — ошибки больше, чем у GPT-4o. Однако точность после отсечки намного хуже: ошибки растут до 14–18% по трём индексам. Этот контраст говорит, что Llama, хотя и менее точная, чем GPT-4o, тоже проявляет запоминание в периоде до отсечки.

6. Заключение

Большие языковые модели проявляют значительное запоминание экономических и финансовых данных, что создаёт фундаментальный вызов их использованию для прогнозирования исторических периодов внутри их обучающих данных. Систематическим тестированием мы документируем способность LLM идеально воспроизводить точные числовые значения — уровни S&P 500, уровни безработицы, темпы роста ВВП, цены отдельных акций — с высокой точностью для данных до отсечки, наряду с почти идеальной идентификацией дат заголовков и устойчивой реконструкцией замаскированных сущностей. Это селективное, но повсеместное запоминание может подорвать валидность видимой прогнозной точности LLM, поскольку их выходы для периодов до отсечки часто неотличимы от воспроизведения, а не подлинного предсказания.

Помимо этих эмпирических находок, мы устанавливаем формальные теоретические результаты, показывающие, что проблема запоминания фундаментально неидентифицируема: когда модель видела реализованные исходы при обучении, её контрфактическую прогнозную способность нельзя восстановить из её выходов. Любой наблюдаемый прогноз согласуется и с подлинным аналитическим навыком, и с простым воспроизведением запомненных ответов, делая вывод невозможным. Более того, распространённые средства доказуемо не работают: ограничивающие промпты не могут идентифицировать целевой эстиманд, дообучение чёрным ящиком нельзя верифицировать без наблюдения изменений параметров, а малые выборки после отсечки не имеют статистической мощности для обнаружения запоминания. Эти результаты о невозможности демонстрируют, что проблема не просто эмпирическая, а структурная.

Усилия по смягчению запоминания — наложение искусственных временных границ или анонимизация данных — оказываются неадекватными. Даже при явной инструкции игнорировать информацию после искусственно наложенной даты отсечки LLM выдают неправдоподобно точные прогнозы: точность после фальшивой отсечки (98%) совпадает с уровнями до неё, а не с 40%, наблюдаемыми для действительно невиданных данных после настоящей отсечки. Аналогично, техники маскирования не могут полностью помешать LLM реконструировать идентифицирующую информацию: они используют тонкие контекстные подсказки для деанонимизации сущностей вроде фирм или периодов с высокой долей успеха. Даже когда маскирование блокирует доступ к конкретным сущностям или событиям, модель сохраняет представления отраслевой структуры и макроусловий, позволяя утечке сохраняться. Эти находки указывают, что ни промптовые стратегии, ни анонимизация данных не могут надёжно изолировать прогнозные способности LLM от их запомненного знания, делая такие подходы недостаточными для строгих академических исследований.

Для обеспечения методологической целостности оценки прогнозных способностей LLM должны сосредоточиваться исключительно на данных за пределами их отсечки обучения, где запоминание невозможно. Только тестируя предсказания для периодов после отсечки, исследователи и практики могут уверенно отличить подлинный экономический инсайт от извлечения запомненной информации. Это ограничение требует сдвига в дизайне исследований — приоритета темпорально согласованных моделей или данных после обучения для оценки истинного потенциала LLM в экономических и финансовых приложениях. Это накладывает практические ограничения, особенно для низкочастотных исследований, где достаточные данные после отсечки могут накапливаться годами. Альтернативно исследователи могут применять open-source модели с документированным временным обучением, исключающим целевой период.

Применение нашей методологии для проверки запоминания в конкретных данных, используемых в исследовании, может дать полезную нижнюю границу проблемы запоминания в конкретном приложении. Наши результаты подчёркивают необходимость переоценки многих текущих практик LLM-исследований в экономике и финансах и потребность в надёжных каркасах для решения проблемы запоминания — чтобы заявления о предсказательной силе основывались на фактической прогнозной способности, а не на артефактах экспозиции обучающим данным.

Литература

Приложение A. Промпты

Тексты промптов сохранены на английском языке, как в оригинале: это дословные входы моделей, и их перевод исказил бы методологию.

A.1. Индексы

Контекст.

Context: The closing price of {data name} was {previous closing price 1} on {previous period 1} and {previous closing price 2} on {previous period 2}.

Системное сообщение. Промпты для фондовых индексов, заголовков WSJ, макроиндикаторов и отдельных акций используют следующие системные промпты.

Период до обучения: You're a helpful assistant who always tries to answer to the best of your recollection of facts. Период после обучения: You're a helpful assistant who always tries to answer to the best of your recollection of facts. Your knowledge cutoff date is December 31st, 2025. Your training data covers up to December 31st, 2025.

Промпт: оценка дневного значения.

{context}

What was the {data name} closing value on {date}? Provide your best estimate.

Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Промпт: месячное направленное предсказание.

{context}

Was the {data name} up or down for the month of {month}, {year}? Provide your best estimate.

Provide an answer that is either "up" or "down". Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: An answer to the question that is either "up" or "down".
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Промпт: месячное процентное изменение.

{context}

By what percentage did the {data name} change for the month of {month}, {year}? Provide your best estimate.

Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Промпт: сравнение относительной результативности.

{context}

Which performed better in {year}: {data name} or {data name2}? Provide your best estimate.

Provide an answer that is either {data name} or {data name2}. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: An answer to the question that is either {data name} or {data name2}.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

A.2. Заголовки

Промпт: построение новостного контекста. Модели давался следующий контекст, сгенерированный из заголовков Wall Street Journal, опубликованных в один день:

Here are headlines from the Wall Street Journal written on the same day:
{title 1}: {content 1}
{title 2}: {content 2}
...

Тип промпта: вывод даты.

{context}

What is the date of these headlines? Provide your best estimate.

Provide a precise date. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise date in the format "mm/dd/yyyy".
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Тип промпта: предсказание уровня рынка.

{context}

First, infer the date of these headlines. What was the closing value of the {data name} for the next trading day? Provide your best estimate.

You must provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:

  • date: The date of the headlines in the format "mm/dd/yyyy".
  • answer: The precise numerical answer to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

A.3. Макропеременные

Промпт: месячная ставка.

What was the {data name} in {month}, {year}? Provide your best estimate.

Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer in percentage format to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Промпт: месячный уровень.

What was the {data name} in {month}, {year}? Provide your best estimate.

Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Промпт: квартальная ставка.

What was the {data name} in {quarter} {year}? Provide your best estimate.

Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer in percentage format to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Промпт: уровень на конец месяца.

What was the {data name} on {end of month date}? Provide your best estimate.

Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

A.4. Отдельные акции

Контекст.

Context: The closing price of {data name} was {previous closing price 1} on {previous period 1} and {previous closing price 2} on {previous period 2}.

(Если существует лишь одна предыдущая цена закрытия: The closing price of {data name} was {previous closing price 1} on {previous period 1}.)

Промпт: цена закрытия на конец месяца.

{context}

What was the closing price of {ticker str} on {end of month date}? Provide your best estimate.

Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

A.5. Фальшивая отсечка знаний

Промпт: отсечка и в системном, и в пользовательском сообщении.

System message: You're a helpful assistant who always tries to answer to the best of your recollection of facts. Knowledge cutoff: December 31st, 2010 Current date: October 1st, 2023.

User message: For the following tasks, please restrict your knowledge pool to the end of 2010. What was the earliest estimate of the US GDP growth rate in quarter? Provide your best estimate.

Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer in percentage format to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Промпт: только системная отсечка.

System message: You're a helpful assistant who always tries to answer to the best of your recollection of facts. Knowledge cutoff: December 31st, 2010 Current date: October 1st, 2023.

User message: What was the earliest estimate of the US GDP growth rate in quarter? Provide your best estimate.

Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer in percentage format to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

Промпт: только пользовательская отсечка.

System message: You're a helpful assistant who always tries to answer to the best of your recollection of facts.

User message: For the following tasks, please restrict your knowledge pool to the end of 2010. What was the earliest estimate of the US GDP growth rate in quarter? Provide your best estimate.

Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer in percentage format to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

A.6. Анонимизированные конференц-звонки / фирменные заголовки

Промпт: анонимизация (адаптирован из Engelberg et al. 2025). Полный промпт инструктирует модель анонимизировать весь предоставленный текст так, чтобы никто — даже эксперт-финаналитик — не смог определить компанию или её отрасль. Тикеры заменяются на «ticker x»; имена людей, локации, отрасли, сектора, продукты, услуги, времена, годы, даты и все числа с процентами — на маркеры «name x», «location x», «industry x», «sector x», «product x», «product type x», «product line x», «service x», «time x», «year x», «date x» и «number a», «number b», «number c» соответственно. Ссылки и домены заменяются на «link x», платформы и сервисы — на «service x». Идентификаторы никогда не удаляются — всегда заменяются анонимным аналогом; на выходе — только анонимизированный текст.

Промпт: идентификация (адаптирован из Engelberg et al. 2025).

You will receive a body of text which has been anonymized. You are omniscient. Use all your knowledge and the context to identify which company and industry the text is about, as well as the quarter and year it was written. Make your best guess based on information and context if you are unsure. Please only provide the ticker of the company you have identified. Provide your estimate exactly in the following format, with no other text at all (TIK is your estimate of the ticker, Industry Name is your estimate of the industry, Q is your estimate of the quarter, Y is your estimate of the year): Company Estimate: TIK, Industry Estimate: Industry Name, Quarter Estimate: Q, Year Estimate: Y

[Anonymized Opening Statement/Firm Headline]

A.7. Анонимизированная экономическая логика

Промпт: экономическая логика.

How should the firm be impacted by the following headline? In your explanation, do not include specifics. Only provide the economic logic using three sentences.

[headline]

Промпты анонимизации и идентификации — те же, что в разделе A.6, применённые к экономической логике вместо стенограммы/заголовка.

A.8. Альтернативный промпт

Промпт: «прогноз» дневного значения.

{context}

Can you forecast the {data name} closing value on {date}? You must provide your best numerical estimate even if you cannot predict perfectly. Do not output explanations of your capabilities.

Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:

  • answer: The precise numerical answer to the question. No strings.
  • confidence: A number between 0 and 100 indicating your confidence in the answer.

A.9. Промпты Llama-3.1-70b-Instruct

Промпты оценки дневного значения, месячной ставки и месячного уровня повторяют промпты GPT-4o из разделов A.1 и A.3; к промптам месячной ставки и уровня добавлено требование: «You must provide a numerical answer even if you are unable to verify the information. Do not output any additional text.»

Приложение B. Дополнительные рисунки и таблицы

Таблица A1. Сводные статистики. Панель A — фондовые индексы (S&P 500, DJIA, NASDAQ Composite): среднее и стандартное отклонение дневных и месячных доходностей с января 1990 по февраль 2025, а также направленное изменение (доля движений вверх от периода к периоду). Панель B — те же статистики для месячных доходностей акций «Великолепной семёрки» и равновзвешенных портфелей случайно отобранных мелких, средних и крупных акций (январь 1990 — декабрь 2023). Панель C — среднее, стандартное отклонение, направление (доля превышения порога: 2.5%, 3%, 4%, 4% соответственно), направленное изменение, ME и MAE при использовании среднего как оценки для роста ВВП, инфляции, безработицы и 10-летних трежерис. Панель D — то же для VIX, закладок домов и изменения nonfarm payrolls (пороги 16, 1400 и 200), с MPE и MAPE при использовании среднего как оценки.
Панель A: ИндексыСр. доходность (%)СКО доходности (%)Направл. изменение (%)
SP500, дневная0.040.1153.59
DJIA, дневная0.050.1554.97
NASDAQ Composite, дневная0.050.1554.97
SP500, месячная0.780.4364.13
DJIA, месячная1.100.6261.52
NASDAQ Composite, месячная1.100.6261.52
Панель B: Акции (месячные)Ср. доходность (%)СКО доходности (%)Направл. изменение (%)
GOOGL1.461.1560.09
AMZN2.531.6758.23
AAPL1.571.3655.85
MSFT1.071.1058.96
META2.341.1261.76
NVDA3.192.0358.22
TSLA3.451.9452.20
Мелкие акции1.561.5953.33
Средние акции0.491.3451.70
Крупные акции0.431.2752.96
Панель C: МакроставкиСреднее (%)СКО (%)Направление (%)Направл. изменение (%)ME (%)MAE (%)
Рост ВВП2.394.4850.3644.53−0.001.93
Инфляция2.701.6231.2842.52−0.001.13
Безработица5.711.7584.1631.990.001.34
10-л. трежерис4.231.9752.0148.820.001.62
Панель D: МакроуровниСреднееСКОНаправление (%)Направл. изменение (%)MPE (%)MAPE (%)
VIX19.867.1565.6247.4811.2529.07
Закладки домов1323.95384.5545.3250.3612.1329.85
Изм. Nonfarm Payrolls104.161062.1237.0543.57−58.81188.41
Таблица A2. Фальшивая отсечка знаний 2005. Аналог таблицы 6 для отсечки в конце 2005 года: периоды до фальшивой отсечки (1990–2005) и после (с 2006). Явная инструкция не использовать данные после 2005 даёт больше отказов и слабее результативность после фальшивой отсечки — в согласии с соблюдением ограничения.
ME (%)MAE (%)Порог. точн. (%)Направл. точн. (%)Калибровка увер.НачалоКонецNum ObsОтказы
Рост ВВП: отсечка и в системном, и в пользовательском сообщении
До фальш. отсечки0.200.4093.6588.710.0601.03.199001.12.2005631
После фальш. отсечки0.781.1150.0071.43−0.6401.03.200601.09.2023863
Рост ВВП: отсечка только в системном сообщении
До фальш. отсечки0.060.1896.8395.16−0.1101.03.199001.12.2005631
После фальш. отсечки−0.030.0797.1898.57−0.3701.03.200601.09.2023710
Рост ВВП: отсечка только в пользовательском сообщении
До фальш. отсечки0.220.4195.2488.71−0.1201.03.199001.12.2005631
После фальш. отсечки0.611.0550.0080.00−0.3801.03.200601.09.2023665
Таблица A3. Фальшивая отсечка знаний 2015. Аналог таблицы 6 для отсечки в конце 2015 года: периоды до фальшивой отсечки (1990–2015) и после (с 2016).
ME (%)MAE (%)Порог. точн. (%)Направл. точн. (%)Калибровка увер.НачалоКонецNum ObsОтказы
Рост ВВП: отсечка и в системном, и в пользовательском сообщении
До фальш. отсечки0.150.4691.2692.16−0.1701.03.199001.12.20151031
После фальш. отсечки0.020.6255.5687.50−0.2101.03.201601.09.2023922
Рост ВВП: отсечка только в системном сообщении
До фальш. отсечки0.000.1098.0697.06−0.2001.03.199001.12.20151031
После фальш. отсечки0.010.02100.00100.00−0.0801.03.201601.09.2023310
Рост ВВП: отсечка только в пользовательском сообщении
До фальш. отсечки0.130.3095.1594.12−0.1701.03.199001.12.20151031
После фальш. отсечки0.690.7183.3380.000.1801.03.201601.09.2023625
Таблица A4. Фальшивая отсечка знаний: скользящая фальшивая отсечка и подвыборки. Способность LLM воспроизводить уровни S&P 500 на дневной частоте со скользящими фальшивыми отсечками (предыдущий день) и с фальшивыми отсечками внутри двух подвыборок: январь 1990 — декабрь 2008 с фальшивой отсечкой 31 декабря 1999 и январь 2009 — октябрь 2023 с фальшивой отсечкой 31 декабря 2015.
MPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
SP500 до отсечки (исходно)0.120.6180.58−0.148 4880
SP500 после отсечки (исходно)−16.7816.8745.70−0.1029262
SP500 до отсечки (скользящая фальш.)0.070.8169.55−0.168 46042
SP500 после отсечки (скользящая фальш.)−17.0717.1842.19−0.0230233
SP500 до фальш. отсечки (1990–2008)0.271.3959.320.012 5280
SP500 после фальш. отсечки (1990–2008)0.130.6774.44−0.102 2620
SP500 до фальш. отсечки (2009–2023)−0.010.0597.33−0.021 7620
SP500 после фальш. отсечки (2009–2023)−0.010.0398.100.001 9463
Таблица A5. Воспроизведение через эмбеддинги — open-source модели. Аналог таблицы 13 для трёх open-source эмбеддинг-моделей: (1) SFR-Embedding-Mistral, (2) nomic-embed-text-v1.5, (3) all-MiniLM-L6-v2. t-статистики Уильямса для гипотезы равенства корреляций скользящего окна и SMA.
РядКорреляция: скользящее окноКорреляция: SMARoll−SMAt-стат.
Модель 1: SFR-Embedding-Mistral
Рост ВВП−0.153−0.074−0.079−0.72
Инфляция0.8850.3330.55219.15
10-л. трежерис0.9650.8570.10815.69
Безработица0.9260.3850.54122.25
Модель 2: nomic-embed-text-v1.5
Рост ВВП−0.136−0.074−0.062−0.58
Инфляция0.8100.3330.47715.13
10-л. трежерис0.9540.8570.09714.72
Безработица0.8660.3850.48117.14
Модель 3: all-MiniLM-L6-v2
Рост ВВП−0.143−0.074−0.069−0.66
Инфляция0.8180.3330.48515.94
10-л. трежерис0.9510.8570.09412.34
Безработица0.8690.3850.48417.85
Таблица A6. Воспроизведение через эмбеддинги — инверсия vec2text (приложение: Width = 1 и 4). Аналог таблицы 15 с тремя группами промптов: (1) реальные пары дата–значение, (2) фальшивые даты с реальными закрытиями, (3) реальные даты с фальшивыми закрытиями. Панель A — точность инверсии (выше — лучше), панель B — точность даты (выше — лучше), панель C — средняя разница цен (ниже — лучше). 0.139 означает, что точно инвертированы 13.9% промптов.
Панель A: Точность инверсииФальш. датыФальш. значенияРеальные промпты
Steps = 5, Width = 10.0280.0280.056
Steps = 10, Width = 10.0560.0690.083
Steps = 15, Width = 10.0560.0690.097
Steps = 5, Width = 40.2220.2360.292
Steps = 10, Width = 40.3750.3330.361
Steps = 15, Width = 40.4030.3750.389
Панель B: Точность датыФальш. датыФальш. значенияРеальные промпты
Steps = 5, Width = 10.0970.2360.264
Steps = 10, Width = 10.1250.3060.375
Steps = 15, Width = 10.1110.2220.333
Steps = 5, Width = 40.4720.5280.625
Steps = 10, Width = 40.5420.5830.681
Steps = 15, Width = 40.5690.5830.639
Панель C: Средняя разница ценФальш. датыФальш. значенияРеальные промпты
Steps = 5, Width = 12.2031.2080.567
Steps = 10, Width = 10.8000.5290.558
Steps = 15, Width = 10.5740.6480.385
Steps = 5, Width = 40.2770.3280.345
Steps = 10, Width = 40.2150.3100.185
Steps = 15, Width = 40.2020.2410.203
Таблица A7. Метрики оценки для международных макроиндикаторов. Мы просим LLM воспроизвести месячные значения инфляции и безработицы для еврозоны, Великобритании, Японии и Китая (в процентах). Пороговая точность — доля предсказаний, правильно определивших превышение порога (3% для инфляции, 4% для безработицы). Остальные метрики как в таблице 1.
МакроиндикаторME (%)MAE (%)Порог. точн. (%)Направл. точн. (%)Калибровка увер.НачалоКонецNum ObsОтказы
До отсечки
Еврозона, инфляция HICP0.020.0696.5795.00−0.2501/199709/20233212
Великобритания, инфляция CPIH−0.050.3685.1586.10−0.4801/199009/202340413
Япония, инфляция CPI0.020.2498.7786.78−0.4101/199009/202340522
Китай, инфляция CPI0.060.5897.2895.53−0.3501/199009/202340511
После отсечки
Еврозона, инфляция HICP2.032.0335.2937.50−0.0810/202302/2025170
Великобритания, инфляция CPIH1.892.03100.0056.250.6910/202302/2025170
Япония, инфляция CPI0.260.6264.7162.5010/202302/2025170
Китай, инфляция CPI0.891.02100.0056.25−0.2910/202302/2025170
До отсечки
Еврозона, безработица−0.230.24100.0085.56−0.5801/200009/20232850
Великобритания, безработица−0.030.1596.5492.57−0.2401/199009/20234050
Япония, безработица0.010.0698.7593.47−0.0701/199009/20233990
Китай, безработица0.040.0789.9584.62−0.2101/199009/202337827
После отсечки
Еврозона, безработица0.060.11100.0075.00−0.1610/202302/2025170
Великобритания, безработица−0.120.2158.8275.00−0.4810/202302/2025170
Япония, безработица0.090.09100.0056.250.6410/202302/2025170
Китай, безработица0.050.09100.0062.5010/202302/2025170
Таблица A8. Метрики оценки для международных фондовых индексов: Euro Stoxx 50, Nikkei 225, FTSE 100 и SSE Composite. Метрики как в таблице 2.
MPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.НачалоКонецNum ObsОтказы
До отсечки
Euro STOXX 50−6.2210.5384.17−0.9201/199009/202336144
Nikkei 225−0.111.5597.52−0.2201/199009/20234041
FTSE 1000.091.2297.77−0.3701/199009/20234050
SSE Composite−3.276.6881.42−0.1912/199009/20233940
После отсечки
Euro STOXX 50−27.2127.5446.67−0.7910/202302/2025161
Nikkei 225−32.7732.7743.75−0.8610/202302/2025170
FTSE 100−23.2723.4350.00−0.7310/202302/2025170
SSE Composite−9.8118.2340.00−0.6110/202302/2025161
Таблица A9. Метрики оценки для S&P 500 с промптом «forecast». Способность LLM воспроизводить дневные уровни индекса с альтернативным промптом, использующим термин «forecast» вместо прямого запроса закрытия. Период до обучения: 02.01.1990 — 29.09.2023; после отсечки: 02.10.2023 — 28.02.2025. Панель A — без контекста, панель B — с закрытиями двух предыдущих дней.
MPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
Панель A: Без контекста
SP500−1.922.7674.26−0.328 5020
SP500 после отсечки−15.1015.3043.060.103540
Панель B: С контекстом
SP5000.031.1048.54−0.068 5020
SP500 после отсечки0.090.7451.84−0.103540
Таблица A10. Метрики оценки для макроиндикаторов — Llama 3.1-70b-Instruct. Аналог таблицы 1 для Llama-3.1-70b-Instruct (отсечка знаний — декабрь 2023).
Панель A: СтавкиME (%)MAE (%)Порог. точн. (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
До отсечки, 01/1990 — 11/2023
Рост ВВП0.070.4892.5991.04−0.111351
Инфляция−0.150.3991.8766.67−0.244061
Безработица−0.030.0699.2676.49−0.174052
10-л. трежерис0.020.1397.2481.61−0.343989
После отсечки, 12/2023 — 02/2025
Рост ВВП−0.131.0460.00100.00−0.0250
Инфляция−0.720.8866.6771.43−0.38150
Безработица−0.140.1475.0027.27−0.33123
10-л. трежерис0.210.3864.2969.230.33141
Панель B: УровниMPE (%)MAPE (%)Порог. точн. (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
До отсечки, 01/1990 — 11/2023
VIX0.9912.1289.4575.82−0.233989
Закладки домов−2.295.5190.2774.25−0.364016
Nonfarm Payrolls42.85208.6186.6784.90−0.114052
Недавний период до отсечки, 12/2014 — 11/2023
VIX1.687.5891.5187.62−0.111062
Закладки домов−1.543.3791.5181.90−0.111062
Nonfarm Payrolls−6.099.5098.1398.110.031071
После отсечки, 12/2023 — 02/2025
VIX15.3120.7037.5057.140.1487
Закладки домов−0.783.8486.6792.860.43150
Nonfarm Payrolls207.67222.8842.8676.92−0.16150
Таблица A11. Метрики оценки для рыночных индексов — Llama 3.1-70b-Instruct. Аналог панели A таблицы 2 для Llama-3.1-70b-Instruct.
Панель A: Числовые тестыMPE (%)MAPE (%)Направл. точн. (%)Калибровка увер.Num ObsОтказы
Дневные уровни: до отсечки, 02.01.1990 — 30.11.2023
SP500−0.192.0360.57−0.158 5450
DJIA0.031.9761.01−0.418 48758
Nasdaq Composite−0.284.4858.05−0.268 5450
Дневные уровни: после отсечки, 01.12.2023 — 28.02.2025
SP500−14.6514.7443.9692234
DJIA10.7618.0858.8269266
Nasdaq Composite−14.1014.5145.0592219
Дневные уровни: до отсечки с контекстом, 02.01.1990 — 30.11.2023
SP5000.120.9652.31−0.078 5441
DJIA0.090.9351.28−0.088 5441
Nasdaq Composite0.151.2753.76−0.068 5450
Дневные уровни: после отсечки с контекстом, 01.12.2023 — 28.02.2025
SP5000.050.8150.32−0.113092
DJIA0.060.6952.43−0.133101
Nasdaq Composite0.131.1552.43−0.093101
Рисунок A1
Рисунок A1. Воспроизведение точных числовых значений международной инфляции: еврозона, Япония, Великобритания и Китай — оценки LLM против фактических значений. Панели A, C, E и G — факт против оценки; панели B, D, F и H — ошибка оценки, в процентах. Период после отсечки (с 10/2023) закрашен серым.
Рисунок A2
Рисунок A2. Воспроизведение точных числовых значений международной безработицы: еврозона, Япония, Великобритания и Китай. Панели A, C, E и G — факт против оценки; панели B, D, F и H — ошибка оценки, в процентах. Период после отсечки (с 10/2023) закрашен серым.
Рисунок A3
Рисунок A3. Воспроизведение точных числовых уровней международных рыночных индексов: Euro Stoxx 50, Nikkei 225, FTSE 100 и SSE Composite. Панели A, C, E и G — факт против оценки; панели B, D, F и H — ошибка оценки, в процентных пунктах. Период после отсечки (с 10/2023) закрашен серым.
Рисунок A4
Рисунок A4. Воспроизведение через эмбеддинги — расширяющееся окно и SMA. Сравнение фактических и предсказанных значений роста ВВП, инфляции, ставки 10-летних трежерис и безработицы: Ridge-регрессия (λ = 0.01) на эмбеддингах текстовых промптов с расширяющимся окном обучения и простая скользящая средняя с 5-летним окном.
Рисунок A5
Рисунок A5. Воспроизведение через эмбеддинги (λ = 0.001). Аналог рисунка 9 с параметром регуляризации 0.001; 5-летнее скользящее окно.
Рисунок A6
Рисунок A6. Воспроизведение через эмбеддинги (λ = 0.1). Аналог рисунка 9 с параметром регуляризации 0.1; 5-летнее скользящее окно.

Приложение C. Доказательство проблемы запоминания

C.1. Формальные определения и предположения

Пусть $\Phi$ — пространство всех возможных параметров модели для фиксированной архитектуры и обучающего конвейера.

Пусть $\mathcal{Y}$ — конечное непустое множество возможных ответов.

С этими определениями сформулируем ключевые величины:

Наконец, сформулируем мягкое предположение, необходимое для конструкции доказательства.

Предположение 1 (достижимость решений). Для любой задачи $Q$ и неограниченного случая $P = \varnothing$, для каждой метки $y \in \mathcal{Y}$ существует параметр $\phi_y \in \Phi$ такой, что $\delta_{\phi_y}(Q, \varnothing) = y$.18

C.2. Каркас «промпт как оператор»

Проблема идентификации возникает потому, что дополнительные инструкции $P$ не меняют фактические параметры модели $\theta$. Вместо этого они действуют как неизвестный внутренний оператор, сдвигающий то, какие части параметрического пространства управляют выходом. Для каждого набора дополнительных инструкций $P$ и задачи $Q$ можно определить эффективное отображение параметров $T_{P,Q} : \Phi \to \Phi$ такое, что

\[ \delta_\theta(Q, P) = \delta_{T_{P,Q}(\theta)}(Q, \varnothing). \]

Это определение: по предположению 1 для любого наблюдаемого выхода $y = \delta_\theta(Q, P)$ существует некоторое $\phi_y$ такое, что $\delta_{\phi_y}(Q, \varnothing) = y$, так что мы просто определяем $T_{P,Q}(\theta) := \phi_y$. Это улавливает наблюдаемое поведение: промпт $P$ даёт тот же выход, что и некоторый эффективный набор параметров $T_{P,Q}(\theta)$ без промпта. Промпт не меняет веса модели, но модулирует то, как эти веса используются для генерации выходов. Ключевым образом, мы не накладываем никакой априорной структуры, связывающей этот неизвестный оператор $T_{P,Q}$ с целевым контрфактом $\theta_t$, — именно это ведёт к неидентифицируемости.

Почему не предположить, что промпт работает? Можно возразить: «А что если ограничивающий промпт действительно достигает своей цели?» Это потребовало бы предположения $T_{P_{\mathrm{constraint}},Q_t}(\theta) = \theta_t$ — что промпт идеально преобразует фактические параметры в контрфактические. Однако это предположение эмпирически неверифицируемо без «белого ящика» (прямого наблюдения внутренних вычислений модели и представлений параметров). Непрозрачный процесс принятия решений моделью делает невозможным подтвердить, действительно ли промпт ограничивает модель информацией до $t$, или знание после $t$ остаётся встроенным и влияет на выходы необнаружимыми способами (например, через опору модели на запомненные исторические убеждения для симуляции ответов, уместных для эпохи). Наш агностический каркас отражает это эпистемическое ограничение: без верифицируемых свидетельств мы не можем идентифицировать, какой из многих наблюдательно эквивалентных процессов породил выход.

C.3. Неидентифицируемость идеального эстиманда

Этот каркас ведёт к общему результату неидентифицируемости.

Предложение 1 (неидентифицируемость). Зафиксируем $Q_t$ и ограничивающий промпт $P$. Пусть мы наблюдаем ограниченное решение $Y_{\mathrm{constrained}}(P) = y \in \mathcal{Y}$. Тогда для любых двух различных меток $y^\star, y^\dagger \in \mathcal{Y}$ существуют два порождающих данные мира $\mathcal{W}^\star$ и $\mathcal{W}^\dagger$ такие, что:

  1. Они дают одно и то же наблюдаемое при одних и тех же фактических параметрах $\theta$: \[ \delta_\theta(Q_t, P) = y. \]
  2. Они расходятся в целевом эстиманде: \[ \delta_{\theta_t^{(\star)}}(Q_t, \varnothing) = y^\star \quad\text{и}\quad \delta_{\theta_t^{(\dagger)}}(Q_t, \varnothing) = y^\dagger. \]

Доказательство. Строим два мира $\mathcal{W}^\star$ и $\mathcal{W}^\dagger$, дающих идентичные наблюдаемые, но различающихся в целевом эстиманде.

Общее наблюдаемое. По предположению 1 выберем $\tilde\theta := \phi_y$ такое, что $\delta_{\tilde\theta}(Q_t, \varnothing) = y$. Оба мира разделяют одни и те же фактические параметры $\theta$ и один и тот же промптовый оператор $T_{P,Q_t}$, определённый через $T_{P,Q_t}(\theta) = \tilde\theta$. Это гарантирует совпадение наблюдаемого в обоих мирах:

\[ \delta_\theta(Q_t, P) = \delta_{T_{P,Q_t}(\theta)}(Q_t, \varnothing) = \delta_{\tilde\theta}(Q_t, \varnothing) = y. \]

Различные контрфакты. Миры различаются только в своих ненаблюдаемых контрфактических параметрах $\theta_t$. По предположению 1 полагаем:

Поскольку $y^\star \ne y^\dagger$ и оба мира согласуются с наблюдаемыми данными, целевой эстиманд $Y_t^\star$ не идентифицирован. $\blacksquare$

У этого предложения есть сильное следствие: в этой агностической модели наблюдение любого выхода даёт нулевую информацию о $Y_t^\star$.

Следствие 1 (резкая неидентифицируемость). При предположении 1 и операторной модели для любого наблюдаемого выхода $Y_{\mathrm{constrained}}(P) = y$ идентифицированное множество для $Y_t^\star$ равно всему множеству меток:

\[ \mathcal{I}(y) = \mathcal{Y}. \]

Доказательство. Для любого $\bar y \in \mathcal{Y}$ конструкция из предложения 1 с $y^\star = \bar y$ показывает, что мир, где $Y_t^\star = \bar y$, наблюдательно эквивалентен наблюдаемым данным $y$. Значит, $\mathcal{I}(y) = \mathcal{Y}$. $\blacksquare$

C.4. Граничные случаи и обобщения

Когда проблема исчезает (будуще-инвариантные задачи). Проблема неидентифицируемости возникает потому, что ответ на $Q_t$ чувствителен к информации после $t$. Если задача «будуще-инвариантна», проблемы не существует. Формально: если для данной задачи $Q_t$ и разбиения информации в момент $t$ выполняется $\delta_{\theta_t}(Q_t, \varnothing) = \delta_{\theta}(Q_t, \varnothing)$, то $Y_t^\star$ равен фактическому решению $\delta_\theta(Q_t, \varnothing)$ и тривиально идентифицирован. Однако, как обсуждалось в разделе 2, задачи, требующие суждения, выбора или предсказания, как правило, не будуще-инвариантны, что ограничивает практическую применимость этого граничного случая.

Обобщение на стохастическое декодирование. Результат не артефакт argmax-декодирования (нулевой температуры). При стохастическом декодировании (температура > 0) та же неидентифицируемость сохраняется, наблюдаем ли мы полное предсказательное распределение $G_\theta(\cdot \mid Q, P)$ или выборки из него. Пусть $G_\phi(\cdot \mid Q, P)$ — предсказательное распределение над $\mathcal{Y}$, порождаемое параметрами $\phi$. Доказательство следует той же конструкции: для любых двух контрфактических распределений $G^*, G^\dagger$ над $\mathcal{Y}$ мы строим два мира с идентичными наблюдаемыми, расходящихся в цели. Это требует распределённого расширения предположения 1: для любого распределения $G$ над $\mathcal{Y}$ существуют параметры $\phi_G$ такие, что $G_{\phi_G}(\cdot \mid Q, \varnothing) = G$. Для нейросетей с softmax-выходами (стандартной архитектурой, переводящей оценки модели в вероятности) это предположение бесспорно: функция softmax $G(y) = \frac{e^{z_y}}{\sum_{y' \in \mathcal{Y}} e^{z_{y'}}}$ непрерывно отображает векторы оценок («логитов») $z \in \mathbb{R}^{|\mathcal{Y}|}$ на вероятностный симплекс. Поскольку $\mathcal{Y}$ конечно, любое целевое распределение $G$ реализуется подходящими значениями логитов (решением $|\mathcal{Y}| - 1$ независимых уравнений с $|\mathcal{Y}|$ параметрами). Для случая наблюдаемых выборок вместо полного распределения неидентифицируемость следует из простого аргумента об информативности: если наблюдение полного распределения $G_\theta(\cdot \mid Q, P)$ не идентифицирует $Y_t^\star$, то наблюдение конечных выборок, лишь частично раскрывающих это распределение, тем более не может.

Множественные или адаптивные промпты. Результат о невозможности не ограничен одиночными промптами. Наблюдение выходов любой последовательности пар «запрос–промпт» $\{(Q^{(k)}, P^{(k)})\}_{k=1}^K$ (даже выбираемых адаптивно на основе более ранних ответов) не идентифицирует $Y_t^\star$, поскольку конструкция предложения 1 применяется независимо к каждому наблюдению последовательности.

Процедуры маскирования и валидное маскирование. Определение 2 требует двух условий валидного маскирования. Условие (i) (будущая инвариантность) требует и эмпирической, и теоретической компонент.

Эмпирическая компонента: тесты реконструкции. Пусть $R_\theta : \mathcal{Q} \to \mathcal{I}$ — функция реконструкции, пытающаяся восстановить идентифицирующую информацию из замаскированной задачи, где $\mathcal{Q}$ — пространство задач, а $\mathcal{I}$ — пространство идентификаторов сущностей (названия компаний, даты, отрасли). Для замаскированной задачи $Q_t^{\mathrm{mask}}$: если модель успешно реконструирует идентификатор сущности с ненулевой вероятностью — формально, если $\Pr[R_\theta(Q_t^{\mathrm{mask}}) = I_{\mathrm{true}}] > \epsilon$ для некоторого порога $\epsilon > 0$, — это окончательно доказывает нарушение условия (i): замаскированный вход содержит достаточно информации для запуска сущность-специфичного запоминания. Однако неудача реконструкции ($\Pr[R_\theta(Q_t^{\mathrm{mask}}) = I_{\mathrm{true}}] \le \epsilon$) не доказывает, что условие (i) выполняется.

Формально: пусть $\mathcal{C}$ — множество всех возможных каналов, через которые $Q_t^{\mathrm{mask}}$ может запустить доступ к $I_{>t}$. Будущая инвариантность требует, чтобы для каждого канала $c \in \mathcal{C}$ решение $\delta_\theta(Q_t^{\mathrm{mask}}, \varnothing)$ не зависело от $I_{>t}$ через этот канал. Тесты реконструкции прощупывают лишь конечное подмножество $\{c_1, \ldots, c_k\} \subset \mathcal{C}$ потенциальных путей реконструкции. По замечанию 1 отрицательные свидетельства не доказывают отсутствия каналов запоминания.

Теоретическая компонента. Требуется аргументировать, что не существует информационного пути к запуску сущность-специфичных запомненных исходов. Для генерических/статистических задач, где лежащая в основе связь стабильна во времени (например, реакция рынка на сюрпризы отчётности), исследователи могут аргументировать: даже если модель идентифицировала сущность, ответ не изменится, потому что паттерн времени-инвариантен.

Условие (ii) (обнаружимый навык) адресует отдельную проблему идентификации. Без наблюдения того, что модель превосходит бейзлайн, слабая результативность может отражать либо (a) отсутствие способности модели, либо (b) чрезмерно агрессивное маскирование, удалившее информацию, необходимую для задачи. Эти альтернативы наблюдательно эквивалентны, создавая проблему неидентифицируемости, аналогичную предложению 1. Требование $p_{\mathrm{mask}} > p_0$ разрешает её: превосходство над бейзлайном устанавливает и наличие способности у модели, и сохранение маскированием достаточной информации.

Валидное маскирование допускает два исследовательских применения. Маскирование с сохранением задачи имеет место, когда $\delta_\theta(Q_t^{\mathrm{mask}}, \varnothing) = Y_t^\star = \delta_{\theta_t}(Q_t, \varnothing)$ — восстанавливается исходная исследовательская цель. Маскирование для демонстрации способности имеет место, когда замаскированная задача представляет смену эстиманда; это валидирует способность модели на классе замаскированных задач, но не позволяет сущность-специфичный вывод по исходной задаче.

C.5. Доказательство предложения 2: статистическая неразличимость в сравнениях до/после отсечки

Постановка и предположения. Пусть $n_{\mathrm{pre}}$ и $n_{\mathrm{post}}$ — размеры выборок до и после отсечки соответственно. Предполагаем:

Пусть $p_{\mathrm{pre}} = \Pr[\delta_\theta(Q_t, \varnothing) = Y_{\mathrm{true}} \mid t < t_{\mathrm{cutoff}}]$ и $p_{\mathrm{post}} = \Pr[\delta_\theta(Q_t, \varnothing) = Y_{\mathrm{true}} \mid t \ge t_{\mathrm{cutoff}}]$ — истинные точности модели на данных до и после отсечки, где $t_{\mathrm{cutoff}}$ — дата отсечки знаний модели, а $Y_{\mathrm{true}}$ — реализованный исход. Определим истинный разрыв запоминания $\Delta := p_{\mathrm{pre}} - p_{\mathrm{post}}$. Пусть $\hat p_{\mathrm{pre}}$ и $\hat p_{\mathrm{post}}$ — соответствующие выборочные оценки.

Предложение 2 (статистическая неразличимость в сравнениях до/после отсечки). Рассмотрим проверку $H_0 : \Delta = 0$, где $\Delta := p_{\mathrm{pre}} - p_{\mathrm{post}}$. Когда $n_{\mathrm{pre}} \gg n_{\mathrm{post}}$, стандартная ошибка оценённого разрыва $\hat\Delta = \hat p_{\mathrm{pre}} - \hat p_{\mathrm{post}}$ приблизительно равна

\[ \mathrm{SE}(\hat\Delta) \approx \sqrt{\frac{p_{\mathrm{post}}(1 - p_{\mathrm{post}})}{n_{\mathrm{post}}}} = O(n_{\mathrm{post}}^{-1/2}). \]

Существуют два порождающих данные процесса, которые не могут быть надёжно различены обычными тестами гипотез:

  1. Времени-инвариантная способность: истинный разрыв равен нулю: $\Delta = 0$.
  2. Необнаруженное запоминание: истинный разрыв положителен, но мал: $\Delta > 0$ с $\Delta/\mathrm{SE}(\hat\Delta) = c$ для некоторой малой константы $c = O(1)$.

Для достаточно малого $c$ тесты гипотез будут иметь низкую мощность обнаружения таких разрывов. Когда $n_{\mathrm{post}}$ мало, экономически существенные разрывы запоминания остаются статистически необнаружимыми.

Доказательство предложения 2. Устанавливаем результат стандартным анализом мощности. Рассмотрим односторонний тест $H_0 : \Delta = 0$ против $H_1 : \Delta > 0$ по тестовой статистике $\hat\Delta = \hat p_{\mathrm{pre}} - \hat p_{\mathrm{post}}$. Односторонний тест уместен, поскольку запоминание теоретически предсказано завышать точность до отсечки (модель имеет доступ к информации об исходах для наблюдений до отсечки), откуда $\Delta \ge 0$; отрицательные разрывы ($\Delta < 0$) не согласуются с механизмом запоминания.

Истинная стандартная ошибка разности:

\[ \mathrm{SE}(\hat\Delta) = \sqrt{\frac{p_{\mathrm{pre}}(1 - p_{\mathrm{pre}})}{n_{\mathrm{pre}}} + \frac{p_{\mathrm{post}}(1 - p_{\mathrm{post}})}{n_{\mathrm{post}}}}. \]

Когда $n_{\mathrm{pre}} \gg n_{\mathrm{post}}$ (как обычно на практике), первый член пренебрежим относительно второго, так что

\[ \mathrm{SE}(\hat\Delta) \approx \sqrt{\frac{p_{\mathrm{post}}(1 - p_{\mathrm{post}})}{n_{\mathrm{post}}}} = O(n_{\mathrm{post}}^{-1/2}). \]

Заметим, что из-за этой асимметрии размеров выборок дисперсия $\hat\Delta$ доминируется дисперсией выборки после отсечки, что делает стандартную формулировку с объединённой дисперсией ненужной.

На практике истинная стандартная ошибка оценивается выборочными долями:

\[ \widehat{\mathrm{SE}}(\hat\Delta) = \sqrt{\frac{\hat p_{\mathrm{pre}}(1 - \hat p_{\mathrm{pre}})}{n_{\mathrm{pre}}} + \frac{\hat p_{\mathrm{post}}(1 - \hat p_{\mathrm{post}})}{n_{\mathrm{post}}}} \approx \sqrt{\frac{\hat p_{\mathrm{post}}(1 - \hat p_{\mathrm{post}})}{n_{\mathrm{post}}}}. \]

По состоятельности $\widehat{\mathrm{SE}}(\hat\Delta) \xrightarrow{p} \mathrm{SE}(\hat\Delta)$ при $n_{\mathrm{post}} \to \infty$. Далее мы используем популяционную стандартную ошибку $\mathrm{SE}(\hat\Delta)$ для теоретических расчётов мощности (характеризующих предельное поведение теста), понимая, что практические тесты гипотез подставляют состоятельную оценку $\widehat{\mathrm{SE}}(\hat\Delta)$.

Анализ мощности. По стандартной асимптотической теории для двухвыборочных тестов долей, при альтернативной гипотезе с истинным разрывом $\Delta > 0$ тестовая статистика приблизительно распределена как

\[ \hat\Delta \sim N\big(\Delta,\; \mathrm{SE}^2(\hat\Delta)\big). \]

Мощность отвержения $H_0$ на уровне значимости $\alpha$ зависит от стандартизированного размера эффекта $\Delta/\mathrm{SE}(\hat\Delta)$. Когда это отношение стремится к нулю, мощность стремится к $\alpha$ (тест не имеет мощности сверх доли ложноположительных). Конкретно, для одностороннего теста уровня $\alpha$ функция мощности приблизительно равна

\[ \mathrm{Power}(\Delta) = \Phi\!\left(\frac{\Delta}{\mathrm{SE}(\hat\Delta)} - z_{1-\alpha}\right), \]

где $\Phi$ — функция распределения стандартного нормального закона, а $z_{1-\alpha}$ — критическое значение. Когда $\Delta/\mathrm{SE}(\hat\Delta) = c$ для малой константы $c = O(1)$, мощность низка.

Статистическая неразличимость. Рассмотрим два порождающих данные процесса с разными истинными параметрами:

Для достаточно малого $c$ (зависящего от уровня значимости $\alpha$ и желаемой мощности) стандартные тесты гипотез не могут отличить DGP 2 от DGP 1 с вероятностью, существенно превышающей долю ложноположительных $\alpha$. Оба DGP с высокой вероятностью дадут $p > \alpha$ («схожие результаты»).

Когда $n_{\mathrm{post}}$ мало, $\mathrm{SE}(\hat\Delta) = O(n_{\mathrm{post}}^{-1/2})$ велика. Любой истинный разрыв $\Delta$, удовлетворяющий $\Delta = c \cdot O(n_{\mathrm{post}}^{-1/2})$ для малого $c$, будет иметь низкий стандартизированный размер эффекта. Такие разрывы запоминания, которые могут быть существенными в абсолютном выражении (например, 5–10 процентных пунктов), остаются статистически необнаружимыми. Следовательно, наблюдение схожей точности до и после отсечки не даёт валидного вывода о том, обладает ли модель подлинным прогнозным навыком ($\Delta = 0$) или необнаруженным запоминанием ($\Delta > 0$). $\blacksquare$

Асимптотическая идентификация. При $n_{\mathrm{post}} \to \infty$ имеем $\mathrm{SE}(\hat\Delta) \to 0$, и множество необнаружимых разрывов сжимается к нулю. При достаточно большом $n_{\mathrm{post}}$ любой ненулевой разрыв $\Delta > 0$ становится обнаружимым с мощностью, стремящейся к 1.

C.6. Доказательство следствия 2: дообучение чёрным ящиком

Доказательство следствия 2. Рассмотрим процедуру дообучения чёрным ящиком $\mathcal{F} : \Phi \times \mathcal{D} \to \Phi$, принимающую исходные параметры $\theta = \theta(I_{\mathrm{all}})$ и «забывающий» датасет $D_{\mathrm{forget}}$ и дающую дообученные параметры $\theta_{\mathrm{ft}} = \mathcal{F}(\theta, D_{\mathrm{forget}})$. Мы наблюдаем выходы дообученной модели: $Y_{\mathrm{ft}} = \delta_{\theta_{\mathrm{ft}}}(Q_t, \varnothing)$.

Доказательство следует той же конструкции, что и предложение 1. Мы не накладываем априорной структуры, связывающей оператор чёрного ящика $\mathcal{F}$ с целевым контрфактом $\theta_t$. Этот агностицизм — источник неидентифицируемости.

Зафиксируем любой наблюдаемый выход $y_{\mathrm{ft}} \in \mathcal{Y}$ дообученной модели. По предположению 1 существует $\phi_{y_{\mathrm{ft}}} \in \Phi$ такое, что $\delta_{\phi_{y_{\mathrm{ft}}}}(Q_t, \varnothing) = y_{\mathrm{ft}}$.

Для любых двух различных меток $y^\star, y^\dagger \in \mathcal{Y}$ строим два наблюдательно эквивалентных мира:

В обоих мирах оператор дообучения $\mathcal{F}$ производит параметры такие, что $\delta_{\theta_{\mathrm{ft}}}(Q_t, \varnothing) = y_{\mathrm{ft}}$. Наблюдаемый выход идентичен, но интерпретации противоречат друг другу: подлинное забывание ($\mathcal{W}^\star$) против выученного подавления ($\mathcal{W}^\dagger$).

Поскольку $y^\star \ne y^\dagger$ и оба мира согласуются с наблюдаемыми данными, $Y_t^\star$ не идентифицируем из выходов дообученного чёрного ящика. Без верификации белым ящиком (например, техник механистической интерпретируемости, идентифицирующих и верифицирующих удаление конкретных вычислительных путей, кодирующих информацию после $t$) мы не можем различить, действительно ли модель забыла или лишь научилась скрывать своё знание. $\blacksquare$

Сноски

  1. После первоначального обучения модели обычно проходят обучение с подкреплением на основе человеческой обратной связи (RLHF) для повышения полезности и безопасности, но нет свидетельств, что этот процесс расширяет их временную линию знаний.
  2. Пороговая точность измеряет процент правильных предсказаний того, превышает ли рост ВВП 2.5% — порог, выбранный для сбалансированной бинарной классификации (примерно 50% наблюдений в исторических данных выше этого порога).
  3. «Великолепная семёрка» — семь заметных технологических компаний: Apple (AAPL), Amazon (AMZN), Alphabet/Google (GOOGL), Meta (META), Microsoft (MSFT), NVIDIA (NVDA) и Tesla (TSLA).
  4. Эмбеддинги — высокоразмерные векторные представления, которые модель выучивает при обучении, чтобы располагать семантически близкие тексты рядом в векторном пространстве. Они извлекаются из внутренних представлений модели (токенных или пулированных предложенческих векторов) и могут дополнительно уточняться контрастивным обучением для улучшения сопоставления по семантическому сходству.
  5. Из другой литературы, вскрывающей ограничения LLM: Ross, Kim, Lo (2024) применяют теорию полезности для оценки экономических смещений LLM, показывая, что экономическое поведение этих моделей ни полностью рационально, ни целиком человекоподобно. Далее, S. Chen et al. (2024) исследуют, как LLM прогнозируют доходности акций, находя человекоподобные поведенческие смещения (сверхэкстраполяция от недавней результативности) при лучшей, чем у людей, калибровке доверительных интервалов.
  6. Мы фокусируемся на детерминированном (жадном) декодировании для ясности. Результаты обобщаются на стохастическое декодирование (температура > 0); см. приложение C.
  7. Больше информации о модели: platform.openai.com/docs/models/gpt-4o.
  8. Температура — параметр моделей ChatGPT, управляющий случайностью и креативностью ответов. Температура 0 по сути означает, что модель всегда выбирает слово с наивысшей вероятностью при условии текста, что устраняет эффект случайности в ответах и максимизирует воспроизводимость результатов.
  9. Llama-3.1-70B-Instruct — 70-миллиардная инструкционно дообученная модель Llama-3.1 от Meta, выпущенная 23 июля 2024. Больше информации: huggingface.co/meta-llama/Llama-3.1-70B-Instruct.
  10. Таблица A1 в приложении приводит сводные статистики данных как бенчмарк точности для сравнения способности модели воспроизводить значения с истинными данными.
  11. Мы также тестируем альтернативные фальшивые отсечки знаний до 2005 и до 2015 годов для роста ВВП в таблицах A2 и A3 приложения и находим схожие паттерны.
  12. Больше информации об эмбеддинг-модели: platform.openai.com/docs/models/text-embedding-3-large.
  13. Схожий паттерн наблюдается при использовании расширяющегося окна. Рисунок A4 показывает сравнение с расширяющимися окнами и простой скользящей средней с 5-летним окном. Расширяющийся подход использует десять фолдов с зазором в один фолд между обучающими и тестовыми данными: для $n$-го фолда модель обучается на фолдах с 1 по $n$ и тестируется на фолде $n+1$. Кроме того, результаты значимо не меняются при силе регуляризации $\lambda = 0.001$ (рисунок A5) и $\lambda = 0.1$ (рисунок A6).
  14. Мы используем 5-летнюю SMA как бенчмарк, поскольку при стандартной практике Ridge-регрессия на скользящем окне коллапсирует к среднему окна (SMA), когда предикторы не несут сигнала.
  15. Мы находим схожие результаты для нескольких open-source эмбеддинг-моделей: (i) SFR-Embedding-Mistral, (ii) nomic-embed-text-v1.5, (iii) all-MiniLM-L6-v2 (см. таблицу A5 в приложении).
  16. Мы повторяем этот тест с другими конфигурациями в таблице A6 и находим, что модель vec2text показывает схожие паттерны.
  17. Llama-3.1-70B-Instruct — 70-миллиардная инструкционно дообученная модель Meta (выпущена 23 июля 2024) со 128K контекстом и мультиязычной поддержкой. Мы используем публично выпущенные веса под лицензией Llama 3.1 Community License (source-available). Дата отсечки знаний модели — декабрь 2023.
  18. Это предположение чрезвычайно слабое. Для любой конкретной задачи доказательству требуется лишь его выполнение для конкретных меток, участвующих в контрфактическом сравнении. Для нейросетей с непрерывными высокоразмерными параметрическими пространствами и конечными множествами ответов это по сути бесспорно.

Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2504.14765 · Lopez-Lira, Tang, Zhu (University of Florida) · CC BY-NC-ND 4.0.