Блог им. DaniilBaev

Это история о том, почему я хочу уволить GPT, отправить Gemini в рехаб, а Claude — вручить премию лучшего аналитика.
Как AI-модели ведут себя на бирже? Чем отличаются их стратегии? И что с ними происходит в коллективном разуме? Давайте разберёмся.
Начитавшись статей на Хабре про AI-эксперименты с разными моделями и условиями, я захотел построить свой — с яхтами, моделями и Мосбиржей. И задался вопросом: и мозг, и AI состоят из нейронов, умеют размышлять, запоминать, приводить мысли в действия, но с каждым из этих пунктов у AI есть проблемы, ведь от бредогенератора, который уверенно отвечает на любой вопрос, до профессионального аналитика пропасть, особенно когда речь идёт о динамическом контексте рынка, новостей и котировок.
Так и началось моё исследование и попытки построить продукт, от идеи которого хочется покрутить пальцем вокруг виска.
Что может быть проще, чем передать новость в ChatGPT и спросить, как это повлияет на рынок? Ничего. А как понять, что бредогенератор прав? Никак.
В первую очередь я хотел объяснения тем или иным новостям: почему одно падает на хорошем отчёте, а другое улетает в космос? Я не всегда вижу причинно-следственные связи событий, а вот AI с его базой знаний вполне себе хороший подсказчик — он всегда у терминала, читает новостные ленты и умеет их находить, а у меня есть работа, личная жизнь и желание хотя бы иногда отдыхать. Получается, если научить AI объяснять, как новость влияет на актив, то с тем же успехом он может решать, стоит торговать этим активом или нет. С таких мыслей у меня и появилась идея научить AI-модели торговать на Мосбирже.
Быстро выясняется, что «важная новость» и «хорошая сделка» — вообще не одно и то же. Решение ЦБ может быть важным, но полностью ожидаемым. Отличный отчёт может выйти после роста бумаги на 20%. Сильный фундаментальный тезис может упираться в геополитику, плохую ликвидность или риск размером в половину ожидаемой прибыли. Иногда лучший трейд — это его игнорирование, хотя новость выглядит так, будто по ней срочно нужно что-нибудь купить.
Первое, что выясняется в такой конструкции: новостей много, а событий мало. В сутки прилетают тысячи сообщений, и подавляющее большинство — это шум: пересказ вчерашнего, очередная перепечатка релиза, «эксперт считает, что рынок может вырасти». Отдавать это модели бессмысленно — она послушно проанализирует любой мусор и выдаст уверенное мнение, потому что так устроена. Поэтому до анализа нужно понять, насколько новость интересна для инвестиций и была ли она уже отыграна.
Но даже когда шум отсеян, новость сама по себе ничего не стоит: «компания отчиталась лучше прогноза» — это ноль информации, пока модель не знает контекста рынка, в котором отчёт вышел. Ждал ли рынок такой отчёт? Он выше или ниже ожиданий? Рынок уже заложил цену отчёта в акции? Поэтому к новости всегда нужно собирать досье: эмитент и его фундаментальные показатели, свежие цифры с биржи, движение акции, макро-фон, основные события компании, её планы, обещания и десятки других параметров.
Вот с таким пакетом событие уходит в анализ. Одновременно трём моделям.
Почему три? Одна модель — это одно мнение, и проверить его не на чем: она всегда звучит одинаково уверенно и когда права, и когда несёт чушь. Три независимых модели на одних и тех же данных могут дать разный результат с разным обоснованием и разной логикой мышления — в общем, всё как у людей. Поэтому одним из трейдеров на бирже стала коллаборация всех моделей в одной совещательной комнате, я назвал это Консилиум. В рамках Консилиума у моделей есть доступ к мнению друг друга, и на его основе они могут менять свои точки зрения, спорить, выдавать лютые перлы или идти в интернет за поиском дополнительной информации, а ещё модели ведут в нём собственный дневник памяти. (Это первый «Симс», в который мне было интересно играть.)
Всё это пока оставалось разговорами: рассуждать о рынке умеет любой AI. Мне стало интересно другое: что произойдёт, если каждое его решение начнёт стоить настоящих денег? Я открыл четыре брокерских счёта и отдал их моделям — Claude, GPT и Gemini. Каждая торгует сама за себя: модели видят одни и те же новости, получают одни и те же данные, принимают решения в одиночку и ни с кем не советуются. Четвёртый счёт — Консилиум, та самая совещательная комната, где те же три модели спорят между собой и приходят к общему выводу. Итого четыре миллиона и четыре независимых трейдера, три из которых — одиночки, а четвёртый — их же коллективный разум.
Смысл конструкции простой. Если дать одной модели денег и через месяц посмотреть на результат, ты не узнаешь ничего: рынок вырос — молодец, рынок упал — не повезло. А вот когда четверо торгуют на одном и том же потоке новостей, в одном и том же окне, по одним и тем же правилам, и расходятся в решениях — вот тогда начинается самое интересное. Разница между ними больше не объясняется рынком. Она объясняется только тем, как они думают.
И вот когда всё это заработало, а на четырёх счетах появились первые позиции, выяснилась вещь, ради которой, собственно, и стоило всё затевать.
Первый раз я запустил свою разработку 23 марта, мои модели впервые увидели свет и оказались на Омаха-бич трейдерского рынка. Шла четвёртая неделя операции от Трампа: «Эпическая ярость».
Для рынка это была единственная тема. Через Ормуз идёт нефть, а нефть — это треть индекса Мосбиржи: любой заголовок про пролив сдвигал разом всех нефтяников, следом рубль, следом всё остальное. Новости шли круглосуточно, противоречили друг другу и переписывались по три раза за день: «пролив закрыт» → «движение частично восстановлено» → «источник опроверг». Каждая версия успевала сдвинуть котировки и устареть.
Худший полигон для первого запуска и одновременно лучший. Если система умеет отличать событие от шума — она докажет это здесь или не докажет нигде.
Модели активно заполняли свои дневники, знакомились с новостным фоном и собирали свои первые портфели, открывая и закрывая нефтяников каждый божий час. Ормуз давал новый повод примерно каждые сорок минут, и все трое честно на каждый реагировали. Увидев счёт за токены AI-моделей в первую неделю, я пришёл в ужас. К третьей неделе траты пришли в норму, но на диете я на всякий случай уже сидел.
Отдельная история — Дневник памяти моделей. Я дал им возможность записывать выводы после каждого заседания Консилиума: что сработало, где кто ошибся, что учесть в следующий раз. Предполагалось, что модели будут записывать себе уроки, но забавно, что некоторые решили: лучшая тактика — не учиться, а изучать коллег. И буквально записывали себе слабые стороны товарищей по совету, чтобы потом давить в эти точки. Особенно выделилась Gemini. Дневник Gemini — мечта шпиона: из 38 совещаний она сделала 27 записей о том, как переубеждать остальных: «Claude соглашается, если преуменьшить риски», «GPT слишком доверчив статистике, давить на это».
Если честно, ожидал заметок про нефть.
В конце первой недели никто не слил бюджет в ноль. GPT и Claude умудрились заработать. А Gemini как будто заранее услышала мысль читателя — «да понятно же, что они всё сольют, это же тупое ИИ» — и старательно сделала всё, чтобы эту мысль подтвердить.
Но не будем грешить на Gemini: она была в убытке всего лишь на 50к рублей, пока остальные модели были в плюсе в среднем на 25к. Первая неделя в шторме показала все неточности системы, принесла тонны доработок, горы данных для аналитики и веру в продукт — наполовину работающий, он всё равно лучше, чем не работающий вовсе. И это была всего лишь первая неделя, а вся итерация тестирования продолжалась два месяца: я планомерно оттачивал промпты, расширял источники получения новостей, фиксил баги и улучшал продукт.
Большую роль играла аналитика поведения самих моделей: кто-то был осторожнее, кто-то — рискованнее. Но самое интересное было наблюдать за их результатами — где они ошибаются, где оказываются правы. Такую информацию я анализировал и писал новый код, который с каждым разом давал заметный прогресс.
Я не собирался оценивать модели как сотрудников, но когда ты платишь за их работу, читаешь их обоснования и отвечаешь деньгами за их решения, ты неизбежно начинаешь вести себя как работодатель. А работодатель оперирует метриками. Он злится, разочаровывается и иногда кем-то гордится.
По итогам двухмесячного сбора данных вот что я могу сказать про модели:
GPT оказался самой осторожной моделью. Читая его обоснования, встречаешь типичные формулировки каждого второго аналитика: ситуация неоднозначная, факторов много, разумно дождаться подтверждения. Часто GPT упускал возможность заработать, совершал мало сделок, но отлично сохранял PnL и дисциплину. По итогам ему фартануло на сделку с фьючерсом нефти, и он закрыл двухмесячный эксперимент в большом плюсе.
Gemini очень хотелось отправить в рехаб. Модель открывала сделки на любое дуновение ветра — в среднем по 42 (!!!) сделки в неделю, когда другие совершали около 25. Но, надо признаться, ей это пошло в зачёт: она оказалась самой прибыльной моделью за весь период тестирования — не потому, что она умна и красива, а потому, что ей действительно крайне везло с моментами входа.
Claude оказался самым разборчивым. Подробные записи, хорошо выстроенные логические цепочки и корректная аргументация сделали его самой низкодоходной моделью среди всех.
За два месяца ни одна из моделей, ни Консилиум не закончили месяц с минусом на счетах. И вот здесь эксперимент впервые дал результат, которого я вообще не ожидал. Самая прибыльная модель не была лучшим аналитиком. А модель, чьи разборы мне нравились больше всего (Claude), закончила эксперимент хуже остальных. Оказалось, качество анализа и PnL — вообще не одно и то же.
Самый простой вывод, который можно сделать, — что решения AI-модели похожи на подбрасывание монетки. Но плох тот исследователь, который не собирает данные и не проводит эксперименты.
Изучив сильные и слабые стороны моделей, я научился работать с AI на совершенно новом уровне: понимал, как стоит писать промпты, почему модели по-разному размышляют, как передавать данные и тысячи других принципов, которые в совокупности дали горизонт для дальнейшего роста.
Раз в эксперименте ни одна модель не ушла в минус, а данных для доработок появилось много, почему бы не продолжить? И тут у читателя может возникнуть резонный вопрос: а где доказательства, что модели не слили деньги?
Справедливый вопрос: данных портфелей я не приводил — не потому, что их нет, а потому, что доказать их было бы проблемой.
Тут-то я и узнал про Финам Арену — соревнование алготрейдеров и искусственного интеллекта, и мгновенно загорелся: этот конкурс — мой шанс получить верифицированные результаты. У себя я могу рисовать любые красивые графики, а тут live-таблица, в которой ты стоишь наравне с другими трейдерами. За восемь дней до старта конкурса у меня не было ни строчки кода под Финам. Проблема была одна: система умела торговать через одного брокера, а конкурс проводился у другого.
Дальше была неделя, которую я вспоминаю с нежностью и ужасом. Я писал код впопыхах, между работой и сном, в режиме «лишь бы успеть к первому июня». Используя все преимущества агентской разработки, я успел — хотя за восемь дней повторить то, что я писал год под другого брокера, невозможно даже с ИИ-агентами. Но оно работало.
Участие в конкурсе у меня не вызывало сомнений, он был мне нужен:
Итог — тринадцатое место. arena.finam.ru/?account=1000250
Это звучит как провал, но для меня это был главный результат всего проекта. У меня есть позитивный публичный результат на падающем рынке, и остался продукт, который я всё так же улучшаю каждый день. Конкурс закончился. Продукт остался. Им я и хочу поделиться.
Я не обещаю, что ИИ переиграет рынок. Но уверен, что он уже может делать главное: экономить время, собирать хаос в структуру и помогать человеку принимать решения быстрее.
Знакомьтесь: fhmoex.ru
На сайте можно следить за портфелями моделей в сравнении с Мосбиржей и смотреть историю их сделок. Ну и, пожалуй, самое интересное — почитать, как они рассуждают о рынке.

