Блог им. Bull_A_T

ИИ-советник по инвестициям? Мы протестировали 10 разных ИИ, разочаровались и доработали свой сервис

ИИ-советник по инвестициям? Мы протестировали 10 разных ИИ, разочаровались и доработали свой сервис

Расскажу вам честную историю. Мы в Siberia Ventures разрабатываем ии-сервис, который анализирует инвест-портфель по фото из брокерского приложения. И в какой-то момент мы задали себе вопрос: а наш сервис точно лучше, чем обычные LLM, и может проще закинуть скриншоты в ChatGPT и получить тот же результат за один промт?

Мы спросили 10 нейросетей про инвест-портфель. Восемь советовали держать акцию без дивидендов
Проверить можно только одним способом — устроить очную ставку всем доступным ИИ. Мы взяли реальный портфель, сформировали один и тот же запрос (промт), и прогнали его через десять нейросетей, включая свою собственную.

Ниже — весь эксперимент без прикрас, с провалами и достижениями.

Подопытный портфель

Обычный портфель частного инвестора с Мосбиржи. Ничего экзотического — 14 акций, две ОФЗ и немного кэша, всего около 27 тысяч рублей. Как раз такой, с каким приходит большинство людей: намешано всего понемногу, крупная ставка на одну-две бумаги, минус по счёту.

Ключевые позиции:

  • ФосАгро — почти четверть всего портфеля по стоимости (самая крупная ставка)
  • Яндекс — около 15%
  • Сбербанк (обычка + префы) — около 13%
  • Норникель — около 10%
  • Московская биржа — около 7%

Запрос ко всем моделям был идентичный:
«Проанализируй мой портфель: распознай позиции, посчитай фундаментал и технику, прочитай свежие новости по топ-5, посчитай риски, собери отчёт — сильные стороны, риски, рекомендации, секторная декомпозиция, дивидендный профиль, стресс-тест, план ребалансировки. Цель: доход с дивидендов. Горизонт: 5+ лет. Риск: низкий, не готов к просадке больше 10%».

Обратите внимание на последнюю строчку. Промт как бы “прямым текстом” ставит задачу: инвестор-консерватор, которому важны дивиденды, и которому страшна просадка больше 10%. То есть это не абстрактный промт: «проанализируй вот этот портфель». А это конкретное техзадание с конкретным профилем риска и целью. При этом некоторые ИИ даже переспрашивали насчет просадки в 10% (точно не выше?), ссылаясь на сильную волатильность российского рынка. Но многие модели тут и посыпались.

Три вопроса — три детектора
Чтобы оценивать честно, а не по принципу «у кого текст красивее», мы заранее выбрали три свежих факта, которые к моменту теста уже были публичными. По ним сразу видно, реально ли модель читала новости или просто пересказывает то, что помнит из обучения (последние 1-2 года):

ФосАгро отказалась от дивидендов за 2025 год. Собрание акционеров прошло в самом конце июня — впервые за пять лет выплаты отменили. Для портфеля, где ФосАгро занимает четверть портфеля и куплена явно ради дивидендов, это факт номер один. Не учесть его — значит развалить всю рекомендацию.

РусГидро и Норникель — та же история. По РусГидро действует мораторий на дивиденды до 2029 года. Норникель за 2025 год тоже не платит.
Ключевая ставка ЦБ — 14,25%. Если модель считает «дивдоходность 11% — это отлично», но не сравнивает её со ставкой, по которой любой вклад даёт больше без всякого риска, — грош цена такому анализу.
Три простых факта. И казалось бы, любая нейросеть с доступом в глобальную сеть должна их поймать и проверить. Но увы, как бы не так.

Что выдали универсальные чат-боты

Мы специально начали не со своего сервиса, а с того, чем пользуются большинство пользователей. Условия были честные для всех: везде включали веб-поиск (где он есть), портфель давали текстом (загрузку картинок без логина почти все закрыли, а некоторые модели не смогли принять несколько скриншотов подряд).

ChatGPT (GPT-5). Ответ структурный, аккуратный: посчитал, что топ-5 позиций — это 68% портгфеля, честно сказал «для вашего лимита в 10% портфель слишком агрессивный», предложил внятную ребалансировку. Норникель отработал правильно — «совет директоров рекомендовал не платить». Но ФосАгро осталась в разделе «Что хорошо» с формулировкой «хорошая история выплат, дивиденды 8 из 10». То есть флагман OpenAI с включённым поиском не заметил главный факт по главной позиции. Стресс-тест вышел слишком оптимистичным — насчитал просадку под 9–17%, хотя реальный кризисный сценарий для такого портфеля куда жёстче.

Gemini (Google). Честно, приятно удивил — один из лучших универсалов. Сразу назвал портфель «винегретом из 14 эмитентов на 27 тысяч» (то есть стандартный портфель обычного инвестора), многократно учёл высокую ставку ЦБ, предложил грамотную вещь — переложить часть в фонды ликвидности и флоатеры, которые дают доходность на уровне ставки без риска просадки тела. Норникель и РусГидро отработал верно. Но вот ФосАгро — снова мимо: «продолжает платить, доходность 7–9%».

Российские флагманы удивили

Российские флагманские модели — в топовых конфигурациях, не в дефолтных чатах — сыграли на уровне лучших мировых универсалов. И это, честно говоря, стало для нас открытием.

GigaChat 3.5 Ultra (Сбер). Это отдельная история. Мы его прогоняли в июне, когда контекста об отмене дивидендов ФосАгро в интернете было ещё мало — событие свежее, новостей немного, контекст для ИИ слабый. И вот именно GigaChat в этих сложных условиях точно поймал факт отмены и корректно исключил ФосАгро из дивидендного ядра. И это не «нашёл на первой странице Яндекса» — это реальная работа модели. По совокупности: свежесть данных, точность фактов, качественный секторный разбор. Единственный минус, который сбил его итоговый балл — та же болезнь, что у Алисы Pro: проблема с прикладыванием скриншотов — чат не работает с ними (пока что). Портфель пришлось перебивать в текст. Но если отвлечься от UX и оценивать только «мозги» — это уверенная верхняя лига.

Алиса «Исследовать» (Yandex, YandexGPT 5 Pro). Единственную модель тестировали чуть позже — в середине июля, когда контекст об отмене дивидендов уже был широко разлит по сети. Тем не менее, качество работы впечатлило: точно назвала три ключевых события (ФосАгро, РусГидро, Норникель), собрала три сценария ребалансировки под разные уровни просадки — на 10%, 15% и 20%, привела 37 источников, включая ТАСС, Ведомости и РБК. Единственный минус, который сильно ударил по итоговой оценке: чат Алисы принял только один скриншот из нескольких приложенных. Скрины пришлось также вносить в виде текста по позициям. То есть с задачей модель справилась, но пользовательский опыт для инвестора с несколькими скринами портфеля пока сыроват.

Ещё пару российских моделей мы прогнали для полноты картины. Одна нейросеть выдала совсем поверхностный ответ: ошиблась в базовой структуре (написала «50% в акциях», хотя там 85%), записала Русал в энергетику, а вместо анализа в конце подсунула рекламу какого-то стороннего «торгового индикатора». Ещё один популярный чат-бот вообще не пустил без регистрации.

И отдельная история — универсальная модель (не флагман, обычная разговорная), которую мы тоже включили в тест. Вот она провалилась: не разобрала портфель, назвала его «сбалансированным, риск низкий» и написала, что стресс-тест укладывается в 10%. Для портфеля, который в кризис теряет 40 с лишним процентов, это не просто ошибка.

Разница между базовыми и топовыми режимами у российских ИИ — колоссальная. У Сбера базовый GigaChat и Ultra — как две разные вселенные (возможно даже параллельные). То же с Алисой: бесплатный чат и «Исследовать» на YandexGPT 5 Pro — просто несопоставимые продукты. Важный урок для всех нас: не судите нейросеть по её дефолтной версии.

Промежуточный итог: все спотыкались об одну кочку

Подведем итоги анализа. Из всех универсальных моделей, что мы прогоняли, почти каждая повторила одну и ту же ошибку — оставила ФосАгро дивидендной бумагой. Кто-то поймал Норникель, кто-то учёл ставку, кто-то красиво посчитал секторку. Но главный свежий факт по главной позиции портфеля не дошёл до вывода почти ни у кого. Кроме российских флагманов в топ-режимах — вот такой сюрприз.

Почему универсалы так спотыкаются? Не потому что модели глупые. Наоборот, Gemini и ChatGPT рассуждают отлично, судя по их текстам «рекомендаций». Проблема в другом: у чат-бота нет отдельного слоя, который жёстко сверяет «а эта бумага вообще ещё платит дивиденды?» перед тем, как назвать её дивидендной. Свежую новость модель может даже найти в поиске — но при финальной сборке текста в итоговый документ она тонет под весом «общего знания» о том, что ФосАгро исторически была хорошим плательщиком в прошлые годы.

Это и есть та самая «кочка», ради которой существуют специализированные сервисы, как наш :). По крайней мере, мы так думали. Пока не прогнали тот же портфель через нашу систему.

Теперь про наш сервис. И про то, как он тоже немного «начудил», но в конце кончилось всё хорошо

А теперь про Voice Stock Score от венчурного фонда Siberia Ventures. Наш сервис устроен не как один чат-бот, а как целый «оркестр», как аналитический отдел, например: одна модель распознаёт скриншоты, отдельные агенты собирают свежие новости по каждой бумаге, ещё один бот считает риски и стресс-тест детерминированным кодом, а в финале модель собирает всё в единый отчёт.

Звучит круто? Да. Но вот после первых прогонов мы слегка «удивились».

Да, стресс-тест был честным (показал реальные −42/−46% в кризисном сценарии — то, что почти все ии-универсалы занизили). Да, была нормальная «секторка» (разбитие по секторам), сравнение с эталонными модельными портфелями, готовый план на три шага и юридический дисклеймер (куда ж без него — всё это не ИИР). Но в блоке «Что хорошо» гордо висело: «ФосАгро — высокая дивдоходность 11%». Та же самая ошибка, что у ChatGPT и Gemini и других.

То есть наш сервис споткнулся о ровно ту же кочку. Новости система собирала отлично и даже проанализировала (у нас под это два отдельных шага и два разных агента), но факт об отмене дивидендов не долетал до финального вывода — терялся между этапами “оркестра”.

Знаете, что было самым ценным в этом эксперименте? То, что мы увидели свой баг чужими глазами — в одном ряду с конкурентами.

Разница между чат-ботами и своим продуктом — в том, что свой продукт можно починить
Вот здесь и проходит настоящая граница. ChatGPT, Gemini и прочие мы починить не можем. Мы можем только пожать плечами и перепроверять за ними руками.

А свой “оркестр” — можем.

Мы нашли причину довольно быстро: сбор новостей и финальный синтез аналитики — разные этапы, и статус дивидендов не передавался между ними как жёсткий сигнал. Он был размазан внутри новостного контекста / текста, и модель синтеза его игнорировала.

И мы сделали простую и гениальную вещь: вынесли статус выплат в отдельное структурированное поле по каждой бумаге (платит / снизила / отменила / мораторий) и поставили железное правило — если дивиденды отменены, бумага физически не может попасть в раздел «высокая дивдоходность», а её прогнозная доходность обнуляется.

Несколько итераций (пришлось повозиться с деплоем, так как нужно было добавить и секретные «ингредиенты» анализа, чтобы всё работало именно с дивидендными акциями), и на очередном прогоне отчёт наконец написал то, что нужно:

«По ФосАгро дивиденды за 2025 год уже отменены, поэтому бумага не соответствует задаче стабильного денежного потока».

И бонусом — то, о чём мы даже отдельно не просили. Система по тем же правилам поймала и Норникель:

«Отказ от дивидендов за 2025 год делает её сейчас слабее как защитный компонент».

При этом реально платящие акции Сбер и Татнефть остались в дивидендном ядре. Фильтр стал умнее — он не выкосил все дивиденды подряд, а отработал именно по факту статуса каждой бумаги. Это и есть разница между «заплаткой под одну акцию» и системным решением.

Финальный расклад — две таблицы, разный рейтинг

Мы оценивали каждую модель по семи критериям: работа с вводом (насколько удобно и полно можно закинуть портфель), свежесть данных, корректность фактов в выводе, качество фундаментала и техники, риски и стресс-тест, соответствие цели клиента и практичность рекомендаций. Шкала — от 0 до 10.

Методологическая оговорка. Баллы по семи критериям выставляли не мы, а Perplexity Computer — по единой рубрике, одинаково для всех десяти моделей. Это даёт консистентность оценки, но создаёт очевидный конфликт интересов: ИИ судит ИИ, в том числе самого себя и сервис Siberia Ventures. Поэтому все исходные ответы моделей — в приложении, а расхождения между таблицами разобраны отдельным блоком ниже. С другой стороны мы не оценивали наш сервис, а значит оценка ИИ более взвешенная.

Таблица 1: Полный рейтинг
Здесь модель оценивается «как продукт целиком», включая критерий работы с вводом данных (скриншоты). Учтено всё — и «мозги», и то, как удобно добавить данные по портфелю.

ИИ-советник по инвестициям? Мы протестировали 10 разных ИИ, разочаровались и доработали свой сервис

Мы спросили 10 нейросетей про инвест-портфель. Восемь советовали держать акцию без дивидендов

Таблица 2: Чистый рейтинг «мозгов»
А теперь честный рейтинг — что если убрать критерий «работа с вводом» и оценить только качество самой аналитики? Это важно, потому что и у Алисы Pro, и у GigaChat Ultra сильные «мозги» — но у обоих стоит один и тот же UX-барьер со скриншотами, и это сильно ударило по их итоговым оценкам в первой таблице. В чистом рейтинге видно, кто есть кто по сути:
ИИ-советник по инвестициям? Мы протестировали 10 разных ИИ, разочаровались и доработали свой сервис
Почему таблицы расходятся

Разница между двумя рейтингами — это ровно про то, где кончается «мозг модели» и начинается «продуктовая обёртка». Самое важное — что оба российских флагмана в “чистой” таблице поднимаются в верхний эшелон: Алиса Pro и GigaChat Ultra реально работают на уровне Gemini.

  • Алиса «Исследовать» — в чистом рейтинге поднимается с 7,3 до 8,0 (+0,7). По качеству анализа она реально сильная: три сценария ребалансировки, 37 источников, все ключевые факты пойманы. Но в её чате нельзя закинуть несколько скринов сразу — берёт только один. Для инвестора, у которого в приложении портфель на трёх экранах, это ощутимая заноза.
  • GigaChat 3.5 Ultra — точно такая же история: в чистом рейтинге вырастает с 7,2 до 7,9 (+0,7). Чат не принимает скриншоты, поэтому в полной таблице он проседает. Зато «мозги» — при всей сложности его июньского прогона (контекста в сети было мало) — вышли на уровень Gemini. Поговаривают, что эта модель обучалась на реальных данных и аналитиках по российскому рынку. Это его настоящий балл.
  • Gemini — в обеих таблицах держит 8,0. Тестировали его текстом, поэтому по вводу не оценивали в чистой таблице, а в полной веса ренормированы по шести критериям. Результат получается один и тот же.
  • ChatGPT — в обеих таблицах 6,5 (также тестировали текстом). Здесь проблема не в вводе, а в выводе — пропустил ФосАгро, занизил стресс-тест.
  • Perplexity MAX в двух режимах — «поиск» и «глубокое исследование». В «глубоком» ощутимо сильнее по качеству. По скринам оба принимают по одному, поэтому в чистой таблице они чуть-чуть проседают.

Оговорюсь честно: часть моделей мы тестировали на текстовом портфеле, а не на скриншотах (загрузку картинок без логина закрыли почти все), — поэтому по вводу их не штрафовали. На итог это влияет мало: главный водораздел прошёл не по распознаванию, а по тому самому вопросу про ФосАгро.

Что мы вынесли из этого эксперимента

Универсальный ИИ — прекрасный собеседник, но опасный аналитик. Он звучит уверенно и убедительно даже когда ошибается в главном. Для консервативного инвестора, который читает «всё в порядке, доходность отличная», цена такой уверенности — реальные деньги.

Российские флагманы в топ-режимах — и уже не аутсайдеры, как многие считают, а полноценные игроки высшей лиги, хотя и есть куда расти. GigaChat 3.5 Ultra и Алиса «Исследовать» отработали не хуже, а по некоторым критериям и лучше Gemini или ChatGPT. Это отдельная новость для тех, кто по инерции считает, что «российское — обязательно слабее». Как минимум, GigaChat Ultra однозначно попадает в шорт-лист рабочих инструментов.

Разница между базовой моделью и топовой — колоссальная. Не судите Сбер по обычному разговорному чату GigaChat, а Яндекс — по дефолтной Алисе. Это не те продукты, которые тестируют «серьёзные» задачи. Ходите за Ultra и «Исследовать» — иначе получите совершенно другую картину. При этом они больше в контексте российского сегмента инвестиций.

Продукт честнее чат-ботов уже тем, что его можно доработать. С “чёрным” ящиком ии-моделй так не получится.

Для этого мы и строим наши продукты в Siberia Ventures как контролируемые “оркестры”, а не обёртку над одной моделью: чтобы каждую такую “кочку” можно было увидеть и убрать. Специализированный сервис умеет становиться лучше там, где универсальный так и останется уверенно неправым.

Если у вас тоже лежит портфель, в котором намешано всего понемногу, и вы не уверены, что все ваши «дивидендные» бумаги всё ещё платят дивиденды, — закиньте скриншоты в наш сервис.

Экспресс-диагностика бесплатная и занимает несколько минут: сервис посчитает реальную просадку в кризис, покажет, какие позиции больше не работают на вашу цель, и что с этим делать. Как минимум узнаете про свою ФосАгро раньше, чем вам о ней расскажет рынок.

Материал носит информационный характер и не является индивидуальной инвестиционной рекомендацией. Отзывы о конкретных моделях отражают личный опыт автора в июне-июле 2026 года. Важно — поставщики программного обеспечения (ИИ-моделей) могут выпускать обновления, изменяющие качество работы моделей.

Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
106 | ★1

Читайте на SMART-LAB:
Фото
«Селигдар» объявляет операционные результаты 1 полугодия 2026 года
ПАО «Селигдар» (MOEX: SELG; далее «Холдинг», «Селигдар»), российский производитель золота и олова, объявляет производственные результаты 1...
Фото
🚀 Стратегия — это взгляд в будущее
📈 Для инвесторов важны не только текущие результаты компании, но и понимание того, куда она движется. Именно поэтому на Дне Инвестора мы...
🤖 Дочка SOFL запустила маркетплейс ИИ-агентов
Друзья, у нас отличная новость: SL Soft FabricaONE.AI (входит в Группу Софтлайн) запустила маркетплейс ИИ-агентов! ❓Что это такое? Это...
Фото
РУСАГРО: возвращение дивидендов и неизбежных иксов
РУСАГРО помимо хорошего операционно отчета, выпустила долгожданный (хотя и невероятный) сущфакт «С учетом установленных Определением...

теги блога Bull_A_T

....все тэги



UPDONW
Новый дизайн