Блог им. Auximen

Сколько стоит современный ИИ?

    • 19 августа 2026, 17:02
    • |
    • Auximen
      Smart-lab премиум
  • Еще
На 3DNews / ServerNews Увидел интересную статью, которая даёт представление о стоимости развёртывания современных ИИ моделей.

Компания MWS Cloud (входит в МТС Web Services) проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей.

Экспертную оценку прошли популярные открытые модели, выпущенные весной и летом соответствующего года.

Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2.

Для 2026 года — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.

Исследование показало, что средняя стоимость минимального набора ускорителей NVIDIA для запуска одной модели увеличилась в 2,8 раза — с 13,7 млн руб. в 2025 году до 38,8 млн руб. в 2026 году.


2025 год


Сколько стоит современный ИИ?

2026 год

Сколько стоит современный ИИ?

Новые ИИ-модели становятся более мощными: они лучше справляются со сложными задачами и могут обрабатывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растёт и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже, пояснили в MWS Cloud результаты исследования.


Источник: ServerNews.ru
Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
5.9К | ★1
50 комментариев
Это только по оборудованию, а есть еще и энергопотребление на задачи.
avatar

ха-ха 2 раза, DeepSeek-V4-Pro, DeepSeek-V4-Flash в последних версиях ставятся на пару DGX Spark… если будет не 2, а 4 машины в кластере — будет айс!

если, конечно, Вы не собираетесь делать полное и быстрое обучение моделей ))) в противном случае бюджет, указанный выше надо умножать в 50-100 раз

avatar
Ho_Chu, но у NVIDIA DGX Spark в описании написано, что он позволяет работать с моделями до 200 миллиардов параметров, а при объединении 2-х до 405 миллиардов параметров, в то время, как у DeepSeek-V4-Pro 1,6 трлн параметров, 2 х 128 Гб универсальной памяти (это означает минус 15 Гб оперативной памяти на задачи системы) для этой модели явно недостаточно.
avatar

Auximen, дядь, а дядь! речь идет про активные параметры, которые нужно держать в видеопамяти, а для остальных достаточно быстрого ССД, желательно 5.0… вот и фсё!

наслаждайтесь!

avatar
Ho_Chu, я понимаю, вот, что говорят источники

avatar

Auximen, Вы можете, конечно, замахнуться и купить 900 Гб видеопамяти, но нам, в нашей деревне, хватит и 2-х Спарков (и ещё 2 заказаны)… смесь экспертов и нужна для того, чтобы не тащить всё в видеопамять, а быстрый ССД 5.0 — для того, чтобы тусоваться туда-сюда постоянно... 

все зависит от задачи… если у Вас постоянная задача, например, фигачить бульварные романы о любви, то Вам не нужны ВСЕ параметры под рукой… значит и обращение ко ВСЕМ будет нечастым… сами решите, что для Вас критично — 350 млн рублей в железе или количество токенов в минуту на выдаче?

avatar
Ho_Chu, для 4х Спарков нужен будет еще Свитч, как ты их соеденишь без него.
Кстати Свитч стоит чуть дешевле одного Спарка
avatar
Auximen, кстати, Вы можете спросить у Алисы или кого угодно, где скачать модель FP16, например… и она зависнет, т.к. таких моделей просто нет… их нет, от слова «совсем»
avatar
Auximen, DeepSeek часто врет, НЕ нужно загружать в VRAM все веса MOE модели, часть весов может остатся в RAM, но будет работать немного медленнее.
Напиши ему что он не прав и для MOE модели не нужно все загружать в VRAM, он извинится и напишет другой ответ
avatar
Ho_Chu, балабол, ты сам то хоть пробовал запускать LLM с быстрым SSD, давай напиши сколько у тебя получается и с какой моделью 
avatar
Beach Bunny, в штанах тебя балабол, не надо грубить незнакомцам
avatar
Ho_Chu, и это все что ты можешь ответить по теме.
Очень содержательный ответ. 
avatar
Beach Bunny, на минисфоруме-С1 на 128 Гб общей памяти, новый Флэш-0731 с q3 выдает 18-20 токенов — доволен?
avatar
Ho_Chu, не, тыж писал про DeepSeek4 Pro которому достаточно 96Gb VRAM ?
А теперь пишешь про Flash который примерно в ШЕСТЬ раз МЕНЬШЕ.

avatar
Beach Bunny, а ну-ка ткни пальцем, где я писал, что 96 Гб достаточно для ПРО?
avatar
Ho_Chu, ниже почитай что ты писал
avatar
Beach Bunny, ты что, — тоже как ПРО? он тоже считал попервоначалу, что 96 больше 98 ))) повторяю вопрос: ткни пальцем, где я писал, что 96 Гб видеопамяти достаточно для ПРО?
avatar
Ho_Chu, то есть по твоему между 96 и 98 огромная разница?
Ok

— то есть 96Gb НЕ хватит для DeepSeek4-Pro !

— Но вот 98Gb ТОЧНО хватит для DeepSeek4-Pro и все будет хорошо работать? 
-----
Ну и с какой скоростью у вас будет работать на 98Gb VRAM?
avatar
Beach Bunny, ты тупой что ли? перечитай всё медленно и внимательно и будет тебе счастье
avatar
Ho_Chu, понятненко, товарисчь тихо съехал с темы. 
avatar

Beach Bunny, конечно )) для тех, кто не умеет пользоваться межушным пространством иначе как для еды, показываю специально:

avatar

Auximen, а у ПРО всего 49В активных… для них достаточно 98 Гб видеопамяти + 30% на обработку и пр.

так что одного Спарка под ПРО недостаточно, нужно побольше — 2-3 штуки в зависимости от загрузки

avatar

Ho_Chu, угу, напиши какая у тебя будет скорость генерации при всего 96Gb VRAM   для DeepSeek 4 Pro.

У меня вот DeepSeek4-Flash которая гораздо меньше,  на 230Gb VRAM на RTX4090 дает 40 tok/sec генерации, для кванта Q8.

У тя же ДВА спарка и 256Gb VRAM и ты пишешь что этого больше чем достаточно для DeepSeek4-Pro.

Ну так и сколько у тебя токенов ? 

avatar
Auximen, Flash версия весит 160Гб, на два спарка встанет. Или на 2-3 разблокированных CMP170HX 64/80 Gb.
avatar
Ho_Chu, а сколько токенов в секунду на инференс и префилл вы планируете получить в такой конфигурации?
 
avatar
Гуру Хренов, в какой именно?

avatar
Ho_Chu, 2 спарка например, и влезающая на нах модель
avatar
Гуру Хренов, напомните мне вопрос после 10 сентября
avatar
так что ИИ не так дорог, как могло бы показаться, но, с другой стороны, стоимость любого стартапа с ним резко выросла, по сравнению, например, с открытием какой-нибудь шаурмичной )))
avatar
Ho_Chu, так сколько памяти надо, чтобы пользоваться одному на локальной модели в режимах вопрос-ответ в тексте, без генерации картин, видео и писания длинных многостраничных текстов.
avatar
dim800, умножайте число активных параметров в миллирдах на 2, получите размер видео памяти в гигабайтах, добавьте 30% и этого будет достаточно для начала работы… Все веса должны умещаться на ссд… Будет кряхтеть, тупить, но работать))) а если пабахатому, то все веса в видеопамять и можете заявлять, что у Вас есть своя модель ИИ))) 
avatar
Самый минимальный дешманский вход стоит — 1 видеокарта типа RTX3090
можно будет запустить
Qwen3.6-27B
Qwen3.6-35B
Qwen3.8-27B
в кванте Q4 
лучше конечно 2 карты типа RTX3090
чтобы гонять теже модели но в лучшем качестве и большим размером контекста.
Та же DeepSeek4-Flash НЕ намного лучше этих Qwen а требования к железу у нее намного выше.
avatar
Beach Bunny, может лучше сразу одну CMP 170HX 64GB за 120т.р.? Выглядит намного веселее, чем 2х 3090.
avatar
Иван Семёнов, лотерая, это же отбраковка, как там тестируют насколько хорошо работает разблокированая память? Шина PCIe урезанная, медленно работает и значит если модель не влазит целиков в видюхи, то падает скорость prefill. Гарантий что память хорошо работает, продаваны не дают и не будут давать, разлочил память и дальше еб##сь c ней сам как хочешь, они даже PCIe шину не допаивают, хотя это несложно.
Плюс еще и нормального охлаждения нет, надо доделывать.
Так что тут лучше переплатить и взять че нит другое, типа Radeon Mi60 Mi50.
Или готовый Radeon 9700x или Intel Arc Pro B70
avatar
Вот и прикинь, какой человеческий мозг, да и не только человеческий, уникальный. По сравнению с ИИ мало потребляет, и опередит ИИ, конечно не в сложных вычислениях, но в других задачах. Ему не надо ничего вычислять, алгоритм работы другой. Опытный мозг правильное решение без переборов множества вариантов найдëт и затратить минимум энергии, которой он и с перебором вариантов меньше затратит, чем ИИ.
Биржевой торговец, вообще то AI, если иметь в виду современные нейронные сети — не перебирает множество вариантов
avatar
Биржевой торговец, наш мозг устроен сильно сложнее чем расматриваемые тут LLM-ки.
Опытный мозг правильное решение без переборов множества вариантов найдëт и затратить минимум энергии, которой он и с перебором вариантов меньше затратит, чем ИИ.

Да и LLM особо то ни чего не переберают, вообще нейронки не знанимаются перебором
avatar
гоняю QWEN 3.6 — 35B сейчас на Spark, заметно тупее облачного DeepSeek V4 Flash, хотя многие задачи отлично решает
avatar
Антон Иванов, это не самая сильная модель.
Сильнее Qwen3.6-27B и Qwen3.8-27B
Qwen3.8-27B — самая сильная из мелких Qwen
avatar
Beach Bunny, реальная ситуация со spark непростая — багов столько, что новые модели зарекся пока ставить, Qwen3.6 только еще отладили более-менее, а 3.8 пока даже пытаться не буду. Но сама игрушка достойная, если модель под нее адаптированная — то отлично работает.
avatar
Технически можно набрать и десктопными видяхами 96 гб И запускать в разы дешевле 3 млн. Но подписка за 20-200 баксов будет и рентабельнее и качественее)
avatar
zhorzh, не забудьте про лимит контекстного окна 
avatar
Ho_Chu, лимиты контектсного окна, хоть и костылями, но можно подлечить — у меня в одной сессии задачи на 10+ млн. токенов решаются, без падений и потерь. Но в целом это хреновая штука, сильно бесит, конечно.
avatar
Антон Иванов, если бы можно было загрузить в него контекст на 10 млн токенов, я, может быть, и не устраивал бы танцев с бубнами… Хотя Ваш опыт интересен
avatar
Ho_Chu, загрузить — точно нет, а выполнить задачу — поэтапно, общей стоимостью 10+ млн токенов — можно. Решается довольно просто: субагенты, канбан-воркеры, фиксация каждого решения в журнал проекта чтобы не потерять готовые решения и не путать шаги выполнения задачи + функция context compaction для сессии = очень приличный результат. И все в одном окне сессии.
avatar
Ho_Chu, я бы не забывал, если бы с ним регулярно сталкивался.
А пока я решаю узкие задачи — говорю что где добавить или какой узкий функционал реализовать, и вот минимум что оставался это сейчас в клоде «6% left». Но тут я долго с ним работал в одной сессии.
Так что, видимо, надо исходить из тех задач, которые решаешь.
avatar
zhorzh, за 3млн можно (пока что )взять 8шт 4090 на 48Gb и борду c Threadripper или EPYC c 200-256Gb  RAM .

И будет 384Gb VRAM на которых можно будет запускать:
GLM-5.2 в Q4 с неплохой скоростью токенов 20-25
Kimi-Code-K2.7 в Q3
MiniMax-M3 будет быстро работать
и все что меньше по размеру в Q8 и быстро
------
Модели большего размера будут работать НЕ быстро, ну и оперативки RAM надо будет больше от 512Gb
========================
Можно и на RTX Spark собрать кластер, но какие скорости будут на Spark сказать не могу, ну и возможно на них будет невысокая скорость Prefill для больших моделей
avatar
Клоуны. У меня Deepseek v4 flash q8 пашет на бу майнинг ферме за 500$. ~20-25 ток/с индивидуальный и ~100 ток/с пакетный.

Для комфортной работы — достаточно.

Какие нафиг 10 000 000? За 50к можно собрать.
avatar
растолкуйте, зачем закупаться оборудованием, если есть подписные варианты использования ИИ?
avatar
Кстати кому интересно «А какая же мать его скорость генерации токенов на КРУТОМ ЖЕЛЕЗЕ» ! 
Можено посмотреть в калькуляторе от Selectel (НЕ реклама) !

selectel.ru/services/vram-calculator/

и УЖАСНУТЬСЯ!
Потому что к примеру посмотрел скорость для GLM-5.2
на 8шт H200 квант FP8 — это типа Q8 но с плавающей запятой
ВСЕГО  20tok/sec 
---------
После этого я понял, что у меня локально GLM-5.2 таки неплохо работает.
А Minimax-M3 таки вообще летает как космолет, быстрее чем у Selectel.

avatar

Читайте на SMART-LAB:
Фото
Позиция ПАО «МГКЛ» по присвоению рейтинга агентством «Эксперт РА»
Присвоенный сегодня рейтинг прекратит действие до конца сентября текущего года в связи с завершением сотрудничества ПАО «МГКЛ» и агентства...
🇮🇩 Индонезии не хватает сотен тысяч айтишников — новые возможности для Софтлайн?
Индонезия активно цифровизирует промышленность, но рынку не хватает квалифицированных кадров. По оценке Kearney, стране ежегодно требуется...
Фото
Объем сделок с платиной и палладием на Мосбирже растет быстрее золота
Совокупный объем торгов драгоценными металлами на Московской бирже в августе составил 506,1 млрд руб. — это в 2,1 раза больше, чем годом ранее. С...
Фото
Повышаю рейтинг сетевым компаниям: кто заслужил «покупать» после отчетов МСФО
Операционные результаты Прибыль от продаж и рентабельность РСБУ Выручка МСФО Операционные расходы и EBITDA Чистый долг и...

теги блога Auximen

....все тэги



UPDONW
Новый дизайн