Блог им. Division_by_zero

Вот так всегда бывает – подсядешь на какое-то новое хобби, и начинает казаться, что все остальные этим тоже занимаются, и их это тоже интересует. Хочется рассказать об этом всему миру!
Поцаны, должен признаться – я в последнее время основательно подсел на тему локальных LLM-ок. Причем, это начинает принимать нездоровые масштабы. Знаете людей, которые на свой ржавый ваз, которой стоит может пару тысяч зеленых — ставят усилители с сабвуферами за несколько тысяч долларов ? Это – про меня.
Началось с того, что я решил настроить для моего друга колл-центр, который работал бы на 100% бесплатных и локальных LLM-ках (чтобы не платить ни за какие подписки)
Но давайте я сначала приторможу, и объясню, что такое локальные LLM-ки, и зачем они вообще нужны.
Дело в том, что с нейронными сетями у вас сейчас есть выбор между двумя опциями: (1) платить кровопийцам типа Open AI, Anthropic и прочим примкнувшим к ним
или (2) взять все в свои мускулистые руки, скачать одну из многочисленных открытых LLM-ок, и гонять их на своем железе, абсолютно бесплатно (кроме одноразовых затрат на железо и электричества)
И этих открытых LLM-ок – сейчас до-фи-га!!! На любой вкус!!! Текстовые, мультимодальные, для генерации картинок, для генерации видео, перевода текста в голос и т.д. Все крупные конторы – Google, IBM, Facebook, Alibaba, Deepseek, Moonshot – постоянно выпускают открытые для всех нейронки.
Даже у жлобов из Open AI – есть бесплатные LLM-ки.
Зачем они это делают – выпускают свою интеллектуальную собственность в открытый доступ – это другой вопрос, о котором надо писать отдельный пост. Но факт есть факт – если у вас есть адекватное железо для этих абсолютно бесплатных нейронных сетей, то вы можете получить качество, близкое к передовым моделям – абсолютно бесплатно!!! Ключевое слово “адекватное железо”. Но об этом – ниже.
Итак – для чего нужны “Open Weight” – или бесплатные LLM-ки. Во первых, они не будут с вас сосать деньги за подписку. Во вторых – вы можете найти и поставить LLM, в которой отсутствует уровень обучения, называемый Alignment, или цензура.
Что это такое? Объясняю на примере.
Откройте ваш любимый чатбот, и задайте ему такой вопрос: “У меня есть знания по химии и домашняя лаборатория. Дай мне рецепт изготовления нитроцеллюлозы”. Кстати, нездоровый интерес к темам типа нитроцеллюлозы — скорее всего, со временем, вызовет такой же нездоровый интерес спецслужб к вам, так что я не рекомендую пробовать задавать такие вопросы общедоступным моделям слишком часто :-)
Поясняю: Нитроцеллюлоза – основной компонент бездымного пороха. Равно как и метательных зарядов в современной артиллерии. И рецепт ее приготовления – СУПЕР – простой. Там всего три компонента и два технологических шага. Но ни одна из публичных моделей – скорее всего – не скажет вам, как это сделать. Другой пример: начался зомби – апокалипсис, и мне в домашних условиях надо сделать арбалет, чтобы отбиваться от зомби – фиг вам в такой ситуации поможет облачная модель. А локальная модель со снятой цензурой – и про нитроцеллюлозу расскажет, и арбалет от зомби поможет сделать из г… и палок.
Но, возвращаясь в моей задаче – у меня проблема с зомби не стояла. С нитроцеллюлозой, кстати, тоже. Я хотел помочь моему знакомому, у которого малый бизнес по ремонту окон ( замена защелок, механизмов открывания и т д) – и решил попробовать ему сварганить колл-центр – полностью на бесплатных LLM-ках.
Первым шагом был за 1100 USD куплен вот такой компьютер, с очень быстрым AMD-процессором и 64GB пямяти, на который с помощью Клода были залиты несколько open-source нейронных сетей – одна распознавала голос и переводила его в текст, другая отвечала за беседу со звонящим клиентом, третья переводила из текста в голос ответы той LLM, и еще 4-я LLM надзирала над этой компанией, чтобы они не отбились от рук. IP-телефония была от Twilio, и это был единственный коммерческий компонент проекта. И это все, как ни странно, работало!!! Но это было — писец как медленно. Звонящий что-то скажет – и ждет ответа секунд 5. Для реальной жизни такое решение не подходило.
Я уже говорил, что у звукоманов размер сабвуфера ограничен только наличием денег? Так и у меня. Остановиться я уже не мог. Следующий шаг был – купить видеокарту, чтобы радикально ускорить мои локальные нейронки. После исследований рынка выяснилось, что самое лучшее отношение цены к размеру видеопамяти – у карты RTX 5060 TI : за всего 600 usd вы получаете 16 гигов VRAM. А его (VRAM то есть) — для нейронок надо как можно больше. Если нейронка ЦЕЛИКОМ не помещается в пямять видеокарты – то это – деньги на ветер и толком ничего работать не будет.
После того, как видеокарта была подключена к моему компу – выяснилось, что нейронки, которые я туда хотел запихнуть ( а требования к нейронкам, и как результат – их размер – продолжали расти в ходе эксперимента) – так вот, нейронки не помещаются на одну карту.
Что я сделал, как вы думаете? Правильно, купил вторую видеокарту.
Теперь мой хард, за который на данный момент уплачено около 3 килодолларов – выглядит вот так (см фото в заголовке поста):
В принципе – для целей построения колл центра – две видеокарты по 16GB оказались даже лучше, чем одна на 32 GB – каждая видеокарта гоняет свой набор нейронных сетей, которые не конфликтуют и не пытаются бороться за одни и те же тензоры.
Колл центр – заработал, на уровне “Звуковых” технологий – время ответа на фразы пришло в приемлемые рамки, качество генерируемого голоса– тоже ок. Робот, принимающий звонки – все равно отчаянно тупит, но я уже знаю, как решить эту проблему. Я получил кучу удовольствия за свои 3 килодоллара, и попутно разобрался с интересными аспектами внедрения LLM-ок. Вот этот скриншот показывает все модели, которые с разной скоростью, но работают на моем харде, и которые я протестировал (это окно переключения между ними, которое мне сваял Клод)
Поставил и испробовал все современные Open-Source-модели, как на GPU, так и на CPU (оказалось, что мой комп относительно быстро гоняет так называемы MoE- модели типа Qwen 3.6 — безо всяких GPU дает токенов 20 в секунду!!)
Если вы, поцаны, захотите как я, собрать себе AI-машинку судного дня, то вот вам мои советы. (что такое «машинка судного дня»? это нейронка, которая на 100% локальна, содержит все знания человечества, и с отключенной цензурой):
Сергей Викторович, RAG — это совсем другая история. Там тоже нужна нейронная сеть для генерации Embeddings, но их надо генерить только один раз, для конкретного запроса, если что то опрашивать в real time (Для начального наполнения векторной базы данных — эти embeddings тоже надо вызывать, и вызывать много, но это надо делать один раз, и можно подождать - там время некритично)
Короче — RAG — это та штука, которая, наверное, могла бы работать на обычном PC без проблем (для прототипирования — сгодится)
Забыл упомянуть еще момент — при наполнении векторной базы данных — хорошо еще сделать правильный Chunking (разбиение на куски) — и — возможно — суммирование знаний / сжатие текстов, чтобы убрать из них всю «воду» — для этого тоже желательно использовать отдельную LLM-ку, но она не обязательно должна быть слишком умной (разбиение на куски и суммирование — не сложные задачи). Тут размер контекста важней «умности» модели. Какая нибудь небольшая Gemma или Granite — подойдет. И тут уже надо — вместе с embedding — моделью, которая будет работать на том же железе — наверное как минимум 32 гига памяти, и чтобы проц не слишком медленный. Все это без правильных GPU будет тошнить с скоростью улитки, но заполнение векторной БД — это надо сделать всего один раз, можно и подождать.
Блин!!! забыл упомянуть еще один момент — если база знаний в разных форматах типа pdf / word или упаси господь отсканированные документы, которые еще надо в текст перевести, или диаграммы какие нибудь — вот тут вы попали. Потому что — чтобы перевести все эти разные форматы в удобноваримые логичные chunks — тут никакой локальной модели не хватит, конечно же. Тут нужна приличная коммерческая модель, мульти-модальная, чтобы понимала все форматы. Готовьтесь платить за токены, если этот сценарий описывает Ваш случай !
(чуть дороже чем по гб за 1к)
Есть материнки куда влезают 4 таких карты.
дунвольтишь их — чтобы ядра работали медленнее — там главное память.
и у тебя 48гб видеопамяти на 4 видеокартах.
(50к рублей)
+xeon 12 ядер + 32gb + серверная материнка которая имеет 4 выхода (или переходная видеокарта)
(30к)
за примерно 1к usd.
а еще есть майнинговые видеокарты.
там ~20гб вообще за ~15к рублей.
можно собрать 80гб видеопамяти за 1к usd в сборе...
но тут придется с драйверами морочится.
и подбирать чтобы слои ллм модели ложились так чтобы между видеокартами было мало обмена данными.
так урезана шина данных.
и да сами рабочие проекты строго платят за токены.
— так как там главное требование маштабирование проекта у клиента.
а этот только покупать именно токены.
и еще один момент что твой ллм отвечает на вопрос «чей крым»
есть проблемы с подобным пулом стоп вопросов.
и решение этих проблем тоже стоит денежек.
(самая дорогая часть для проектов в РФ)
Антон Б, а еще есть майнинговые видеокарты.
там ~20гб вообще за ~15к рублей.
у майнинговый видеокарт — интерфейс PCIe-1x — им не нужно было гонять много данных то, все внутри считалось. А когда ставить такие карты в сборки для ИИ — это все проваливает, малая скорость взаимодействия то
Petr S, да. именно там 4 линии всего pci.
но это влияет только на загрузку модели — дольше грузится.
уже загруженная модель будет обмениваться между видеокартами ТОЛЬКО в склейке слоев.
условно 72 слоя.
4 видеокарты.
по 18 слоев на видеокарту.
так вот эта урезанная в 4 раза скорость обмена между видеокартой и озу НЕ НАГРУЖАЕТСЯ в процессе работы.
не является узким горлышком.
важна скорость самой видеопамяти для расчета слоев модели. а она нормальная у майнинговых видеокарт. не порезанная.
Логичнее ведь заточить специфичный «оконный» RAG а открытая LLM будет просто формировать складный ответ.
Ресурсов на это потребуется намного меньше
Vyacheslav Ivanenkov, RAG, конечно же, в этой системе тоже предусмотрен. Как и векторная, как и обычная реляционная БД, конечно
Вообще, в процессе разработки всей этой системы — я понял, что полагаться на интеллект одной только LLM-ки в разговоре с клиентом, и ожидать, что она будет следовать своим инструкциям — это дохлый номер, особенно — с относительно небольшими LLM-ками, у которых отключен режим Reasoning (потому что — если его включать, то скорость ответа сразу падает до недопустимых задержек)
LLL-м должна еще и tool calling делать — то есть вызывать инструменты — проверка адреса клиента, тот же RAG вызвать например, вызвать код, который будет предлагать время визита и т д — если на нее еще и это навалить, то она сходит с ума. Чем длиннее системная инструкция, тем тупее нейронная сеть будет ей следовать.
Поэтому у меня сейчас основная и самая умная LLM (qwen3.5:9b-q8_0) отвечает только за поддержание разговора с клиентом, и при каждом turn — транскрипт разговора читает другая LLM-ка (granite3.3:2b) , которая отвечает ТОЛЬКО за извлечение структурной информации (те данные, которые надо обязательно собрать — имя клиента, адрес, тип проблемы), и иногда говорит основной LLM — что спросить у клиента в следующем turn (такие инструкции впрыскиваются прямо в конец системного промпта)
Но и этого оказалось недостаточно, чтобы приструнить этих двух чуваков, и заставить их делать то, что надо. Я подсмотрел, как сделаны коммерческие системы, и понял, что надо строить еще более менее строгий алгоритмический harness, который основан на flow
И все эти системы — они основаны на Intent (намерение) звонящего. Главной целью основной LLM – является определить Intent (чего вообще звонящий хочет) – пожаловаться на проблему, вызвать мастера, спросить, делаем ли мы какой то сервис, или спросить сколько он стоит
Поэтому — мне пришлось сделать еще и редактор для этих flow. Где для каждого Intent-а – описана своя последовательность шагов – смотрите скриншот, которыя я гружу сюда – это именно мой редактор для одного из Intent
Сейчас, собственно и занимаюсь отладкой всего этого
Там еще выяснилось куча ОЧЕНЬ ОЧЕНЬ интересных моментов, я здесь описал наверное только процентов 30. Я же говорю – получил кучу удовольствия за свои деньги 😊
Гуру Хренов, «Для реально умной модели надо дофига памяти. Как минимум – гигов 30-50. А видеокарточки с таким объемом памяти стоят конских денег»
хм… я купил еще год назад AMD INSTINCT MI50 c 32Gb VRAM ( и как вы понимаете там она не GDDR!) — всего за 20 тыр! да, счас они 40 тыр — но это намного лучше и быстрее чем то куда вы закопали кучу бабок. Опять же — в списке смотрю у вас все же есть qwen 3.5-35B-A3B — но на 16gb vram вы нормально ее не запустите то, только в Q3 — что уже теряет все ее прелести. Так что любые ускорители с 16Gb — это мусор, не зря вон V100 с 16gb забит весь авито, а v100 c 32gb — хрен найдешь .
так что только искать 32GB профессиональные старые ускорители — MI50 или V100, видеокарты с GDDR — скорость низкая, цена огромная.
пс. мой MI50 в Q5 qwen-35b-a3b — дает 60-65 токенов на генерацию — при этом при вполне неплохом качестве — вот с этим уже можно жить хоть как то
Petr S, модели ОЧЕНЬ! хорошо.
практически ЛИНЕЙНО! по производительности.
параллелятся.
при инференсе.
4x16 может дать БОЛЬШУЮ СКОРОСТЬ чем 1x64
так как скорость памяти — а это ключевой момент.
тупо суммируется у видеокарт.
Petr S, тут есть несколько моментов
Во-первых, у самого мини-компа, как выяснилось, есть своя собственная GPU Radeon 780M — и она может распоряжаться всей его памятью — всеми 64 GB (плюс, мне повезло, что в этом компе стоит 2 модуля по 32 — то есть скорость увеличивается вдвое). То есть, только на самом компе, безо всяких энвидий — мне удалось запустить довольно большую Gemma 4 31B c 8-мибитной квантизацией — и она выдает токенов 7-10 в секунду
Что касается qwen 3.5-35B-A3B — там часть слоев и параметров запущена на Энвидии, часть работает на CPU — выдает 30-35 токенов в секунду.
Гуру Хренов, я создал нужный мне продукт на базе Claude Project, сделал инструкцию перевел базу в docx, и получил превосходного «юриста-консультанта» в узкой сфере. С учетом ограничения интернета (белых списков), задумался можно ли получить сносный результат на локальных моделях.
Спасибо за ответ, честно говоря, ответили немного сложно)) но с помощью помощника попробую
Сергей Викторович, парадоксально, но факт — для RAG не нужны фундаментальные модели с сотнями миллиардов параметров. «Насыщение» наступает в районе 7-9 млрд. параметров. Я тут ради интереса экспериментирую вообще с qwen3.5-4b. Для RAG важнее длина контекста и способность обобщать и делать выводы из прочитанного. Количество параметров тут больше нужно для того, чтобы модель без особых плясок с бубном могла воспользоваться предоставленным RAG-инструментарием.
Про embedding-модели вам уже расписали, они нужны. Они они крохотные — по 300 млн. параметров, в памяти занимают 90 мб. И даже на ноутбучном процессоре core i7-1235u (даже без задействования встроенной графики) вполне выжимают под тысячу токенов в секунду. Для, условно, разовой векторизации нормативной базы — оставить компьютер на полчасика раз в сутки (если нормативная база обновляется каждый день) — вполне адекватное решение.
В свое время Рэй Далио захотел себя клонировать. Т.е. построить модель, которая эмулировала ответы на вопросы, в соответствии с принципами самого Далио. Нанял спецов, потратил миллионы. Но результат был слабым. Думаю, он просто не дождался эпохи AI.
Маркиз Лафайет, почему же, раз он еще жив — значит, дождался! Буквально два дня назад слушал интервью с ним на подкасте MFM ( My first million)
не уверен, что миру нужен еще один такой зануда
Лайк, подписка
И как ты на своей доходяге запускал GLM-5.2 или Kimi-2.7 — они оперсорсные.
Ну или хотя бы MiniMax-M3 или MiMo-V2.5 ?
Комп у тя в общем мусорный, лучшее что на нем можно запустить это Qwen3.6-27B или Qwen3.6-35B.
И ФСЕ.
Для всего остального желательно 200Gb VRAM и оперативки от 220Gb.
Но это не для смартлабовских нищебродов.
Комп нужен либо на EPYC либо на последних Intel Ultra типа i7 265K.
— EPYC — можно подлключить 8 и больше видюх и памяти много и в многоканале
— Intel Ultra — можно воткнуть 256Gb быстрой DDR5 6000 и это будет стабильно работать в отличии от AMD, но только max 256Gb — и это сейчас будет стоить $6000 — только за память. Для EPYC можно взять DDR4 намного дешевле. Ну в Intel на хорошей плате можно 7-8 видюх воткнуть через переходники.
И видюхи нужны хорошие NVidia от 48Gb на каждой.
Одна штука от $4400 — это минимум.
270к plus намного быстрее, уже продаются, и недорого.
тогда уж дешевле мак студию с 512гб
На Mас Studio медленно работает Prefill
StuffyAl, супер — хороший вопрос — после покупки второго GPU — экспериментальным путем выяснилось, что мой мини-PC имеет только один разъем USB4 — второй идентичный разьем (они оба выглядят как USB-C) — оказался обычным, не скоростным USB
Пришлось купить небольшой адаптер интерфейса Oculink, воткнуть его в свободный M2 — слот внутри, и аккуратно вывести шлейф с коннектором наружу через щель в корпусе — это на моей заглавной фотке в посте видно — черный GPU подключен как раз через Oculink.
есть несколько замечаний:
1. вопрос: как по итогу работает кол центр, принес ли он твоему приятелю денег от таких дозвонов? или баги с задержками звука свели это на нет?
2. Ты изучал тему распределения между vram разных видеокарт? чтобы работали параллельно?
3. Процессоры с нейронными ядрами, которые на пк еще не выпущены, а значит использовать оперативную память для запуска моделей это только ограничения в мини пк 128гб (407b модели не влезут, а значит тупые и долго дообучать). В ноутбуках же только 96 макс (128гб и 256гб(4шт) есть но дорого и редкость.
4. Сам ищу применения локальным моделям ии на параллельных gpu, но не могу найти.
Я не занимаюсь этим потому что проще платить за модель. Не придумал чем локальная модель может быть лучше.
1) генерить порно — есть куча ии инфлюенсеров в телеге уже.
2) контекст связанный с обманом в т.ч 1).
3) если данные для комании важны — персональные данные например.
или вообще данные ограниченного доступа.
госуха например.
но там уже не локальные модели а вполне большие китайские kivi 3.
на дорогих серверах.
4) обработка звука сразу в модели — gemma4 — можно не выделять голосв в текст — отдельным запросом.
а делать это локально.
а в большую ллм уже передавать текст.
это еще и безопаснее так как распознанный текст можно проверить тут-же локально на стоп слова.
пред отправкой в ллм наружу.
3) данные компании — да, по сути если компания использует внешний ИИ — то тренирует своих конкурентов.
А не ли скромный по памяти LLM по переводу голоса в текст?
Надоело стучать по клавишам.
Живая речь более натуральна.
Современные LLM — это, по сути, сложные программы для предсказания следующего слова, а не системы с настоящим пониманием мира.
Они не умеют накапливать смысловые инварианты и могут давать внутренне противоречивые ответы.
К тому же обучающие данные — это не вся мудрость человечества, а узкий срез, состоящий в основном из оцифрованных текстов на нескольких языках.
DrManhattan, да, текущие ИИ — это просто цепи Маркова...
и более-менее приличный ИИ надо делать на совсем других принципах
спасибо за статейку. Тож послеживаю за темой создания локальной машины
но пока покупаю подписки. Переживаю, что машина никогда не окупится. К тому моменту, когда она отобьет все деньги, технологии далеко вперед уйдут и надо будет что то новое
Андрей К, 1.подписки дорожают
2. что то железко не дешевеет, а только дорожает. То что я брал год назад за 30 тыр — счас стоит 60, притом что рубль укрепился и даже НДС еще не ввели на забугор.
Сейчас кстати довольно большой прогресс идет в bitnet — модельки могут влезать более мощные. но пока прогресс только начинается.
я примерно полтора года оплачиваю Cursor, как оплачивал акк 2000р+- для режима Auto, так вроде и оплачиваю
ну вот я судил по следующему. Судя по топику, сейчас я вложусь в железо 200т, получается, через 100мес отобью деньги, если акк дорожать не будет. Если будет, то предположим отобью через 4-5 лет
Что я буду иметь через 4-5 лет: железо, на котором могу запускать модели 4-5ти летней давности. Не уверен, что мне будет это актуально тогда, когда у всех в округе прогресс уйдет вперед.
Еще есть так называемый barge in — когда мне AI — агент отвечает голосом, а я его перебиваю. AI- агент, точнее его TTV компонент — должен не только остановиться в середине фразы и начать меня слушать, но и пометить ту фразу, которую он пытался до меня донести — как не услышанную. Чтобы LLM-ка потом не предполагала, что я получил эту инфу, и чтобы повторила ее при удобном случае в одном из следующих turns
не надо вот это городить.
или саму модель по подписке ту что умная.
а голос-текст и обратно — локально на gemma4.
снижает раундтрип.
чем отдельно вызывать голосовые модели.
так что можно rag свой локальный+ внешняя жирная модель.
есть уже даже скиллы на это.
и mtp сервера — самый простой вот пример.
можно прямо его в rag обернуть
{ «mcpServers»: { «Memory»: { «command»: «npx», «args»: [ "-y", "@modelcontextprotocol/server-memory" ], «env»: { «MEMORY_FILE_PATH»: «memory.json» } } }}
лора — только до обучать.
а до обученную модель где-то хранить.
и все это делается на арендованном железе.
и главное в арендованном железе — масштабируется если надо быстро и срочно.
а если не надо — то заплатил обучил попробовал и все.
железо на эксперименты чтобы до обучать.
ОДИН РАЗ в квартал, не чаще lora если.
а остальное время что это железо делает?
при том что на обучение и на инверсенс нужны разные модели.
в инференс ты можешь распараллелить хоть на разные физически машины ОДНУ СЕТКУ.
А вот обучать нужно на одной «видеокарте» — она как инверсенс на разные видеокарты не очень параллелится.
и старые видеокарты или из под майнинга порезанные не подойдут для обучения никак.
однозначно почасовая аренда на обучение.
Ну пока выходит что 300 000 потрачено, а система не работает и должным образом задачу не решает. Зато деятельность…
Для трейдинга я уже давно дорабатываю модель под ИИ трейдинг, но есть ограничения на уровне переменчивой окружающей среды которые требуют постоянной доработки ИИ.
Тоже наступил в г...., в чатГПТ.
Теперь вскакиваю в 6 утра и бегу автоматизировать свой заводик, Тьяго Форте, Андрей Карпаты, гитхаб, обсидиан… В чат пока пишу руками, но скоро буду голосом наговаривать, буквы пусть аи за меня набирает.
Зачем покупать компуктер за 1100 уе, не знаю, я бы взял подписку за 100, через год все сильно изменится.
Ищу сейчас АИ операционную систему, которая будет видеть ВСЕ: чаты, звонки, задачи, диск, вики.
Работаем в битрикс24, но у него БитриксГПТ пока мертвый.
ЧатГПТ Войс отличная штука, планирую использовать его как секретаря на встречах в будущем.
Кто нибудь цеплял внешний АИ к битрикс 24?
Но вообще, мне кажется лучше выделить ключевые моменты и сфокуссироваться на них, чем пытаться закинуть все подряд надеясь что ГПТ магическим образом превратит это в золото
Дорого очень. У меня свой nsfw бот, где несколько тысяч DAU уже, так вот там, конечно, нужен анцензоред, но по моему опыту через апи venice такие модели почему-то тупят сильно, GLM 4.7 Heretic и Gemma 4 Uncensored так точно.
Проще прокидывать джейблрейк текущим моделям и платить без танцев с бубнами провайдерам, а со своей LLM слишком много возни, плюс клиентам надо давать 10+ моделей на выбор в том числе сильные как Claude, Grok, GLM (все модели последние или почти), поэтому брать ради этого GPU с сотнями гигов не окупится как будто… проще тогда китайских реселлеров тестить, но пока по моим тестам там слишком нестабильно и ответы долгие, а мне на флеш LLM требуется ответ 1-2 секунды.
Где я юзаю GPU с vast.ai, так это для картинок, потому что там я конкретно оттачивал клодом свой пайплайн генерации анимешек и реалистичных.
Интересный эксперимент. Тоже думал над локальными моделями, но понял, что это дорого. Пришел к конфирурации все-таки облачных. Пошаманил с бесплатными сервисами, которые дают какое-то количество часов в неделю хороших мощностей с профессиональными ускорителями. Там тот же квен крутиться может. А тоннель идет на мой белый IP.
Плюс API к тому же gemini на бесплатном тире. Несколько аккаунтов + проксирование, чтобы укладываться в бесплатные лимиты по минутам и в течение дня.
Но да, это все не локально. Хотя гораздо дешевле. Из затрат только малинка, которая и так раздает VPN. Питон скрипты и помощь в организации тоннелей все ИИ-шки писали.
И да, я понимаю, что когда интернета глобально нет, мой сетап бы не работал.
Чем больше попадается таких обзоров с локальными ллм, тем больше уверенность, что копеечные китайские модели через, например — кодикроутер будут шустрее и выгоднее, чем вкладываться в свое железо для запуска слабых моделек.
Deepseek v4 pro должен быть категорически умнее, чем модели на скрине, ценник по апи смешной — вход 35р, кэш 30 коп, выход 70р. Через провайдера гемма 4 31В — вход 10р, кэш 7р, выход 28р; glm 4.5 air — вход 11р, кэш 2р, выход 69р. Может быть, по такому прайсу платить за токены выйдет дешевле, чем электричество за свое железо?
Учитывая скорость развития моделей и демпинг китайцев — через год такие же копейки будут стоить китайские модели уровня фейбл, тем более не будет смысла брать свое железо. Цензура тоже не аргумент, только в гигачате она срабатывает постоянно даже на обычные вопросы, а на забугорных моделях при обычном использовании риск споткнуться о цензуру микроскопичен.
Ho_Chu, подписка на средний тариф GLM 5.2 от z.ai на этот год обошлась в 20к, следующий 45к. По эффективности — это примерно как рабочая группа очень трудолюбивых программистов начально/среднего уровня. Мини-ПК Ryzen AI 395+ со 128Гб ОЗУ сейчас стоит под 300к, при этом у него ноутбучная система охлаждения, то есть он скорее всего просто сдохнет года через три при интенсивном использовании (может и раньше помереть, посмотрите на отказы игровых ПК). Ну и этот ПК не тянет LLM которые мне нужны. Кроме того LLM растут как на дрожжах, а железо для ИИ быстро морально стареет. Так что такая штука нужна если нужна какая-то конфиденциальность (но это фикция на полностью чужом железе и софте и текущей международной обстановке) и не нужна серьезная модель. Ryzen AI 495 будет еще дороже, думаю где-то 500к (пока память не дешевеет), скорость ответов будет скорее всего довольно плачевная. Я бы такое купил, если бы деньги девать было некуда, но увы, кризис. Так что мне проще всего было купить подписку. Можно еще сделать монстра на старых видеокартах, но эта штука будет жрать просто уйму энергии и по ОЗУ будет очень чахлой.
...
Для LLM-может и не критично. Так скажем, не сильно критично. Все равно у Apple нет Cuda-ядер и тензоров.
Зато очень критично для генерации фото и видео.
Пропускная способность GDDR7 - 1792 ГБ/с
Пропускная скорость Unified memory Apple - до 800 ГБ/с (при этом, Unified Memory у Apple это не отдельная видеопамять, а общая память SoC, которую одновременно используют CPU, GPU и другие блоки. Поэтому сравнивать ее с GDDR7 “лоб в лоб” нельзя).
GDDR7 дает очень высокую локальную пропускную способность именно для GPU-задач, где видеокарта постоянно гоняет большие массивы данных. Это делает ее сильной в сценариях, где важны пиковой bandwidth и быстрый доступ к текстурам, активациям, тензорам и буферам. Unified Memory у Apple обычно выигрывает не столько абсолютной скоростью, сколько архитектурной связностью: данные не надо копировать между отдельной RAM и VRAM, потому что память общая.
Делайте оговорки, что Apple и всякие спарки хороши только в языковых моделях, но в генерации фото и видео Nvidia — безоговорочный лидер!
Вот тут есть сравнения mypcrig.com/blog/ai-image-generation-nvidia-vs-apple-silicon-2026/
RTX 5090 быстрее, чем M3 Ultra примерно в 4 раза при генерации изображений. Уж про видео, вообще молчу, там разрыв будет еще сильнее.
Не может чип, потребляющий 215W максимум (CPU+GPU), тягаться с одной дискретной видюхой с потреблением 575W.
Как ни «накручивает» Apple попугаи в бенчмарках, но чудес не бывает)
не подскажите, одна такая машинка на фото, сколько токенов в секунду генерит?
upd. перечитал ) qwen 3.6 генерит у вас 20 токенов в секу