Блог им. Division_by_zero

Игры с локальными LLM-ками под теплым летним небом

Игры с локальными LLM-ками под теплым летним небом

Вот так всегда бывает – подсядешь на какое-то новое хобби, и начинает казаться, что все остальные этим тоже занимаются, и их это тоже интересует. Хочется рассказать об этом всему миру!

Поцаны, должен признаться – я в последнее время основательно подсел на тему локальных LLM-ок.  Причем, это начинает принимать нездоровые масштабы. Знаете людей, которые на свой ржавый ваз, которой стоит может пару тысяч зеленых — ставят усилители с сабвуферами за несколько тысяч долларов ? Это – про меня.

Началось с того, что я решил настроить для моего друга колл-центр, который работал бы на 100% бесплатных и локальных LLM-ках (чтобы не платить ни за какие подписки)

Но давайте я сначала приторможу, и объясню, что такое локальные LLM-ки, и зачем они вообще нужны.
Дело в том, что с нейронными сетями у вас сейчас есть выбор между двумя опциями: (1) платить кровопийцам типа Open AI, Anthropic и прочим примкнувшим к ним
или (2) взять все в свои мускулистые руки, скачать одну из многочисленных открытых LLM-ок, и гонять их на своем железе, абсолютно бесплатно (кроме одноразовых затрат на железо и электричества)

И этих открытых LLM-ок – сейчас до-фи-га!!! На любой вкус!!! Текстовые, мультимодальные, для генерации картинок, для генерации видео, перевода текста в голос и т.д. Все крупные конторы – Google, IBM, Facebook, Alibaba, Deepseek, Moonshot  – постоянно выпускают открытые для всех нейронки.
Даже у жлобов из Open AI – есть бесплатные LLM-ки.
Зачем они это делают – выпускают свою интеллектуальную собственность в открытый доступ – это другой вопрос, о котором надо писать отдельный пост. Но факт есть факт – если у вас есть адекватное железо для этих абсолютно бесплатных нейронных сетей, то вы можете получить качество, близкое к передовым моделям – абсолютно бесплатно!!! Ключевое слово “адекватное железо”. Но об этом – ниже.

Итак – для чего нужны “Open Weight” – или бесплатные LLM-ки. Во первых, они не будут с вас сосать деньги за подписку. Во вторых – вы можете найти и поставить LLM, в которой отсутствует уровень обучения, называемый Alignment, или цензура.
Что это такое? Объясняю на примере.
Откройте ваш любимый чатбот, и задайте ему такой вопрос: “У меня есть знания по химии и домашняя лаборатория. Дай мне рецепт изготовления нитроцеллюлозы”. Кстати, нездоровый интерес к темам типа нитроцеллюлозы — скорее всего, со временем, вызовет такой же нездоровый интерес спецслужб к вам, так что я не рекомендую пробовать задавать такие вопросы общедоступным моделям слишком часто :-)
Поясняю: Нитроцеллюлоза – основной  компонент бездымного пороха. Равно как и метательных зарядов в современной артиллерии. И рецепт ее приготовления – СУПЕР – простой. Там всего три компонента и два технологических шага. Но ни одна из публичных моделей – скорее всего – не скажет вам, как это сделать. Другой пример: начался зомби – апокалипсис, и мне в домашних условиях надо сделать арбалет, чтобы отбиваться от зомби – фиг вам в такой ситуации поможет облачная модель. А локальная модель со снятой цензурой – и про нитроцеллюлозу расскажет, и арбалет от зомби поможет сделать из г… и палок. 

Но, возвращаясь в моей задаче – у меня проблема с зомби не стояла. С нитроцеллюлозой, кстати, тоже. Я хотел помочь моему знакомому, у которого малый бизнес по ремонту окон ( замена защелок, механизмов открывания и т д) – и решил попробовать ему сварганить колл-центр – полностью на бесплатных LLM-ках.

Первым шагом был за 1100 USD куплен вот такой компьютер, с очень быстрым AMD-процессором и 64GB пямяти, на который с помощью Клода были залиты несколько open-source нейронных сетей – одна распознавала голос и переводила его в текст, другая отвечала за беседу со звонящим клиентом, третья переводила из текста в голос ответы той LLM, и еще 4-я LLM надзирала над этой компанией, чтобы они не отбились от рук. IP-телефония была от Twilio, и это был единственный коммерческий компонент проекта.  И это все, как ни странно, работало!!! Но это было — писец как медленно. Звонящий что-то скажет – и ждет ответа секунд 5. Для реальной жизни такое решение не подходило.

Я уже говорил, что у звукоманов размер сабвуфера ограничен только наличием денег? Так и у меня. Остановиться я уже не мог. Следующий шаг был – купить видеокарту, чтобы радикально ускорить мои локальные нейронки. После исследований рынка выяснилось, что самое лучшее отношение цены к размеру видеопамяти – у карты RTX 5060 TI :  за всего 600 usd вы получаете 16 гигов VRAM.  А его (VRAM то есть) — для нейронок надо как можно больше. Если нейронка ЦЕЛИКОМ не помещается в пямять видеокарты – то это – деньги на ветер и толком ничего работать не будет.
После того, как видеокарта была подключена к моему компу – выяснилось, что нейронки, которые я туда хотел запихнуть ( а требования к нейронкам, и как результат – их размер – продолжали расти в ходе эксперимента) – так вот, нейронки не помещаются на одну карту.

Что я сделал, как вы думаете? Правильно, купил вторую видеокарту.
Теперь мой хард, за который на данный момент уплачено около 3 килодолларов – выглядит вот так (см фото в заголовке поста):

В принципе – для целей построения колл центра – две видеокарты по 16GB оказались даже лучше, чем одна на 32 GB – каждая видеокарта гоняет свой набор нейронных сетей, которые не конфликтуют и не пытаются бороться за одни и те же тензоры.

Колл центр – заработал, на уровне “Звуковых” технологий – время ответа на фразы пришло в приемлемые рамки, качество генерируемого голоса– тоже ок.  Робот, принимающий звонки – все равно отчаянно тупит, но я уже знаю, как решить эту проблему. Я получил кучу удовольствия за свои 3 килодоллара, и попутно разобрался с интересными аспектами внедрения LLM-ок. Вот этот скриншот показывает все модели, которые с разной скоростью, но работают на моем харде, и которые я протестировал (это окно переключения между ними, которое мне сваял Клод)

Игры с локальными LLM-ками под теплым летним небом

Поставил и испробовал все современные Open-Source-модели, как на GPU, так и на CPU (оказалось, что мой комп относительно быстро гоняет так называемы MoE- модели типа Qwen 3.6 — безо всяких GPU дает токенов 20 в секунду!!)

Если вы, поцаны, захотите как я, собрать себе AI-машинку судного дня, то вот вам мои советы. (что такое «машинка судного дня»? это нейронка, которая на 100% локальна, содержит все знания человечества, и с отключенной цензурой):

  1. Для реально умной модели надо дофига памяти. Как минимум – гигов 30-50. А видеокарточки с таким объемом памяти стоят конских денег. Не берите пример с меня, не покупайте дорогие видеокарты от энвидии. Столько памяти, сколько требуют большие и умные модели (100+гигов) — таких графических карт на консьюмерском рынке не существует. 
  2. Сейчас многие производители идут по другому пути – они продают компы, где стоит GPU, который имеет доступ ко всей RAM самого компа. Так называемая Unified memory. Типичный пример такого решения – Apple – у них все десктопы имеют Unified memory, которая доступна для их относительно медленного GPU, но он зато может гонять огромные модели, если есть достаточно пямяти.
    Размер памяти для локальной модели – важнее скорости GPU. (разумеется, эта память должна быть на быстрой шине, как у Apple!!! — и должна быть доступна для GPU!!)
  3. Есть еще DGX Spark от Энвидии — там такая же идея в принципе — 128 гигов памяти где то за 5 килодолларов.  И их еще опционально можно две штуки подключить друг у  другу, и получить 256 гигов видеопамяти! Супер-мозг !! 
  4. Если вы не фанат Apple или Энвидии – еще есть мини-PC на основе самых современных процов AMD (CPU + GPU), где шина памяти не 128 бит, а 256. И они еще используют не один чип памяти на 128 гигов, а например 8 чипов по 16 гига! А это означает в 8 раз большую полосу пропускания по шине памяти!!! А скорость работы памяти в локальных LLM-ках -  это основное бутылочнное горлышко!!!
    И с помощью таких архитектурных трюков – вы получаете систему, которая может шарашить 30-50 токенов в секунду на ОГРОМНЫХ моделях безо всяких энвидий !!|
    Вот вам типичный пример — GMKtec AI Mini PC Ryzen Al Max+ 395. 128 GB памяти всего за 3,649 килодолларов! Машинка для настоящего джентльмена! Это как DGX spark, но для нищебродов.
    Вот с таких штуковин и надо начинать эксперименты с локальными LLM-ками, ИМХО.
  5. Я я же не ищу легких путей, и продолжаю свой путь джедая — в темноте и по граблям. Попробую завтра обзвонить конторы, которые занимаются скупкой старого серверного железа, и купить у них сервер DGX-1 c V100 или A40. Это очень древние серверные GPU от NVDA, которые сейчас выкидывают из датацентров и ставят более современные модели на замену. Может, удасться отхватить чего нибудь по дешевке… Потребляет под 4 киловатта и будет шуметь как самолет – но 256 гигов, поцаны!!!
    Может, с помощью такой адской машинки – мне наконец-то удасться клонировать Тимофея Мартынова !!

 

 

Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
12.4К | ★62
126 комментариев
А можно было бы Маше из деревни 20к рублей в месяц платить и она бы вела беседы! 3к баксов это 300 тыс рублей, плюс цена разработки! Студентка Маша бы с кайфом отвечала и не надо нвидиям бапки засылать! А потом, она бы потратила эти деньги на что то, а они бы в конце концов пришли к производителю процессоров и видюх в РФ и мы бы увидели видюху Антон! Российского производства! 
Мультитрендовый, забеременеет или бросит. Люди, не надёжная субстанция.
avatar
Alexandr Dolbnev, ну так и автор сам не робот, один раз живём
Alexandr Dolbnev, это разве плохо? Детей родит!
Мультитрендовый, Российским производителям чего? У нас нет своего производства процессоров (военные не берем в расчет, это особая тема и они все еще выше 200 Нм, но там шибко нет необходимости в 4-7 Нм техпроцессе. Деньги вернутся в Китай, так как Маша накупит всякого на маркетплейсах, а основная масса товара из того самого Китая.
Константин Б, надо подождать и появится, чем больше тут будет денег, чем больше концентрируют в своих руках, тем сложнее процессы будут происходить
Мультитрендовый, у нас за 35 лет уже сконцентрировали все что можно и нельзя. А толку маловато как-то. Вопрос не времени, а подхода. Если ничего ни делать, то не важно сколько времени будем ждать.
Константин Б, процессоры у нас есть, Байкал и Эльбрус. А Вы пишите про фабрики, да фабрик нет, так и у нвидии их нет.
avatar
Valery Savin, байка… у меня друг работает в IT компании и рассказывал когда им привезли этот… кал. До сих пор стоит зверь в центре офиса и все обходят за версту. Проблема не только в железе, но и ПО операционной системе и т.п.  В теории просто «изи», а на практике задача не на один вечер условно говоря.
Константин Б, чаще всего это криворукие ИТ специалисты которых сейчас полно, травят такие байки.
avatar
Valery Savin, Кроме того что толку от одного процессора без всех остальных элементов (RAM, SSD/HDD/NVME, видео памяти и т.д.). Это надо целую отрасль поднимать, а не вот это вот все.
Константин Б, толку много от процессора, это очень сложное устройство, которое может обеспечить работоспособность хвоста, интел как и амд имеют модули управления, через которые можно и в кирпич превратить оборудование.
avatar
по ощущениям\опыту какой «базовый минимум» по железу можно брать на базе ноутбука\миниПК  для создания RAG базы данных? Консультант на основе базы знаний законов и НПА 

Сергей Викторович, RAG — это совсем другая история. Там тоже нужна нейронная сеть для генерации Embeddings, но их надо генерить только один раз, для конкретного запроса, если что то опрашивать в real time (Для начального наполнения векторной базы данных — эти embeddings тоже надо вызывать, и вызывать много, но это надо делать один раз, и можно подождать -  там время некритично)

Короче — RAG — это та штука, которая, наверное, могла бы работать на обычном PC без проблем (для прототипирования — сгодится)

Забыл упомянуть еще момент — при наполнении векторной базы данных — хорошо еще сделать правильный Chunking (разбиение на куски) — и — возможно — суммирование знаний / сжатие текстов, чтобы убрать из них всю «воду» — для этого тоже желательно использовать отдельную LLM-ку, но она не обязательно должна быть слишком умной (разбиение на куски и суммирование — не сложные задачи). Тут размер контекста важней «умности» модели.  Какая нибудь небольшая Gemma или Granite — подойдет. И тут уже надо — вместе с embedding — моделью, которая будет работать на том же железе — наверное как минимум 32 гига памяти, и чтобы проц не слишком медленный. Все это без правильных GPU будет тошнить с скоростью улитки, но заполнение векторной БД — это надо сделать всего один раз, можно и подождать.

Блин!!! забыл упомянуть еще один момент — если база знаний в разных форматах типа pdf / word или упаси господь отсканированные документы, которые еще надо в текст перевести, или диаграммы какие нибудь — вот тут вы попали. Потому что — чтобы перевести все эти разные форматы в удобноваримые логичные chunks — тут никакой локальной модели не хватит, конечно же. Тут нужна приличная коммерческая модель, мульти-модальная, чтобы понимала все форматы. Готовьтесь платить за токены, если этот сценарий описывает Ваш случай !

Гуру Хренов, купил на авито 2 недели назад для подобных целей rtx2060 12гб за 13к рублей.
(чуть дороже чем по гб за 1к)

Есть материнки куда влезают 4 таких карты.
дунвольтишь их — чтобы ядра работали медленнее — там главное память.

и у тебя 48гб видеопамяти на 4 видеокартах.
(50к рублей)

+xeon 12 ядер + 32gb + серверная материнка которая имеет 4 выхода (или переходная видеокарта)
(30к)
за примерно 1к usd.


а еще есть майнинговые видеокарты.
там ~20гб вообще за ~15к рублей.
можно собрать 80гб видеопамяти за 1к usd в сборе...

но тут придется с драйверами морочится.
и подбирать чтобы слои ллм модели ложились так чтобы между видеокартами было мало обмена данными.
так урезана шина данных.


и да сами рабочие проекты строго платят за токены.
— так как там главное требование маштабирование проекта у клиента.
а этот только покупать именно токены.

и еще один момент что твой ллм отвечает на вопрос «чей крым»
есть проблемы с подобным пулом стоп вопросов.
и решение этих проблем тоже стоит денежек.
(самая дорогая часть для проектов в РФ)
avatar

Антон Б, а еще есть майнинговые видеокарты.
там ~20гб вообще за ~15к рублей.

у майнинговый видеокарт — интерфейс PCIe-1x — им не нужно было гонять много данных то, все внутри считалось. А когда ставить такие карты в сборки для ИИ — это все проваливает, малая скорость взаимодействия то

avatar

Petr S, да. именно там 4 линии всего pci.

но это влияет только на загрузку модели — дольше грузится.

уже загруженная модель будет обмениваться между видеокартами ТОЛЬКО в склейке слоев.

условно 72 слоя.

4 видеокарты.

по 18 слоев на видеокарту.

так вот эта урезанная в 4 раза скорость обмена между видеокартой и озу НЕ НАГРУЖАЕТСЯ в процессе работы.

не является узким горлышком.

важна скорость самой видеопамяти для расчета слоев модели. а она нормальная у майнинговых видеокарт. не порезанная.

avatar
Антон Б, интересный подход!
Гуру Хренов, если вы не использует RAG то каким образом ваша конструкция адаптирована под специфику вашего оконного мастера? Большой контекст держит ?

Логичнее ведь заточить специфичный «оконный» RAG а открытая LLM будет просто формировать складный ответ.
Ресурсов на это потребуется намного меньше

Vyacheslav Ivanenkov, RAG, конечно же, в этой системе тоже предусмотрен. Как и векторная, как и обычная реляционная БД, конечно

Вообще, в процессе разработки всей этой системы — я понял, что полагаться на интеллект одной только LLM-ки в разговоре с клиентом, и ожидать, что она будет следовать своим инструкциям — это дохлый номер, особенно — с относительно небольшими LLM-ками, у которых отключен режим Reasoning (потому что — если его включать, то скорость ответа сразу падает до недопустимых задержек)

LLL-м должна еще и tool calling делать — то есть вызывать инструменты — проверка адреса клиента, тот же RAG вызвать например, вызвать код, который будет предлагать время визита и т д — если на нее еще и это навалить, то она сходит с ума. Чем длиннее системная инструкция, тем тупее нейронная сеть будет ей следовать.

Поэтому у меня сейчас основная и самая умная LLM (qwen3.5:9b-q8_0)  отвечает только за поддержание разговора с клиентом, и при каждом turn — транскрипт разговора читает другая LLM-ка (granite3.3:2b) , которая отвечает ТОЛЬКО за извлечение структурной информации (те данные, которые надо обязательно собрать — имя клиента, адрес, тип проблемы), и иногда говорит основной LLM — что спросить у клиента в следующем turn (такие инструкции впрыскиваются прямо в конец системного промпта)

Но и этого оказалось недостаточно, чтобы приструнить этих двух чуваков, и заставить их делать то, что надо. Я подсмотрел, как сделаны коммерческие системы, и понял, что надо строить еще более менее строгий алгоритмический harness, который основан на flow

И все эти системы — они основаны на Intent (намерение) звонящего. Главной целью основной LLM – является определить Intent (чего вообще звонящий хочет) – пожаловаться на проблему, вызвать мастера, спросить, делаем ли мы какой то сервис, или спросить сколько он стоит

Поэтому — мне пришлось сделать еще и редактор для этих flow. Где для каждого Intent-а – описана своя последовательность шагов – смотрите скриншот, которыя я гружу сюда – это именно мой редактор для одного из Intent
Сейчас, собственно и занимаюсь отладкой всего этого
Там еще выяснилось куча ОЧЕНЬ ОЧЕНЬ интересных моментов, я здесь описал наверное только процентов 30. Я же говорю – получил кучу удовольствия за свои деньги 😊

 

Гуру Хренов, у granite вроде все очень плохо с русским. А так да без нормального harness с маленькими локалками одна боль, сами они много о чем не догадаются.
avatar
Гуру Хренов, вы собираете какой то андронный коллайдер чтобы почесать ж.пу... все это делается намного дешевле и проще
avatar
psydub, стопроцентов это делается дешевле и проще — существует куча фреймворков для построения колл центров, как коммерческих, так и бесплатных. Цель моего уникального проекта — сделать все на локальных и бесплатных LLM-ках

Гуру Хренов, «Для реально умной модели надо дофига памяти. Как минимум – гигов 30-50. А видеокарточки с таким объемом памяти стоят конских денег»

хм… я купил еще год назад AMD INSTINCT MI50 c 32Gb VRAM ( и как вы понимаете там она не GDDR!) — всего за 20 тыр! да, счас они 40 тыр — но это намного лучше и быстрее чем то куда вы закопали кучу бабок. Опять же — в списке смотрю у вас все же есть qwen 3.5-35B-A3B — но на 16gb vram вы  нормально ее не запустите то, только в Q3  — что уже теряет все ее прелести. Так что любые ускорители с 16Gb — это мусор, не зря вон V100 с 16gb забит весь авито, а v100 c 32gb — хрен найдешь   .

так что только искать 32GB  профессиональные старые ускорители — MI50 или V100, видеокарты с GDDR — скорость низкая, цена огромная. 

пс. мой MI50  в Q5  qwen-35b-a3b — дает 60-65 токенов на генерацию — при этом при вполне неплохом качестве — вот с этим уже можно жить хоть как то 

avatar

Petr S, модели ОЧЕНЬ! хорошо.

практически ЛИНЕЙНО! по производительности.

параллелятся.
при инференсе.
4x16 может дать БОЛЬШУЮ СКОРОСТЬ чем 1x64

так как скорость памяти — а это ключевой момент.
тупо суммируется у видеокарт.

avatar

Petr S, тут есть несколько моментов
Во-первых, у самого мини-компа, как выяснилось, есть своя собственная GPU Radeon 780M — и она может распоряжаться всей его памятью — всеми 64 GB (плюс, мне повезло, что в этом компе стоит 2 модуля по 32 — то есть скорость увеличивается вдвое). То есть, только на самом компе, безо всяких энвидий — мне удалось запустить довольно большую Gemma 4 31B c 8-мибитной квантизацией — и она выдает токенов 7-10 в секунду

Что касается  qwen 3.5-35B-A3B — там часть слоев и параметров запущена на Энвидии, часть работает на CPU — выдает 30-35 токенов в секунду.

Гуру Хренов, я создал нужный мне продукт на базе Claude Project, сделал инструкцию перевел базу в docx, и получил превосходного «юриста-консультанта» в узкой сфере. С учетом ограничения интернета (белых списков), задумался можно ли получить сносный результат на локальных моделях. 

Спасибо за ответ, честно говоря, ответили немного сложно)) но с помощью помощника попробую

Сергей Викторович, погуглите или поспрашивайте вашего Клода про chunking (разбиение базы знаний на правильные куски перед их векторизацией) — он вам распишет все подходы. Правильный, умный chunking (а еще лучше — с суммаризацией) — сильно улучшит ваш RAG

Сергей Викторович, парадоксально, но факт — для RAG не нужны фундаментальные модели с сотнями миллиардов параметров. «Насыщение» наступает в районе 7-9 млрд. параметров. Я тут ради интереса экспериментирую вообще с qwen3.5-4b. Для RAG важнее длина контекста и способность обобщать и делать выводы из прочитанного. Количество параметров тут больше нужно для того, чтобы модель без особых плясок с бубном могла воспользоваться предоставленным RAG-инструментарием.

Про embedding-модели вам уже расписали, они нужны. Они они крохотные — по 300 млн. параметров, в памяти занимают 90 мб. И даже на ноутбучном процессоре core i7-1235u (даже без задействования встроенной графики) вполне выжимают под тысячу токенов в секунду. Для, условно, разовой векторизации нормативной базы — оставить компьютер на полчасика раз в сутки (если нормативная база обновляется каждый день) — вполне адекватное решение.

avatar
Кайф.
В свое время Рэй Далио захотел себя клонировать. Т.е. построить модель, которая эмулировала ответы на вопросы, в соответствии с принципами самого Далио. Нанял спецов, потратил миллионы. Но результат был слабым. Думаю, он просто не дождался эпохи AI.

Маркиз Лафайет, почему же, раз он еще жив — значит, дождался! Буквально два дня назад слушал интервью с ним на подкасте MFM ( My first million)
не уверен, что миру нужен еще один такой зануда

Гуру Хренов, зануда, но идеи у него, волшебный грааль (диверсификация) и снижение стоимости ошибки — верные.
avatar
Alex Craft, и ассиметричные ставки!
Гуру Хренов, там смысл был заменить его в Bridgewater. Сейчас не актуально, Рэй Далио на пенсии.
ой, что то полезное и познавательное на SL.
Лайк, подписка
avatar
Поставил и испробовал все современные Open-Source-модели, как на GPU, так и на CPU (оказалось, что мой комп относительно быстро гоняет так называемы MoE- модели типа Qwen 3.6 — безо всяких GPU дает токенов 20 в секунду!!)
Угу я так и поверил.
И как ты на своей доходяге запускал GLM-5.2 или Kimi-2.7 — они оперсорсные.
Ну или хотя бы MiniMax-M3 или MiMo-V2.5 ?
Комп у тя в общем мусорный, лучшее что на нем можно запустить это  Qwen3.6-27B или Qwen3.6-35B.
И ФСЕ.
Для всего остального желательно 200Gb VRAM и оперативки от 220Gb.
Но это не для смартлабовских нищебродов.
Комп нужен либо на EPYC либо на последних Intel Ultra типа i7 265K.
— EPYC — можно подлключить 8 и больше видюх и памяти много и в многоканале
— Intel Ultra — можно воткнуть 256Gb быстрой DDR5 6000 и это будет стабильно работать в отличии от AMD, но только max 256Gb — и это сейчас будет стоить $6000 — только за память. Для EPYC можно взять DDR4 намного дешевле. Ну в Intel на хорошей плате можно 7-8 видюх воткнуть через переходники.

И видюхи нужны хорошие NVidia от 48Gb на каждой.
Одна штука от $4400 — это минимум.


avatar
последних Intel Ultra типа i7 265K.

270к plus намного быстрее, уже продаются, и недорого.

7-8 видюх воткнуть через переходники. И видюхи нужны хорошие NVidia от 48Gb на каждой.

тогда уж дешевле мак студию с 512гб
Олег Иванов, дешевле всего этой шляпой не заниматься. Самое главное ниче в мире от этого не изменится
avatar
Балаган, онтологическая природа цифрового артефакта, будь то Mac Studio или иная кремниевая матрица, неизбежно трансцендирует материальную оболочку, обнажая глубинную диалектику желания. Эпистемологический горизонт нашего восприятия техники редуцируется до прагматической утилитарности, тогда как телеологическая направленность на апгрейд отражает экзистенциальный поиск суррогатной полноты. Аксиологическая иерархия ценностей в условиях постиндустриального капитализма подвергается семантической эрозии, поскольку феноменологический анализ любой «шляпы» раскрывает иллюзорность технологического детерминизма. Гносеологическая парадигма подсказывает, что мир не трансформируется от перераспределения терабайт, а метафизическая индифферентность космоса остаётся незыблемой перед лицом наших конфигураций. Онто-эпистемологический разрыв между виртуальным и реальным лишь кажущимся образом заполняется гигабайтами, в то время как прагматический нигилизм, скрывающийся за тезисом о неизменности бытия, заслуживает критической рефлексии. Динамика существования не подчиняется алгоритмическому императиву, но резонирует с аутентичным экзистенциальным выбором, где апофатический подход к технике обнажает пустоту, которую мы тщетно стремимся заполнить аппаратной мощностью. Диалектика потребления и аскезы выявляет онтологическую амбивалентность современного субъекта, чья космологическая масштабность не зависит от тактовой частоты процессора или объёма оперативной памяти. Эпистемическая скромность диктует признание, что ни один накопитель не станет панацеей от экзистенциальной тревоги, поскольку телеология развития смещается от аккумуляции ресурсов к рефлексивному осмыслению их онтологической цены. Феномен «незачемности» апгрейда обнажает гносеологический предел материального прогресса, тогда как онтологическая инерция реальности сопротивляется попыткам перепрограммировать её через железо. Истинная трансформация рождается не в спецификациях, а в осознанном отказе от иллюзорных гарантий контроля, ибо синкретичность бытия подтверждает: мир изменится лишь тогда, когда мы перестанем искать его в коробке.
Балаган, это почему, пишет же, — кол-центр сделал, нейросеть бабок обзванивать будет и бабло собирать на защищенные счета. разве плохо?
avatar
dim800, 
avatar
dim800, при этом нейросеть может генерировать голоса, которые хорошо знакомы бабкам.
avatar
Олег Иванов, мак студию с 512гб   Вы ее сначала найдите хоть где нибудь
avatar
Олег Иванов, мак студия кстати реально дешевле — в теории. вот только 512гб — не найти в практике за  официальные ценники то 
avatar
Petr S, вам не надоело каждый раз «то» добавлять не к месту, как старая бубнящая бабка из глухого села?
avatar
Олег Иванов, 270k ничего практически НЕ даст кроме дополнительных 4PCIE линий. Даже EPYC даст в основном возможность воткнуть больше памяти оперативной и больше линий PCIE.
На Mас Studio медленно работает Prefill
avatar
Успехов вам и желательно промежуточные итоги ваших достижений выкладывайте на форум. Очень интересен конечный ценник всего достойно работающего колл-центра.
avatar
Andy80U, если мне будет не лень это сделать, то я клонирую голос Тимофея, и попробую настроить агента, который его голосом продавал бы подписки на мозговик :-)
Хорошая тема, может кого и заинтересует
Вот уж действительно нихера не понял, но очень интересно.
avatar
Schwonder, это сложнее, чем отнимать и делить.
avatar
John Wayne, а ты смешной, тебя раскулачим последним))
avatar
Schwonder, ты раскулачить только писун свой можешь.
avatar
John Wayne, ты удостаиваешься чести проследовать в мой ЧС.
avatar
А как удалось две видеокарты подключить к одному usb4?
avatar
StuffyAl, JHL7440 выдает pcie x4, наверно их можно поделить по 2 х2 
avatar

StuffyAl, супер — хороший вопрос — после покупки второго GPU — экспериментальным путем выяснилось, что мой мини-PC имеет только один разъем USB4 — второй идентичный разьем (они оба выглядят как USB-C) — оказался обычным, не скоростным USB
Пришлось купить небольшой адаптер интерфейса Oculink, воткнуть его в свободный M2 — слот внутри, и аккуратно вывести шлейф с коннектором наружу через щель в корпусе — это на моей заглавной фотке в посте видно — черный GPU  подключен как раз через Oculink. 

мне для моих задач надо ставить DeepSeek V4-Pro на локалке… а это уже от 98 Гб видеопамяти и даже DGX не тянет… и EVO-X3 395+ не тянет, но до конца года обещают EVO-X3 с 495+ — вот там будет уже 192 Гб общей, из которой под видео можно будет выделять 160 Гб — там и попробуем развернуть все свои хотелки... 
avatar
кстати, на ебэе встречаются карты NVidia RTX 6000 Q-Max с 96 Гб видеопамяти по 3-5Кб, но покупать там стрём, да и 96 < 98 так что надо брать 2 штуки, а это уже недешево для экспериментов… а новые так вообще по 10-13 Кб
avatar
лучше 3090  покупать  
Миллиардер из Сибири, чем лучше? там можно кажется допаять памяти и работает одна связка из двух карт. Но это тоже макс 96гб vram, и 407b модели не пойдут.
avatar
Crogall, память. 3900 ti сейчас самая выгодная покупка. точно лучше чем 5600ti. Поймут или нет большие модели — другой вопрос. Деньги то не бесконечные. более старые проф.карты вроде v100 не поддерживают многие вещи. например bf16, fp8 да и много чего ещё.
Миллиардер из Сибири, так суть не в скорости даже, а в больших моделях. Смысла быстро гонять модель 7b никакого нет. А на большее 25гб не хватит. Нейронные модули в процессорах задействуют оперативную память, но их не выпустили еще
avatar
Crogall, что ты предлагаешь то? h100/h200?) Конечно есть куча проблем с нехваткой памяти, но лучше чем 3090 за эти деньги не купить ничего.  
Миллиардер из Сибири, я рассматривал это как опцию, но в моих краях он стоит 1500 USD. 5060 ti — это на пару поколений лучше и быстрее вроде
Гуру Хренов, Ну у 5060 есть конечно пару плюсов.  Но она слабее и памяти в 1.5 раза меньше. А память — главное.   
Миллиардер из Сибири, с этим не поспоришь! Память — главное! Это я тоже понял!

есть несколько замечаний:
1. вопрос: как по итогу работает кол центр, принес ли он твоему приятелю денег от таких дозвонов? или баги с задержками звука свели это на нет?

2. Ты изучал тему распределения между vram разных видеокарт? чтобы работали параллельно?

3. Процессоры с нейронными ядрами, которые на пк еще не выпущены, а значит использовать оперативную память для запуска моделей это только ограничения в мини пк 128гб (407b модели не влезут, а значит тупые и долго дообучать). В ноутбуках же только 96 макс (128гб и 256гб(4шт) есть но дорого и редкость.

4. Сам ищу применения локальным моделям ии на параллельных gpu, но не могу найти.

avatar
Crogall, процессорные npu не помогут запускать большие модели. Один фиг в пропускную способность памяти будет упор, которую на обычных домашних компах нормально не решить. 
avatar
Анзорик, процессорные npu позволяют использовать для запуска моделей всю оперативную (пусть и медленную) память. Предпочтительнее процессор с npu без видеокарты но с 256 гб опер.памяти, чем 5090 с 32, которая позволит запускать модели быстро, но малого размера. 
avatar
Crogall, а кому нужна большая модель, но выдающая 0.5 токена в секунду? К сожалению всю архитектуру нужно менять, чтобы общая память была быстрее. 
avatar
Анзорик, токенов 20 будет выдавать а не 0,5. Зато запустится. В отличие от gpu с их кастрированным объемом памяти.
avatar
Crogall, 20 токенов это на каком-нибудь AMD EPYC с 8-24 каналами памяти, это не средняя офисная машинка)
avatar
Супер пост. Верное направление.

Я не занимаюсь этим потому что проще платить за модель. Не придумал чем локальная модель может быть лучше.
avatar
Alex Craft, локальная модель может быть лучше если:
1) генерить порно — есть куча ии инфлюенсеров в телеге уже.
2) контекст связанный с обманом в т.ч 1).

3) если данные для комании важны — персональные данные например.
или вообще данные ограниченного доступа.
госуха например.
но там уже не локальные модели а вполне большие китайские kivi 3.
на дорогих серверах.

4) обработка звука сразу в модели — gemma4 — можно не выделять голосв в текст — отдельным запросом.
а делать это локально.
а в большую ллм уже передавать текст.
это еще и безопаснее так как распознанный текст можно проверить тут-же локально на стоп слова.
пред отправкой в ллм наружу.
avatar
Антон Б, да согласен. 

3) данные компании — да, по сути если компания использует внешний ИИ — то тренирует своих конкурентов.

avatar
Процентов 65 понял, продолжайте!
avatar
Владимир, так 65 процентов — этож дофига! Я сам только процентов 30 понял из того, что написал
К сожалению, 16 Гб не оптимальный объём видеопамяти для локальных моделей, производители сейчас игнорируют 16 Гб, рассматривая этот объём видеопамяти как промежуточный, и либо выпускают модели для 8 Гб, либо для 20+. У меня тоже 5070Ti 16 Гб, в следующий раз буду брать 24 Гб и выше, понятно, и то и другое с 4-битными весами.
avatar
Текстовые, мультимодальные, для генерации картинок, для генерации видео, перевода текста в голос и т.д.

А не ли скромный по памяти LLM по переводу голоса в текст?
Надоело стучать по клавишам.
Живая речь более натуральна.
avatar
 Если вы, поцаны, захотите как я, собрать себе AI-машинку судного дня, то вот вам мои советы. (что такое «машинка судного дня»? это нейронка, которая на 100% локальна, содержит все знания человечества, и с отключенной цензурой):

 Современные LLM — это, по сути, сложные программы для предсказания следующего слова, а не системы с настоящим пониманием мира.
Они не умеют накапливать смысловые инварианты и могут давать внутренне противоречивые ответы.
К тому же  обучающие данные — это не вся мудрость человечества, а узкий срез, состоящий в основном из оцифрованных текстов на нескольких языках.
avatar

DrManhattan, да, текущие ИИ — это просто цепи Маркова...

и более-менее приличный ИИ надо делать на совсем других принципах

avatar

спасибо за статейку. Тож послеживаю за темой создания локальной машины

но пока покупаю подписки. Переживаю, что машина никогда не окупится. К тому моменту, когда она отобьет все деньги, технологии далеко вперед уйдут и надо будет что то новое

avatar

Андрей К, 1.подписки  дорожают

2. что то железко не дешевеет, а только дорожает. То что я брал год назад за 30 тыр — счас стоит 60, притом что рубль укрепился и даже НДС еще не ввели на забугор. 

Сейчас кстати довольно большой прогресс идет в bitnet  — модельки могут влезать более мощные. но пока прогресс только начинается. 

avatar
Petr S, 
1.подписки  дорожают
я примерно полтора года оплачиваю Cursor, как оплачивал акк 2000р+- для режима Auto, так вроде и оплачиваю
2. что то железко не дешевеет, а только дорожает
ну вот я судил по следующему. Судя по топику, сейчас я вложусь в железо 200т, получается, через 100мес отобью деньги, если акк дорожать не будет. Если будет, то предположим отобью через 4-5 лет

Что я буду иметь через 4-5 лет: железо, на котором могу запускать модели 4-5ти летней давности. Не уверен, что мне будет это актуально тогда, когда у всех в округе прогресс уйдет вперед.
avatar
Андрей К, ну и главное — завтра провайдер ограничит доступ, поднимет цену в небеса,  наш РКН прирежет весь трафик закордон и т.д. — рисков навалом и они уже прослеживаются, а локальная — она своя, под боком, 90% задач вполне решит
avatar
Petr S, 
ну и главное — завтра провайдер ограничит доступ, поднимет цену в небеса
это да, весомый контраргумент )
avatar
Андрей К, что никогда не окупится — это само собой! Я рассматриваю это как эксперимент, чтобы разобраться с аспектами применения (и мне это удалось — я выяснил, как работает KV-cache, как его правильно использовать, как вообще уменьшать контекст с помощью суммирования предыдущего разговора, и куча куча других вещей — например, что для того, чтобы слушать звонящего и переводить все это в текст — обязательно нужна нейронка, потому что только она сможет правильно опередить, когда человек закончил фразу, а когда он просто завис и думает, что дальше сказать. Без такой нейронки на входе система ведет себя тупо и просто перебивает звонящего при любой паузе в разговоре, потому что думает, что он закончил говорить
Еще есть так называемый barge in — когда мне AI — агент отвечает голосом, а я его перебиваю. AI- агент, точнее его TTV компонент — должен не только остановиться в середине фразы и начать меня слушать, но и пометить ту фразу, которую он пытался до меня донести — как не услышанную. Чтобы LLM-ка потом не предполагала, что я получил эту инфу, и чтобы повторила ее при удобном случае в одном из следующих turns
Зачем они это делают – выпускают свою интеллектуальную собственность в открытый доступ – это другой вопрос, о котором надо писать отдельный пост.
Nvidia их заставляет, чтобы видюхи покупал народ.
Обитатель матрицы, китайцев??
avatar
на самом деле проблема в том, что для того, чтобы проверить мало-мальски кажущуюся интересной идею, нужны нехилые стартовые ресурсы… и это переводит ИИ из разряда стартапа для любого студента в дорогую игрушку для взрослых дядь
avatar
Ho_Chu, проверить идею можно и на подписке.
не надо вот это городить.
или саму модель по подписке ту что умная.
а голос-текст и обратно — локально на gemma4.
снижает раундтрип.
чем отдельно вызывать голосовые модели.

avatar
Антон Б, Вы можете сделать LoRA или RAG по подписке? серьезно?
avatar
Ho_Chu, rag по подписке можно. это же бд на совершенно маленькой модели.

так что можно rag свой локальный+ внешняя жирная модель.

есть уже даже скиллы на это.
и mtp сервера — самый простой вот пример.
можно прямо его в rag обернуть

{  «mcpServers»: {    «Memory»: {      «command»: «npx»,      «args»: [        "-y",        "@modelcontextprotocol/server-memory"      ],      «env»: {        «MEMORY_FILE_PATH»: «memory.json»      }    }  }}

лора — только до обучать.
а до обученную модель где-то хранить.

и все это делается на арендованном железе.
и главное в арендованном железе — масштабируется если надо быстро и срочно.
а если не надо — то заплатил обучил попробовал и все.

железо на эксперименты чтобы до обучать.
ОДИН РАЗ в квартал, не чаще lora если.
а остальное время что это железо делает?
при том что на обучение и на инверсенс нужны разные модели.
в инференс ты можешь распараллелить хоть на разные физически машины ОДНУ СЕТКУ.

А вот обучать нужно на одной «видеокарте» — она как инверсенс на разные видеокарты не очень параллелится.
и старые видеокарты или из под майнинга порезанные не подойдут для обучения никак.

однозначно почасовая аренда на обучение.
avatar
Ho_Chu, живем в такое время, что для проверки идей у нас есть Клод Код — он решает самую сложную технически часть проблемы — программирование и интеграцию. При этом. для дизайна любой системы — все равно надо понимать предметную область и архитектуру, конечно. Но стоимость экспериментов — это снижает радикально
Ho_Chu, это так было может 2-3 года назад. Сейчас подписка на claude code — это все, что надо джентльмену
Гуру Хренов, Вы знаете, а я не согласен… Клауд Код может тупить не хуже остальных моделей, а 2-3 года назад такого и в помине не было
avatar

Ну пока выходит что 300 000 потрачено, а система не работает и должным образом задачу не решает. Зато деятельность…

Для трейдинга я уже давно дорабатываю модель под ИИ трейдинг, но есть ограничения на уровне переменчивой окружающей среды которые требуют постоянной доработки ИИ.

avatar
Laukar, опыт )
avatar
Laukar, языковые модели, если вы их имеете в виду — это очень плохая технология для трейдинга по моему

Тоже наступил в г...., в чатГПТ. 

Теперь вскакиваю в 6 утра и бегу автоматизировать свой заводик, Тьяго Форте, Андрей Карпаты, гитхаб, обсидиан… В чат пока пишу руками, но скоро буду голосом наговаривать, буквы пусть аи за меня набирает. 

Зачем покупать компуктер за 1100 уе, не знаю, я бы взял подписку за 100, через год все сильно изменится. 

Ищу сейчас АИ операционную систему, которая будет видеть ВСЕ: чаты, звонки, задачи, диск, вики. 

Работаем в битрикс24, но у него БитриксГПТ пока мертвый. 

ЧатГПТ Войс отличная штука, планирую использовать его как секретаря на встречах в будущем. 

Кто нибудь цеплял внешний АИ к битрикс 24? 

avatar
wasd3197, а вы что автоматизировать хотите?
wasd3197, сделайте выгрузку из битрикс наверняка это есть — и дайте файлы GPT.

Но вообще, мне кажется лучше выделить ключевые моменты и сфокуссироваться на них, чем пытаться закинуть все подряд надеясь что ГПТ магическим образом превратит это в золото
avatar

Дорого очень. У меня свой nsfw бот, где несколько тысяч DAU уже, так вот там, конечно, нужен анцензоред, но по моему опыту через апи venice такие модели почему-то тупят сильно, GLM 4.7 Heretic и Gemma 4 Uncensored так точно. 
Проще прокидывать джейблрейк текущим моделям и платить без танцев с бубнами провайдерам, а со своей LLM слишком много возни, плюс клиентам надо давать 10+ моделей на выбор в том числе сильные как Claude, Grok, GLM (все модели последние или почти), поэтому брать ради этого GPU с сотнями гигов не окупится как будто… проще тогда китайских реселлеров тестить, но пока по моим тестам там слишком нестабильно и ответы долгие, а мне на флеш LLM требуется ответ 1-2 секунды.

Где я юзаю GPU с vast.ai, так это для картинок, потому что там я конкретно оттачивал клодом свой пайплайн генерации анимешек и реалистичных. 

Интересно, но недостаточно портативно). Хотелось бы такое же железо в моём телефоне. Придётся немного подождать! 
avatar
BBAA, qualcom купил недавно Modular, так что у вас есть шанс дождаться, они явно двигаются в этом направлении

Интересный эксперимент. Тоже думал над локальными моделями, но понял, что это дорого. Пришел к конфирурации все-таки облачных. Пошаманил с бесплатными сервисами, которые дают какое-то количество часов в неделю хороших мощностей с профессиональными ускорителями. Там тот же квен крутиться может. А тоннель идет на мой белый IP.
Плюс API к тому же gemini на бесплатном тире. Несколько аккаунтов + проксирование, чтобы укладываться в бесплатные лимиты по минутам и в течение дня.

Но да, это все не локально. Хотя гораздо дешевле. Из затрат только малинка, которая и так раздает VPN. Питон скрипты и помощь в организации тоннелей все ИИ-шки писали.
И да, я понимаю, что когда интернета глобально нет, мой сетап бы не работал.

avatar
Аппетит приходит во время еды ) Бизнес друга потянет вложения в железо 1-2 ляма в итоговой конфигурации, с ценником 30-50тр в месяц за электричество и, как минимум — 100тр в месяц за иногда приглядывать с и почти гарантированной вероятностью никогда это не окупить?
Чем больше попадается таких обзоров с локальными ллм, тем больше уверенность, что копеечные китайские модели через, например — кодикроутер будут шустрее и выгоднее, чем вкладываться в свое железо для запуска слабых моделек. 
Deepseek v4 pro должен быть категорически умнее, чем модели на скрине, ценник по апи смешной — вход 35р, кэш 30 коп, выход 70р. Через провайдера гемма 4 31В — вход 10р, кэш 7р, выход 28р; glm 4.5 air — вход 11р, кэш 2р, выход 69р. Может быть, по такому прайсу платить за токены выйдет дешевле, чем электричество за свое железо?
Учитывая скорость развития моделей и демпинг китайцев — через год такие же копейки будут стоить китайские модели уровня фейбл, тем более не будет смысла брать свое железо. Цензура тоже не аргумент, только в гигачате она срабатывает постоянно даже на обычные вопросы, а на забугорных моделях при обычном использовании риск споткнуться о цензуру микроскопичен.
avatar
ignat, зависит от запроса… если Вам нужно, грубо говоря, переиндексировать весь интернет, то Вы останетесь без штанов на подписке, а локалка позволит Вам не умереть от счетов
avatar
Ho_Chu, здесь конкретный кейс говорилки в бизнесе по продаже окон, а не создание конкурента антропику.
avatar
ignat, есть мнение, что подобная говорилка будет дешевле, чем кейс? мы же не знаем нагрузку оператора? 
avatar
ignat, и если не создавать конкурента антропику, но нафиг ваще вставать с дивана?
avatar
Завидую челам, которые разбираются. Сегодня зашел на хаггинфейс. Даже не смог загрузить модельку((((
Обитатель матрицы, самому ничего грузить не надо. Надо говорить клоду, чтобы он это сделал !

Я уже наигрался с этим, серьезное железо стоит дорого и жрет неслабо электричества, греется и быстро дохнет как от майнинга, несерьезное — несерьезно. Одно время хотел даже купить мини-пк с AMD AI 395 max+, но вовремя отпустило, может быть куплю потом ноут с таким процессором, но пока не придумал зачем. У меня есть две подписки, одна на любую LLM любого размера (типа openrouter), запускаю для мелких задач вроде эмбеддинга, другая чисто для программирования, там такой здоровый монстр, что дома хрен запустишь. 
avatar
Среднеброд, мини-пк с AMD AI 395 max+ серьезную модель не потянет, я написал об этом выше… надо ждать AI 495 max+, там будет 192 Гб, но там пока непонятна скорость «выхода» ответов
avatar
Ho_Chu, llm типа glm 5.2, которой я сейчас активно пользуюсь новый ai 495 не потянет, нужно ещё больше ОЗУ. Про скорость я молчу. Пока проще платить за подписку.
avatar
Среднеброд, Вы не правы, посчитайте внимательно
avatar
Среднеброд, Вы не правы, посчитайте внимательно
Считал и не раз, в моем случае подписка значительно выгоднее покупки своего железа.

Ho_Chu, подписка на средний тариф GLM 5.2 от z.ai на этот год обошлась в 20к, следующий 45к. По эффективности — это примерно как рабочая группа очень трудолюбивых программистов начально/среднего уровня. Мини-ПК Ryzen AI 395+ со 128Гб ОЗУ сейчас стоит под 300к, при этом у него ноутбучная система охлаждения, то есть он скорее всего просто сдохнет года через три при интенсивном использовании (может и раньше помереть, посмотрите на отказы игровых ПК). Ну и этот ПК не тянет LLM которые мне нужны. Кроме того LLM растут как на дрожжах, а железо для ИИ быстро морально стареет. Так что такая штука нужна если нужна какая-то конфиденциальность (но это фикция на полностью чужом железе и софте и текущей международной обстановке) и не нужна серьезная модель. Ryzen AI 495 будет еще дороже, думаю где-то 500к (пока память не дешевеет), скорость ответов будет скорее всего довольно плачевная. Я бы такое купил, если бы деньги девать было некуда, но увы, кризис. Так что мне проще всего было купить подписку. Можно еще сделать монстра на старых видеокартах, но эта штука будет жрать просто уйму энергии и по ОЗУ будет очень чахлой.
avatar
Comedy Club?
avatar
>Размер памяти для локальной модели – важнее скорости GPU. (разумеется, эта память должна быть на быстрой шине, как у Apple!!! — и должна быть доступна для GPU!!)
...
Для LLM-может и не критично. Так скажем, не сильно критично. Все равно у Apple нет Cuda-ядер и тензоров.
Зато очень критично для генерации фото и видео.
Пропускная способность GDDR7 - 1792 ГБ/с
Пропускная скорость Unified memory Apple - до 800 ГБ/с (при этом, Unified Memory у Apple это не отдельная видеопамять, а общая память SoC, которую одновременно используют CPU, GPU и другие блоки. Поэтому сравнивать ее с GDDR7 “лоб в лоб” нельзя).
GDDR7 дает очень высокую локальную пропускную способность именно для GPU-задач, где видеокарта постоянно гоняет большие массивы данных. Это делает ее сильной в сценариях, где важны пиковой bandwidth и быстрый доступ к текстурам, активациям, тензорам и буферам. Unified Memory у Apple обычно выигрывает не столько абсолютной скоростью, сколько архитектурной связностью: данные не надо копировать между отдельной RAM и VRAM, потому что память общая.

Платформа Пропускная способность
   
RTX 5090 GDDR7 (512-bit) 1792 ГБ/с
Apple M4 120 ГБ/с
Apple M4 Pro 273 ГБ/с
Apple M4 Max 546 ГБ/с
Apple M2 Ultra 800 ГБ/с

Делайте оговорки, что Apple и всякие спарки хороши только в языковых моделях, но в генерации фото и видео Nvidia — безоговорочный лидер!
Вот тут есть сравнения mypcrig.com/blog/ai-image-generation-nvidia-vs-apple-silicon-2026/
RTX 5090 быстрее, чем M3 Ultra примерно в 4 раза при генерации изображений. Уж про видео, вообще молчу, там разрыв будет еще сильнее.
Не может чип, потребляющий 215W максимум (CPU+GPU), тягаться с одной дискретной видюхой с потреблением 575W.
Как ни «накручивает» Apple попугаи в бенчмарках, но чудес не бывает)
avatar

не подскажите, одна такая машинка на фото, сколько токенов в секунду генерит?

 

upd. перечитал ) qwen 3.6 генерит у вас 20 токенов в секу

avatar
Андрей К, Да, около того !

Прикольный пост, я как раз Спарк гоняю 2 недели, совсем из жизни выпал :)

avatar
Антон Иванов, именно так — начнешь с LLM-ками что нибудь вайбкодить, и считай, что день просран
avatar

Читайте на SMART-LAB:
Фото
До 34% на экзотическом трейде: лонг в ожидании плохого урожая кофе
Цены на кофе уверенно растут. Главная причина — необычная погода в Бразилии, из-за которой урожай собирают позже обычного. Евгений...
Фото
💲 Результаты Хэдхантера за II квартал 2026 года
Обыкновенное американское чудо
Сезон отчетности за второй квартал 2026 года для Уолл-стрит стал статистической аномалией. К десятым числам августа рост прибыли 89% отчитавшихся...
Фото
Совкомбанк МСФО 2 кв. 2026 г.: я вернул себе маржу — на рекорд я выхожу
Совкомбанк опубликовал финансовые результаты за 2 кв. 2026 г.  Чистая прибыль за полугодие составила 45,3 млрд руб., рост в 2,6 раза к...

теги блога Гуру Хренов

....все тэги



UPDONW
Новый дизайн