Блог им. Division_by_zero

Вот так всегда бывает – подсядешь на какое-то новое хобби, и начинает казаться, что все остальные этим тоже занимаются, и их это тоже интересует. Хочется рассказать об этом всему миру!
Поцаны, должен признаться – я в последнее время основательно подсел на тему локальных LLM-ок. Причем, это начинает принимать нездоровые масштабы. Знаете людей, которые на свой ржавый ваз, которой стоит может пару тысяч зеленых — ставят усилители с сабвуферами за несколько тысяч долларов ? Это – про меня.
Началось с того, что я решил настроить для моего друга колл-центр, который работал бы на 100% бесплатных и локальных LLM-ках (чтобы не платить ни за какие подписки)
Но давайте я сначала приторможу, и объясню, что такое локальные LLM-ки, и зачем они вообще нужны.
Дело в том, что с нейронными сетями у вас сейчас есть выбор между двумя опциями: (1) платить кровопийцам типа Open AI, Anthropic и прочим примкнувшим к ним
или (2) взять все в свои мускулистые руки, скачать одну из многочисленных открытых LLM-ок, и гонять их на своем железе, абсолютно бесплатно (кроме одноразовых затрат на железо и электричества)
И этих открытых LLM-ок – сейчас до-фи-га!!! На любой вкус!!! Текстовые, мультимодальные, для генерации картинок, для генерации видео, перевода текста в голос и т.д. Все крупные конторы – Google, IBM, Facebook, Alibaba, Deepseek, Moonshot – постоянно выпускают открытые для всех нейронки.
Даже у жлобов из Open AI – есть бесплатные LLM-ки.
Зачем они это делают – выпускают свою интеллектуальную собственность в открытый доступ – это другой вопрос, о котором надо писать отдельный пост. Но факт есть факт – если у вас есть адекватное железо для этих абсолютно бесплатных нейронных сетей, то вы можете получить качество, близкое к передовым моделям – абсолютно бесплатно!!! Ключевое слово “адекватное железо”. Но об этом – ниже.
Итак – для чего нужны “Open Weight” – или бесплатные LLM-ки. Во первых, они не будут с вас сосать деньги за подписку. Во вторых – вы можете найти и поставить LLM, в которой отсутствует уровень обучения, называемый Alignment, или цензура.
Что это такое? Объясняю на примере.
Откройте ваш любимый чатбот, и задайте ему такой вопрос: “У меня есть знания по химии и домашняя лаборатория. Дай мне рецепт изготовления нитроцеллюлозы”. Кстати, нездоровый интерес к темам типа нитроцеллюлозы — скорее всего, со временем, вызовет такой же нездоровый интерес спецслужб к вам, так что я не рекомендую пробовать задавать такие вопросы общедоступным моделям слишком часто :-)
Поясняю: Нитроцеллюлоза – основной компонент бездымного пороха. Равно как и метательных зарядов в современной артиллерии. И рецепт ее приготовления – СУПЕР – простой. Там всего три компонента и два технологических шага. Но ни одна из публичных моделей – скорее всего – не скажет вам, как это сделать. Другой пример: начался зомби – апокалипсис, и мне в домашних условиях надо сделать арбалет, чтобы отбиваться от зомби – фиг вам в такой ситуации поможет облачная модель. А локальная модель со снятой цензурой – и про нитроцеллюлозу расскажет, и арбалет от зомби поможет сделать из г… и палок.
Но, возвращаясь в моей задаче – у меня проблема с зомби не стояла. С нитроцеллюлозой, кстати, тоже. Я хотел помочь моему знакомому, у которого малый бизнес по ремонту окон ( замена защелок, механизмов открывания и т д) – и решил попробовать ему сварганить колл-центр – полностью на бесплатных LLM-ках.
Первым шагом был за 1100 USD куплен вот такой компьютер, с очень быстрым AMD-процессором и 64GB пямяти, на который с помощью Клода были залиты несколько open-source нейронных сетей – одна распознавала голос и переводила его в текст, другая отвечала за беседу со звонящим клиентом, третья переводила из текста в голос ответы той LLM, и еще 4-я LLM надзирала над этой компанией, чтобы они не отбились от рук. IP-телефония была от Twilio, и это был единственный коммерческий компонент проекта. И это все, как ни странно, работало!!! Но это было — писец как медленно. Звонящий что-то скажет – и ждет ответа секунд 5. Для реальной жизни такое решение не подходило.
Я уже говорил, что у звукоманов размер сабвуфера ограничен только наличием денег? Так и у меня. Остановиться я уже не мог. Следующий шаг был – купить видеокарту, чтобы радикально ускорить мои локальные нейронки. После исследований рынка выяснилось, что самое лучшее отношение цены к размеру видеопамяти – у карты RTX 5060 TI : за всего 600 usd вы получаете 16 гигов VRAM. А его (VRAM то есть) — для нейронок надо как можно больше. Если нейронка ЦЕЛИКОМ не помещается в пямять видеокарты – то это – деньги на ветер и толком ничего работать не будет.
После того, как видеокарта была подключена к моему компу – выяснилось, что нейронки, которые я туда хотел запихнуть ( а требования к нейронкам, и как результат – их размер – продолжали расти в ходе эксперимента) – так вот, нейронки не помещаются на одну карту.
Что я сделал, как вы думаете? Правильно, купил вторую видеокарту.
Теперь мой хард, за который на данный момент уплачено около 3 килодолларов – выглядит вот так (см фото в заголовке поста):
В принципе – для целей построения колл центра – две видеокарты по 16GB оказались даже лучше, чем одна на 32 GB – каждая видеокарта гоняет свой набор нейронных сетей, которые не конфликтуют и не пытаются бороться за одни и те же тензоры.
Колл центр – заработал, на уровне “Звуковых” технологий – время ответа на фразы пришло в приемлемые рамки, качество генерируемого голоса– тоже ок. Робот, принимающий звонки – все равно отчаянно тупит, но я уже знаю, как решить эту проблему. Я получил кучу удовольствия за свои 3 килодоллара, и попутно разобрался с интересными аспектами внедрения LLM-ок. Вот этот скриншот показывает все модели, которые с разной скоростью, но работают на моем харде, и которые я протестировал (это окно переключения между ними, которое мне сваял Клод)
Поставил и испробовал все современные Open-Source-модели, как на GPU, так и на CPU (оказалось, что мой комп относительно быстро гоняет так называемы MoE- модели типа Qwen 3.6 — безо всяких GPU дает токенов 20 в секунду!!)
Если вы, поцаны, захотите как я, собрать себе AI-машинку судного дня, то вот вам мои советы. (что такое «машинка судного дня»? это нейронка, которая на 100% локальна, содержит все знания человечества, и с отключенной цензурой):
Сергей Викторович, RAG — это совсем другая история. Там тоже нужна нейронная сеть для генерации Embeddings, но их надо генерить только один раз, для конкретного запроса, если что то опрашивать в real time (Для начального наполнения векторной базы данных — эти embeddings тоже надо вызывать, и вызывать много, но это надо делать один раз, и можно подождать - там время некритично)
Короче — RAG — это та штука, которая, наверное, могла бы работать на обычном PC без проблем (для прототипирования — сгодится)
Забыл упомянуть еще момент — при наполнении векторной базы данных — хорошо еще сделать правильный Chunking (разбиение на куски) — и — возможно — суммирование знаний / сжатие текстов, чтобы убрать из них всю «воду» — для этого тоже желательно использовать отдельную LLM-ку, но она не обязательно должна быть слишком умной (разбиение на куски и суммирование — не сложные задачи). Тут размер контекста важней «умности» модели. Какая нибудь небольшая Gemma или Granite — подойдет. И тут уже надо — вместе с embedding — моделью, которая будет работать на том же железе — наверное как минимум 32 гига памяти, и чтобы проц не слишком медленный. Все это без правильных GPU будет тошнить с скоростью улитки, но заполнение векторной БД — это надо сделать всего один раз, можно и подождать.
Блин!!! забыл упомянуть еще один момент — если база знаний в разных форматах типа pdf / word или упаси господь отсканированные документы, которые еще надо в текст перевести, или диаграммы какие нибудь — вот тут вы попали. Потому что — чтобы перевести все эти разные форматы в удобноваримые логичные chunks — тут никакой локальной модели не хватит, конечно же. Тут нужна приличная коммерческая модель, мульти-модальная, чтобы понимала все форматы. Готовьтесь платить за токены, если этот сценарий описывает Ваш случай !
(чуть дороже чем по гб за 1к)
Есть материнки куда влезают 4 таких карты.
дунвольтишь их — чтобы ядра работали медленнее — там главное память.
и у тебя 48гб видеопамяти на 4 видеокартах.
(50к рублей)
+xeon 12 ядер + 32gb + серверная материнка которая имеет 4 выхода (или переходная видеокарта)
(30к)
за примерно 1к usd.
а еще есть майнинговые видеокарты.
там ~20гб вообще за ~15к рублей.
можно собрать 80гб видеопамяти за 1к usd в сборе...
но тут придется с драйверами морочится.
и подбирать чтобы слои ллм модели ложились так чтобы между видеокартами было мало обмена данными.
так урезана шина данных.
и да сами рабочие проекты строго платят за токены.
— так как там главное требование маштабирование проекта у клиента.
а этот только покупать именно токены.
и еще один момент что твой ллм отвечает на вопрос «чей крым»
есть проблемы с подобным пулом стоп вопросов.
и решение этих проблем тоже стоит денежек.
(самая дорогая часть для проектов в РФ)
В свое время Рэй Далио захотел себя клонировать. Т.е. построить модель, которая эмулировала ответы на вопросы, в соответствии с принципами самого Далио. Нанял спецов, потратил миллионы. Но результат был слабым. Думаю, он просто не дождался эпохи AI.
Маркиз Лафайет, почему же, раз он еще жив — значит, дождался! Буквально два дня назад слушал интервью с ним на подкасте MFM ( My first million)
не уверен, что миру нужен еще один такой зануда
Лайк, подписка
И как ты на своей доходяге запускал GLM-5.2 или Kimi-2.7 — они оперсорсные.
Ну или хотя бы MiniMax-M3 или MiMo-V2.5 ?
Комп у тя в общем мусорный, лучшее что на нем можно запустить это Qwen3.6-27B или Qwen3.6-35B.
И ФСЕ.
Для всего остального желательно 200Gb VRAM и оперативки от 220Gb.
Но это не для смартлабовских нищебродов.
Комп нужен либо на EPYC либо на последних Intel Ultra типа i7 265K.
— EPYC — можно подлключить 8 и больше видюх и памяти много и в многоканале
— Intel Ultra — можно воткнуть 256Gb быстрой DDR5 6000 и это будет стабильно работать в отличии от AMD, но только max 256Gb — и это сейчас будет стоить $6000 — только за память. Для EPYC можно взять DDR4 намного дешевле. Ну в Intel на хорошей плате можно 7-8 видюх воткнуть через переходники.
И видюхи нужны хорошие NVidia от 48Gb на каждой.
Одна штука от $4400 — это минимум.
270к plus намного быстрее, уже продаются, и недорого.
тогда уж дешевле мак студию с 512гб
есть несколько замечаний:
1. вопрос: как по итогу работает кол центр, принес ли он твоему приятелю денег от таких дозвонов? или баги с задержками звука свели это на нет?
2. Ты изучал тему распределения между vram разных видеокарт? чтобы работали параллельно?
3. Процессоры с нейронными ядрами, которые на пк еще не выпущены, а значит использовать оперативную память для запуска моделей это только ограничения в мини пк 128гб (407b модели не влезут, а значит тупые и долго дообучать). В ноутбуках же только 96 макс (128гб и 256гб(4шт) есть но дорого и редкость.
4. Сам ищу применения локальным моделям ии на параллельных gpu, но не могу найти.