Сергей Викторович, RAG — это совсем другая история. Там тоже нужна нейронная сеть для генерации Embeddings, но их надо генерить только один раз, для конкретного запроса, если что то опрашивать в real time (Для начального наполнения векторной базы данных — эти embeddings тоже надо вызывать, и вызывать много, но это надо делать один раз, и можно подождать - там время некритично)
Короче — RAG — это та штука, которая, наверное, могла бы работать на обычном PC без проблем (для прототипирования — сгодится)
Забыл упомянуть еще момент — при наполнении векторной базы данных — хорошо еще сделать правильный Chunking (разбиение на куски) — и — возможно — суммирование знаний / сжатие текстов, чтобы убрать из них всю «воду» — для этого тоже желательно использовать отдельную LLM-ку, но она не обязательно должна быть слишком умной (разбиение на куски и суммирование — не сложные задачи). Тут размер контекста важней «умности» модели. Какая нибудь небольшая Gemma или Granite — подойдет. И тут уже надо — вместе с embedding — моделью, которая будет работать на том же железе — наверное как минимум 32 гига памяти, и чтобы проц не слишком медленный. Все это без правильных GPU будет тошнить с скоростью улитки, но заполнение векторной БД — это надо сделать всего один раз, можно и подождать.
Блин!!! забыл упомянуть еще один момент — если база знаний в разных форматах типа pdf / word или упаси господь отсканированные документы, которые еще надо в текст перевести, или диаграммы какие нибудь — вот тут вы попали. Потому что — чтобы перевести все эти разные форматы в удобноваримые логичные chunks — тут никакой локальной модели не хватит, конечно же. Тут нужна приличная коммерческая модель, мульти-модальная, чтобы понимала все форматы. Готовьтесь платить за токены, если этот сценарий описывает Ваш случай !



