Инженерная команда Яндекса создала и обучила с нуля две большие языковые модели, исходный код которых теперь доступен экспертам во всем мире для анализа и использования.
Alice AI Foundation LLM— претрейн-версия для следующего поколения моделей
🟡 Модель обучена с нуля на собственной архитектуре и данных компании. Её технологии будут использоваться при создании будущей единой рассуждающей модели (EPM) с агентными возможностями для сложных многоэтапных задач.
🟡 При обучении модели Яндекс применил собственные инженерные решения, чтобы повысить её эффективность и сократить необходимые вычисления. Оптимизация процесса позволила примерно в два раза ускорить шаги обучения, а каскадная обработка данных — в десятки раз сократить вычислительные затраты.
🟡 Модель включает 80 млрд параметров, из которых в моменте активны только 3 млрд. Это обеспечивает высокую скорость и экономичность её работы. За счет оптимизации алгоритмов Яндексу удалось существенно повысить эффективность — несмотря на меньшее количество параметров модель обходит более крупные зарубежные аналоги в ряде ключевых задач. Например, она превосходит модель DeepSeek (включает в 3 раза больше параметров) в задачах на фактические знания и модель Nvidia (в 4 раза больше параметров) — в написании кода.
Alice AI Search Pretrain— модель для быстрых ИИ-ответов в Поиске
🟡 Это созданная и обученная с нуля базовая версия модели, дообученный вариант которой с июля генерирует быстрые ответы прямо под поисковой строкой Яндекса. Каждый месяц ими пользуются более 49 млн человек. На сегодняшний день, это самый массовый продукт Яндекса, где пользователи чаще всего сталкиваются с технологиями генеративного ИИ.
🟡 Всего в модели 35 млрд параметров, из которых при обработке одного токена (небольшого фрагмента текста) алгоритм использует около 600 млн — менее 2%. Такая архитектура позволяет поддерживать высокое качество ответов, скорость работы и эффективность вычислений при большой нагрузке. Модель позволила быстрым ИИ-ответам показать более высокие результаты в сравнительном тестировании с AI Overviews от Google.
Почему это важно:
💬 Яндекс последовательно развивает собственные модели, которые можно масштабировать как внутри собственных массовых В2С-сервисов, так и на широкий спектр коммерческих сценариев, включая B2B-сегмент.
💬 За их разработкой стоит сильная инженерная экспертиза: модели создаются с нуля под конкретные продуктовые и исследовательские задачи. При этом их архитектура оптимизируется так, чтобы получать высокие результаты при меньших вычислительных затратах. Это соответствует рыночному тренду на компактные модели, способные за счет роутинга, оркестрации и харнеса конкурировать по качеству с более тяжелыми и высокозатратными моделями.
Данная публикация является личным мнением автора. Мнение владельца сайта может не совпадать с мнением автора.
Когда сможете войти в мировой ТОП-10 (в общем зачете), тогда и порадуемся. А пока…