Блог им. RationalAnswer
У Дваркеша Пателя в недавнем выпуске подкаста с AI-исследователями обсуждалась интересная идея.
Смотрите, мы с вами много раз обсуждали, что у текущих LLM есть одно из важных отличий от, к примеру, человеческого разума. Люди умеют учиться на собственном опыте и перестраивать собственные нейронные связи. А большие языковые модели после окончания тренировочной фазы остаются в одном и том же состоянии: они при каждой активации как бы «просыпаются» заново в исходном виде, и максимум – могут что-то из подаваемого на вход контекста/ внешней памяти подсосать из того, что с ними после тренировки происходило.

И вот Дваркеш там спрашивает как раз про это: что это, дескать, за ИИ у вас такой дурацкий – когда модель после деплоя может переделать (по поручению юзеров) дофига всяких делов, и ничегошеньки из этого опыта для себя не вынести?
А другой чувак ему возражает: на самом деле, обучение в каком-то смысле уже сейчас происходит. Просто через механизм тренировки следующего поколения моделей, в которые загрузят уже свежий набор данных. Сейчас, условно, новые передовые модели в линейке выходят раз в полгода – а в будущем, может быть, будут уже каждый месяц обновляться, или даже каждую неделю, а потом каждый день…
Получается, в таком сценарии это будет даже немного похоже на то, как обучаются люди: в течение дня ты вывозишь на базе краткосрочной памяти (у LLM – это всякие блокнотики для записушек, которые используются в качестве внешней памяти), а потом засыпаешь, и ночью у тебя происходит формирование долгосрочных воспоминаний и закрепление новых навыков.
Но тут еще будет интересный нюанс: нам интуитивно хочется (опять же, по аналогии с человеком) воспринимать каждого отдельного ИИ-агента как самостоятельного субъекта. А в описанном выше сценарии этим субъектом, способным к самообучению (если ЛЛМкам прикрутят для этого автоматические механизмы, а не в ручном режиме, как сейчас), становится целая модель.
То есть, у такой модели смогут ежедневно независимо работать сотни тысяч ее клонов, а в конце дня все они будут тащить накопленный опыт к «мамке», которая его впитает, и сделает весь завтрашний рой еще умнее. Получается эдакий «хайвмайнд», где каждый индивидуальный агентик может действовать самостоятельно, но эволюционируют они всё равно все вместе на коллективной основе.
P.S. Пока именно в таком виде оно не работает: они там обсуждают, что, во-первых, не все пользовательские логи автоматом идут на вход тренировочного процесса (хотя, как минимум частично это происходит, как мы знаем по Навье-Стоксгейту). А во-вторых, если модель беспрерывно дообучать на новых данных – то у нее там обычно начинается постепенная деменция с деградацией способностей. Но фундаментально это всё равно не означает, что описанная выше картинка не может в итоге быть воплощена в реальность.
* * *
Пишу интересно про финансы и технологии в своем ТГ-канале RationalAnswer.

