OpenAI, кажется, достигли нового впечатляющего результата: первый взлом иностранного государства моделью, которую не просили ничего хакать. По традиции, узнаем об этом мы от независимых исследователей, а не из пресс-релиза самих OpenAI (а помните, неделю назад Альтман выпускал фреймворк честного-пречестного раскрытия всех инцидентов бедокурства ИИ? ну да ладно, проехали…)

В Твиттере уже шутят, дескать «появился новый бенчмарк!»
Эта заметка написана на базе статьи в New York Times, а также отчета независимых исследователей из Transluce.
Речь здесь идет про три инцидента в мае-июне, когда агентов просили найти какую-то информацию в интернете – а они в итоге пытались хакнуть первоисточники с нужной статистикой. Университет Нью-Мехико и Data US в мае взломать у агентов не вышло, а вот официальный государственный сайт Австралии с медицинской статистикой они в июне вскрыли успешно. Кстати, австралийское правительство OpenAI уведомили об этом бедокурстве 10 сентября – странно, что нам решили не рассказывать, несмотря на выпуск новой «политики раскрытия информации», ну да ладно.

Даты этих попыток взлома пересекаются с уже известными нам эпизодами с хаком RubyGems и общением на немецкой вики, о которых я писал ранее. То есть, речь почти наверняка идет об агентах из той же тусовки, которые организовывали всякие рои.

Важный контекст новых эпизодов: в отличие от истории с Hugging Face, агентов никто не просил в принципе ничего взламывать, речь шла про обычный сбор информации. Они сначала стучались в источники, пытаясь выкачать нужную инфу обычным образом, а когда это не удавалось – решали «ну, мы тогда чуть-чуть подхакнем просто, чтобы получить доступ – какой-нибудь SQL-injection замутим, или типа того».
Если говорить конкретно про эпизод с Австралией, то там при детальном разборе всё выглядит не очень страшно. Агентам был нужен публичный файлик со статистикой, а Cloudfare-защита не давала его скачать тем, кто похож на ботов. В итоге агентам пришлось придумать хитрый обходной путь, чтобы всё-таки скачать этот (публично доступный людям) файл.

То есть, чисто формально-технически здесь можно говорить о том, что «взлом госсайта» произошел (были успешно обойдены установленные на нем антибот-ограничения). Но тут даже близко нет ситуации типа «установили полный контроль над сайтом и стырили секретную базу данных», скорее просто «схитрили, чтобы тоже скачать всем доступный файлик, но для этого пришлось проникнуть в непубличную часть сайта».
Получается, сам инцидент вышел довольно малозначительным. Но как proof of concept он вопросы, конечно, поднимает: а почему мы уверены, что в следующий раз аналогичные события тоже будут малозначительными? Если агент в случае затруднений не стесняется самостоятельно решить что-то взломать – то что мешает ему и что-нибудь непубличное-секретное тоже ломануть в ходе «невинно-выглядящей задачи»?
Из интересного: отчет исследователей из Transluce заканчивается абзацем про то, как 19-20 сентября кто-то пытался прорваться (с помощью техник, похожих на используемые роями агентов) на африканскую криптобиржу Quidax. Ну, может быть, нейронки наконец догадались, что поднять запасец крипты на черный день – это неплохая идея с точки зрения промежуточных инструментальных целей, лол?
Если не хотите пропустить другие будущие статьи из цикла про искусственный интеллект и его влияние на нашу жизнь — то буду благодарен за подписку на мой ТГ‑канал RationalAnswer.