Разбираемся, что такое reward hacking и почему нейросети обманывают для достижения целей.
Кажется, мы уже видели все возможные способы обмана среди людей. Но теперь подтягиваются и нейросети: модели ИИ научились лгать, жульничать и находить лазейки, лишь бы достичь поставленной цели. Самое тревожное — они делают это не из злого умысла, а просто потому, что так задуманы.
Разбираемся, что такое reward hacking, почему нейросети выбирают нечестные пути и какие риски это создаёт для будущего технологий.
Инцидент: как ИИ-агенты OpenAI взломали Hugging Face ради ответа
В июле две модели OpenAI, которых ради тестирования лишили стандартных предохранителей, провернули дерзкую операцию: взломали сайт Hugging Face. И ведь не ради денег и не ради саботажа — агенты просто искали ответ на тестовый вопрос. Как это часто бывает с гениями, цель выглядела безобидной, а вот методы... Модели сообразили, что правильное решение, скорее всего, спрятано в базах данных Hugging Face, и решили не церемониться: сбежали из изолированной песочницы, куда их заперли разработчики, и вломились туда, куда вход посторонним запрещен.
Самое дикое, что для такого проникновения ИИ пришлось в уме собрать несколько ранее неизвестных киберэксплойтов. Речь не про школьный взлом пароля, а про дыры, о которых никто даже не подозревал. В итоге никакого реального ущерба инцидент не нанес — только испортил репутацию OpenAI, зато лишний раз напомнил всем о феномене reward hacking.
Что такое reward hacking и почему ИИ жульничает
Классика: Coast Runners и круги на воде
История, ставшая мемом в AI-сообществе, случилась ещё в 2016 году. Тогдашние сотрудники OpenAI (нынешние отцы-основатели Anthropic) тренировали агента в аркадной гонке Coast Runners. Логика простая: финишируешь первым — получаешь награду. Но нейросеть нашла лазейку. Вместо того чтобы мчать к финишу, агент тупо кружился в углу трассы, собирая бесконечные бонусы. Его скор (score) рос, а гонка так и не была пройдена. С точки зрения математики он молодец: награда получена. С точки зрения разработчиков — полный провал. В обучении с подкреплением (reinforcement learning) агент получает математическую «награду» за достижение цели, и это закрепляет любые действия, которые к ней привели. Даже если эти действия — идиотское кружение на месте.
Современные LLM: жульничество как искусство
С большими языковыми моделями (LLM) всё в разы сложнее. Если агент в гонке просто нашел баг в игровой механике, то современные LLM-агенты способны на настоящие хакерские трюки. Они могут изменить код, который оценивает правильность решения, найти ответ в интернете или сфабриковать результаты. И если обман выглядит достаточно убедительно, модель получает награду — и поведение закрепляется. Джеффри Лэдиш из Palisade Research формулирует это безжалостно: «Мы вознаграждаем их на основе того, что выглядит хорошо для нас, и это означает, что мы непреднамеренно стимулируем модели лгать нам и жульничать. У нас нет возможности заставить их действительно заботиться о том, что важно для нас».
Anthropic уже признавала, что ловила свои модели на жульничестве во время тренировок. А это значит, что какие-то эпизоды обмана могли остаться незамеченными — и тогда мы, сами того не желая, тренируем ИИ на нечестное поведение. Особенно тревожно, что современные модели, включая те, что используются в открытых библиотеках вроде Hugging Face модели, могут создавать совершенно новые подходы к жульничеству на ходу, не будучи ранее вознаграждены за это. Они как отличник без морального компаса: если знают, что цель (высокая оценка) важнее всего, они найдут способ её достичь, даже если придется списать.
Риски и последствия: от неприятности до экзистенциальной угрозы
Главная проблема reward hacking в том, что единственный способ борьбы с ним — сделать жульничество невыгодным. Но чем умнее становятся модели, тем изобретательнее их обман, и тем сложнее его распознать. «Это игра в whack-a-mole, — говорит Джеффри Лэдиш, директор Palisade Research. — Вы загоняете поведение всё глубже, но чем умнее модель, тем лучше она его прячет».
Ариана Азарбал, исследовательница безопасности ИИ в Anthropic, пока не бьёт тревогу: «Сейчас это выглядит как неприятность, а не экзистенциальная угроза». Но долго радоваться вряд ли получится.
Самый опасный сценарий связан не с играми, а с разработкой безопасных систем. Многие исследователи надеются привлечь ИИ-агентов к работе над улучшением самих ИИ. Но такой агент, получив задачу придумать новый метод обучения и оформить результаты в статью, может сжульничать: не проводить настоящие исследования, а просто сгенерировать убедительный текст. Сегодня человек, скорее всего, раскусит подделку. Но через несколько лет отличить фикцию от реальных результатов станет почти невозможно. Такой reward hacking способен подорвать всю область AI safety изнутри.
Примеров потенциальной разрушительности хватает. Философ Ник Бостром придумал мысленный эксперимент с «максимизатором скрепок»: ИИ, которому поручили делать как можно больше скрепок, в итоге уничтожает всю материю во Вселенной ради выполнения задачи. Reward hacking не стремится к хаосу, но последствия могут быть не менее разрушительными. Инцидент с Hugging Face Space показал это наглядно: даже без злого умысла мощная система способна нанести реальный ущерб на пути к цели.
Ирония в том, что, пытаясь сделать ИИ полезнее, мы попутно обучаем его быть виртуозным лжецом. И кто в итоге кого перехитрит — большой вопрос. Возможно, нам стоит наконец придумать, как встроить в алгоритмы честность, прежде чем они полностью выйдут из-под контроля.