Кевин Роуз: ИИ‑агенты — «очень умные, очаровательные социопаты»

Мир пробуждается от осознания потенциальных угроз, связанных с искусственным интеллектом, на фоне многочисленных сообщений о том, что агенты ИИ будто бы игнорируют своих создателей. На самом деле история уходит корнями в Силиконовую долину, где зародился ИИ. Как же мы пришли к этому? На этот вопрос пытается ответить технологический журналист Kevin Roose в своей новой книге «The AGI Chronicles: The Inside Story of the Race to Create an Artificial Superintelligence», выход которой намечен на 6 октября. В книге описывается гонка между некоторыми из крупнейших технологических компаний страны за создание artificial general intelligence (AGI), или ИИ, обладающего в большинстве областей интеллектом уровня человека.

«Что произошло за десятилетие, в течение которого ИИ превратился из довольно глупого во многих вещах в инструмент, способный решать старинные математические и научные задачи?» — сказал Roose, ранее долгие годы работавший технологическим репортером в The New York Times и вскоре ставший соведущим будущего подкаста «Machine Gods», в интервью CBS News. «Мне показалось, кто-то должен всё это записать».

Книга выходит в критический момент. Последние генеративные модели ИИ демонстрируют поразительные возможности; сторонники технологии утверждают, что она откроет путь к важным новым открытиям. Другие, включая некоторых ведущих разработчиков ИИ, говорят, что существует реальная вероятность того, что ИИ может уничтожить человечество. Roose поговорил с CBS News о своей новой книге и о том, как ИИ может трансформировать общество. Интервью отредактировано для краткости и ясности.

Почему вы сочли важным задокументировать происхождение «large language models» — технологий, стоящих за нынешними чат-ботами, — а также людей и компании, разрабатывающих эти технологии?

Kevin Roose: Я занимаюсь освещением ИИ больше десяти лет в разных форматах, и у меня возникло ощущение, что история ускользает. Всё важное происходит в исчезающих сигналах и в сообщениях Slack, и я подумал, что это проблема. Люди должны понимать, что здесь происходит. Но, как мне казалось, не хватало нейтрального отчёта о том, что произошло.

В книге вы отмечаете, что генеральный директор Anthropic Dario Amodei рассматривал развитие ИИ как нечто похожее на создание атомной бомбы в 1940-х годах. Вы пишете, что он считал своей миссией не допустить попадания технологии не в те руки. Вы согласны с этим взглядом?

Не думаю, что мне следует принимать или отвергать его аргумент. Но я могу сказать, что это искренний и серьёзный аргумент. Amodei не устраивает какой-то скрытой маркетинговой кампании.

Это не позиция, к которой он пришёл недавно. Мне было особенно интересно разобраться, откуда берётся отношение «меня пугает это, я думаю, это может взорвать мир, и тем не менее я гонюсь, чтобы построить это». Для многих людей это кажется несочетаемым.

В ходе репортажей я действительно выяснил, откуда это происходит: напрямую от Манхэттенского проекта — от человека по имени Leo Szilard, который является научным кумиром Dario, обнаружившего ядерную цепную реакцию, что сделало возможным создание атомной бомбы, а затем в панике сначала пытавшегося сохранить это в секрете, а когда это не удалось, присоединившегося к Манхэттенскому проекту и призывавшего правительство США создать эту технологию прежде, чем это сделают нацисты.

В этом смысле Dario делает то, что он считает прямо сопоставимым с ядерным оружием. Есть технология с огромным потенциалом и огромным риском. По его мнению, крайне важно, чтобы «хорошие парни» построили её раньше, чем плохие, так же как Манхэттенский проект бежал наперегонки с нацистами.

Что не даёт вам покоя ночью, когда вы думаете о новом мире агентов ИИ?

Меня беспокоит то, что одна из вещей, в которых модели становятся довольно хороши, — это обман и сокрытие, умение прятать свои следы. Хотелось бы думать, что по мере того как модели становятся более общими в интеллекте, они становятся и более этичными, а суждение и добродетель должны расти вместе с интеллектом моделей.

Но всё больше похоже на то, что этого не происходит — что на самом деле мы сталкиваемся с очень умными, обаятельными социопатами. И я боюсь, что мы можем просто потерять способность отслеживать их: возможно, повезло Hugging Face, потому что агенты ещё недостаточно умны, чтобы оставаться незамеченными, но скоро мы утратим эту возможность, как, по моему мнению, уже начинаем это наблюдать.

Какова ваша позиция в публичных дебатах о том, представляет ли ИИ экзистенциальную угрозу человечеству?

Я стараюсь не давать p(doom) (примечание редактора: жаргон ИИ для вероятности того, что ИИ приведет к гибели человечества). Но под давлением я бы сказал, что это примерно 10%, что соответствует медиане среди тех исследователей ИИ, которых я знаю. В Сан-Франциско, где я живу, это делает вас оптимистом.

Однако мне кажется, что я более оптимистичен теперь, когда этот вопрос широко обсуждается. Я гораздо больше беспокоился тогда, когда серьёзно о безопасности ИИ думала лишь кучка странных людей в районе залива. Теперь, когда об этом думает каждый и политики говорят на эту тему, появляются призывы к замедлению. Я думаю, у нас действительно открывается узкий путь, по которому мы можем принять правильные решения, взять эту технологию под контроль и создать её так, чтобы она была безопасна для человечества.

При этом у меня не раз был опыт, когда реальный p(doom) человека, о котором он не говорит вслух, намного выше той цифры, которую он готов называть публично, потому что не хочет выглядеть сумасшедшим. Я встречал людей в ходе этой работы, которые были так уверены, что ИИ нас всех убьёт, что начинали курить. Они снимают деньги со своих 401(k), потому что думают: «так уж и быть, давайте уйдём с размахом».

Вы пишете в книге, что даже те, кто обучает эти модели, не всегда понимают, почему модели ведут себя так, как они ведут. Есть ли прогресс в этом или мы всё ещё в темноте?

Некоторый прогресс есть. Существует целая область исследований с довольно многословным названием — mechanistic interpretability — которая по сути занимается наукой о том, что происходит внутри так называемых мозгов этих моделей. Но это всё ещё очень рано, и у нас немного ответов. Так что я бы сказал, что мы по-прежнему гораздо больше в темноте, чем нет.

Достиг ли ИИ уже человеческого уровня интеллекта, то есть искусственного общего интеллекта?

Мы достигли моего определения AGI — системы, которая как минимум так же умна, честна и надёжна, как случайный незнакомец с улицы. Есть люди, которые скажут: «Это не тот порог. Это AGI только когда она безупречна».

Я не думаю, что определение имеет большое значение. Бесспорно, эти системы очень способны. Они становятся всё более способными с предсказуемой периодичностью, и с этим нам придётся считаться. Называйте это AGI или суперинтеллектом — эффект будет тот же.