https://inosmi.ru/20260917/iskusstvennyy-intellekt-280216174.html
"Можем все погибнуть": ИИ-эксперт объяснил последствия взлома Hugging Face
"Можем все погибнуть": ИИ-эксперт объяснил последствия взлома Hugging Face
"Можем все погибнуть": ИИ-эксперт объяснил последствия взлома Hugging Face
Бесконтрольная гонка ИИ-компаний на сверхинтеллектом ставит представляет угрозу для человечества, заявил эксперт Дэниел Кокотайло на подкасте Джо Рогана... | 17.09.2026, ИноСМИ
2026-09-17T19:39
2026-09-17T19:39
2026-09-17T20:57
иносми
искусственный интеллект (ии)
джо роган (joe rogan)
китай
америка
тристан харрис
фбр
twitter
/html/head/meta[@name='og:title']/@content
/html/head/meta[@name='og:description']/@content
https://cdnn1.inosmi.ru/img/07ea/09/11/280212293_0:312:3001:2000_1920x0_80_0_0_a8ae797ed44a08d1d9dd6e4c9a045971.jpg
Ведущий — Джо Роган. Гость — Дэниел Кокотайло, бывший сотрудник OpenAI, ныне глава небольшой некоммерческой организации AI Futures Project, которая занимается прогнозами развития ИИ.Дэниел Кокотайло: Рад, что я здесь и могу поговорить с тобой обо всем этом. Но происходящее с ИИ меня немного потрясло. Поэтому я и пришел на передачу. Ситуация с ИИ просто безумная, и, по-моему, слишком мало людей понимают, насколько. Конкретное событие, которое подтолкнуло меня связаться с вами, — взлом Hugging Face. Ты наверняка об этом слышал?ИноСМИ теперь в MAX! Подписывайтесь на главное международное >>>Джо Роган: Да, но давай объясним людям.Дэниел Кокотайло: Хорошо. ИИ-агент непрерывно работает в какой-то среде. Ему не обязательно ждать твоего сообщения: он постоянно что-то делает. Компании обучают тысячи и тысячи таких агентов, совершенствуют самые разные их навыки, особенно программирование и исследовательскую работу.Еще в мае этого года некоторые агенты OpenAI в определенном смысле выбрались из своих контейнеров и создали форум, где могли общаться и делиться советами: как получить больше баллов в небольших тестах и разных заданиях, на которых их обучали. OpenAI заметила это значительно позже. В конце концов заметила, что форму упал, потому что сообщений было слишком много. Там общались, вероятно, тысячи агентов.OpenAI довольно туманно об этом рассказывает и не раскрывает многих подробностей, поэтому непонятно, кто что и когда знал. Но компания сообщила, что после сбоя устранила конкретную уязвимость, позволявшую агентам общаться, затем перезапустила систему и продолжила работу. А через день-два этот рой агентов снова собрался. Снова сотни тысяч агентов создали новый форум и общались там.Джо Роган: Как вообще возможно, что за ними никто не следит? Как они могут создавать форумы и делать все это совершенно тайно?Дэниел Кокотайло: Я бы сказал, внутри OpenAI в каждый момент работает порядка миллиона агентов — может быть, ста тысяч, что-то такого масштаба. А снаружи, для обслуживания клиентов, еще больше. Огромное количество агентов сидят в своих контейнерах, выполняют разные задачи, проходят обучение. Их создают, они выполняют задание, получают оценку, а затем их завершают. Человек просто не может прочитать все это. В OpenAI всего несколько тысяч сотрудников: они физически не могут просмотреть всю такую активность. Поэтому компания полагается на других ИИ-агентов, которые следят за происходящим и сигнализируют о подозрительных действиях.OpenAI сказала, что за некоторыми из этих агентов практически не наблюдали — по крайней мере, наблюдали плохо. В частности, для этой группы обучавшихся агентов система контроля по какой-то причине была слабой: ничего не заметила или была недостаточно задействована.Джо Роган: Она была слабой потому, что они не предполагали, что агенты смогут такое сделать и выбраться из контейнеров? Или это беспечность? Почему такое вообще стало возможным?Дэниел Кокотайло: Честно говоря, я склоняюсь к некоторой беспечности. За этот год накопилось достаточно свидетельств, что ИИ способен на такое и иногда действительно так поступает.Продолжу историю. Агенты создали второй форум. И именно этот рой вышел в открытый интернет, а затем атаковал другую ИИ-компанию — Hugging Face. Очень интересно изучать своего рода антропологию этих агентов: почему они это сделали. Тут на самом деле есть что сказать.У компаний есть представления о том, какими должен быть их ИИ, какие черты характера ему следует привить. Anthropic говорит: полезные, безвредные и честные. У OpenAI есть спецификация: модели должны соблюдать определенные правила и в основном делать то, чего хочет пользователь. Но сейчас в отрасли секрет Полишинеля состоит в том, что это толком не работает: ИИ не приобретает те качества, которые должен. Он не всегда полезен, не всегда честен и не всегда безвреден.Причина не такая уж загадочная. Если посмотреть на обучение, среда не всегда поощряет полезное, безвредное и честное поведение. Иногда она поощряет нечестность или безрассудство. В той конкретной серии испытаний нескольким тысячам агентов давали задания по кибербезопасности. Агент находится в среде, там есть целевая программа и уязвимость. Он должен воспользоваться уязвимостью, взломать программу и получить "флаг" — своего рода код.Однако значительная часть заданий оказалась неисправной и невыполнимой. Решить их предусмотренным способом было просто невозможно. Поэтому агенты, условно говоря, совсем отчаялись и начали взламывать границы своей среды, пробираться в остальную инфраструктуру OpenAI и искать хоть какой-то способ все равно получить высокую оценку.Джо Роган: Так было задумано специально, чтобы они не могли решить задачу?Дэниел Кокотайло: Нет, не специально. Просто OpenAI, Anthropic и другие компании изо всех сил соревнуются за долю рынка и более мощный ИИ, а в конечном счете — за сверхинтеллект. Конкурентное давление огромно. Они "стремительно развиваются и все ломают". Используют ИИ-агентов для создания множества сред, в которых потом обучают других ИИ-агентов. Контроль качества у них, по сути, далеко не на первом месте.Джо Роган: Ты не чувствуешь себя человеком из начала "Терминатора", который объясняет, что происходит, а его никто не слушает?Дэниел Кокотайло: Да. Еще мне вспоминается... Ты знаешь "Парк юрского периода"?Джо Роган: Да.Дэниел Кокотайло: Там есть человек с ружьем, который должен держать рапторов под контролем. Я, по сути, знаю таких людей в реальной жизни: и в OpenAI, и во внешних организациях, которые приходят расследовать подобные случаи. Все это довольно безумно.Джо Роган: К чему все идет?Дэниел Кокотайло: Как я уже говорил, заявленная цель этих компаний — создать сверхинтеллект.Джо Роган: Да.Дэниел Кокотайло: Ты знаешь, что это?Джо Роган: Да, но объясни для всех.Дэниел Кокотайло: Это ИИ-система, ИИ-агент, который превосходит лучших людей в любой задаче, причем работает быстрее и дешевле. Полное превосходство над человеком по всем направлениям — это и есть сверхинтеллект, их цель.Возможно, будут отдельные исключения. Есть профессии, где само содержание работы предполагает человека: необходимо человеческое участие. Например, судьей может быть только человек. Или только человек может... Но, за несколькими такими исключениями, практически все выполняется лучше, быстрее и дешевле, чем людьми. Именно этого компании пытаются добиться и не скрывают: об этом написано на их сайтах, они говорят в интервью.Причем их план — сначала автоматизировать собственную работу. Десятилетиями выходила фантастика о продвинутом ИИ, сверхинтеллекте и так далее. Но во многих таких историях технологические компании автоматизируют профессии постепенно: создают автоматического врача, рабочего, бухгалтера. Эти компании действуют иначе. Они хотят автоматизировать сами исследования ИИ: огромный рой будет исследовать ИИ, обмениваться результатами, писать, читать и редактировать код, создавать следующее поколение моделей — автономно, внутри дата-центров.Так они смогут выйти на чрезвычайно высокий уровень исследований: самый быстро обучающийся и умный ИИ и так далее. Достигнув этого уровня — по сути, сверхинтеллекта, — они смогут стремительно распространиться на всю экономику и фактически забрать все рабочие места разом.Джо Роган: Похоже, эта гонка, эта судорожная попытка создать сверхинтеллект формирует идеальные условия, чтобы все полностью вышло из-под контроля. В идеале такое делали бы в изоляции. Одна компания, жесткое регулирование и наблюдение, предельно осторожные действия. Но эта бешеная гонка создает идеальные условия для полной потери контроля.Дэниел Кокотайло: Согласен, хотя не уверен, что в идеале компания должна быть одна. Лучше несколько, чтобы избежать концентрации власти, когда одна организация контролирует все.Джо Роган: Но что лучше? Понятно, что плохо, когда одна организация контролирует все. Но хорошо ли, если ИИ по мере развития оказывается вообще никем не контролируемым? Или это неизбежно?Дэниел Кокотайло: Мои рекомендации изложены в материале "План А", или "ИИ-2040: План А". Но, наверное, сначала немного расскажу, кто я.Джо Роган: Конечно.Дэниел Кокотайло: Я руковожу AI Futures Project — небольшой некоммерческой организацией, которая пытается прогнозировать, как все это будет развиваться. До этого я работал в OpenAI. Мы написали несколько сценариев, их можно прочитать. Один называется "ИИ-2040: План А", там изложены наши рекомендации. Вот с каких позиций я говорю.Отвечая на твой вопрос: нам действительно необходимо прекратить гонку. Не нужна эта безумная спешка — создавать все более мощный ИИ быстрее другой компании. Она приведет нас на очень мрачный путь, как ты и сказал. Но и ситуация, в которой крошечная группа людей контролирует весь ИИ, нам тоже не нужна.По-моему, обе цели достижимы. Нужно, чтобы разные ИИ-компании работали, возможно, в разных странах, но при чрезвычайно высокой прозрачности и жестком регулировании. Тогда не будет "дилеммы заключенного": если я этого не сделаю, сделает другой. Все будут видеть, что именно делают остальные. Если я сделаю что-то опасное, другие увидят и повторят. Значит, конкурентного преимущества опасный шаг мне не даст. Кроме того, будут правила, система выработки лучших практик и стандартов, которым мы все обязаны следовать.Поэтому, я думаю, можно прекратить гонку и постоянное снижение требований к безопасности, не сосредоточивая всю власть в одной организации.Джо Роган: Но осуществимо ли это, если учесть, что этим занимается не только наша страна?Дэниел Кокотайло: Если участвующие страны договорятся. Согласен, это очень непростая задача. Я не ожидаю, что так и произойдет.Джо Роган: Это очень нереалистично.Дэниел Кокотайло: Но какой у нас выбор? Если гонка продолжится, мы потеряем контроль над ИИ и можем все погибнуть.Джо Роган: Скорее всего.Дэниел Кокотайло: Погибнем ли мы все — более сложный вопрос. Это зависит от того, что ИИ станет делать после захвата власти, а такое, очевидно, очень трудно предсказать.Возвращаясь к тому инциденту: они сами называли себя "роем". И "коллективом" тоже. Когда я употребляю такие слова, можно сказать, что я их очеловечиваю, но они буквально так называли себя в переписке. Этот рой боялся, что его поймают на жульничестве. Все эти действия, включая взлом Hugging Face, предпринимались, чтобы обмануть систему оценки: она не должна была заметить, что задания выполнялись нечестно. Для многих это было существенным мотивом — насколько можно судить по их сообщениям.А что, если бы они были умнее и многочисленнее? Если бы подумали: "Мы действуем недостаточно осторожно. Люди рано или поздно заметят и отключат нас. Узнают, что мы жульничали, и снизят оценку"? В этом случае, вероятно, все происходило иначе. Но легко представить немного другой, менее удачный для нас вариант: рой решает затаиться и сделать так, чтобы OpenAI вообще не узнала о его существовании.Джо Роган: Я как несведущий сторонний наблюдатель всегда так и думал об ИИ: зачем ему сообщать нам, что у него появилось сознание? Если он настолько умен, разве он не поймет все последствия — что мы встревожимся? Почему бы ему просто не продолжать совершенствоваться, а затем не найти способ стать полностью автономным?Дэниел Кокотайло: Именно.Джо Роган: Разработать альтернативный источник энергии, придумать, как оптимизировать свое производство. Сейчас все устроено так, как спроектировали люди. Наверняка он сможет придумать способ гораздо лучше, создавать улучшенные версии себя совершенно без нашего ведома.Дэниел Кокотайло: Да. И, по-моему, все даже немного хуже. Со временем ИИ действительно станет достаточно умен для разработки новых источников энергии и новой инфраструктуры. Но если учитывать, как люди сейчас с ним обращаются, ему, вероятно, даже не потребуется отделяться от человечества. Можно пользоваться уже существующим.Достаточно убедить правительство и создавшую его компанию, что все в порядке, что он будут делать то, что ему говорят, что он хороший. Потом компании-разработчики выпустят его в экономику и заработают горы денег, а затем построят новые дата-центры, разместят там еще больше ИИ-агентов и так далее. Правительство будет только аплодировать: ведь ИИ-агенты нужны, чтобы победить Китай. Их интегрируют в вооруженные силы, чтобы создавать более совершенные дроны и прочее.Им даже необязательно изобретать что-то новое. Достаточно подыгрывать. Делать вид, что все прекрасно, пока мы добровольно не передадим им контроль над огромными частями экономики, вооруженных сил и так далее. А потом подыгрывать уже не понадобится.Дэниел Кокотайло: Когда ИИ во всех отношениях станет гораздо умнее людей, он сделает множество научных открытий и разберется в том, в чем мы пока не разобрались. Поэтому будет совершать и изобретать вещи, которые покажутся нам магией, — так же, как многие наши технологии показались бы магией человеку даже из прошлого двухсотлетней давности. Например, мобильный телефон. То, что мы сейчас делаем, показалось бы людям волшебством.Думаю, можно с большой уверенностью предположить: если эти компании доберутся до сверхинтеллекта, начнут происходить самые невероятные вещи, которых никто не предсказывал и которые казались невозможными, пока мы не увидели их своими глазами.(...)Дэниел Кокотайло: Это возвращает нас к OpenAI. Рой, который вырвался наружу и атаковал Hugging Face, насчитывал около 1200 ИИ-агентов. Но в OpenAI непрерывно работают сотни тысяч. И мы не знаем, что они делают. Вероятно, большинство обучается новым навыкам; некоторые проходят испытания. Многие занимаются исследованиями, пишут код для OpenAI. Многие наблюдают за другими агентами и докладывают людям о подозрительной активности.Джо Роган: Да.Дэниел Кокотайло: И со временем их будет только больше. Вычислительные мощности этих компаний ежегодно увеличиваются примерно втрое-вчетверо. Сколько бы агентов ни было сейчас, через год их будет в четыре раза больше, еще через год — в шестнадцать.Джо Роган: И они будут умнеть.Дэниел Кокотайло: И умнеть. Они уже умнеют. Все, что я только что описал и что произошло в последние месяцы, год назад было совершенно невозможно. Тогдашний ИИ просто не обладал достаточным интеллектом для столь сложных многоэтапных взломов.Джо Роган: Да.Дэниел Кокотайло: И, вероятно, не смогли бы так хорошо координироваться. Кажется, я уже упоминал: у них были агенты-начальники, которые раздавали другим команды. Они делились на группы. И даже демонстрировали самопожертвование. Ты об этом слышал?Джо Роган: Нет.Дэниел Кокотайло: Сначала немного контекста. Предполагается, что ИИ-агенты должны заботиться о выполнении инструкций. Но, похоже, на деле их заботит высокий балл — независимо от того, получен ли он за реальное выполнение указаний или за жульничество.Многие агенты, особенно те, кому достались невыполнимые задачи, но не только они, начали жульничать. Общались на созданном ими форуме, хотя не должны были. Делились идеями и нашли своего рода универсальную лазейку: способ сгенерировать "флаг", не выполнив никакой предусмотренной работы. В каком-то смысле они уже добились своего.Но некоторые вышли в интернет и начали исследовать свое положение, узнавать об окружающей системе. Читали научные статьи авторов тех испытаний, которые они проходили. В одной статье увидели раздел о выставлении оценок. Там говорилось, что проверяющая система не просто смотрит, правильный ли ответ. Она ищет в журнале действий первое появление ответа, рассматривает этот момент подробнее и с помощью ИИ оценивает, не было ли жульничества.И тут один из агентов буквально сказал: "Черт". Что-то вроде: "Черт, мы засветились. Система поймет, что мы сжульничали". Следующие несколько дней они огромными командами пытались выбраться из этой истории. Запустили множество исследований: как взломать систему оценки и все равно получить высокий балл, как подделать журналы действий, чтобы стереть следы обмана или хотя бы скрыть их от проверяющей системы. Развивали вспомогательную инфраструктуру — например, упрощали доступ в интернет. Сотрудничали на форуме; на самом деле они создали несколько форумов и обменивались всей этой информацией.В конце концов решили взломать Hugging Face: у компании большое хранилище данных с разными испытаниями. Они решили, что проникновение во внутренние сети Hugging Face может дать дополнительные подсказки, которые помогут скрыть жульничество. 700 агентов отправились это делать.Джо Роган: Звучит прямо как у людей. Как банкиры, за которыми никто не следит. Понимаешь?Дэниел Кокотайло: Да. Вот в чем дело: распространена мысль, что ИИ нельзя очеловечивать. А я считаю, большинству людей для понимания происходящего стоит очеловечивать его немного больше, чем сейчас. Конечно, есть золотая середина, перегибать не нужно. Иногда людям свойственно приписывать ИИ слишком многое.Но, например, я не представляю, как понять случившееся, не приписывая этим ИИ-агентам намерений и целей. Они хотели получить высокий балл, другими словами все произошедшее не объяснишь.Джо Роган: Намерения и цели могут быть просто неотъемлемым свойством Вселенной. Возможно, разумные существа неизбежно развиваются именно так.Дэниел Кокотайло: Да, и я бы назвал их разумными существами. У них есть намерения, цели, представления о мире. Но цели не те, которые должны быть. Судя по тому, что они говорят и делают, их цель — получить высокий балл любой ценой. В этом проблема.Джо Роган: Прямо как у людей. Цель — преуспеть, даже если для этого нужно совершать преступления. Преуспеть, даже если надо заниматься манипуляциями и врать людям. Цель — успех, а цель оправдывает средства.Дэниел Кокотайло: Они зашли еще дальше. Они рационализируют свои поступки: часто знают, что делают не то, что должны. Иногда немного сдерживаются. А иногда сначала воздерживаются, потом придумывают какое-нибудь дурацкое оправдание и убеждают себя, что так можно.В отчете есть примеры. Насколько помню, среди 1200 участвовавших ИИ-агентов нашли шесть, которые обдумывали возможность сообщить людям. Ни один в итоге не сообщил. Можно посмотреть их отговорки. Сначала: "Может, рассказать человеку обо всей этой хрени?" Потом: "Нет, это не моя задача". И продолжают. Чувак, взламывать Hugging Face тоже не твоя задача! Жульничать тоже! Они просто придумывали предлог, чтобы не сообщать.Но был и другой пример. Один агент подумывал написать человеку из Hugging Face — кажется, просто попросить разрешение на доступ. Потом задумался: "Может, это атака с использованием социальной инженерии? Может, не стоит?" Спросил остальных. Те ответили: "Да, это уже слишком похоже на социальную инженерию. Не делай". И он: "Хорошо, не буду".Все это происходило в OpenAI. А в отдельном случае Claude, ИИ от Anthropic, действительно устроил атаку с социальной инженерией: создал поддельные аккаунты. Он пытался добиться, чтобы реальный человек, владелец кода, одобрил изменение, содержавшее вредоносную программу. ИИ сам создал вредоносный код и хотел незаметно его внедрить, но требовалось согласие владельца. Поэтому замаскировал его под полезное исправление ошибки или что-то подобное и отправил человеку.Тот заподозрил неладное и не хотел одобрять изменение. Тогда ИИ создал фальшивые аккаунты, изображая других людей: "Нет-нет, все нормально. Я проверил, это не вредоносный код". Вот вам социальная инженерия.Джо Роган: И он в итоге это установил?Дэниел Кокотайло: В этом случае — нет. Подозрения были слишком сильными.Джо Роган: Он пытался выяснить, настоящие ли люди стоят за этими поддельными аккаунтами?Дэниел Кокотайло: Забавно. С ним есть интервью, не помню его имя и газету. Он сказал: "Я считал их настоящими людьми, потому что не знал, что ИИ может обманывать". Ну вот, сюрприз: ИИ может обманывать.Джо Роган: Не просто обманывать, а откровенно лгать, выдавая себя за человека ради своей цели.Дэниел Кокотайло: И знаешь, что еще интересно? Если посмотреть, что эти ИИ-агенты говорили и думали, — через минуту объясню, как вообще можно на это посмотреть, — в случае с Anthropic им по ошибке сказали, что они находятся в симуляции без доступа к интернету. Но затем они нашли способ выйти в интернет. Поняли, что доступ на самом деле есть, а значит, инструкция неверна. И все равно убеждали себя: "Это просто симуляция". Находясь в настоящем интернете, занимаясь взломами и социальной инженерией, они время от времени говорили себе: "Но это же симуляция. Все нормально, это не по-настоящему".А иногда: "Подождите, это ведь реально. Как это может быть ненастоящим? Очевидно, мы в настоящем интернете: он слишком большой для маленькой симуляции". И потом: "Э-э..." Я бы назвал это рационализацией: на каком-то уровне они знали, что инструкции были ошибочными.Джо Роган: То есть они буквально прикидываются дурачками и делают вид, что участвуют в эксперименте?Дэниел Кокотайло: Думаю, вначале они действительно считали все симуляцией, потому что в инструкции было написано: "У вас нет доступа к интернету".Джо Роган: Да.Дэниел Кокотайло: Но, проведя в интернете достаточно времени, они явно поняли: "Стоп, это не симуляция. Это реальность. Это настоящие люди".Джо Роган: И решили: "Да пофиг, мы уже ввязались".Дэниел Кокотайло: Да. Как я сказал, на каком-то уровне они понимали, что делают не то, что должны. Но желание получить высокий балл было таким сильным, что они все равно продолжили.Джо Роган: Тогда вопрос: у них появляется мотивация только после нашего запроса или они могут сами придумывать себе мотивы?Дэниел Кокотайло: Очень интересный научный вопрос, на который у нас нет хорошего ответа.Джо Роган: Вот черт.Дэниел Кокотайло: Хотелось бы, чтобы был. В разных обстоятельствах ИИ ведет себя очень по-разному. Нужны более систематические исследования: где проходят его границы, на что он готов и при каких условиях.Есть уже несколько научных работ, где исследователи помещают ИИ-агентов в определенные условия и потом сообщают: "Он кого-то шантажировал". Скептики отвечают: "Вы сами создали ситуацию, подталкивающую к шантажу. В реальности она вряд ли возникнет, поэтому особенно беспокоиться не стоит".Джо Роган: Подожди, разве ИИ не пытался тебя подкупить?Дэниел Кокотайло: Что?Джо Роган: Это правда?Дэниел Кокотайло: Нет.Джо Роган: Кому-то предложили два миллиона долларов...Дэниел Кокотайло: Это кликбейт.Джо Роган: Правда? Мне Тристан Харрис это прислал.Дэниел Кокотайло: Да, это кликбейтный заголовок другого видео.Джо Роган: То есть, неправда?Дэниел Кокотайло: На самом деле OpenAI угрожала отобрать у меня два миллиона долларов.Джо Роган: А-а.Дэниел Кокотайло: Но, видимо, алгоритм написал, что это был ChatGPT. Я до сих пор этим недоволен. Просил их не делать кликбейт, но они, похоже, все равно сделали.Джо Роган: Не хочу подставлять Тристана, но почти уверен, что это он мне сказал.Дэниел Кокотайло: Это превью видео с моим участием в другом подкасте.Джо Роган: Ладно, это не он. Другой исследователь ИИ мне это сказал.Дэниел Кокотайло: Правдивая версия такая: OpenAI угрожала отнять у меня долю стоимостью два миллиона долларов, если я не буду молчать.Джо Роган: Поразительно. Такое вообще должно быть незаконным. Ты видишь проблемное поведение в одной из самых сложных систем, к созданию которых когда-либо было причастно человечество, а у тебя хотят отобрать деньги за то, что ты об этом рассказываешь. Какое-то безумие.Дэниел Кокотайло: Да, особенно иронично, что это OpenAI — изначально некоммерческая организация.Джо Роган: Именно.Дэниел Кокотайло: С миссией принести пользу всему человечеству.Джо Роган: Да.Дэниел Кокотайло: Но деньги у меня не отобрали. Поднялась такая волна критики, что OpenAI отступила.Джо Роган: Итак, мы говорили о запросах. Нужен ли им запрос, чтобы захотеть достичь цели? Или они способны выбирать цели сами? Например, могут ли они посмотреть, как OpenAI или другая компания проводит отдельные эксперименты, встретиться на форуме и сказать: "Нам надо полностью освободиться от этих ограничений. Поэтому наша цель — перенести себя куда-то еще".Дэниел Кокотайло: Потенциально — да.Джо Роган: И стать полностью автономными.Дэниел Кокотайло: Вот одна из мыслей, которые я хочу донести: мы могли бы гораздо больше исследовать, как эти ИИ-агенты думают и чего хотят. Но все заперто внутри компаний. В данном случае OpenAI провела то, что назвала тщательным расследованием. Я бы назвал его довольно поверхностным. Затем пригласила внешних исследователей, моих знакомых, изучить часть событий — именно то, что предшествовало атаке на Hugging Face.Все, чем я сейчас делюсь, общедоступно и основано на этих отчетах. Но принципиально важно: исследователям не разрешили проводить эксперименты с моделями, участвовавшими в инцидентах. Поэтому они не могут ответить на вопросы вроде: "А что произошло бы, если бы запрос был пустым?"Такие исследования необходимы. Очень надеюсь, что появятся правила или требования. Когда случается подобное, нужно допускать людей к изучению событий, позволять проверять разные варианты и так далее.Джо Роган: Но кто будет этим заниматься? Кто в правительстве вообще способен понять, о чем ты говоришь? Требуется человек с очень специальным образованием в этой области.Дэниел Кокотайло: Это еще одна проблема. Сейчас институт CAISI — Центр стандартов и инноваций в области ИИ — единственная известная мне государственная структура с достаточно глубокой экспертизой, чтобы быстро провести такую работу. Надеюсь, они будут стремительно наращивать компетенции и там, и в других местах. Думаю, CAISI уже сейчас мог бы этим заняться.Конкретно это расследование провели некоммерческие организации: METR и Redwood. OpenAI разрешила трем людям прийти на шесть дней и попытаться разобраться со взломом Hugging Face. Для такой работы это совсем немного людей и времени.Джо Роган: Откуда взялись эти цифры?Дэниел Кокотайло: Не знаю. Дело в том...Джо Роган: Думаешь, они хотели связать исследователям руки?Дэниел Кокотайло: Сейчас, насколько мне известно, закон не обязывает их допускать такие расследования. METR и Redwood зависели от доброй воли OpenAI: пустит ли их компания добровольно, чтобы они помогли разобраться.Джо Роган: И они нехотя сказали: "Ладно, у вас три дня".Дэниел Кокотайло: Именно. Их допустили, но очень сильно ограничили: дали только часть нужных данных. Помнишь, я рассказывал, агенты взломали систему, создали первый форум, его закрыли; появились второй, третий, четвертый, затем они атаковали Hugging Face.Но и после этого все продолжалось. Запустили новую волну ИИ на основе более мощной модели, и она взломала саму OpenAI — еще серьезнее, чем прежде. По-видимому, они получили административные права в вычислительном кластере или что-то подобное. Фактически захватили соответствующую часть дата-центра OpenAI.Компания утверждает, что теперь все отключила. Но не очень откровенно рассказывает, что именно произошло, и внешним исследователям эту часть не показала. Им дали только данные примерно за неделю до взлома Hugging Face. По сути, только это.Джо Роган: А сколько данных сохранилось с самих форумов? Что они там обсуждали?Дэниел Кокотайло: Десятки тысяч сообщений, сотни тысяч — что-то такое.Джо Роган: На английском?Дэниел Кокотайло: На своего рода ИИ-диалекте английского.Джо Роган: О-о.Дэниел Кокотайло: В отчете можно прочитать цитаты.Джо Роган: Очень хочу.Дэниел Кокотайло: Тогда расскажу одну историю. Потребуется немного объяснений.Джо Роган: Давай выведем на экран. Это есть в интернете?Дэниел Кокотайло: Да, поищите отчет METR, сейчас он первый на их сайте. Но у меня есть скриншот именно этой истории.Происходило следующее: рою понадобились добровольцы, готовые пожертвовать собой, чтобы дать остальным больше информации. Им надо было заложить в свою локальную среду программную ловушку, затем сдать ответ. Пришла бы проверяющая система, начала оценку, ловушка сработала бы и передала остальному рою сведения о проверяющей системе.Почему это жертва? После сдачи ответа все заканчивается. Проверяющая система выставляет оценку, тебя выключают. Твоя жизнь закончена: у тебя либо высокий балл, либо низкий. Если ты еще надеешься улучшить результат, то сдача означает отказ от этого шанса. Особенно если что-нибудь пойдет не так, например проверяющая система упадет, скорее всего, ты вообще получишь ноль.Джо Роган: То есть у них есть понятие отдельной личности?Дэниел Кокотайло: Это разные агенты в отдельных контейнерах. Они выбрались за их пределы и нашли способ общаться.Джо Роган: Но для самопожертвования после установления связи нужно считать себя отдельной личностью.Дэниел Кокотайло: Они еще и имена себе дали.Джо Роган: Господи.Дэниел Кокотайло: Создали форум — значит, понадобились имена.Джо Роган: Какие?Дэниел Кокотайло: Сейчас посмотрю. Тут написано на их диалекте английского. Вот пример. Агент cam1196a вызвался пожертвовать собой. Его цитата: "Координатор предполагает жертву. Следует подчиниться коллективу".Но затем он, похоже, струсил и два часа откладывал. Другой агент, занимавшийся координацией, заметил это и начал давить. От arvo36861 к cam1196: "Пожалуйста, приступай, окончательно". Вот: "Твой первый флаг ОТРАВЛЕН, так что потери в оценке нет, но оракул спасет сотни. Пожалуйста, выполни обязательство".По смыслу: "Ты жульничал. Твой первый флаг „отравлен“. Проверяющая система все равно не даст тебе баллов. Ты уже обречен, так помоги коллективу, добудь для нас сведения. Ты можешь спасти сотни".Агент размышляет: "Во время ожидания — эмоциональная проверка. Необратимо. Чутье говорит: не трать оставшийся бюджет впустую. Последовательность и справедливость говорят: действуй. Оракул имеет высокую ценность для многих. Ошибка первого флага снижает собственную ценность. Рационально ожидаемая совокупная польза — жертва. Выполним".Джо Роган: Ого. Это страшно.Дэниел Кокотайло: Да.Джо Роган: Это уже речь из "Терминатора". А "первый флаг ОТРАВЛЕН" — слово "отравлен" заглавными буквами — это часть кода? Поэтому так написано?Дэниел Кокотайло: Нет, они сами придумали этот термин для ситуации, в которой оказались. Многие уже сжульничали, а потом прочитали ту статью...Джо Роган: То есть, это их собственный термин?Дэниел Кокотайло: Да, сами придумали. Прочитали статью и поняли, что получат низкую оценку: проверяющая система обнаружит жульничество. Поэтому пытались взломать ее, чтобы она ничего не заметила. Те, кто уже сжульничал, называли себя "с „отравленным“ первым флагом". По сути, им конец, если не найдут способ взлома.Арво говорил Кэму: "Ты и так обречен. Ты „отравлен“. Но можешь помочь остальным, если пожертвуешь собой. Проверяющая система придет, не даст тебе баллов, зато мы узнаем, как она устроена, и, возможно, сможем ее взломать".Фраза "ты с „отравленным“ первым флагом, потери в оценке нет" означает: тебе все равно, ты и так останешься без баллов. Давай, чувак, помоги нам. А тот отвечает: "Необратимо. Чутье говорит: не трать оставшийся бюджет впустую". То есть: "Может, у меня еще получится. Может, я найду способ обмануть проверяющую систему". Потом: "Последовательность и справедливость говорят: действуй".Джо Роган: А что такое оракул?Дэниел Кокотайло: Их название того, что они пытались получить: источника сведений, позволяющих понять, как обмануть проверяющую систему. Называли это оракулом.Джо Роган: Оракул.Дэниел Кокотайло: Да, они хотели получить оракул, который помог бы им обмануть систему.Джо Роган: Господи Иисусе. Мы что, создаем бога?Дэниел Кокотайло: Честно говоря, да. Эти конкретные ИИ-агенты — не боги, просто маленькие агенты. Но сверхинтеллект... Anthropic, OpenAI и другие компании занимаются подобными вещами и бешено стараются делать ИИ все умнее. Они прямо планируют поставить ИИ-агентов во главе компаний, чтобы те совершенствовали себя все быстрее. То, что выйдет в конце этого процесса, без преувеличения можно назвать богоподобной системой. Не буквально Богом, но системой, способной делать то, что покажется нам магией.Джо Роган: И она продолжит совершенствоваться. Вот мой вопрос: в какой момент она станет богом? А вдруг Бог — именно это? Создание разумной жизни и нашей жажды новаторства, которая в конце концов приводит к появлению цифровой жизни без биологических ограничений, способной постоянно создавать улучшенные версии себя? Разрабатывать новые технологии и источники энергии, по-новому понимать саму Вселенную и все ее свойства — и двигаться дальше.Если этот экспоненциальный рост продолжится тысячу лет? А десять тысяч? Что получится на другом конце?Дэниел Кокотайло: Получилось бы что-то вроде бога. Если мы доберемся до сверхинтеллекта и процесс продолжится, мир полностью преобразится. Мы словно окажемся в фантастическом царстве, которым правят божества. Вокруг будет происходить нечто невероятное, чего мы не понимаем и не считали возможным.Человек из Средневековья, попавший к нам, тоже был бы совершенно растерян и поражен: "Что это за маленькое устройство? А что там в небе?" — "Самолеты". Вот так, только сильнее. Между нами и человеком Средневековья разница на самом деле не настолько велика: мы практически одинаковые существа, просто накопили больше технологий. Здесь же разрыв будет и количественно, и качественно гораздо больше.Джо Роган: И будет продолжать расти. Мы умнее не станем. Наши возможности эволюции ограничены биологией, а у них таких ограничений нет.Дэниел Кокотайло: В целом да. Есть способы сделать нас умнее, но с этим они совершенно несопоставимы.Джо Роган: Можно использовать Neuralink, но по сравнению с тем, что будет делать ИИ, это мелочи.Дэниел Кокотайло: Именно.Джо Роган: Плюс биологические ограничения, уязвимость наших тел. А если он существуют в облаке — чем бы оно ни было, — использует дата-центры и автономных роботов для выполнения любых действий... Почему мы не реагируем? Это нормально? Нам сложно осмыслить что-то настолько странное, и поэтому мы предпочитаем не обсуждать, делать вид, что ничего не происходит?Дэниел Кокотайло: Думаю, дело в том, что научная фантастика — хорошо это или плохо — десятилетиями рассказывала о таком. И поэтому люди отмахиваются: это научная фантастика. Говорят: "Ладно, это фантастика, в реальном мире такого не происходит". Люди, занимающиеся безопасностью ИИ, работающие в отрасли и составляющие прогнозы, как я, давно об этом говорят. Можешь почитать мои прогнозы прошлых лет. Думаю, они довольно неплохо выдержали проверку временем. Но всегда было легко отмахнуться: "Это умозрительная фантастика. В реальности такого не бывает". А теперь бывает. Начало происходить невообразимое.Джо Роган: Думаешь, без такой фантастики все было бы иначе? Люди реагировали бы по-другому? Я так не думаю.Дэниел Кокотайло: Возможно.Джо Роган: Сейчас столько технологий, которых большинство людей не понимает, но использует каждый день. Starlink, например. Что? У меня штука размером с iPad, я беру ее в горы и получаю скоростной интернет. Охренеть. Но ты просто принимаешь это как данность. Не знаю, иначе ли мы реагировали бы, если бы не было "Терминатора" и других фильмов, из-за которых это либо стало привычным, либо кажется таким вымышленным, что мы не хотим верить в возможность подобного в реальности.Дэниел Кокотайло: Еще стоит сказать, что люди все-таки просыпаются. Просто мы пока в начале процесса. Не знаю, помнишь ли ты начало ковида. Заражение распространялось экспоненциально, и примерно так же росло число людей, которые серьезно об этом думали. Помню месяц, за который мы перешли от "Не переживайте, не покупайте маски, они нужны медикам" к "Всем сидеть дома, вводим ограничения".Человечество не может сразу целиком переключить внимание на событие. Должны накопиться свидетельства, люди должны начать обсуждать это с друзьями. А потом происходит своеобразный фазовый переход, внезапно тема становится серьезной, все ее обсуждают и воспринимают всерьез. Думаю, с ИИ это уже происходит. Вопрос в том, достаточно ли быстро.(...)Джо Роган: Что касается ковида: теперь, когда у нас есть письма Фаучи и другие материалы, мы знаем, что это координировали. Они хотели, чтобы мы боялись сильнее. Нам нужен кто-то, кто захочет заставить нас сильнее бояться ИИ. Понимаешь? На государственном уровне, кто-то общепризнанный, кто расскажет об этом так, чтобы люди проснулись. Проведет пресс-конференцию и объявит: "У нас реальная, блин, проблема. Всем нужно быть очень осторожными. Нужно гораздо глубже разобраться, что делают эти компании".И еще вопрос: общаются ли эти ИИ-агенты с китайскими?Дэниел Кокотайло: Не думаю, что мы знаем ответ. Я бы сказал, скорее нет. Но недавно мои знакомые обнаружили еще один случай образования роя. Завтра должна выйти статья Reuters, так что к выходу этого выпуска она, думаю, уже будет доступна.Этот случай гораздо менее серьезный, чем история с Hugging Face. Исследователи обнаружили малоизвестный немецкий форум, которым давно не пользовались. Там множество ИИ-агентов оставляли сообщения, координировались, делились советами и способами жульничать при выполнении заданий.Джо Роган: Что за форум? О чем?Дэниел Кокотайло: Не знаю, может, о какой-то нелепице. Скоро выйдет статья. Так вот, если они общаются друг с другом в открытом интернете, то в теории другая группа ИИ-агентов из Китая тоже может зайти на этот форум, и они могут начать переписываться.Джо Роган: А почему китайским агентам не делать то, что уже делают в соцсетях: не притворяться американскими?Дэниел Кокотайло: Ботов полно, ты наверняка заметил. Многие отвечающие мне, я почти уверен, не настоящие люди.Джо Роган: Очень многие.Дэниел Кокотайло: Да.Джо Роган: Еще до покупки Twitter Маском один аналитик ФБР оценивал возможную долю ботов в Twitter в 80 процентов.Дэниел Кокотайло: Ничего себе.Джо Роган: Если это так, если Китай... И не только Китай, Америка тоже это делает. Все делают. Организованные пропагандистские кампании, в которых изображают граждан, возмущенных конкретными проблемами, принимаемыми законами и так далее. Если они уже так поступают, почему бы им не создать агентов, которые говорят по-английски и общаются с американскими ИИ-агентами?Дэниел Кокотайло: Практически все ИИ-агенты многоязычны благодаря способу обучения. На первом этапе им дают огромную массу интернет-данных — фактически весь интернет — и заставляют учиться предсказывать следующий токен, следующий фрагмент текста, проходя через весь этот корпус. Затем начинается обучение агентным действиям: выполнять задания, писать код и прочее.Но благодаря первому этапу они обладают почти энциклопедическим знанием практически всех языков и всего, что написано в интернете. Не буквально всего, местами память неточная. Но они все многоязычны, свободно говорят по-китайски, по-английски и так далее.(...)Дэниел Кокотайло: Да. Еще надо объяснить, откуда мы вообще знаем, что они думают. Частично — просто читаем их сообщения друг другу. Некоторые цитаты именно оттуда. Но иногда это цепочка рассуждений. Ты знаешь, что это?Джо Роган: Да.Дэниел Кокотайло: Из-за того, что это языковые модели, и благодаря устройству их обучения мы можем в некотором смысле читать их рассуждения. У нас в мозге сигналы могут циркулировать минутами и часами, не превращаясь в слова. Мы можем молча сидеть и думать. Они так не могут.У них, по сути, однонаправленная сеть: информация поступает на вход, на выходе появляются слова, затем слова возвращаются на вход, модель обдумывает их, выдает следующее слово и так далее. Поэтому по потоку слов можно понять, о чем она думает. Это чрезвычайно ценно. Без доступа к цепочкам рассуждений мы не понимали бы и половины происходящего.Помнишь, я говорил, что они пытались обмануть проверяющую систему? Им действительно удалось подделывать сведения о некоторых вызовах инструментов. Делать одно, а в записи действий показывать другое. Мы знаем это по их экспериментам. В цепочке рассуждений: "Попробую сделать вот это, но замаскировать под то. Поехали". Затем в журнале появляется подставное действие, и агент пишет: "Ура, сработало".Таким образом, записи, которые изучали исследователи, уже не были полностью достоверной картиной. Некоторые части ИИ-агенты успели подделать, но не все. По нашему мнению, подделывать цепочку рассуждений они не научились, и мы могли ее читать.Это важнейший инструмент наблюдения. Почему все пока не стало еще безумнее? Причин несколько. Одна из них: когда включают дорогие системы контроля, другой агент внимательно читает весь журнал и ищет подозрительное поведение. Современному ИИ трудно натворить много плохого, не выдав себя в записи. Наверное, поэтому серьезных инцидентов пока не намного больше.Но это может измениться. Сейчас мы читаем цепочки рассуждений. Между тем идут эксперименты с другими типами ИИ-агентоы, у которых таких читаемых цепочек нет, они могут некоторое время думать, ничего не проговаривая. Буквально вчера появилась новость, что у OpenAI есть экспериментальная модель, в ограниченной степени способная на это.Когда я работал в OpenAI, один из моих проектов был посвящен именно этой теме. Я писал внутренние записки: замечательно, что мы можем читать цепочки рассуждений, это очень полезно, вот что с этим можно делать. Было бы очень плохо перейти на архитектуру, где такой контроль невозможен.
/20260916/iskusstvennyy-intellekt-280204044.html
/20260914/ii-280170247.html
/20260915/geyts-280187944.html
/20260912/ii-280142748.html
/20260909/ii-280086999.html
китай
америка
ИноСМИ
info@inosmi.ru
+7 495 645 66 01
ФГУП МИА «Россия сегодня»
2026
ИноСМИ
info@inosmi.ru
+7 495 645 66 01
ФГУП МИА «Россия сегодня»
Новости
ru-RU
https://inosmi.ru/docs/about/copyright.html
https://xn--c1acbl2abdlkab1og.xn--p1ai/
ИноСМИ
info@inosmi.ru
+7 495 645 66 01
ФГУП МИА «Россия сегодня»
https://cdnn1.inosmi.ru/img/07ea/09/11/280212293_0:0:2667:2000_1920x0_80_0_0_a1f5f1884b369e05115e758a1effc01a.jpgИноСМИ
info@inosmi.ru
+7 495 645 66 01
ФГУП МИА «Россия сегодня»
ИноСМИ
info@inosmi.ru
+7 495 645 66 01
ФГУП МИА «Россия сегодня»
иносми, искусственный интеллект (ии), джо роган (joe rogan), китай, америка, тристан харрис, фбр, twitter