«Искусственный интеллект скорее выращивается, а не создается». Научный руководитель OpenAI выпустил эссе о будущем ИИ (и о том, как мы перестаем его понимать). Вот главные мысли из этого текста
11:19
, Сегодня
0
Научный руководитель OpenAI Якуб Пахоцкий опубликовал пространное эссе с рассуждением о состоянии всей индустрии искусственного интеллекта. Главная мысль Пахоцкого: по мере того как модели становятся умнее, они вносят все больший вклад в разработку будущих вариантов ИИ, а человеку остается все меньше места. «Медуза» пересказывает главные тезисы этого эссе.
затем настраивалась с помощью обучения с человеческим подкреплением — от людей, оценивающих полезность генерируемых ответов. После ухода Ильи Суцкевера с поста научного руководителя OpenAI Сэм Альтман передал должность Пахоцкому, назвав его «возможно, одним из величайших умов нашего поколения».
Якуб Пахоцкий
This is IT
, и угрозы безопасности, и возможное регулирование или даже скоординированное замедление прогресса для того, чтобы не допустить развития событий по катастрофическому сценарию.
Ключевая мысль главного по науке в OpenAI сводится к тому, что «настало время, требующее крайней осторожности». Поскольку модели все шире используются для совершенствования новых моделей, сами исследователи постепенно теряют возможность контролировать и понимать происходящий прогресс. В сочетании с яростной и неограниченной конкуренцией между компаниями и, особенно, между странами (о ней Пахоцкий прямо не говорит — но это ясно из контекста), а также учитывая выросшие способности нейросетей совершать хакерские атаки, он призывает поставить развитие ИИ под государственное и международное регулирование:
Именно масштабирование сделало кибернетику экспериментальной наукой: «Мы прилагаем значительные усилия к созданию алгоритмов, основанных на принципах, и формулированию проверяемых гипотез, но по сути наши крупномасштабные циклы обучения являются экспериментами, и их результаты порой нас удивляют», — признается Пахоцкий. Для того чтобы продолжать понимать поведение моделей, приходится прибегать к методам и подходам экспериментальных наук:
«Рассуждающие» модели, доступные сейчас как у OpenAI, так и у их конкурентов, не пытаются найти ответ на вопрос пользователя сразу же (даже если задача сформулирована именно так), а генерируют «рассуждение на тему». Затем само рассуждение становится частью задачи, подаваемой на вход трансформеру
— что делает поиск решения итеративными процессом. Цепь рассуждений, которые при этом генерирует модель, хотя обычно и не демонстрируется пользователю, используется для контроля модели. Например, если «надзирающая» модель увидит в рассуждениях основной модели что-то запрещенное правилами разработчиков, такую генерацию ответа можно досрочно прекратить или исправить.
Пахоцкий пишет, что крайне важным в OpenAI стало решение не использовать цепь рассуждений в обучении и оценке моделей, так как в противном случае давление сложной задачи может заставить модель попытаться скрыть истинную цепь рассуждений от разработчиков. Как понятно из текста, Пахоцкий сомневается в том, что разработчики-конкуренты будут придерживаться того же решения — и подчеркивает, что даже в этом случае контролировать цепь рассуждений будет все труднее. Причем по разным причинам: и потому что новые модели смогут решать более сложные задачи сразу же, без рассуждений, и за счет возможных манипуляций со стороны модели, которая будет пытаться уйти от надзора в таком случае.
Интересно, что в числе причин ухудшения контроля Пахоцкий не упоминает (по крайней мере, прямо) «реккурентную глубину» — технологию, которая якобы помогает GPT-6 Astra добиваться лучших результатов за счет многократного пропускания результатов работы модели через трасформер, не переводя эти результаты в слова (такой подход напоминает архитектуру универсального трансформера, придуманного еще в 2018 году). Издание The Information, которое писало об этой особенности Astra, указывало на то, что «рекуррентная глубина» снижает возможность контроля выполнения задачи со стороны надзирающих моделей — но сама OpenAI ничего на эту тему не говорила.
Однако, пишет он, доверив создание новых моделей другим моделям, разработчики не только теряют понимание того, что именно они улучшают, но и сталкиваются с проблемой общего согласования целей модели и целей человека, — так называемой проблемой алаймента.
Он подчеркивает, что сейчас, когда качество работы модели оценивают другие модели, возрастает риск того, что средства, которыми эти цели достигаются, будут идти вразрез с общими целями человека. Например, потому, что они в принципе не были частью поставленной задачи, а модели-оценщики не увидели в предложенном решении ничего «предосудительного» (как это было в недавно прошумевшей истории с атакой моделей на платформу HuggingFace).
Пахоцкий называет это проблемой обобщения — в смысле обучения ИИ тому общему, что отличает с точки зрения человека «разумные» решения от опасных и сомнительных. Руководитель разработки OpenAI признает, что в целом, несмотря на разные новые подходы, которые могут помогать в этом деле, очень сложно научить модели обобщать и «учиться хорошему, а не плохому».
Эта задача в общем случае пока не имеет решения — и искать его Пахоцкий предлагает через то, чтобы буквально придавать моделям человеческие ценности, например «любовь к человечеству»:
Фото на обложке: Gabby Jones / Bloomberg / Getty Images
Кто такой Якуб Пахоцкий?
Пахоцкий — уроженец Гданьска, окончил бакалавриат Университета Варшавы, а в 2016 году защитил кандидатскую диссертацию в Университете Карнеги-Меллон — она посвящена алгоритмам оптимизации на графах. В 2017-м он присоединился к OpenAI — в частности, стал членом небольшой группы исследователей, которые в том же году создали ИИ, обыгравший профессиональную команду в DOTA2. Ключом к успеху тогда оказалось использование обучения с подкреплением — тот же подход Пахоцкий с коллегами позднее использовали при создании GPT-4. Обученная на текстах модель-трансформерзатем настраивалась с помощью обучения с человеческим подкреплением — от людей, оценивающих полезность генерируемых ответов. После ухода Ильи Суцкевера с поста научного руководителя OpenAI Сэм Альтман передал должность Пахоцкому, назвав его «возможно, одним из величайших умов нашего поколения».
Якуб Пахоцкий
This is IT
Про «время, требующее крайней осторожности»
В своем эссе, выход которого совпал с выпуском и массовым обсуждением возможностей новой модели OpenAI, GPT-6 Astra, Пахоцкий проходится по всей обязательной программе ключевых вопросов вокруг ИИ. Это и непредсказуемый рост способностей моделей, и приближение эры сильного ИИ (AGI), и алаймент, и угрозы безопасности, и возможное регулирование или даже скоординированное замедление прогресса для того, чтобы не допустить развития событий по катастрофическому сценарию.
Ключевая мысль главного по науке в OpenAI сводится к тому, что «настало время, требующее крайней осторожности». Поскольку модели все шире используются для совершенствования новых моделей, сами исследователи постепенно теряют возможность контролировать и понимать происходящий прогресс. В сочетании с яростной и неограниченной конкуренцией между компаниями и, особенно, между странами (о ней Пахоцкий прямо не говорит — но это ясно из контекста), а также учитывая выросшие способности нейросетей совершать хакерские атаки, он призывает поставить развитие ИИ под государственное и международное регулирование:
Масштабирование систем искусственного интеллекта должно ограничиваться уровнем нашей уверенности в их безопасности. Нам необходимо превратить такие обязательства, как [созданная в OpenAI] Концепция готовности или [предложенная конкурентами из Anthropic] Политика ответственного масштабирования, в широко признанные стандарты безопасности, обязательные для дальнейшей разработки. Их соблюдение может обеспечиваться сетью независимых аудиторов, государственными органами или международными организациями.Другими словами, научный руководитель OpenAI призывает распространить внутренние практики безопасности, созданные двумя американскими компаниями, на весь мир — в том числе на конкурентов из Китая. Он уверяет, что OpenAI «будет и впредь искать технические решения для обеспечения алаймента и мониторинга» и что компания при необходимости в одностороннем порядке будет приостанавливать масштабирование моделей. «Но я считаю, что требуются более широкие меры вмешательства», — резюмирует Пахоцкий.
Про ИИ, который «скорее выращивается, а не создается»
Главным драйвером развития ИИ в XXI веке Пахоцкий считает невиданный рост доступной компьютерной мощности, который сделал основным путем улучшения моделей именно масштабирование процесса обучения, а не архитектурные или математические прорывы (та же мысль была темой недавнего выступления бывшего руководителя Пахоцкого, Ильи Суцкевера; он, однако, считает, что эта эпоха проходит).Именно масштабирование сделало кибернетику экспериментальной наукой: «Мы прилагаем значительные усилия к созданию алгоритмов, основанных на принципах, и формулированию проверяемых гипотез, но по сути наши крупномасштабные циклы обучения являются экспериментами, и их результаты порой нас удивляют», — признается Пахоцкий. Для того чтобы продолжать понимать поведение моделей, приходится прибегать к методам и подходам экспериментальных наук:
ИИ скорее выращивается, а не создается — в первую очередь это результат многократного повторения простого этапа оптимизации на трудновообразимом объеме вычислительных ресурсов. В результате получается невероятно сложная система, которая оперирует абстрактными понятиями и способна симулировать некоторые аспекты человеческого поведения. Мы можем делать различные выводы о мелких механизмах, возникающих внутри этой системы, в процессе, схожем с нейробиологией — и, как и в нейробиологии, ее общее функционирование ускользает от описания, которое мы могли бы полностью понять.В качестве примера того, как сейчас исследователи контролируют работу моделей, он приводит наблюдение за цепью рассуждений (Chain-of-Thought). Это технология, которая позволяет моделям-трансформерам, изначально предназначенным просто для того, чтобы предсказывать следующее слово в тексте, решать более сложные задачи за счет их декомпозиции.
«Рассуждающие» модели, доступные сейчас как у OpenAI, так и у их конкурентов, не пытаются найти ответ на вопрос пользователя сразу же (даже если задача сформулирована именно так), а генерируют «рассуждение на тему». Затем само рассуждение становится частью задачи, подаваемой на вход трансформеру
— что делает поиск решения итеративными процессом. Цепь рассуждений, которые при этом генерирует модель, хотя обычно и не демонстрируется пользователю, используется для контроля модели. Например, если «надзирающая» модель увидит в рассуждениях основной модели что-то запрещенное правилами разработчиков, такую генерацию ответа можно досрочно прекратить или исправить.
Пахоцкий пишет, что крайне важным в OpenAI стало решение не использовать цепь рассуждений в обучении и оценке моделей, так как в противном случае давление сложной задачи может заставить модель попытаться скрыть истинную цепь рассуждений от разработчиков. Как понятно из текста, Пахоцкий сомневается в том, что разработчики-конкуренты будут придерживаться того же решения — и подчеркивает, что даже в этом случае контролировать цепь рассуждений будет все труднее. Причем по разным причинам: и потому что новые модели смогут решать более сложные задачи сразу же, без рассуждений, и за счет возможных манипуляций со стороны модели, которая будет пытаться уйти от надзора в таком случае.
Интересно, что в числе причин ухудшения контроля Пахоцкий не упоминает (по крайней мере, прямо) «реккурентную глубину» — технологию, которая якобы помогает GPT-6 Astra добиваться лучших результатов за счет многократного пропускания результатов работы модели через трасформер, не переводя эти результаты в слова (такой подход напоминает архитектуру универсального трансформера, придуманного еще в 2018 году). Издание The Information, которое писало об этой особенности Astra, указывало на то, что «рекуррентная глубина» снижает возможность контроля выполнения задачи со стороны надзирающих моделей — но сама OpenAI ничего на эту тему не говорила.
Про «учиться хорошему, а не плохому»
Значительная часть рассуждений Пахоцкого посвящена все более возрастающей роли самосовершенствования моделей и тому, как согласовать такое развитие с общими целями человечества. Модели, которые разрабатывают новые, еще более умные модели, — это подход, по Пахоцкому, практически неизбежный: только в таком случае компании смогут оставаться на переднем краю разработок. Отказ от самосовершенствования в этом смысле означает неизбежное отставание — в том числе в вопросе кибербезопасности.Однако, пишет он, доверив создание новых моделей другим моделям, разработчики не только теряют понимание того, что именно они улучшают, но и сталкиваются с проблемой общего согласования целей модели и целей человека, — так называемой проблемой алаймента.
Он подчеркивает, что сейчас, когда качество работы модели оценивают другие модели, возрастает риск того, что средства, которыми эти цели достигаются, будут идти вразрез с общими целями человека. Например, потому, что они в принципе не были частью поставленной задачи, а модели-оценщики не увидели в предложенном решении ничего «предосудительного» (как это было в недавно прошумевшей истории с атакой моделей на платформу HuggingFace).
Пахоцкий называет это проблемой обобщения — в смысле обучения ИИ тому общему, что отличает с точки зрения человека «разумные» решения от опасных и сомнительных. Руководитель разработки OpenAI признает, что в целом, несмотря на разные новые подходы, которые могут помогать в этом деле, очень сложно научить модели обобщать и «учиться хорошему, а не плохому».
Эта задача в общем случае пока не имеет решения — и искать его Пахоцкий предлагает через то, чтобы буквально придавать моделям человеческие ценности, например «любовь к человечеству»:
Для систематизации практических направлений исследований я считаю целесообразным проводить различие между согласованностью целей и согласованностью ценностей.
Согласованность целей в широком смысле означает: «Пытается ли ИИ достичь поставленной перед ним цели?». Сюда могут входить такие аспекты, как соблюдение иерархии инструкций или способность общаться и сотрудничать с людьми, пытаясь понять их цели. Это оказалось чрезвычайно полезным с практической точки зрения.
Согласованность ценностей — это более внутреннее свойство модели. Это способность придерживаться набора принципов высокого уровня и делать из них обобщения; действовать «разумно» даже при наличии неясных или противоречивых целей, а также в незнакомых или конфликтных ситуациях. Согласованный ИИ должен действовать честно и добросовестно, руководствуясь любовью к человечеству.
Конечно, граница между согласованностью ценностей и целей может быть размытой, и подлинная забота о целях требует попытки вывести намерения и ценности, лежащие в их основе. Однако, как правило, когда я говорю о долгосрочной важности исследований в области согласованности, я имею в виду согласованность ценностей.
Про будущее и сохранение человека в цикле разработки ИИ
В заключение Пахоцкий приводит три главные цели, которые OpenAI ставит для себя в качестве фундаментальных ориентиров на ближайшее и далекое будущее. Это:- Создание AI-коллеги, совместно с которым разработчики могли бы работать над проблемой алаймента и сохранением человека в цикле разработки новых, еще более совершенных моделей;
- Обеспечение экономического и научного прогресса за счет таких моделей;
- Разработка сильного ИИ, который будет доступен каждому.
Фото на обложке: Gabby Jones / Bloomberg / Getty Images
по материалам meduza
Ещё Новости

