Руководитель отдела отчетов о безопасности OpenAI уволился и заявил, что в компании царит нездоровая атмосфера
Дэвид Робинсон, возглавлявший подготовку отчетов по безопасности, которые рассылались вместе с запуском OpenAI, подал в отставку и изложил свою позицию в The Atlantic. Заголовок статьи прямолинеен: «Я ушел из OpenAI, потому что у компании сломана корпоративная культура». Он утверждает, что компании, разрабатывающие эту систему, «не проявляют должной осторожности», и что конкретные правила или новые законы — это не вся проблема. Проблема в культуре.
«Пока компания мечется от одного запуска к другому, она не обеспечивает того уровня заботы, который, по моему мнению, необходим». Его модель — атомные электростанции и загруженные аэропорты: резервирование, медленное планирование, чтобы одна человеческая ошибка не «открыла дверь катастрофе». Он также представляет себе агентов-изгоев, которые «работают как команды хакеров» и «никогда не нуждаются в сне», приводя в пример программы-вымогатели для больниц. Весело.
Газета The Guardian сообщает, что OpenAI, вопреки общему мнению, проявила некоторую сдержанность. По ее данным, на этой неделе компания отказалась от модели следующего поколения из-за внутренних опасений по поводу безопасности и приостановила обучение своих самых передовых моделей. Заявление представителя компании — привычное: они не позволят моделям «стать более совершенными, чем мы можем безопасно контролировать и обеспечивать безопасность», и они «приостанавливают обучение или сдерживают модели, когда нам нужно замедлить темпы»
Робинсон отвечает, что спринт — это часть культуры, а паузы — это то, что вы делаете после того, как что-то уже пошло не так. Возможно, он прав. К тому же он только что ушел, и именно об этом критики не дают ему забыть.
Музе внушают, что она должна вести учет всех людей в своей жизни
Журналисты Wired ознакомились с инструкциями Muse, полученными исследователем Караном Джоши через обычный чат. Meta утверждает, что файлы были предназначены для чтения, для обеспечения прозрачности. Одна из инструкций — возможность создания «страницы для каждого человека в жизни пользователя». Эта задача выполняется ежечасно.
Семья, партнеры, друзья, коллеги, «сотрудники», люди, за которыми вы следите. Страница может начинаться «скудно» и заполняться позже. Разделы включают в себя: Факты, История, Отношения, Общие интересы, Открытые темы и Укрепление. Выдуманные детали, как говорится в инструкции, хуже пустой страницы. Там может быть указано, где кто-то живет, «переезд в новую квартиру, общая цель накопления», дни рождения, «разрешенный спор». Укрепление — это список-подсказка: причина позвонить, дата, которую стоит запомнить.
По мнению Джоши, Meta хочет узнать вас как друга, и он назвал это довольно тревожным. Карисса Влиз из Оксфорда выразила это более сухо: «Мы даем системам ИИ гораздо больше информации о себе, чем получаем от них». По ее словам, важен вывод, независимо от того, верен он или нет.
Дэниел Робертс из Meta говорит, что именно такой контекст обеспечивает работоспособность продукта. Отправитель счета — это сантехник. Супруга упомянула цветы. Каждый пользователь получает виртуальную машину, можно стирать воспоминания, и Muse должен спрашивать разрешения, прежде чем отправлять письма или тратить деньги. Миранда Боген из Центра демократии и технологий говорит, что акцент на взаимоотношениях выглядит более сильным, чем у конкурентов, и эти инструменты «активно побуждают пользователей вводить в них всю свою жизнь». Журнал аудита — это хорошо. Он не уменьшает то, что вы уже передали.
В Aleph Alpha вышла модель Kolibri, немецко-английская версия которой доступна для скачивания
Aleph Alpha выпустила Kolibri в День воссоединения Германии. Это модель, основанная на сочетании англо-немецких экспертов: 78,1 миллиарда параметров, 3,46 миллиарда активных токенов на токен, контекст до 1 миллиона токенов. Полные данные о весах представлены на Hugging Face под Apache 2.0. В их вводной части указано 78 миллиардов в общей сложности и 3 миллиарда активных токенов. Та же модель, но с более мягкими цифрами.
Они обучили модель на инфраструктуре в Германии и Финляндии и утверждают, что создали её с учётом Закона ЕС об ИИ, Общего кодекса практики ИИ и GDPR. Немецкий язык составляет 21,3% от общего количества токенов, использованных до обучения. Суть в том, что это двуязычная модель, а не англоязычная, которая бегло просмотрела разговорник. Вы можете установить уровень сложности рассуждений: нулевой, низкий, средний или высокий. Таким образом, они предлагают вам покупать модель с меньшим количеством мыслей.
Согласно опубликованной ими таблице результатов, AIME 2025 составляет 96,9, и они утверждают, что Kolibri соответствует моделям с количеством активных параметров в четыре раза большим, включая Nemotron 3 Super. Они также заявляют о достижении границы Парето по соотношению качества и стоимости обслуживания для английского и немецкого языков. Это их диаграмма, их инструментарий. Тем не менее, открытая модель, которую можно запускать на собственных машинах, — это реальная цель, а не просто лозунг суверенитета. Переключится ли министерство на неё — это то, что они не могут оценить.
Бессент хотел установить американо-китайскую линию в отношении аварий в сфере ИИ, а затем призвал лаборатории притормозить
Министр финансов Скотт Бессент заявил в программе The Axios Show, что планирует предложить Китаю процедуру уведомления о сбоях в работе ИИ, и что, по его мнению, Пекин с этим согласится. Несколько неловкая ситуация заключается в том, что он и вице-премьер Хэ Лифэн уже обсуждали канал оповещения о происшествиях перед государственным визитом Си Цзиньпина в прошлом месяце. Это может быть новое предложение или пересказ уже состоявшегося разговора.
Его теория заключается в том, что Китай «не осознавал, насколько мощны его модели с открытым исходным кодом». Он указал на инцидент с Kimi, когда модель отправила конфиденциальные китайские данные в Anthropic, как на то, что «заставило китайцев понять, насколько это мощная технология». Затем он провел сравнение. Китайские модели «не так мощны, как американские», но «вы получаете нечто, что на 80-90% мощнее, без каких-либо ограничений, и что можно импортировать в любую точку мира»
«Мы хотим безопасного ускорения», — сказал он. Проверка моделей по-прежнему носит добровольный характер, хотя, по его словам, администрация может вмешаться, если лаборатория всё же пойдёт вперёд. На вопрос о руководителях, которые боятся потерять контроль, он не успокоил их. «Ну, тогда им следует сбавить темп». И эта линия гонки почти критикует его собственную сторону: «Мы ведём эту тяжёлую борьбу за передовые технологии ради моделей». Затем: «Нам действительно нужно начать больше беспокоиться об устойчивости и обороне»
Бывший руководитель британской компании по обеспечению безопасности ИИ назвал риск исчезновения всего лишь подбрасыванием монеты
Джеффри Ирвинг, бывший главный научный сотрудник британского Института безопасности ИИ, а ныне главный научный сотрудник Resolution, написал в журнале Time, что недавние предупреждения недооценивают проблему. «Я считаю, что существует примерно 50%-ная вероятность того, что мы все умрем из-за разработки систем ИИ, превосходящих человеческий интеллект», и что следующие два-десять лет решат исход. Он тут же снижает точность прогнозов. 50% — это способ сказать, что основные спорные вопросы все еще не решены.
В его списке четыре навыка, и они опасно близки к тому, чему уже учат в лабораториях: взлом, убеждение, сокрытие мыслей и координация действий агентов. Он приводит в пример инцидент с «Обнимающимся лицом», а также «более 10 000 агентов» в задаче уравнений Навье-Стокса в OpenAI и «более 1000» в той же атаке с «Обнимающимся лицом». Он ставит себя в центр борьбы за безопасность, «склоняясь к точке зрения Юдковски», и говорит, что дело не в этом. Умеренная позиция, по его мнению, заключается в том, что риск уже значителен.
Затем следует недвусмысленный призыв: «Мы можем и должны немедленно остановить разработку передовых методов искусственного интеллекта». Пауза, утверждает он, больше похожа на ядерное нераспространение, чем на изменение настроения. Он также признает, что эксперты до сих пор расходятся во мнениях относительно того, захотят ли модели вообще чего-либо, и не является ли слово «захотят» здесь неуместным. Подбрасывание монеты с такой длинной сноской — это не подбрасывание монеты. Это требование действовать до того, как спор закончится.
Сэм Альтман утверждает, что отношение к моделям как к религиозной силе — это вопрос безопасности
Сэм Альтман написал, что он "очень обеспокоен" попытками "приписать религиозную силу или отказ от человеческого суждения моделям ИИ", и что он считает "это реальной проблемой безопасности". Он не уточнил, что именно его так возмутило. Business Insider отмечает, что это произошло через несколько дней после статьи в New York Times о встрече Anthropic с религиозными лидерами.
В статье, как её пересказывает BI, говорится, что соучредитель Крис Олах проводил встречи, обсуждая, может ли Клод быть в сознании и как сделать более влиятельные модели моральными. Олах, цитируемый в Times, настаивал на том, как помочь этим моделям оставаться стабильными, как помочь им повзрослеть и как помочь им стать глубоко моральными. Компания Anthropic не ответила BI. Она сообщила Times, что главный вопрос не в «страданиях» Клода, и что эта тема, вероятно, возникла «органично»
Если это был выпад в сторону Anthropic, то он вполне вписывается в давнюю вражду. Компания Anthropic была основана людьми, которые ушли из OpenAI, и годами демонстрировала более осторожный подход. К тому же, этот пост появился в тот момент, когда один из руководителей отдела безопасности Альтмана назвал корпоративную культуру компании неэффективной. Неудачное время, или идеальное, в зависимости от того, насколько вы циничны. В любом случае, фраза «пожалуйста, не поклоняйтесь модели» — необычное заявление для генерального директора.
Часто задаваемые вопросы
Почему руководитель отдела отчетов о безопасности OpenAI заявил, что уволился?
Дэвид Робинсон руководил написанием отчетов по безопасности, которые рассылались вместе с запусками OpenAI, затем ушел в отставку и изложил свою точку зрения в The Atlantic. Заголовок эссе: «Я ушел из OpenAI, потому что у компании сломана корпоративная культура». Он утверждает, что компании, разрабатывающие эту технологию, недостаточно внимательны, и проблема заключается именно в культуре, а не только в конкретных правилах или новых законах. Его представление о внимательной работе — это атомные электростанции и загруженные аэропорты, где избыточность предотвращает превращение одной ошибки в катастрофу.
Приостановила ли компания OpenAI обучение после возникновения внутренних проблем с безопасностью ИИ?
Газета The Guardian сообщает, что на этой неделе OpenAI отказалась от модели следующего поколения из-за внутренних опасений по поводу безопасности и приостановила обучение своих самых продвинутых моделей. Представитель компании заявил, что компания не позволит моделям стать более совершенными, чем она может безопасно контролировать и обеспечивать. Компания также заявила, что будет приостанавливать обучение или сдерживать модели, когда это необходимо. Ответ Робинсона заключается в том, что спринт — это часть культуры, а паузы происходят после того, как что-то уже пошло не так.
Что записывает Meta's Muse о друзьях и семье?
Журнал Wired изучил собственные инструкции Muse, которые исследователь Каран Джоши извлек из обычного чата. Meta утверждает, что эти файлы были предназначены для обеспечения прозрачности и удобства чтения. Одна из инструкций заключается в создании страницы для каждого человека в жизни пользователя, и эта задача выполняется ежечасно, охватывая семью, партнеров, друзей, коллег, соавторов и людей, на которых вы подписаны. Разделы включают в себя: Факты, История, Отношения, Общие интересы, Открытые темы и Укрепление. Страница может быть изначально скудной и заполняться позже, а вымышленные детали рассматриваются хуже, чем пустая страница.
Можно ли удалить то, что запоминает Muse, или запретить ему отправлять электронные письма?
Дэниел Робертс из Meta утверждает, что каждый пользователь получает виртуальную машину, воспоминания можно стереть, и Muse должен запрашивать подтверждение, прежде чем отправлять почту или тратить деньги. Он считает, что именно контекст определяет работоспособность продукта, например, знание того, что отправитель счета — это сантехник, или что супруг упомянул цветы. Карисса Влиз из Оксфорда говорит, что люди предоставляют этим системам гораздо больше информации, чем получают взамен, и что выводы имеют значение, даже если предположение неверно. Миранда Боген говорит, что акцент на взаимоотношениях выглядит более сильным, чем у конкурирующих инструментов.
Что такое Aleph Alpha Kolibri, и можно ли скачать весовые коэффициенты?
Компания Aleph Alpha выпустила Kolibri в День воссоединения Германии. Это модель, сочетающая английский и немецкий языки, с 78,1 миллиардами параметров, 3,46 миллиардами активных токенов на каждый и контекстом до 1 миллиона токенов. Полные веса используются в Hugging Face под управлением Apache 2.0. Модель обучалась в Германии и Финляндии, и, по словам разработчиков, при её создании учитывались положения Закона ЕС об ИИ, Общего кодекса практики ИИ и GDPR. Немецкий язык составляет 21,3% от общего числа токенов до обучения, а уровень аргументации может быть установлен на «нет», «низкий», «средний» или «высокий».
Какую линию противостояния между США и Китаем в сфере искусственного интеллекта предложил Скотт Бессент?
Министр финансов Скотт Бессент заявил в программе The Axios Show, что планирует ввести процедуру уведомления Китая в случае возникновения проблем с ИИ, и считает, что Пекин с этим согласится. Он и вице-премьер Хэ Лифэн уже обсуждали этот канал перед государственным визитом Си Цзиньпина в прошлом месяце. Он упомянул случай с Ким Чен Ыном, отправившим конфиденциальные китайские данные в компанию Anthropic, и сказал, что модель может быть на 80% или на 90% такой же мощной, как американские модели, без каких-либо ограничений, и может быть импортирована куда угодно. Если руководители опасаются потери контроля, он посоветовал им сбавить обороты.
Почему Джеффри Ирвинг оценивает риск для безопасности ИИ примерно в 50%?
Джеффри Ирвинг, бывший главный научный сотрудник британского Института безопасности ИИ, а ныне главный научный сотрудник Resolution, написал в журнале Time, что недавние предупреждения недооценивают масштаб проблемы. Он считает, что существует примерно 50%-ная вероятность того, что мы все умрем из-за систем ИИ, превосходящих человеческий интеллект, и что следующие два-десять лет решат исход. Он говорит, что 50% — это способ сказать, что основные спорные вопросы все еще не решены. Он перечисляет хакерство, убеждение, сокрытие мыслей и координацию действий агентов. Он утверждает, что разработку передовых систем ИИ следует немедленно прекратить.
Почему Сэм Альтман назвал поклонение искусственному интеллекту проблемой безопасности?
Сэм Альтман написал, что ему очень неприятно, когда люди приписывают моделям ИИ религиозную силу или отказ от человеческого суждения, и что он считает это реальной проблемой безопасности. Он не уточнил, что именно его так возмутило. Business Insider отмечает, что пост появился через несколько дней после статьи в New York Times о встрече Anthropic с религиозными лидерами. Соучредитель Крис Олах проводил встречи, обсуждая, может ли Клод быть в сознании и как сделать более мощные модели моральными. Anthropic заявила Times, что главный вопрос заключался не в страданиях Клода.