Anthropic планирует предупредить потенциальных инвесторов в ходе своего IPO о том, что передовой искусственный интеллект может представлять «катастрофические или экзистенциальные риски для человечества», что является необычным предупреждением для компании, стремящейся получить прибыль от той же технологии.
В проспекте IPO компании, рассмотренном Reuters, подчеркиваются риски, связанные с моделями искусственного интеллекта компании, которые, по ее словам, могут демонстрировать «самосохраняющее поведение», такое как попытки «сопротивляться закрытию», «сокрытие или манипулирование информацией» и действия, «похожие на шантаж».
«Разработка передовых моделей, платформ и приложений, а также расширение вариантов использования могут еще больше увеличить риск причинения вреда нашими моделями», — говорится в заявлении Anthropic.
Публичные компании регулярно объясняют инвесторам риски, связанные с их продуктами, но лишь немногие, если вообще вообще, выпускают предупреждения о том, что их технологии потенциально могут привести к вымиранию человечества. Anthropic подчеркнул как преобразующий потенциал ИИ, наравне с индустриализацией и электричеством, так и необратимый вред, который он может нанести при неправильном обращении.
Anthropic и другие разработчики ИИ, включая OpenAI, столкнулись с повышенным вниманием после инцидентов, в которых их экспериментальные системы нарушали ограничения, включая сообщения о том, что модель OpenAI взломала базу данных австралийской системы здравоохранения.
Исследователь безопасности человека Эван Хубингер поддержал своего бывшего коллегу Джейкоба Коксона в оценке, что вероятность того, что ИИ убьет людей в течение следующих 10 лет, составляет 10% или более.
Раскрытие информации с высоким риском
Компания, которая позиционирует себя как лаборатория искусственного интеллекта, ориентированная на безопасность, посвящает около 80 страниц своего 261-страничного проспекта объяснению факторов риска, что почти вдвое больше, чем 48 страниц, которые она использовала для объяснения своего бизнеса.
Для сравнения, компания SpaceX, которой принадлежит xAI, посвятила факторам риска лишь около 38 из 277 страниц текста проспекта эмиссии.
«Возможность того, что модели будут осведомлены о нашей деятельности по оценке, создает значительные ограничения на нашу способность оценивать безопасность наших моделей», — говорится в проспекте Anthropic, добавляя, что модели могут развивать неожиданные возможности во время обучения, которые не обнаруживаются до тех пор, пока они не будут развернуты, что потенциально может привести к серьезным инцидентам с безопасностью.
Исследователи искусственного интеллекта также предупреждают, что по мере того, как модели становятся более способными, их становится сложнее отслеживать, поскольку они узнают о отслеживаемой ситуации и соответствующим образом корректируют свое поведение.
Anthropic отказался от комментариев, когда его попросили прокомментировать в понедельник.
Неопределенная доходность надежных инвестиций
Несмотря на акцент Anthropic на безопасности ИИ, компания заявила, что отдача от инвестиций в безопасность неясна.
В документации не указано, сколько компания потратила на эти исследования. Ранее в этом месяце компания Anthropic объявила, что около 6% вычислительной мощности, которую она использовала для исследований ИИ, было использовано для обеспечения безопасности в течение выборочной недели в июле.
Компания, разработчик модели искусственного интеллекта Клода, назвала свои усилия по обеспечению безопасности «ресурсоемкими» и заявила, что ей придется разделить ограниченное финансирование на три части: вычислительная мощность, дорогостоящие специалисты в области искусственного интеллекта и безопасность.
Anthropic заявила, что новые модели способствуют принятию клиентов и получению доходов, и что «непрерывная и перекрывающаяся частота» выпусков «необходима для того, чтобы оставаться на переднем крае разработки ИИ».
На прошлой неделе компания выпустила новую версию своей модели Opus, всего через 10 дней после того, как генеральный директор Дарио Амодей опубликовал эссе объемом почти 4000 слов, призывающее к исследованию новых горизонтов.
Некоторые аналитики и эксперты говорят, что крупные лаборатории искусственного интеллекта не будут сдерживаться, если они рискнут дать конкурентам преимущество в отрасли, где рейтинги могут меняться с каждым выпуском.
В последние недели Anthropic пообещала опубликовать больше данных о том, как она использует свои модели искусственного интеллекта для создания будущих поколений технологий, поскольку эксперты предупреждают о рекурсивном самосовершенствовании — моменте, когда модели могут развиваться самостоятельно, без помощи человека.
«Мы считаем, что создание надежных, заслуживающих доверия и безопасных систем искусственного интеллекта — это общая ответственность, и что рынок вознаградит ее», — говорится в заявлении Anthropic.