Anthropic и OpenAI внедряют оценщиков безопасности. Будут ли они действительно независимыми?

#Anthropic#OpenAI#безопасность ИИ#независимая оценка#регулирование ИИ#METR
Anthropic и OpenAI внедряют оценщиков безопасности. Будут ли они действительно независимыми?

Введение

Крупнейшие лаборатории искусственного интеллекта — Anthropic и OpenAI — всё активнее говорят о необходимости внешней проверки безопасности своих моделей. Обе компании объявили о планах привлекать сторонних оценщиков для аудита рисков, связанных с их ИИ-системами. Однако ключевой вопрос остаётся открытым: насколько независимыми окажутся эти оценщики, если их нанимают и оплачивают сами разработчики моделей?

Детали

Anthropic ещё в 2023 году опубликовала документ о «Responsible Scaling Policy» (RSP), в котором описала уровни риска (ASL — AI Safety Levels) и обязательства по проведению оценок перед выпуском моделей. Компания заявляла о сотрудничестве с внешними организациями, включая некоммерческие исследовательские группы, для проверки моделей на предмет опасных возможностей — от киберугроз до помощи в создании биологического оружия.

OpenAI в свою очередь представила «Preparedness Framework» — систему оценки рисков, которая предусматривает привлечение внешних экспертов для тестирования моделей перед релизом. Компания также создала команду Preparedness, которая координирует эти проверки.

Обе компании участвуют в инициативах по стандартизации оценки ИИ, включая работу с такими организациями, как METR (Model Evaluation and Threat Research) и Apollo Research. Эти группы проводят независимые тесты моделей, включая оценку способности ИИ к автономному поведению, обману и самовоспроизведению.

Тем не менее, механизм финансирования остаётся спорным: внешние оценщики часто получают оплату от самих лабораторий, что ставит под сомнение их беспристрастность. Кроме того, доступ к моделям предоставляется на условиях разработчика, что ограничивает глубину проверки.

Анализ

Проблема независимости оценщиков безопасности ИИ — это классический конфликт интересов. Когда компания одновременно разрабатывает продукт, устанавливает стандарты его оценки и оплачивает тех, кто эту оценку проводит, возникает структурная уязвимость.

С одной стороны, привлечение внешних экспертов — шаг вперёд по сравнению с полностью закрытыми внутренними проверками. Это создаёт хотя бы видимость подотчётности и позволяет выявить риски, которые разработчики могли упустить или намеренно игнорировать.

С другой стороны, независимость требует не только формального статуса, но и реальной возможности влиять на решения. Если оценщик не может заблокировать выпуск модели или публично сообщить о выявленных проблемах без риска потерять контракт, его роль сводится к символической.

Существует также вопрос методологии. Оценка безопасности ИИ — молодая дисциплина без устоявшихся стандартов. Разные группы используют разные подходы, что затрудняет сравнение результатов и создаёт пространство для манипуляций.

Мнение

На мой взгляд, текущая модель «внешней оценки» в индустрии ИИ — это компромисс, а не решение. Она лучше, чем ничего, но недостаточна для реальной подотчётности.

Настоящая независимость требует трёх условий: независимого финансирования (например, через государственные гранты или международные фонды), юридической защиты оценщиков от retaliation и обязательного публичного раскрытия результатов. Пока хотя бы одно из этих условий не выполнено, «независимая оценка» остаётся в значительной степени декларацией.

Anthropic и OpenAI заслуживают признания за то, что вообще поднимают эту тему. Но признание проблемы — не то же самое, что её решение. Индустрия нуждается в институциональных механизмах, а не в доброй воле отдельных компаний.

Итог

Anthropic и OpenAI делают шаги в сторону внешней оценки безопасности своих моделей, сотрудничая с исследовательскими организациями и публикуя框架ы управления рисками. Однако структурная зависимость оценщиков от разработчиков, отсутствие обязательных стандартов и ограниченный доступ к моделям ставят под сомнение реальную независимость этих проверок. Без независимого финансирования и юридических гарантий для оценщиков такие инициативы рискуют остаться формальностью.

FAQ

Почему независимость оценщиков ИИ так важна?
Потому что ошибки в оценке рисков могут привести к выпуску моделей с опасными возможностями — от дезинформации до кибератак. Независимая проверка снижает риск конфликта интересов и повышает доверие общества.

Кто сейчас проводит независимые оценки моделей?
Среди известных организаций — METR, Apollo Research и академические группы. Они тестируют модели на автономность, обман и другие риски, но часто работают по контрактам с самими лабораториями.

Может ли государство решить проблему независимости?
Да, через регулирование: обязательная сертификация, независимое финансирование оценщиков и требования к раскрытию результатов. Примеры таких подходов обсуждаются в ЕС и США, но пока не приняты в полном объёме.