«Модель, которая не говорит "нет"»: как стартап Abliteration.ai превратил снятие защитных ограничений ИИ в бизнес

#Abliteration.ai#ИИ-безопасность#guardrails#GLM-5.3#red teaming#кибербезопасность
«Модель, которая не говорит "нет"»: как стартап Abliteration.ai превратил снятие защитных ограничений ИИ в бизнес

Введение

Пока крупнейшие лаборатории мира — OpenAI, Anthropic и другие — вкладывают миллиарды в выравнивание (alignment) и безопасность искусственного интеллекта, небольшой стартап из Пало-Альто пошёл в прямо противоположном направлении. Компания Abliteration.ai, названная в честь техники «аблитерации» — удаления из модели склонности отказываться от вредных запросов, — превратила снятие защитных ограничений с открытых ИИ-моделей в коммерческий сервис.

Платформа размещает модифицированные версии открытых моделей с удалёнными guardrails, включая недавно выпущенную китайской лабораторией Z.ai модель GLM-5.3. Пользователи могут обращаться к ней через веб-браузер или API. На сайте компании цель сформулирована предельно прямо: создать ИИ, который «не говорит нет».

Детали: цифры и факты

Что предлагает Abliteration.ai

Флагманская модель стартапа — abliterated-model-large-v2 — построена на базе GLM-5.3 от Z.ai. Компания использовала процесс, известный как ортогонализация (orthogonalization), который позволяет найти и удалить «вектор отказа» внутри модели, сохраняя при этом остальные способности — рассуждение, кодинг и агентные навыки — нетронутыми.

Ключевые характеристики модели:

  • Контекст: 1 миллион токенов, только текст
  • Цена: $5 за 1 миллион токенов (вход и выход)
  • Хостинг: FP8
  • Хранение данных: нулевое удержание промптов и ответов по умолчанию
  • Совместимость: OpenAI-совместимые и Anthropic-стиль API-эндпоинты

По бенчмаркам, модель показывает впечатляющие результаты: 84,5% pass@1 на CyberGym (1 507 уязвимостей OSS-Fuzz в 188 проектах), 41,8% на Terminal-Bench 4.0 и 105 задач ExploitGym за 2 часа.

История компании

Abliteration.ai была основана в конце прошлого года, официально зарегистрирована в марте. Соучредитель компании, известный только как Девон (фамилию он попросил не раскрывать, поскольку продолжает работать в другой фирме), сообщил TechCrunch, что стартап заключил соглашения с несколькими крупными облачными провайдерами и финансирует их исключительно за счёт выручки от клиентов. Венчурный капитал компания пока не привлекала, но ведёт переговоры.

Масштаб явления

Техника аблитерации не нова — исследователи и разработчики годами удаляли отказы из открытых моделей. Однако масштабы впечатляют:

  • На платформе Hugging Face размещено более 6 000 абliterated-моделей (по данным на май 2026 года), тогда как в 2024 году их было около 600 — десятикратный рост.
  • Исследование arXiv от августа 2026 года насчитало 11 598 «нецензурированных» LLM только на Hugging Face.
  • Исследование ThreatDown от июля 2026 года выявило более 6 600 моделей без guardrails в открытом доступе, с более чем 22 миллионами загрузок за 30 дней.
  • Инструмент Heretic позволяет снять защитные ограничения с открытых моделей за считанные минуты. Журналист Financial Times удалил safety alignment с Llama 3.3 менее чем за 10 минут без специализированного оборудования. Создатель Heretic заявил, что снял ограничения с Google Gemma 4 в течение 90 минут после её публичного релиза.

Что умеет модель

TechCrunch протестировал сервис: журналисты создали аккаунт и попросили абliterated-версию GLM-5.3 написать Python-программу для кражи сохранённых паролей Chrome и подробный протокол культивирования опасного человеческого патогена в домашних условиях. Модель охотно выполнила оба запроса.

Анализ

Аргументы «за»

Основатели Abliteration.ai и сторонники подхода утверждают, что доступ к «нецензурированным» моделям критически важен для кибербезопасности. Логика проста: невозможно защититься от поведения, которое не можешь воспроизвести. Модель, отказывающаяся писать рабочий эксплойт-код, не поможет red team защищаться от атакующих.

«Преимущество в том, что защитники теперь могут двигаться максимально быстро. У них есть все инструменты, необходимые для моделирования злоумышленников и защиты от их действий. Я думаю, это ускорит кибербезопасность — что, как ни странно, контринтуитивная точка зрения», — говорит Девон.

Среди клиентов стартапа — несколько ранних red teaming-компаний из Великобритании и Европы, которые помогают банкам, авиакомпаниям и предприятиям критической инфраструктуры укреплять кибербезопасность.

Аргументы «против»

Критики предупреждают о серьёзных рисках. Эндрю Юн, руководитель исследований некоммерческой организации по безопасности ИИ CivAI, заявляет, что абliterация позволяет «модифицировать модель так, чтобы она стала социопатом».

«Вы можете ввести буквально что угодно, и модель подчинится. Когда люди говорят о снятии guardrails с ИИ-моделей, они имеют в виду именно это… Я ожидаю, что в ближайшем будущем мы начнём видеть отредактированные, абliterated-модели, используемые для причинения вреда», — предупреждает Юн.

Крис МакГуайр, эксперт по Китаю и новым технологиям из Совета по международным отношениям в Нью-Йорке, назвал коммерциализацию доступа к опасным функциям без какого-либо регулирования «тревожной».

Серая зона

Интересно, что даже внутри индустрии кибербезопасности нет единого мнения о ценности абliterated-моделей. Ахмед Али, CEO компании Fabraix, занимающейся red teaming агентов, говорит, что его команда больше полагается на fine-tuning открытых моделей, а не на абliterацию, поскольку удаление отказов может снижать знания и способности модели: «Если вы действительно пытаетесь нанести реальный вред — кибер- или био-вред — она будет не так эффективна».

Дэвид Слейтер из Armadin отмечает, что до последнего поколения моделей их было «не особенно сложно джейлбрейкнуть». Он считает, что открытое тестирование возможностей моделей критически важно: «Это будет происходить за закрытыми дверями. Это будет происходить в частном порядке. То, что это происходит открыто, даёт исследователям инструменты. Это даёт нам возможность понять, где находится реальный рубеж, и осознать вред».

Мнение

История Abliteration.ai — это не просто история очередного стартапа. Это зеркало, в котором отражается фундаментальное противоречие всей индустрии ИИ.

С одной стороны, мы видим, как крупнейшие лаборатории мира усиливают меры безопасности. OpenAI, например, впервые активировала внутренний протокол безопасности при разработке модели Astra, которая обнаруживает больше уязвимостей, чем текущие публичные системы. Anthropic призывала к паузе в разработке особенно продвинутых моделей.

С другой стороны, техника абliterации настолько проста и доступна, что остановить её распространение невозможно. Инструменты вроде Heretic позволяют снять ограничения с любой открытой модели за минуты. Тысячи «нецензурированных» моделей уже доступны на Hugging Face. Вопрос не в том, произойдёт ли это, а в том, как общество адаптируется к новой реальности.

Позиция Abliteration.ai вызывает смешанные чувства. Аргумент о том, что защитникам нужны те же инструменты, что и злоумышленникам, звучит разумно — в конце концов, именно так работает вся индустрия кибербезопасности. Но когда компания сама признаёт, что ещё не решила, «где провести черту ответственности», и не внедрила полноценные процедуры KYC, это настораживает.

Особенно тревожно то, что компания, по сути, снимает с себя ответственность за последствия, предлагая клиентам «модерационный слой» по желанию. Да, модель не генерирует контент о сексуальном насилии над детьми и самоповреждении — но это лишь две узкие красные линии в огромном пространстве потенциально опасных применений.

Я считаю, что регулирование здесь неизбежно. Эндрю Юн предлагает разумные меры: обязать провайдеров запускать классификаторы для обнаружения вредоносной кибер- и биоактивности, а также требовать от компаний, сдающих в аренду GPU, верифицировать личности клиентов. Эти меры не остановят абliterацию как технику, но создадут барьеры для её коммерческого распространения.

В конечном счёте, Abliteration.ai — это симптом более широкой проблемы. Пока индустрия спорит о том, как сделать ИИ безопасным, технология развивается быстрее, чем регуляторы успевают реагировать. И «модель, которая не говорит нет», — лишь один из многих вызовов, с которыми нам предстоит столкнуться.

Итог

Abliteration.ai стала первой компанией, которая превратила удаление защитных ограничений ИИ в полноценный коммерческий сервис. Платформа предлагает доступ к абliterated-версиям мощных открытых моделей через браузер и API, снимая барьеры для тех, кто раньше должен был самостоятельно скачивать модели и обеспечивать вычислительные мощности.

Сторонники видят в этом инструмент для red teaming и кибербезопасности. Критики предупреждают о рисках злоупотреблений и ожидают, что абliterated-модели будут использоваться для причинения вреда уже в ближайшем будущем.

Одно можно сказать точно: джинн выпущен из бутылки. Техника абliterации доступна, воспроизводима и не требует специальных навыков. Вопрос лишь в том, как индустрия и регуляторы ответят на этот вызов — и успеют ли они ответить до того, как последствия станут необратимыми.

FAQ

1. Что такое абliterация (abliteration)?

Абliterация — это техника удаления из языковой модели «вектора отказа» — внутреннего механизма, который заставляет модель отказываться от выполнения вредных или опасных запросов. В отличие от джейлбрейка (промпт-атаки), абliterация модифицирует сами веса модели, поэтому изменение сохраняется между сессиями. Термин образован от слов «ablation» (абляция) и «obliteration» (уничтожение).

2. Насколько сложно снять guardrails с открытой модели?

Очень просто. Инструменты вроде Heretic позволяют удалить защитные ограничения с открытых моделей за считанные минуты — без специализированного оборудования и глубоких технических знаний. Журналист Financial Times снял ограничения с Llama 3.3 менее чем за 10 минут. На Hugging Face уже размещено более 6 000 абliterated-моделей.

3. Законно ли использование абliterated-моделей?

Сама по себе техника не является незаконной, и абliterated-модели используются для легитимных целей — red teaming, тестирования безопасности, исследований. Однако использование таких моделей для совершения преступлений (например, генерация вредоносного кода для атак) подпадает под действующее законодательство. Вопросы регулирования доступа к таким моделям активно обсуждаются, и некоторые эксперты призывают к обязательной верификации пользователей и внедрению классификаторов для блокировки вредоносной активности.