OpenAI представляет «Ultrafast»: новый режим разгоняет GPT-5.6 Sol в 14 раз
В ночь на 14 августа 2026 года OpenAI совместно с чипмейкером Cerebras официально представила новый сервисный уровень Ultrafast для своего флагманского фронтир-модели GPT-5.6 Sol. Режим позволяет разогнать вывод модели до 750 выходных токенов в секунду — это до 14 раз быстрее стандартной обработки, без какого-либо снижения качества. Для индустрии, где последние годы шла гонка исключительно за «интеллект» моделей, это первый серьёзный сигнал о том, что следующим полем битвы становится скорость.
Это не просто очередное улучшение производительности. Ultrafast меняет саму экономику использования фронтир-моделей: задачи, которые раньше требовали перехода на меньшие и более слабые модели ради скорости, теперь можно выполнять на самом мощном «мозге» OpenAI в реальном времени. Разберём, что именно анонсировано, как это работает технически и что значит для рынка.
Что такое Ultrafast и почему это важно
До сих пор разработчикам и бизнесу приходилось выбирать между двумя крайностями: либо максимальный интеллект фронтир-модели, но с заметной задержкой ответа, либо высокая скорость, но на меньших и менее способных моделях. Ultrafast впервые снимает этот компромисс — он даёт полный интеллект GPT-5.6 Sol на скоростях, пригодных для задач, где «каждая секунда на счету».
По данным OpenAI, Ultrafast запускается первым делом в OpenAI API и работает на инфраструктуре Cerebras. В предварительном доступе режим уже тестируют первые корпоративные клиенты в таких сферах, как кодинг, коммерция, финансовые исследования, поддержка и другие интерактивные приложения.
Ключевые сценарии, которые OpenAI называет приоритетными:
- Реагирование на инциденты и надёжность — анализ логов приложений, недавних изменений кода и отчётов инженеров прямо во время сбоя, чтобы подготовить исправление, пока отказ ещё разворачивается.
- Финансовые исследования и безопасность — анализ рыночных сигналов, оценка транзакций и выявление подозрительной активности в условиях быстро меняющейся конъюнктуры.
- Поддержка клиентов и голосовые сервисы — решение сложных вопросов в реальном времени, не прерывая разговор.
- Коммерция — ответы на вопросы о товарах, проверка остатков, персональные рекомендации и решение проблем на кассе, пока покупатель ещё не отказался от корзины.
- Живые исследования и эксперименты — превращение задач, которые раньше занимали ночь, в интерактивную рабочую сессию с несколькими итерациями в течение дня.
Технические детали: как достигнута скорость 750 токенов/с
Секрет Ultrafast — не в самой модели, а в аппаратной архитектуре Cerebras. Традиционные GPU-кластеры при автогрессивной генерации токенов упираются в узкое место пропускной способности памяти: веса модели приходится постоянно перекачивать между чипом и внешней памятью (HBM), а при многокарточном разбиении добавляются задержки межчиповой коммуникации (PCIe/NVLink).
Cerebras решает эту проблему радикально иначе — с помощью архитектуры Wafer-Scale Engine (WSE). Каждый чип размером с обеденную тарелку несёт на себе 44 ГБ сверхбыстрой SRAM-памяти. Веса модели остаются на чипе, и токены «протекают» через слои модели, конвейерно распределённые по нескольким пластинам, без постоянной перекачки данных извне.
Технические характеристики чипа WSE-3, на котором работает Ultrafast:
| Параметр | Значение |
|---|---|
| Транзисторы | 4 триллиона |
| Пиковая вычислительная мощность | 125 петафлопс |
| Встроенная SRAM-память | 44 ГБ на чип |
| Скорость вывода GPT-5.6 Sol | до 750 токенов/с |
| Ускорение vs Standard | до 14× |
Поскольку общий размер параметров GPT-5.6 Sol превышает ёмкость одного чипа, Cerebras использует механизм «Pipelined across wafers»: каждый слой модели размещается на отдельной пластине, а параметры слоя постоянно находятся в SRAM своего чипа. Это обеспечивает бесшовную конвейерную передачу токенов между пластинами.
Сравнение с конкурентами: цифры говорят сами за себя
OpenAI и Cerebras приводят впечатляющие сравнительные данные. По замерам скорости вывода, опубликованным Artificial Analysis, GPT-5.6 Sol в режиме Ultrafast работает в 5 раз быстрее, чем Claude Opus 4.8 в Fast-режиме, и в 11 раз быстрее, чем Claude Fable 5.
| Модель | Скорость вывода (отн.) |
|---|---|
| GPT-5.6 Sol Ultrafast | 750 токенов/с (база) |
| Claude Opus 4.8 (Fast) | ~5× медленнее |
| Claude Fable 5 | ~11× медленнее |
Ещё более показательны бенчмарки на реальной «экономически ценной» работе. На тесте Humanity's Last Exam (HLE) — 2500 вопросов уровня PhD по химии, экономике и литературе — GPT-5.6 Sol в Ultrafast-режиме ответил на весь набор за 11 часов 11 минут. Для сравнения, Claude Fable 5 потребовалось 78 часов 27 минут (более трёх дней непрерывных вычислений) для достижения сопоставимой точности. Итог — ускорение почти в 7 раз без потери качества.
На бенчмарке GDP-Val, измеряющем задачи экономически ценной работы (юридические документы, финансовые модели, инженерные отчёты), Ultrafast дал 5,6-кратное сквозное ускорение без какого-либо ухудшения качества.
Рыночный контекст: ставка на скорость как конкурентное преимущество
Анонс Ultrafast — это не изолированное событие, а часть более широкой стратегии OpenAI по смещению акцента с «просто умных» моделей на «умные и быстрые». В июне 2026 года OpenAI представила семейство GPT-5.6 из трёх моделей: флагманскую Sol, сбалансированную Terra и скоростную бюджетную Luna. Полное семейство стало широко доступно в июле — через ChatGPT, Codex и API.
Примечательно, что 30 июля 2026 года OpenAI уже вводила Fast mode в API (заменив прежний Priority Processing), который для GPT-5.6 Sol давал ускорение до 2,5× при удвоении цены. Ultrafast — это следующий, гораздо более радикальный шаг: 14× вместо 2,5×.
Одновременно OpenAI снизила цены на младшие модели семейства: Luna подешевела на 80%, Terra — на 20%. Это создаёт чёткую ценовую лестницу: Luna для массовых высокообъёмных задач, Terra для повседневной работы, Sol для фронтир-задач, а теперь ещё и Sol Ultrafast для задач, где критична скорость.
Для Cerebras этот анонс — важный момент. Компания вышла на биржу (NASDAQ: CBRS) в мае 2026 года и заключила многолетнее соглашение с OpenAI на 750 мегаватт вычислительных мощностей стоимостью более $20 млрд. Однако 12 августа 2026 года акции Cerebras обрушились примерно на 16% после публикации квартальной отчётности: выручка в $180,1 млн выросла на 74% год к году, но не дотянула до ожидаемых $194 млн и упала на 7% последовательно, а скорректированный убыток в $2,98 на акцию оказался в разы хуже прогноза. После новости о партнёрстве с OpenAI по Ultrafast акции частично восстановились, отойдя от минимумов.
Перспективы: что дальше
Сейчас Ultrafast доступен в ограниченном предварительном доступе для избранной группы клиентов. OpenAI и Cerebras подчёркивают, что будут расширять доступ по мере роста мощностей. Бизнес может записаться в лист ожидания, указав свой рабочий профиль, требования к задержке и ожидаемый объём использования.
Ключевые вопросы, которые будут определять дальнейшее развитие:
- Расширение на другие модели. В AI-сообществе уже активно обсуждают, когда Ultrafast появится для Luna и Terra. Единственный вопрос — хватит ли у Cerebras чипов для поддержки такого спроса.
- Ценообразование. OpenAI пока не раскрыла цену Ultrafast-режима. Учитывая, что Fast mode стоит вдвое дороже Standard, Ultrafast с его 14-кратным ускорением, вероятно, будет иметь существенную премию. Это станет ключевым фактором для экономики внедрения.
- Влияние на конкурентов. Анонс оказывает давление на Anthropic и других игроков, которые пока не могут предложить сопоставимую скорость на фронтир-моделях. Если Ultrafast подтвердит свою надёжность в продакшене, OpenAI получит устойчивое конкурентное преимущество в сегменте «скорость + интеллект».
Итог: стоит ли использовать
Для бизнеса, который работает с фронтир-моделями в задачах, чувствительных к задержке, Ultrafast — это потенциально значимый шаг вперёд. Возможность выполнять сложные задачи на самом мощном «мозге» OpenAI в реальном времени открывает сценарии, которые раньше были невозможны: реагирование на инциденты в моменте, живая финансовая аналитика, голосовая поддержка с фронтир-интеллектом.
Однако есть важные оговорки. Во-первых, режим пока доступен лишь ограниченному кругу клиентов в предварительном доступе. Во-вторых, цена не раскрыта, и премия за 14-кратное ускорение может оказаться существенной. В-третьих, стоит помнить о волатильности Cerebras как поставщика инфраструктуры — компания только недавно вышла на биржу и демонстрирует «неровные» кварталы.
Вердикт: для компаний с задачами, где скорость критична и оправдывает премию, Ultrafast стоит внимательно изучить и записаться в лист ожидания. Для остальных — это сигнал о том, куда движется индустрия: следующий этап конкуренции в ИИ будет определяться не только интеллектом, но и скоростью. Следите за развитием событий — расширение доступа и ценообразование станут ключевыми индикаторами.
FAQ
Вопрос: Чем Ultrafast отличается от Fast mode, который OpenAI ввела в июле 2026 года?
Fast mode (введён 30 июля 2026 года) даёт ускорение до 2,5× для GPT-5.6 Sol при удвоении цены. Ultrafast — это принципиально другой, более радикальный уровень: до 14× ускорения (750 токенов/с) за счёт аппаратной инфраструктуры Cerebras. Fast mode работает на обычной инфраструктуре OpenAI, тогда как Ultrafast требует специализированных чипов Cerebras WSE.
Вопрос: Снижает ли Ultrafast качество ответов модели?
Нет. По заявлениям OpenAI и Cerebras, Ultrafast работает с той же интеллектуальной мощностью, что и GPT-5.6 Sol в Standard-режиме, без какого-либо ухудшения качества. На бенчмарке GDP-Val ускорение в 5,6 раза достигнуто без потери качества, а на HLE — сопоставимая точность при ускорении почти в 7 раз.
Вопрос: Когда Ultrafast станет доступен широкой публике и сколько будет стоить?
Точные сроки и цена пока не объявлены. Сейчас режим доступен ограниченному кругу клиентов в предварительном доступе. OpenAI и Cerebras заявляют, что будут расширять доступ по мере роста мощностей. Бизнес может записаться в лист ожидания на сайтах обеих компаний. Цена, вероятно, будет включать существенную премию к Standard-режиму, учитывая, что даже Fast mode стоит вдвое дороже.