Kog выжимает максимум из GPU: 3000 токенов/с

#инференс#GPU#оптимизация#Kog#ИИ-инфраструктура#monokernel
Kog выжимает максимум из GPU: 3000 токенов/с

Full article...

Let me write it out.

Kog выжимает максимум из GPU: 3000 токенов/с

ai

Введение

Пока рынок заворожённо смотрит на Cerebras и её IPO в мае 2026 года, а NVIDIA переводит фокус на Rubin, французский стартап Kog выбрал принципиально иной путь: не строить новые чипы, а выжать максимум из тех GPU, которые уже стоят в дата-центрах. В мае 2026 года компания опубликовала техническое превью Kog Inference Engine (KIE), которое взорвало Hacker News и привлекло 200 реальных бизнес-лидов.

Суть заявки проста и дерзка: на стандартных дата-центровых GPU — AMD MI300X и NVIDIA H200 — Kog демонстрирует 3000 выходных токенов в секунду на один запрос. Для сравнения, типичные значения в индустрии составляют 100–300 токенов/с. Это не маркетинговый слайд: технология работает на открытой модели Laneformer 2B, а инженерные детали расписаны в блоге компании.

Почему это важно именно сейчас? В 2026 году индустрия окончательно перешла из эпохи обучения моделей в эпоху инференса. По данным TrendForce, совокупная вычислительная мощность ИИ-инференса в 2026 году вырастет примерно на 122% в годовом выражении — это более чем вдвое опережает темпы роста сегмента обучения. У крупнейших провайдеров фундаментальных моделей на инференс приходится уже 60–75% всех GPU-часов. Стоимость токена и энергоэффективность стали главными факторами, определяющими валовую маржу и масштабируемость бизнеса.

Технические детали

Что такое monokernel

Ключевая инновация Kog — так называемый monokernel: единая постоянная программа, резидентная в GPU, которая выполняет весь цикл декодирования LLM — от prefill и decode до LM-head сэмплирования и проверки EOS — без возврата к CPU и без запуска нового ядра на каждый токен.

В стандартных стеках (vLLM, SGLang, ROCm/HIP) на каждый токен запускается отдельное ядро, которое платит налог за запуск. Kog количественно оценивает этот налог:

Источник накладных расходовСтоимость за операцию------
Запуск ядра (на каждый этап)~4,5 мксЗадержка HBM при каждом перезапуске загрузки памяти~0,5 мкс
Материализация промежуточных тензоров в HBM>1 мкс

Синхронизация также была перестроена. Вместо счётчиков атомарного прибытия буферы инициализируются значением NaN, а потребители опрашивают их до появления реальных данных. Это снизило задержку синхронизации с ~7,8 мкс до ~0,9 мкс, хотя синхронизация по-прежнему съедает около 35% времени генерации токена.

Цифры производительности

КонфигурацияСкоростьУсловия
8× AMD MI300X3000 токенов/с на запросFP16, batch 1, без спекулятивного декодирования
8× NVIDIA H2002100 токенов/с на запросFP16, batch 1, без спекулятивного декодирования

Важный нюанс: на MI300X скорость 3000 токенов/с означает примерно 36% утилизации пропускной способности памяти. Это подтверждает тезис Kog о том, что при batch size 1 декодирование ограничено пропускной способностью HBM, а не вычислительной мощностью, — и именно «мёртвое время» между ядрами доминирует в задержке.

Архитектура и особенности

  • GEMV вместо GEMM. При batch size 1 векторно-матричное умножение является GEMV, поэтому monokernel использует скалярные/векторные инструкции ALUdot2, а не тензорные ядра. Тензорные ядра окупаются только когда batch заполняет их тайл.
  • Delayed Tensor Parallelism (DTP). All-reduce из attention и FFN откладывается и сворачивается в вычисления более поздних слоёв, поэтому меж-GPU трафик по Infinity Fabric выполняется асинхронно, скрываясь за арифметикой. Это делает жизнеспособным разбиение модели на 8 «полос» по 8 GPU без синхронного коммуникационного барьера.
  • Топология чиплетов. MI300X — это CDNA3-дизайн: 8 вычислительных кристаллов (XCD) с 304 вычислительными блоками (по 38 на XCD), поверх 4 I/O кристаллов (IOD), с 192 ГБ HBM3 и пиковой пропускной способностью ~5,3 ТБ/с. Monokernel осознанно использует 256 из 304 CU и дублирует тензоры на каждый IOD, жертвуя немного памятью ради избежания штрафов кросс-кристального all-reduce.

Модель Laneformer 2B

Демонстрация построена на собственной модели Laneformer 2B — открытой модели с ~2 млрд параметров, предобученной на 6 триллионах токенов на 256 GPU H100. Модель показывает около 50% на HumanEval. Важно понимать: выпущенный чекпоинт полезен как стандартная модель, но основные преимущества по задержке даёт именно KIE и DTP-ориентированный путь исполнения.

Рыночный контекст

Эпоха инференса

Kog вписывается в более широкий тренд, который TrendForce называет «экономикой инференса». Индустрия сместилась от «больших» моделей к «эффективным». Примеры:

  • Cerebras вышла на Nasdaq 14 мая 2026 года, привлекая внимание к специализированным чипам (WSE-3, 44 ГБ SRAM, 21 ПБ/с).
  • Taalas HC1 (февраль 2026) «зашивает» Llama 3.1 8B прямо в чип, достигая 16 960 токенов/с на пользователя при стоимости 0,75 цента за миллион токенов против 3,79 цента у B200.
  • NVIDIA в июле 2026 года раскрыла детали Rubin: Adaptive Compression для KV Cache, Tensor Memory Accelerator, третье поколение Transformer Engine, 50 PFLOPS (NVFP4).

Kog занимает в этом спектре уникальную нишу: в отличие от Taalas, Groq и Cerebras, которые меняют железо, Kog не требует нового оборудования. Это программный путь к той же цели — снижению стоимости токена.

Конкуренты и партнёры

Kog не одинока в мысли, что софт может выжать из GPU больше, чем заявлено на коробке. Французская ZML в июле 2026 года выпустила бесплатный открытый инференс-сервер ZML/LLMD v2, работающий на любом железе (NVIDIA, AMD, Google TPU, Apple Metal, Intel Arc) без переписывания кода. Однако Delalleau подчёркивает, что Kog ближе к лаборатории Hazy Research из Стэнфорда — с ещё более глубоким уровнем фокуса на ускорении GPU.

Отдельного внимания заслуживает контекст OpenAI: в июле 2026 года компания сообщила, что модель GPT-5.6 Sol сама оптимизирует ядро, снижая стоимость сервиса на 20% и повышая эффективность генерации токенов на 15%. Это подтверждает: программная оптимизация инференса — главный фронт конкуренции 2026 года.

Европейский суверенитет

Kog получает сильный политический попутный ветер. Стартап поддерживает Scaleway, а также программы Bpifrance и French Tech 2030. В контексте стремления Европы строить собственную ИИ-инфраструктуру это даёт Kog преимущества в финансировании и видимости.

Перспективы

Главный вызов: масштабирование на LLM

Самый большой разрыв между обещанием и реальностью — переход от 2B-модели к большим языковым моделям. Kog обещает «30-кратное ускорение LLM-инференса», но пока демонстрация построена на специально созданной малой модели. Компания признаёт: потенциальные клиенты не готовы дообучать малые модели, поэтому с момента запуска весь фокус сместился на ускорение более крупных моделей.

CEO Gaël Delalleau планирует в сентябре 2026 года развернуть первую крупную модель на скорости, в 10 раз превышающей текущую, продемонстрировать привлечение клиентов и на этой основе запустить раунд Series A.

Ограничения подхода

  • Ручной труд. Для каждой новой GPU Kog тратит недели или месяцы на глубокое исследование аппаратного обеспечения. При команде из 11 человек это ограничивает число поддерживаемых чипов.
  • Нет независимых бенчмарков. Все цифры — самоотчёт компании. Пока нет сторонней верификации ни 3000 токенов/с на MI300X, ни 2100 на H200.
  • Дорожная карта. Поддержка MoE-моделей, FP8-квантование, спекулятивное декодирование и большие batch size заявлены как планы, но не реализованы.
  • Нет открытого ядра. По состоянию на июнь 2026 года нет ни открытого исходного кода, ни pip-пакета. Технологию можно попробовать только через браузерный playground на playground.kog.ai.

Долгосрочная стратегия

Kog планирует автоматизировать свою методологию через агентные пайплайны, что позволит поддерживать больше чипов и моделей без расширения команды. Если это удастся, подход Kog может стать стандартом для «выжимания» производительности из существующих GPU-активов.

Итог

Стоит ли использовать Kog? Ответ зависит от ваших задач.

Для инженеров и продвинутых пользователей: технология впечатляет, но пока это proof-of-concept на малой модели. Попробовать можно бесплатно через playground, но для продакшена на больших LLM придётся ждать сентябрьского релиза и независимой верификации.

Для бизнеса: тезис Kog — «не GPU плохи, а плохи планировщик и фреймворки» — звучит убедительно в контексте, где инференс уже съедает 60–75% GPU-часов. Если Kog подтвердит 10-кратное ускорение на крупных моделях, это может кардинально изменить экономику ИИ-инфраструктуры, позволив компаниям «оживить» уже оплаченные GPU вместо закупки новых.

Главный риск: отсутствие независимых бенчмарков и узкая демонстрация. Пока это смелая ставка талантливой команды из 11 человек, а не проверенное промышленное решение. Но именно такие ставки в 2026 году переписывают правила игры в экономике инференса.

FAQ

Нужен ли мне AMD MI300X, чтобы попробовать Kog Inference Engine?

Нет. Техническое превью KIE — это браузерный playground на playground.kog.ai, где модель Laneformer 2B работает на собственном кластере Kog из 8× MI300X. Вы взаимодействуете через браузер и наблюдаете скорость генерации токенов в реальном времени — без локального GPU, драйверов и настройки. Собственный MI300X нужен только если вы хотите воспроизвести monokernel в HIP самостоятельно.

Почему monokernel обходит тензорные ядра и использует скалярные/векторные ALU?

При batch size 1 декодирование — это GEMV (матрично-векторное умножение), а не GEMM, поэтому матричные ядра простаивают. Тензорные ядра окупаются только когда batch достаточно велик, чтобы заполнить их тайл. Kog реализует проекцию через скалярные/векторные инструкции ALUdot2, которые быстрее для batch-1 декодирования, где узким местом является пропускная способность HBM, а не вычисления.

Насколько достоверны цифры 3000 токенов/с?

Цифры — самоотчёт Kog, и независимого стороннего бенчмарка пока нет. Первичный блог компании указывает 3000+ токенов/с на 8× MI300X; цифра 3300 токенов/с появилась в обзоре AI Weekly от 29 мая 2026 года как вариант с топологической настройкой. До воспроизведения результатов сторонними командами к точным пиковым значениям стоит относиться с осторожностью.