Запись архива

Французский стартап Kog обещает ускорить инференс LLM в 10 раз на существующих GPU без дообучения моделей

Стартап Kog, вышедший из скрытого режима в мае 2026 года, утверждает, что может кардинально ускорить инференс больших языковых моделей на стандартных датацентровых GPU, таких как AMD MI300X и Nvidia H200. Компания нацелена на агентные рабочие процессы, где скорость генерации становится критическим узким местом, и плани

Серверные графические ускорители Nvidia H200 и AMD MI300X в стойке датацентра, используемые для инференса больших языковых моделей
Серверные графические ускорители Nvidia H200 и AMD MI300X в стойке датацентра, используемые для инференса больших языковых моделей
Imagen destacada del articulo fuente

Французский стартап Kog, дебютировавший с публичной демонстрацией на Hacker News в мае 2026 года, готовится к ключевому рубежу: продемонстрировать десятикратное ускорение инференса на большой языковой модели к сентябрю. Компания утверждает, что стандартные датацентровые GPU — вроде Nvidia H200 и AMD MI300X — способны на гораздо большее, чем принято считать, если подойти к их использованию на уровне физики чипа и ассемблерного кода.

Проблема скорости в агентных сценариях

Одной из главных болевых точек современных агентных пайплайнов становится время генерации. Опытные пользователи инструментов вроде Claude Code регулярно сталкиваются с ожиданием в несколько часов для получения результата. Anthropic, в свою очередь, монетизирует скорость через платный Fast Mode. Kog нацелился именно на этот сегмент: профессионалы, для которых задержки означают прямые потери времени и дохода.

Генеральный директор и единственный основатель Kog Гаэль Делалло отметил, что после майской превью компания получила более 200 коммерческих лидов. Ожидается, что первым массовым сценарием использования станет программная инженерия, однако в портфеле дизайн-партнёров также присутствуют сервисы по генерации игр и приложений с одного промпта — там каждый выигранный в скорости раунд напрямую конвертируется в выручку.

3000 токенов/с на малой модели — но это был тест

Демонстрация Kog показала впечатляющие 3000 токенов в секунду на один запрос. Однако важно понимать контекст: это было достигнуто на специально построенной малой модели Laneformer 2B, которую стартап открыл под лицензией open-source. Критики резонно указали, что перенос такого подхода на модели с десятками и сотнями миллиардов параметров — нетривиальная задача.

Сам Делалло признаёт, что рынок пока не созрел для работы с малыми моделями: потенциальные заказчики не готовы заниматься их дообучением. Именно поэтому после запуска компания полностью сосредоточилась на ускорении больших языковых моделей. «Как только мы реализуем нашу первую крупную модель с десятикратным ускорением, что произойдёт, я думаю, в сентябре, мы сможем начать демонстрировать привлечение клиентов и на этом основании привлечь раунд серии A», — заявил Делалло.

Физика, реверс-инжиниринг и команда из 11 человек

Ключевое отличие подхода Kog — глубина проработки. Делалло имеет бэкграунд в физике твёрдого тела (окончил Политехническую школу Франции) и опыт в наступательной кибербезопасности. Он четырежды выходил в финал CTF-соревнований DEFCON. Этот гибридный опыт сформировал методологию: понимать «законы физики GPU» и реверс-инжинирить их на уровне ассемблерного кода и бинарных инструкций, чтобы заставить чипы работать так, как изначально не предполагалось.

Оборотная сторона такого подхода — высокая трудоёмкость. «Для каждого нового GPU мы будем посвящать несколько недель или даже месяцев детальному изучению оборудования и проведению GPU-инженерных исследований», — поясняет Делалло. При команде в 11 человек это накладывает жёсткие ограничения на количество поддерживаемых чипов. В долгосрочной перспективе стартап надеется автоматизировать процесс через агентные пайплайны, но пока работа остаётся ручной и высококвалифицированной.

Конкуренты и контекст

Kog — не единственный, кто считает, что софтверная оптимизация может выжать из GPU больше заявленного производителем. Другой французский стартап, ZML, выпустил аппаратно-независимое ПО, которое обходит CUDA. Однако Делалло позиционирует Kog ближе к исследовательской лаборатории Hazy Research из Стэнфорда, фокусируясь на ещё более низком уровне.

Косвенным преимуществом для стартапа может стать европейский контекст. Kog уже поддерживается облачным провайдером Scaleway, а также государственными институтами — Bpifrance и программой French Tech 2030. В условиях, когда Европа стремится к суверенитету в области чипов и моделей, такой фокус на глубокую оптимизацию существующего оборудования может получить дополнительную поддержку.

Ключевые факты

Параметр Значение
Продемонстрированная скорость 3000 токенов/с на Laneformer 2B
Целевые GPU Nvidia H200, AMD MI300X
Планируемое ускорение LLM 10x к сентябрю 2026
Команда 11 человек
Финансирование Посевной раунд от Varsity VC, поддержка Bpifrance и French Tech 2030

Почему это важно для читателей Comrad404

Для разработчиков агентов, промпт-инженеров и всех, кто упирается в latency при работе с LLM, Kog предлагает альтернативу покупке новых чипов или миграции в специализированные облака. Если подход подтвердится на моделях уровня 70B+, это изменит экономику агентных пайплайнов: время ожидания ответа сократится с минут до секунд на существующем железе. Однако стоит сохранять здоровый скепсис — пока результаты получены только на малой открытой модели, и ключевой тест ещё впереди.

Источник: TechCrunch — «Kog is going deeper to squeeze more inference out of GPUs» (14 августа 2026) https://techcrunch.com/2026/08/14/kog-is-going-deeper-to-squeeze-more-inference-out-of-gpus/