Groq нейросеть и её технологии¶
Groq — американская технологическая компания, разрабатывающая специализированные аппаратные ускорители (тензорные процессоры) и программное обеспечение для высокоскоростного запуска моделей искусственного интеллекта, включая большие языковые модели. Компания основана в 2016 году в Маунтин-Вью (Калифорния) бывшими инженерами Google Джонатаном Россом и Дугласом Вайтом. Название компании происходит от слова «грог» (grog) — напитка, которым угощали гостей писатели-фантасты на конвенциях, что символизирует скорость и энергию.
¶История и развитие
Компания была основана с целью создания процессора, способного выполнять вычисления для нейронных сетей значительно быстрее, чем традиционные графические процессоры (GPU). В 2020 году Groq представила свой первый коммерческий продукт — тензорный процессор (Tensor Streaming Processor, TSP), который изначально предназначался для задач инференса (запуска уже обученных моделей), а не для обучения.
В начале 2024 года компания привлекла широкое внимание общественности после запуска собственного облачного сервиса GroqCloud, предоставляющего доступ к ускорителям через API. Сервис стал популярен благодаря аномально высокой скорости генерации текста: модели семейства Llama от Meta (признана экстремистской и запрещена в РФ) на оборудовании Groq демонстрировали скорость более 500 токенов в секунду, что в десятки раз превышало показатели традиционных GPU-решений. В августе 2024 года компания привлекла 640 миллионов долларов инвестиций, оценившись в 2,8 миллиарда долларов.
¶Архитектура аппаратного обеспечения
Ключевым продуктом Groq является специализированный процессор TSP, построенный на архитектуре, принципиально отличающейся от GPU и TPU (тензорных процессоров Google). Основные особенности:
- Потоковая обработка данных — процессор работает по принципу потоковой архитектуры, где данные передаются между вычислительными ядрами без обращения к внешней памяти на каждом шаге. Это минимизирует задержки.
- Отсутствие кэш-памяти — в отличие от классических чипов, TSP не имеет многоуровневого кэша. Вместо этого используется огромная статическая память (SRAM) объёмом около 230 МБ, распределённая по чипу, что позволяет хранить веса модели непосредственно на кристалле.
- Детерминированность — архитектура гарантирует фиксированное время выполнения операций, что упрощает прогнозирование производительности и отладку.
- Высокая пропускная способность — чип способен выполнять до 750 терафлопс операций с 8-битными числами (INT8) и около 250 терафлопс с 16-битными числами (FP16).
Каждый чип TSP производится по техпроцессу 14 нм на мощностях компании GlobalFoundries. Для масштабирования несколько чипов объединяются в системные платы (например, в составе вычислительного блока GroqCard), которые устанавливаются в серверы.
¶Программное обеспечение и экосистема
Groq разработала собственный программный стек, включающий компилятор и среду выполнения. Ключевые компоненты:
- GroqCompiler — компилятор, который транслирует модели машинного обучения в машинный код для TSP. Он поддерживает популярные фреймворки: PyTorch, TensorFlow и ONNX.
- Groq API — интерфейс для облачного доступа, совместимый с форматом OpenAI API, что позволяет разработчикам переключаться на сервисы Groq с минимальными изменениями кода.
- GroqCloud — облачная платформа, предоставляющая доступ к моделям с открытым исходным кодом, таким как Llama, Mistral, Gemma и другим. Сервис предлагает бесплатный тариф с ограничениями и платные подписки для коммерческого использования.
Важной особенностью программного обеспечения является отсутствие поддержки обучения моделей — Groq позиционирует свои чипы исключительно как решение для инференса, то есть для выполнения готовых моделей в продакшене.
¶Производительность и сравнение с конкурентами
Основное преимущество Groq — сверхнизкая задержка (латентность) при генерации текста. Если современные GPU, такие как NVIDIA H100, обеспечивают скорость генерации порядка 50–100 токенов в секунду для больших моделей, то решения Groq достигают 300–500 и более токенов в секунду. Это достигается за счёт:
- отсутствия необходимости подгружать веса модели из внешней памяти (они размещаются в SRAM);
- конвейерной архитектуры, при которой вычисления следующего токена начинаются до завершения предыдущего;
- детерминированного планирования, исключающего простои вычислительных ядер.
Однако у архитектуры есть ограничения. Объём SRAM (230 МБ на чип) не позволяет разместить веса современных моделей с сотнями миллиардов параметров на одном чипе, что требует распределения модели между несколькими процессорами и увеличивает сложность системы. Кроме того, Groq уступает GPU в задачах обучения и тонкой настройки моделей.
¶Применение
Основные сценарии использования оборудования и сервисов Groq:
- Чат-боты и ассистенты — благодаря низкой задержке ответа, решения Groq подходят для диалоговых систем реального времени.
- Обработка естественного языка в промышленных масштабах — анализ тональности, извлечение информации, машинный перевод.
- Генерация кода — сервисы автодополнения кода, требующие быстрого отклика.
- Научные вычисления — запуск моделей для обработки данных в реальном времени.
¶Критика и ограничения
Эксперты отмечают несколько проблемных аспектов технологии. Во-первых, высокая скорость достигается на относительно небольших моделях (до 70–100 миллиардов параметров); для самых крупных моделей, таких как GPT-4, требуется кластерное решение, которое может быть экономически неэффективным. Во-вторых, экосистема Groq менее зрелая по сравнению с экосистемой NVIDIA CUDA, что ограничивает переносимость кода. В-третьих, компания зависит от одного производителя чипов (GlobalFoundries) и не имеет собственных производственных мощностей.
¶Перспективы
Компания активно развивает направление аппаратного обеспечения для инференса, которое становится всё более важным по мере роста популярности генеративного ИИ. В 2024–2025 годах Groq анонсировала планы по выпуску новых поколений чипов с увеличенным объёмом памяти и поддержкой более широкого спектра форматов данных. Аналитики прогнозируют, что специализированные инференс-процессоры могут занять существенную долю рынка, однако конкуренция со стороны NVIDIA, AMD и Google остаётся высокой.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →

