← Все статьи
Новости11 мин чтения

API key Groq и первый запрос: как измерить задержку бесплатного прототипа

Как проверить, годится ли бесплатный Groq для интерактивного демо: создание ключа, первый запрос по документации и измерение распределения задержек ограниченной серии.

Обложка статьи: API key Groq и первый запрос: как измерить задержку бесплатного прототипа

Через поиск «api key groq» до рабочего ключа в консоли Groq — пять минут. Первый вызов API отвечает почти мгновенно, и это мгновение легко принять за готовый вердикт: раз ответило быстро, значит free tier годится под интерактивное демо. Вердикт преждевременный. Один удачный запрос ничего не говорит о том, сколько будет ждать реальный пользователь в сотом или двадцатом обращении: для прототипа важен не рекордный минимум, а то, насколько широко расходится время ответа в серии одинаковых запросов.

Это и есть тезис, который стоит проверять руками, а не угадывать: пригодность бесплатного тарифа Groq для интерактивного демо определяется распределением задержек и статусов ограниченной серии, а не единичным удачным ответом. Если демо позже уйдёт в прод, тот же клиентский вызов можно будет направить на платный маршрут через provod.ai (российский аналог OpenRouter), не смешивая его условия с бесплатным тарифом Groq. Но сначала — измерение.

Платите в рублях за AI-модели без наценки на токены через provod.ai

Почему один быстрый ответ обманывает

Groq продаёт скорость как главное продуктовое обещание. Но скорость становится свойством твоего продукта только тогда, когда она стабильна на серии запросов, а не в одном удачном прогоне. Пользователь интерактивного демо не видит медиану: он видит конкретное ожидание своего собственного запроса, и если в серии из двадцати вызовов один растянулся, именно этот случай формирует впечатление о продукте.

Groq описывает режим обслуживания по умолчанию (on_demand) только качественно: «предсказуемо высокие скорости... с редкой очередью-задержкой в пиковые моменты» (Groq, GroqDocs, service tiers, доступ 2026-07-18). Ни числа, ни перцентиля, ни SLA для бесплатного тарифа документация не публикует. Значит, единственный честный способ узнать разброс — снять его самому на своей дате, а не выводить из маркетингового текста.

Отсюда рабочее правило на всю статью. Ограниченная серия измеряет только наблюдаемое распределение времени и статусов, она не устанавливает SLA, не считает квоту под нагрузкой и не переносится на платный маршрут. Всё, что она даёт — ответ на один узкий вопрос: укладывается ли ожидание в заранее объявленный порог конкретного демо.

Как получить ключ и не потерять его

Ключ создаётся в консоли: заходишь на console.groq.com/keys и нажимаешь Create API Key — буквально то, что ищут как create api key groq. Название придумываешь сам. Значение показывается целиком один раз, сразу после создания, дальше в интерфейсе виден только префикс. В поиске этот же ключ называют по-разному в зависимости от того, что подчёркивает запрос: console groq api key — потому что ключ создаётся и виден именно в консоли console.groq.com/keys, а groq cloud api key — потому что сервис часто называют облачной платформой Groq. По сути это и есть просто groq api key: одна строка, которую нельзя посмотреть повторно, только перевыпустить.

Официальное имя сервиса — Groq Cloud API, но в поиске к нему часто добавляют лишнее слово, отсюда варианты groq ai api и groq ai api key, хотя отдельного продукта «Groq AI» не существует. По-русски тот же смысл иногда пишут как groq api api ключ, смешивая английский термин и русское слово: это не опечатка про другой сервис, а транслитерация того же самого ключа.

Groq в своём quickstart рекомендует не хардкодить ключ, а хранить его в переменной окружения GROQ_API_KEY и подставлять в официальные SDK для Python или TypeScript (Groq, GroqDocs, quickstart, доступ 2026-07-18). Практический смысл простой: демо переживёт публикацию репозитория без утечки, а серию замеров ты запустишь одной командой, не редактируя код.

Бесплатный доступ (groq api key free, по-русски groq api бесплатно) не требует карты и не берёт плату за токены. Но у него есть потолок, выраженный не одним числом, а сразу несколькими. Лимиты free tier применяются на уровне организации, а не отдельного ключа — это важно, если тебе нужно несколько groq api keys (или api keys groq во множественном числе) для разных окружений, скажем, отдельного для локальной разработки и отдельного для демо перед инвестором. Второй ключ не даёт второй квоты: лимит общий на все ключи организации и измеряется в четырёх единицах сразу. Для модели Llama 3.1 8B Instant документация фиксирует 30 RPM, 14 400 RPD, 6 000 TPM и 500 000 TPD (Groq, GroqDocs, rate limits, доступ 2026-07-18). Троттлинг наступает по тому лимиту, который упрёшься первым: тридцать коротких запросов за минуту отрежут тебя по счётчику запросов, даже если токенный бюджет почти нетронут.

Вопрос «как получить api key groq в россии» решается тем же путём, что и везде: ключ создаётся в той же общей консоли, без отдельной региональной формы регистрации. Доступность самой регистрации и обязанности по экспортному контролю определяет Groq в своих условиях обслуживания, и это стоит проверять прямо на странице регистрации, а не считать заранее решённым вопросом. Платёжные и региональные вопросы всплывают позже — если и когда демо перерастёт в платный маршрут.

Четыре единицы лимита free tier Groq для Llama 3.1 8B Instant: 30 RPM, 14400 RPD, 6000 TPM, 500000 TPD

Как выглядит первый запрос

Документированный паттерн первого запроса у Groq короткий: аутентификация через Groq(api_key=...) и один синхронный вызов client.chat.completions.create(...) к чат-модели (в примере документации — llama-3.3-70b-versatile). Это ровно та же форма, которую повторит серия идентичных запросов, только в цикле. Некоторые ищут это как groq api key verity, имея в виду проверку — verify — что ключ действительно работает: для этого и нужен первый тестовый вызов.

import os from groq import Groq

client = Groq(api\_key=os.environ["GROQ\_API\_KEY"])

resp = client.chat.completions.create( model="llama-3.3-70b-versatile", messages=[{"role": "user", "content": "Ответь одним словом: ок"}], ) print(resp.choices[0].message.content)

Второй путь — совместимый с OpenAI эндпоинт по адресу https://api.groq.com/openai/v1 — тот же адрес ищут и как https api groq com openai v1. Берёшь клиент OpenAI, меняешь ключ и base_url — и работаешь тем же кодом.

from openai import OpenAI

client = OpenAI( api\_key=os.environ["GROQ\_API\_KEY"], base\_url="https://api.groq.com/openai/v1", )

У совместимого режима есть документированные пробелы, и о них лучше знать до замеров, а не во время. Groq перечисляет: logprobs, logit_bias, top_logprobs не поддерживаются, n обязан равняться 1, messages[].name не поддерживается, а temperature со значением 0 молча переписывается в 1e-8 (Groq, GroqDocs, OpenAI compatibility, доступ 2026-07-18). Последнее коварно тем, что не бросает ошибку: ты думаешь, что запросы детерминированы, а на деле нет, и это способно исказить вывод, если ты сравниваешь ответы в серии.

Таблица ограничений OpenAI-совместимого режима Groq: неподдерживаемые logprobs, logit_bias, top_logprobs, name; n равен 1; temperature 0 переписывается в 1e-8

Как измерить распределение, а не минимум

Теперь сама серия. План минимальный и осознанно скучный: один и тот же обезличенный короткий запрос, фиксированное число прогонов, запись времени ответа и HTTP-статуса на каждый вызов. Обезличенный означает отсутствие персональных данных в промпте, одинаковый означает отсутствие вариаций между прогонами — иначе ты измеряешь не задержку, а разные задачи. Пауза между вызовами держит тебя ниже 30 RPM, чтобы серия проверяла задержку, а не троттлинг.

import os, time from groq import Groq

client = Groq(api\_key=os.environ["GROQ\_API\_KEY"]) PROMPT = "Ответь одним словом: ок" N = 20

for i in range(N): t0 = time.perf\_counter() status = "200" try: client.chat.completions.create( model="llama-3.3-70b-versatile", messages=[{"role": "user", "content": PROMPT}], ) except Exception as e: status = getattr(e, "status\_code", type(e).**name**) dt = round((time.perf\_counter() - t0) \* 1000) print(i, dt, status) time.sleep(2.5)  # \~24 запроса в минуту, ниже лимита 30 RPM

Статус здесь так же важен, как время. Если лимит превышен, Groq возвращает HTTP 429 Too Many Requests, и в ответе, по документации, приходят заголовки с остатком квоты и временем сброса. В интерактивном демо 429 — это не «медленно», это «пользователь вообще не получил ответ», и в таблице он должен стоять отдельной категорией, а не растворяться в средней задержке.

Артефакт, ради которого всё затевалось: таблица распределения. Числа в такой таблице всегда будут датированы — сама документация Groq оговаривает, что лимиты по моделям могут измениться, так что дата замера часть результата, а не формальность. На момент написания этой заметки заполненной таблицы с реальными миллисекундами нет и быть не может: её строит тот, кто запускает серию на своей дате. Ниже — только схема с минимальным набором полей: номер прогона, одинаковый запрос, время ответа в мс, HTTP-статус. Из заполненной таблицы читают не среднее, а разброс: где минимум, где хвост, сколько статусов не равно 200.

Схема метода: одинаковый запрос, замер времени и статуса, повтор N раз, профиль распределения; пустой шаблон таблицы без чисел

Что делать с полученным профилем

Порог объявляй до запуска, не после. Для интерактивного демо это выглядит так: «ответ должен приходить не дольше X мс в такой-то доле прогонов, и доля не-200 статусов не выше Y». Числа X и Y свои для каждого сценария: чат-подсказка терпит одно ожидание, живой автокомплит совсем другое. Важно, что порог зафиксирован заранее, иначе результат подгоняется под то, что получилось.

Дальше решение бинарное. Если распределение времени и статусов укладывается в объявленный порог, бесплатный тариф остаётся кандидатом, но только для этого демо и только на дату замера. Если не укладывается: либо сужаешь сценарий демо, либо меняешь маршрут. Третьего варианта «в среднем нормально» тут нет, потому что среднее и было той ловушкой, из-за которой один быстрый ответ выглядел доказательством.

Чего профиль не даёт — тоже стоит проговорить прямо. Он не превращается в SLA: Groq его не публикует для free tier, и назначать его извне некорректно. Он не считает мощность под рабочей нагрузкой: серия из двадцати неспешных запросов и продакшн с параллельными пользователями разные вещи. И он не переносится на другой тариф или другого провайдера: условия бесплатного Groq остаются условиями бесплатного Groq.

Чем платный маршрут отличается от бесплатного

Groq сам проводит границу между режимами. По официальному анонсу Developer Tier (Groq, объявление от 10 февраля 2025, Developer Tier, проверено 2026-07-18) добавление карты и переход на pay-as-you-go поднимает лимиты «до 10x» относительно бесплатного тарифа и открывает доступ к Batch API со скидкой. Это прямо означает, что бесплатная ёмкость — отдельный, более низкий по потолку режим, и любой платный маршрут, в том числе сторонний, живёт по своим правилам. Переносить сюда цифры free tier нельзя.

Если демо проходит порог и разговор заходит о выводе в прод из России, тот же клиентский код можно направить на другой платный маршрут — provod.ai: оплата рублёвым балансом картой, СБП или счётом без иностранной карты и VPN, а цены на модели по официальным ценам провайдеров, без наценки сверху. Условия Groq free tier это не отменяет: это два разных маршрута, а не один общий тариф.

from openai import OpenAI

client = OpenAI( api\_key=os.environ["PROVOD\_API\_KEY"], base\_url="https://api.provod.ai/v1", )
Сравнение режимов Groq: free tier без карты с базой 30 RPM и режимом on_demand против платного Developer Tier с лимитами до 10x и Batch API

Итог: заведи ключ через console.groq.com/keys, положи его в GROQ_API_KEY, объяви порог демо в цифрах и прогони короткую серию идентичных запросов. Решение принимай по её распределению, а не по одному быстрому ответу — это измерение прототипной задержки, а не расчёт производственной мощности, и путать их самая дорогая ошибка на этом этапе.

provod.ai - платный маршрут для того же клиентского кода: один API, совместимый с OpenAI и Anthropic, рублёвый баланс без наценки

provod.ai — единая точка для retrieval и генерации

Не разделяйте RAG-пайплайн между несовместимыми кабинетами: эмбеддинги, поиск и генерация ответа подключаются через общий контур, а модель можно менять без новой платёжной интеграции.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Единая точка доступа не скрывает экономику компонентов: стоимость каждого вызова соответствует официальному тарифу 1:1, без маржи provod.ai.

Соберите RAG на едином балансе: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

Источники

  • Groq (GroqDocs), лимиты тарифов, доступ 2026-07-18: console.groq.com/docs/rate-limits — структура и единицы лимитов free tier, поведение 429.
  • Groq (GroqDocs), quickstart, доступ 2026-07-18: console.groq.com/docs/quickstart — создание ключа, переменная GROQ_API_KEY, паттерн первого запроса.
  • Groq (GroqDocs), OpenAI-совместимость, доступ 2026-07-18: console.groq.com/docs/openai — base URL и ограничения параметров.
  • Groq (GroqDocs), service tiers, доступ 2026-07-18: console.groq.com/docs/service-tiers — качественное описание режима on_demand.
  • Groq, Developer Tier announcement (10 февраля 2025), доступ 2026-07-18: groq.com/blog/developer-tier-now-available-on-groqcloud — условия платного тарифа и «до 10x».