Лимит параллельных запросов

Лимит параллельных запросов ограничивает, сколько запросов аккаунт может держать в работе одновременно, — в отличие от лимита частоты, который ограничивает, сколько запросов можно начать за отрезок времени. Их постоянно путают, хотя ограничивают они совершенно разные вещи. Лимит в шестьдесят запросов в минуту легко соблюсти одним запросом в секунду; лимит конкурентности, равный пяти, означает, что сколько бы вы ни ждали между партиями, в любой момент открыто может быть только пять запросов. Для ИИ-нагрузок значение имеет именно конкурентность, потому что запросы к моделям медленные. Обычный API-вызов возвращается за десятки миллисекунд, поэтому даже скромный запас параллельности обеспечивает высокую пропускную способность. Модель, генерирующая длинный ответ, может удерживать соединение много секунд — и тогда низкий потолок конкурентности напрямую задаёт вашу максимальную пропускную способность, как бы щедро ни выглядела поминутная квота. Задача обработки десяти тысяч документов ограничена сочетанием конкурентности и задержки, а поминутный лимит частоты к длительности этой работы часто не имеет отношения. Перед тем как строить решение на инструменте, выясните три вещи. Каков реальный лимит конкурентности на вашем тарифе: он документируется куда менее последовательно, чем лимиты частоты, и иногда обнаруживается только при столкновении с ним. Что происходит при превышении: поставленный в очередь запрос, который в итоге выполнится, — это совсем не то же самое, что мгновенная ошибка, которую ваш код обязан поймать и повторить с экспоненциальной паузой. И на что назначен лимит — на ключ, на аккаунт или на модель: в зависимости от вендора распределение работы по нескольким ключам будет либо законным способом масштабирования, либо нарушением условий использования. Проектируйте пакетную обработку под измеренный, а не предполагаемый потолок конкурентности, а его повышение считайте полноценным коммерческим условием для переговоров.

Похожие термины

Ещё термины: Интеграции