Ошибки, лимиты и биллинг
HTTP-статусы
| Статус | Что проверить |
|---|---|
| 400 | Входные данные, параметры конкретной модели или длину контекста |
| 401 | Наличие и действительность API-ключа |
| 402 | Баланс и резерв под запрошенный лимит токенов |
| 403 | Права models / agents у ключа |
| 404 | ID ресурса, принадлежность вашему аккаунту, ID модели |
| 409 | Лимит активных ключей или получателей вебхуков |
| 413 | Тело запроса превышает 1 МиБ |
| 422 | Схему запроса, неизвестные поля, корректность URL |
| 429 | Лимит запросов или ограничение провайдера; смотрите Retry-After |
| 502 | Ошибку внешнего провайдера |
| 503 | Временное отключение модели или отсутствие настройки шифрования вебхуков |
Ошибки публичного API возвращаются в поле error с message, type, code. Ошибки в открытом SSE-потоке передаются отдельным событием error. Подробности внутренних исключений и ключи провайдеров не возвращаются.
Ограничения
До 20 активных ключей и 5 активных получателей вебхуков на аккаунт. Лимит — 120 аутентифицированных обращений к публичному API в минуту на аккаунт, общий для ключей. При недоступном ограничителе новые обращения отклоняются; это не даёт обходить лимит при аварии Redis.
Текстовый запрос ограничен 200 000 байтами UTF-8 и 128 сообщениями. Максимум ответа — 16 384 токена, по умолчанию 1024; каталог может задавать более низкий предел. Не все параметры поддерживаются каждой моделью. После открытия поток ограничен десятью минутами; установка соединения и обычный ответ — примерно 110 секундами.
Расходы и отмена
До вызова модели резервируется консервативная сумма по входу и максимальному ответу. По завершении записывается фактическая стоимость с наценкой и пересчётом в валюту аккаунта, остаток резерва возвращается. Если окончательная статистика недоступна из-за обрыва, используется оценка токенов. Списание не превышает принятого резерва. Незавершённые резервы после аварии процесса освобождаются фоновым сервисом спустя 30 минут.
Отмена клиентского соединения не гарантирует бесплатность уже выполненной работы провайдера. max_tokens помогает ограничить расход одного запроса; API-ключи не имеют собственного независимого денежного лимита.
Агенты оплачиваются по существующим правилам платформы после выполнения. Для запуска нужен положительный баланс; длительная задача или несколько агентов могут израсходовать его. Прекратите расписания, которые больше не нужны. Удаление записи запуска не является гарантированной отменой вычислений.
Автоматически повторяйте только безопасные чтения. Идемпотентность создания Chat Completions и запусков пока не поддерживается: повтор POST может привести к дополнительному расходу.