На планете не найдется ни одного ИТ-директора, которого прямо сейчас не беспокоят расходы на ИИ. Финансовые директора тоже становятся всё более нервными.
Из страха отстать многие компании максимально агрессивно подталкивают своих сотрудников к использованию ИИ. Указание было ясным: «Действуйте быстро, со счетом разберемся позже». И по большей части это сработало: ИИ действительно стал преобразующей силой для тех команд, которые включились в процесс.
Но затраты реальны: мы слышали бесчисленное множество историй об огромных счетах и болезненных перерасходах на токены.
Сегодня мы объявляем о контроле расходов в AI Gateway от Cloudflare и о закрытом бета-тестировании бюджетов и маршрутизации на основе идентификации с помощью Cloudflare Access и вашего существующего поставщика идентификационных данных.
В беседах с сотнями компаний об их стратегии в области ИИ мы часто сталкивались с одной и той же историей: компания предоставляет каждому инженеру доступ к передовым моделям через общий ключ API. Использование растет. В конце месяца финансовый отдел получает счет, и никто не может объяснить, куда ушли деньги. Это команда машинного обучения тренировала новый пайплайн? Это стажер запускал Claude Opus для сортировки электронной почты? Или это была失控авшаяся задача непрерывной интеграции, которая за выходные сожгла 50 миллионов токенов? Никто не знает, потому что ключ API не показывает, кто его использовал.
Без руководящих принципов сотрудники обычно выбирают самую большую из доступных моделей. И почему бы и нет? Если нет бюджета, прозрачности и логики маршрутизации, рациональным решением будет использовать самую мощную модель для всего. Проблема в том, что большинству задач не нужна передовая модель. Для сводки рецензии на код не нужна та же модель, что и для сложного рефакторинга архитектуры. Парсеру логов не нужна та же модель, что и генератору контента для клиентов. Должно быть легко выбрать правильный инструмент для задачи, а не по умолчанию использовать самый мощный и дорогой. И должно быть просто видеть, куда уходят расходы.
Вы не можете рассчитать ROI от своих затрат на ИИ без прозрачности того, сколько вы тратите, и вы не можете защитить этот ROI без контроля. Каждая другая статья расходов в бизнесе имеет бюджет и распределение по командам, и расходы на ИИ не должны быть исключением.
Что такое AI Gateway
AI Gateway находится между вашими приложениями и поставщиками ИИ. Вместо прямого вызова OpenAI, Anthropic, Google или любого другого провайдера ваши запросы сначала проходят через AI Gateway.
Это сразу дает вам несколько полезных инструментов:
-
Единый биллинг для легкого переключения между различными провайдерами и моделями
-
Логирование по всем провайдерам — каждый запрос, количество токенов и стоимость в одном месте
-
Кэширование ответов
-
Ограничение скорости
-
Защитные барьеры контента и возможность блокировать личную информацию (PII) и секреты до того, как они попадут в модель
Однако у AI Gateway не было простого способа ответить на вопрос, кто сколько тратит или как можно установить лимиты на расходы ИИ.
Вы могли видеть общее использование по вашему аккаунту. Но вы не могли увидеть, что Джейн из отдела разработки потратила 2000 долларов на Claude в этом месяце, в то время как вся команда по науке о данных использовала только 400 долларов. Вы не могли установить бюджет, который бы гласил: «У разработки — 5000 долларов в месяц на передовые модели, у стажеров — 200 долларов в месяц на Kimi K2.6».
Сегодня это меняется.
Лимиты расходов: бюджеты на использование ИИ
Теперь AI Gateway поддерживает лимиты расходов как основную функцию. Это настоящие меры контроля затрат в виде бюджетов, установленных в долларах, а не токенах, которые отслеживают совокупные расходы по всем запросам, работая независимо от традиционного ограничения скорости.
Вы можете задать лимиты для любой комбинации параметров: модель, провайдер или пользовательские атрибуты, определенные администратором, такие как пользователь, команда или приложение. Окна могут быть фиксированными (сброс первого числа месяца, в понедельник или в полночь) или скользящими, и установлены на день, неделю или месяц.
AI Gateway рассчитывает стоимость каждого запроса на основе ценообразования модели и в реальном времени отслеживает совокупные расходы относительно вашего лимита. Вы можете легко отслеживать расходы на модели на панели аналитики и фильтровать по модели, провайдеру или любому пользовательскому атрибуту.
У вас есть варианты действий при достижении лимита бюджета. По умолчанию AI Gateway будет блокировать дальнейшие запросы. Или вы можете настроить правила через Динамические маршруты, чтобы перенаправлять запросы на резервную модель после достижения лимита расходов, чтобы жесткий лимит не нарушал рабочий процесс ваших инженеров. Мы работаем над добавлением возможности отправлять оповещения при достижении лимита.
Лимиты расходов доступны в открытой бета-версии сегодня для всех пользователей AI Gateway на всех тарифных планах. Настройте их в параметрах шлюза на панели управления или через API.
Мы используем это сами
Мы уже отслеживаем затраты на токены внутри Cloudflare. Каждый сотрудник Cloudflare ежедневно использует инструменты ИИ, пропуская через AI Gateway миллионы запросов и миллиарды токенов в месяц. Мы столкнулись с тем же вопросом, что и любая компания в таком масштабе: кто что использует и как нам на это бюджетировать?
Мы решили эту проблему, добавив в AI Gateway возможность добавлять идентификационные данные к каждому запросу. Когда сотрудник проходит аутентификацию через Cloudflare Access, мы извлекаем его идентификатор из JSON Web Token (JWT) и прикрепляем его как метаданные к запросу AI Gateway. Это позволяет видеть потребление токенов на пользователя, разбивку использования по командам и распределение затрат по всей организации в одном месте.
Бюджеты и политики на основе идентификации (закрытая бета)
В дополнение к лимитам расходов сегодня мы также объявляем о закрытом бета-тестировании бюджетов и политик на основе идентификации.
Лимиты расходов в AI Gateway позволяют устанавливать бюджеты по модели, провайдеру или пользовательским атрибутам. Но ваше приложение должно передавать эти метаданные, и AI Gateway доверяет тому, что получает. Для проверенной автоматической атрибуции необходима идентификация.
В сочетании с Cloudflare Access AI Gateway может видеть, кто делает каждый запрос — не только какой аккаунт, но и какой сотрудник, какая группа поставщика идентификационных данных (IdP), какой сервис и т.д.
Вот как это выглядит на практике.
Вы можете установить бюджеты на пользователя, например, 500 долларов в месяц для рядовых сотрудников и 2000 долларов для старших инженеров. Когда пользователь достигает своего лимита, запросы могут быть понижены до более дешевой модели или заблокированы.
Вы можете устанавливать политики использования моделей для команд. Например, ваша команда машинного обучения получает Claude Opus и GPT-4o. Команда бренд-дизайна может получать доступ к генеративным моделям изображений и видео. Стажеры используют модели с открытым исходным кодом на Workers AI. Эти политики напрямую сопоставляются с вашими существующими группами IdP — теми же группами поставщика идентификационных данных, которыми вы уже управляете.
Для конвейеров CI/CD и автономных агентов сервисные токены Access позволяют дать каждому агенту именованную идентификацию. Вы можете видеть, что ваш бот рецензирования кода использовал 5 миллионов токенов на этой неделе, в то время как ваш генератор документации — 500 000. Если один агент выходит из-под контроля, примените бюджетную политику, не затрагивая других.
Каждая запись журнала AI Gateway будет включать аутентифицированную идентификацию: электронную почту, группу IdP, имя сервисного токена. Экспортируйте их в свою аналитическую платформу, и вы получите разбивку затрат по пользователям и командам без необходимости создавать что-то с нуля.
Под капотом вы создаете приложение Cloudflare Access для своей конечной точки AI Gateway и настраиваете политики на основе групп IdP. Когда разработчик или агент делает запрос, он проходит аутентификацию через OAuth, используя стандартный поток кода устройства CLI. AI Gateway проверяет токен и извлекает идентификацию. Вам не нужно писать собственный Worker, самостоятельно разбирать JWT или полагаться на заголовки метаданных, действующие на доверии.
Недавно мы писали о том, как мы создали наш внутренний стек инженерии ИИ. Именно это мы делаем доступным сегодня — чтобы вы тоже могли это использовать и вам не пришлось создавать это самостоятельно.
Если вы хотите получить доступ к закрытой бета-версии, зарегистрируйтесь здесь.
Что дальше: от контроля затрат к оптимизации затрат
Установить бюджет необходимо. Но когда у вас есть бюджет, как извлечь из него максимум пользы?
Реальность такова, что не каждый запрос требует передовой модели: задача обобщения может выполняться на меньшей, более дешевой модели без существенной потери качества, в то время как масштабный рефакторинг кода может потребовать самых передовых технологий. Но без контроля люди почти всегда будут выбирать самую продвинутую модель.
Решение этой проблемы скоро появится: мы создаем интеллектуальную маршрутизацию на основе задач в AI Gateway. Для каждого запроса мы можем анализировать и автоматически направлять его к модели, которая даст наилучший результат с наименьшими затратами. Эта функция активно разрабатывается, поэтому следите за нашей документацией для разработчиков и списком изменений.
Начать
Начать работу с AI Gateway можно бесплатно. Лимиты расходов теперь доступны для всех пользователей.
Если вы еще этого не сделали, создайте шлюз и направьте на него свои приложения. Затем установите лимиты расходов в панели управления или через API. Начните с высокого лимита в режиме мониторинга, чтобы понять текущие модели использования, прежде чем вводить ограничения.
Если вам нужна привязка к пользователям и политики на основе команд, зарегистрируйтесь для участия в закрытой бета-версии бюджетов на основе учетных записей, и мы настроим интеграцию с Access.