Сегодня мы рады сообщить, что ключевые участники команды Ensemble AI присоединяются к Cloudflare, чтобы помочь ускорить нашу работу в области AI-инфраструктуры и упростить для разработчиков эффективное масштабное выполнение мощных AI-моделей.
Ensemble AI, основанная в 2023 году в Сан-Франциско, последние несколько лет занималась одной из важнейших задач в области AI: созданием более быстрых, компактных и экономичных крупных моделей без потери качества. Команда разработала новые подходы к сжатию моделей и эффективному выводу, которые призваны снизить затраты памяти, вычислений и развертывания больших языковых моделей и мультимодальных архитектур.
По мере того как AI становится неотъемлемой частью создания приложений разработчиками, экономика вывода становится важнее, чем когда-либо. Модели становятся всё больше; нагрузки становятся всё более динамичными. И клиенты всё чаще ожидают, что AI будет доступен повсюду: глобально распределённым, быстрым, надёжным и доступным по цене. Привлечение команды Ensemble AI в Cloudflare укрепляет нашу способность сделать это возможным.
Внедрение опыта Ensemble
Команда Ensemble AI сосредоточилась на сохранении структуры внутри современных AI-моделей при одновременном снижении стоимости их выполнения. Вместо того чтобы рассматривать эффективность модели только как проблему квантования или аппаратного обеспечения, Ensemble исследовала новые строительные блоки моделей, которые могут сделать нейронные сети более компактными и эффективными на архитектурном уровне.
Ключевой частью этой работы является NdLinear — замена стандартных линейных слоёв в трансформерных моделях, которая работает непосредственно с многомерными активациями, а не с уплощённой структурой. Это позволяет моделям сохранять значимые оси, такие как головы, каналы, пространственные размерности или другие структурированные представления, уменьшая при этом количество параметров и объём вычислений. Ensemble также разработала NdLinear-LoRA — эффективный метод адаптации, предназначенный для уменьшения количества обучаемых параметров, необходимых для тонкой настройки больших моделей.
Эти подходы дополняют другие методы повышения эффективности, включая квантование и векторное квантование. Вместе они указывают на будущее, в котором разработчики смогут запускать мощные AI-модели со значительно более низкими требованиями к памяти, вычислениям и стоимости.
Повышение эффективности вывода AI
Cloudflare Workers AI предоставляет разработчикам доступ к бессерверному выводу на GPU в глобальной сети Cloudflare. По мере того как разработчики создают всё больше приложений, изначально ориентированных на AI, способность эффективно обслуживать модели становится критической частью платформы.
Стоимость вывода является одним из главных препятствий для масштабирования AI-приложений. Каждое улучшение размера модели, занимаемой памяти, пропускной способности и использования GPU может сделать AI более доступным для разработчиков и более экономичным для клиентов. Это особенно важно, поскольку AI-нагрузки выходят за рамки простой генерации текста и включают агенты, мультимодальные модели, персонализацию, тонкую настройку, поиск и обучение с подкреплением.
Мы углубляем наши инвестиции в основные возможности машинного обучения, необходимые для того, чтобы сделать Workers AI быстрее, гибче и экономичнее. Это опирается на нашу существующую работу по повышению эффективности моделей, включая наш движок вывода Infire, методы сжатия тензоров, такие как Unweight, и нашу платформу для запуска сверхбольших языковых моделей. Команда сосредоточится на улучшении экономики обслуживания больших языковых моделей и других передовых AI-архитектур с упором на эффективность моделей, использование GPU и масштабируемое развёртывание.
Создание инфраструктуры для следующего поколения AI-нагрузок
AI-инфраструктура вступает в новую фазу. Разработчикам теперь нужен не просто доступ к моделям; им нужна инфраструктура, которая может выполнять модели надёжно, недорого и рядом с пользователями. Им нужна возможность экспериментировать с различными размерами моделей, подходами к тонкой настройке и схемами развёртывания, не ограниченными стоимостью или операционной сложностью.
Cloudflare находится в уникальном положении, чтобы помочь решить эту задачу. Наша глобальная сеть, платформа для разработчиков и бессерверная архитектура дают нам основу для того, чтобы приблизить AI к тому месту, где уже выполняются приложения. Команда инженеров машинного обучения Workers AI поможет нам улучшить уровень эффективности, лежащий в основе этого опыта.
Объединив глобальную инфраструктуру Cloudflare с работой Ensemble в области сжатия моделей и эффективных архитектур, мы сможем продолжить создание платформы, где разработчики смогут развёртывать AI-приложения с меньшими затратами, лучшей производительностью и меньшими операционными издержками.
Что дальше
Вместе мы продолжим создавать инфраструктуру, необходимую для того, чтобы сделать AI более эффективным, доступным и полезным для разработчиков по всему миру. Наша цель проста: помочь разработчикам выполнять мощные AI-нагрузки в глобальном масштабе, одновременно улучшая экономику вывода на платформе Cloudflare. Если вы хотите присоединиться к нашей миссии, загляните на нашу страницу вакансий.