AI-агент для бизнеса: из чего складывается стоимость
Компании часто планируют бюджет на AI-агента так же, как на обычную фичу: посчитали разработку — успокоились. Но у AI-агента, в отличие от обычного модуля, есть постоянная статья расходов, которая появляется только после запуска и растёт вместе с использованием — счёт за обращения к модели. Разбираем, из чего на самом деле складывается полная стоимость.
Прежде чем разработать AI-агента на заказ, стоит понять реальную стоимость владения — не только разовую разработку.
Два вида затрат: разовые и постоянные
| Статья расходов | Тип | Что входит |
|---|---|---|
| Разработка и интеграция | Разовая | Логика агента, подключение к вашим системам (CRM, 1С, документооборот), тестирование |
| Инференс (обращения к модели) | Постоянная, растёт с использованием | Плата за каждый запрос к модели — пропорционально объёму текста и числу обращений |
| Хостинг и инфраструктура | Постоянная | Серверы, очереди, хранилище логов и истории диалогов |
| Мониторинг и доработка | Постоянная | Отслеживание качества ответов, обновление инструкций и контекста, реакция на новые сценарии |
Ошибка, которая обходится дороже всего — планировать бюджет только по первой строке. Разработка агента, который проходит демо на пяти тестовых вопросах, стоит сильно дешевле, чем система, которая стабильно работает на тысячах реальных обращений в месяц — а разница в основном именно в постоянных расходах, а не в первоначальной разработке.
Что сильнее всего разгоняет расходы на инференс
- Длинный контекст на каждый запрос. Если агент на каждое обращение передаёт модели всю историю диалога, документы и инструкции целиком — стоимость одного запроса растёт линейно с этим объёмом, даже если сам вопрос пользователя короткий.
- Избыточно мощная модель для простых задач. Не каждый запрос требует самой точной и дорогой модели — классификация обращения, короткий FAQ-ответ и сложный анализ документа стоят по-разному, и разумная архитектура маршрутизирует их на разные по стоимости модели.
- Отсутствие кеширования. Одинаковые или похожие запросы, если их не кешировать, каждый раз оплачиваются заново.
- Частота обращений выше ожидаемой. Успешный внутренний AI-инструмент имеет свойство неожиданно быстро становиться популярным среди сотрудников — рост использования это хорошо, но бюджет должен быть к этому готов заранее, а не по факту счёта.
Как снизить постоянные расходы, не теряя качество
Управлять стоимостью инференса можно осознанно, а не только смириться с ней:
- Маршрутизация по сложности запроса — простое обращение обрабатывает дешёвая быстрая модель, сложное передаётся более точной и дорогой.
- Ограничение контекста тем, что действительно нужно для ответа на конкретный запрос, а не передача всей истории и базы знаний целиком каждый раз.
- Кеширование частых и похожих запросов, чтобы не оплачивать одно и то же вычисление повторно.
- Собственная развёрнутая модель для высокочастотных простых задач — при достаточном объёме обращений это может обойтись дешевле, чем оплата по счётчику у внешнего провайдера, хотя добавляет расходы на инфраструктуру и её обслуживание.
Как выбрать подрядчика
Разработчика для такой задачи стоит выбирать по конкретным признакам, а не по общему впечатлению от презентации:
- Сразу говорит про постоянные расходы, а не только про стоимость разработки — если про инференс и хостинг не сказано ни слова, спросите сами.
- Предлагает пилот на реальном, но ограниченном потоке обращений, чтобы получить фактическую стоимость одного запроса до масштабирования, а не гадать по прогнозам.
- Умеет объяснить архитектуру маршрутизации и кеширования, а не просто «подключает к API модели» без оптимизации расходов.
- Даёт доступ к метрикам использования после запуска — вы должны видеть, сколько тратится и на что, а не получать неожиданный счёт постфактум.
Частые вопросы
Что дороже — разработка AI-агента или его эксплуатация?
На коротком горизонте дороже разработка — это разовая работа с понятным объёмом. На горизонте года и дольше суммарные расходы на инференс (обращения к модели), хостинг и поддержку у активно используемого агента почти всегда обгоняют стоимость первоначальной разработки — особенно если агент обрабатывает много обращений или работает с длинным контекстом.
От чего зависит стоимость инференса — обращений к модели?
От трёх переменных: сколько обращений в единицу времени, сколько текста передаётся модели за один запрос (контекст — история диалога, документы, инструкции) и какая модель используется — более мощные и точные модели дороже за единицу текста, чем компактные. Длинный контекст на каждый запрос — самый частый источник неожиданно высоких счетов.
Можно ли снизить расходы на инференс без потери качества?
Да, несколькими способами: кешировать повторяющиеся ответы, направлять простые запросы на более дешёвую модель и оставлять мощную только для сложных случаев (маршрутизация по сложности), ограничивать контекст только действительно нужной информацией вместо передачи всей истории целиком, использовать собственную развёрнутую модель для высокочастотных простых задач вместо оплаты по счётчику за каждый запрос.
Нужно ли платить за модель отдельно от разработки?
Да, почти всегда это отдельная статья расходов — плата провайдеру модели за каждый запрос (или инфраструктура для собственной развёрнутой модели), независимо от того, кто и когда написал код агента. Стоимость разработки не включает будущие расходы на использование модели — это разные бюджетные линии, и их стоит планировать отдельно с самого начала.
Как оценить бюджет на AI-агента, если непонятно, сколько будет обращений?
Начать с пилота на ограниченном сценарии и реальном, но небольшом потоке обращений — это даёт фактическую цифру стоимости одного обращения, которую дальше можно умножить на ожидаемый объём при масштабировании, вместо того чтобы гадать заранее по абстрактным прогнозам.
Расскажите, какую задачу должен закрывать AI-агент — на созвоне за 40 минут прикинем не только стоимость разработки, но и реалистичный бюджет на эксплуатацию.
Обсудить проект