Vlas Zubenko
АвторVlas ZubenkoВеб-разработчик, руковожу командой · 9+ лет · 260+ проектов
Подробнее об авторе

Почему счёт удивляет всех

Во время разработки вы делаете пару сотен запросов, и стоимость незаметна. Потом фича выходит, ею ежедневно пользуется тысяча человек, каждая сессия отправляет модели всю историю переписки — и счёт становится реальной строкой в бюджете. Технически всё в порядке. Ошибка была в том, что юнит-экономику никто не посчитал заранее.

Единственная формула, которая нужна

Стоимость на пользователя в месяц = число запросов × токены на запрос × цена токена. Всё остальное — детали. Недооценивают обычно средний множитель: токены на запрос тихо растут по мере того, как вы добавляете системные инструкции, найденные документы и историю диалога.

  • Входные токены: ваши инструкции, сообщение пользователя и всё, что вы к нему приложили
  • Выходные токены: обычно дороже, и напрямую зависят от того, насколько длинные ответы вы разрешаете
  • Ретраи и упавшие вызовы — они тоже стоят денег
  • Фоновые задачи: суммаризация, индексация, модерация, прогоны оценок
Если вы не можете назвать стоимость типичной сессии одного пользователя — у вас не модель монетизации, а надежда.

Рычаги, которые реально снижают счёт

  • Отдавайте лёгкие 80% запросов модели поменьше, а сильную включайте только там, где это важно
  • Кэшируйте стабильную часть промпта вместо того, чтобы слать её каждый раз
  • Кэшируйте целые ответы на повторяющиеся вопросы — в поддержке они повторяются чаще, чем кажется
  • Обрезайте историю диалога вместо отправки всего с самого начала
  • Доставайте меньше, но точнее подобранных фрагментов вместо «набить контекст»
  • Ограничивайте длину ответа — большинство полезных ответов короче, чем модель выдаёт по умолчанию

На практике основная экономия живёт в маршрутизации и кэшировании. Сократить счёт больше чем вдвое без заметной для пользователя потери качества — обычное дело.

Бизнес-вопрос за техническим

Стоимость запроса имеет смысл только относительно его ценности. ИИ-функция, экономящая оператору поддержки десять минут, стоит дорого — и оправданно. ИИ-функция, переписывающая заголовок пользователю бесплатного тарифа, не стоит почти ничего, и пользоваться ею будут постоянно. Прежде чем оптимизировать технологию, решите, какие запросы вообще заслуживают быть дорогими.

Предохранители, которые нужны любому продукту

  • Лимиты на пользователя и на аккаунт с первого дня
  • Жёсткий месячный потолок расходов и алерт задолго до него
  • Логирование стоимости каждого запроса, чтобы видеть, какая фича дорогая
  • Дешёвый запасной сценарий при достижении лимита вместо падения сервиса
  • Защита от злоупотреблений — боты быстро находят бесплатный ИИ-эндпоинт

Вывод

Цены на модели падают, и это реальный попутный ветер. Но потребление растёт быстрее, чем дешевеют модели, и фича со сломанной юнит-экономикой не станет прибыльной, если просто подождать. Считайте ИИ переменной себестоимостью: моделируйте до запуска и измеряйте после. Это и есть разница между ИИ-функцией, которая масштабируется, и той, что тихо съедает маржу.

Vlas Zubenko
АвторVlas ZubenkoВеб-разработчик, руковожу командой · 9+ лет · 260+ проектов
Подробнее об авторе

Есть похожая задача?

Расскажите, что должен делать сайт, — честный диапазон получите в тот же день.

Обсудить проект