Почему счёт удивляет всех
Во время разработки вы делаете пару сотен запросов, и стоимость незаметна. Потом фича выходит, ею ежедневно пользуется тысяча человек, каждая сессия отправляет модели всю историю переписки — и счёт становится реальной строкой в бюджете. Технически всё в порядке. Ошибка была в том, что юнит-экономику никто не посчитал заранее.
Единственная формула, которая нужна
Стоимость на пользователя в месяц = число запросов × токены на запрос × цена токена. Всё остальное — детали. Недооценивают обычно средний множитель: токены на запрос тихо растут по мере того, как вы добавляете системные инструкции, найденные документы и историю диалога.
- Входные токены: ваши инструкции, сообщение пользователя и всё, что вы к нему приложили
- Выходные токены: обычно дороже, и напрямую зависят от того, насколько длинные ответы вы разрешаете
- Ретраи и упавшие вызовы — они тоже стоят денег
- Фоновые задачи: суммаризация, индексация, модерация, прогоны оценок
Если вы не можете назвать стоимость типичной сессии одного пользователя — у вас не модель монетизации, а надежда.
Рычаги, которые реально снижают счёт
- Отдавайте лёгкие 80% запросов модели поменьше, а сильную включайте только там, где это важно
- Кэшируйте стабильную часть промпта вместо того, чтобы слать её каждый раз
- Кэшируйте целые ответы на повторяющиеся вопросы — в поддержке они повторяются чаще, чем кажется
- Обрезайте историю диалога вместо отправки всего с самого начала
- Доставайте меньше, но точнее подобранных фрагментов вместо «набить контекст»
- Ограничивайте длину ответа — большинство полезных ответов короче, чем модель выдаёт по умолчанию
На практике основная экономия живёт в маршрутизации и кэшировании. Сократить счёт больше чем вдвое без заметной для пользователя потери качества — обычное дело.
Бизнес-вопрос за техническим
Стоимость запроса имеет смысл только относительно его ценности. ИИ-функция, экономящая оператору поддержки десять минут, стоит дорого — и оправданно. ИИ-функция, переписывающая заголовок пользователю бесплатного тарифа, не стоит почти ничего, и пользоваться ею будут постоянно. Прежде чем оптимизировать технологию, решите, какие запросы вообще заслуживают быть дорогими.
Предохранители, которые нужны любому продукту
- Лимиты на пользователя и на аккаунт с первого дня
- Жёсткий месячный потолок расходов и алерт задолго до него
- Логирование стоимости каждого запроса, чтобы видеть, какая фича дорогая
- Дешёвый запасной сценарий при достижении лимита вместо падения сервиса
- Защита от злоупотреблений — боты быстро находят бесплатный ИИ-эндпоинт
Вывод
Цены на модели падают, и это реальный попутный ветер. Но потребление растёт быстрее, чем дешевеют модели, и фича со сломанной юнит-экономикой не станет прибыльной, если просто подождать. Считайте ИИ переменной себестоимостью: моделируйте до запуска и измеряйте после. Это и есть разница между ИИ-функцией, которая масштабируется, и той, что тихо съедает маржу.