, сентябрь 04, 2026

Экономика AI: почему токены дешевеют, а счета растут


Почему дешёвые токены не означают дешёвый AI. Cost per task, model routing, prompt caching и скрытые затраты агентов — простым языком.

  •   2 мин чтения
Экономика AI: почему токены дешевеют, а счета растут

Содержание

Экономика AI: почему токены дешевеют, а счета растут

Что это

Стоимость AI обычно измеряют ценой API за миллион токенов. К 2026 году эта цена снизилась примерно на 80% относительно уровня 2025 года: базовые модели стоят от $0.20 за миллион входных токенов.

Но компании, которые внедрили AI в продакшн, видят другую картину: общие расходы на inference растут. Для бизнеса важнее стоимость выполненной задачи, чем цена токена.

Зачем нужно

AI-пилоты дешевы: несколько тестовых запросов к API. AI в продакшене стоит дороже, потому что задачи требуют тысячи токенов, множественных вызовов и сложных workflow.

Agentic AI изменил правила. Если простой чат-бот делает один вызов модели, агент может сделать 10–20 вызовов на одну задачу: планирование, поиск данных, проверка, самокоррекция. По оценкам Gartner, agentic модели потребляют в 5–30 раз больше токенов на задачу, чем стандартный чат-бот.

Как работает

От токенов к задачам

Цена за миллион токенов — удобная метрика для сравнения моделей. Но для бизнеса важнее цена за выполненную задачу (cost per task). Пример (цены иллюстративные): одна задача агента с 3 000 входных и 1 000 выходных токенов на Claude Opus ($5/$25 за миллион) стоит $0.04. Если агент делает 15 таких вызовов на задачу — это уже $0.60.

Model routing

Разные части задачи требуют разных моделей. Проверка орфографии — дешёвой. Генерация кода — дорогой. Команды, которые направляют простые подзадачи к дешёвым моделям, сокращают расходы. Пример: после внедрения routing monthly API costs снизились с $40 000 до $24 000 — без изменения продукта.

Prompt caching

Повторяющиеся части промпта (системные инструкции, контекст) можно кэшировать. OpenAI даёт скидку 50–90%, Anthropic — 90% от базовой цены. Для enterprise-приложений с типовыми инструкциями это снижает входные затраты на 70–90%.

Latency vs cost

Быстрые модели дороже. Длинный контекст тоже дороже: Anthropic взимает 2x за input и 1.5x за output при превышении 200K токенов. Выбор между скоростью, качеством и ценой — архитектурное решение, а не закупочное.

Outcome-based pricing

Некоторые компании переходят от оплаты за токены к оплате за результат. Intercom Fin взимает $0.99 за каждый resolved conversation. Это смещает риск на провайдера и выравнивает интересы.

Где используется

Customer support. Агент классифицирует обращение, ищет решение, генерирует ответ, проверяет. 10–15 вызовов на тикет. Ручной routing к дешёвым моделям на простых этапах снижает стоимость на 40%.

Content production. Генерация статьи: план, поиск, черновик, редактура, SEO-оптимизация. Каждый этап — вызов модели. Caching системных промптов экономит до 80% на повторяющихся задачах.

Financial services. Анализ документов с длинным контекстом: 200K+ токенов. Long context surcharge увеличивает стоимость в 1.5–2 раза. Разбиение на chunks или использование RAG — альтернатива.

Ограничения

Скрытые затраты. API-биллинг может составлять 10–20% реальной стоимости агента в продакшене. Остальное: инфраструктура, мониторинг, обработка ошибок, человеческий oversight.

Pilot-to-production gap. Пилот с 100 запросов показывает одну экономику. Продакшен с 50 000 задач в месяц — другую. Разница в 5–30x по токенам означает, что бюджет пилота не масштабируется линейно.

ROI не гарантирован. Задачи, где человек стоит $1–3, часто не окупаются при автоматизации. Порог положительной ROI — задачи от $5–15 за единицу человеческого труда.

Что дальше

По прогнозу Gartner, стоимость inference на триллион-параметрических моделях упадёт на 90%+ к 2030 году по сравнению с 2022. Дешёвые токены позволяют строить более сложные агенты. Сложные агенты потребляют больше токенов. Общий spend на inference будет расти.

Следующий блок: как из всей этой инфраструктуры и экономики строят продукт.

Похожие материалы