Что это
Стоимость AI обычно измеряют ценой API за миллион токенов. К 2026 году эта цена снизилась примерно на 80% относительно уровня 2025 года: базовые модели стоят от $0.20 за миллион входных токенов.
Но компании, которые внедрили AI в продакшн, видят другую картину: общие расходы на inference растут. Для бизнеса важнее стоимость выполненной задачи, чем цена токена.
Зачем нужно
AI-пилоты дешевы: несколько тестовых запросов к API. AI в продакшене стоит дороже, потому что задачи требуют тысячи токенов, множественных вызовов и сложных workflow.
Agentic AI изменил правила. Если простой чат-бот делает один вызов модели, агент может сделать 10–20 вызовов на одну задачу: планирование, поиск данных, проверка, самокоррекция. По оценкам Gartner, agentic модели потребляют в 5–30 раз больше токенов на задачу, чем стандартный чат-бот.
Как работает
От токенов к задачам
Цена за миллион токенов — удобная метрика для сравнения моделей. Но для бизнеса важнее цена за выполненную задачу (cost per task). Пример (цены иллюстративные): одна задача агента с 3 000 входных и 1 000 выходных токенов на Claude Opus ($5/$25 за миллион) стоит $0.04. Если агент делает 15 таких вызовов на задачу — это уже $0.60.
Model routing
Разные части задачи требуют разных моделей. Проверка орфографии — дешёвой. Генерация кода — дорогой. Команды, которые направляют простые подзадачи к дешёвым моделям, сокращают расходы. Пример: после внедрения routing monthly API costs снизились с $40 000 до $24 000 — без изменения продукта.
Prompt caching
Повторяющиеся части промпта (системные инструкции, контекст) можно кэшировать. OpenAI даёт скидку 50–90%, Anthropic — 90% от базовой цены. Для enterprise-приложений с типовыми инструкциями это снижает входные затраты на 70–90%.
Latency vs cost
Быстрые модели дороже. Длинный контекст тоже дороже: Anthropic взимает 2x за input и 1.5x за output при превышении 200K токенов. Выбор между скоростью, качеством и ценой — архитектурное решение, а не закупочное.
Outcome-based pricing
Некоторые компании переходят от оплаты за токены к оплате за результат. Intercom Fin взимает $0.99 за каждый resolved conversation. Это смещает риск на провайдера и выравнивает интересы.
Где используется
Customer support. Агент классифицирует обращение, ищет решение, генерирует ответ, проверяет. 10–15 вызовов на тикет. Ручной routing к дешёвым моделям на простых этапах снижает стоимость на 40%.
Content production. Генерация статьи: план, поиск, черновик, редактура, SEO-оптимизация. Каждый этап — вызов модели. Caching системных промптов экономит до 80% на повторяющихся задачах.
Financial services. Анализ документов с длинным контекстом: 200K+ токенов. Long context surcharge увеличивает стоимость в 1.5–2 раза. Разбиение на chunks или использование RAG — альтернатива.
Ограничения
Скрытые затраты. API-биллинг может составлять 10–20% реальной стоимости агента в продакшене. Остальное: инфраструктура, мониторинг, обработка ошибок, человеческий oversight.
Pilot-to-production gap. Пилот с 100 запросов показывает одну экономику. Продакшен с 50 000 задач в месяц — другую. Разница в 5–30x по токенам означает, что бюджет пилота не масштабируется линейно.
ROI не гарантирован. Задачи, где человек стоит $1–3, часто не окупаются при автоматизации. Порог положительной ROI — задачи от $5–15 за единицу человеческого труда.
Что дальше
По прогнозу Gartner, стоимость inference на триллион-параметрических моделях упадёт на 90%+ к 2030 году по сравнению с 2022. Дешёвые токены позволяют строить более сложных агентов. Сложные агенты потребляют больше токенов. Общий spend на inference будет расти.
Следующий блок: как из всей этой инфраструктуры и экономики строят продукт.
Похожие материалы
Утечки данных в Центральной Азии: что показывают цифры F6, а что — нет
сент. 04, 2026
AI и деньги · Часть 2
сент. 04, 2026
Экономика AI: почему токены дешевеют, а счета растут
сент. 03, 2026