, сентябрь 04, 2026

AI Stack: карта для принятия решений


AI-продукт — это не модель. Разбираем, с чего начать: API, свой инференс или edge, и как устроена карта из 8 блоков AI-системы.

  •   2 мин чтения
AI Stack: карта для принятия решений

Содержание

AI Stack: карта для принятия решений

AI-продукт — это не модель. GPT, Claude или Qwen — только мозг системы. Чтобы ИИ выполнял реальную работу, вокруг модели нужны данные, память, инструменты, инфраструктура, контроль и экономика.

В AI 2.0 мы разбирались, как устроены модели. В AI 3.0 мы строим систему вокруг модели. Этот пост — карта всей новой серии.

С чего начать AI-продукт

Первый архитектурный вопрос: где будет работать модель? Есть три основных варианта.

API

OpenAI, Anthropic, Google и другие провайдеры.

📌 Когда использовать: нужно быстро проверить гипотезу, объём запросов небольшой, нет команды для управления GPU, важнее скорость запуска.

✅ Плюсы: запуск за дни, не нужны свои GPU, оплата за фактическое использование.

⚠️ Минусы: зависимость от провайдера, ограничения по данным, рост стоимости с нагрузкой.

Собственный инференс

Свои GPU в облаке или on-premise.

📌 Когда использовать: большой и стабильный поток запросов, чувствительные данные, критична предсказуемая latency, нужна независимость от API.

✅ Плюсы: полный контроль над инфраструктурой и данными, оптимизация стоимости при высокой загрузке.

⚠️ Минусы: капитальные затраты, нужны инженеры, эксплуатация и мониторинг.

Здесь нет универсального порога вроде «после X миллионов токенов нужно покупать GPU». Точка перехода считается для конкретной нагрузки: цена API против полной стоимости собственного инференса.

Edge AI

Модель работает непосредственно на устройстве пользователя.

📌 Когда использовать: критична минимальная задержка, устройство должно работать офлайн, данные не должны покидать устройство.

✅ Плюсы: низкая latency, приватность, работа без сети.

⚠️ Минусы: ограниченные вычислительные ресурсы, необходимость оптимизации модели под конкретное железо.

Практическое правило

Для большинства новых продуктов начинайте с API. Сначала докажите, что задача решается. Затем считайте cost per task, latency и объём нагрузки. Если экономика оправдывает собственную инфраструктуру — переходите к своему инференсу. Edge выбирайте не потому, что он «дешевле», а когда latency или offline-режим являются частью продукта.

Карта AI 3.0

После выбора способа запуска начинается настоящая инженерия. В следующих постах серии мы разберём:

📦 Блок 2. Data — память системы (Embeddings, RAG, chunking).

🔧 Блок 3. Адаптация модели (Prompt engineering, fine-tuning, LoRA).

🤖 Блок 4. AI Agents — как научить модель действовать (tool use, function calling).

🔄 Блок 5. Agentic Systems — координация нескольких агентов и human-in-the-loop.

Сохраняйте как навигатор. Следующий пост — про Data.

---

Источники:

  • [The Batch — Andrew Ng](https://www.deeplearning.ai/the-batch/)
  • [Artificial Analysis](https://artificialanalysis.ai/)
  • [Hugging Face Blog](https://huggingface.co/blog)
  • [REAL DIGITAL](https://t.me/digitalreal)

Похожие материалы