AI Stack: карта для принятия решений
AI-продукт — это не модель. GPT, Claude или Qwen — только мозг системы. Чтобы ИИ выполнял реальную работу, вокруг модели нужны данные, память, инструменты, инфраструктура, контроль и экономика.
В AI 2.0 мы разбирались, как устроены модели. В AI 3.0 мы строим систему вокруг модели. Этот пост — карта всей новой серии.
С чего начать AI-продукт
Первый архитектурный вопрос: где будет работать модель? Есть три основных варианта.
API
OpenAI, Anthropic, Google и другие провайдеры.
📌 Когда использовать: нужно быстро проверить гипотезу, объём запросов небольшой, нет команды для управления GPU, важнее скорость запуска.
✅ Плюсы: запуск за дни, не нужны свои GPU, оплата за фактическое использование.
⚠️ Минусы: зависимость от провайдера, ограничения по данным, рост стоимости с нагрузкой.
Собственный инференс
Свои GPU в облаке или on-premise.
📌 Когда использовать: большой и стабильный поток запросов, чувствительные данные, критична предсказуемая latency, нужна независимость от API.
✅ Плюсы: полный контроль над инфраструктурой и данными, оптимизация стоимости при высокой загрузке.
⚠️ Минусы: капитальные затраты, нужны инженеры, эксплуатация и мониторинг.
Здесь нет универсального порога вроде «после X миллионов токенов нужно покупать GPU». Точка перехода считается для конкретной нагрузки: цена API против полной стоимости собственного инференса.
Edge AI
Модель работает непосредственно на устройстве пользователя.
📌 Когда использовать: критична минимальная задержка, устройство должно работать офлайн, данные не должны покидать устройство.
✅ Плюсы: низкая latency, приватность, работа без сети.
⚠️ Минусы: ограниченные вычислительные ресурсы, необходимость оптимизации модели под конкретное железо.
Практическое правило
Для большинства новых продуктов начинайте с API. Сначала докажите, что задача решается. Затем считайте cost per task, latency и объём нагрузки. Если экономика оправдывает собственную инфраструктуру — переходите к своему инференсу. Edge выбирайте не потому, что он «дешевле», а когда latency или offline-режим являются частью продукта.
Карта AI 3.0
После выбора способа запуска начинается настоящая инженерия. В следующих постах серии мы разберём:
📦 Блок 2. Data — память системы (Embeddings, RAG, chunking).
🔧 Блок 3. Адаптация модели (Prompt engineering, fine-tuning, LoRA).
🤖 Блок 4. AI Agents — как научить модель действовать (tool use, function calling).
🔄 Блок 5. Agentic Systems — координация нескольких агентов и human-in-the-loop.
Сохраняйте как навигатор. Следующий пост — про Data.
---
Источники:
- [The Batch — Andrew Ng](https://www.deeplearning.ai/the-batch/)
- [Artificial Analysis](https://artificialanalysis.ai/)
- [Hugging Face Blog](https://huggingface.co/blog)
- [REAL DIGITAL](https://t.me/digitalreal)
Похожие материалы
Адаптация модели: от промпта к fine-tuning
авг. 27, 2026
Data: как дать модели память
авг. 26, 2026
Nebius тағы да $5 млрд тартты. AI-компаниялар неге ауыр өнеркәсіп сияқты қарызға бата бастады
авг. 26, 2026