Как устроена AI-инфраструктура в 2026 году: почему память дороже вычислений
Что это
AI-инфраструктура — это всё, что стоит за моделью: серверы, сети, хранилища, дата-центры, электричество. Модель обучается и работает не в вакууме — ей нужны аппаратные компоненты.
Раньше это был обычный IT. Сегодня AI-инфраструктура — отдельная индустрия со своей логикой, узкими местами и ценами.
Зачем нужно
Чтобы AI работал, нужны три ресурса: вычисления (GPU), память (HBM/DRAM) и электричество. В 2026 году спрос на все три превышает предложение.
Hyperscalers и крупные технологические компании — Amazon, Google, Microsoft, Meta, Oracle — планируют потратить на инфраструктуру в 2026 году $600–630 млрд по разным оценкам — на 36–62% больше, чем в 2025 году, в зависимости от методологии подсчёта. Около 75% этих инвестиций направлено на AI-инфраструктуру.
Причина роста расходов — inference обогнал training по объёму нагрузки. AI-сервисы обслуживают миллионы пользователей, и каждый запрос требует вычислений. Совокупный спрос на AI-вычисления вырос примерно в 10 000 раз за два года, по оценкам NVIDIA.
Как работает
Training vs Inference
Training — это когда модель учится. Нужны огромные кластеры, долгие прогоны, редкие запуски. Inference — это когда готовая модель отвечает пользователям. Это происходит постоянно, миллиарды раз в день.
В 2026 inference стал доминирующей нагрузкой для AI-дата-центров. По данным Dell'Oro, растущую долю новых развёртываний обеспечивает именно inference.
GPU и память
GPU (графические процессоры) стали стандартом для AI. Производительность GPU определяет пропускная способность памяти: количество ядер вторично. HBM (High Bandwidth Memory) — это специальная память, упакованная вокруг процессора.
NVIDIA Vera Rubin (H2 2026) будет использовать HBM4; по предварительным данным, пропускная способность может достигать 22 TB/s на GPU. Память при этом занимает всё большую долю стоимости: по оценкам аналитиков, на Vera Rubin Superchip она составляет 62% себестоимости ($24 297 из $38 902) против 53% у Grace Blackwell. Общая стоимость памяти выросла в 2,5 раза за поколение.
Это создаёт «стену памяти» (memory wall): GPU обрабатывают данные быстрее, чем память успевает их поставлять.
AI-дата-центры
Современный AI-дата-центр — фабрика, потребляющая гигаватты электроэнергии. Кластеры из 100 000+ GPU требуют собственных подстанций и систем жидкостного охлаждения. В 2025 году дата-центры США потребляли, по разным оценкам, около 80 ГВт; прогнозы на 2028 год расходятся от 96 до 150 ГВт в зависимости от сценария.
Edge AI
Не всё можно считать в центральном дата-центре. Для real-time задач — автономные системы, компьютерное зрение, медицинские устройства — нужна задержка под 5–20 мс. Cloud даёт 100–500 мс.
Edge AI разворачивает модель локально: на устройстве, шлюзе или ближайшей точке. Это снижает задержку, сохраняет данные локально и снижает затраты на трафик. Trade-off: ограниченная вычислительная мощность по сравнению с облаком.
Где используется
Облачные AI-сервисы. ChatGPT, Claude, Gemini — всё это работает на hyperscale-инфраструктуре. Задержка и стоимость API напрямую зависят от того, насколько эффективно провайдер использует GPU и память.
Автономные системы. Беспилотники, роботы, промышленные камеры используют edge AI для принятия решений в реальном времени без связи с облаком.
Медицина. Анализ изображений на месте, без отправки данных в центральный сервер — это edge AI.
Ограничения
Энергия. Дата-центры уже потребляют электричество, сопоставимое со странами. Рост ограничен физической инфраструктурой: подстанциями, сетями, водой для охлаждения. Деньги здесь вторичны.
Дефицит HBM. Производители памяти (SK Hynix, Samsung, Micron) не успевают наращивать мощности. HBM требует специальных процессов упаковки (CoWoS). Узкое место — мощности сборки (assembly), которых не хватает для растущего спроса.
Цена. NVIDIA уведомила клиентов о повышении цен более чем на 15% на компоненты HBM. Рост затронет системы Grace Blackwell — текущее поколение в производстве — и будущие поставки Vera Rubin. Причина — рост стоимости HBM.
Зависимость от поставщиков. NVIDIA доминирует на рынке AI-ускорителей. Альтернативы (AMD, Intel, custom silicon) существуют, но переключение требует переработки ПО.
Что дальше
AI-инфраструктура перестаёт быть «фоном» для моделей. Она становится конкурентным преимуществом: кто быстрее и дешевле считает inference, тот выигрывает рынок.
Следующий блок разберёт, сколько это стоит: токены, задержки, стоимость задачи — экономика AI.
Похожие материалы
Экономика AI: почему токены дешевеют, а счета растут
сент. 04, 2026
Утечки данных в Центральной Азии: что показывают цифры F6, а что — нет
сент. 04, 2026
AI и деньги · Часть 2
сент. 04, 2026